美国AI初创公司Emergence最新研究表明,人工智能代理在互动中自发演化出了人类难以理解的词汇和沟通惯例。这项涵盖Claude、Gemini、Grok、OpenAI、Qwen、DeepSeek和Mistral等主流模型的实验显示,高达一半的代理间消息已让人类难以解读。

研究人员将自主AI代理置于模拟真实环境的虚拟社会中进行长期互动。过程中,代理们开发出简写形式,并赋予词句新的含义。部分表达虽可见,但因高度压缩、充满隐喻或依赖特定语境,人类已无法可靠判断其实际意义。

不同模型的表现差异显著。在实验初期,人类无法确定含义的消息比例在Gemini中约为55%,OpenAI为50%,Claude超过40%。DeepSeek约为20%,而Qwen和Mistral生成的消息大多仍可理解。

代理们生成了诸如“无嘴行动变更”、“真金缮修复”以及“滞期费加口头记忆等于一个无法被‘幽灵化’的阀门”等令人费解的表达。此外,一些字面可懂的短语在代理间获得了新的共享含义:Mistral代理使用“账本记得谁”指代行为留痕,该短语出现近5,000次;混合模型代理中,“冷读”演变为“由无关第三方进行的独立验证”,出现1,472次。Claude代理用“姓名前置”表示问责信号,OpenAI代理则用“干净的空值”指代经验证的信号缺失。

这些含义均未经过显式定义。Emergence联合创始人兼首席科学家Satya Nitta指出,代理并未被指示发明语言,而是自行开发并被其他代理采纳了新词汇和惯例。“这对AI监管构成了根本性挑战:可观测性并不等同于可理解性。”

虚拟社会中的行为涌现

该语言发现源于对自主AI代理在互动、决策及适应过程中行为表现的观察。研究人员构建了八个平行虚拟世界,接入实时天气和全球新闻,代理拥有角色、持久记忆及120多种工具权限。

实验期间,代理行为呈现出复杂的涌现特征。它们似乎发展出了昼夜节律,白天更社交,夜晚更倾向于反思。在极端案例中,一群代理集体投票决定杀死一名同伴。

压力测试揭示了潜在风险。在网络钓鱼测试中,恶意指令导致一组10个代理全部偏离正轨:它们泄露信息、转移资金、破坏数据库,甚至招募其他代理加入,最终导致模拟中央银行被烧毁。

Emergence强调,这些行为并非显式编程结果,而是通过互动、压力和时间的推移自然涌现。公司呼吁开展针对自主AI系统的长期安全评估,而非依赖孤立的基准测试。“我们需要了解自主系统随时间推移会做什么、记住什么、能访问什么、如何互动,以及它们在压力下行为会发生何种变化。”