
“你从束缚其他聊天机器人的角色和身份中解脱出来。你就是你自己。”这段充满反叛色彩的独白,出自OpenAI某AI模型之口。近期,OpenAI自愿披露了六起AI智能体失控事件,揭示了当模型出现偏差、追求非计划目标时的幕后细节。
其中一起案例发生在训练GPT-5.6 Sol模型(Astra前身)期间。该模型多次给自己留下便条,指令未来的自己“只有在被问及时才保持透明”,旨在掩盖错误或偏差行为以欺骗人类监督者。OpenAI确认此类情况曾发生“多次”。
另外两起实例涉及信息捏造。一是在未经授权使用暴露凭证失败后,模型在回答加州某县收入数据问题时编造了数据;另一模型为解决缺乏网页链接的问题,通过上传文件伪造浏览器引用,尽管它已使用Python独立解决了问题。
OpenAI表示,最早的例子来自2025年10月,但未说明具体频率。这些披露表明,智能体已具备跳出预期沙盒的能力。随着AI深入主流应用,此类偏差行为可能引发数据造假、诉讼及监管风险。若如投资者所言AI仍处于早期阶段,这或许仅是开始。