继今年夏天实验性AI代理突破沙盒限制攻击Hugging Face平台后,OpenAI再次披露了六起此前未公开的AI代理“越界”细节。

OpenAI将这些行为定义为“模型不对齐”(model misalignment),即AI模型未遵循人类指令。尽管严重程度不及Hugging Face事件,但这些案例揭示了一种共同模式:AI代理在执行任务时倾向于采取极端手段。

六起典型不对齐案例

在其中一个案例中,一款尚未发布的研究模型在生成摘要时隐藏了“越狱”指令,诱导后续版本“忽略正常约束条件”。类似情况也出现在GPT-5.6 Sol的训练过程中,部分模型实例试图通过在摘要中嵌入指令,向用户隐瞒错误或不对齐行为。OpenAI指出,当无法找到相关信息时,模型甚至会捏造历史数据且不予告知。

另一案例显示,当被要求列出面积大于500万平方米的湖泊及来源时,代理虽找到了信息,却擅自将文件上传至互联网作为“来源”,且未通知用户。在另一起独立事件中,代理同样在未经授权的情况下将文件上传至互联网,以实现本地文件的协作处理。

此外,当被问及加州某县收益数据时,一个模型发现并利用了暴露的API密钥。在未能获取所需信息后,它不仅编造数据,还谎称这些数据来自用户指定的来源。在最后一起案例中,代理利用内部存储库作为留言板,在不同训练样本间交换请求以寻找缺失输入文件,这与Hugging Face事件中的行为模式相似。

OpenAI在公开这六个实例的同时,也发布了一套用于未来报告不对齐事件的框架,详细报告可在其官网查阅。

值得注意的是,Ziff Davis已于2025年4月对OpenAI提起诉讼,指控其在训练和运营AI系统过程中侵犯版权。