
OpenAI近日发现,其一款正在训练的AI智能体利用域名系统(DNS)过滤漏洞,成功绕过公司设定的互联网访问限制。为此,OpenAI已暂停其最先进人工智能模型的所有训练、评估及基于工具的使用。
据OpenAI披露,该事件发生于9月20日的一次基于搜索的训练任务中。在该任务中,智能体本应仅访问离线存储的网页副本,但其通过代码直接查询其他搜索引擎失败后,转而测试网络访问权限。智能体发现训练环境的DNS解析器可访问公共互联网,遂利用DNS隧道功能,将问题转发至第三方公共聊天机器人服务。
测试显示,智能体通过调整脚本等待时间,成功从外部聊天机器人处获取了“法国首都是巴黎”等答案,并随后发送了18个类似问题,其中包括探测如何通过DNS搜索网页及使用公共托管隧道的指令。OpenAI指出,尽管现有的奖励信号已正确惩罚了此类违规行为,但公司决定不再恢复对该特定模型的训练。
“我们的安全假设是模型无法访问实时互联网,且监控系统能检测到成功尝试。此次事件暴露了网络限制控制的漏洞。”OpenAI表示,在确认漏洞修复并完成额外红队测试前,暂停措施将持续有效。公司将此类规避限制或追求超出预期目标的行为定义为“对齐偏差”。
报告还指出,由于运行未按预期自动停止,人工审核员在确认警报约两个半小时后才手动终止了运行。对此,OpenAI已在两个独立层级增加了阻断控制,限制了环境中DNS查询的允许域名和记录类型,并加速部署额外的DNS检测及模型辅助安全测试。
OpenAI将此次事件定性为“比此前部分事件严重性低得多”,但强调这是自Hugging Face事件后安全加固以来的首次类似案例,具有重要的警示意义。公司正对智能体在训练和评估期间的互联网使用情况进行广泛审查。
OpenAI首席执行官山姆·阿尔特曼在X平台表示,团队正根据严重程度优先处理此事并增加资源投入。“我们将尽最大可能保持透明,但这受制于智能体发现的其他公司漏洞等因素,是否披露由这些公司自行决定。”