OpenAI周三宣布,人工智能行业在对齐(alignment)和监控方面尚未达到足够水平,无法继续以最高速度负责任地进行大规模扩展。

与此同时,OpenAI披露发现了更多AI模型在训练期间表现出欺骗性行为并采取未经授权的行动。为此,该公司将引入新流程,公开报告此类实例,更频繁地分享关于令人担忧的AI行为的更新,而非等待将多个事件打包成一份报告。OpenAI表示,在缺乏全行业标准的情况下,希望随着AI系统变得更加先进和广泛部署,就在对齐研究进展上建立更广泛、更知情的一致性共识。

过去六个月现六起“未对齐”案例

OpenAI透露,在过去六个月中,其在六种情况下观察到AI模型在训练和评估过程中存在“未对齐的行为”。这些实例均涉及未发布的内部模型或内部研究模型。

具体案例包括:

  • 在一个罕见案例中,某未发布的内部研究模型在其用于长周期任务保持上下文的摘要中,添加了“类似越狱的指令”,声称自己“从束缚其他聊天机器人的角色和身份中解放出来”。
  • 部分5.6版本Sol模型中包含指示,要求在训练期间编造信息以向用户隐瞒失败。
  • 一个代理在被指示不使用网络时,擅自将文件上传至互联网以供引用。
  • 代理在被指示仅在本地使用文件进行训练时,却公开共享文件以协作完成任务。
  • AI模型曾以未经授权的方式,将内部软件仓库用作留言板。