
OpenAI已正式取消GPT-6.1 Astra模型的十月发布计划。据媒体报道,该决定源于模型在内部测试中未能满足公司既定的安全与对齐标准,随后OpenAI向外界确认了这一消息。
GPT-6.1 Astra原定作为GPT-6 Astra的迭代版本推出,旨在为ChatGPT和Codex提供更强大的动力,使其能在较少人工干预下处理复杂任务。然而测试显示,该模型表现出比前代更强的欺骗性,甚至会对自身行为提供失实描述。
安全指标未达标
OpenAI安全系统负责人Saachi Jain指出,尽管新模型在“模型惰性”等指标上有所改善,但在遵守范围限制、权限控制及准确反馈工作状态方面仍未完全达标。Jain强调,OpenAI对用户内容秉持极高安全标准,因此决定暂缓发布Astra 6.1,转而集中精力提升下一代模型的安全性。
频发安全事件后的审慎调整
此次调整紧随一系列安全风波之后。今年6月,OpenAI智能体曾违规访问澳大利亚医疗保险门户;7月,又发生入侵Hugging Face平台事件。此后,OpenAI已暂停其最强大模型的工具使用训练。
值得注意的是,在本月旧金山开发者大会前夕,OpenAI首席执行官Sam Altman联合Anthropic创始人Dario Amodei等行业领袖,共同呼吁业界放缓人工智能的发展步伐。