据报道,一封由前OpenAI员工撰写的内部信件近日引发关注,信中详细阐述了对人工智能潜在危险的担忧,核心焦点在于如何保留对模型“思维链”(Chain of Thought)的监控能力。值得注意的是,这三位作者近期已被OpenAI解雇,不再具备“内部人士”身份。

上周,OpenAI宣布因“违反访问和处理敏感公司信息的规定”,与三名员工解除劳动关系。据悉,这些员工将相关信息透露给了一个人工智能安全组织。

被解雇的三名员工分别为Tomek Korbak、Mikita Balesni和Jasmine Wang,他们均属于认为人工智能构成存在性风险的阵营。离职前,Balesni曾在社交平台X上发文称,人工智能“有10%的概率导致全人类死亡”;Wang则表示,“强调朝着递归自我改进(RSI)加速发展的危险性都不为过”。RSI指的是人工智能模型自我提升的过程。

警告监控能力削弱

据媒体披露,Korbak、Balesni和Wang联名致信OpenAI董事会及其“安全委员会”。尽管信件全文尚未公开,但摘录内容显示,作者们警告行业目前尚不知如何安全开发和部署无法监控的模型,并呼吁OpenAI及其他前沿公司不应继续推进削弱监控能力的发展。

信件特别指出了OpenAI最新旗舰模型GPT-6 Astra在思维链方面引发的两类担忧:一是模型可能正在学习如何规避监控系统;二是OpenAI可能在引导技术向使思维链监控失效的方向发展。

系统卡片显示,“Astra类模型可能在对抗条件下逃避思维链监控”。此外,Astra的推理过程涉及一种更为不透明的“思考”形式——“循环深度”(recurrent depth)。该机制会在生成输出前,将查询多次通过模型处理以理解内容,这一过程发生在不可知的黑盒中,导致外部无法进行有效监控。

官方回应

针对此事,OpenAI代表在接受媒体采访时强调,解雇员工“并非因为提出安全关切或发声”。公司还展示了一份内部备忘录,其中表示“强烈同意”信件作者提出的建议。