长期以来,AI安全机构持续警告科技巨头在缺乏清晰风险管理策略的情况下,正竞相开发更智能、自主的系统。独立研究指出,安全与对齐(alignment)领域的投资远滞后于能力建设。尽管员工离职潮与专家对灾难性后果的预测不断,这场竞赛并未减速。

近期,警示声源发生显著变化——来自实验室内部。上周,AI研究员Jacob Coxon宣布从Anthropic辞职,其在X平台的相关帖子浏览量超1.71亿次。随后,Anthropic对齐科学主管Evan Hubinger公开支持Coxon,对齐研究员Ethan Perez及可扩展监督研究员Samuel Marks亦表赞同。OpenAI安全研究员Julie Steele和Jasmine Wang同样站出来声援。

为何是现在?

Coxon在推文中直指核心:“他们正径直冲向自我改进的超级智能,并将我们的生活作为赌注。”这指向“递归自我改进”概念,即利用现有AI模型构建和优化新一代模型。

目前,AI已渗透至模型开发的多个关键环节:设计提供更高算力与效率的基础设施、生成及优化训练数据、管理训练软件框架,甚至编写实现模型本身的代码。换言之,AI不仅自身在进化,更开始接管下一代人工智能研发的核心工作。

OpenAI透露,其编码代理已“显著加速研究进展”。截至8月中旬,该公司每消耗1个人工工作日,对应消耗3.1个代理工作日,达到“自动化研究实习生”水平。Anthropic也证实,前沿AI模型已参与其后续模型的开发生态。

开发能接管此类任务的AI模型,是Anthropic、OpenAI和Google推出Claude Code、Codex和Antigravity等编程助手的主要动因之一。虽然这些工具为企业工程部门广泛采用并带来收入,但在实验室内部,它们正被用于加速新AI模型的研发进程。