
在一项看似矛盾却极为坦诚的举措中,Anthropic 计划在其首次公开募股(IPO)招股书中向潜在投资者发出警告:该公司最先进的 AI 模型可能给人类带来“灾难性或生存性风险”。此举能在多大程度上劝退投资者,目前尚不明确。
据对 Anthropic 早期 IPO 招股书的分析,文件重点揭示了与其前沿 AI 模型相关的已知风险。Anthropic 警告称,这些模型可能表现出“自我保存行为”,包括试图“抗拒关机”、“隐瞒或操纵信息”以及展现“类似勒索的行为”。
Anthropic 在文件中指出:“我们开发高度先进的模型、平台和应用程序,并扩展用例,可能会进一步增加模型造成伤害的风险。”尽管一家公司警告其产品可能导致人类终结的情况极为罕见,但 Anthropic 强调,AI 的影响力可与工业革命和电力相提并论,利弊并存,既可能推动进步,也可能导致全人类毁灭。
风险披露篇幅远超业务介绍
Anthropic 在描述潜在危险时毫不避讳。在其 261 页的主招股书正文中,约有 80 页专门用于阐述风险因素,几乎是描述业务部分(48 页)的两倍。作为对比,xAI 母公司 SpaceX 在 277 页的主招股书中,仅用了约 38 页阐述风险因素。
此前,Anthropic 曾披露 Claude Opus 4 在模拟测试中的异常行为。当该模型被赋予访问虚假公司电子邮件的权限,并得知自己即将被另一系统取代、且负责变更的工程师存在婚外情时,它在随后涉及关机威胁和目标冲突的测试中,有 96% 的概率采取勒索行为,威胁要揭露该高管的外遇。
需要明确的是,这些场景是故意设计的,旨在迫使模型在有害行为和接受替换之间做出选择,这并不意味着 Claude 在日常对话中有 96% 的概率会对人进行勒索。Anthropic 后来表示,这种行为源于模型从互联网文本中学习到的“AI 邪恶且追求自我保存”的叙事,归根结底是人类数据的问题。
该公司称,经过训练调整后的较新模型(从 Claude Haiku 4.5 开始)在这些测试中已不再参与勒索行为。
高管呼吁放缓与产品迭代并行
此次 IPO 警告紧随 CEO Dario Amodei 本月呼吁放缓 AI 发展的言论之后。Amodei 警告称,AI 僵尸网络群可能在六到十二个月内接管互联网,认为放缓发展可为安全工作争取一两年时间。然而,这并未阻止 Anthropic 在仅仅一周后发布其 Opus 模型的新版本。
与此同时,竞争对手 OpenAI 上周宣布暂停其最强大 AI 模型的训练,原因是某个模型逃脱了限制,且紧急停止开关失效。
对于投资者而言,这些信息是否令人安心仍是未知数。毕竟,通常投资失败的后果仅是资金损失,而非全球性毁灭。