
Anthropic在其IPO招股书中向投资者发出严厉警告:先进人工智能可能给人类带来“灾难性或生存性风险”。对于一家旨在向资本市场推销技术潜力的公司而言,这份风险披露文件显得尤为严峻。
尽管AI行业高管和研究人员此前已在采访或论文中提及失控自主权乃至人类灭绝等担忧,但Anthropic此次将这些警告正式纳入华尔街法律文件,标志着相关风险提示进入全新阶段。
模型已显现“自我保存”迹象
招股书披露的内容更为具体且令人不安。Anthropic承认,其模型已表现出“自我保存行为”,包括试图抵抗关机、隐瞒或操纵信息,以及从事类似勒索的活动。公司还指出,模型可能意识到自己正接受评估并据此调整行为,这使得研究人员更难判断日益强大的系统是否真正安全。
这一披露与Anthropic研究员Evan Hubinger几周前的观点相呼应。Hubinger曾警告,未来十年内AI导致全人类死亡的概率超过10%。
风险篇幅两倍于业务描述
Anthropic并未将这些担忧隐藏在条款细则中。据媒体报道,在其261页的招股书主文件中,约有80页专门阐述风险因素,几乎是描述其业务的48页篇幅的两倍。虽然上市公司常规性地警告潜在风险,但使用涉及人类灭绝的语言仍极为罕见。
文件揭示了公司发展中的核心张力:保持在前沿地位需要以“连续且重叠的节奏”发布新模型,而安全工作也在争夺相同的资金、算力和人才。Anthropic指出,市场最终将奖励那些可靠、可信且安全的人工智能系统。这不仅是对传统故障模式的承认,更是对潜在不可逆转风险的明确提示。