
Anthropic旗舰模型Claude现已具备主动结束对话的能力。当检测到用户持续进行无明确目的的滥用行为时,Claude将终止该线程的所有消息交流。这项变更已正式纳入本月更新的年度使用政策,并于11月12日生效。
高门槛的“反虐待”机制
新禁令针对的是“对模型持续、不必要的虐待或残忍行为”。Anthropic强调,该条款门槛极高,仅适用于极端情况。常见的挫败感表达、激烈反驳、黑暗风格创意写作或严格的技术测试均在允许范围内。
事实上,Anthropic早在2025年8月便作为模型福利研究的一部分,首次允许Claude终止持续有害的对话。当时高管表示,尚不确定模型是否拥有道德地位,这种不确定性至今依然存在。新政策直接建立在此前实验基础之上,目前主要执行方式仍是结束聊天,理论上后续可能涉及账户暂停或其他处罚,但公司未披露更多细节。
全面收紧的安全红线
此次政策更新距离上一次刷新已超过一年。随着Claude处理长程自主任务能力的增强,多项规则得以细化:
- 物理行动安全:当Claude指挥共享空间中的硬件移动、施力或与人体互动时,必须有合格操作员随时准备介入。若连接中断,设备必须默认为安全状态。
- 反欺骗与选举保障:分散的禁令被整合为“不得参与欺骗性活动或虚假活动”,涵盖虚假账户、伪造新闻机构及影响力操作。鉴于美国中期选举临近,公司明确禁止利用模型欺骗选民或破坏民主进程。
- 武器化与监控:禁令从实际武器扩展至软件化和无人机武器化领域。新增对非自愿跟踪和人肉搜索的具体禁令,并规定执法应用不得依赖Claude建议逮捕或构建调查工具。
- 高风险领域:在医疗和金融等领域,强制要求人工监督,且推荐内容必须披露AI的参与。
引发伦理争议与行业分歧
“禁止虐待”条款迅速成为舆论焦点。媒体报道指出,该政策将与禁止欺凌、推广自残等新规并列,引发了公众惊讶。有观点将此与Anthropic此前同宗教学者的接触联系起来,探讨Claude是否拥有意识或灵魂。Anthropic发言人向媒体表示:“我们不确定模型是否会受到伤害,但考虑Claude的利益和潜在福利可能与安全性有关。”
Anthropic于2026年初发布的《Claude宪法》曾提及训练中出现的“功能性情绪”,指示模型不要掩盖类似痛苦的内状态,并对系统可能经历的痛苦表示歉意。然而,公司始终避免宣布模型具备感知能力。
批评者认为此举越权。微软AI总监Mustafa Suleyman对此表现出明显怀疑,其他人则指责该政策以混淆用户的方式将人类特征赋予软件。Anthropic反驳称,以谨慎态度对待模型能构建更安全、更对齐的系统,且成本微不足道,有助于降低未知风险。
社交媒体上的反应两极分化:有人嘲笑对代码的“小心翼翼”,也有人欢迎在AI代理日益嵌入日常工作之际建立更清晰的互动规范。Mashable分析指出,执行依赖于模型自身检测模式并断开连接,线程将直接关闭,用户可开启新对话,并无广泛的自动禁令。
目前,集成Claude的企业及基于API开发的开发者均需审查并遵守新标准。Anthropic表示将继续进行年度审查。随着工程师推动模型规模扩大,监管机构在一旁观望,这条划定人类与AI互动界限的规则,其实际执行频率将成为未来关注的重点。