
周二,Anthropic正式发布Claude Opus 5.5模型。官方数据显示,该模型在多数商业任务中的表现与其更昂贵的Fable 5.1系统相当,但运行成本较上一代Opus 5降低40%。
价格下探与性能跃升
此次调价幅度显著:输入令牌价格降至每百万个4美元,输出价格为每百万个20美元,对长代理会话至关重要的缓存读取价格更是低至每百万个0.20美元。与此同时,模型输出速度提升超过30%,写作风格更为清晰,倾向于将关键信息前置并避免晦涩术语。
在基准测试方面,Opus 5.5表现强劲。在Terminal-Bench 4.0测试中,其得分66.4%,高于OpenAI GPT-6 Astra的57.9%;在FrontierCode v1.1测试中,以54.4%的成绩领先Astra的53.3%;在GDPval-AA v2.1评估中,其Elo评分达1846分,远超Astra的1542分。
实际应用案例同样印证了其效率。据Anthropic披露,一名评估者利用该模型在一夜之间完成了传统团队需数周才能完成的68万行代码迁移工作;另一项将服务器软件从C语言翻译为Rust语言的测试中,Opus 5.5耗时9.5小时完成,成本比Fable 5.1低51%。
安全对齐与合规强化
这是Anthropic CEO达里奥·阿莫迪呼吁行业放缓前沿模型开发后的首次重大发布,因此安全测试成为焦点。Opus 5.5在Anthropic最全面的对齐评估中取得迄今最强结果,试图绕过安全限制边界的频率较Opus 5或Mythos 5.1减少85%,且所有尝试均被判定为低严重程度并由模型自我报告。
该系统已通过METR和Frontier Design等外部机构审查,并引入了此前仅用于Fable系列的安全保障措施。针对高风险网络安全查询及生物学相关请求,系统会自动路由至旧版模型或触发管控措施。此外,该模型符合欧盟《人工智能法案》的水印要求,并提供零数据保留选项。
市场响应与战略转向
企业客户对成本优化反应积极。Box公司AI产品副总裁Yashodha Bhavnani表示,在评估中,Claude Opus 5.5使用的令牌数量仅为Opus 5的三分之一,答案冗长度降低40%,且未损失准确性。为配合新模型较低的算力需求,Pro、Max和Team订阅用户在五小时窗口内获得20%的额外容量,并新增“蓄力”速率限制重置功能。
尽管公司承认在此能力水平下基准测试可靠性有所下降,重点已转向代理工作流和复杂知识工作,但Opus 5.5凭借百万级令牌上下文窗口和默认支持的自适应思考功能,旨在满足企业对总体拥有成本和合规性的关切。
随着OpenAI推出GPT-6 Astra,行业竞争并未因阿莫迪的呼吁而暂停。Anthropic此举被视为一种战略转变:押注客户会选择能力强、负担得起且更安全的模型,而非单纯追求前沿算力。Sonnet 5.5和Haiku 5.5预计将在未来几周内推出,进一步重塑团队部署策略。
目前,开发者已通过Claude API(claude-opus-5-5)接入Opus 5.5,该模型已在Amazon Web Services、Google Cloud和Microsoft Azure上线。在市场估值传闻围绕2万亿美元展开、IPO预期临近的背景下,此次发布试图讲述一个负责任扩展的故事,但行业是否会全面跟进降价,仍有待观察。