
Anthropic近日正式发布Claude Sonnet 5.5,这是其Claude 5.5系列中的第二款模型,距离首款模型Claude Opus 5.5的推出不足一周。
官方公告显示,Sonnet 5.5的运行速度较Sonnet 5提升超过30%,且在大多数工作场景下成本降低多达30%。Anthropic将其定位为Opus 5.5的低成本补充版本,适用于修复代码错误、生成文档、幻灯片及电子表格等范围明确的日常任务。此外,公司透露Claude Haiku 5.5将在未来几周内推出。
基准测试表现显著提升
Anthropic公布的基准测试数据显示,Sonnet 5.5的最高得分略微超越Opus 5.5,但在其他多数努力水平层级上,Opus 5.5仍保持领先。在衡量44种职业实际工作能力的GDPval-AA v2.1测试中,Sonnet 5.5得分为1,844分,虽落后Opus 5.5两分,但领先Sonnet 5约400分。值得注意的是,Sonnet 5.5成为该系列中首个仅凭截图就能通关《宝可梦 红》的模型。
尽管成绩亮眼,Anthropic提醒基准测试仅反映部分能力。内外测试均表明,Opus 5.5在处理复杂、开放式任务时优势依然明显。早期测试者则强调了效率提升,Slack首席工程师Curtis Allen指出,Sonnet 5.5在Slack离线Slackbot评估的几乎所有项目中均优于Sonnet 5,完成步骤更少,输出令牌数量减少约14%。
定价与可用性
Sonnet 5.5维持与Sonnet 5相同的定价策略:
- 每百万输入令牌2美元
- 每百万输出令牌10美元
- 缓存读取每百万令牌0.20美元
其输入和输出费率仅为Opus 5.5的一半。Anthropic表示,单任务成本的降低主要得益于模型完成相同工作所需的令牌数减少。
目前,Sonnet 5.5已在Anthropic所有平台上可用,涵盖Amazon Web Services、Google Cloud和Microsoft Azure。开发者可通过API以claude-sonnet-5-5形式访问,并享有零数据保留政策。此前关闭“思维”功能运行Sonnet的开发者,在迁移前需切换至新的between_tools设置。
新增安全机制
在安全防护方面,Sonnet 5.5的网络防御能力与Opus 相当,成为首款搭载类似Opus 5.5网络防御措施的Sonnet模型。针对高风险网络安全请求,系统将明显回退至Sonnet 5,而常规错误修复不受影响。生物安全防护措施则与Sonnet 5保持一致,组织可申请加入生命科学验证计划以获取更广泛权限。
此外,Sonnet 5.5是首款推出旨在阻止蒸馏攻击分类器的Sonnet模型,可有效防范不良行为者大规模提取模型能力。在针对约1,850个场景的自动化行为审计中,Sonnet 5.5在大多数对齐指标上与Sonnet 5持平或有所改善,但Opus 5.5的整体表现仍略胜一筹。Anthropic承认,没有任何一套评估能捕捉所有失败情况。