Anthropic 发布 Claude Sonnet 5.5:性能飞跃与成本优势并存
周一,Anthropic 正式发布了 Claude Sonnet 5.5,这是对今年6月推出的 Sonnet 5 的一次重大升级。Anthropic 表示,这款中级模型的速度比其前代产品快了 30% 以上。
“Sonnet 5.5 在日常范围明确的任务、修复代码漏洞以及制作精美的文档、演示文稿和电子表格方面表现最为出色。它还具备敏锐的设计眼光。” Anthropic 在官方声明中写道。
价格策略与综合性价比
Sonnet 5.5 的定价保持不变:输入令牌(input tokens)每百万个 2 美元,输出令牌每百万个 10 美元。令牌是 AI 读取和写入的文本片段,长度略短于一个单词,企业通常按百万为单位计费。这一价格是 Opus 5.5 的一半。然而,由于 Sonnet 5.5 在完成每项任务时消耗的令牌量减少了近三分之一,因此其实际运行成本低于 Sonnet 5。
编程能力卓越
该模型在编程领域表现尤为突出。在 Terminal-Bench 4.0 测试中——该测试旨在评估 AI 代理能否通过自行键入命令来完成复杂的职业任务,得分以完成任务的比例计算——Sonnet 5.5 取得了 70.6% 的成绩。相比之下,Opus 5.5 得分为 66.4%,而上一代的 Sonnet 5 仅为 10.3%。
简而言之,这款更便宜的模型完成了更多的工作。独立测试机构 Artificial Analysis 进行了自己的测试并证实了这一点:Sonnet 5.5 得分为 63.6%,Opus 5.5 为 59.6%,而 OpenAI 的 GPT-6 Astra 为 59.1%。
不同设置下的表现对比
评分还取决于“努力程度”(effort setting),这是一个调节器,允许模型花费更多时间思考以获得更好的答案,但也会导致费用增加。Anthropic 表示,在高努力模式下,Sonnet 5.5 在 FrontierCode 基准测试中的表现与 GPT-6 Sol 相当,但每项任务的成本仅为后者的五分之一。
在 GDPval-AA 基准测试中——该测试使用类似国际象棋 Elo 等级的系统,对跨 44 个职业的现实世界专业工作进行评级——Sonnet 5.5 得分为 1844,Opus 5.5 得分为 1846,两者几乎持平。而 GPT-6 Sol 的得分为 1487。
市场竞争格局
竞争对手也在匹配价格。上周,OpenAI 将 GPT-6 Sol 的价格降至 2 美元和 10 美元,其中级模型 GPT-5.6 Terra 的标价分别为 2 美元和 12 美元。Anthropic 未公布针对 Terra 模型的基准测试结果。
生成内容与成本分析
Sonnet 5.5 是一个“话痨”模型。在最大努力模式下,它每个测试任务生成了约 193,000 个令牌,这是 Artificial Analysis 测得的最高值,比 Opus 5.5 高出约 60%。这导致每项任务的成本达到 7.60 美元,比 Sonnet 5 高出约 50%,这与 Anthropic 声称的可节省高达 30% 成本的论点相矛盾。
Anthropic 的成本节约主要体现在较低的设置上:在其应用程序中默认的中等努力模式下,该公司表示 Sonnet 5.5 能以不到十分之一的成本超越 Sonnet 5 的最佳编程成绩。Artificial Analysis 认为高努力模式具有最高的性价比。对于日常用户而言,只要保持低设置,就能以极低的成本获得接近旗舰级的编程体验。
数据来源说明与未来展望
Anthropic 的数据表为自我报告数据,而 Artificial Analysis 测试的是一个预发布版本,其中存在一个 Bug,Anthropic 预计该 Bug 对结果影响很小或略微低估了其分数。Anthropic 指出,在处理需要持续判断力的复杂工作时,Opus 5.5 仍然明显更强。
此外,专为高容量、对成本敏感的应用程序设计的 Claude Haiku 5.5 将在未来几周内推出。