亚洲财经

搜索

Anthropic新Claude Opus 5.5性能匹敌Fable,价格仅为其60%

Anthropic 发布 Claude Opus 5.5:性能对标旗舰,成本大幅降低

周二,Anthropic 正式发布了 Claude Opus 5.5,这是其所谓“Claude 5.5”系列的首款模型。据 Anthropic 表示,在大多数任务中,新模型的性能水平与该公司最昂贵的旗舰产品 Claude Fable 5.1 相当。

这款模型的最大亮点在于其极高的性价比:它的运行成本比被取代的 Opus 5 低了 20%,比公司目前最先进的 Fable 5.1 更是便宜了 60%。从版本迭代(5.5 对比 Fable 的 5.1)和家族定位来看(Opus 是目前公开可用的最大规模模型,其次是 Sonnet,Haiku 为最小规模),该模型展现出了极强的能力。尽管 Anthropic 承认 Fable 与 Opus 之间的实际差距可能小于基准测试分数所显示的那样,但考虑到 Opus 5.5 在套餐中的可用性以及更低的单 token 成本,它无疑成为了大多数 Claude 用户的最优选择。

性能回顾与基准测试表现

此前,Opus 5 于七月推出,在定价上低于 Fable 5,并在多数基准测试中超越后者;而 Fable 5.1 于九月初上线,逆转了这一局面,在 Anthropic 发布的每一项基准测试中都击败了 Opus 5。此次 Opus 5.5 再次缩小了两者间的差距,不过这次是在价格层面而非原始分数上实现突破。

开发平台 Lovable 曾在七月通过其自有的编码测试运行过 Opus 5,并表示该模型相比前代更加稳定,“运行时的方差极小”。这一关于效率的宣传点正是 Anthropic 如今对 Opus 5.5 的核心主张。

此外,Opus 5.5 也是 CEO Dario Amodei 发表文章呼吁行业放慢步伐后,Anthropic 推出的首款模型。Amodei 在文章中指出,AI 能力的提升速度已经超过了旨在对其进行制约的安全测试速度。“我们必须减缓提升 AI 模型能力的节奏。”他在本月早些时候写道。

Anthropic 主要通过“代理式编程”(Agentic Coding)来衡量大部分进展——即由 AI 代理执行的多步骤工作,而非仅仅回答单一提示词。以下是 Opus 5.5 在几项关键基准测试中的表现:

  • Terminal-Bench 4.0:该测试评估代理能否在命令行界面内完成复杂的职业任务,并以完成任务的百分比进行评分。Opus 5.5 得分 66.4%,领先于 Fable 5.1 的 55.8% 和 GPT-6 Astra 的 57.9%。
  • FrontierCode:该测试检查代理的代码更改是否能在真实的工程流水线中被合并,同样采用通过率评分。Opus 5.5 得分为 54.4%,高于 Fable 5.1 的 50.3%。
  • GDPval-AA v2.1:该测试使用 Elo 等级系统(一种类似国际象棋的相对技能排名系统,而非绝对百分比)对 44 个职业的真实世界专业工作进行评级。Opus 5.5 得分为 1846,优于 Fable 5.1 的 1735 和 Opus 5 的 1708。

当然,Opus 5.5 并非在所有领域都占据领先地位。在由 Zapier 构建的 AutomationBench 基准测试中(评估代理能否在无人类帮助的情况下独立完成完整的业务流程),GPT-6 Astra 以 41.4% 的成绩略微领先于 Opus 5.5 的 40.0%。而在 Terminal-Bench-Science 0.1(测试命令行环境内的代理式科学研究)中,Astra 以 64.6% 的成绩明显优于 Opus 5.5 的 58.7%。

成本优势与安全机制

更大的卖点在于成本控制。输入 token(模型读取和写入的文本块,按百万计价)的价格现在为 Opus 5.5 的 $4,低于 Opus 5 的 $5;输出 token 的价格则从 $25 降至 $20。缓存读取(指复用模型已处理过的上下文,而不是从头重新处理,这也是长代理编程会话中成本的主要来源)下降了 60%,降至每百万 token $0.20。

由于 Opus 5.5 在这两项关键能力上与 Anthropic 的 Mythos 级模型(公司限制最严格的层级,保留给经过审核的网络安全和生物学研究人员)持平,因此它推出了与 Fable 5.1 相同的安全防护措施。大多数网络安全任务会自动重定向到较旧的 Opus 4.8 模型,这一点此前曾遭到许多开发者和用户的抱怨。

目前,Opus 5.5 已在 Anthropic 的各个平台上全面上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。Anthropic 表示,Sonnet 5.5 和 Haiku 5.5 将在未来几周内陆续推出,并将把同样的降价优惠延伸至整个产品线。