简讯
- Claude Opus 5.5 于周二发布,定价为每百万输入和输出 token 分别为 4 美元和 20 美元,在默认设置下比 Opus 5 便宜 40%,而 Anthropic 表示它在大多数任务上与 Fable 5.1 相当。
- 根据 Anthropic 自己公布的数据,Opus 5.5 在编程和知识工作测试中领先于 Fable 5.1 和 Opus 5,但 GPT-6 Astra 在 AutomationBench 和 Terminal-Bench-Science 0.1 上仍然胜过它。
- 这是自首席执行官 Dario Amodei 呼吁行业放缓 AI 能力提升以来,Anthropic 发布的首个模型,它带有与 Fable 5.1 相同的网络安全和生物学防护措施。
Anthropic 发布了 Claude Opus 5.5 于周二,这是该公司所称的 Claude 5.5 系列中的首个模型。Anthropic 表示,这个新模型在大多数任务上的表现达到了其最昂贵的旗舰产品 Claude Fable 5.1 的水平。
其特别之处在于,该模型的运行成本比它所取代的 Opus 5 低 20%,并且比该公司最先进的 Fable 5.1 便宜 60%。

看来,这个模型非常强大。它无论是在版本上(5.5 对 Fable 的 5.1),还是在系列上(Opus 是公开可用的最大模型,其次是 Sonnet,Haiku 则是最小的),都是最先进的模型。
Anthropic 承认,Fable 与 Opus 之间的差距比其基准测试分数所显示的要小,但按计划公开可用,并且每 token 成本更低,使其成为大多数 Claude 用户的明显选择。
Opus 5 于 7 月发布,定价偏低,并在大多数基准测试中得分超过 Fable 5,而 Fable 5.1于 9 月初推出,扭转了这一局面,在 Anthropic 发布的每一项基准测试中都击败了 Opus 5。
Opus 5.5 再次缩小了差距,这一次是在价格上,而非原始分数上。Lovable 是一家开发平台,曾在 7 月用自己的编码测试运行过 Opus 5,它在 Anthropic 分享的一份声明中表示,较早的模型比之前的模型“更稳定,每次运行的差异要小得多”——这与 Anthropic 现在再次提出的效率主张相同。
Opus 5.5 也是自首席执行官达里奥·阿莫代伊(Dario Amodei)发表文章呼吁行业放缓脚步以来,Anthropic 发布的首个模型。阿莫代伊在文中主张,AI 能力的提升速度正超过旨在对其进行约束的安全测试。“我们必须放慢改进 AI 模型能力的速度,”阿莫代伊本月早些时候写道。
Anthropic 主要通过智能体编程来衡量这一进展的大部分——即由 AI 智能体执行的工作,这种模型能够自行采取多步骤行动,而不仅仅是回答单个提示。
在 Terminal-Bench 4.0 上,该测试考察智能体能否在命令行界面内完成复杂的专业任务,并以完成任务百分比计分,Opus 5.5 达到 66.4%,领先于 Fable 5.1 的 55.8% 和 GPT-6 Astra 的 57.9%。FrontierCode 使用相同的通过率计分方式,检验智能体的代码更改是否真的能在真实工程流水线中被合并,其结果显示 Opus 5.5 为 54.4%,而 Fable 5.1 为 50.3%。

在 GDPval-AA v2.1 上,该测试使用 Elo 对 44 种职业的真实专业工作进行评分——Elo 是国际象棋式的排名系统,用于衡量相对技能水平,而非简单的百分比——Opus 5.5 得分为 1846,而 Fable 5.1 为 1735,Opus 5 为 1708。
不过,Opus 5.5 并非在所有方面都领先。在 AutomationBench 上,这是 Zapier 构建的基准测试,用于评估智能体能否在无人帮助的情况下从头到尾完成完整的业务流程,GPT-6 Astra 的 41.4% 略高于 Opus 5.5 的 40.0%。
在 Terminal-Bench-Science 0.1 上,该测试使用相同的通过率方法考察在命令行环境中进行的智能体科学研究,Astra 的 64.6% 以更大差距击败 Opus 5.5 的 58.7%。
更大的卖点是成本。输入 token——模型读取和写入的文本块,按每百万计价——现在 Opus 5.5 为 4 美元,而 Opus 5 为 5 美元,输出 token 从 25 美元降至 20 美元。缓存读取,即复用模型已经处理过的上下文,而不是从头重新处理,这在长时间智能体编码会话中占据了大部分成本,下降了 60%,降至每百万 token 0.20 美元。

由于 Opus 5.5 在这两项能力上与 Anthropic 的 Mythos 级模型——该公司限制最严格的层级,专供经过审查的网络安全和生物学研究人员使用——相匹配,它发布时带有与 Fable 5.1 相同的安全保障措施。
大多数网络安全任务会自动重新路由到较旧的 Opus 4.8,这是许多开发者和用户此前抱怨过的问题。。
Opus 5.5 现已在 Anthropic 的各平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。Anthropic 表示,Sonnet 5.5 和 Haiku 5.5 将在未来几周内跟进,并将同样的降价延续到产品线的其余部分。






