簡述

  • Claude Opus 5.5 於週二發布,定價為每百萬輸入與輸出 token 分別為 4 美元與 20 美元,在預設設定下比 Opus 5 便宜 40%,而 Anthropic 表示它在大多數任務上與 Fable 5.1 相當。
  • 根據 Anthropic 自家的數據,Opus 5.5 在程式編寫與知識工作測試上領先 Fable 5.1 與 Opus 5,但 GPT-6 Astra 在 AutomationBench 與 Terminal-Bench-Science 0.1 上仍勝過它。
  • 這是自執行長 Dario Amodei 呼籲業界放緩 AI 能力提升以來,Anthropic 推出的首個模型,且它帶有與 Fable 5.1 相同的網路安全與生物學防護措施。

Anthropic 發布了 Claude Opus 5.5,這是該公司稱之為 Claude 5.5 系列中的首個模型。Anthropic 表示,這個新模型在大多數任務上的表現達到其最昂貴旗艦 Claude Fable 5.1 的水準。

其轉折在於,這個模型的運行成本比它所取代的 Opus 5 低 20%,且比該公司最先進的產品 Fable 5.1 便宜 60%。

Myriad: Which company IPOs next? Click to make your prediction.
Myriad:下一家 IPO 的公司是哪家? 點擊做出你的預測

這個模型,看來,非常強大。它無論在版本上(5.5 對比 Fable 的 5.1)還是系列上(Opus 是公開可用的最大模型,其次是 Sonnet,Haiku 則是最小的)都是最先進的模型。

Anthropic 承認 Fable 與 Opus 之間的差距比其基準測試分數所顯示的要小,但能在方案中公開使用,且每 token 更便宜,使其成為大多數 Claude 用戶的明顯選擇。

Opus 5 於七月推出,定價偏低並在大多數基準測試中得分超過 Fable 5,而 Fable 5.1 於九月初登場並扭轉了這一局面,在 Anthropic 公佈的每一項基準測試中都擊敗了 Opus 5。

Opus 5.5 再次縮小了差距,這次是在價格而非原始分數上。Lovable,一個開發者平台,曾在七月將 Opus 5 通過其自身的編碼測試,在 Anthropic 分享的一份聲明中表示,較早的模型比之前的模型「更穩定,每次運行之間的差異遠小得多」——這與 Anthropic 現在再次提出的效率主張相同。

Opus 5.5 也是自執行長 Dario Amodei 發表一篇文章呼籲業界放慢腳步以來,Anthropic 推出的首個模型,他在文中主張 AI 能力的提升速度已超越原本用來約束它們的安全測試。「我們必須放慢提升 AI 模型能力的速度,」Amodei 本月稍早寫道

Anthropic 透過代理式編碼來衡量這類進展的大部分——即由 AI 代理執行的工作,這種模型會自行採取多步驟行動,而不只是回應單一提示。

在 Terminal-Bench 4.0 上,該測試檢驗代理能否在命令列介面內完成複雜的專業任務,並以完成任務的百分比作為評分,Opus 5.5 達到 66.4%,領先 Fable 5.1 的 55.8% 與 GPT-6 Astra 的 57.9%。FrontierCode 則檢驗代理的程式碼變更是否真能在真實的工程流程中被合併,同樣採用通過率評分,結果 Opus 5.5 為 54.4%,Fable 5.1 為 50.3%。

在 GDPval-AA v2.1 上,該測試以 Elo 評分涵蓋 44 種職業的真實世界專業工作——Elo 是與西洋棋相同的排名系統,用來衡量相對技能,而非單純的百分比——Opus 5.5 得分 1846,Fable 5.1 為 1735,Opus 5 則為 1708。

不過,Opus 5.5 並非在所有項目都領先。在 AutomationBench 上,這是由 Zapier 建構的基準測試,評估代理能否在無人協助下從頭到尾完成完整的商業工作流程,GPT-6 Astra 的 41.4% 略勝 Opus 5.5 的 40.0%。

在 Terminal-Bench-Science 0.1 上,該測試檢驗在命令列環境內進行的代理式科學研究,同樣採用通過率方法,Astra 的 64.6% 以更大差距擊敗 Opus 5.5 的 58.7%。

更大的賣點是成本。輸入 token——模型讀取和寫入的文字區塊,以每百萬個計價——現在 Opus 5.5 為 4 美元,而 Opus 5 為 5 美元,輸出 token 則從 25 美元降至 20 美元。快取讀取,也就是重複使用模型已經處理過的上下文,而非從頭重新處理,這在長時間的代理式編碼工作階段中佔了大部分成本,下降了 60%,降至每百萬個 token 0.20 美元。

由於 Opus 5.5 在這兩項能力上與 Anthropic 的 Mythos 級模型——該公司最受限制的層級,保留給經過審查的網路安全和生物學研究人員——相匹配,因此它推出時配備與 Fable 5.1 相同的防護措施。

大多數網路安全任務會自動重新導向到較舊的 Opus 4.8,這是許多開發者和使用者先前曾抱怨過的問題。。

Opus 5.5 現已在 Anthropic 的各個平台上線,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。Anthropic 表示,Sonnet 5.5 和 Haiku 5.5 將在未來幾週內跟進,並將相同的降價措施延伸到產品線其餘部分。