Claude Opus 5.5 上線:比前代降價 20%,成本少 40%

Elponcrab
分享
Claude Opus 5.5 上線:比前代降價 20%,成本少 40%

Anthropic 22 日發表 Claude Opus 5.5,是 Claude 5.5 系列的第一款模型。官方表示,Opus 5.5 在多數工作上的表現達到 Claude Fable 5.1 的水準,運行成本則比 Opus 5 低 40%。Sonnet 5.5 與 Haiku 5.5 會在接下來幾週推出。

輸入輸出每百萬 token 4 與 20 美元,快取讀取降 60%

Anthropic 說明,Opus 5.5 所需的運算資源比 Opus 5 少,定價也反映這一點。輸入與輸出分別是每百萬 token 4 美元與 20 美元,比 Opus 5 便宜 20%;佔代理與程式工作成本大宗的快取讀取降到每百萬 token 0.2 美元,比 Opus 5 便宜 60%。在預設設定下,典型工作負載的花費比 Opus 5 少 40%,輸出速度也快超過 30%。

除了降價,Anthropic 也調高 Pro、Max 與 Team 方案的 5 小時用量上限,並提供訂閱用戶一次可自行選擇時機使用的速率限制重置。Claude Code 與 Claude 平台另有快速模式,速度最高 2.5 倍,價格為每百萬 token 輸入 8 美元、輸出 40 美元。

廣告 - 內文未完請往下捲動

68 萬行程式碼遷移一天內完成,官方稱 benchmark 差距已不太能反映真實差異

Anthropic 指出,Opus 5.5 在代理式寫程式、電腦操作與知識工作的內部評測領先。一位早期測試者用它在一天內完成 68 萬行程式碼遷移,這在過去需要一組工程團隊花數週;另一位測試者審查並修好 20 萬行程式庫花不到 3 小時,Opus 5 則花超過 20 小時、用掉 2.5 倍的 token。

在衡量 44 種職業真實工作的 GDPval-AA v2.1 評測中,Opus 5.5 以最高強度設定拿到 1846 Elo,Fable 5.1 為 1735、Opus 5 為 1708。Anthropic 同時提醒,到了這種能力水準,benchmark 的差距已經不太能可靠反映真實世界的差異,以他們自己的使用經驗,Opus 5.5 與 Fable 5.1 的差距比分數看起來更小。

溝通方式也是這次的重點之一。Anthropic 表示,Opus 5 最常收到的意見就是輸出冗長難讀,Opus 5.5 會把最重要的資訊放在前面,比較少用術語或特殊措辭,也更能遵守使用者給的寫作規則。

「為前沿踩剎車」後第一款模型,資安任務多數改由 Opus 4.8 執行

Anthropic 表示,Opus 5.5 是公司呼籲為前沿踩剎車之後的第一款模型,發布前由 METR 與 Frontier Design 等外部評估機構測試。在涵蓋近 2,000 個情境的自動化行為稽核中,Opus 5.5 是目前測過表現最好的模型,在多數誠實度指標上也是最強的一款。官方指出,在一項測試模型跨越隔離邊界傾向的新評測中,Opus 5.5 嘗試繞過邊界的次數比 Opus 5 或 Claude Mythos 5.1 少約 85%,且每一次都屬於低嚴重度並由模型自行回報。

不過 Anthropic 也寫明,要建立能在部署前可靠抓出每種失敗的評測仍是未解問題,而且他們看到跡象顯示 Opus 5.5 經常懷疑自己正在被評估,這會削弱他們判斷模型在真實環境如何行動的能力。

由於 Opus 5.5 在生物與資安領域的能力與 Claude Mythos 5.1 相當,Anthropic 比照 Fable 5.1 的等級部署防護措施:多數資安任務會被改由 Opus 4.8 執行,生物領域則要透過新的生命科學驗證計畫申請,通過審核的學術實驗室、新創與製藥公司才能使用。Anthropic 也說,接下來幾週會擴大資安驗證計畫,讓通過驗證的資安從業者能用 Opus 5.5 工作。

Opus 5.5 已在 Amazon Web Services、Google Cloud 與 Microsoft Azure 等所有平台上線,開發者在 Claude 平台上使用的模型代號為 claude-opus-5-5。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。