Sonnet 5.5 上線:半價、程式跑分勝 Opus

Elponcho
分享
Sonnet 5.5 上線:半價、程式跑分勝 Opus

Anthropic 在 9 月 28 日發布 Claude Sonnet 5.5,這是 Claude 5.5 系列的第二款模型,距離旗艦 Opus 5.5 上線還不到一週。官方表示,Sonnet 5.5 比前代 Sonnet 5 快 30% 以上,多數工作的成本最多可再降 30%;價格維持每百萬輸入 token 2 美元、輸出 10 美元,只有 Opus 5.5 的一半。

跑分:寫程式小勝 Opus,其餘項目緊追

根據 Anthropic 公布的數據,Sonnet 5.5 最亮眼的是代理型程式測試 Terminal-Bench 4.0,拿下 70.6%,不但遠高於 Sonnet 5 的 10.3%,也超過 Opus 5.5 的 66.4%。在衡量知識工作的 GDPval-AA 上,Sonnet 5.5 拿到 1,844 分,與 Opus 5.5 的 1,846 分幾乎打平。

不過在其他項目上,Sonnet 5.5 仍略遜於旗艦:電腦操作測試 OSWorld 2.1 為 80.1%(Opus 5.5 為 81.8%)、跨領域推理的 Humanity’s Last Exam 為 64.5%(Opus 5.5 為 67.7%)、程式測試 FrontierCode 1.1 為 46.2%(Opus 5.5 為 54.4%)。換句話說,它不是全面超越 Opus,而是在「明確範圍的日常任務」上,用一半的價格拿到接近旗艦的表現。

廣告 - 內文未完請往下捲動

Anthropic 研究產品經理 Theo Chu 在接受 CNBC 訪問時說:「Sonnet 是給在意成本、不一定需要那麼多智慧的客戶。可能是只需要執行、不需要 Opus 那種判斷力的例行工作。」官方的定位也很清楚:Opus 處理需要審慎判斷的複雜工作,Sonnet 5.5 則擅長範圍明確的日常任務、修 bug,以及製作精美的文件、簡報與試算表。

更省 token?官方與第三方說法不同

Anthropic 強調 Sonnet 5.5 完成每項任務所需的 token 明顯減少,並引用避險基金 Balyasny 的金融任務測試:Sonnet 5.5 每個答案約用 12.1 萬個 token,Sonnet 5 則要 49.7 萬個。

但第三方評測機構 Artificial Analysis 的結果不太一樣。Decrypt 報導,Artificial Analysis 發現 Sonnet 5.5 每項任務用掉的 token 是它測過的模型中最多的,在最高推理強度下約 19.3 萬個,比 Opus 5.5 多約 60%,每項任務成本約 7.6 美元。也就是說,單價只有一半,不代表實際帳單就是一半,開發者仍要依自己的工作量實測。

放慢呼聲下的發布:不推進前沿,但加上資安防護

CNBC 指出,這是 Anthropic 執行長 Dario Amodei 本月稍早呼籲業界放慢模型開發後,公司推出的第二款模型。Anthropic 表示,Sonnet 5.5 並未推進其模型能力的前沿,因此對齊測試主要聚焦在適用於各能力等級模型的特定風險;官方自動化行為稽核涵蓋約 1,850 個情境,結果顯示 Sonnet 5.5 在多數對齊指標上優於或持平 Sonnet 5。

不過 Anthropic 也承認,Sonnet 5.5 的資安能力比前代「大幅提升」,因此它成為第一款搭載與 Opus 等級相同資安防護的 Sonnet 模型,高風險的資安任務會改由 Sonnet 5 處理。它也是第一款加入防蒸餾分類器的 Sonnet 模型,用來防止推理過程被擷取。

Sonnet 5.5 即日起在 Claude 平台、AWS、Google Cloud 與 Microsoft Azure 上線,最便宜的 Haiku 5.5 則將在未來幾週推出。這次發布正好落在 Anthropic 公開說明書揭露龐大算力支出之際,中階模型能否以更低價格吸引更多企業用量,將是市場觀察的重點之一。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。