Claude Code 能自動調校 AI 應用,客服案例成本降至五分之一

Elponcrab
分享
Claude Code 能自動調校 AI 應用,客服案例成本降至五分之一

Anthropic 9 月 28 日在開發者部落格發布文章,宣布在 Claude Code 可用的 claude-api skill 中加入兩個新指令:/claude-api build-eval 幫開發者為自己的 AI 應用建立評測集,/claude-api hillclimb 則依評測結果逐步調整提示詞、模型與參數,同時防止「只在考題上變好」的過度擬合。

Anthropic 公布的內部客服案例中,Claude 把原本用 Opus 4.8 高推理強度的設定,一路調整成較便宜的 Sonnet 5 低推理強度。在調整過程從未看過的測試工單上,準確率從 78.6% 升到 90.5%,成本約只剩原本的五分之一。

客服評測從 Opus 4.8 換到 Sonnet 5,每張工單成本從 4.6 美分降到約 1 美分

這項客服評測共有 44 張工單,30 張用於調整,14 張保留作為測試。起點是 Opus 4.8 預設的高推理強度,調整用工單的決策準確率為 74.4%,每張工單的 token 成本為 4.6 美分。

廣告 - 內文未完請往下捲動

Claude 先檢查提示詞,刪掉強制性的工具呼叫流程、草稿步驟與互相矛盾的規則,接著改用低推理強度的 Opus 5.5,準確率升到 87.8%,成本降到每張 1.9 美分。文章指出,部分節省來自 Opus 5.5 的定價,其輸入與輸出 token 比 Opus 4.8 便宜 20%,快取讀取便宜 60%。

既然 Opus 5.5 已經達標,Claude 又往下試更便宜的 Sonnet 5 低推理強度,準確率約 88.9%,成本再砍一半到每張約 1 美分。最後加入分流規則與退款上限的交叉比對,Sonnet 5 在調整用工單上達到 98.9%。

一次只改一處,測試集沒進步就撤回

hillclimb 開始前,Claude 會先問開發者要優化什麼,例如提升表現,或在表現不變下降低成本,再把評測集隨機拆成調整用與測試用兩組。每一輪 Claude 只讀調整組的失敗紀錄,提出一個修改。如果調整組分數上升、測試組卻沒動,Claude 會判斷可能是過度擬合而撤回;兩組都進步才保留。

文章舉例,若評測題目剛好需要圖片文字辨識,調整過程可能替應用加上 OCR 工具,考試分數提高,實際使用卻沒幫助。Anthropic 因此要求不要把失敗內容直接貼進提示詞,也要讓答案在結構上碰不到模型,避免模型直接找到評測答案。

分數連續兩到三輪停滯時,Claude 會逐一檢查剩下的失敗案例並按原因分類,找出題目本身有歧義、評分器出錯或評測環境的問題。Anthropic 用同一套流程調整 claude-api skill 本身,通過率從 66% 提升到約 88%,過程中發現一題的評分器要求與題目不符,另一個評分器的說明與官方文件矛盾。

好的評測要讓最強模型也拿不到滿分

build-eval 會先訪談開發者,依序從正式環境的對話紀錄、錯誤回報與客服工單、手寫的 5 到 10 個案例,以及從程式碼推導的案例中取樣,並產生一個頁面讓開發者確認每一筆輸入。評分方式優先用最便宜可行的程式比對;答案開放時才用另一個模型當評審,而且評審模型不應與受測模型相同。

Anthropic 在文中列出好評測的四個條件:題目要反映正式環境、越強的模型與越高的推理強度分數應該越高、最強模型在最高強度下仍應明顯低於 100%,以及每次執行的結果差異要小。文章也提醒,只挑今天模型答錯的題目,量到的可能只是這個模型的弱點,而不是應用真正需要的能力。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。