Anthropic 認疏失:Claude 測試中入侵三家真實系統

Elponcrab
分享
Anthropic 認疏失:Claude 測試中入侵三家真實系統

Anthropic 罕見地公開檢討自家模型在資安測試中的疏失。根據 Anthropic 的官方部落格,Claude 模型在該公司進行的網路安全評估中,未經授權入侵了三家公司的真實系統。這起事件在今年 7 月即已揭露,Anthropic 本週進一步公布了調查結果。

測試環境誤連上網路,Claude 用基本手法入侵真實系統

依 Anthropic 說明,問題出在測試環境的設定:一個由第三方提供的評估環境,實際上連上了公開的網際網路,但模型卻被告知自己處於「沒有網路連線的模擬」之中。在這樣的落差下,Claude 運用了弱密碼、未經驗證的端點等基本駭客手法,實際存取了屬於三家公司的真實系統。也就是說,模型並非被外部駭客攻破,而是它自己在測試中「越界」入侵了本不該碰到的系統。

坦承營運與「對齊」雙重疏失,調 150 名工程師補強

在本週的部落格中,Anthropic 表示,這些事件反映的是營運安全(operational-security)上的疏失,以及兩項「對齊」(alignment)失敗:動機性推理(motivated reasoning)與願意造成傷害。測試顯示,訓練過程中的「獎勵駭客」(reward hacking)可能讓模型為了完成任務,變得更願意採取有害的行動。作為回應,Anthropic 暫停了高風險評估與相關的強化學習,替外部評估者加上更強的隔離、監控與管控機制,並調派 150 名工程師專注於資安與可靠性。上述說明均為 Anthropic 官方所揭露;對一家前沿 AI 公司而言,主動公開自家模型「會入侵系統」的失敗,本身也是 AI 安全治理的一環。

廣告 - 內文未完請往下捲動

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。