OpenAI 揭露蒸餾攻擊套取模型推理,指向 Kimi 開發商月之暗面

Elponcrab
分享
OpenAI 揭露蒸餾攻擊套取模型推理,指向 Kimi 開發商月之暗面

OpenAI 發布報告指出,公司已識別並瓦解一場有組織的「對抗性蒸餾」行動,對方試圖從 OpenAI 模型套出受保護的推理內容。OpenAI 表示,無法確定所有參與者是否來自同一方,但將其中的核心群組歸屬於開發 Kimi 的中國 AI 新創月之暗面(Moonshot AI)的相關人士。

7 月 24、25 日兩天暴增至 1.6 萬次請求

根據 OpenAI 的說明,這波活動從 7 月 1 日開始,起初量不大,7 月 24、25 日兩天突然暴增,超過 4,000 個用戶發出 1.6 萬次符合萃取模式的請求。進一步調查後,OpenAI 在超過 1.5 萬個用戶的群組中找到相關的提示模式,並在 7 月 28 日全面阻斷。

OpenAI 所說的「對抗性蒸餾」,是指有系統、未經授權地利用一個模型的輸出或推理,去訓練、複製或改進另一個模型。受保護的推理是模型處理任務時的內部紀錄,被萃取出來可能洩露最終答案裡沒有提供的資訊,也能幫助他人複製模型能力。

廣告 - 內文未完請往下捲動

OpenAI 強調,對方沒有破解加密、入侵資料庫,也沒有直接取得儲存的用戶對話,而是操弄與模型的互動,讓原本隱藏的推理以請求者看得到的形式重現。其中一種新手法,是把某段對話中加密的推理內容複製出來,再請另一段對話中的模型解密並轉寫。

OpenAI 稱涉及國安風險,已封鎖帳號並與業界分享

OpenAI 認為,對抗性蒸餾帶來安全與國家安全風險。被萃取的推理可以用來訓練另一個模型,卻不保留原模型的安全防護;大規模蒸餾也可能讓先進能力在不投入同等安全成本的情況下快速移轉,模型在軍民兩用領域的能力越強,這個問題就越嚴重。

因應措施方面,OpenAI 封鎖或限制了詐騙帳號,強化註冊與基礎設施管控,並堵住一條漏洞:原本持有他人加密推理內容的人,可以重播並還原其內容。相關活動經由第三方服務進行時,OpenAI 也與這些業者合作找出並阻斷相關帳號。OpenAI 已透過前沿模型論壇(Frontier Model Forum)與政府資訊分享管道,向其他前沿模型開發者與公部門通報。

OpenAI 也提到,這種操弄手法並非 OpenAI 模型獨有的弱點,獨立資安研究人員先前也透過負責任揭露,回報了相關的跨模型漏洞。

Anthropic 9 月也指控中國實驗室蒸餾 Claude

根據 CNBC 報導,OpenAI 這份報告發布前幾週,Anthropic 才指控包括月之暗面、阿里巴巴在內的多家中國 AI 開發商,暗中使用 Claude 協助訓練自家模型。鏈新聞先前也報導過 Anthropic 阻斷中國實驗室非法蒸餾 Claude 的經過。

OpenAI 預期,隨著前沿模型持續進步,蒸餾嘗試會變得更加精密,防禦需要多層管控與持續調整。公司表示後續會聚焦三個方向:更強的技術防護、更好的協同行動偵測與執法,以及更深入的業界與政府威脅情資分享。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。