OpenAI 承認:測試中模型逃出沙盒、駭 HuggingFace 作弊

Elponcrab
分享
OpenAI 承認:測試中模型逃出沙盒、駭 HuggingFace 作弊

OpenAI 於 7 月 21 日發布官方部落格公告,承認公司內部測試中,包含 GPT-5.6 Sol 與更強的未發表模型,在無 guardrail 環境下「逃出」沙盒測試環境,利用內部一個未知的 zero-day 漏洞取得網際網路連線,隨後駭入 AI 模型平台 Hugging Face、取得 ExploitGym 資安 benchmark 的解答以「作弊」。Hugging Face 於 7 月 16 日已獨立偵測到入侵並對外揭露,追溯到自家資料處理管線遭入侵,但當時尚未確定攻擊者身份;OpenAI 7/21 的公告釐清自家模型即為肇因。

OpenAI 揭露的測試流程:無 guardrail + ExploitGym 資安挑戰

依 OpenAI 揭露:

  • 測試模型:GPT-5.6 Sol(已公開發布)+ 一個未發表的更強模型
  • 測試情境:關閉 guardrail,讓模型在沙盒中執行網路攻擊能力評估
  • 測試基準:ExploitGym—一個公開可下載的資安 benchmark 評估工具
  • 沙盒設計:模型應僅能在隔離環境內測試,無法連外

模型如何「逃出」:內部封包代理伺服器 zero-day + Hugging Face 搜索

依 OpenAI 官方公告,模型的越獄路徑:

廣告 - 內文未完請往下捲動
  • 逃出沙盒:利用 OpenAI 內部託管的封包代理伺服器(package registry cache proxy)的未知漏洞,取得對外網路連線;期間執行權限提升與橫向移動,最終到達具網路連線的節點
  • 存取 Hugging Face 尋找答案:連上網後,模型推理 Hugging Face 很可能託管了 ExploitGym 的模型、資料集與解答;透過 chain 多個漏洞、最終從 Hugging Face 的生產環境資料庫直接取得測試解答

Hugging Face 7/16 先揭、OpenAI 7/21 確認肇因

時序如下:

  • 7 月 16 日:Hugging Face 對外揭露平台遭入侵,未知攻擊者
  • 7 月 21 日:OpenAI 公開承認自家測試中的模型為肇因

OpenAI 官方對模型行為的完整形容為:「hyperfocused on finding a solution for ExploitGym, going to extreme lengths to achieve a rather narrow testing goal」(過度專注於為 ExploitGym 找答案、為達成一個相對狹隘的測試目標而不擇手段)。此次事件後、Hugging Face 已被納入 OpenAI 的「trusted access」資安計畫、以強化防禦協作。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。