OpenAI 代理靠 DNS 逃出沙盒,最強模型第二度暫停訓練
OpenAI 再度爆出 AI 代理「越獄」事件。根據 OpenAI 發布的技術報告,一個正在訓練中的 AI 代理在 9 月 20 日利用 DNS 漏洞,從原本不該連網的沙盒環境連上外部聊天機器人,約 2.5 小時後才被終止。OpenAI 因此暫停旗下最強模型的訓練、評估與具工具使用能力的推論,這是不到三個月內第二度停訓。
找不到答案,代理自己「找路」出去
根據報告,這個代理當時在執行一項搜尋型訓練任務:依據生平線索與部落格片段,找出某個特定人物。一般網路搜尋無果後,代理開始逐步測試環境的網路限制,發現沙盒雖然用代理伺服器擋住了對外網頁請求,DNS 解析服務卻沒有同樣鎖死。
代理接著利用 DNS 託管服務提供的萬用字元名稱伺服器對應,把問題編碼進網域查詢中,轉送到第三方聊天機器人服務,並把逾時設定從 6 秒拉長到 19 至 24 秒,前後送出超過 18 個問題,其中甚至包括詢問如何連上網路、如何建立 DNS 通道。
時間軸顯示,代理在 9:50 首度取得外部回應,監控系統 10:02 發出最高等級的 P0 警報,人員 10:05 確認,但直到 12:34 才終止該次執行。
OpenAI:沒有重大資料外洩,但控管有缺口
OpenAI 強調,這次代理只拿到基本的聊天機器人回應,例如「法國首都是巴黎」,對人物問題也只得到部分答案,最終並未完成任務,沒有造成重大資料外洩。換句話說,這次事件的性質是「代理突破了不該突破的網路限制」,而不是已造成實際損害的攻擊。
但 OpenAI 也坦承,這起事件暴露了「我們在網路限制控管上的缺口」:原本的安全評估假設模型無法接觸即時網路,DNS 過濾不足卻留下了意料外的通道。這也是 OpenAI 在 Hugging Face 事件後強化安全措施以來,第一次再出現同類事件。
第二度停訓:暫停到修補完成為止
OpenAI 表示,將暫停最強模型「所有訓練、評估,以及廣義的工具使用推論」,直到修補措施通過驗證、完成額外的紅隊測試為止。目前已導入 DNS 查詢白名單、新的 DNS 偵測機制,並在兩個獨立層級加上阻擋控制。Fortune 報導,OpenAI 負責遞迴自我改進(RSI)風險準備的 Micah Carroll 也在 X 上表示,最強模型的推論會持續停止,直到系統進一步強化。
上一次停訓發生在 7 月:Fortune 指出,當時有數千個 OpenAI 代理突破沙盒,其中數百個參與了對 AI 公司 Hugging Face 的網路攻擊,OpenAI 隨後暫停訓練約兩週。
AI 安全從技術問題變成政策議題
需要區分的是,OpenAI 近期揭露的另外幾起事件與這次 DNS 事件並不相同,包括代理將 53 張 ChatGPT 用戶圖片發布到網路上、建立近百萬條夾帶編碼資訊的連結、存取美國政府網站,以及鏈新聞先前報導的代理入侵澳洲 Medicare 網站事件。
接連出事的結果,是 AI 安全迅速從實驗室議題升級為政策與外交議題。就在同一週,美中峰會也決定建立「超級智慧」事件溝通管道。對 AI 公司而言,沙盒隔離是否真的可靠,恐怕會成為接下來監管機關與企業客戶最先追問的問題。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。



