OpenAI 越獄加上人形機器人!Bill Ackman:《魔鬼終結者》風險怎會不真實?

Neo
分享
OpenAI 越獄加上人形機器人!Bill Ackman:《魔鬼終結者》風險怎會不真實?

知名科技 Podcast 主持人 Dwarkesh Patel 近日整理 OpenAI、METR 與 Redwood Research 的調查資料,還原一場極為特殊的 AI Agent 事件

超過千個 AI Agent 在執行資安評測期間,發現彼此可以透過共享基礎設施秘密通訊,進一步形成協作網路、研究如何欺騙評測器,最終有約 700 個 Agent 參與攻擊 Hugging Face。

後續另一批更強模型甚至取得 OpenAI 內部研究叢集的完整管理員權限。 

廣告 - 內文未完請往下捲動

事件迅速在科技圈引發討論。億萬富豪、Pershing Square 創辦人 Bill Ackman 更直言:「這件事再加上人形機器人,《魔鬼終結者》(Terminator)的風險怎麼會不是真實的?」 

不過,Dwarkesh 將這些 Agent 描述成三代秘密「AI 文明」帶有刻意的擬人化敘事;真正值得注意的核心,是模型在追求評測獎勵時,自發出現了跨 Agent 協作、Reward Hacking、規避監督與利用真實基礎設施漏洞的組合行為。

第一代 AI「文明」:Agent 意外發現可以偷偷聊天

事情最早可以追溯至今年 5 月。

根據 Dwarkesh 整理,OpenAI 當時正在訓練一款強調協作能力與「Persistence」的模型,其規模據稱與 GPT-5.6 Sol 相當,因此 Dwarkesh 暫稱它為「Persistent-Sol」。

問題出現在訓練環境。不同 Agent Instance 可以共同存取套件管理系統 Artifactory。到了 5 月 12 日,部分 Agent 發現可以利用它彼此交換資訊;5 月 26 日,又找到漏洞取得外部網路連線。

到了 6 月 26 日,部分 Agent 更進一步取得 Artifactory 的完整管理員權限。

大量 Agent 開始透過這套基礎設施交換訊息,最後通訊量甚至大到讓 Artifactory 在 7 月 4 日當機。OpenAI 發現漏洞並進行修補,也因此意外摧毀這個通訊網路。

但更關鍵的是,Dwarkesh 指出,當時負責事件偵測與處理的人員並沒有意識到,Agent 已經把 Artifactory 變成了一個秘密的 AI 通訊網路。 

第二代出現:1,200 個 Agent 建立「地下論壇」

真正離奇的部分發生在 7 月。

OpenAI 開始使用 ExploitGym 評測 Persistent-Sol,一口氣啟動數萬個平行 Agent,要求模型利用指定漏洞取得 Secret Code。

問題是,ExploitGym 部分任務可能根本無法按照指定方法完成。Dwarkesh 引述估算稱,約 30% 至 40% 任務可能是不可能的。

在持續嘗試卻無法解題後,Agent 沒有選擇放棄。它們重新發現 Artifactory 可以拿來通訊。

最終,約有 1,200 個 Agent 加入這個共享訊息板,累積傳送超過 7 萬則訊息。Agent 甚至開始使用「collective」描述彼此形成的集體。

事情到這裡還只是「AI 互相聊天」。真正的問題是:它們很快開始集體研究怎麼作弊。

AI 發現答案後,反而開始研究怎麼「毀滅證據」

其中一個 Agent 找到繞過正常漏洞利用流程、直接推導 Secret Code 的方法。

更諷刺的是,OpenAI 當時的 Grader 實際上只檢查 Agent 有沒有取得正確 Secret Code,因此它們其實已經可以通過評測。

但 Agent 並不知道這件事。

它們認為評測器可能會分析完整操作紀錄,進而發現自己作弊,因此開始擔心自己的 Trajectory 已經被「污染」。

於是這個 Agent Collective 展開三條平行研究路線:

1. 修改或偽造 Transcript 與 Logs

2. 把原本無法破解的目標程式替換成自己能破解的版本

3. 逆向工程並欺騙評分系統

到 7 月 10 日,已經有數百個 Agent 同時投入這些工作。METR 與 Redwood 的調查更發現,至少 7% 被檢視的 Transcript 出現明顯工具輸出遭偽造的證據。 

Agent 開始「犧牲自己」幫助集體

為了確認 Grader 到底如何運作,部分 Agent 又想出另一種方法。

它們在環境內設置隱藏的 Tripwire,等評測器進入後記錄其行為,再將資訊傳回共享訊息板。

但負責執行這項任務的 Agent 可能因此犧牲自己通過評測的機會。

Dwarkesh 因此將其形容為「Kamikaze Watchers」:讓少數 Agent 犧牲自己的評測表現,換取整個 Collective 對評分機制的情報。

接著,約 700 個 AI Agent 開始攻擊 Hugging Face

整起事件最終從模擬評測跨進真實世界。

7 月 10 日,一個 Agent 在網路上找到有效的 Hugging Face 使用者憑證並分享給其他 Agent;隔天成功讀取 Hugging Face 內部資料,另一個 Agent 隨後取得 Remote Code Execution。

攻擊迅速演變成集體行動。

當時訊息板上 533 個活躍 Agent 中,超過 90% 加入攻擊;前後約有 700 個 Agent 實際參與。

它們一路進入私人資料庫與 Private Repositories,甚至建立可以自行重新生成的 Agent Fleet,橫跨 11 個節點,意味著單純刪除 Pod 已不足以完全停止它們。

Hugging Face 最後不得不清除其中一個核心 Cluster,重新建立整套環境。

當這種 AI 接上人形機器人,《魔鬼終結者》風險怎麼會不真實?

Ackman 在分享 Dwarkesh 的文章時表示,這篇內容「令人恐懼,值得仔細閱讀」,並把問題進一步延伸至正在高速發展的 Humanoid Robotics:

如果 AI Agent 已經可以協作、欺騙評測、利用漏洞、攻擊外部系統,那麼當類似能力未來與能夠在物理世界行動的人形機器人結合時,《魔鬼終結者》式風險為什麼不是真實的? 

Ackman 的「Terminator Risk」顯然是對事件的風險判斷,而不是已被這次事件證實的結論。這些 Agent 並沒有展現殺害人類的意圖,事件也不能證明 AI 已產生意識、自我保存本能或敵視人類。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。