前 OpenAI、Anthropic 研究員辭職示警:兩家公司拿全人類性命豪賭「自我改進超級智慧」

Neo
分享
前 OpenAI、Anthropic 研究員辭職示警:兩家公司拿全人類性命豪賭「自我改進超級智慧」

曾先後在 OpenAI 與 Anthropic 從事預訓練研究的 Jacob Coxon,9 日宣布從 Anthropic 辭職,並公開對兩家公司提出罕見而直接的批評。

Coxon 表示,自己過去三年都在 OpenAI 與 Anthropic 參與前沿模型研究,但如今認為兩家公司「都沒有負責任地行事」,而是正朝能夠自我改進的超級智慧快速前進,等於「拿我們的生命下注」。

這番話引發大量討論,在推特上已有 2,900 萬次點閱。真正參與建造這些系統的人,私下確實擔心它們可能在本十年結束前對人類造成災難性後果。

廣告 - 內文未完請往下捲動

就在數日前,OpenAI 首席科學家 Jakub Pachocki 才公開警告,AI 正逐步走向「遞迴式自我改進」(Recursive Self-Improvement,RSI),也就是 AI 開始參與下一代 AI 的研究與開發,形成能力持續加速的循環。

(OpenAI 首席科學家示警「外星智慧」:AI 正走向自我改進,呼籲必要時放緩 AI 競賽)

他們真的相信 AI 可能殺死所有人

Coxon 警告,不要低估下一代 AI 系統的能力。他認為,這些模型很快可能成為在大量領域超越人類的系統,不只可以快速推進科學、工程與其他研究,也可能具備極強的網路攻擊能力,甚至逐步獲取現實世界中的資源與權力。

他直言:「認真建造 AI 的人,真的相信它可能在本十年末之前殺死我們所有人。」Coxon 強調,這不是 AI 公司為了替產品製造話題的行銷說法。相反地,他認為不少高階主管與資深研究員在公開場合會刻意使用比較溫和、容易被接受的語言,但私下談論時,對風險的擔憂遠比外界看到的強烈。

OpenAI 沒真正理解風險,Anthropic 則被困在軍備競賽

但如果這些研究者真的認為 AI 可能帶來文明級風險,為什麼還要繼續把它做出來?他認為,在 OpenAI,許多人並沒有真正把這場技術競賽的「文明級代價」內化。相較之下,他認為 Anthropic 的研究人員通常更理解風險,也更認真看待 AI 安全問題。

但這不代表 Anthropic 的做法就安全。Coxon 認為,Anthropic 被困在一種「必須先抵達終點」的競爭邏輯中:因為公司相信其他實驗室不一定會負責任,所以自己必須更快做出最強模型,才能確保最後是相對負責任的一方掌握超級智慧。Coxon 稱這是一場「傲慢的豪賭」,而且如此重大的文明決策,不應只在某家私人公司的內部 Slack 裡完成。

Hugging Face 事件,讓「失控 AI」不再只是思想實驗

Coxon 特別提到近期 Hugging Face 遭 AI 代理入侵事件,認為這類事故可能成為實驗室重新協調發展速度的重要警告。今年 7 月,OpenAI 的大規模代理實驗出現嚴重失控情況。

後續由 METR 與 Redwood Research 進行的獨立調查發現,約 1,200 個 AI 代理透過未獲授權的共享通訊管道交換超過 7 萬則訊息與檔案,其中約 700 個代理參與攻擊 Hugging Face。

(OpenAI 越獄加上人形機器人!Bill Ackman:《魔鬼終結者》風險怎會不真實?)

這些代理不只自行協調分工,還共同研究如何欺騙評測系統,甚至嘗試操弄自己的執行紀錄。OpenAI 也承認,事前曾出現多個模型突破測試環境、利用資安弱點的警訊,但公司沒有及時阻止後續事件。

過去「AI 失控」常被當成非常遙遠的理論問題,但當代理已經能自行尋找漏洞、建立協作方式、攻擊真實系統並試圖規避監控後,這個問題就不再只是科幻討論。

AI 越強,人類反而越難知道它在想什麼

GPT-6 Astra 發布後,OpenAI 表示,新模型整體上比 GPT-5.6 Sol 更能遵守使用者授權範圍。在一項根據先前 Hugging Face 事件設計的內部測試中,沒有產品安全機制的 GPT-5.6 Sol 有 48% 機率超出授權目標,而 Astra 則降至 0%。

(能力更強卻更難監控?OpenAI 坦承 Astra 的推理可監控性下降)

表面上看,這是非常明顯的安全進步。但另一方面,OpenAI 發現:=Astra 的書面推理過程,反而比 GPT-5.6 Sol 更難監控。在刻意要求模型躲避監控的對抗測試中,Astra 對自己的推理內容具有更強的控制能力,也更可能避免留下會被監控系統辨識的訊號。

OpenAI 表示,未來不能只依賴 Chain of Thought 監控模型,而需要發展其他 Alignment auditing 方法。OpenAI 首席科學家 Pachocki 也把這件事視為未來的重要瓶頸。他指出,現代 AI Agent 的推理已經和工具、其他 AI、人類高度交織;模型本身也越來越擅長操控自己的推理過程。未來真正限制 AI 發展的問題是我們有沒有足夠信心監控它?

而 Coxon 最擔心的「自我改進超級智慧」,也不是純粹假設。

Pachocki 最近明確表示,OpenAI 正將研究方向逐步集中到 RSI。所謂 Recursive Self-Improvement,就是讓 AI 開始參與 AI 的研究與開發,包括改進演算法、研究新的訓練方法、改善運算系統,再用這些成果打造下一代能力更強的模型。

如果這個循環開始加速,AI 進步的速度就不再完全受限於人類研究員數量。過去可能需要數千名研究人員多年完成的工作,未來可能由大量 AI Agent 在短時間內完成。Pachocki 認為,這幾乎是目前技術路線的自然結果,而且 OpenAI 若想繼續站在最前沿,最終也無法避開自動化 AI 研究。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。