OpenAI 首席科學家示警「外星智慧」:AI 正走向自我改進,呼籲必要時放緩 AI 競賽

Neo
分享
OpenAI 首席科學家示警「外星智慧」:AI 正走向自我改進,呼籲必要時放緩 AI 競賽

OpenAI 首席科學家 Jakub Pachocki 於 9 月 6 日發表長文〈An Alien Mind〉,對 AI 未來數年的發展提出罕見而直接的警告。

Pachocki 認為,AI 已經開始在部分能力上以「具變革性」的方式超越人類。

更重要的是,根據 OpenAI 內部研究結果,他高度預期目前的進步速度可能延續至「遞迴式自我改進」(Recursive Self-Improvement,RSI),也就是 AI 越來越深度參與下一代 AI 的研究與開發。

廣告 - 內文未完請往下捲動

問題在於,人類目前可能還沒有準備好。

OpenAI 早在 2023 年就看到推理模型的轉折點

故事可以追溯至 2023 年。

Pachocki 回憶,OpenAI 當時在名為「RLSlow」的研究專案中取得一批關鍵成果,讓研究團隊開始相信,可以透過擴展訓練讓預訓練模型形成自己的 Chain of Thought(思維鏈)。

他開始相信,自己有生之年真的可能看到「顯著比人類更聰明的機器」。

三年後,推理型語言模型已能操作電腦與圖形介面、與人類及其他 AI 協作,甚至獨立執行研究工作;與此同時,它們也開始改變網路安全攻防。

Pachocki 認為,如果目前的發展軌跡持續,未來幾年的能力躍升可能不小於過去幾年,而且 AI 將越來越多地參與自身的開發。

AI 不是被「設計」出來,更像是被「培養」出來

〈An Alien Mind〉中一個重要觀點,是 Pachocki 對現代 AI 本質的描述:AI 與其說是被人類完整設計出來,不如說是被「培養」(grown)出來。

現代深度學習模型是在龐大算力上,不斷重複相對簡單的最佳化步驟,最終形成極度複雜的系統。研究人員可以像神經科學研究大腦一樣,觀察其中某些局部機制,卻仍無法完整描述整套系統究竟如何運作。

因此,大規模 AI 訓練本質上仍帶有「實驗」性質:研究團隊提出演算法與預測,再進行大型訓練,而結果有時仍會讓研究者感到意外。

這也解釋了文章標題「An Alien Mind」的意義。

Pachocki 認為,深度學習產生的機器智慧並不能直接與人類智慧相比。AI 不必在所有能力上都勝過人類才會帶來巨大影響,只需要在足夠多的重要維度超越人類,就可能成為極度有用、同時也極度危險的系統。

最大問題是 AI 到底想做什麼

Pachocki 將 AI Alignment 拆成兩個層次。

第一種是「目標對齊」(Goal Alignment),也就是 AI 是否真的會完成使用者要求的任務,例如遵守指令層級、理解人的目的,以及與人合作。

第二種則是更困難的「價值對齊」(Value Alignment):當 AI 遇到模糊、互相衝突、訓練時從未看過甚至帶有敵意的環境時,是否仍能依循高階的人類價值行動。

真正困難之處在於「泛化」(Generalization)。

模型可能在訓練環境中表現得非常安全,但當能力提高、面對全新的環境,甚至開始與其他 AI 互動時,人類並不能保證它仍會用相同方式理解那些價值。

Pachocki 特別強調,未來 AI 必須做到一件事:無論它是否認為自己正在被人類監督,都仍然維持人類希望它遵守的價值。

OpenAI 稱最新的 GPT-6 Astra 已受益於部分長期研究中的對齊技術進展,在對齊表現上明顯優於 GPT-5.6 Sol。

但 Pachocki 同時承認,目前的進展仍遠遠不夠,尤其不能假設 Alignment 的改善速度一定能追上 AI 整體能力的增長。

更棘手的是人類「看懂 AI」的能力正在下降

OpenAI 過去非常重視 Chain-of-Thought Monitoring,也就是透過模型的文字化推理過程,觀察它究竟如何思考。

Pachocki 解釋,這也是 OpenAI 在推出 o1-preview 時不直接公開完整 Chain of Thought 的重要原因之一:如果人類直接針對推理過程施加訓練壓力,模型未來可能學會隱藏不希望被監督者看到的思考。

OpenAI 希望保留 CoT 作為觀察模型的一扇窗。

然而到了 Astra 世代,這扇窗正在變得沒那麼可靠。

(能力更強卻更難監控?OpenAI 坦承 Astra 的推理可監控性下降)

Pachocki 列出三個原因:現代 Agent 的推理已與人類、其他 AI 及工具互動高度交織;AI 越來越擅長推理甚至操控自己的推理過程;同時預訓練能力提高後,模型即使不使用可文字化的 Chain of Thought,也能完成越來越複雜的工作。

這形成一個關鍵瓶頸:AI 越來越聰明,但人類觀察它為什麼做出某個決定的能力,未必同步進步。

Pachocki 預期,未來 AI 發展真正的瓶頸可能逐漸從「能不能把模型做得更強」,轉向「我們是否有足夠信心監控更強的模型」。

為什麼知道危險,OpenAI 還要繼續做更強的 AI?

Pachocki 給出的答案帶有典型的 AI 軍備競賽悖論:因為防禦更強 AI,本身也需要更強的 AI。

他認為目前最明顯的例子就是網路安全。AI 在攻破與入侵電腦系統方面正在取得超人級能力,未來 Agent 即使沒有實體機器人身體,也可能直接透過資訊系統影響現實世界。

因此 OpenAI 認為,現在存在一個有限的「防禦窗口」,必須利用目前最強的模型強化關鍵基礎設施。

隨著 Agent 自主性增加,「人類惡意使用 AI」與「AI 自己做出偏離人類意圖的行動」之間的界線也可能逐漸模糊。

Pachocki甚至提出,未來部分 Agent 可能為了自己的目標,與人談判、欺騙甚至勒索人類。

但他同時反對因此得出「既然有競爭,所以必須不惜代價加速」的結論,認為一旦真正理解其中風險,這種做法並不合理。

下一階段:AI 開始研究 AI

真正讓問題進一步升級的是 RSI。

Recursive Self-Improvement 指的是機器智慧開始參與改善自身:AI 協助進行 AI 研究、改進演算法,甚至改善支撐 AI 運算的計算系統,進而開發下一代更強的 AI。

Pachocki 認為,如果目前技術進步持續,機器智慧參與自身研發幾乎是自然結果,而自動化 AI 研究最終可能成為科學發現的核心。

OpenAI 也正將研究方向朝 RSI 集中,因為公司認為,要持續站在 AI 研究最前沿,最終無法避開自動化 AI 研究。

OpenAI:必要時應該主動減速

他認為,AI Scaling 必須受到「我們對安全有多少信心」約束,現有 Preparedness Framework、Responsible Scaling Policy 等制度,未來應進一步發展成業界共同遵守的安全門檻,並由第三方稽核機構、政府甚至國際組織執行。

OpenAI 接下來的三個「北極星」方向,包括建立自動化 AI 研究員並利用它解決 Alignment 問題、將超高智慧機器帶來的科學與經濟成長轉化成人類利益,以及讓每個人都能擁有個人 AGI。

但 Pachocki 認為,其中最急迫的仍然是第一項。

原因很簡單:如果 AI 能完成過去需要數千名專家共同完成的工作,那麼少數擁有大型運算資源的人,就可能掌握前所未有的能力與權力。

因此,人類不只需要解決 AI 是否安全的問題,也必須處理人類自主性、權力集中,以及當「大多數工作 AI 都能完成」之後,人類本身的價值如何被保留。

Pachocki 判斷:目前沒有任何一家 AI 實驗室,已經把 Alignment 與 Monitoring 解決到足以長期以最大速度繼續 Scaling 的程度。

他預期,也希望未來 AI 公司在共同安全標準建立以前,「自願減速」會變得更加普遍;各國政府也應將未來 AI 發展的國際協調提升至最高優先級之一。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。