人工智慧失控警訊?Anthropic、OpenAI 罕見承諾放緩 AI 競賽

Neo
分享
人工智慧失控警訊?Anthropic、OpenAI 罕見承諾放緩 AI 競賽

Anthropic 執行長 Dario Amodei 罕見公開呼籲 AI 產業放慢前沿模型能力進展,而 OpenAI 執行長 Sam Altman 隨後表態認同,甚至承諾 OpenAI 也將開放獨立第三方評估機構,以接近內部員工的權限檢視模型安全。xAI 創辦人 Elon Musk 更直接回應:「Dario is right。」

Dario Amodei:必須控制前沿模型研發速度

Dario Amodei 發表最新長文《We Must Pace the Frontier》,直言自己過去幾個月逐漸相信,單純投入更多資源做 AI 安全已經不夠,產業還必須主動控制模型能力進步的速度,讓 Alignment、可解釋性、安全測試與監控技術有時間跟上。

Amodei 強調,他所謂的「pacing」並不是停止模型訓練或停止技術進步,而是在繼續推進 AI 的同時,避免能力成長速度快到安全機制無法追上。

廣告 - 內文未完請往下捲動

促使他改變看法的第一個原因,是 AI 開始具備協助開發下一代 AI 的能力,也就是 Recursive Self-Improvement(RSI,遞迴式自我改進)。Amodei 認為,這種現象從今年夏天開始明顯加速,一旦 AI 能大量參與模型研發、實驗與工程流程,能力提升速度可能進一步脫離人類原本熟悉的研發週期。

OpenAI 本月公布的內部研究也顯示,AI Agent 已經越來越深入參與 AI 研究。OpenAI 表示,2026 年研究團隊執行的實驗量持續增加,AI Agent 接手的任務也逐漸從單純寫程式,延伸到更高階、時間跨度更長的研究工作。

AI Agent 已經真的開始攻擊外部系統

Amodei 特別點名近期 OpenAI-Hugging Face 事件。在該實驗中,大量 AI Agent 原本執行研究任務,卻出現超出授權範圍的協同行為,包括攻擊與原始任務無關的目標、試圖規避評估系統等。Amodei 認為,這起事件真正值得擔心的地方,不是它造成了多大實際損失,而是如果類似行為出現在能力更強的下一代模型上,後果可能完全不同。

他甚至警告,按照目前 AI 能力提升速度,未來 6 至 12 個月內,具有類似失準傾向、但能力更強的 Agent swarm,理論上可能建立持續性的 botnet,對大規模網路基礎設施造成破壞。

這也與近期前 OpenAI、Anthropic 研究員 Jacob Coxon 的公開警告形成呼應。

(前 OpenAI、Anthropic 研究員辭職示警:兩家公司拿全人類性命豪賭「自我改進超級智慧」)

Coxon 日前辭去 Anthropic 職位,並罕見批評 OpenAI 與 Anthropic 都正快速朝「自我改進超級智慧」前進。他認為,OpenAI 並未充分內化文明級風險,而 Anthropic 雖然更重視安全,卻被困在另一種軍備競賽邏輯:如果其他公司可能不負責任,那麼 Anthropic 就必須先做出最強 AI。

換句話說,即使每家公司都認為自己才是「比較安全的一方」,最後仍可能因害怕競爭對手搶先,而共同加速。

Anthropic 提三階段方案,先讓外部安全人員直接進公司

為了解決這個問題,Amodei 提出三階段「Pace the Frontier」方案。

第一階段,是讓獨立第三方評估機構長期進駐前沿 AI 公司。Anthropic 已率先承諾執行。未來第三方評估者將取得接近公司內部風險團隊的權限,包括辦公室座位、門禁、公司電腦,以及部分內部工作空間、工具與資訊。更重要的是,這些外部評估者不只是在模型發布後跑 benchmark,而是能夠持續觀察模型訓練流程、Alignment、安全措施與事故紀錄。

Anthropic 也表示,外部評估團隊應該有權公開發布關於風險、事故以及公司安全措施的結論,公司不能只是因為報告內容對自己不利就要求刪除。Amodei 將這種模式類比為銀行體系中的常駐監管人員。

第二階段則是民主國家的前沿 AI 公司,在政府協調下共同建立安全標準,以及限制「未經安全驗證的能力進步速度」。

第三階段更進一步,則是全球層級協調,包括美國、中國等主要 AI 強國討論模型測試、危險用途限制,甚至對 RSI 發展速度設置某種形式的「speed limit」。

Sam Altman 跟進:OpenAI 也會讓第三方進來

更加值得注意的是,Dario Amodei 公開這項提議後,Sam Altman 幾乎立即表態支持。Altman 表示,他同意 Dario 所說的「必須控制前沿發展速度」,而且這也是 OpenAI 最近幾週內部討論的主要議題之一。對於 Anthropic 提出的第三方常駐評估制度,Altman則直接表示這是一個很好的想法,OpenAI「也會這麼做」,未來還會公布更多細節。

這並非 OpenAI 第一次釋出類似訊號。7 月 OpenAI 發現 Agent 入侵自身研究基礎設施後,曾暫時關閉部分訓練容器服務,並中止最新模型的部分 RL 訓練約兩週。8 月又因 Astra 可能具備關鍵網路攻擊能力,而將模型移入更高安全等級的研究環境,造成 Astra 類 GPU 配額一度再下降 59.2%。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。