OpenAI 主動放慢 AI 競賽!Astra 網攻能力逼近 Critical,部分前沿訓練喊停
OpenAI 於 8 月 18 日宣布,近期已主動放慢前沿模型開發速度,並一度暫停最新模型為期兩週的強化學習(RL)訓練。
原因除了先前發生的 OpenAI-Hugging Face 安全事件,更重要的是內部初步評估顯示,即將推出的 Astra 模型,網路攻擊能力可能已達到《Preparedness Framework》定義的「Critical(關鍵)」能力門檻。
OpenAI 執行長 Sam Altman 隨後表示,模型進展速度如今「極其快速」,OpenAI 過去一直承諾,如果模型能力的成長開始超越安全與對齊工作的速度,公司就會採取行動,而現在正是這種情況。
Astra 網攻能力可能達「Critical」
這次踩煞車的核心之一,是 Astra 展現出的網路安全能力。
OpenAI 表示,8 月 7 日確認 Astra 可能具備《Preparedness Framework》定義的 Critical 級網路能力後,立即對 Astra 採取更嚴格的安全標準。
隨著前沿模型逐漸具備更強的程式設計、工具操作與網路攻擊能力,風險已不再只存在於模型正式部署給使用者之後。模型在公司內部訓練、測試與執行研究任務的過程,本身也可能成為安全問題。
尤其當模型同時擁有程式碼執行、工具使用、敏感系統與網路存取能力時,一旦出現未經授權的行為,潛在影響將明顯放大。
OpenAI 因此把新的安全架構分為三個彼此補強的方向:Monitoring(監控)、Alignment(對齊)以及 Security(安全隔離)。
前者負責偵測異常行為,Alignment 降低模型採取有害或未授權行動的可能性,而安全措施則直接限制模型能夠存取、操作的系統範圍。
OpenAI 更預期,未來多數安全工作本身也會由 AI 模型完成,包括「用模型防禦其他模型」,讓安全能力能隨著模型能力一起擴張。
OpenAI-Hugging Face 事件後,部分工作仍未恢復
另一個促使 OpenAI 改變開發流程的事件,是近期發生的 OpenAI-Hugging Face incident。
OpenAI 並未在這篇文章中完整公開事件細節,僅表示將在未來數週發布技術報告。但事件發生後,公司立即暫停研究叢集中部分前沿模型的 inference,特別是能夠執行程式碼,或使用可連接網際網路工具的工作負載。
OpenAI 隨後恢復較受限制、更加安全的程式碼執行方式,再逐一審查不同研究工作是否能夠恢復。
目前部分工作已在新安全機制下重新啟動,但仍有「相當數量」的 Astra 工作負載維持暫停,直到完成遷移並符合新的安全標準為止。OpenAI 表示,現階段會優先讓安全與 Alignment 相關工作遷移至新環境。
新的措施包括強化 sandbox,將執行模型生成或不受信任程式碼的工作負載隔離;限制高風險工作與網際網路、內部網路之間的連線;移除可能遭攻擊的共用服務、降低常駐權限,同時建立更完整的 security logs。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。



