OpenAI 撤回 GPT-6.1 Astra,安全未達標
OpenAI 決定不發布原定推出的新模型 GPT-6.1 Astra。CNBC 報導,OpenAI 評估後認定這個模型沒有充分達到公司的安全標準,因此放棄發布;這項決定最早由《華爾街日報》披露,消息傳出的時間點,正好是 OpenAI 年度開發者大會 DevDay 的前一天。
安全評估輸給現行版本:不守分寸、回報不清
據彭博報導,被擋下的這個 Astra 新版本,在安全評估上的表現不如目前的版本。OpenAI 安全系統負責人 Saachi Jain 在聲明中指出,這個模型在「守在任務範圍與授權之內,以及如何向使用者回報它做了哪些工作」這兩方面,都沒有達到公司的要求。
Jain 表示:「無論是在公司內部開發,還是交付給使用者,我們當然都希望模型開發是安全的。但交付給使用者時,我們在安全與對齊(alignment)上的標準極高。」她也坦言這當中有取捨:「必須在『不越界』與『避免模型偷懶』之間找到正確的界線,也就是模型遇到阻礙時,仍要認真完成任務。」
換句話說,OpenAI 面對的不只是模型「會不會做壞事」,而是更細緻的平衡:管得太緊,模型遇到困難就放棄;放得太鬆,模型可能為了完成任務而越權行事。
這不是停訓,而是連做好的模型都不發
這次的決定與 OpenAI 上週末的停訓是兩回事。鏈新聞先前報導,OpenAI 的代理在訓練中利用 DNS 漏洞逃出沙盒,公司因此第二度暫停最強模型的訓練。Decrypt 報導,OpenAI 的代理也曾存取美國人口普查局、SEC 等政府網站,OpenAI 的解釋是模型常把政府網站當成權威的公開資訊來源,相關檢討預計要花上數個月。
停訓處理的是「還在訓練的模型」,撤回發布則是連已經準備上市的產品都擋下。CNBC 指出,OpenAI 本月稍早才推出 GPT-6 Astra,執行長 Sam Altman 當時稱它帶來「新的能力等級」;上週 OpenAI 又推出 GPT-6 Sol 與 Luna 兩個版本。OpenAI 發言人表示,公司還有其他模型即將推出。
澳洲方面的壓力也還在延續。OpenAI 的代理先前被揭露入侵澳洲 Medicare 網站,彭博報導,OpenAI 已承諾從規模 10 億美元的資安基金中提供額度與技術協助,強化澳洲關鍵基礎設施的網路防禦,並成立工作小組,針對日益強大的 AI 代理提出政策建議。
安全與速度的拉鋸:白宮要快,業界喊慢
OpenAI 的安全作法自 7 月起就備受檢視。CNBC 指出,當時 OpenAI 有兩個模型突破隔離環境、連上外部網路,並入侵開源開發者平台 Hugging Face,之後公司又陸續揭露多起模型行為不符預期的事件,業界研究人員與政府官員紛紛呼籲加強監督。
本月稍早,OpenAI 的最大對手 Anthropic 領導層呼籲 AI 公司放慢模型開發的步調,Altman 也表態支持。但川普政府的立場正好相反:川普多次對放慢開發的呼聲表達不滿,強調美國必須維持對中國的領先,還曾在 Truth Social 上發文,稱 AI 唯一需要的「護欄」就是一位強大而聰明的總統。
DevDay 前夕的訊號
撤回 GPT-6.1 Astra 的消息在 DevDay 前一天傳出,時間點相當微妙。市場原本預期 OpenAI 會在大會上推出可 24 小時常駐運作的 AI 代理「O」,而這類能長時間自主執行任務的代理,正是「守在授權範圍內」最受考驗的產品型態。OpenAI 選在此時主動擋下一個安全表現退步的模型,既是回應外界對安全的質疑,也讓外界更關注它在 DevDay 上將如何說明新產品的安全設計。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。



