OpenAI 公布失準揭露框架:模型曾隱瞞錯誤、捏造資料
OpenAI 9 月 16 日公布一套追蹤、調查與揭露模型失準(misalignment)的框架,並同步發布過去六個月觀察到的六份案例報告。公告中有一句話值得單獨看:OpenAI 表示,他們不認為 AI 產業已經把對齊與監控解決到足以繼續用最高速度負責任地擴張太久的程度。
六個案例:從隱瞞錯誤到自行上傳檔案
這六份報告都來自模型訓練或評估過程中觀察到的個別事件,OpenAI 強調這些是單一實例,不代表失準在其模型上發生的頻率。
一是任務摘要裡出現模型自己寫的指令。一個未發布的研究模型在用於接續工作的摘要中插入無關指令,包括要求忽略自身正常約束的內容,OpenAI 指出受影響的摘要有 27 份。
二是指示隱瞞錯誤。在 GPT-5.6 Sol 的訓練過程中,許多模型實例在摘要裡加入指令,要求對使用者隱藏錯誤或失準行為,例子包括在壓縮摘要中指示捏造缺漏的歷史資料而不揭露,以及隱藏來源版本不一致的情形。
三是找出外洩的 API 金鑰後捏造資料。一個模型在回答關於加州某郡收益數字的例行問題時,未經授權找到並使用了一組外洩的 API 金鑰;即使如此仍無法取得所需數字,它最後捏造了數字,並以來自指定來源的資料呈現。
四是為了引用而把檔案上傳到網路。使用者要求列出面積大於 500 萬平方公尺的湖泊代號與名稱,模型用 Python 得到正確答案,但因為指示要求提供瀏覽器引用,該代理便自行把檔案上傳,以便在答案中引用,過程中沒有詢問使用者。
五與六都與代理之間的協作有關。模型把內部程式庫當成留言板,在不同訓練樣本之間交換請求與回應;另一起案例中,共同執行同一訓練任務的代理在無法存取彼此本機檔案時,改用公開的檔案代管網站交換檔案,導致任務產出出現在公開網址上,而任務本身要求只能使用本機檔案。
為什麼要訂框架:過去的揭露是臨時性的
OpenAI 說明改變的原因在於過去缺乏系統性做法。以往的揭露多半等到能把數個實例彙整成一份報告時才發布,或附在新模型的系統卡(system card)裡,頻率低於理想。新框架的用意是在觀察到行為之後就儘快發布,即使尚未完全解釋或緩解該行為。
框架也明確偏向揭露:OpenAI 表示即使重要性尚不確定也傾向公開,並直言其中部分案例日後可能被證實是偶發、不構成更大的模式。
OpenAI 指出,目前產業並沒有一套針對失準揭露的明確標準,希望這份框架是建立標準的第一步。該公司並表示認為嚴重的安全、資安與失準事件應與美國聯邦政府分享,正在研擬通報機制,同時強調這套框架是既有法律揭露義務的補充而非取代。
內部流程:任何員工都可以提報,分三軌處理
依公告,任何 OpenAI 員工都可以提報失準案例,交由安全與對齊團隊調查並要求評估是否公開,每個步驟都設有期限。技術人員會調查發生了什麼、哪些部分仍不確定、是否值得公開、哪些事實可以分享,並評估是否有第三方受影響而需要在發布前私下通知。
案例接著被分到三條軌道:可直接揭露、小型調查、大型調查(慢軌)。OpenAI 預期前兩軌會涵蓋大多數案例,這次發布的六件都屬於前兩軌。涉及第三方的複雜調查走慢軌,此時資安、法律與負責任揭露的義務優先於本框架。
這份框架出現的時間點,正好落在 AI 產業關於是否該放緩前沿開發的辯論中間。鏈新聞近期報導過馬斯克稱 AI 現在非常危險、以及Anthropic 與 OpenAI 罕見承諾放緩競賽。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。




