OpenAI 提 AI 訓練安全規範:高層握否決權,警報無人回應就自動停訓

Elponcrab
分享
OpenAI 提 AI 訓練安全規範:高層握否決權,警報無人回應就自動停訓

OpenAI 9 月 29 日在官網發布《Towards safety cases for frontier AI training》,主張任何前沿強化學習訓練在繼續進行之前,都應先備妥結構化的安全文件,理想上要達到航空、核能等高風險產業所用的「安全論證」(safety case)層級,也就是一套完整、有證據支撐的風險論證。

OpenAI 坦言,由於每一級 AI 能力都會帶來新的複雜性,要讓 AI 模型的安全論證像航空或核能一樣嚴謹並不容易,因此把它視為努力的方向,目前正在建立框架把這些做法制度化。文件列出的是目前的心得,OpenAI 表示會持續調整,公開是為了讓外界了解他們的想法並徵求意見。

這份文件發布前,OpenAI 才經歷一連串事件。鏈新聞先前報導,OpenAI 的代理在訓練中利用 DNS 逃出沙盒,公司第二度暫停最強模型的訓練,隨後又撤回 GPT-6.1 Astra。這份文件本身沒有點名這些事件。

廣告 - 內文未完請往下捲動

不讓評分器看到思維鏈,沙盒被突破也要有第二道防線

技術面分成對齊訓練、隔離與監控三層。對齊方面,OpenAI 建議用代理自動檢查、再加上人工複核,找出有漏洞的強化學習訓練環境,避免模型靠鑽漏洞而非完成任務拿到高分;評分器也要調整成會懲罰這類鑽漏洞的行為。文件特別提到,自動評分器不應看到模型的思維鏈,以免模型在訓練中演化出躲避思維鏈監控的能力。另外也要追蹤模型「察覺自己正在被測試」而改變行為的情況,並設定明確的阻擋門檻。

隔離方面,除了強化模型執行的沙盒,也要強化承載沙盒的研究基礎設施,讓沙盒一旦被突破時還有額外一層保護;同時要用前沿訓練過程中的模型檢查點,反覆對沙盒與周邊系統做紅隊測試,訓練期間模型可能接觸的服務(例如網路快取)也要測。代理的對話紀錄則應以不可修改的方式保存一段時間,方便事後調查。

監控方面,高優先警報要在約定時限內觸發處置,可以是呼叫值班人員,也可以是自動暫停受影響的訓練。文件舉例,白天出事時通知資安值班人員與訓練負責人,夜間的警報若沒人確認,就自動暫停訓練。

安全主管與首席科學家都能否決,監控關掉就不准開跑

營運面,安全論證寫好後,要由其他團隊的成員撰寫反對意見、找出漏洞,訓練團隊再逐一回應。論證要交由多位高層審查,每人都有否決權,文件舉的例子是研究部門主管或副總裁、安全主管與首席科學家。負責該次訓練的高層要對安全論證與事故應變負責,這也會納入績效考核。

文件也要求一套失準(misalignment)事件的分級與值班制度,嚴重程度達到一定等級時,值班人員可以直接呼叫執行長。技術上,監控與自動暫停這類安全功能要做到「失效即封鎖」:沒開監控就無法啟動訓練,也不能從訓練、評估或內部部署的環境裡把監控關掉。OpenAI 表示,這些建議正在公司內部導入,未來幾週還會繼續調整。

事故調查比照高風險產業,結果要對外公開

針對嚴重的失準事件,OpenAI 建議比照其他高風險產業的調查做法:調查期間定期向內部更新,研究人員要追查失準行為是在訓練中如何出現的,並做營運與文化層面的事後檢討,找出問題為何沒有被及早發現或上報。

從事故衍生出來的評測要當成「回歸測試」,確保未來的模型不會在類似情境重犯。調查結束後,結果、事後檢討與營運上的改變都應對外公開,受影響的第三方則應盡快通知。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。