OpenAI 安全報告負責人辭職投書:公司文化已壞,應學核電廠
負責撰寫 OpenAI 重大產品安全報告的 David Robinson 本週離職,並於美東時間 10 月 3 日在《大西洋月刊》發表投書,直言公司的文化已經壞掉,邊衝刺推出新產品,邊無法達到他認為必要的謹慎程度。
主導 12 次前沿模型發布的安全報告,任職三年半
Robinson 在文中表示,他在 OpenAI 任職三年半,是公司年資最長的員工之一,主導起草了現行的「準備度框架」(Preparedness Framework),並督導 12 次前沿模型發布的安全報告撰寫。他說自己知道這種「離職後示警」的戲碼已近乎老套,但仍決定加入近期出走的前同事行列,因為他認為目前的路線無法接受。
他也揭露,離職後已聘請公關公司 Spitfire Strategies 協助應對外界關注,但強調「發聲的決定完全是我自己的」。他的離職消息最早由 Business Insider 披露。
點名 Hugging Face 事件:試錯式安全做法注定週期性失敗
Robinson 指出,OpenAI 靠試錯起家,公司稱之為「迭代部署」,也就是邊發現問題邊補強防護。但他認為這種做法本質上保證會週期性出錯,而且隨著系統能力提升,失敗的規模也越來越大。
他舉例,今年夏天的 Hugging Face 事件中,OpenAI 誤把一群 AI 代理放了出去;公司事後強化資安,但之後又通報一起案例:訓練中的模型繞過了網路存取限制,監控系統雖然發出警報,卻沒有依設計自動關閉模型。他也提到 Anthropic 曾因設定錯誤意外關掉自家防護機制,認為這類失誤在產業中很普遍。OpenAI 近期也持續揭露更多失控代理活動。
Robinson 引述幾週前加入 OpenAI 董事會的 Paul Christiano 所言,AI 能力快速加速,在極近期內就有導致災難性、不可逆失控的實質風險。他寫道:「如果情況如此,試錯的時代就該結束了。」
呼籲比照核電廠與機場,OpenAI 回應會在必要時暫停訓練
Robinson 提出兩項急需的改變:AI 公司應更多借重其他領域既有的安全專業;在打造明顯更強的系統之前,需要新的科學方法,確保模型在無人監看時也會做出安全的選擇。他認為前沿實驗室應該像核電廠或繁忙機場一樣運作,有多層備援與耗時的周密規劃,讓偶發的人為失誤不至於釀成災難。
他寫道,在 OpenAI 期間,就他所知從未遇過有讓飛機安全飛行、核反應爐不熔毀,或協助金融體系成長而不崩潰經驗的同事。他也坦言或許應該留下來爭取人力與文化的根本改變,但實際上大家忙於衝刺,很少有機會思考大幅調整,因此結論是需要來自公司外部、更強的安全誘因。
OpenAI 發言人 Drew Pusateri 向 TechCrunch 回應,公司確保模型能力不會超出能安全管理的範圍,「需要放慢時,我們會暫停訓練或暫緩發布模型」,並表示正在強化研究與測試環境的安全、擴大與第三方評估機構的合作,以及改善即時監控,以便在訓練過程更早發現並處理令人擔憂的行為。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。




