OpenAI 研究員離職創業!下一場戰爭不是模型,而是價值逾千億美元的 RL 數據
參與 OpenAI GeneBench、GeneBench-Pro 等生物醫學 AI 評測工作的研究員 Andrew Ho 宣布離開 OpenAI,並將創辦一家新公司,專注於打造高品質強化學習(Reinforcement Learning,RL)訓練資料集。
他認為,大型語言模型(LLM)的下一個瓶頸,不再只是增加 GPU 或模型參數,而是取得真正能提升推理能力的高品質資料。
LLM 的泛化能力其實很差
Andrew Ho 在離職文章開宗明義指出,目前外界對大型模型存在一項誤解。
他認為,LLM 的泛化(Generalization)能力仍然非常有限。
即使 AI 已投入數十億甚至數千億美元發展,模型在許多領域仍呈現「尖峰式能力(spiky capabilities)」。
他以程式設計為例表示,即使目前模型可以解 Codeforces 題目,也能比自己更好地將 C++ 移植到 Rust,但實際工作中,他仍需要親自修改 AI 產生的 Pull Request,代表模型距離真正理解軟體開發仍有很大落差。
在他看來,今天的 AI 更像是在少數基準測試表現優異,而不是已經具備真正可泛化的能力。
真正缺的不是模型,而是 RL 訓練資料
Andrew Ho 認為,目前市場最大的問題不是模型,而是高品質 RL 資料極度不足。
他指出,大部分現有資料供應商並未真正參與大型模型訓練,因此不了解什麼樣的資料才能有效提升模型能力。
更重要的是,大量具有經濟價值的工作都高度依賴情境。
例如企業決策、醫療判斷或科研分析,很難像數學題一樣有唯一答案,因此無法直接設計成容易評分的 RL 環境。
他表示,即使知道人類採用了一條「最佳路徑(Golden Path)」,也很難判斷其他可能的決策路徑究竟是好還是壞,這正是目前 RL 訓練最大的挑戰。
AI 實驗室未來可能投入超過 1,000 億美元購買資料
Andrew Ho 更提出一項大膽預測。
他認為,未來幾年各家前沿 AI 實驗室,將投入超過 1,000 億美元採購高品質訓練資料,而不是單純依靠模型規模持續擴大。
原因在於,隨著 OpenAI、Anthropic、Google 等公司逐漸面臨獲利壓力,單靠 Scaling Law 已不足以持續提升模型能力。
未來真正重要的是精準且高度針對性的資料 acquisition。
他表示,由於自己曾直接負責 OpenAI 從資料採購到模型訓練的完整流程,因此十分清楚大型 AI 公司真正需要什麼樣的資料,也希望自己的新公司能成為 AI 實驗室的重要供應商。
第一站瞄準生物學與統計推理
Andrew Ho 的新公司第一批產品將聚焦兩大方向。
首先,是建立支援長鏈科學推理(Long-horizon Scientific Reasoning)的資料集。
他指出,自己近期與 OpenAI 團隊共同推出 GeneBench-Pro,就是希望測試 AI 是否能真正完成具有大量判斷、探索與反覆修正的科研分析,而不是只會回答選擇題。
他透露,目前 GPT-5.6 Sol 在 GeneBench-Pro 的最高通過率仍僅約 30%,距離真正能可靠協助科學研究還有很長一段路,因此希望藉由高品質 RL 資料,將模型可靠性提升至 90% 以上。
第二個方向則是打造更貼近日常科研工作的資料。
例如研究人員拍攝一張細胞培養皿(Cell Culture Plate)、Western Blot 或其他實驗影像,直接詢問 AI 如何判讀。
Andrew Ho 認為,目前包括多模態模型在內,對這類真實科研工作仍表現不佳,但若希望 AI 真正協助科學發現,就必須先補足這些基礎能力。
未來將擴展至醫療、材料與白領工作
除了生物學之外,Andrew Ho 表示,公司未來也將逐步拓展至化學、材料科學、醫療保健,甚至一般白領工作的 RL 資料。
他最後也向 OpenAI、Anthropic 等 AI 實驗室喊話,表示公司將提供符合業界標準價格與合作模式的資料服務,歡迎有需求的 AI 公司直接與他聯繫。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。


