GPT-6 Astra 有多強?ARC-AGI-3 達 99.9%,AI Agent 邁向自主完成工作

Neo
分享
GPT-6 Astra 有多強?ARC-AGI-3 達 99.9%,AI Agent 邁向自主完成工作

OpenAI 正式發布新一代旗艦 AI 模型 GPT-6 Astra,將能力重點從單純的問答與推理,進一步推向 AI Agent、電腦操作(Computer Use)、專業工作、科學研究、程式開發與資安,讓 AI 不只回答問題,也能操作電腦與工具完成多步驟工作。

OpenAI 執行長 Sam Altman 表示,希望 GPT-6 Astra 能催生新一代的創業、科學發現與創造,並稱 OpenAI 相信 Astra 是目前在電腦操作、專業工作、科學、程式開發與網路安全等領域表現最好的模型。

Benchmark 方面,GPT-6 Astra 在 ARC-AGI-3 達 99.9%、FrontierMath Tier 4 達 97.6%,ExploitBench 更取得 100%。其中資安能力首次觸及 OpenAI Preparedness Framework 的 Critical 門檻;另一方面,Astra 也開始把 Computer Use、Coding、Web Search、MCP 與 Skills 等工具整合進長時間 Agent 工作流程,模型競爭正從「回答問題」進一步轉向「完成工作」。

廣告 - 內文未完請往下捲動

GPT-6 Astra 最大升級是什麼?AI 開始直接「做完工作」

如果說過去大型語言模型主要競爭的是「回答得多聰明」,GPT-6 Astra 更重要的方向則是能不能把工作真正完成。

OpenAI 表示,Astra 能直接操作電腦與瀏覽器,例如填寫線上表格、更新 CRM 客戶資料、整理行事曆、進行網路研究,再把結果寫進電子郵件或文件;更複雜的工作還包括分析科學資料、繪製圖表、建立網站,以及完成前端 QA 測試。

在 OSWorld 2.0 電腦操作測試中,GPT-6 Astra 得分達 72.6%,高於 GPT-5.6 Sol 的 65.7%;同時平均完成任務所需時間約 40 分鐘,GPT-5.6 Sol 則約為 75 分鐘,相當於時間縮短約 47%。

另一項模擬真實專業軟體工作的 Agents’ Last Exam,Astra 得分 59.3%,也高於 Claude Opus 5 的 55.5% 與 GPT-5.6 Sol 的 53.6%。OpenAI 表示,在最高分設定下,Astra 使用的輸出 token 還比 Claude Opus 5 少約 65%。

這讓 GPT-6 Astra 的定位更接近一個能自主執行工作的通用 AI Agent,而不只是聊天機器人。

GPT-6 Astra 程式能力提升,Codex 還能「跨 Context Window 記憶」

程式開發同樣是 GPT-6 Astra 的主要升級項目。

在 Terminal-Bench 4.0 中,Astra 得分從 GPT-5.6 Sol 的 37.3% 提升至 57.9%;DeepSWE v1.1 則取得 74.1%。不過並非所有程式測試都由 Astra取得第一,例如 Artificial Analysis Coding Agent Index 中,Astra 得分 67.0,仍略低於 Claude Opus 5 的 68.1。

GPT-6 Astra 在 Codex 中新增一種保存與重新取得 Context 的方式。過去 Agent 執行大型重構或長時間除錯時,Context Window 填滿後通常需要透過 compaction 壓縮先前內容,過程可能遺失「某個方法為什麼失敗」等細節。

Astra 則能跨 Context Window 保留工作筆記,同時讓較早以前的 Context 保持可搜尋,使模型可以重新找回先前的需求、測試結果與工具輸出。

這項改變的意義在於,AI Coding Agent 能執行的任務可能進一步從「一次性的程式生成」,走向持續數小時甚至更長時間的軟體工程工作。

ARC-AGI-3 從 7.8% 暴增至 99.9%,GPT-6 Astra 推理能力大幅躍進

GPT-6 Astra 最驚人的 Benchmark 之一來自 ARC-AGI。

根據 OpenAI 公布結果:

  • ARC-AGI-3:99.9%,GPT-5.6 Sol 為 7.8%
  • ARC-AGI-2:95.0%,GPT-5.6 Sol 為 92.5%
  • FrontierMath Tier 4:97.6%,GPT-5.6 Sol 為 83.0%
  • GPQA Diamond:96.0%,GPT-5.6 Sol 為 94.6%
  • Terminal-Bench Science:64.6%,GPT-5.6 Sol 為 22.4%

ARC-AGI-3 尤其值得注意。這套測試希望衡量 AI 面對陌生環境時的抽象推理與適應能力,OpenAI 公布的 Astra 成績幾乎達到滿分。

ARC Prize 也另外公布 Astra 測試結果,稱 GPT-6 Astra 在 ARC-AGI-3 創下目前最佳成績,並指出較高 reasoning level 雖然投入更多推理能力,卻可能因為模型能以更少操作解決問題,而降低整體模型呼叫與 token 使用量。

不過 Benchmark 接近飽和並不等於「AGI 已被證明」,尤其不同測試的 harness、工具與執行條件都會影響結果。OpenAI 自己也註明,其評測是在研究環境或 API 執行,與實際 ChatGPT 產品中的模型表現可能存在差異。

GPT-6 Astra 已能找到 Zero-day,首次達 OpenAI 資安「Critical」等級

能力提升同時帶來另一個問題:Astra 已經強到 OpenAI 必須限制部分能力的使用方式。

GPT-6 Astra 是 OpenAI 首款在 Preparedness Framework 中,資安能力達到 Critical(關鍵)門檻的模型。

在沒有產品安全限制的測試環境下,Astra 於 ExploitBench 取得 100%,相比 GPT-5.6 Sol 為 78.5%;ExploitGym 則為 42.4%,高於 Sol 的 30.3%。

更值得注意的是,OpenAI 表示 Astra 在測試期間甚至發現並利用了兩個此前未知的 Zero-day 漏洞,目前正向相關維護者揭露漏洞。

在 SRE-Bench 逆向工程測試中,Astra 首次嘗試即可解決 88% 任務,四次嘗試內更達到 99.2%。專家測試還發現,未套用產品安全措施的 Astra,可以利用未知漏洞在經過強化的瀏覽器中達成任意程式碼執行。

因此,正式推出的 Astra 仍會拒絕部分進階攻擊性資安任務,例如替漏洞建立 Proof-of-Concept exploit。OpenAI 預計透過 Daybreak 計畫逐步向可信任的資安研究者開放更多能力。

能力更強卻更難監控?OpenAI 坦承 Astra 的推理可監控性下降

GPT-6 Astra 的另一個重要訊號,反而來自 OpenAI 主動揭露的限制。

OpenAI 表示,Astra 整體而言比 GPT-5.6 Sol 更能遵守使用者授權範圍。在一項根據先前 Hugging Face 事件設計的內部測試中,沒有產品安全機制的 GPT-5.6 Sol 有 48% 機率超出授權目標,而 Astra 為 0%。

但另一方面,OpenAI 發現 Astra 的書面推理過程反而比 GPT-5.6 Sol 更難監控。

在刻意要求模型躲避監控的對抗測試中,Astra 對自己的推理內容具有更強控制能力,也更可能避免留下可被監控系統辨識的訊號。OpenAI 因此強調,未來不能只依賴 Chain of Thought 監控模型,而需要發展其他 Alignment auditing 方法。

這形成前沿 AI 發展的一個新矛盾:模型越聰明、越能自主完成長時間工作,人類可能也越難單純從它寫出的推理過程判斷它究竟在做什麼。

GPT-6 Astra 何時可以用?Plus、Pro 將陸續開放

GPT-6 Astra 首波先向有限數量的組織推出,OpenAI 表示,接下來幾天將逐步提供給 ChatGPT Plus、Pro、Business 與 Enterprise 使用者,同時登陸 OpenAI API 與 AWS。

Pro、Business 與 Enterprise 用戶還將獲得 GPT-6 Astra Pro 使用權;Enterprise 管理員則需要自行為 Workspace 開啟 Astra,發布初期預設關閉。

API 模型名稱為 `gpt-6-astra`,Standard 模式價格為:

  • 輸入:每 100 萬 Token 10 美元
  • 輸出:每 100 萬 Token 50 美元

另外還有最高可達 Standard 兩倍速度的 Fast mode,價格同樣為 Standard 的兩倍。

GPT-6 Astra 的 Context Window 更擴大至 105 萬 Token,單次最高輸出 12.8 萬 Token。這也與 OpenAI 對 Astra 的產品定位一致:不再只是追求一次 Prompt 的回答品質,而是希望模型能接收龐大工作背景,持續操作工具並完成端到端任務。

GPT-6 Astra 上線出包,Sam Altman 出面道歉

不過,想立刻使用 GPT-6 Astra 的 ChatGPT 付費用戶可能還得再等等。

GPT-6 Astra 發布後的 rollout 並不順利。OpenAI 執行長 Sam Altman 隨後公開為混亂的上線過程道歉,表示「當我們搞砸事情時,我們會努力把它修好」,並透露 OpenAI 應該能在不久後開始向 API 客戶與 ChatGPT 訂閱用戶大規模開放 Astra。

Altman 引用 OpenAI 團隊成員 Tibo 的貼文表示,團隊正在全力加快 Astra 的開放速度。Tibo 稱,從發布當天開始,付費 ChatGPT 用戶每晚一天沒有取得 Astra 使用權,就會獲得一次可累積(banked)的 reset,作為 rollout 延遲的補償。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。