馬斯克 Grok 4.7 上線不漲價,前代在 AI 星海爭霸對戰幾乎全敗

Elponcrab
分享
馬斯克 Grok 4.7 上線不漲價,前代在 AI 星海爭霸對戰幾乎全敗

SpaceXAI 9 月 21 日推出 Grok 4.7,官方稱這是旗下寫程式與知識工作能力最強的模型,價格與速度維持 Grok 4.6 的水準。根據 SpaceXAI 官方公告,Grok 4.7 即日起可在 Cursor、Grok Build 與 Grok API 使用。前一天,一份讓 AI 代理互打《星海爭霸:母巢之戰》的評測在 X 上流傳,前代 Grok 4.6 在 19 組參賽設定中幾乎墊底。

Grok 4.7 定價每百萬 token 輸入 2 美元,法律與電機評測高於 Fable 5.1

SpaceXAI 是馬斯克旗下的 AI 部門,今年二月由 xAI 併入 SpaceX,六月再買下 Cursor,鏈新聞先前報導曾整理其沿革。

官方說明,Grok 4.7 改用比 Grok 4.6 更大的新基礎模型,強化學習訓練時間更長,題目組合也更難,偏重需要好幾個小時才能完成的任務。SpaceXAI 表示,新模型更會檢查自己的成果、處理更長的上下文,也針對自家常駐代理 Grok Bot 的運作框架做了訓練。

廣告 - 內文未完請往下捲動

定價為每百萬 token 輸入 2 美元、輸出 6 美元,另有輸出速度兩倍、價格也兩倍的快速版。官方公布的比較數據如下,Grok 4.7 採 xHigh 推理設定,GPT-5.6 Sol 與 Fable 5.1 為 Max,Grok 4.6 為 High:

評測/價格 Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
輸入/輸出價格(每百萬 token) 2/6 美元 2/6 美元 4/20 美元 10/50 美元
CursorBench 4.0(軟體工程) 46.3% 40.4% 41.7% 51.8%
Terminal-Bench 4.0(長時間終端機作業) 38.0% 20.3% 37.3% 57.9%
EEBench(電機工程) 64.0% 53.0% 39.4% 56.4%
Harvey 法律代理評測 19.6% 15.8% 2.5% 6.7%
HealthBench Professional(臨床推理) 56.7% 48.5% 60.5% 62.1%

依官方數據,Grok 4.7 在電機工程與法律兩項領先,寫程式與長時間終端機作業仍落後 Fable 5.1,臨床推理則低於另外兩家。以上皆為 SpaceXAI 自行公布的成績。

安全方面,SpaceXAI 表示 Grok 4.7 換上全新的防護機制,在自家評測 HackerBench v0.3 中只放行 3.3% 有風險的雙重用途資安請求,在 LatchBio 生物安全評測拿下 62.4% 居冠。公司也開始讓特定資安合作夥伴以邀請制使用 Grok 4.7 的紅隊測試能力,做防禦研究。

星海爭霸評測 171 場:Grok 4.6 最高推理設定 43 分鐘只下 6 次指令

另一邊,開發者 Ben Swerdlow 發表的 Brood War Bench 9 月 20 日由 OpenClaw 開發者 Peter Steinberger 在 X 上轉貼,引起不少討論。Swerdlow 做了一個只能透過 AI 代理操作的《星海爭霸:母巢之戰》,讓 Codex、Claude 與 Grok 共 19 組模型與推理強度設定兩兩對戰,總計 171 場。

結果 Codex Astra 最高推理設定 18 戰全勝,Claude Fable 15 勝 3 敗排第三,Claude Opus 5 則是 12 勝 6 敗。Grok 4.6 的三種設定輸給所有 Codex 與 Claude 設定,只贏過 Claude Haiku 或彼此,表現最好的一組 18 場只拿 2 勝。

Swerdlow 記錄到,Grok 4.6 常花很長時間推理,卻很少實際下指令。其中一場,最高推理設定用了 11,138 個推理 token,43 分鐘內只送出 6 批指令,始終沒有派出任何戰鬥單位。他在報告中寫道,Grok 模型還不夠聰明,玩不了母巢之戰;較舊的模型常把即時戰略遊戲當成回合制來玩,還在思考就被對手摧毀。

Swerdlow 也強調,所有參賽模型都沒有超過新手程度,就連 Codex Astra 與 Claude Fable 也組不出複雜的部隊、守不住簡單的進攻,一個會用光子砲快攻的新手玩家就能贏下全部對局。這份評測測的是 Grok 4.6,排行榜上目前還沒有 Grok 4.7 的成績。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。