輝達 Groq 3 LPX 機櫃正式量產!三星代工 4 奈米、Nebius 搶先部署

Crumax
分享
輝達 Groq 3 LPX 機櫃正式量產!三星代工 4 奈米、Nebius 搶先部署

輝達(NVIDIA)於 Hot Chips 大會上宣布,旗下 AI 推論加速機櫃 Groq 3 LPX 已進入量產階段,委由三星電子(Samsung Electronics)採 4 奈米製程代工。AI 雲端服務商 Nebius 作為首位客戶,將率先整合進入其推論平台並對外提供服務。此次量產象徵輝達繼 Grace Blackwell 世代之後,Vera Rubin 平台在 AI 代理浪潮下最具話題性的產品落地。

NVIDIA Feynman 採台積電 A16 製程、首次導入 CPO 加速光互連 2028 放量

Groq 3 LPX 是什麼?Vera Rubin 平台的推論加速補丁

Groq 3 LPX 的核心定位,是基於 Nvidia Vera Rubin NVL72 系統、專為優化 AI 代理推論速度而生的加速器。NVL72 負責模型訓練與通用推論,而 Groq 3 LPX 則專攻「token 生成速度」。

廣告 - 內文未完請往下捲動

硬體架構上,Groq 3 LPX 是一套內建 256 顆 LPU(語言處理器)的機架系統,LPU 是輝達去年底間接收購 Groq 半導體公司後,所取得的核心推論專用晶片技術。在 Artificial Analysis 的基準測試中,Groq 3 LPX 以 Gemma 4 31B 開源代理模型搭配 100,000 token 的上下文長度執行,達到每秒 3,400 個 output token,是該模型的全球最高紀錄。

輝達於 Hot Chips 大會上所報告的投影片

相較於市面上其他替代平台,Groq 3 LPX 的推論響應速度快 4 倍,能讓 AI 代理在幾分鐘內就完成程式撰寫等複雜任務。

對 AI 代理系統來說,這個優勢特別重要:一個 AI 代理從檢查檔案、撰寫程式碼、呼叫外部工具、驗證結果到反覆迭代往往需耗費數小時;此時 token 生成速度的快慢,將決定整個使用者體驗能否維持流暢且高效。

三星電子平澤廠操刀,採 4 奈米製程

在量產細節上,Groq 3 LPX 100% 委由三星電子旗下的晶圓代工部門(Samsung Foundry)製造,生產地點為三星位於韓國京畿道的平澤園區,製程節點為 4 奈米。

在台積電(TSMC)近乎壟斷高階 AI 晶片代工市場的當下,輝達選擇以三星代工 Groq 3 LPX 也格外引發關注。三星 4 奈米製程近期陸續吸引多家全球客戶,這次拿下輝達量產訂單,對三星晶圓代工業務再次具有象徵意義,也意味著三星在 AI 晶片代工領域的競爭地位正在復甦。

台積電產能滿載成三星晶片代工春天!Google、AMD、比亞迪詢單量激增

Nebius、Groq 搶頭香,Vera Rubin 打造全方位 AI 工廠

首批客戶陣容也曝光是輝達第二親兒子 NebiusAI 雲端公司 Groq,前者預計透過其旗下的 Nebius Token Factory 推論平台,率先將 Groq 3 LPX 導入生產環境,讓開發者可透過現有 API 直接存取超高速 token 生成能力,無需遷移技術棧。

Nebius 技術長 Danila Shtan 表示,Groq 3 LPX 正是針對 AI 代理迴圈中最關鍵的「生成階段」所打造,目標是讓代理每一個執行步驟都能即時回應。

拆解整台 Vera Rubin NVL72 與 Groq 3 LPX,這些機架配備了 NVIDIA BlueField-4 DPU、Vera CPU 機架、BlueField-4 STX 儲存系統,以及 Spectrum-6 SPX 乙太網路,形成以高吞吐量與低延遲推論為目標的完整 AI 工廠配置。

AI 推論是下一個戰場,輝達代理人佈局成形

輝達執行長黃仁勳(Jensen Huang)在聲明中強調「推論是 AI 的成長引擎。」他指出,在全球 AI 運算需求加速的當下,Groq 3 LPX 將為 AI 系統帶來吞吐量、效率與響應速度的全面躍升。

隨著 AI 產業重心正從「訓練」轉向「推論」,計算需求與硬體要求也出現根本性轉變。輝達透過收購 Groq 的 LPU 技術,快速補強了 GPU 在低延遲推論場景下的先天限制,同時透過 Vera Rubin 平台的整合設計,形成訓練與推論雙軌並行的完整 AI 工廠解決方案。

從這個角度看,Groq 3 LPX 的量產不只是一款新產品的上市,而是輝達在 AI 代理與推論時代到來之際,全面鞏固競爭優勢的關鍵一步。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。