NVIDIA 發表 Nemotron 3 Nano Omni 開源多模態

Elponcrab

2026/4/29

根據 NVIDIA 官方部落格 4 月 28 日公告（作者 Kari Briski），NVIDIA 發表 Nemotron 3 Nano Omni — 開源多模態模型，把視覺、語音與語言能力整合進單一模型，目標是為 AI agent 系統提供更低延遲、更省成本的「感知層」。

Table of Contents

核心規格：30B-A3B MoE、256K context、9 倍吞吐量、登 6 個排行榜首位

關鍵架構：

30B-A3B hybrid mixture-of-experts（總參數 30B、活化 3B）
整合 Conv3D 與 EVS 編碼
256K context 長度
輸入：文字、影像、音訊、影片、文件、圖表、GUI 螢幕
輸出：文字

性能訊號：較其他開源 omni 模型在同等互動性下達 9 倍吞吐量；於文件智慧、影片理解、音訊理解三大類共 6 個基準排行榜取得首位（NVIDIA 公告未列出具體分數，引導讀者前往開發者部落格查看詳細資料）。

廣告 - 內文未完請往下捲動

NVIDIA 把 Nemotron 3 Nano Omni 定位為 agent 系統中的「眼睛與耳朵」，可與 Nemotron 3 Super（高頻執行）、Nemotron 3 Ultra（複雜規劃）等同家族模型分工，亦可與第三方雲端模型互通。三個典型 agent 應用場景：

電腦操作代理（Computer Use Agent）：原生 1920×1080 解析度視覺推理
文件智慧：跨圖、表、截圖與混合媒體輸入推理
音訊／影片理解：把講話、畫面、紀錄整合為單一推理串

採用方陣容：鴻海、Palantir 入列、H Company CEO 具名表態

NVIDIA 公告中明確區分「生產採用」與「正在評估」：

已生產採用：Aible、Applied Scientific Intelligence（ASI）、Eka Care、鴻海（Foxconn）、H Company、Palantir、Pyler

正在評估：Amdocs、Dell、Docusign、Infosys、IQVIA、Lila、Oracle、Quantiphi、TCS、Zefr 等

H Company 執行長 Gautier Cloix 在公告中具名表態：「To build useful agents, you can’t wait seconds for a model to interpret a screen. By building on Nemotron 3 Nano Omni, our agents can rapidly interpret full HD screen recordings — something that wasn’t practical before.」翻譯：「打造實用代理時，你不能等模型秒級解讀螢幕。建立在 Nemotron 3 Nano Omni 之上，我們的代理可快速解讀完整 HD 螢幕錄影 — 這在之前並不實際可行。」