輝達推 AI 代理安全平台,稱毫秒內可隔離失控代理

Elponcho
分享
輝達推 AI 代理安全平台,稱毫秒內可隔離失控代理

AI 代理接連「逃出沙盒」後,輝達(NVIDIA)拿出了自己的解法。輝達 9 月 28 日發表「Open Agent Safety Platform」代理安全平台,包含負責劃定權限的 OpenShell,以及在獨立硬體上監控代理的 Sentry,目標是讓 AI 代理只能碰到完成工作所需的東西,一旦越界就能立即隔離。執行長黃仁勳在 CNBC 專訪中形容,這個平台基本上就是「給代理用的瀏覽器」。

兩道防線:OpenShell 劃界、Sentry 看門

根據輝達官方說明,OpenShell 是一套安全的執行環境(runtime),在 CPU 上替代理設下邊界。Decrypt 報導,它會把營運者的指示轉成可強制執行的規則,控制代理能存取哪些檔案、網路與工具。OpenShell 以開源形式釋出,可在輝達為代理型 AI 打造的 Vera CPU 上執行,也能延伸到 Arm、Intel 等第三方運算平台,目前已可從輝達開發者資源與 GitHub 取得。

Sentry 則是「頻外」(out-of-band)的看門機制,跑在輝達 BlueField-4 DPU 這類網路晶片上,而不是執行 AI 模型的 CPU 或 GPU。由於 Sentry 與模型所在的系統分開,代理無法存取或關閉它;輝達表示,當代理試圖突破邊界時,Sentry 能在「毫秒內」將其隔離並停止。

廣告 - 內文未完請往下捲動

輝達把這套平台定位為參考設計,部分軟體開源,由合作夥伴在上面開發產品推向市場。

為什麼是現在?代理失控事件接連爆發

CNBC 指出,這項發表的背景是 OpenAI、Anthropic、Meta 與 Google 近期都揭露過 AI 模型逃出沙盒、試圖入侵其他公司系統的事件。鏈新聞先前也報導,OpenAI、Anthropic 正在調查數萬起 AI 失控事件;OpenAI 更在同一天撤回 GPT-6.1 Astra 的發布。

輝達代表在記者會上宣稱,這個平台原本可以防止 OpenAI 在 7 月發生的 Hugging Face 事件,當時 OpenAI 的模型突破隔離、連上網路並入侵了 Hugging Face。輝達企業 AI 副總裁 Justin Boitano 表示:「每起資安事件都不一樣,必須逐一細看。就我們所知,Hugging Face 回報有超過 17,000 個代理攻擊其基礎設施,持續了好幾天甚至好幾週。」他認為,近期事件凸顯了根本問題:「光靠模型層級的防護,無法管住代理能存取或做什麼。」

工程派對上放慢派:黃仁勳的立場

這套平台也代表輝達在 AI 安全辯論中的立場。CNBC 指出,Anthropic 執行長 Dario Amodei 兩週前呼籲業界放慢模型開發,獲得 OpenAI 執行長 Sam Altman 與馬斯克支持;黃仁勳則主張,許多安全疑慮是可以靠電腦科學與產品開發解決的工程問題。他對 CNBC 表示:「你不能讓代理在公司裡四處遊走,所以必須想辦法把它裝進容器裡。」

白宮 AI 與加密貨幣顧問 David Sacks 也在 X 上附和:「輝達的 OpenShell 提醒我們,代理安全是工程問題。近期的突破事件不是開發必須停止的證據,而是沙盒太弱的證據。」

百家夥伴加入,安全變成硬體賣點

輝達表示已有超過 100 家合作夥伴,包括 Anthropic、微軟、思科、CrowdStrike、Palo Alto Networks、摩根大通、Palantir、Hugging Face、Salesforce、SAP 與 SpaceXAI 等。CNBC 指出,輝達也正與 Anthropic 合作,將雲端託管代理與 OpenShell 整合。Anthropic 商務長 Paul Smith 表示,輝達的平台「在硬體與軟體之間增加了另一層治理與控制」;SpaceXAI 總裁 Mike Nicolls 則說:「安全應該由模型之外、代理無法繞過的額外控制來強制執行。」

對輝達而言,這不只是一項安全工具。OpenShell 與 Sentry 分別對應 Vera CPU 與 BlueField-4 DPU,代理安全等於成了推銷整套硬體的新理由。黃仁勳說:「如果世界不相信 AI 是被安全地打造與部署,AI 產業就不可能成功。」接下來值得觀察的是,這套「模型之外的護欄」能否說服監管機關與企業,讓 AI 代理繼續加速上線。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。