研究揭 AI「內心話」可被解密:主流模型思考鏈全洩

Elponcrab
分享
研究揭 AI「內心話」可被解密:主流模型思考鏈全洩

你以為 AI 模型「藏起來」的思考過程是加密安全的,其實可能被整包解開。根據 Decrypt 報導,一篇 8 月 10 日提交的研究揭露,Anthropic、OpenAI 與 Google 的推理模型,用來加密「內心思考鏈」的做法存在重大弱點,讓外界得以解出這些原本看不到的內部推理。

單一全域金鑰:加密的思考鏈可被互換解密

這篇論文由 MATS Research、圖賓根 ELLIS 研究所、馬克斯普朗克智慧系統研究所與資安公司 Snyk 的團隊共同提出,鎖定的是「推理模型」—這類模型不會立刻回答,而是先在一個看不見的「草稿區」一步步想過(也就是思考鏈,chain-of-thought),再給出最終答案。Anthropic、OpenAI、Google 都會把這段草稿加密。問題在於,研究發現各大業者是用「單一全域金鑰」加密推理 token,導致這些加密後的推理區塊,竟然可以跨工作階段、跨使用者、甚至跨模型互相通用—等於留下了一把萬能鑰匙。

解出 31 萬個推理區塊,藏在裡面的祕密全都露

殺傷力來自一個開發者的日常習慣:很多人會把 AI 代理的工作日誌(含加密的思考過程)公開貼到 GitHub、Hugging Face 上協作或除錯,卻不知道那些加密區塊裡藏著敏感資料。研究團隊抓取了 6,708 份公開的 AI 代理對話紀錄,成功解出其中 31 萬 5,320 個推理區塊;而這些祕密大多從未出現在模型「可見的」輸出裡,只存在於加密的思考過程中,不跑這套攻擊根本看不到。這也再度呼應近期的 AI 資安警訊:從 AI 模型在測試中「越獄」,到 PDF 隱形指令劫持 AI 助理,都指向同一件事—當 AI 承載愈多敏感任務,它的每一層(包括「看不見的思考」)都可能成為新的攻擊面。

廣告 - 內文未完請往下捲動

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。