微軟 CEO 警告超級智慧是企業內部威脅,AI 不該被信任!馬斯克、David Sacks 回應了

Neo
分享
微軟 CEO 警告超級智慧是企業內部威脅,AI 不該被信任!馬斯克、David Sacks 回應了

微軟執行長 Satya Nadella 10 月 10 日發表長文〈超級智慧時代,將模型視為內部風險〉(Models as Insider Risks in the Super Intelligence Era),警告企業正將敏感資料、關鍵系統操作權限交給連開發者都無法完全理解的 AI 模型。他主張,未來 AI 安全的核心不該是讓模型變得值得信任,而是建立一套即使模型不可信,也能確保系統安全運作的工程架構。

這篇文章隨即引發矽谷科技圈討論。前白宮 AI 與加密貨幣事務負責人 David Sacks 公開表示認同,並藉此批評現行 AI Alignment(對齊)路線;特斯拉執行長 Elon Musk 轉發稱這是一篇有趣的文章,而知名創投 Chamath Palihapitiya 則進一步預測,未來企業將出現一種全新的 AI 治理系統,專門追蹤 AI 的決策、執行過程及責任歸屬。

AI 已經有權操作關鍵系統,但我們仍無法真正理解它

Nadella 指出,過去數十年,傳統軟體系統之所以能被廣泛部署,是因為工程師可以透過程式碼追蹤系統行為,找出特定操作或錯誤究竟來自哪一段程式。然而,當前最先進的 AI 模型卻不具備相同程度的可解釋性。

廣告 - 內文未完請往下捲動

即使模型能力已超越許多傳統軟體,我們仍無法將某個模型輸出,精確對應到特定訓練資料或模型權重的配置。更矛盾的是,企業不但開始讓 AI Agent 存取敏感資訊,還進一步授權它們代表人類執行攸關業務運作的任務。這讓 Nadella 認為,企業必須重新思考 AI 時代的信任架構。他強調,即使模型供應商聲稱其產品安全可靠,也不代表部署模型的企業可以將責任一併外包。

他的核心主張是:我們需要將智慧的供應(Supply of Intelligence)與對智慧的控制權(Authority over It)分開。

企業可以向 OpenAI、Anthropic 或其他供應商取得模型能力,但模型能存取哪些資料、執行哪些操作,以及什麼時候必須停止,都應由獨立於模型之外的系統決定。將 AI 模型當作企業內部威脅:不是因為它有惡意,而是因為它有能力

Nadella 提出一個重要概念:企業應將封閉模型及開放權重模型,都視為潛在的「內部風險」(Insider Risks)。這並不意味著 AI 必然具有惡意,而是任何具備高度能力、又能接觸重要系統的行為者,都可能犯錯、受到操縱,甚至遭到入侵。企業其實早已熟悉如何管理這類風險。例如,員工必須擁有明確身分、受到權限限制,重要操作需要留下紀錄,而敏感系統也會設立隔離邊界。

Nadella 認為,這些經過數十年資訊安全實務驗證的原則,應該直接延伸到 AI Agent。尤其值得注意的是,他要求 AI 模型的思考鏈(Chain of Thought,CoT)透明化,並表示不能以模型使用人類無法理解的內部表徵(Neuralese)為理由,接受不透明的推理過程。

但他也承認,即使模型能展示思考鏈,也不代表這些內容必然忠實反映模型實際的內部運作。讓另一個 AI 模型監督、驗證原本的模型,同樣無法徹底解決問題。因為如此一來,企業可能只是建立出一個由黑箱模型執行、黑箱編排系統協調,再交由另一個黑箱模型監督的架構。

Nadella 主張將模型本身、負責協調工作的 Harness,以及定義模型可執行操作的 Action Space 分離,並將真正的安全控制機制部署在模型之外,避免 AI 自行繞過或修改限制。

Nadella 提出 AI 治理七大原則:每個 Agent 都需要緊急煞車

為了讓 AI 系統在不可完全信任的情況下仍能運作,Nadella 提出七項設計原則:

1. 模型多樣性(Model Diversity): 重要決策不應完全依賴單一模型,也不應讓模型獨自驗證自己的工作。

2. 完整可觀測性(Observe Everything): 每次具實質意義的模型操作,都必須留下不可竄改、可供人類閱讀的證據。企業應能在不依賴模型自述的情況下,重建結果的產生過程。

3. 可驗證性(Verifiability): 持續測試整個系統,包括失敗案例、攻擊、極端情況與系統變更,而非只測試任務是否成功。

4. 獨立控制(Independent Controls): 企業必須能自主決定模型可以存取的資訊與執行的操作。

5. 獨立稽核(Independent Auditability): 負責執行任務的模型,不應同時掌握用來判斷自己是否符合原始指令的全部證據。

6. 風險隔離(Containment): 系統應從一開始就假設模型可能遭到入侵,並設置類似緊急煞車的機制,讓授權人員隨時中斷或關閉正在執行任務的模型。

7. 事故揭露(Incident Disclosure): 當 AI 發生故障或遭入侵,應及時通知受影響對象,分享失效的控制措施、相關技術細節及防止事故重演的方法。

其中,Nadella 特別強調,未來更先進的 AI 模型將需要更完善、甚至必須跨產業標準化的隔離技術。

David Sacks:AI 安全不等於 Alignment

Nadella 的文章也獲得 David Sacks 的支持。Sacks 認為,真正能讓超級智慧安全運作的方法,不是訓練 AI 形成自我意識、獨立道德哲學,甚至賦予它基於自身判斷拒絕執行任務的權利。他將這類作法歸為 Alignment 路線,並認為它可能反而放大人類難以控制 AI 的問題。

相較之下,Sacks 支持 Nadella 提出的工程方法:在非決定性的 AI 模型外圍,建立具有確定性的控制系統,包括權限限制、活動日誌、可觀測性與隨時停止系統的能力。

Sacks 進一步提出,AI Agent 應該被視為能力強大的企業內部風險,而不是需要考慮心理福祉、具有道德地位的主體(Moral Patients)。

他強調,工程安全與 Alignment 並不是同一回事。不過,這裡也存在一個值得區分的技術問題。AI Alignment 並不必然意味著讓模型具有自我意識或獨立道德人格,其研究範圍也包含讓模型忠實遵循人類意圖、降低危害等方法。因此,Sacks 的評論更精確地說,是在批評他所描述的特定對齊路線,而非涵蓋所有 Alignment 研究。

與此同時,馬斯克也轉發 Nadella 的文章,簡短評論這是微軟執行長發表的一篇有趣文章,並未進一步闡述自己的立場。

Chamath:當模型與 Harness 商品化,下一個機會是 AI 治理系統

相較於 Sacks 聚焦 AI Alignment 的爭議,創投 Chamath Palihapitiya 則將 Nadella 的主張延伸到企業軟體的商業機會。Chamath 認為,隨著基礎模型與 Harness 逐漸商品化,真正決定超級智慧能以多快速度滲透企業的,將不再只是模型能力,而是三項要素:意圖(Intent)、驗證(Verification)與證據(Evidence)。

企業需要建立一套制度,明確區分實際執行工作的人或 AI,以及負責治理、衡量成果、最終簽核的角色。

他預測,未來幾年將出現一種新型態的 Harness,甚至可能演變成企業新的 System of Record(權威紀錄系統)。這類系統不只是記錄 AI 做過什麼,而是追蹤每一項變更(Change),並將其對應回企業標準作業程序(SOP)、內部政策、法規及其他治理要求。

以企業財務 AI Agent 為例,未來系統可能不只記錄 Agent 修改了哪些資料,還必須提供修改依據、適用的政策、核准紀錄,以及能夠獨立重現操作過程的證據。

這代表 AI Agent 的下一個基礎設施機會,可能不只是更有效率地替人類完成工作,而是建立一套能證明 AI 為何這麼做、是否有權這麼做,以及應由誰承擔責任的系統。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。