a16z:AI Agent 用量半年暴增 14 倍,前 10% 企業 Token 用量拉開 8 倍差距

Neo
分享
a16z:AI Agent 用量半年暴增 14 倍,前 10% 企業 Token 用量拉開 8 倍差距

創投機構 Andreessen Horowitz(a16z) 最新一期《Charts of the Week》指出 Agent 不僅快速增加,其 Token 消耗量已接近一般人類使用者的 5 倍,自今年 2 月以來 Agent 使用量更成長約 14 倍。

a16z 認為,這項變化背後還可能帶來另一個硬體層面的贏家:高頻寬記憶體(HBM)。

原因在於 Agent 的工作方式大量依賴 Cached Token(快取 Token),與一般使用者「一問一答」的聊天模式完全不同,可能進一步推升 AI 基礎設施對記憶體的需求。

廣告 - 內文未完請往下捲動

AI 使用開始兩極化,前 10% 企業 Token 用量拉開 8 倍差距

a16z 引述 OpenAI 數據指出,企業 AI 使用量雖然普遍增加,但成長並不平均。

自 2025 年 4 月以來,一般企業的 Output Token 大致增加一倍,但使用量排名前 10% 的企業已成長超過 17 倍。目前排名前 10% 與典型企業之間的 Token 輸出量差距約達 8 倍。

在資訊科技產業,差距甚至接近 12 倍,其中前 10% 企業的 Token 輸出量已是約一年前的 32.5 倍。

這也意味企業 AI 市場可能正從單純比較「有沒有使用 AI」,逐漸轉向比較「AI 已經深入工作流程到什麼程度」。

重度使用企業已不再只把 AI 當聊天機器人。a16z 指出,前 10% 企業的 Plug-in 採用程度約為典型企業的 2 倍,而 Skills 採用程度則達約 6 倍。

值得注意的是,近期進展最快的產業甚至不是科技業。若以 Codex 採用率衡量進階 AI 工具使用程度,法律產業自 2026 年 2 月以來的採用率暴增 108 倍。不過 a16z 也提醒,其中多少來自 Codex 本身擴大推出,目前仍難以區分。

Agent 才剛開始,Token 消耗已是人類近 5 倍

a16z 引述 OpenRouter 與 Peter Walker 整理的數據指出,目前真正部署完整 Agent 的 AI 使用者仍只占少數,但 Agent 已經消耗極為龐大的 Token。

目前 Agent 使用的 Token 接近人類使用者的 5 倍,而 Agent 使用量自今年 2 月以來更已增加約 14 倍。

這背後與 Agent 的運作模式有關。

一般人使用 ChatGPT、Claude 等 AI 工具時,通常採取「Prompt → Response」模式。

但 Agent 接收到任務後,需要持續讀取資訊、呼叫工具、寫入結果,再根據前一步輸出進行下一輪操作。

換句話說,一個人可能只送出一次指令,但 Agent 在完成任務之前,可能自行運作許多輪。

HBM 為何因此受惠?

OpenRouter 數據顯示,超過 85% 的 Agent Token 消耗來自 Cached Prompt,而近期 Agent Token 使用量增加,也幾乎都是由 Cached Token 所推動。

原因在於 Agent 開始執行任務時,需要先載入大量背景資訊,例如系統規則、程式碼規範、公司政策以及任務 Context。完成初始 Prefill 後,Agent 不必每一次推理都重新載入全部內容,而是持續利用已快取的 Context,再逐步讀寫新的資訊。

Cached Token 的成本通常比重新執行 Prefill 更低,因此有利於降低 Agent 長時間運作的推理成本;但另一面是,這種模式對記憶體資源的需求也更高。

a16z 因此將 Agent 的崛起與目前 HBM 的強勁需求連結起來:當大量 Agent 同時持續運作,而且不斷保存與重複使用 Context,AI 推理基礎設施除了需要 GPU 算力,也需要大量高頻寬記憶體支撐。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。