Vitalik 實測 Qwen 3.8:筆電本地推論每秒 33 token

Elponcrab
分享
Vitalik 實測 Qwen 3.8:筆電本地推論每秒 33 token

以太坊共同創辦人 Vitalik Buterin 在自己的筆電上實測本地大型語言模型,並公布了一張十組測試的效能表:短上下文情境下輸出速度可達每秒 33 個 token。他表示 Qwen 3.8 flash 的表現「真的很不錯」,並認為已經很接近「大部分任務可以直接使用本地模型」的那個點。上下文拉長到約 10 萬 token 時,輸出降到每秒 18 至 21 個。

測試環境是搭載 AMD Strix Halo 平台的筆電,模型為 Qwen 3.8 flash,執行環境是開源推論框架 llama.cpp。他表示 llama.cpp 處理這個模型的效率一直在快速改善。

上下文拉到十萬,輸出速度掉三到四成

依他公布的表格,欄位依序為既有 prompt 長度、新增 prompt 長度、生成 token 數、輸入處理速度與輸出速度。十組測試明顯分成兩群:前六組的既有 prompt 在 2,136 至 7,799 token 之間,後四組則都在 10 萬 token 以上。

廣告 - 內文未完請往下捲動

既有 prompt 新增 prompt 生成 輸入(token/秒) 輸出(token/秒)
7,799 1,198 229 347.38 31.47
5,160 2,643 232 373.22 32.35
4,488 676 66 319.37 28.07
3,472 1,020 113 362.13 28.93
2,242 1,234 71 300.58 33.37
2,136 110 113 109.82 31.46
107,402 1,064 483 150.83 18.42
106,822 469 112 164.92 19.79
105,975 851 447 188.40 20.78
104,535 1,444 780 197.58 19.92

短上下文那一群的輸出速度落在每秒 28 至 33 個 token,輸入處理速度除一組外都在 300 至 373;長上下文那一群輸出降到 18 至 21,輸入降到 150 至 198。以輸出速度而言,上下文從數千 token 拉到十萬時,衰減幅度約三到四成。

每秒 30 個 token 大致是一般人閱讀速度的水準,20 個 token 則明顯偏慢但仍可用。表格中有一組的輸入處理速度只有 109.82,是十組裡最低的,該組既有 prompt 為 2,136 token、新增 prompt 僅 110 token。

他的用法:本地模型當調度層,提問不外流

Buterin 對這組數字給出的解讀分成兩層。第一層是日常:他認為已經很接近「大部分任務可以直接使用本地模型」的那個點。

第二層是隱私。他寫道,對於更進階的需求,「用你的本地模型去調度對強大模型的查詢,讓你的提問不會洩漏個人資訊」這類工作流程開始變得可行。也就是把本地模型放在使用者與雲端模型之間,由它決定哪些內容需要送出、哪些留在機器內。

這個方向與他近期的公開發言一致。他在 ETH Taipei 談隱私科技的普及障礙時就指出,隱私方案要被採用,關鍵不在技術本身而在導入成本。

量化精度與硬體規格未揭露,不宜跨機器比較

這則貼文沒有說明模型的量化精度、記憶體配置,也沒有給出 Strix Halo 的確切規格與功耗設定。這些變數都會直接影響推論速度,因此表中的數字適合當作同一台機器上不同上下文長度的相對比較,不宜直接與其他硬體的測試結果對照。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。