Vitalik 實測 Qwen 3.8:筆電本地推論每秒 33 token
以太坊共同創辦人 Vitalik Buterin 在自己的筆電上實測本地大型語言模型,並公布了一張十組測試的效能表:短上下文情境下輸出速度可達每秒 33 個 token。他表示 Qwen 3.8 flash 的表現「真的很不錯」,並認為已經很接近「大部分任務可以直接使用本地模型」的那個點。上下文拉長到約 10 萬 token 時,輸出降到每秒 18 至 21 個。
測試環境是搭載 AMD Strix Halo 平台的筆電,模型為 Qwen 3.8 flash,執行環境是開源推論框架 llama.cpp。他表示 llama.cpp 處理這個模型的效率一直在快速改善。
上下文拉到十萬,輸出速度掉三到四成
依他公布的表格,欄位依序為既有 prompt 長度、新增 prompt 長度、生成 token 數、輸入處理速度與輸出速度。十組測試明顯分成兩群:前六組的既有 prompt 在 2,136 至 7,799 token 之間,後四組則都在 10 萬 token 以上。
| 既有 prompt | 新增 prompt | 生成 | 輸入(token/秒) | 輸出(token/秒) |
|---|---|---|---|---|
| 7,799 | 1,198 | 229 | 347.38 | 31.47 |
| 5,160 | 2,643 | 232 | 373.22 | 32.35 |
| 4,488 | 676 | 66 | 319.37 | 28.07 |
| 3,472 | 1,020 | 113 | 362.13 | 28.93 |
| 2,242 | 1,234 | 71 | 300.58 | 33.37 |
| 2,136 | 110 | 113 | 109.82 | 31.46 |
| 107,402 | 1,064 | 483 | 150.83 | 18.42 |
| 106,822 | 469 | 112 | 164.92 | 19.79 |
| 105,975 | 851 | 447 | 188.40 | 20.78 |
| 104,535 | 1,444 | 780 | 197.58 | 19.92 |
短上下文那一群的輸出速度落在每秒 28 至 33 個 token,輸入處理速度除一組外都在 300 至 373;長上下文那一群輸出降到 18 至 21,輸入降到 150 至 198。以輸出速度而言,上下文從數千 token 拉到十萬時,衰減幅度約三到四成。
每秒 30 個 token 大致是一般人閱讀速度的水準,20 個 token 則明顯偏慢但仍可用。表格中有一組的輸入處理速度只有 109.82,是十組裡最低的,該組既有 prompt 為 2,136 token、新增 prompt 僅 110 token。
他的用法:本地模型當調度層,提問不外流
Buterin 對這組數字給出的解讀分成兩層。第一層是日常:他認為已經很接近「大部分任務可以直接使用本地模型」的那個點。
第二層是隱私。他寫道,對於更進階的需求,「用你的本地模型去調度對強大模型的查詢,讓你的提問不會洩漏個人資訊」這類工作流程開始變得可行。也就是把本地模型放在使用者與雲端模型之間,由它決定哪些內容需要送出、哪些留在機器內。
這個方向與他近期的公開發言一致。他在 ETH Taipei 談隱私科技的普及障礙時就指出,隱私方案要被採用,關鍵不在技術本身而在導入成本。
量化精度與硬體規格未揭露,不宜跨機器比較
這則貼文沒有說明模型的量化精度、記憶體配置,也沒有給出 Strix Halo 的確切規格與功耗設定。這些變數都會直接影響推論速度,因此表中的數字適合當作同一台機器上不同上下文長度的相對比較,不宜直接與其他硬體的測試結果對照。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。




