智譜 GLM-5.3 自己優化推論系統,吞吐 3.2 倍但唐杰不稱 RSI

Elponcrab
分享
智譜 GLM-5.3 自己優化推論系統,吞吐 3.2 倍但唐杰不稱 RSI

智譜(Z.ai)9 月 17 日公布一件事:替 GLM-5.3-Flash 提供服務的推論系統,大部分是由 GLM-5.3 驅動的代理自己蓋出來並優化的。從模型第一次在國產加速器上跑起來,到承接全部生產流量,花了兩週,端到端吞吐量是初始基線的 3.2 倍。

創辦人唐杰在貼文中把界線劃得很清楚:「我們距離遞迴自我改進還很遠。但最小的迴圈現在存在了。」中文圈部分報導以「RSI 首個成果」為題,當事人自己的說法保守得多。

卡住代理的不是寫不出程式,是不知道為什麼變慢

唐杰說,這次最重要的發現不是任何一項優化。代理卡關的時候,很少是因為寫不出程式碼,而是因為它不知道事情為什麼變糟。

廣告 - 內文未完請往下捲動

他的比喻是:「吞吐量下降 20%」這句話只告訴你有東西壞了,沒告訴你是哪一層、哪個假設、下一步該測什麼。用強化學習的語彙來說,這是回饋稀疏加上功勞歸屬的問題;而跑一次端到端測試要好幾個小時,探索就更慢。

資深工程師靠的是腦中一套隱性的判斷流程,知道什麼時候該看時間軸、什麼時候該跑微基準測試、該比對哪一層的輸出。智譜的做法是把這套流程外顯出來。

他們把這套做法叫 dense feedback,分成三層

依唐杰的說明,dense feedback 是代理可以直接呼叫的分層驗證介面,分成三種訊號:正確性回饋(算得對不對)、系統行為回饋(時間花在哪裡)、效能回饋(哪個選項在什麼條件下勝出)。每種訊號都必須是局部的、便宜的、能客觀驗證的。

環境本身也不寬鬆。記憶體與互連頻寬有限、要處理 100 萬 token 的上下文與多模態請求,軟體堆疊還不成熟,核心程式缺漏、文件常常靠猜。每項優化都是取捨:用算力換記憶體、用通訊換記憶體、用精度換容量,以及把編碼、預填充與解碼拆開換取排程自由度。

代理找到的三個問題,其中一個已經合併進上游

唐杰列出代理找到的三件事。

第一是 KDA 的上下文平行路徑出現精度漂移,且隨序列長度變大,成因是 TF32 的捨入誤差在連鎖的狀態矩陣合併中累積。這個修正已經合併進開源專案 Flash Linear Attention 的 PR #1180

第二是 KV 傳輸始終沒有與 DeepEP 的分派重疊。代理追著呼叫鏈跨過 Python 與 C++ 的邊界,發現節點內路徑從未釋放 GIL。修好之後,傳輸額外開銷從超過 30% 降到 1% 以內。

第三是一個解碼核心因為分塊方式,把同一個正規化重算了四次。代理重構之後拿到 1.71 倍加速。唐杰說這個想法來自代理讀過 SGLang、FLA 與 DeepGEMM 既有核心後,自己歸納出的「優化骨架」。

人做了什麼,唐杰講得很明白

唐杰在貼文中主動標出邊界:目標仍由人定義、回饋環境由人建立、每一項高風險變更都由人審查。

他接著寫,工程師的角色正在改變,「從解決問題的人,變成設計回饋的人」。他也指出一個延伸的意涵:一個建立在真實基礎設施任務上、分層且可驗證的回饋環境,正是訓練下一代模型最需要的東西,代理完成的每個任務都可能成為下一代模型的訓練素材。

官方部落格的完整說明另有技術細節。要留意的是,上述效能數字目前都來自智譜自己的說明,沒有第三方獨立驗證;可外部查核的部分是那筆已經合併進 Flash Linear Attention 的修正。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。