DeepSeek 開源昇騰基礎元件,API 與輝達平台版本對齊

Elponcrab
分享
DeepSeek 開源昇騰基礎元件,API 與輝達平台版本對齊

DeepSeek 9 月 30 日在 GitHub 開源一批專為華為昇騰平台打造的基礎設施元件,涵蓋運算函式庫與分散式通訊函式庫,並宣稱與先前為輝達 GPU 平台開源的元件一一對應。其中 DeepGEMM Ascend 的說明文件寫明,首個版本於 9 月 30 日釋出、支援昇騰 950 系列。

API 與輝達版本對齊,開發流程不必重寫

DeepGEMM Ascend 的說明文件指出,這套矩陣乘法函式庫完全相容原本 DeepGEMM 的 API,支援 BF16、FP8、FP4 等格式,使用者安裝後可以沿用其他平台上的 API 與開發流程。文件也說明,這套實作替昇騰的矩陣乘加原語做了一層輕量抽象,把分形矩陣布局、對齊限制、位址計算等細節包起來。

另一套 DeepEP-Ascend 是訓練與推論用的通訊函式庫,提供混合專家模型(MoE)所需的專家並行通訊操作。文件寫明,它對外的 buffer API 與輝達版的 DeepEP 對齊。

廣告 - 內文未完請往下捲動

根據量子位報導,這次開源的還包括 TileLang 編譯工具、FlashMLA、TileKernel、DeepSelect 等元件。

實測頻寬在小規模下接近硬體上限,大規模仍在調校

DeepEP-Ascend 的說明文件附上實測數據,測試環境是昇騰 950DT 與 CANN 9.2.0。在 8 個專家並行單位的配置下,dispatch 頻寬為每秒 373 至 375 GB、combine 為每秒 345 至 347 GB;隨著規模放大到 128 個單位,dispatch 降到每秒 313 至 320 GB、combine 降到每秒 272 至 278 GB。

文件說明,在 32 個單位以內,持續 dispatch 的頻寬約達實體負載頻寬上限的 90% 至 95%;更大規模與 combine 仍在最佳化,combine 另有本地歸約的額外開銷。文件也註明,這些數據是在人工設定的概念驗證韌體環境下取得,其他昇騰世代或 CANN 版本的支援程度未經這批測試證實。

華為方面,量子位報導引述的說明指出,華為提供了與 DeepSeek 共同定義的昇騰超節點 SuperPoD Flex 與 UBL128 組網方案,可做到 128 張卡、單層交換每秒 3.2 Tb 的網路規模。

華為把部署做法開源,建議韌體預計 10 月中才公開

量子位報導指出,華為把這次合作的成果放上 CANN 社群開源,內容包括低延遲推論部署、單卡與單機部署、大規模訓練等做法。報導引述的數據顯示,在 32 個專家並行單位的離線推論模式下,DeepSeek-V4.1-Flash 純模型在每個輸出 token 延遲 5 毫秒時,每張卡的輸出吞吐量為每秒 2,469 個 token。該數據註明是離線推論模式採集,不含服務排程與框架負載平衡的影響。

DeepEP-Ascend 的說明文件則提到,要達到完整頻寬需要華為針對 Atlas 850E 的第三季商用韌體版本,該版本預計 2026 年 10 月中旬、約 10 月 15 日前後公開,實際時程仍以華為的發布安排為準。

中國實驗室的算力選項近期仍在變動,鏈新聞先前報導過 The Information 指中國擬放行字節跳動、阿里巴巴採購輝達新晶片。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。