Qwen3.8-LiveTranslate 同步口譯延遲降到 2.3 秒

Elponcrab
分享
Qwen3.8-LiveTranslate 同步口譯延遲降到 2.3 秒

阿里巴巴 9 月 19 日發布新一代即時同步口譯模型 Qwen3.8-LiveTranslate。依 Qwen 團隊在官方帳號公布的說明,這個版本採用 Interleave 架構,在 60 種語言上把平均延遲從 2.8 秒降到 2.3 秒,同時在忠實度、流暢度與簡潔度上都有改善。

延遲從 2.8 秒降到 2.3 秒

同步口譯要處理的核心矛盾是等待與準確之間的取捨。模型聽得越久,掌握的語意越完整,譯得越準,但使用者也等得越久。官方採用的衡量指標是平均延遲(LAAL),也就是譯文相對於原文平均落後多少時間。

這一版把這個數字從 2.8 秒壓到 2.3 秒,差距約半秒。在口譯情境中,半秒是對話節奏會不會斷掉的差別。

廣告 - 內文未完請往下捲動

三項新能力都指向多人對話

官方列出的三項新功能,方向一致。第一是即時區分說話人,能在多人同時發言的場合分辨誰在講話,並透過更穩定的聲音複製,讓每位說話者的譯文保留各自音色。

第二是原文與譯文同步顯示,兩種語言同時出現在畫面上。第三是長脈絡消歧,模型會利用先前的對話內容來判斷人名與專業術語,讓同一個詞在整場對話中翻譯一致。

這三項要解決的都是單向逐句翻譯處理不了的狀況:會議有多個人講話、聽眾需要對照原文、同一個專有名詞在一場對話裡反覆出現。

走雲端服務,沒有開源權重

Qwen3.8-LiveTranslate 透過 QwenCloud 提供,官方公告中給的是部落格與雲端服務連結。鏈新聞查詢 Hugging Face,未見這個模型的權重上架,與 Qwen 系列部分版本開源的做法不同。

同屬 Qwen 3.8 系列的文字模型則可在本地執行,Vitalik 先前實測在筆電上的推論速度約每秒 33 個 token。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。