字節跳動推 SeedRealtime 音視全雙工模型,豆包 App 上線

Elponcrab
分享
字節跳動推 SeedRealtime 音視全雙工模型,豆包 App 上線

即時多模態互動又往前一步。根據 TechNode 報導,字節跳動推出原生音視訊全雙工模型 SeedRealtime,能同時處理音訊、影像與文字串流,一邊看、一邊聽、一邊回應。這款模型已在字節跳動的豆包(Doubao)App 上線,從研究展示走向消費者產品,並被視為對標 OpenAI 的 GPT Live。

全雙工:不必等你說完就能開口回應

SeedRealtime 是原生的音視訊全雙工大型語言模型,能同時理解聲音、畫面與時間資訊,辨識互動對象與使用者意圖。所謂全雙工,指的是模型不必等使用者說完才回應,而是能在持續接收影音串流的同時開口,帶來接近真人對話的即時體驗。

從研究走向豆包 App

字節跳動已將 SeedRealtime 部署到旗下的豆包 App,讓一般使用者能舉起手機、開著鏡頭與它對話。這是字節跳動在即時多模態 AI 互動上的最新進展,也讓它在「看得到、聽得到、能對話」的語音助理賽道,與 OpenAI 等對手正面交鋒。

廣告 - 內文未完請往下捲動

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。