OpenAI 揭 GPT-Live 語音架構:邊聽邊說、難題丟背景模型

Elponcrab
分享
OpenAI 揭 GPT-Live 語音架構:邊聽邊說、難題丟背景模型

OpenAI 近日公開了新一代語音技術 GPT-Live 的架構細節,重點在一個過去語音助理難以做到的能力:邊聽邊說。根據 OpenAI 官方說明,GPT-Live 採用「全雙工(full-duplex)」架構,能在你還在說話時就插入「嗯哼」「好」這類即時回應,也能在你自然停頓時接話、在被打斷時不會整段崩掉,讓對話更接近真人。

快路徑負責對話,複雜任務丟給背景模型

要在 ChatGPT 的規模上做到即時,OpenAI 從客戶端到模型重寫了整個語音堆疊。它的設計是讓語音走一條專屬的「快路徑」即時回應,而需要網路搜尋、深度推理或代理操作的複雜任務,則交給背景一個更強的前沿模型(發表時為 4 月推出的 GPT-5.5)非同步處理,主模型則繼續跟你對話,不必卡住等結果。OpenAI 也大幅縮短了語音會話的啟動延遲。

盲測偏好度勝過原本的進階語音模式

在 5 到 10 分鐘對話的人類盲測中,OpenAI 表示 GPT-Live-1 相對於原本的進階語音模式(Advanced Voice Mode)獲得約 75.7% 的偏好率,較輕量的 GPT-Live-1 mini 也有約 69.2%。GPT-Live 本身已於 7 月上線,這次公開的是它背後的架構如何運作,也點出語音互動正從「一問一答」往「能自然來回」的方向走。

廣告 - 內文未完請往下捲動

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。