Google 推 Gemini 3.5 Transcribe:能轉逐字稿也能即時翻譯,支援 85+ 語言但沒繁體中文

Neo
分享
Google 推 Gemini 3.5 Transcribe:能轉逐字稿也能即時翻譯,支援 85+ 語言但沒繁體中文

Google 於 8 月 26 日正式推出 Gemini 3.5 Transcribe,定位為目前旗下最精準的語音轉文字(Speech-to-Text)模型。

不只追求逐字辨識,而是希望讓 AI 理解自然說話中的修正、停頓、專有名詞甚至多人對話,直接輸出經過整理的文字。

值得台灣使用者注意的是,Google 宣稱 Gemini 3.5 Transcribe 可自動辨識超過 85 種語言。

廣告 - 內文未完請往下捲動

但從目前官方公布的支援清單來看,中文僅列出中國簡體普通話與香港繁體粵語,並沒有台灣繁體中文或台灣華語的獨立支援項目。

Gemini 3.5 Transcribe:不只逐字稿,還會自動「整理」你說的話

傳統 Speech-to-Text 最大的問題之一,是人類實際講話並不像文章。

例如說話者可能說:「我們禮拜二開會……不對,改禮拜三。」

Gemini 3.5 Transcribe 的 Smart Transcription 能理解這類自我修正,並自動移除「嗯」、「呃」等填充詞,同時整理標點與文字格式,而不是單純把每個聲音機械式轉成文字。

模型還支援 Custom Vocabulary,開發者最多可以提供 1,000 個自訂詞彙,讓模型更容易辨識產業術語、縮寫、人名與特殊拼法。

Google 表示,實務上通常在 100 個以內的自訂詞彙可以得到較好的效果。

即時 Voice Agent,延遲壓到一秒內

Gemini 3.5 Transcribe 分成兩種使用方式。

第一種是 gemini-3.5-transcribe-live,透過 Live API 提供雙向串流與亞秒級延遲(sub-second latency),主要瞄準 Voice Agent、即時字幕與語音操作等需要立即反應的應用。

另一種 gemini-3.5-transcribe 則針對已經錄製完成的音訊,可以處理會議錄音、客服通話與其他 Audio File,並支援 Speaker Diarization 與 Word-level Timestamp,也就是辨識「誰在什麼時間說了什麼」。

官方文件顯示,一般音訊檔單次最長可以處理 1 小時;若同時啟用 Speaker Diarization 或逐字時間戳記,則限制為 30 分鐘。

Live Streaming 單次 Session 則最長 10 分鐘。

Google:非串流模式平均 WER 僅 2.6%

在辨識準確度方面,Google 引用 Artificial Analysis 的測試結果指出,Gemini 3.5 Transcribe 在 Streaming 情境下平均 Word Error Rate(WER)為 4.0%,Non-streaming 更降低至 2.6%。

相較上一代語音轉錄模型 Chirp 3,Google表示,新模型除了辨識能力提升,在最終逐字稿產生時間(Time to Final Transcription)上也改善約 70%。

Google另外以 FLEURS Benchmark 測試多種主要語言與地區,Gemini 3.5 Transcribe 的 WER 分別達到 Streaming 5.50%、Non-streaming 5.04%。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。