Google 推 Gemini 3.5 Transcribe:能轉逐字稿也能即時翻譯,支援 85+ 語言但沒繁體中文
Google 於 8 月 26 日正式推出 Gemini 3.5 Transcribe,定位為目前旗下最精準的語音轉文字(Speech-to-Text)模型。
不只追求逐字辨識,而是希望讓 AI 理解自然說話中的修正、停頓、專有名詞甚至多人對話,直接輸出經過整理的文字。
值得台灣使用者注意的是,Google 宣稱 Gemini 3.5 Transcribe 可自動辨識超過 85 種語言。
但從目前官方公布的支援清單來看,中文僅列出中國簡體普通話與香港繁體粵語,並沒有台灣繁體中文或台灣華語的獨立支援項目。
Gemini 3.5 Transcribe:不只逐字稿,還會自動「整理」你說的話
傳統 Speech-to-Text 最大的問題之一,是人類實際講話並不像文章。
例如說話者可能說:「我們禮拜二開會……不對,改禮拜三。」
Gemini 3.5 Transcribe 的 Smart Transcription 能理解這類自我修正,並自動移除「嗯」、「呃」等填充詞,同時整理標點與文字格式,而不是單純把每個聲音機械式轉成文字。
模型還支援 Custom Vocabulary,開發者最多可以提供 1,000 個自訂詞彙,讓模型更容易辨識產業術語、縮寫、人名與特殊拼法。
Google 表示,實務上通常在 100 個以內的自訂詞彙可以得到較好的效果。
即時 Voice Agent,延遲壓到一秒內
Gemini 3.5 Transcribe 分成兩種使用方式。
第一種是 gemini-3.5-transcribe-live,透過 Live API 提供雙向串流與亞秒級延遲(sub-second latency),主要瞄準 Voice Agent、即時字幕與語音操作等需要立即反應的應用。
另一種 gemini-3.5-transcribe 則針對已經錄製完成的音訊,可以處理會議錄音、客服通話與其他 Audio File,並支援 Speaker Diarization 與 Word-level Timestamp,也就是辨識「誰在什麼時間說了什麼」。
官方文件顯示,一般音訊檔單次最長可以處理 1 小時;若同時啟用 Speaker Diarization 或逐字時間戳記,則限制為 30 分鐘。
Live Streaming 單次 Session 則最長 10 分鐘。
Google:非串流模式平均 WER 僅 2.6%
在辨識準確度方面,Google 引用 Artificial Analysis 的測試結果指出,Gemini 3.5 Transcribe 在 Streaming 情境下平均 Word Error Rate(WER)為 4.0%,Non-streaming 更降低至 2.6%。
相較上一代語音轉錄模型 Chirp 3,Google表示,新模型除了辨識能力提升,在最終逐字稿產生時間(Time to Final Transcription)上也改善約 70%。
Google另外以 FLEURS Benchmark 測試多種主要語言與地區,Gemini 3.5 Transcribe 的 WER 分別達到 Streaming 5.50%、Non-streaming 5.04%。
風險提示
加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。



