Google Gemini 3.5 Transcribe登場 語音轉文字WER達2.6%躋身前五,仍落後ElevenLabs

中華超傳媒 (文/ 記者 郭紋雅)

Aug 27, 2026 - 21:10
0 0
source Google Gemini 3.5 Transcribe登場 語音轉文字WER達2.6%躋身前五,仍落後ElevenLabs


(圖/ 中華超傳媒 AI圖片)

Google在美國推出Gemini 3.5 Transcribe,主打新一代AI語音轉文字能力,非串流版本詞錯率(WER)達2.6%,在Artificial Analysis評測中進入前段班,但仍落後ElevenLabs Scribe v2。這場AI語音轉錄競賽,也從「聽得準」進一步延伸到能否理解語意、整理口語與即時完成文字輸出。

Google Gemini 3.5 Transcribe登場,AI語音轉文字競爭進入下一階段


Google Gemini 3.5 Transcribe正式加入AI語音轉文字市場,Google強調這款模型不只追求辨識正確率,更希望將使用者自然說出的語音直接轉化成較完整、易閱讀的文字。根據Google公布的Artificial Analysis評測,Gemini 3.5 Transcribe非串流版本WER為2.6%,串流版本為4.0%;目前公開榜單顯示,非串流2.6%屬於前段水準,但並非市場第一。

這項更新的重要性,在於Google正在重新定義語音轉錄工具的競爭標準。過去語音辨識主要比的是「聽錯多少字」,現在Google則把自我修正、贅詞清除、自動排版、自訂專業詞彙及多語言辨識等能力納入產品核心。

換句話說,AI語音轉錄正在從單純的Speech-to-Text,逐漸走向「理解語音內容後直接產出可使用文字」。

不只把聲音變成文字 Gemini 3.5 Transcribe開始理解「你真正想說什麼」


Gemini 3.5 Transcribe最大的產品差異之一,是Google加入所謂的Smart transcription。傳統語音轉文字工具通常盡可能保留原始語音內容,但Gemini 3.5 Transcribe會進一步處理說話者在對話中的修正。例如使用者先說「星期二開會」,隨後馬上改口為「不,是星期三」,模型可以將最終結果整理成正確日期,而不是把兩段內容全部照錄。Google同時讓模型自動刪除「嗯」、「啊」等口語填充詞,並對文字進行格式整理。

這項設計讓AI轉錄的用途從逐字稿進一步延伸到會議紀錄、語音輸入、客服紀錄及工作流程自動化。不過,這也代表「最準確」的定義開始變得複雜。

如果使用者需要法律訪談、醫療紀錄、研究訪問或字幕等必須完整保留原話的內容,自動修正與刪除口頭禪未必是優勢;相反地,若目的是快速取得可閱讀的會議紀錄或語音筆記,這類處理反而能節省後續人工整理時間。因此,Gemini 3.5 Transcribe的核心競爭力未必只是WER數字,而是從辨識到整理之間多做了一層AI處理。

WER 2.6%很亮眼,但為何還沒有擊敗ElevenLabs?


Google公布的Artificial Analysis數據顯示,Gemini 3.5 Transcribe非串流版本WER為2.6%,串流版本則為4.0%;WER越低代表錯誤越少。Google也表示,相較前一代Chirp 3,最終轉錄結果的延遲改善約70%。

但如果把數據放進Artificial Analysis公開的非串流排行榜比較,Gemini 3.5 Transcribe的2.6%並不是第一名。ElevenLabs Scribe v2目前為2.2%,Microsoft MAI-Transcribe-1.5為2.4%,因此Gemini的成績雖然相當突出,卻還沒有突破市場最高水準。

這也讓「Google最強語音模型」與「全球最準語音模型」必須區分開來。Google官方定位是Gemini 3.5 Transcribe為自身目前最精準的語音轉文字模型,而公開第三方榜單則顯示,它在整體市場仍處於追趕位置。不同評測資料的測試條件也不完全相同,因此不能單純拿不同模式、不同資料集的WER直接判定誰全面勝出。

兩種模型路線:即時串流與錄音轉錄各有戰場


Gemini 3.5 Transcribe並不是只有一個使用情境,而是分成兩套API。第一種是Gemini 3.5 Transcribe Live,主要服務即時、雙向串流的語音應用;另一種則是處理錄音檔案的Gemini 3.5 Transcribe,可用於會議、電話紀錄等預錄音訊。Google目前透過Gemini API提供開發者使用。

Google資料顯示,模型支援超過85種語言並可自動辨識語言,也支援自訂詞彙;預錄音訊版本則提供時間戳與說話者辨識等功能。這代表Google不是單純推出一款「錄音轉文字工具」,而是在布局更完整的語音AI基礎服務。

對企業而言,這類API可以被嵌入客服中心、會議系統、語音助理、內容整理及其他AI Agent工作流程,語音本身也因此成為AI應用的重要輸入介面。

價格也成為AI語音市場的新戰場


除了準確率,成本也是企業採用語音模型時的重要考量。Google目前公開的Gemini API價格資料顯示,Gemini 3.5 Transcribe預錄音訊的估算價格約為每分鐘0.005美元,即每1000分鐘約5美元;Gemini 3.5 Transcribe Live的混合估算價格約為每分鐘0.009美元。

Artificial Analysis目前列出的ElevenLabs Scribe v2價格約為每1000分鐘3.67美元,WER則為2.2%。因此,Google目前面對的並不是單純的技術競賽,而是準確率、速度、價格與功能整合的綜合競爭。

對開發者來說,真正需要比較的可能不是「誰的WER最低」,而是相同成本下能否完成更多工作,例如自動整理會議內容、辨識專有名詞、處理多語言對話,以及直接將語音輸入串接到其他AI功能。

從Android到Mac Google正把語音轉錄嵌入既有產品


Gemini 3.5 Transcribe並非只存在於開發者API。Google表示,這套模型已經支援Android上的Rambler語音輸入功能,以及macOS版Gemini應用程式;未來也將進一步整合Chrome等產品與服務。

這項布局具有另一層意義。如果語音辨識只是獨立工具,使用者必須特別開啟轉錄程式;但當模型直接進入鍵盤、瀏覽器與AI助理,語音就可能變成一般文字輸入以外的另一種預設操作方式。

Google官方也指出,Gemini 3.5 Transcribe可以處理自然語音中的自我修正與格式需求,讓使用者更接近「直接說出想寫的內容」,而不是先說話、再人工整理逐字稿。

AI語音轉錄的下一場競爭,不只是「誰最準」


Gemini 3.5 Transcribe的推出,反映AI語音市場正在出現明顯變化。第一階段的語音辨識競爭,核心是降低錯字率;第二階段則開始追求即時性與多語言能力;如今Google加入語意修正、格式整理與自訂詞彙後,競爭焦點進一步轉向**「AI能不能直接交付一份可使用的結果」**。

這也解釋了為何WER不能成為唯一指標。同樣是2.6%或2.2%的錯誤率,實際使用時可能還涉及專有名詞、數字、姓名、多人對話、背景噪音、時間戳、說話者辨識與語言切換等問題。

Google目前已提供超過85種語言的自動偵測與轉錄能力,但不同語言、口音與使用場景的實際效果,仍需要更多第三方與實際應用測試。因此,Gemini 3.5 Transcribe真正值得觀察的,不是能否立刻擊敗ElevenLabs,而是Google能否利用Gemini生態系優勢,把語音辨識、文字整理與AI Agent能力串成完整工作流程。

Google vs. ElevenLabs:這場語音AI戰爭才剛開始


目前公開資料顯示,Gemini 3.5 Transcribe在Artificial Analysis非串流WER評測中以2.6%進入前段班,但ElevenLabs Scribe v2仍以2.2%領先。

然而,單純比較數字可能低估Google真正的競爭策略。Google擁有Gemini、Android、Chrome、Gboard與Google AI工具等龐大產品生態系,如果能把高品質語音辨識直接放進既有服務,使用者甚至不需要知道背後使用的是哪一個模型。

這將使AI語音市場從「模型排行榜」進一步轉向「生態系競爭」。目前無進一步公開資訊可證明Gemini 3.5 Transcribe已全面超越ElevenLabs Scribe v2;就目前可驗證的公開評測來看,Google的新模型已進入第一梯隊,但仍處於與ElevenLabs、Microsoft及其他語音AI業者競逐的階段。

MGBOX NEWS

中華超傳媒

(文/ 記者 郭紋雅)

What's Your Reaction?

Like Like 0
Dislike Dislike 0
Love Love 0
Funny Funny 0
Wow Wow 0
Sad Sad 0
Angry Angry 0

Comments (0)

User