Google近日推出新一代語音轉文字模型「Gemini 3.5 Transcribe」,除了將語音轉換為文字,也進一步處理口語中的停頓、自我修正及重複內容,並自動整理標點、段落與格式,讓輸出的文字更接近可直接閱讀、使用的內容。相較於傳統語音輸入主要將使用者說出的內容轉成文字,Gemini 3.5 Transcribe更強調對語意與口語表達的理解。
Gemini 3.5 Transcribe的特色之一,是能在「智慧轉錄」模式下自動移除「嗯」、「啊」、「呃」等填充詞,並處理口吃、重複,以及說話者中途改口的情況。例如使用者先說「星期二」,隨後改口為「星期三」,模型可將最後文字整理為修正後的內容,而非完整保留原本的說話過程。模型也能自動加入標點符號、大小寫及段落,並將日期、時間、數字等資訊轉換成較容易閱讀的格式。
除了智慧轉錄,Gemini 3.5 Transcribe也提供「verbatim」忠實轉錄模式,可保留語助詞、重複內容、停頓及修正過程,讓使用者依照不同需求選擇。對於會議紀錄、口述內容等需要整理的情境,可使用智慧轉錄;若涉及採訪、研究訪談等需要保留原始說法的內容,則可使用忠實轉錄。
在辨識能力方面,Google表示模型可自動偵測超過85種語言,並處理不同口音、方言及對話中的語言切換;預錄音檔則可辨識最多3名說話者,並標示時間戳記。此外,使用者可加入最多1000個自訂詞彙,協助模型辨識人名、品牌及專業術語。

■ Google推出Gemini 3.5 Transcribe,進一步強化語音轉文字能力,從單純「聽打」延伸至口語內容整理。(截圖自/Gemini 3.5 Transcribe官網)
目前Gemini 3.5 Transcribe主要透過Gemini API,在Google AI Studio及Google Antigravity提供公開預覽,企業也可透過Gemini Enterprise Agent Platform使用;Google同時已將相關能力導入部分產品,包括Android版Gboard的Rambler功能,以及macOS版Gemini的「Speak to Window」語音輸入,Chrome整合則預計後續推出。台灣一般使用者目前尚未能在Gemini介面全面使用。
對使用者而言,Gemini 3.5 Transcribe的差異,在於將語音轉文字從單純的「聽打」進一步延伸至文字整理。對需要處理大量錄音、會議或口述內容的使用者來說,可減少後續整理逐字稿的工作;但不同功能目前仍有使用地區、語言及產品限制,未來Google如何擴大整合範圍,以及語音輸入能否進一步融入更多日常使用情境,仍值得持續觀察。