Google 推出 Gemini 3.8 文字轉語音模型,全面升級語音合成技術
Google 正式推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS,為其企業級人工智慧產品陣容帶來支援超過 100 種語言的可客製化語音生成功能。

Google 擴展 Gemini 3.8 產品線,推出專屬語音生成模型
Google 在 Gemini 3.8 架構下推出了一套全新的文字轉語音(TTS)工具,旨在為開發者、創作者與企業客戶完善並升級其合成音訊產品組合。該陣容於 9 月 23 日發布,主要包含兩款核心引擎:Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS。
Google 將其譽為迄今為止最先進的音訊生成模型,本次更新著重於提供保真度更高、更具表現力的語音。雖然底層能力是建立在成熟的業界技術之上而非顛覆性的重大突破,但它們為娛樂、行銷和軟體開發領域的使用者提供了直接整合至 Google 人工智慧生態系中的升級版第一方語音合成技術。
創意指導、多語言語音與企業整合
這次推出的語音生成任務分為兩個不同層級:
- Gemini 3.8 Flash TTS: 專為創意指導與角色設計打造,該模型允許使用者透過自然語言提示詞,從零開始設計全新的合成語音。它支援超過 100 種語言與方言的語音人設客製化、方言調整以及口音設定,鎖定遊戲、互動媒體、有聲書和 Podcast 等應用場景。
- Gemini 3.8 Flash-Lite TTS: 專為高效率與大量工作負載打造,Flash-Lite 主要針對音訊配音、一般數位內容製作以及對話式語音代理(Voice Agent)。
產業分析師強調,新模型的架構整合對企業而言是一項關鍵優勢。Futurum Group 分析師 Bradley Shimmin 指出,該模型針對長篇有聲書和短篇旁白對話等格式提供了精細的微調定向。Shimmin 補充說明,將語音功能直接整合至更廣泛的 Gemini 生態系中,有助於解決企業面臨的主要營運瓶頸——也就是技術堆疊的整合,而非單純的資料管理問題。
在競爭激烈的語音人工智慧市場中拓展版圖
Google 最新推進的語音技術,正切入一個已有 ElevenLabs 與 Baseten 等專門語音合成平台盤據的市場。語音人工智慧廠商 Modulate 執行長 Carter Huffman 指出,整個產業的大趨勢正從各自獨立的單一用途端點,轉向將多種多模態功能整合至同一架構下的全方位平台。
不過 Huffman 也強調,語音人工智慧目前仍處於早期發展階段。Google 若想與專注於語音領域的競爭對手形成真正的差異化,最終仍需推出超越現有市場標準的創新應用與獨特語音功能。



