AI RACE— 每日追蹤 AI 競爭賽局
New Models

Google 推出 Gemini 3.8 Flash TTS 模型,支援文字提示詞設計語音

Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言,創作者可透過文字提示詞或簡短音訊樣本生成客製化聲音。

2026/09/24 00:39
Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

Google 發表 Gemini 3.8 Flash TTS 與 Flash-Lite TTS

Google 發布 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,進一步拓展其生成式音訊產品陣容。這兩款文字轉語音(TTS)模型支援超過 100 種語言,並引入精細的發音控制功能,包括逐行的舞台表演指示。

Gemini 3.8 Flash TTS 主打富有表現力的創意工作流程,例如電玩角色對話、Podcast 與有聲書,讓開發者能直接根據文字描述生成全新的合成語音。Gemini 3.8 Flash-Lite TTS 則專為具備成本效益且利於規模化部署的場景打造,包含在地化配音、自動化語音代理以及大規模媒體製作。兩款模型現已透過 Google AI Studio 與 Gemini API 陸續推出,企業端權限預計隨後跟進。

文字轉語音設計、劇本控制與計費機制解析

Flash TTS 帶來直接透過文字提示詞描述聲音特徵的能力,包含音高、口音、語氣與角色人設。偏好既有選項的用戶,則可從涵蓋墨西哥西班牙語、蘇格蘭英語與魁北克法語等地區口音的 2,000 多種預設聲音資料庫中進行挑選。名為「Voice Remixing」的即將推出功能,還將允許創作者藉由調整音色、節奏與音高來微調資料庫中的既有聲音。

在聲音複製方面,Flash TTS 內建語音複製工具,僅需 30 秒的音訊錄音即可建立自訂聲音模型。為防止未經授權的冒用,系統要求說話者錄製明確的口頭同意聲明,且該聲明必須與來源樣本的生物辨識特徵相符。

兩款模型皆支援細緻的表演指示:

  • 劇本化演繹: 提示詞可自動解析敘事線索,或執行明確的逐行表演指示,插入停頓以及笑聲、嘆氣或「嗯哼」等非語言線索。
  • 多角色對話: 雙人對話模式可在單一劇本中交替呈現兩種不同的聲音。Google 表示,該模型能在長時間生成過程中維持聲音的一致性,將「發音者飄移」降至最低。
  • 工具支援度: Flash TTS 已整合至 Gemini Notebook,Flash-Lite TTS 則可在 Google Vids 中使用。包括 LiveKit、Agora、Pipecat 與 Vercel 在內的多個開發者平台,也已透過 Gemini API 推出相關支援。

Google 的 API 定價結構以文字輸入 token 與音訊輸出 token 為基準,音訊生成速度以每秒 25 個 token(即每小時 90,000 個 token)計算。截至 2026 年底前,兩款模型的文字輸入費用皆為每百萬 token 0.50 美元;音訊輸出方面,Flash TTS 為每百萬 token 9.00 美元(生成一小時語音約 0.81 美元),Flash-Lite TTS 則為每百萬 token 6.00 美元(每小時約 0.54 美元)。自 2027 年 1 月 1 日起,費率預計調漲一倍,文字輸入為每百萬 token 1.00 美元;音訊輸出部分,Flash TTS 調漲至每百萬 token 18.00 美元(每小時 1.62 美元),Flash-Lite TTS 則為每百萬 token 12.00 美元(每小時 1.08 美元)。透過付費 API 方案提交的資料不會用於產品訓練,但免費方案的資料則可能被 Google 使用。

浮水印標準與合成語音市場布局

為了解決合成語音的安全與來源真實性疑慮,新款 Gemini TTS 引擎生成的所有音訊均包含 Google 人耳無法察覺的 SynthID 浮水印,旨在便於後續驗證是否為機器生成的音訊。

Google 宣稱,在 Hume AI 建立的評測基準中,全新 Gemini 3.8 TTS 系列在多數評估項目均處於領先地位。此次發表讓 Google 直接迎戰 ElevenLabs 與 Cartesia 等專業語音合成業者,鎖定打造即時對話代理、互動遊戲資源以及自動化配音工作流程的開發者族群。

◗ 參考來源

The Decoder09/24

相關文章