AI RACE— The AI Race
New Models

Google、テキストプロンプトで音声デザインが可能な「Gemini 3.8 Flash TTS」モデルを発表

Googleは、100以上の言語に対応し、テキストプロンプトや短い音声サンプルからカスタム音声を生成できる新たな音声生成モデル「Gemini 3.8 Flash TTS」および「Flash-Lite TTS」を発表した。

2026/09/24 00:39
Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

Google、「Gemini 3.8 Flash TTS」と「Flash-Lite TTS」を発表

Googleは、「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」のリリースにより、生成オーディオのポートフォリオを拡充した。これら2つのテキスト読み上げ(TTS)モデルは100以上の言語に対応し、行ごとのト書き(演技指示)を含む、発声ニュアンスのきめ細やかな制御機能を備えている。

Gemini 3.8 Flash TTSは、ビデオゲームのキャラクター台詞やポッドキャスト、オーディオブックといった表現力豊かなクリエイティブワークフロー向けに位置づけられており、開発者はテキストによる説明からまったく新しい合成音声を生成できる。Gemini 3.8 Flash-Lite TTSは、ローカライズの吹き替えや自動音声エージェント、大量のメディア制作など、スケーラビリティとコストパフォーマンスを重視した導入向けに調整されている。両モデルともGoogle AI StudioおよびGemini APIを通じて提供が開始されており、エンタープライズ向けのアクセスも追って提供される予定だ。

テキストによる音声設計、スクリプト制御、価格体系の詳細

Flash TTSでは、ピッチ(音高)、アクセント、トーン、キャラクターのペルソナといった声の属性をテキストプロンプトで直接指定できる機能が導入された。既存の選択肢を使いたいユーザーは、メキシコスペイン語、スコットランド英語、ケベックフランス語などの地域アクセントを網羅した2,000種類以上のプリセット音声カタログから選択可能だ。さらに、「Voice Remixing」と呼ばれる近日登場予定の機能では、音色やテンポ、ピッチを変更してライブラリの音声を微調整できるようになる。

音声の複製(ボイスクローニング)に向けて、Flash TTSには30秒の音声録音からカスタムプロファイルを構築するクローニングツールが含まれている。不正ななりすましを防止するため、システムは話者に対し明確な口頭同意声明の録音を義務付けており、その声は元サンプルの生体認証プロファイルと一致する必要がある。

両モデルとも、詳細な演技指導に対応している:

  • 台本に沿った発声(Scripted Delivery): プロンプトは物語の文脈指示を自動的に解釈するか、行ごとの明確なト書きを実行し、ポーズ(間)や、笑い声、ため息、「うーん(mhm)」といったためらいなどの非言語的な表現を挿入できる。
  • 複数話者による対話(Multi-Voice Dialogue): デュアルスピーカーモードにより、単一のスクリプト内で2つの異なる音声が交互に対話可能。Googleによると、長時間の生成セッションでも「話者のブレ(speaker drift)」を最小限に抑え、声の一貫性を維持できるという。
  • ツールの提供状況(Tool Availability): Flash TTSはGemini Notebookに統合されており、Flash-Lite TTSはGoogle Vids内で利用できる。また、LiveKit、Agora、Pipecat、Vercelをはじめとする複数の開発者プラットフォームがGemini API経由でのサポートを開始している。

GoogleのAPI料金体系はテキスト入力トークンと音声出力トークンに基づいて構成されており、音声生成は1秒あたり25トークン(1時間あたり9万トークン)として計測される。2026年末まで、両モデルのテキスト入力は100万トークンあたり0.50ドルで請求される。音声出力のコストは、Flash TTSが100万トークンあたり9.00ドル(生成音声1時間あたり約0.81ドル)、Flash-Lite TTSが100万トークンあたり6.00ドル(1時間あたり0.54ドル)となっている。2027年1月1日には料金が2倍に改定される予定で、テキスト入力は100万トークンあたり1.00ドル、音声出力はFlash TTSが100万トークンあたり18.00ドル(1時間あたり1.62ドル)、Flash-Lite TTSが100万トークンあたり12.00ドル(1時間あたり1.08ドル)に値上げされる。有料APIティアで送信されたデータは製品の学習対象から除外されるが、無料ティアのデータはGoogleによって利用される場合がある。

電子透かしの標準化と合成音声市場

合成音声を取り巻く安全性や出所の透明性に関する懸念に対処するため、新しいGemini TTSエンジンによって生成されたすべての音声には、Googleの知覚不可能な電子透かし「SynthID」が含まれており、後続プロセスで機械生成音声であることを検証できるよう設計されている。

Googleは、新世代のGemini 3.8 TTSラインナップが、Hume AIの策定したベンチマークにおける大半の評価カテゴリで首位を獲得したと主張している。今回のリリースにより、GoogleはElevenLabsやCartesiaといった音声合成の専門プロバイダーと直接競合することになり、リアルタイム対話エージェントやインタラクティブなゲームアセット、自動吹き替えパイプラインを構築する開発者をターゲットに見据えている。

関連記事