ElevenLabs、新音声モデル「Eleven v4」と150msの「Turbo」版をリリース
ElevenLabsは新音声モデル「Eleven v4」と超低遅延の「Turbo」版をリリースした。感情表現の指示追従性の向上、90言語に対応する多言語クローニングの拡張、そして150ミリ秒の応答速度を実現している。

ElevenLabs、新フラグシップ「Eleven v4」とリアルタイム向け「Turbo」モデルを発表
音声AI開発のElevenLabsは、新たなフラグシップText-to-Speech(TTS)モデル「Eleven v4」を正式にリリースした。演出指示(ディレクション)への追従性を高め、長尺の音声制作でも声の一貫性を維持できるように設計されている。通常版のリリースに加え、対話型音声エージェントやビデオゲームのキャラクター、カスタマーサービスのワークフロー向けに最適化された低遅延版「Eleven v4 Turbo」も発表された。
今回のアップデートは、約1年前に登場した「Eleven v3」をベースに構築されている。v3では囁き声、笑い声、効果音といった音声挙動を指定するスクリプトタグが導入されたが、ElevenLabsによると、v4ではこれらのタグをはるかに高精度に実行でき、リテイク(再生成)時におけるキャラクターの一貫性も向上しているという。両モデルは、ElevenCreative、ElevenAgents、および同社のAPIを通じて即日利用可能となっている。
アーキテクチャの強化、吹き替え制御、ベンチマークでの優位性
Eleven v4は、文章を個別に合成するのではなく、シーン全体の幅広いコンテキスト、トーン、ペーシング(話速・間隔)を解釈するよう設計された刷新版アーキテクチャを採用している。ユーザーはインラインタグや自然言語の文章を通じて指示を与えることができ、名前や専門用語の正確な発音を指定するための表音綴り(フォネティック)制御機能も強化された。社内の発音評価において、v4はv3の85.6%から向上し、91.7%のスコアを記録した。
本モデルは1回のリクエストで最大1万文字(音声で約10分間に相当)の処理が可能であり、オーディオブックや長編コンテンツにおいてセグメントの区切りをまたいでも一貫した語り口を維持できる。複数人による対話シーンでは、音色のブレ(timbre drift)を生じることなく、キャラクターが会話の文脈に動的に適応するようになった。
対応言語数はv3の約70言語から、v4では90言語以上に拡大した。このシステムにより、クローン音声は長尺の収録でもアクセントが劣化することなく、ネイティブのアクセントで外国語を発話できる。ElevenLabsは、v3では利用できなかった「Professional Voice Clones」機能を、10秒のサンプル音声で作成可能な「Instant Voice Clone」ツールとともに復活させた。Michael Caineなどの著名人が名を連ねるElevenLabsのマーケットプレイスを通じて音声をライセンス提供している俳優は、高度に訓練されたクローン音声を、対応するすべての言語でのグローバルな吹き替え向けに収益化できる。
Artificial Analysisの「Provider Voice Arena」リーダーボードにおいて、Eleven v4は現在、Cartesia Sonic 3.6やGoogleのGemini 3.8 Flash TTSを上回る順位につけている。ElevenLabsが実施したブラインド評価では、リスナーの約75%がCartesia、Google、Inworldのモデルよりもv4を選好し、直接比較において比較対象システムに応じて65%〜81%の割合でv4の方がより表現力豊かであると評価された。
Turboの低遅延性能、価格体系、リージョン別データ処理
リアルタイムアプリケーションにおける遅延と豊かな表現力のトレードオフを解消するため、Eleven v4 Turboは同社の「ElevenAgents」プラットフォームと並行して共同最適化された。ElevenLabsのテストによると、v4 Turboは150ミリ秒で聞き取り可能な音声を生成する。これに対し、Cartesia Sonic 3.6は262ミリ秒、OpenAIのGPT-4o mini TTSは814ミリ秒を記録している。
標準APIの価格は、Eleven v4が100万文字あたり80ドル、v4 Turboが100万文字あたり40ドルに設定されている。ElevenLabsは10月12日までプロモーション価格を適用しており、それぞれ100万文字あたり22ドル、11ドルへと値下げしている。月額22ドルのCreatorプラン以上の加入者は、ElevenCreative内で月間クレジット枠の2倍を上限として、2週間追加料金なしでv4をテストできる。市場の比較対象として、Artificial AnalysisによるとCartesia Sonic 3.6は100万文字あたり49ドル、Gemini 3.8 Flash TTSは100万文字あたり16.49ドルとなっている。
顧客の音声データはデフォルトで米国に保存される。エンタープライズ顧客は、欧州連合(EU)、インド、シンガポールにある隔離されたデータストレージを利用できるが、運用処理の一部は依然として外部で発生する場合がある。EUの顧客は、ゼロデータ保持(zero-data-retention)モードを有効にすることで、域内でのAPI処理を義務付けることが可能だ。今回のv4のリリースは、ElevenLabsが9月中旬にリリースした、より緻密で自然な楽曲生成に特化したモデル「Music 2.5」に続くものとなる。



