AI RACE— 每日追蹤 AI 競爭賽局
New Models

ElevenLabs 推出 Eleven v4 語音模型與 150 毫秒極速 Turbo 版本

ElevenLabs 正式推出 Eleven v4 語音模型以及超低延遲的 Turbo 版本,提供更出色的情緒引導、支援超過 90 種語言的多語言聲音複製,並具備 150 毫秒的極速反應時間。

2026/09/29 21:45
New Models

ElevenLabs 發表 Eleven v4 與即時 Turbo 模型

語音 AI 開發商 ElevenLabs 正式推出全新旗艦文字轉語音(TTS)模型 Eleven v4。該模型旨在更精確地遵循情緒引導提示,並在長篇音訊製作中維持聲音的一致性。除了標準版外,該公司還發表了更低延遲的 Eleven v4 Turbo,專為互動式語音代理(voice agent)、電玩遊戲角色及客服工作流程量身打造。

此更新以大約一年前推出的 Eleven v3 為基礎。儘管 v3 就已導入用於耳語、笑聲與音效等音訊表現的腳本標籤(scripting tags),但 ElevenLabs 表示,v4 執行這些標籤的可靠度大幅提升,同時強化了重新生成台詞時的角色一致性。目前這兩款模型皆已正式上線,使用者可透過 ElevenCreative、ElevenAgents 以及官方 API 直接存取。

架構升級、配音控制與基準測試表現躍升

Eleven v4 採用了經過改良的全新架構,能理解整場戲的整體上下文、語氣與節奏,而非孤立地合成單一語句。使用者可以透過行內標籤(inline tags)或自然語言句子給予指示,並搭配升級後的發音拼讀控制功能,精確指定姓名與專業術語的發音。在內部發音評測中,v4 取得了 91.7% 的準確率,優於 v3 的 85.6%。

該模型單次請求最高可處理達 10,000 個字元(約相當於 10 分鐘的語音音訊),讓有聲書和長篇製作在不同段落之間依然能維持一致的演繹水準。在多名說話者的對話場景中,角色現在也能動態適應對話情境,不會出現音色漂移的問題。

在語言支援方面,v4 從 v3 的約 70 種語言擴展至 90 多種語言。該系統使複製的聲音能以道地的母語口音說外語,並避免在長段錄音中出現口音劣化的現象。ElevenLabs 也重新推出了在 v3 中未提供的「專業聲音複製」(Professional Voice Clones)功能,同時保留了僅需 10 秒音訊樣本的「即時聲音複製」(Instant Voice Clone)工具。透過 ElevenLabs 市集授權聲音的演員(陣容已包含 Michael Caine 等知名人士),可利用經過深度訓練的數位聲音分身,在所有支援的語言中進行全球配音以獲取收益。

在評測平台 Artificial Analysis 的 Provider Voice Arena 排行榜上,Eleven v4 目前名列前茅,領先 Cartesia Sonic 3.6 以及 Google 的 Gemini 3.8 Flash TTS。而在 ElevenLabs 進行的盲測評估中,約有 75% 的聆聽者更偏好 v4,勝過 Cartesia、Google 與 Inworld 的模型;且在不同競品的正面對決中,v4 在 65% 至 81% 的對比評比中被評為表現力更為豐富。

Turbo 延遲表現、定價架構與區域資料處理

為了克服即時應用在延遲與豐富表現力之間的權衡取捨,Eleven v4 Turbo 與該公司的 ElevenAgents 平台進行了協同最佳化。在 ElevenLabs 的測試中,v4 Turbo 能在 150 毫秒內輸出可聽見的語音。相較之下,Cartesia Sonic 3.6 的反應時間為 262 毫秒,而 OpenAI 的 GPT-4o mini TTS 則為 814 毫秒。

標準 API 定價方面,Eleven v4 為每百萬字元 80 美元,v4 Turbo 則為每百萬字元 40 美元。ElevenLabs 正推出優惠促銷至 10 月 12 日止,價格分別調降至每百萬字元 22 美元與 11 美元。訂閱每月 22 美元 Creator 方案或更高階方案的用戶,可在兩週內於 ElevenCreative 免費測試 v4,上限為其每月額度的兩倍。作為市場對比,Artificial Analysis 列出 Cartesia Sonic 3.6 的價格為每百萬字元 49 美元,而 Gemini 3.8 Flash TTS 則為每百萬字元 16.49 美元。

在資料處理方面,客戶音訊資料預設儲存於美國。企業客戶可選擇將資料獨立儲存在歐盟、印度或新加坡,不過部分運作處理仍可能在外部進行;歐盟客戶則可藉由啟用「零資料保留」(zero-data-retention)模式,強制於境內執行 API 處理。在推出 v4 之前,ElevenLabs 甫於 9 月中旬發表了 Music 2.5,這是一款專門用於生成層次更豐富、更自然音樂曲目的模型。

◗ 參考來源

The Decoder09/29

相關文章