ElevenLabs 推出 Eleven v4 語音模型與 150 毫秒極速 Turbo 版本
ElevenLabs 正式推出 Eleven v4 語音模型以及超低延遲的 Turbo 版本,提供更出色的情緒引導、支援超過 90 種語言的多語言聲音複製,並具備 150 毫秒的極速反應時間。

ElevenLabs 發表 Eleven v4 與即時 Turbo 模型
語音 AI 開發商 ElevenLabs 正式推出全新旗艦文字轉語音(TTS)模型 Eleven v4。該模型旨在更精確地遵循情緒引導提示,並在長篇音訊製作中維持聲音的一致性。除了標準版外,該公司還發表了更低延遲的 Eleven v4 Turbo,專為互動式語音代理(voice agent)、電玩遊戲角色及客服工作流程量身打造。
此更新以大約一年前推出的 Eleven v3 為基礎。儘管 v3 就已導入用於耳語、笑聲與音效等音訊表現的腳本標籤(scripting tags),但 ElevenLabs 表示,v4 執行這些標籤的可靠度大幅提升,同時強化了重新生成台詞時的角色一致性。目前這兩款模型皆已正式上線,使用者可透過 ElevenCreative、ElevenAgents 以及官方 API 直接存取。
架構升級、配音控制與基準測試表現躍升
Eleven v4 採用了經過改良的全新架構,能理解整場戲的整體上下文、語氣與節奏,而非孤立地合成單一語句。使用者可以透過行內標籤(inline tags)或自然語言句子給予指示,並搭配升級後的發音拼讀控制功能,精確指定姓名與專業術語的發音。在內部發音評測中,v4 取得了 91.7% 的準確率,優於 v3 的 85.6%。
該模型單次請求最高可處理達 10,000 個字元(約相當於 10 分鐘的語音音訊),讓有聲書和長篇製作在不同段落之間依然能維持一致的演繹水準。在多名說話者的對話場景中,角色現在也能動態適應對話情境,不會出現音色漂移的問題。
在語言支援方面,v4 從 v3 的約 70 種語言擴展至 90 多種語言。該系統使複製的聲音能以道地的母語口音說外語,並避免在長段錄音中出現口音劣化的現象。ElevenLabs 也重新推出了在 v3 中未提供的「專業聲音複製」(Professional Voice Clones)功能,同時保留了僅需 10 秒音訊樣本的「即時聲音複製」(Instant Voice Clone)工具。透過 ElevenLabs 市集授權聲音的演員(陣容已包含 Michael Caine 等知名人士),可利用經過深度訓練的數位聲音分身,在所有支援的語言中進行全球配音以獲取收益。
在評測平台 Artificial Analysis 的 Provider Voice Arena 排行榜上,Eleven v4 目前名列前茅,領先 Cartesia Sonic 3.6 以及 Google 的 Gemini 3.8 Flash TTS。而在 ElevenLabs 進行的盲測評估中,約有 75% 的聆聽者更偏好 v4,勝過 Cartesia、Google 與 Inworld 的模型;且在不同競品的正面對決中,v4 在 65% 至 81% 的對比評比中被評為表現力更為豐富。
Turbo 延遲表現、定價架構與區域資料處理
為了克服即時應用在延遲與豐富表現力之間的權衡取捨,Eleven v4 Turbo 與該公司的 ElevenAgents 平台進行了協同最佳化。在 ElevenLabs 的測試中,v4 Turbo 能在 150 毫秒內輸出可聽見的語音。相較之下,Cartesia Sonic 3.6 的反應時間為 262 毫秒,而 OpenAI 的 GPT-4o mini TTS 則為 814 毫秒。
標準 API 定價方面,Eleven v4 為每百萬字元 80 美元,v4 Turbo 則為每百萬字元 40 美元。ElevenLabs 正推出優惠促銷至 10 月 12 日止,價格分別調降至每百萬字元 22 美元與 11 美元。訂閱每月 22 美元 Creator 方案或更高階方案的用戶,可在兩週內於 ElevenCreative 免費測試 v4,上限為其每月額度的兩倍。作為市場對比,Artificial Analysis 列出 Cartesia Sonic 3.6 的價格為每百萬字元 49 美元,而 Gemini 3.8 Flash TTS 則為每百萬字元 16.49 美元。
在資料處理方面,客戶音訊資料預設儲存於美國。企業客戶可選擇將資料獨立儲存在歐盟、印度或新加坡,不過部分運作處理仍可能在外部進行;歐盟客戶則可藉由啟用「零資料保留」(zero-data-retention)模式,強制於境內執行 API 處理。在推出 v4 之前,ElevenLabs 甫於 9 月中旬發表了 Music 2.5,這是一款專門用於生成層次更豐富、更自然音樂曲目的模型。



