ElevenLabs lança modelo de voz Eleven v4 e variante Turbo de 150 ms
A ElevenLabs lançou seu modelo de voz Eleven v4 junto a uma versão Turbo de baixíssima latência, trazendo direcionamento emocional aprimorado, clonagem multilíngue expandida para mais de 90 idiomas e tempo de resposta de 150 milissegundos.

ElevenLabs estreia Eleven v4 e modelo Turbo em tempo real
A ElevenLabs, desenvolvedora de IA de voz, lançou oficialmente o Eleven v4, seu novo modelo topo de linha de conversão de texto em fala, projetado para seguir comandos de direcionamento com mais fidelidade e manter a consistência vocal em produções de áudio extensas. Junto com a versão padrão, a empresa apresentou o Eleven v4 Turbo, uma variante de menor latência desenvolvida para agentes de voz interativos, personagens de videogames e fluxos de atendimento ao cliente.
A atualização sucede o Eleven v3, lançado cerca de um ano antes. Embora o v3 tenha introduzido tags de roteirização para comportamentos de áudio como sussurros, risadas e efeitos sonoros, a ElevenLabs afirma que o v4 executa essas marcações de forma muito mais confiável, além de melhorar a consistência dos personagens em falas regeradas. Ambos os modelos já estão disponíveis no ElevenCreative, no ElevenAgents e na API da empresa.
Melhorias na arquitetura, controles de dublagem e ganhos em benchmarks
O Eleven v4 traz uma arquitetura reformulada, projetada para interpretar o contexto mais amplo, o tom e o ritmo de uma cena completa, em vez de sintetizar frases de forma isolada. Os usuários podem fornecer instruções por meio de tags embutidas ou frases em linguagem natural, contando com controles aprimorados de grafia fonética para ditar a pronúncia exata de nomes e termos técnicos. Em avaliações internas de pronúncia, o v4 alcançou 91,7%, superando a marca de 85,6% obtida pelo v3.
O modelo processa até 10.000 caracteres por solicitação — cerca de dez minutos de áudio falado —, permitindo que audiolivros e produções mais longas mantenham uma entonação consistente nas transições entre blocos. Em diálogos com múltiplos interlocutores, os personagens agora se adaptam dinamicamente ao contexto da conversa sem oscilações no timbre da voz.
O suporte a idiomas foi ampliado de aproximadamente 70 no v3 para mais de 90 no v4. O sistema permite que vozes clonadas falem línguas estrangeiras com sotaques nativos, evitando a perda de qualidade do sotaque em trechos mais longos. A ElevenLabs também restabeleceu o recurso Professional Voice Clones, indisponível no v3, ao lado da ferramenta Instant Voice Clone, que exige apenas dez segundos de áudio de amostra. Atores que licenciam suas vozes no marketplace da ElevenLabs — que já inclui nomes como Michael Caine — podem monetizar réplicas amplamente treinadas para dublagens globais em todos os idiomas suportados.
No ranking do Artificial Analysis Provider Voice Arena, o Eleven v4 atualmente lidera à frente do Cartesia Sonic 3.6 e do Gemini 3.8 Flash TTS, do Google. Em avaliações cegas conduzidas pela ElevenLabs, cerca de 75% dos ouvintes preferiram o v4 em relação a modelos da Cartesia, do Google e da Inworld, com o v4 sendo classificado como mais expressivo em 65% a 81% das comparações diretas, dependendo do sistema concorrente.
Latência do Turbo, estrutura de preços e processamento regional
Para lidar com o equilíbrio entre latência e expressividade em aplicações de tempo real, o Eleven v4 Turbo foi otimizado em conjunto com a plataforma ElevenAgents da empresa. Nos testes da ElevenLabs, o v4 Turbo entrega fala audível em 150 milissegundos. Em comparação, o Cartesia Sonic 3.6 atingiu 262 milissegundos, enquanto o GPT-4o mini TTS, da OpenAI, registrou 814 milissegundos.
O preço padrão da API está fixado em US$ 80 por milhão de caracteres para o Eleven v4 e US$ 40 por milhão de caracteres para o v4 Turbo. A ElevenLabs está oferecendo valores promocionais até 12 de outubro, reduzindo as tarifas para US$ 22 e US$ 11 por milhão de caracteres, respectivamente. Assinantes do plano Creator (de US$ 22 mensais) ou superior podem testar o v4 no ElevenCreative sem custo adicional por duas semanas, sujeito a um limite de duas vezes o pacote mensal de créditos. Para comparação de mercado, o Artificial Analysis lista o Cartesia Sonic 3.6 a US$ 49 por milhão de caracteres e o Gemini 3.8 Flash TTS a US$ 16,49 por milhão de caracteres.
Por padrão, os dados de áudio dos clientes são armazenados nos Estados Unidos. Clientes empresariais têm acesso a armazenamento isolado de dados na União Europeia, na Índia ou em Cingapura, embora algum processamento operacional ainda possa ocorrer externamente; clientes da UE podem exigir o processamento local da API ativando o modo de retenção zero de dados. O lançamento do v4 ocorre após a disponibilização, em meados de setembro, do Music 2.5 pela ElevenLabs, um modelo dedicado à geração de faixas musicais mais densas e naturais.



