ElevenLabs lanza el modelo de voz Eleven v4 y una variante Turbo de 150 ms
ElevenLabs ha presentado su modelo de voz Eleven v4 junto con una versión Turbo de ultrabaja latencia, ofreciendo mejor dirección emocional, clonación multilingüe en 90 idiomas y tiempos de respuesta de 150 milisegundos.

ElevenLabs presenta Eleven v4 y su modelo Turbo en tiempo real
El desarrollador de IA de voz ElevenLabs ha lanzado oficialmente Eleven v4, un nuevo modelo insignia de texto a voz diseñado para seguir indicaciones de dirección con mayor fidelidad y mantener la consistencia vocal en producciones de audio extensas. Junto con la versión estándar, la compañía presentó Eleven v4 Turbo, una variante de menor latencia adaptada para agentes de voz interactivos, personajes de videojuegos y flujos de trabajo de atención al cliente.
La actualización se basa en Eleven v3, que debutó aproximadamente un año antes. Aunque v3 introdujo etiquetas de guion para comportamientos de audio como susurros, risas y efectos de sonido, ElevenLabs asegura que v4 ejecuta estas etiquetas de manera mucho más confiable, al tiempo que mejora la consistencia del personaje en las líneas regeneradas. Ambos modelos están disponibles de inmediato a través de ElevenCreative, ElevenAgents y la API de la compañía.
Mejoras de arquitectura, controles de doblaje y avances en benchmarks
Eleven v4 cuenta con una arquitectura rediseñada para interpretar el contexto general, el tono y el ritmo de una escena completa en lugar de sintetizar oraciones de manera aislada. Los usuarios pueden incluir instrucciones mediante etiquetas integradas o frases en lenguaje natural, con controles de ortografía fonética mejorados para dictar la pronunciación exacta de nombres y términos técnicos. En evaluaciones internas de pronunciación, v4 obtuvo un puntaje del 91,7 por ciento, superando la marca del 85,6 por ciento alcanzada por v3.
El modelo procesa hasta 10.000 caracteres por solicitud —aproximadamente diez minutos de audio hablado—, lo que permite que audiolibros y producciones extensas mantengan una interpretación consistente a través de los distintos segmentos. En diálogos con múltiples interlocutores, los personajes ahora se adaptan dinámicamente al contexto conversacional sin sufrir variaciones en el timbre.
La cobertura lingüística se ha ampliado de aproximadamente 70 idiomas en v3 a más de 90 en v4. El sistema permite que las voces clonadas hablen lenguas extranjeras con acentos nativos, evitando al mismo tiempo el deterioro del acento en tomas prolongadas. ElevenLabs también ha restablecido su función Professional Voice Clones, que no estaba disponible en v3, junto con su herramienta Instant Voice Clone, que requiere diez segundos de muestra de audio. Los actores que licencian sus voces a través del marketplace de ElevenLabs —que ya cuenta con talentos como Michael Caine— pueden monetizar réplicas entrenadas a fondo para doblajes internacionales en todos los idiomas admitidos.
En la tabla de clasificación Provider Voice Arena de Artificial Analysis, Eleven v4 se ubica actualmente por delante de Cartesia Sonic 3.6 y Gemini 3.8 Flash TTS de Google. En evaluaciones a ciegas realizadas por ElevenLabs, aproximadamente el 75 por ciento de los oyentes prefirió v4 frente a modelos de Cartesia, Google e Inworld; asimismo, v4 fue calificado como más expresivo en entre el 65 y el 81 por ciento de las comparaciones directas, según el sistema competidor.
Latencia de Turbo, estructura de precios y procesamiento regional
Para resolver el dilema entre latencia y expresividad en aplicaciones en tiempo real, Eleven v4 Turbo fue cooptimizado junto con la plataforma ElevenAgents de la empresa. En las pruebas de ElevenLabs, v4 Turbo entrega voz audible en 150 milisegundos. En comparación, Cartesia Sonic 3.6 registró 262 milisegundos, mientras que GPT-4o mini TTS de OpenAI alcanzó 814 milisegundos.
El precio estándar de la API se fijó en 80 dólares por millón de caracteres para Eleven v4 y 40 dólares por millón de caracteres para v4 Turbo. ElevenLabs mantiene tarifas promocionales hasta el 12 de octubre, reduciendo los precios a 22 y 11 dólares por millón de caracteres, respectivamente. Los suscriptores del plan Creator de 22 dólares al mes o superior pueden probar v4 en ElevenCreative sin costo adicional durante dos semanas, sujeto a un límite del doble de su cuota mensual de créditos. En el mercado de referencia, Artificial Analysis sitúa a Cartesia Sonic 3.6 en 49 dólares por millón de caracteres y a Gemini 3.8 Flash TTS en 16,49 dólares por millón de caracteres.
Los datos de audio de los clientes se almacenan en Estados Unidos de forma predeterminada. Los clientes corporativos tienen acceso a almacenamiento de datos aislado en la Unión Europea, India o Singapur, aunque parte del procesamiento operativo todavía podría llevarse a cabo de forma externa; los clientes de la UE pueden exigir el procesamiento doméstico mediante la API activando un modo de retención de datos cero. El lanzamiento de v4 se suma a la presentación a mediados de septiembre de Music 2.5 por parte de ElevenLabs, un modelo enfocado en la generación de pistas musicales más densas y naturales.



