AI RACE— La carrera de la IA
New Models

Google lanza los modelos Gemini 3.8 Flash TTS con diseño de voces a partir de prompts de texto

Google ha presentado Gemini 3.8 Flash TTS y Flash-Lite TTS, dos nuevos modelos de generación de voz que admiten más de 100 idiomas y permiten crear voces personalizadas mediante prompts de texto o breves muestras de audio.

24/09/2026, 00:39
Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

Google presenta Gemini 3.8 Flash TTS y Flash-Lite TTS

Google ha ampliado su catálogo de audio generativo con el lanzamiento de Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. Los dos modelos de texto a voz (TTS) abarcan más de 100 idiomas e introducen controles granulares sobre la interpretación vocal, incluidas acotaciones escena por escena y línea por línea.

Gemini 3.8 Flash TTS está orientado a flujos de trabajo creativos y expresivos —como diálogos de personajes para videojuegos, pódcasts y audiolibros— y permite a los desarrolladores generar voces sintéticas completamente nuevas a partir de descripciones escritas. Por su parte, Gemini 3.8 Flash-Lite TTS está diseñado para implementaciones escalables y de bajo costo, tales como doblaje para localización, agentes de voz automatizados y producción de contenidos multimedia a gran escala. Ambos modelos se están desplegando a través de Google AI Studio y la Gemini API, y el acceso empresarial está programado para más adelante.

Diseño de texto a voz, control de guion y desglose de precios

Flash TTS introduce la capacidad de describir atributos vocales —como tono, acento, timbre y la personalidad del personaje— directamente mediante prompts de texto. Los usuarios que prefieran opciones preexistentes pueden elegir dentro de un catálogo de más de 2.000 voces predefinidas que abarcan acentos regionales como español de México, inglés de Escocia y francés de Quebec. Una próxima función denominada "Voice Remixing" permitirá a los creadores ajustar las voces de la biblioteca modificando el timbre, el tempo y el tono.

Para la clonación de voz, Flash TTS incluye una herramienta de replicación que crea un perfil personalizado a partir de una grabación de audio de 30 segundos. Con el fin de evitar la suplantación no autorizada, el sistema exige que el hablante grabe una declaración explícita de consentimiento verbal que debe coincidir con el perfil biométrico de la muestra original.

Ambos modelos admiten una dirección interpretativa detallada:

  • Interpretación con guion: Los prompts pueden interpretar indicaciones narrativas de forma automática o ejecutar acotaciones explícitas línea por línea, insertando pausas y expresiones no verbales como risas, suspiros y vacilaciones del tipo "mhm".
  • Diálogo multivoz: Un modo de dos interlocutores permite alternar dos voces distintas dentro de un mismo guion. Google afirma que los modelos mantienen la coherencia vocal a lo largo de sesiones de generación prolongadas con una desviación mínima del hablante ("speaker drift").
  • Disponibilidad de herramientas: Flash TTS está integrado en Gemini Notebook, mientras que Flash-Lite TTS está disponible dentro de Google Vids. Varias plataformas para desarrolladores, entre ellas LiveKit, Agora, Pipecat y Vercel, han lanzado compatibilidad a través de la Gemini API.

Google estructura los precios de su API en función de los tokens de entrada de texto y de salida de audio, cuantificando la generación de audio a un ritmo de 25 tokens por segundo (o 90.000 tokens por hora). Hasta finales de 2026, la entrada de texto para ambos modelos se factura a 0,50 dólares por millón de tokens. La salida de audio cuesta 9,00 dólares por millón de tokens para Flash TTS (aproximadamente 0,81 dólares por hora de voz generada) y 6,00 dólares por millón de tokens para Flash-Lite TTS (0,54 dólares por hora). El 1 de enero de 2027, está previsto que las tarifas se dupliquen a 1,00 dólar por millón de tokens de texto, mientras que las salidas de audio aumentarán a 18,00 dólares por millón de tokens para Flash TTS (1,62 dólares por hora) y a 12,00 dólares por millón de tokens para Flash-Lite TTS (1,08 dólares por hora). Los datos enviados bajo el nivel de pago de la API están exentos del entrenamiento de productos, mientras que los datos del nivel gratuito pueden ser utilizados por Google.

Estándares de marcas de agua y el mercado de voces sintéticas

Para responder a las preocupaciones sobre seguridad y procedencia en torno a la voz sintética, todo el audio generado por los nuevos motores Gemini TTS incluye la marca de agua imperceptible SynthID de Google, diseñada para verificar posteriormente si el contenido fue generado por máquinas.

Google afirma que la nueva línea Gemini 3.8 TTS lidera la mayoría de las categorías de evaluación en los benchmarks establecidos por Hume AI. Este lanzamiento sitúa a la compañía en competencia directa con proveedores especializados en síntesis de voz como ElevenLabs y Cartesia, apuntando a desarrolladores que crean agentes conversacionales en tiempo real, recursos interactivos para videojuegos y procesos automatizados de doblaje.

◗ Fuentes

The Decoder24/9

Historias relacionadas