AI RACE— La carrera de la IA
New Models

Google estrena los modelos de texto a voz Gemini 3.8 para mejorar la síntesis de voz

Google ha lanzado Gemini 3.8 Flash TTS y Flash-Lite TTS, incorporando la creación de voces personalizables en más de 100 idiomas a su catálogo de IA empresarial.

25/09/2026, 03:43
Google ra mắt Gemini 3.8 TTS: Nâng cấp giọng nói AI đa ngữ, giải bài toán tích hợp cho doanh nghiệp

Google amplía Gemini 3.8 con modelos dedicados a la generación de voz

Google ha presentado una nueva suite de herramientas de texto a voz bajo el paraguas de Gemini 3.8, con el objetivo de perfeccionar y actualizar su catálogo de audio sintético para desarrolladores, creadores y clientes empresariales. Lanzada el 23 de septiembre, la línea cuenta con dos motores principales: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS.

Presentados por Google como sus modelos de generación de audio más avanzados hasta la fecha, las actualizaciones se centran en ofrecer un habla más expresiva y de mayor fidelidad. Aunque las capacidades subyacentes se basan en técnicas ya consolidadas en la industria en lugar de avances completamente inéditos, proporcionan a los usuarios de los sectores del entretenimiento, el marketing y el desarrollo de software una síntesis de voz nativa mejorada e integrada directamente en el ecosistema de IA de Google.

Dirección creativa, voces multilingües e integración empresarial

El despliegue divide las tareas de generación de voz en dos niveles diferenciados:

  • Gemini 3.8 Flash TTS: Orientado a la dirección creativa y el diseño de personajes, este modelo permite a los usuarios diseñar voces sintéticas inéditas desde cero mediante prompts en lenguaje natural. Admite la personalización del perfil de voz, ajustes de dialectos y adaptación de acentos en más de 100 idiomas y dialectos, enfocado en aplicaciones para videojuegos, medios interactivos, audiolibros y pódcasts.
  • Gemini 3.8 Flash-Lite TTS: Diseñado para ofrecer eficiencia y gestionar cargas de trabajo de gran volumen, Flash-Lite está dirigido al doblaje de audio, la producción general de contenido digital y los agentes de voz conversacionales.

Los analistas de la industria destacan la integración arquitectónica de los nuevos modelos como un beneficio clave para las empresas. Bradley Shimmin, analista de Futurum Group, señaló que el modelo ofrece una orientación precisa para formatos como audiolibros extensos y chats narrados de formato corto. Shimmin añadió que integrar la voz directamente en el ecosistema más amplio de Gemini ayuda a resolver un cuello de botella operativo fundamental para las empresas: la integración del stack tecnológico, más allá de la simple gestión de datos.

Navegando en un mercado de IA de voz saturado

La última apuesta de voz de Google llega a un mercado ya poblado por plataformas especializadas en síntesis de voz como ElevenLabs y Baseten. Carter Huffman, CEO del proveedor de IA de voz Modulate, señaló una tendencia generalizada en la industria que se aleja de los endpoints aislados y de propósito único para dar paso a plataformas integrales que reúnen múltiples capacidades multimodales bajo un mismo techo.

No obstante, Huffman enfatizó que la IA de voz aún se encuentra en sus etapas iniciales. Para que Google logre diferenciarse por completo de los competidores dedicados exclusivamente a la voz, la compañía deberá, en última instancia, introducir aplicaciones innovadoras y capacidades de voz únicas que vayan más allá de los estándares actuales del mercado.

◗ Fuentes

AI Business25/9

Historias relacionadas