AI RACE— A Corrida da IA
New Models

Google lança modelos Gemini 3.8 Flash TTS com criação de voz a partir de prompts de texto

O Google apresentou o Gemini 3.8 Flash TTS e o Flash-Lite TTS, dois novos modelos de geração de fala que suportam mais de 100 idiomas e permitem criar vozes personalizadas via prompts de texto ou pequenas amostras de áudio.

24/09/2026, 00:39
Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

Google apresenta o Gemini 3.8 Flash TTS e o Flash-Lite TTS

O Google expandiu seu portfólio de áudio generativo com o lançamento do Gemini 3.8 Flash TTS e do Gemini 3.8 Flash-Lite TTS. Os dois modelos de conversão de texto em fala (TTS) oferecem suporte a mais de 100 idiomas e trazem controles granulares para a interpretação vocal, incluindo direções de cena linha por linha.

O Gemini 3.8 Flash TTS é voltado para fluxos de trabalho criativos e expressivos — como diálogos de personagens de videogame, podcasts e audiolivros —, permitindo que desenvolvedores criem vozes sintéticas totalmente novas a partir de descrições em texto. Já o Gemini 3.8 Flash-Lite TTS foi projetado para implementações escaláveis e com foco em custo-benefício, incluindo dublagem para localização, agentes de voz automatizados e produção de mídia em grande escala. Ambos os modelos estão sendo disponibilizados por meio do Google AI Studio e da Gemini API, com o acesso corporativo previsto para breve.

Design de voz por texto, controle de roteiro e estrutura de preços

O Flash TTS introduz a capacidade de descrever atributos vocais — como tom, sotaque, entonação e a personalidade do personagem — diretamente por meio de comandos de texto. Os usuários que preferirem opções prontas podem escolher em um catálogo de mais de 2.000 vozes predefinidas, que incluem variações regionais como o espanhol mexicano, o inglês escocês e o francês quebequense. Um recurso futuro denominado "Voice Remixing" permitirá aos criadores ajustar vozes da biblioteca modificando timbre, andamento e tom.

Para replicação de voz, o Flash TTS inclui uma ferramenta de clonagem capaz de construir um perfil personalizado a partir de uma gravação de áudio de 30 segundos. Para evitar falsificações e uso não autorizado, o sistema exige que o locutor grave uma declaração verbal explícita de consentimento, que precisa corresponder ao perfil biométrico da amostra original.

Ambos os modelos oferecem suporte a um direcionamento cênico minucioso:

  • Interpretação roteirizada: Os prompts podem interpretar deixas narrativas automaticamente ou executar direções de cena explícitas linha por linha, inserindo pausas e sinais não verbais como risadas, suspiros e hesitações como "mhm".
  • Diálogo multivoz: Um modo para dois locutores permite que duas vozes distintas se alternem dentro de um mesmo roteiro. Segundo o Google, os modelos mantêm a consistência vocal ao longo de sessões prolongadas de geração, apresentando um nível mínimo de "speaker drift" (desvio de características da voz).
  • Disponibilidade nas ferramentas: O Flash TTS já está integrado ao Gemini Notebook, enquanto o Flash-Lite TTS pode ser acessado no Google Vids. Diversas plataformas para desenvolvedores, incluindo LiveKit, Agora, Pipecat e Vercel, já disponibilizaram suporte por meio da Gemini API.

A precificação da API do Google é estruturada com base em tokens de entrada de texto e de saída de áudio, calculando a geração de áudio a 25 tokens por segundo (ou 90.000 tokens por hora). Até o final de 2026, a entrada de texto em ambos os modelos custará US$ 0,50 por milhão de tokens. A saída de áudio custa US$ 9,00 por milhão de tokens no Flash TTS (aproximadamente US$ 0,81 por hora de fala gerada) e US$ 6,00 por milhão de tokens no Flash-Lite TTS (US$ 0,54 por hora). A partir de 1º de janeiro de 2027, as taxas dobrarão para US$ 1,00 por milhão de tokens de texto, e as saídas de áudio subirão para US$ 18,00 por milhão de tokens no Flash TTS (US$ 1,62 por hora) e US$ 12,00 por milhão de tokens no Flash-Lite TTS (US$ 1,08 por hora). Os dados enviados nos planos pagos da API não são utilizados para treinamento de produtos, ao passo que os dados do plano gratuito podem ser aproveitados pelo Google.

Padrões de marca d'água e o mercado de vozes sintéticas

Com o objetivo de sanar preocupações de segurança e procedência em torno da voz sintética, todo áudio gerado pelos novos motores Gemini TTS inclui a marca d'água imperceptível SynthID do Google, projetada para verificar posteriormente se o conteúdo foi produzido por máquina.

O Google afirma que a nova linha Gemini 3.8 TTS lidera a maioria das categorias de avaliação em benchmarks conduzidos pela Hume AI. O lançamento coloca o Google em concorrência direta com fornecedores especializados em síntese de voz, como ElevenLabs e Cartesia, disputando a preferência de desenvolvedores que criam agentes conversacionais em tempo real, ativos para jogos interativos e fluxos automatizados de dublagem.

Notícias relacionadas