AI RACE— A Corrida da IA
New Models

Google lança modelos text-to-speech Gemini 3.8 para aprimorar síntese de voz

O Google lançou o Gemini 3.8 Flash TTS e o Flash-Lite TTS, trazendo criação de vozes personalizáveis em mais de 100 idiomas para seu portfólio de IA corporativa.

25/09/2026, 03:43
Google ra mắt Gemini 3.8 TTS: Nâng cấp giọng nói AI đa ngữ, giải bài toán tích hợp cho doanh nghiệp

Google expande Gemini 3.8 com modelos dedicados de geração de voz

O Google apresentou um novo pacote de ferramentas de text-to-speech sob o guarda-chuva do Gemini 3.8, com o objetivo de refinar e atualizar seu portfólio de áudio sintético para desenvolvedores, criadores e clientes corporativos. Lançada em 23 de setembro, a linha conta com dois motores principais: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS.

Apresentadas pelo Google como seus modelos de geração de áudio mais avançados até o momento, as atualizações focam em oferecer uma fala mais expressiva e de maior fidelidade. Embora os recursos subjacentes se baseiem em técnicas já consolidadas na indústria, em vez de avanços inéditos, eles oferecem aos usuários dos setores de entretenimento, marketing e desenvolvimento de software uma síntese de voz nativa e aprimorada, integrada diretamente ao ecossistema de IA do Google.

Direção criativa, vozes multilíngues e integração corporativa

O lançamento divide as tarefas de geração de voz em dois níveis distintos:

  • Gemini 3.8 Flash TTS: Voltado para direção criativa e criação de personagens, este modelo permite que os usuários criem novas vozes sintéticas do zero usando comandos em linguagem natural. Ele oferece suporte à personalização de personas de voz, ajustes de dialetos e adaptação de sotaques em mais de 100 idiomas e dialetos, tendo como foco aplicações em jogos, mídias interativas, audiolivros e podcasts.
  • Gemini 3.8 Flash-Lite TTS: Desenvolvido para oferecer eficiência e lidar com altos volumes de trabalho, o Flash-Lite é voltado para dublagem de áudio, produção geral de conteúdo digital e agentes de voz conversacionais.

Analistas do setor destacam a integração arquitetural dos novos modelos como um benefício crucial para as empresas. Bradley Shimmin, analista do Futurum Group, observou que o modelo oferece um direcionamento refinado para formatos como audiolivros longos e conversas narradas curtas. Shimmin acrescentou que integrar a voz diretamente ao ecossistema mais amplo do Gemini ajuda a resolver um dos principais gargalos operacionais para as empresas: a integração da stack tecnológica, em vez do mero gerenciamento de dados.

Navegando por um mercado concorrido de IA de voz

A nova investida do Google em voz entra em um mercado já povoado por plataformas especializadas em síntese de voz, como ElevenLabs e Baseten. Carter Huffman, CEO da fornecedora de IA de voz Modulate, destacou uma tendência geral do setor de se afastar de endpoints desconectados e de propósito único em direção a plataformas abrangentes que reúnem múltiplos recursos multimodais sob o mesmo teto.

No entanto, Huffman enfatizou que a IA de voz ainda está em seus estágios iniciais. Para que o Google consiga se diferenciar plenamente de concorrentes dedicados ao setor de fala, a empresa precisará, em última análise, introduzir aplicações inéditas e recursos de voz exclusivos que vão além dos padrões atuais do mercado.

Notícias relacionadas