구글, 음성 합성 기능 강화한 'Gemini 3.8' TTS 모델 공개
구글이 100개 이상의 언어로 맞춤형 음성을 생성할 수 있는 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 출시하며 엔터프라이즈 AI 라인업을 강화했다.

구글, 전용 음성 생성 모델로 Gemini 3.8 라인업 확장
구글이 개발자, 크리에이터 및 기업 고객을 대상으로 음성 합성 포트폴리오를 고도화하고 개선하기 위해 Gemini 3.8 제품군 산하의 새로운 텍스트 음성 변환(TTS) 툴셋을 공개했다. 9월 23일 출시된 이 라인업은 'Gemini 3.8 Flash TTS'와 'Gemini 3.8 Flash-Lite TTS' 두 가지 핵심 엔진으로 구성된다.
구글이 자사의 가장 진보한 오디오 생성 모델이라고 소개한 이번 업데이트는 한층 더 높은 음질과 풍부한 표현력을 갖춘 음성을 제공하는 데 초점을 맞췄다. 기반 기술이 완전히 새로운 혁신이라기보다는 기존 업계 기술을 바탕으로 개발되었으나, 엔터테인먼트, 마케팅, 소프트웨어 개발 전반의 사용자에게 구글 AI 생태계에 직접 통합된 업그레이드된 퍼스트 파티 음성 합성 기능을 제공한다.
크리에이티브 연출, 다국어 음성 지원 및 엔터프라이즈 통합
이번 출시는 음성 생성 용도에 따라 두 가지 티어로 나뉜다.
- Gemini 3.8 Flash TTS: 크리에이티브 연출과 캐릭터 디자인에 특화된 모델로, 자연어 프롬프트를 사용해 완전히 새로운 합성 음성을 처음부터 만들어낼 수 있다. 100개 이상의 언어와 방언에 걸쳐 음성 페르소나 커스터마이징, 방언 조정, 억양 맞춤 설정을 지원하며 게임, 인터랙티브 미디어, 오디오북, 팟캐스트 등의 분야를 겨냥한다.
- Gemini 3.8 Flash-Lite TTS: 효율성과 대규모 워크로드를 위해 설계된 모델로 오디오 더빙, 일반 디지털 콘텐츠 제작, 대화형 음성 에이전트 구축에 초점을 맞췄다.
업계 분석가들은 새 모델들이 지닌 아키텍처적 통합을 기업 고객을 위한 핵심 이점으로 꼽았다. Futurum Group의 브래들리 심민(Bradley Shimmin) 애널리스트는 이 모델이 장편 오디오북이나 짧은 대화형 내레이션과 같은 포맷에 최적화된 맞춤 기능을 제공한다고 평가했다. 또한 심민 애널리스트는 광범위한 Gemini 생태계에 음성을 직접 통합함으로써 단순한 데이터 관리가 아닌 기업의 주요 운영 병목인 '기술 스택 통합' 문제를 해결하는 데 도움을 준다고 덧붙였다.
경쟁 치열해진 음성 AI 시장 공략
구글의 이번 음성 AI 시장 진출은 ElevenLabs, Baseten 등 전문 음성 합성 플랫폼들이 이미 입지를 굳힌 시장 속에서 이뤄졌다. 음성 AI 기업 Modulate의 카터 허프만(Carter Huffman) CEO는 단절된 단일 목적의 엔드포인트에서 벗어나 다양한 멀티모달 기능을 하나로 묶은 종합 플랫폼으로 나아가는 것이 업계 전반의 트렌드라고 언급했다.
다만 허프만 CEO는 음성 AI가 여전히 초기 단계에 머물러 있다고 강조했다. 구글이 음성 전문 경쟁업체들과 확고한 차별화를 이루기 위해서는 기존 시장 기준을 뛰어넘는 새로운 애플리케이션과 독창적인 음성 역량을 시장에 선보여야 할 것이라는 설명이다.



