AI RACE— AI Race
New Models

구글, 텍스트 프롬프트 기반 음성 제작 지원하는 'Gemini 3.8 Flash TTS' 모델 출시

구글이 100개 이상의 언어를 지원하며 텍스트 프롬프트나 짧은 오디오 샘플로 맞춤형 음성을 생성할 수 있는 신규 음성 합성 모델 Gemini 3.8 Flash TTS 및 Flash-Lite TTS를 공개했다.

2026. 09. 24. 00:39
Google ra mắt Gemini 3.8 Flash TTS: Tạo và tùy biến giọng nói AI từ câu lệnh văn bản

구글, Gemini 3.8 Flash TTS 및 Flash-Lite TTS 공개

구글이 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 출시하며 생성형 오디오 포트폴리오를 확장했다. 두 텍스트 음성 변환(TTS) 모델은 100개 이상의 언어를 지원하며, 대사별 지시문을 포함해 발화 표현을 세부적으로 제어할 수 있는 기능을 제공한다.

Gemini 3.8 Flash TTS는 비디오 게임 캐릭터 대사, 팟캐스트, 오디오북과 같이 표현력이 중요한 크리에이티브 워크플로에 최적화되어 있으며, 개발자가 텍스트 설명만으로 완전히 새로운 합성 음성을 만들 수 있도록 돕는다. Gemini 3.8 Flash-Lite TTS는 현지화 더빙, 자동화 음성 상담원(보이스 에이전트), 대규모 미디어 제작 등 확장성과 비용 효율성이 중요한 배포 환경에 적합하도록 설계됐다. 두 모델은 Google AI Studio와 Gemini API를 통해 먼저 출시되며, 엔터프라이즈 대상 서비스도 이어 지원될 예정이다.

텍스트 기반 음성 디자인, 대본 제어 기능 및 가격 정책

Flash TTS는 음높이(피치), 억양, 톤, 캐릭터 성격 등 음성 특성을 텍스트 프롬프트로 직접 묘사할 수 있는 기능을 도입했다. 기존 옵션을 원하는 사용자는 멕시코 스페인어, 스코틀랜드 영어, 퀘벡 프랑스어 등 다양한 지역 억양을 아우르는 2,000개 이상의 프리셋 음성 카탈로그에서 선택할 수 있다. 음색, 템포, 피치를 조절해 라이브러리 음성을 미세 조정할 수 있는 'Voice Remixing' 기능도 출시를 앞두고 있다.

음성 복제(클로닝)를 위해 Flash TTS는 30초 분량의 오디오 녹음으로 맞춤형 프로필을 구축하는 도구를 제공한다. 무단 사칭을 방지하기 위해 시스템은 화자가 원본 샘플의 생체 인식 프로필과 일치하는 명시적인 구두 동의 진술을 녹음하도록 요구한다.

두 모델 모두 세부적인 연출 지시 기능을 지원한다.

  • 대본 기반 발화(Scripted Delivery): 프롬프트는 서사적 단서를 자동으로 해석하거나 명시적인 대사별 지시문을 수행하여 일시 중지(휴지)를 삽입하고 웃음, 한숨, "음(mhm)"과 같은 머뭇거림 등 비언어적 표현을 구현할 수 있다.
  • 다중 음성 대화(Multi-Voice Dialogue): 듀얼 스피커 모드를 통해 단일 대본 내에서 두 개의 서로 다른 음성을 번갈아 연출할 수 있다. 구글에 따르면 이 모델들은 장시간 생성 세션에서도 '화자 이탈(speaker drift)'을 최소화하며 음성 일관성을 안정적으로 유지한다.
  • 지원 도구(Tool Availability): Flash TTS는 Gemini Notebook에 통합되었으며, Flash-Lite TTS는 Google Vids 내에서 사용할 수 있다. LiveKit, Agora, Pipecat, Vercel 등 다수의 개발자 플랫폼도 Gemini API를 통한 지원을 시작했다.

구글의 API 요금제는 텍스트 입력 토큰과 오디오 출력 토큰을 기준으로 책정되며, 오디오 생성은 초당 25토큰(시간당 9만 토큰)으로 계산된다. 2026년 말까지 두 모델의 텍스트 입력 요금은 100만 토큰당 0.50달러다. 오디오 출력 비용은 Flash TTS의 경우 100만 토큰당 9.00달러(생성된 음성 1시간당 약 0.81달러), Flash-Lite TTS는 100만 토큰당 6.00달러(시간당 0.54달러)다. 2027년 1월 1일부터는 요금이 2배로 인상되어 텍스트 토큰은 100만 개당 1.00달러가 되며, 오디오 출력은 Flash TTS가 100만 토큰당 18.00달러(시간당 1.62달러), Flash-Lite TTS가 100만 토큰당 12.00달러(시간당 1.08달러)로 인상될 예정이다. 유료 API 티어로 전송된 데이터는 제품 학습에 활용되지 않으나, 무료 티어 데이터는 구글이 활용할 수 있다.

워터마킹 표준 및 합성 음성 시장 현황

구글은 합성 음성을 둘러싼 안전 및 출처 관련 우려를 해소하기 위해 신규 Gemini TTS 엔진으로 생성된 모든 오디오에 기계 생성 여부를 판별할 수 있는 비가청 SynthID 워터마크를 기본 적용했다.

구글은 새로운 Gemini 3.8 TTS 라인업이 Hume AI가 수립한 벤치마크 평가 카테고리 대부분에서 선두를 기록했다고 강조했다. 이번 출시를 통해 구글은 실시간 대화형 에이전트, 인터랙티브 게이밍 애셋, 자동 더빙 파이프라인을 구축하는 개발자들을 타깃으로 삼으며 ElevenLabs, Cartesia 등 음성 합성 전문 기업들과 직접적인 경쟁 구도를 형성하게 됐다.

관련 기사