AI RACE— AI Race
New Models

ElevenLabs, 음성 모델 Eleven v4 및 150ms 응답속도의 Turbo 버전 출시

ElevenLabs가 강화된 감정 표현 디렉팅, 90개 언어 지원 다국어 복제, 150밀리초 응답 속도를 제공하는 플래그십 음성 모델 Eleven v4와 초저지연 Turbo 에디션을 출시했다.

2026. 09. 29. 21:45
New Models

ElevenLabs Debuts Eleven v4 and Real-Time Turbo Model

음성 AI 개발사 ElevenLabs가 연출 지시를 더욱 충실히 따르고 장편 오디오 제작 전반에서 음성 일관성을 유지하도록 설계된 신규 플래그십 텍스트-음성 변환(TTS) 모델 'Eleven v4'를 공식 출시했다. 이와 함께 대화형 음성 에이전트, 비디오 게임 캐릭터, 고객 서비스 워크플로우에 최적화된 저지연 변형 모델인 'Eleven v4 Turbo'도 공개했다.

이번 업데이트는 약 1년 전 선보인 Eleven v3를 기반으로 한다. v3가 속삭임, 웃음, 음향 효과와 같은 오디오 동작을 위한 스크립팅 태그를 도입했다면, ElevenLabs는 v4가 이러한 태그를 훨씬 더 안정적으로 실행하는 동시에 대사를 재생성할 때 캐릭터 일관성을 크게 향상시켰다고 밝혔다. 두 모델 모두 ElevenCreative, ElevenAgents 및 회사의 API를 통해 즉시 이용할 수 있다.

Architecture Enhancements, Dubbing Controls, and Benchmark Gains

Eleven v4는 문장을 개별적으로 합성하는 대신 전체 장면의 폭넓은 맥락, 톤, 호흡(pacing)을 해석하도록 설계된 개편된 아키텍처를 특징으로 한다. 사용자는 인라인 태그나 자연어 문장을 통해 지시 사항을 전달할 수 있으며, 업그레이드된 발음 표기(phonetic spelling) 제어 기능을 통해 인명이나 전문 용어의 정확한 발음을 지정할 수 있다. 자체 발음 평가에서 v4는 91.7%를 기록해 v3가 기록한 85.6%에서 상승했다.

이 모델은 단일 요청당 최대 1만 자(음성 기준 약 10분 분량)를 처리할 수 있어, 오디오북이나 장편 제작물에서 구간 경계를 넘나들며 일관된 전달력을 유지할 수 있다. 다자간 대화에서도 캐릭터들이 음색 왜곡(timbre drift) 없이 대화 맥락에 동적으로 적응한다.

지원 언어 범위는 v3의 약 70개에서 v4의 90개 이상으로 확장됐다. 이 시스템을 통해 복제된 음성은 긴 호흡의 녹음에서도 악센트 저하 없이 원어민 발음으로 외국어를 구사할 수 있다. ElevenLabs는 10초 분량의 샘플 오디오가 필요한 Instant Voice Clone 도구와 더불어 v3에서 지원되지 않던 Professional Voice Clones 기능도 다시 도입했다. Michael Caine과 같은 유명 인사들이 이미 참여하고 있는 ElevenLabs 마켓플레이스를 통해 음성 라이선스를 제공하는 배우들은 지원되는 모든 언어의 글로벌 더빙에 정밀 훈련된 복제 음성을 활용해 수익을 창출할 수 있다.

Artificial Analysis의 Provider Voice Arena 리더보드에서 Eleven v4는 현재 Cartesia Sonic 3.6과 Google의 Gemini 3.8 Flash TTS를 앞서고 있다. ElevenLabs가 실시한 블라인드 평가에서는 청취자의 약 75%가 Cartesia, Google, Inworld의 모델보다 v4를 선호했으며, 경쟁 시스템에 따라 1:1 비교 시 65~81%의 비율로 v4가 더 표현력이 풍부하다고 평가했다.

Turbo Latency, Pricing Structure, and Regional Processing

실시간 애플리케이션에서 지연 시간과 표현력 사이의 상충 관계를 해결하기 위해, Eleven v4 Turbo는 자사의 ElevenAgents 플랫폼과 함께 동시 최적화되었다. ElevenLabs의 테스트에 따르면 v4 Turbo는 150밀리초 만에 가청 음성을 출력한다. 이에 비해 Cartesia Sonic 3.6은 262밀리초, OpenAI의 GPT-4o mini TTS는 814밀리초를 기록했다.

표준 API 가격은 100만 자당 Eleven v4가 80달러, v4 Turbo가 40달러로 책정되었다. ElevenLabs는 10월 12일까지 프로모션 가격을 적용해 요금을 각각 100만 자당 22달러와 11달러로 인하한다. 월 22달러의 Creator 플랜 이상 구독자는 월 크레딧 할당량의 2배 한도 내에서 2주 동안 추가 비용 없이 ElevenCreative에서 v4를 테스트할 수 있다. 시장 비교 기준으로 Artificial Analysis에 등재된 Cartesia Sonic 3.6은 100만 자당 49달러, Gemini 3.8 Flash TTS는 16.49달러다.

고객 오디오 데이터는 기본적으로 미국에 저장된다. 엔터프라이즈 고객은 유럽연합(EU), 인도, 싱가포르의 격리된 데이터 저장소를 이용할 수 있으나 일부 운영 처리는 여전히 외부에서 발생할 수 있다. 다만 EU 고객은 데이터 무보존(zero-data-retention) 모드를 활성화해 역내 API 처리를 강제할 수 있다. 이번 v4 출시는 보다 밀도 있고 자연스러운 음악 트랙을 생성하는 전용 모델인 Music 2.5를 지난 9월 중순 출시한 데 이어 진행됐다.

관련 기사