TL;DR

  • ElevenLabs가 90개 이상 언어, 감정·맥락 해석, 화자 일관성을 갖춘 텍스트 음성 변환(Text-to-Speech, TTS) 모델 Eleven v4와 저지연 버전 Eleven v4 Turbo를 출시함.
  • Artificial Analysis 1위를 기록하고 블라인드 대결 테스트에서 청취자의 약 75%가 경쟁 모델보다 선호한 결과를 제시함.
  • 자연어 지시와 [laughs], [light rain] 같은 인라인 태그로 말투·감정·효과음을 제어하며, 국제음성기호(IPA) 발음 지원도 개선함.
  • Turbo는 중앙값 최초 음성 출력 시간 약 150ms, 중앙값 추론 지연 시간 약 100ms를 제시하며 대화형 에이전트에 맞춰 설계됨.
  • 10초 오디오로 고충실도 인스턴트 음성 복제가 가능하고, 전문 음성 복제(PVC)와 긴 콘텐츠 생성 연결의 신뢰성도 지원함.

성능을 위해 새로 구축한 아키텍처

  • Eleven v4는 완전히 새로운 아키텍처를 기반으로 한 가장 감정 표현력이 높은 TTS 모델이며, Artificial Analysis 순위에서 1위를 기록함.
  • 경쟁 모델과의 블라인드 일대일 청취 테스트에서 약 75%의 청취자가 Eleven v4를 선호함. 테스트는 Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS, Google Gemini 3.8 Flash TTS와 비교해 2026년 9월 진행됐으며, 동일한 문장을 익명으로 들려준 뒤 표현력과 자연스러움을 평가하고 동점은 절반으로 계산함.
  • Eleven v4 Turbo는 같은 기술을 저지연 용도에 적용한 버전임. 중앙값 추론 지연 시간은 약 100ms로, 두 사람이 대화할 때 평균적으로 말 사이에 생기는 멈춤보다 빠른 응답이 가능함.
  • 두 모델은 기계적인 음성이 아닌 감정 표현이 담긴 음성을 생성하며, 전반적으로 오디오 충실도가 높고 출력이 더 깨끗하고 자연스러움.
  • 이전 세대 TTS 모델이 텍스트를 소리 내 읽는 데 그쳤다면, Eleven v4는 의도된 말투와 속도, 글의 특성, 문맥을 해석해 감정적으로 자연스러운 음성을 생성함.
  • 사용자는 자연어로 대사 전달 방식을 세밀하게 지시할 수 있으며, 특정 문구의 발화 방식과 감정, 효과음을 인라인 태그로 지정할 수 있음. 예시는 [laughs], [said angrily in French accent], [light rain], [phone buzzing]임.
  • Eleven v4는 이전 모델보다 오디오 태그와 지시를 정확히 따르며, 이를 통해 내레이션 연출, 캐릭터와 대사 구성 등 전달 방식이 중요한 작업을 지원함.
  • ElevenLabs 개발자 문서는 전체 태그 문법과 API를 통한 태그 적용 방식을 다룸. 국제음성기호(IPA) 음소 지원도 크게 개선돼 사용자 지정 발음의 신뢰성이 높아짐.
  • 새로운 화자 정체성 포착 방식으로 각 목소리의 고유한 특성을 유지하며, 에이전트 대화·오디오북·광고에서도 일관된 음성을 생성함.
  • 장면 전체의 문맥을 이해해 앞선 발화에 반응하는 자연스러운 대화를 생성하며, 서로 분리된 대사를 이어 붙인 듯한 결과를 줄임.

저지연 용도를 위한 Turbo 모델

  • 고품질 음성 모델은 생성 속도가 느린 경향이 있어, 사용자는 빠른 음성과 표현력 있는 음성 에이전트 중 하나를 선택해야 했음. 많은 경우 당황한 고객에게 로봇처럼 들릴 수 있는 능숙하지만 단조로운 에이전트가 선택됐음.
  • Eleven v4 Turbo는 속도와 감정 표현을 결합하며, 중앙값 최초 음성 출력 시간 약 150ms를 제공함. 측정은 2026년 9월 동일한 스크립트와 기본 설정으로 Cartesia Sonic 3.6, xAI TTS, Google Gemini 3.8 Flash-Lite TTS, OpenAI GPT-4o mini TTS와 비교해 진행됐으며, 모든 시스템에서 네트워크 지연 시간을 측정해 제외함. Eleven v4 Turbo는 WebSocket 스트리밍으로 측정됨.
  • 적용 사례로 의료 용어를 정확히 발음하는 따뜻하고 안심을 주는 의료 에이전트, 빠르게 말하고 속어를 사용하는 게임 에이전트 등이 제시됨.
  • Eleven v4 Turbo는 대화형 에이전트 플랫폼 ElevenAgents와 함께 작동하도록 구축됨. 서로 다른 공급업체의 모델과 소프트웨어를 조합하는 다른 에이전트 빌더 방식과 달리, ElevenLabs의 연구·엔지니어링 팀은 Eleven v4 Turbo와 ElevenAgents를 하나의 시스템으로 함께 최적화함.
  • 통합 최적화 결과로 더 표현력 있고 신뢰할 수 있으며 지연 시간이 짧은 에이전트를 제공함.

하나의 목소리, 다양한 언어

  • 의사소통 방식은 문맥과 지역, 시간대에 따라 달라지며, 여러 언어에서 이를 반영하는 표현력 있는 음성을 구현하는 일은 오디오 인공지능(AI)의 가장 어려운 과제 중 하나임.
  • Eleven v4는 발음뿐 아니라 언어별 리듬·감정·전달 방식도 더 잘 포착해 언어와 문맥에 자연스러운 음성 제작을 지원함. 예를 들어 일본의 연로한 낯선 사람에게 말하는 방식은 이탈리아의 연로한 낯선 사람에게 말하는 방식과 다를 수 있음.
  • Eleven v4와 Eleven v4 Turbo는 모두 90개 이상 언어를 지원함. 한 언어로 녹음한 목소리가 다른 언어도 유창하게 말하며, 원래 화자의 정체성을 유지하면서 해당 언어의 원어민 억양을 구사함.
  • 억양 유지 능력이 이전보다 강해져 생성 도중 목소리가 원본 언어의 억양으로 되돌아가는 현상이 줄어듦.
  • 더빙과 현지화에서는 유명 배우의 목소리나 회사 스타일에 맞춘 음색 등 선택한 브랜드 목소리를 Eleven v4가 지원하는 모든 언어에서 활용할 수 있음.

더 진정성 있고 일관된 음성 복제

  • Eleven v4와 Eleven v4 Turbo는 음성 복제의 진정성·성능·일관성을 높이고, 원본 목소리와의 화자 유사도를 크게 개선함.
  • 인스턴트 음성 복제(Instant Voice Clones)는 10초 분량의 오디오만으로도 높은 충실도의 목소리를 포착함.
  • 여러 세대에 걸친 생성, 대화, 내레이션, 재생성된 대사에서도 화자 정체성을 더 안정적으로 유지함. 장편 프로젝트에서 캐릭터·내레이터·복제 음성이 제작 전반에 걸쳐 일관성을 유지함.
  • 최고 수준의 충실도가 필요한 복제 용도를 위해 전문 음성 복제(Professional Voice Clones, PVC) 지원을 추가함.
  • 긴 콘텐츠를 위해 여러 생성을 이어 붙이는 요청 연결(request stitching)의 신뢰성도 크게 개선돼 ElevenLabs Studio와 ElevenLabs Reader App의 작업 경험이 향상됨.

직접 차이 확인

  • Eleven v4와 Eleven v4 Turbo는 표현력 있는 음성 생성 연구의 최신 성과를 반영한 모델임.
  • 오디오북, 캐릭터 연기, 보이스오버, 더빙, 대화형 에이전트 현지화 등 단어만큼 전달 방식도 중요한 콘텐츠에 맞춰 설계됨.
  • 두 모델은 현재 ElevenAgents, ElevenCreative, ElevenAPI에서 이용 가능함.