AI 모델 및 플랫폼

ElevenLabs, 저지연 터보 변형인 Eleven V4 출시

mm
Unite.AI를 Google의 선호 소스에 추가

ElevenLabs는 2026년 9월 28일 Eleven v4를 출시했으며, 이는 회사가 지금까지 가장 감성적이라고 설명하는 텍스트‑투‑스피치 모델이며, 저지연 변형인 Eleven v4 Turbo는 음성 에이전트와 실시간 사용을 위해 설계되었습니다. 두 모델은 ElevenAgents, ElevenCreative, 그리고 ElevenAPI를 통해 즉시 이용 가능하며, 무료 계정 등급에서도 접근할 수 있습니다.

출시 게시물은 Mati Staniszewski와 Piotr Dabkowski가 작성했으며, 회사의 Research 카테고리에 등록되었습니다.

표현력에 초점을 맞춘 새로운 아키텍처

ElevenLabs에 따르면 Eleven v4는 텍스트에서 어조, 속도, 감정, 캐릭터 및 맥락을 해석하도록 설계된 완전히 새로운 아키텍처 위에 구축되었으며, 연설자는 화자의 정체성을 유지하면서도 극적이거나 부드럽거나 긴박하거나 코믹하거나 대화체로 들릴 수 있는 음성을 생성합니다. 회사는 기본 오디오 충실도가 이전 모델보다 전반적으로 더 높다고 밝혔습니다.

회사에 따르면 화자 정체성을 포착하는 새로운 방법은 에이전트 대화, 오디오북, 광고 전반에 걸쳐 각 음성을 일관되게 유지하도록 설계되었으며, 장면 수준의 맥락을 통해 화자는 대화 중 방금 언급된 내용에 반응할 수 있어, 회사가 말하길 고립된 문장을 조합하는 것보다 더 자연스러운 대화를 만들어냅니다.

인라인 오디오 태그가 SSML 제어를 대체

사용자는 자연어로 전달 방식을 지정하고 인라인 오디오 태그를 삽입할 수 있으며, 회사가 제시한 예시로는 웃음, 프랑스 억양으로 화난 말투, 가벼운 빗소리, 전화 진동 등이 있습니다. ElevenLabs는 이 모델이 이러한 오디오 태그와 지시 프롬프트를 이전 모델보다 더 정확하게 따른다고 밝혔습니다. 국제 음성 기호(IPA) 음소 지원이 크게 개선되어 맞춤 발음이 보다 신뢰성 있게 동작하며, ElevenLabs 개발자 문서에는 API 사용을 위한 전체 태그 구문이 포함되어 있습니다. 제품 페이지 FAQ에 따르면 SSML 태그는 다음과 같습니다. <break> Eleven v4에서는 비활성화되어 있으며, 대신 자연어 태그가 제어 메커니즘으로 사용됩니다.

터보 변형 및 지연 측정

실시간 사용을 위해 ElevenLabs는 연구 및 엔지니어링 팀이 Eleven v4 Turbo를 ElevenAgents 대화 플랫폼과 하나의 시스템으로 최적화했다고 밝혔습니다. Turbo는 양방향 스트리밍을 지원하여 문장이 끝나기 전에 오디오가 반환되기 시작합니다.

발표에 첨부된 방법론에 따르면, Eleven v4 Turbo는 2026년 9월에 WebSocket 스트리밍을 통해 동일한 스크립트와 기본 설정으로 진행된 테스트에서 최초 발화까지의 중앙값이 약 150밀리초였으며, 비교 대상은 Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS, 그리고 OpenAI GPT‑4o mini TTS였고, 모든 시스템의 네트워크 지연은 측정 후 제거되었습니다. 회사 제품 페이지의 비교 차트는 Cartesia Sonic 3.6의 262밀리초, OpenAI GPT‑4o mini TTS의 814밀리초에 대비해 150밀리초를 기준값으로 제시하고 있습니다. 발표에서는 또한 Turbo의 중앙 추론 지연이 약 100밀리초라고 언급했으며, 이는 두 사람이 대화할 때 평균적인 멈춤보다 빠른 수치라고 회사는 말합니다.

언어, 음성 클로닝 및 장시간 오디오

두 모델 모두 90개 이상의 언어를 지원합니다. 회사에 따르면 한 언어로 녹음된 음성이 이제 다른 언어를 유창하게 구사하면서 원어민의 억양을 그대로 적용하며, 세대가 진행되는 동안 억양이 원래 억양으로 다시 돌아가는 현상이 더 이상 발생하지 않는다고 합니다.

회사에 따르면 Instant Voice Clones는 이제 10초 분량의 오디오만으로도 높은 충실도의 음성을 포착할 수 있으며, 이는 Multilingual v2 모델의 Professional Voice Clones보다 성능이 우수하다고 합니다. Eleven v3에서 제공되지 않았던 Professional Voice Clones가 다시 지원되며, 모델의 전체 감정 범위를 구현합니다. 즉시 클론이든 전문 클론이든 모든 복제는 음성 소유자의 검증된 동의를 필요로 하며, 생성된 오디오는 ElevenLabs의 AI Speech Classifier 기술에 의해 AI 생성음으로 감지될 수 있다고 회사는 밝혔습니다.

회사에 따르면 Eleven v4에서는 요청 스티칭, 즉 여러 생성 결과를 연결해 장시간 콘텐츠를 만드는 기능이 크게 향상되어 ElevenLabs Studio와 ElevenLabs Reader App에서의 작업 경험이 개선되었습니다. 한 번의 생성은 최대 10,000자를 지원하며, 컨텍스트 스티칭을 통해 긴 스크립트에서도 속도와 전달이 일관되게 유지됩니다.

회사 보고 벤치마크 결과

ElevenLabs는 Eleven v4가 2026년 9월 Artificial Analysis Provider Voice Arena 순위표에서 1위를 차지했으며, 블라인드 1대1 테스트에서 청취자 약 75%가 선호했다고 보고했습니다. 각주에 명시된 방법론에 따르면 해당 9월 테스트에서는 모델을 Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS, 그리고 Google Gemini 3.8 Flash TTS와 비교했으며, 평가자는 Eleven v4와 경쟁 모델의 동일한 문장을 블라인드로 듣고 어느 쪽이 더 표현력이 풍부하고 자연스러운지 판단했으며, 동점은 절반으로 계산되었습니다. 발표에 포함된 차트는 Eleven v4가 이러한 매치업에서 65%‑81%의 승률을 기록했다고 나타냅니다.

API 접근, 가격 및 컴플라이언스

두 모델은 TypeScript 및 Python SDK와 함께 REST 및 스트리밍 엔드포인트를 통해 접근할 수 있으며, 개발자는 단일 model_id로 모델 간 전환이 가능합니다. 출력 형식은 다른 ElevenLabs 모델과 동일하며, MP3, 스튜디오 및 후반 작업용 비압축 WAV/PCM, 그리고 전화 및 콜센터 통합용 µ-law가 지원되며, 샘플 레이트와 비트레이트는 API를 통해 설정됩니다.

가격은 회사의 다른 텍스트‑투‑스피치 모델과 동일한 크레딧 구조를 따릅니다: 월 10,000 크레딧의 무료 티어(이는 약 10분 분량의 오디오에 해당)와, 월 $6부터 시작하는 전문 음성 클로닝을 포함한 유료 플랜, 그리고 맞춤형 기업 가격이 제공됩니다. 17,500개가 넘는 음성 라이브러리의 모든 음성은 Eleven v4와 호환되지만, 출시 이전에 만든 즉시 및 전문 클론은 새로운 모델에 효과적으로 작동하도록 재학습이 필요합니다.

ElevenLabs는 Eleven v4가 SOC 2 Type II, ISO 27001, PCI DSS Level 1 인증 인프라에서 운영되며, 의료 분야에 대한 HIPAA 적격 워크플로와 GDPR을 준수하고, 동의 없이 스크립트나 오디오 태그를 학습하지 않으며, 해당 기업 서비스에 대해 Zero Retention Mode를 제공한다고 밝혔습니다.

The Eleven v4 제품 페이지는 명시된 고객들의 발언을 담고 있으며, Salesforce의 Agentforce Voice 제품 담당 SVP인 Ryan Peterson은 “바로 이것이 우리가 Eleven v4 Turbo가 기준을 높이고 있다는 것을 보는 지점이며, 더 빠르고 자연스러운 응답으로 고객이 기대하는 표준을 충족합니다”라고 말했습니다. BeyondWords 공동 설립자 Patrick O’Flaherty, Spring Financial의 신용 구축 제품 담당 책임자 Oscar Daniels, 그리고 Accenture Accelerate의 음악·오디오 책임자 Kyle Gudmundson도 새로운 모델에 대한 발언을 제공했습니다.

ElevenLabs는 개발자에게 전체 audio-tag 구문 및 API 통합 세부 정보를 위한 문서를 참조하도록 안내합니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.