Модели и платформы ИИ

ElevenLabs представляет Eleven V4 с низколатентным Turbo‑вариантом

mm
Добавьте Unite.AI в избранные источники в Google

ElevenLabs 28 сентября 2026 года запустила Eleven v4, модель преобразования текста в речь, которую компания описывает как самую эмоциональную на сегодняшний день, а также Eleven v4 Turbo — низколатентный вариант, предназначенный для голосовых агентов и использования в реальном времени. Оба модели доступны сразу в ElevenAgents, ElevenCreative и через ElevenAPI, при этом доступ включён в бесплатный тарифный план.

Пост о запуске был написан Мати Станишевским и Пётром Дабковским и размещён в категории «Research» компании.

Новая архитектура, ориентированная на выразительность

ElevenLabs заявляет, что Eleven v4 построена на полностью новой архитектуре, разработанной для интерпретации тона, ритма, эмоций, характера и контекста текста, генерируя речь, которая может звучать драматично, нежно, срочно, комично или разговорно, при этом сохраняет идентичность говорящего. Компания утверждает, что базовое качество аудио выше во всех аспектах по сравнению с её предыдущими моделями.

Новый метод захвата идентичности говорящего разработан для поддержания согласованности каждого голоса в диалогах агентов, аудиокнигах и рекламных роликах, согласно компании, а контекст на уровне сцен позволяет ораторам реагировать на только что произнесённое в разговоре, создавая диалог, который, по словам компании, выглядит более естественно, чем сборка изолированных реплик.

Встроенные аудио‑теги заменяют элементы управления SSML

Пользователи могут задавать доставку естественным языком и встраивать встроенные аудио‑теги; примеры компании включают смех, реплику «сказал сердито с французским акцентом», лёгкий дождь и звон телефона. ElevenLabs утверждает, что модель следует этим аудио‑тегам и директивным подсказкам точнее, чем её предыдущие модели. Поддержка фонем Международного фонетического алфавита была значительно улучшена, чтобы пользовательские произношения работали надёжнее, а документация разработчика ElevenLabs охватывает полный синтаксис тегов для использования через API. Согласно FAQ на странице продукта, SSML‑теги, такие как <break> отключены в Eleven v4, при этом теги естественного языка выступают вместо них в качестве механизма управления.

Turbo‑вариант и измерения задержки

Для использования в реальном времени ElevenLabs сообщает, что её исследовательские и инженерные команды оптимизировали Eleven v4 Turbo совместно с разговорной платформой ElevenAgents как единую систему. Turbo поддерживает двунаправленную потоковую передачу, поэтому аудио начинает возвращаться ещё до завершения предложения.

В методологии, приведённой в примечании к объявлению, указано, что Eleven v4 Turbo показала медианное время до первой речи около 150 млс в тестах сентября 2026 года, проведённых через потоковую передачу WebSocket с одинаковыми сценариями и настройками по умолчанию против Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS и OpenAI GPT‑4o mini TTS, при этом сетевая задержка измерялась и исключалась для всех систем. Сравнительная таблица на странице продукта компании указывает 150 мс как эталонную величину, против заявленных 262 мс для Cartesia Sonic 3.6 и 814 мс для OpenAI GPT‑4o mini TTS. В отдельном месте объявление приводит медианную задержку вывода около 100 мс для Turbo, что, по словам компании, быстрее средней паузы между двумя говорящими людьми.

Языки, клонирование голоса и длительное аудио

Обе модели поддерживают более 90 языков. Компания заявляет, что голос, записанный на одном языке, теперь свободно говорит на других, принимая акцент носителя, и что соблюдение акцента больше не отклоняется обратно к исходному акценту в процессе генерации.

Instant Voice Clones теперь могут захватывать голос с высоким качеством из 10‑секундного аудио, согласно компании, которая также утверждает, что они превосходят Professional Voice Clones её модели Multilingual v2. Professional Voice Clones, недоступные в Eleven v3, снова поддерживаются и работают с полным эмоциональным диапазоном модели. Каждый клон, мгновенный или профессиональный, требует подтверждённого согласия владельца голоса, а сгенерированное аудио покрывается технологией AI Speech Classifier от ElevenLabs, которую, по словам компании, можно определить как созданное ИИ.

Сшивание запросов, то есть последовательное объединение генераций для более длительного контента, в Eleven v4, по словам компании, значительно надёжнее, улучшая работу в ElevenLabs Studio и приложении ElevenLabs Reader. Одна генерация поддерживает до 10 000 символов, при этом сшивание контекста сохраняет ритм и подачу согласованными в более длинных сценариях.

Результаты бенчмарков, сообщённые компанией

ElevenLabs сообщает, что Eleven v4 заняла первое место в рейтинге Voice Arena от Artificial Analysis Provider за сентябрь 2026 и была предпочтительна примерно 75 процентам слушателей в слепых прямых тестах. В примечании к методологии указано, что эти тесты сентября 2026 сравнивали модель с Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS и Google Gemini 3.8 Flash TTS, при этом оценщики слышали одну и ту же реплику от Eleven v4 и одного конкурента в слепом режиме, определяя, какая звучит более выразительно и естественно, а ничьи учитывались как половина. Диаграмма в объявлении указывает, что Eleven v4 выиграла в 65 %–81 % этих сопоставлений.

Доступ к API, цены и соответствие требованиям

Обе модели доступны через REST и потоковые конечные точки с SDK для TypeScript и Python, и разработчики переключаются между моделями с помощью единственного model_id. Форматы вывода соответствуют всем другим моделям ElevenLabs: MP3, несжатый WAV/PCM для студийной и постпродакшн‑работы, а также µ-law для телефонных и колл‑центр интеграций, при этом частота дискретизации и битрейт задаются через API.

Ценообразование следует той же структуре кредитов, что и у остальных моделей синтеза речи компании: бесплатный уровень с 10 000 кредитами в месяц, что компания приравнивает примерно к 10 минутам аудио; платные планы, начиная с $6 в месяц, включающие профессиональное клонирование голоса; а также индивидуальное корпоративное ценообразование. Каждый голос из библиотеки компании, содержащей более 17 500 голосов, работает с Eleven v4, хотя мгновенные и профессиональные клоны, созданные до запуска, необходимо переобучить для эффективной работы с новой моделью.

ElevenLabs заявляет, что Eleven v4 работает на инфраструктуре, сертифицированной по SOC 2 Type II, ISO 27001 и PCI DSS Level 1, соответствует требованиям GDPR с рабочими процессами, пригодными для HIPAA, в сфере здравоохранения, не обучается на сценариях или аудиотегах без согласия и предлагает режим Zero Retention Mode для подходящих корпоративных сервисов.

страница продукта Eleven v4 содержит заявления от указанных клиентов, включая Райана Питерсона, SVP по продукту Agentforce Voice в Salesforce, который сказал: «Именно здесь мы видим, как Eleven v4 Turbo поднимает планку, предлагая более быстрые и естественные ответы, соответствующие стандарту, который ожидают наши клиенты». Соучредитель BeyondWords Патрик O’Flaherty, руководитель продуктов по построению кредитной истории в Spring Financial Оскар Дэниелс и руководитель музыкального и аудио направления Accenture Accelerate Кайл Гудмундсон также предоставили заявления о новых моделях.

ElevenLabs направляет разработчиков к своей документации, где описан полный синтаксис audio-tag и детали интеграции API.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.