Моделі та платформи ШІ

ElevenLabs запускає Eleven V4 з низьколатентним варіантом Turbo

mm
Додайте Unite.AI до бажаних джерел у Google

ElevenLabs 28 вересня 2026 року запустила Eleven v4, модель текст‑в‑мову, яку компанія описує як найемоційнішу на сьогодні, а також Eleven v4 Turbo, низьколатентний варіант, призначений для голосових агентів та використання в режимі реального часу. Обидві моделі доступні одразу в ElevenAgents, ElevenCreative та через ElevenAPI, при цьому доступ включено у безкоштовний тарифний план.

Пост про запуск був написаний Мати Станішевським та Пйотром Дабковським і розміщений у розділі “Research” компанії.

Нова архітектура, орієнтована на виразність

ElevenLabs стверджує, що Eleven v4 побудована на цілком новій архітектурі, розробленій для інтерпретації тону, темпу, емоцій, характеру та контексту з тексту, генеруючи мову, яка може звучати драматично, ніжно, терміново, комічно або розмовно, зберігаючи ідентичність мовця. Компанія зазначає, що базова якість аудіо вища у всіх аспектах порівняно з її попередніми моделями.

За словами компанії, новий метод захоплення ідентичності мовців розроблений для збереження послідовності кожного голосу в розмовах агентів, аудіокнигах та рекламних роликах, а контекст на рівні сцени дозволяє мовцям реагувати на те, що щойно було сказано в розмові, створюючи діалог, який компанія описує як більш природний, ніж складання окремих реплік.

Вбудовані аудіо‑теги замінюють елементи керування SSML

Користувачі можуть керувати доставкою за допомогою природної мови та вбудовувати вбудовані аудіо‑теги; приклади компанії включають сміх, сказано злісно у французькому акценті, легкий дощ та гудіння телефону. ElevenLabs стверджує, що модель слідує цим аудіо‑тегам та підказкам напрямку точніше, ніж її попередні моделі. Підтримка фонем Міжнародного фонетичного алфавіту була значно покращена, тож індивідуальні вимови працюють більш надійно, а документація розробника ElevenLabs охоплює повний синтаксис тегів для використання в API. За даними FAQ на сторінці продукту, SSML‑теги, такі як <break> вимкнені в Eleven v4, при цьому теги природної мови слугують механізмом керування замість них.

Варіант Turbo і вимірювання затримки

Для використання в режимі реального часу ElevenLabs стверджує, що її дослідницькі та інженерні команди оптимізували Eleven v4 Turbo разом з розмовною платформою ElevenAgents як єдину систему. Turbo підтримує двостороннє потокове передавання, тому аудіо починає повертатися ще до завершення речення.

У методології, зазначеній у примітці оголошення, вказано, що Eleven v4 Turbo продемонстрував медіанний час до першого мовлення приблизно 150 мілісекунд у тестах вересня 2026 року, проведених через потокове передавання WebSocket з ідентичними сценаріями та стандартними налаштуваннями проти Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS та OpenAI GPT‑4o mini TTS, при цьому мережеву затримку виміряли та виключили для всіх систем. Порівняльна діаграма на сторінці продукту компанії вказує 150 мс як референтне значення у порівнянні зі зазначеними 262 мс для Cartesia Sonic 3.6 та 814 мс для OpenAI GPT‑4o mini TTS. Окремо в оголошенні зазначено медіанну затримку виведення приблизно 100 мс для Turbo, що, за словами компанії, швидше середньої паузи між двома людьми під час розмови.

Мови, клонування голосу та довготривале аудіо

Обидві моделі підтримують понад 90 мов. Компанія стверджує, що голос, записаний однією мовою, тепер вільно говорить іншими, при цьому приймаючи акцент носія мови, і що дотримання акценту більше не повертається до вихідного акценту протягом генерації.

Instant Voice Clones тепер можуть захоплювати голос з високою точністю з 10‑секундного аудіо, згідно з компанією, яка також стверджує, що вони перевершують Professional Voice Clones моделі Multilingual v2. Professional Voice Clones, які були недоступні в Eleven v3, знову підтримуються і працюють з повним емоційним діапазоном моделі. Кожен клон, миттєвий або професійний, вимагає підтвердженої згоди власника голосу, а згенероване аудіо підпадає під технологію AI Speech Classifier від ElevenLabs, яку компанія заявляє, що може виявити його як створене ШІ.

Запит‑стеження, об’єднання генерацій для довшого контенту, значно надійніше в Eleven v4, зазначає компанія, покращуючи роботу в ElevenLabs Studio та ElevenLabs Reader App. Одна генерація підтримує до 10 000 символів, при цьому стеження за контекстом зберігає темп і подачу послідовними протягом довших сценаріїв.

Результати бенчмарків, повідомлені компанією

ElevenLabs повідомляє, що Eleven v4 зайняв перше місце у рейтингу Voice Arena від Artificial Analysis Provider за вересень 2026 року і був обраний приблизно 75 відсотками слухачів у сліпих порівняльних тестах. У методології, зазначеній у примітці, вказано, що ці вересневі тести 2026 року протиставляли модель Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS та Google Gemini 3.8 Flash TTS, причому оцінювачі слухали однаковий рядок від Eleven v4 і одного конкурента в сліпому режимі, визначаючи, який звучить виразніше, а який природніше; нічиї рахувалися як половина. Діаграма в оголошенні зазначає, що Eleven v4 виграв у 65 %–81 % цих поєдинків.

Доступ до API, ціноутворення та відповідність

Обидві моделі доступні через REST‑ та потокові кінцеві точки з SDK для TypeScript і Python, і розробники перемикаються між моделями за допомогою одного model_id. Формати виводу збігаються з усіма іншими моделями ElevenLabs: MP3, незжатий WAV/PCM для студійної та постпродакшн роботи, а також µ-law для телефонії та інтеграцій кол‑центрів, при цьому частота дискретизації та бітрейт задаються через API.

Ціноутворення відповідає тій самій кредитній структурі, що й інші моделі текст‑у‑мову компанії: безкоштовний рівень з 10 000 кредитами на місяць, що приблизно відповідає 10 хвилинам аудіо; платні плани, що починаються від $6 на місяць і включають професійне клонування голосу; а також індивідуальне корпоративне ціноутворення. Кожен голос у бібліотеці компанії, що налічує понад 17 500 голосів, працює з Eleven v4, хоча миттєві та професійні клони, створені до запуску, потрібно перенавчити, щоб вони ефективно працювали з новою моделлю.

ElevenLabs заявляє, що Eleven v4 працює на інфраструктурі, сертифікованій за SOC 2 Type II, ISO 27001 та PCI DSS Level 1, відповідає вимогам GDPR з процесами, сумісними з HIPAA, для охорони здоров’я, не навчається на сценаріях або аудіо‑тегах без згоди та пропонує режим Zero Retention для відповідних корпоративних сервісів.

На Eleven v4 сторінка продукту розміщені заяви від іменованих клієнтів, серед яких Раян Петерсон, старший віце‑президент з продукту Agentforce Voice у Salesforce, який сказав: “Саме тут ми бачимо, як Eleven v4 Turbo піднімає планку, забезпечуючи швидші, більш природні відповіді, які відповідають стандарту, який очікують наші клієнти.” Співзасновник BeyondWords Патрік О’Флагері, керівник продуктів зі створення кредиту у Spring Financial Оскар Даніелс та керівник музики та аудіо у Accenture Accelerate Кайл Гудмундсон також надали заяви щодо нових моделей.

ElevenLabs спрямовує розробників до своєї документації щодо повного синтаксису audio‑tag та деталей інтеграції API.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.