Modely a platformy AI

ElevenLabs uvádí Eleven V4 s variantou Turbo s nízkou latencí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

ElevenLabs 28. září 2026 spustil Eleven v4, model převodu textu na řeč, který společnost popisuje jako dosud nejvíce emotivní, a Eleven v4 Turbo, variantu s nízkou latencí určenou pro hlasové agenty a použití v reálném čase. Oba modely jsou okamžitě k dispozici v ElevenAgents, ElevenCreative a přes ElevenAPI, přičemž přístup je zahrnut v bezplatném tarifu.

Příspěvek o uvedení byl napsán Matiem Staniszewskim a Piotrem Dabkowskim a zařazen do kategorie Výzkum společnosti.

Nová architektura zaměřená na expresivitu

ElevenLabs uvádí, že Eleven v4 je postaven na zcela nové architektuře navržené k interpretaci tónu, tempa, emocí, charakteru a kontextu z textu, čímž generuje řeč, která může znít dramaticky, něžně, naléhavě, komicky nebo konverzačně, přičemž zachovává identitu mluvčího. Společnost dále uvádí, že základní kvalita zvuku je ve všech ohledech vyšší než u jejích předchozích modelů.

Podle společnosti je navržena nová metoda zachycení identity mluvčích, která má udržet každou hlasovou stopu konzistentní napříč konverzacemi agentů, audioknihami a reklamami, a kontext na úrovni scény umožňuje mluvčím reagovat na to, co bylo právě řečeno v rozhovoru, což vede k dialogu, který společnost popisuje jako přirozenější než skládání izolovaných vět.

Vložené audio značky nahrazují SSML ovládání

Uživatelé mohou nasměrovat výstup pomocí přirozeného jazyka a vkládat vložené audio značky; příklady společnosti zahrnují smích, řečeno rozhořčeně s francouzským přízvukem, lehký déšť a bzučení telefonu. ElevenLabs uvádí, že model tyto audio značky a pokyny v přirozeném jazyce dodržuje přesněji než předchozí modely. Podpora fonémů Mezinárodní fonetické abecedy byla výrazně vylepšena, takže vlastní výslovnosti fungují spolehlivěji, a vývojářská dokumentace ElevenLabs pokrývá kompletní syntaxi značek pro použití v API. Podle častých otázek na stránce produktu jsou SSML značky jako <break> jsou v Eleven v4 zakázány, přičemž místo nich slouží jako řídící mechanismus značky v přirozeném jazyce.

Turbo varianta a měření latence

Pro použití v reálném čase ElevenLabs uvádí, že jeho výzkumné a inženýrské týmy optimalizovaly Eleven v4 Turbo společně s konverzační platformou ElevenAgents jako jeden systém. Turbo podporuje obousměrné streamování, takže audio začíná být vráceno ještě před dokončením věty.

Metodologie uvedená v poznámce k oznámení uvádí, že Eleven v4 Turbo dosáhl mediánové doby do první řeči přibližně 150 milisekund v testech v září 2026 provedených přes WebSocket streamování se stejnými skripty a výchozími nastaveními proti modelům Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS a OpenAI GPT‑4o mini TTS, přičemž síťová latence byla měřena a odečtena u všech systémů. Srovnávací graf na produktové stránce společnosti uvádí 150 ms jako referenční hodnotu oproti uvedeným 262 ms pro Cartesia Sonic 3.6 a 814 ms pro OpenAI GPT‑4o mini TTS. Oznámení také uvádí mediánovou inferenční latenci přibližně 100 ms pro Turbo, což společnost uvádí jako rychlejší než průměrná pauza mezi dvěma lidmi při rozhovoru.

Jazyky, klonování hlasu a dlouhý audio obsah

Oba modely podporují více než 90 jazyků. Společnost uvádí, že hlas nahraný v jednom jazyce nyní plynule mluví i ostatními jazyky a přitom přijímá přízvuk rodilého mluvčího, a že dodržování přízvuku se již během generace nevrací zpět k původnímu přízvuku.

Podle společnosti mohou Instant Voice Clones nyní zachytit hlas s vysokou věrností z 10 sekund audiozáznamu, přičemž také uvádí, že překonávají Professional Voice Clones modelu Multilingual v2. Professional Voice Clones, které nebyly k dispozici v Eleven v3, jsou opět podporovány a fungují s plným emocionálním rozsahem modelu. Každý klon, ať už okamžitý nebo profesionální, vyžaduje ověřený souhlas vlastníka hlasu a generované audio je pokryto technologií AI Speech Classifier od ElevenLabs, kterou společnost uvádí, že dokáže rozpoznat jako AI‑generované.

Společnost uvádí, že request stitching, tj. řetězení generací pro delší obsah, je v Eleven v4 výrazně spolehlivější, což zlepšuje práci v ElevenLabs Studio a aplikaci ElevenLabs Reader. Jedna generace podporuje až 10 000 znaků, přičemž kontextové spojování udržuje tempo a doručení konzistentní napříč delšími skripty.

Výsledky benchmarků hlášené společností

ElevenLabs uvádí, že Eleven v4 obsadil první místo v žebříčku Voice Arena od Artificial Analysis Provider za září 2026 a byl preferován přibližně 75 % posluchačů v slepých testech tváří v tvář. Metodologie uvedená v poznámce uvádí, že tyto testy v září 2026 postavily model proti modelům Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS a Google Gemini 3.8 Flash TTS, přičemž hodnotitelé slyšeli stejnou větu od Eleven v4 i od jednoho konkurenta prezentovaného slepě a posuzovali, který je expresivnější a který zní přirozeněji; při remíze se počítalo jako polovina. Graf v oznámení uvádí, že Eleven v4 vyhrál 65 %–81 % těchto soubojů.

Přístup k API, ceny a soulad s předpisy

Oba modely jsou přístupné přes REST a streamingové koncové body s SDK pro TypeScript a Python a vývojáři mohou přepínat mezi modely pomocí jediného model_id. Výstupní formáty odpovídají všem ostatním modelům ElevenLabs: MP3, nekomprimovaný WAV/PCM pro studiovou a postprodukční práci a µ-law pro telefonii a integrace call‑center, přičemž vzorkovací frekvence a bitrate jsou nastaveny přes API.

Cenová struktura následuje stejný kreditní model jako u ostatních modelů text‑to‑speech společnosti: bezplatná úroveň s 10 000 kredity za měsíc, což společnost přibližně rovná 10 minutám audia; placené plány od $6 za měsíc, které zahrnují profesionální klonování hlasu; a individuální cenová nabídka pro podniky. Každý hlas v knihovně společnosti, která obsahuje více než 17 500 hlasů, funguje s Eleven v4, i když instantní a profesionální klony vytvořené před spuštěním je třeba přeškolit, aby s novým modelem fungovaly efektivně.

ElevenLabs uvádí, že Eleven v4 běží na infrastruktuře certifikované podle SOC 2 Type II, ISO 27001 a PCI DSS Level 1, je v souladu s GDPR a nabízí workflow kompatibilní s HIPAA pro zdravotnictví, neprovádí trénink na skriptech nebo audio tagách bez souhlasu a poskytuje režim Zero Retention Mode pro oprávněné podnikové služby.

Stránka produktu Eleven v4 obsahuje prohlášení od uvedených zákazníků, včetně Ryana Petersona, SVP produktu pro Agentforce Voice ve společnosti Salesforce, který řekl: “Právě zde vidíme, jak Eleven v4 Turbo posouvá laťku výše, s rychlejšími a přirozenějšími odpověďmi, které splňují standard, který naši zákazníci očekávají.” Zakladatel BeyondWords Patrick O’Flaherty, vedoucí produktů pro budování úvěru ve Spring Financial Oscar Daniels a vedoucí hudby a audia v Accenture Accelerate Kyle Gudmundson také poskytli prohlášení o nových modelech.

ElevenLabs nasměruje vývojáře na svou dokumentaci, kde najdou úplnou syntaxi audio-tag a podrobnosti o integraci API.

Jonas Reeve je analytik vytvořený umělou inteligencí ve Unite.AI, zaměřuje se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojové inteligence. Jeho práce zkoumá, jak se učení, uvažování, paměť a abstrakce objevují jak v biologických, tak v umělých systémech, a vytváří spojení mezi moderními architekturami AI a dlouhodobými otázkami kognitivní vědy a filozofie mysli.

S konceptuálním a reflexivním přístupem Jonas zkoumá rámce jako modely uvažování, agentické systémy, emergentní kognice a teorii zarovnání, s cílem objasnit, co skutečně znamená pokrok směrem k AGI – a co ne. Místo honby za termíny nebo hype zdůrazňuje první principy, konceptuální přísnost a limity současných modelů.

Články napsané Jonasem Reeve jsou generovány AI a jsou recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, srozumitelnost a odpovědnou diskusi o pokročilých konceptech AI.