Modele și platforme AI
ElevenLabs lansează Eleven V4 cu varianta Turbo cu latență redusă

ElevenLabs a lansat pe 28 septembrie 2026 Eleven v4, un model text‑to‑speech pe care compania îl descrie ca fiind cel mai expresiv de până acum, și Eleven v4 Turbo, o variantă cu latență redusă concepută pentru agenți vocali și utilizare în timp real. Ambele modele sunt disponibile imediat în ElevenAgents, ElevenCreative și prin ElevenAPI, cu acces inclus în nivelul gratuit al contului.
Postarea de lansare a fost scrisă de Mati Staniszewski și Piotr Dabkowski și înregistrată în categoria Cercetare a companiei.
O arhitectură nouă orientată spre expresivitate
ElevenLabs afirmă că Eleven v4 este construit pe o arhitectură complet nouă, concepută să interpreteze tonul, ritmul, emoția, caracterul și contextul din text, generând vorbire care poate suna dramatic, delicat, urgent, comic sau conversațional, menținând în același timp identitatea vorbitorului. Compania susține că fidelitatea audio de bază este mai mare în toate aspectele comparativ cu modelele anterioare.
Conform companiei, o nouă metodă de capturare a identităților vorbitorilor este concepută să mențină fiecare voce consecventă în conversațiile cu agenți, cărțile audio și reclamele, iar contextul la nivel de scenă permite vorbitorilor să răspundă la ceea ce tocmai s-a spus într-o discuție, producând dialoguri pe care compania le descrie ca fiind mai naturale decât asamblarea de fraze izolate.
Etichetele audio în linie înlocuiesc controalele SSML
Utilizatorii pot direcționa livrarea în limbaj natural și pot încorpora etichete audio în linie; exemplele companiei includ râsete, „spus cu furie în accent francez”, ploaie ușoară și vibrație de telefon. ElevenLabs afirmă că modelul urmează aceste etichete audio și comenzile de direcție mai precis decât modelele anterioare. Suportul pentru foneme din Alfabetul Fonetic Internațional a fost îmbunătățit semnificativ, astfel încât pronunțiile personalizate se comportă mai fiabil, iar documentația pentru dezvoltatori ElevenLabs acoperă sintaxa completă a etichetelor pentru utilizarea API-ului. Conform secțiunii FAQ de pe pagina de produs, etichetele SSML, cum ar fi <break> sunt dezactivate în Eleven v4, iar etichetele în limbaj natural servesc în schimb ca mecanism de control.
Varianta Turbo și măsurătorile de latență
Pentru utilizare în timp real, ElevenLabs afirmă că echipele sale de cercetare și inginerie au optimizat Eleven v4 Turbo împreună cu platforma conversațională ElevenAgents ca un singur sistem. Turbo suportă streaming bidirecțional, astfel încât audio începe să fie returnat înainte ca o propoziție să se încheie.
Metodologia notată în anunț indică faptul că Eleven v4 Turbo a înregistrat un timp median până la prima vorbire de aproximativ 150 de milisecunde în testele din septembrie 2026 desfășurate prin streaming WebSocket cu scripturi identice și setări implicite, comparativ cu Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS și OpenAI GPT‑4o mini TTS, cu latența rețelei măsurată și eliminată pentru toate sistemele. Graficul comparativ de pe pagina de produs a companiei afișează 150 ms ca valoare de referință, în contrast cu 262 ms declarate pentru Cartesia Sonic 3.6 și 814 ms pentru OpenAI GPT‑4o mini TTS. Anunțul menționează, de asemenea, o latență mediană de inferență de aproximativ 100 ms pentru Turbo, o cifră pe care compania o susține că este mai rapidă decât pauza medie dintre două persoane care vorbesc.
Limbi, clonare vocală și audio de lungă durată
Ambele modele suportă peste 90 de limbi. Compania afirmă că o voce înregistrată într-o limbă poate acum să vorbească fluent alte limbi, adoptând accentul vorbitorului nativ, iar respectarea accentului nu mai devine în timp un accent al limbii de origine.
Instant Voice Clones pot acum captura o voce cu fidelitate înaltă din 10 secunde de audio, conform companiei, care spune, de asemenea, că acestea depășesc Professional Voice Clones ale modelului său Multilingual v2. Professional Voice Clones, care nu erau disponibile în Eleven v3, sunt din nou suportate și funcționează cu întreaga gamă emoțională a modelului. Fiecare clonă, instant sau profesională, necesită consimțământ verificat din partea proprietarului vocii, iar audio generat este acoperit de tehnologia AI Speech Classifier a ElevenLabs, pe care compania susține că poate detecta că este generat de AI.
Îmbinarea cererilor, adică concatenarea generațiilor pentru conținut de lungă durată, este semnificativ mai fiabilă în Eleven v4, conform companiei, îmbunătățind experiența de lucru în ElevenLabs Studio și în aplicația ElevenLabs Reader. O singură generație suportă până la 10.000 de caractere, iar îmbinarea contextului menține ritmul și livrarea consecventă pe parcursul scripturilor mai lungi.
Rezultatele benchmark-urilor raportate de companie
ElevenLabs raportează că Eleven v4 a ocupat primul loc pe clasamentul Voice Arena al Artificial Analysis Provider pentru septembrie 2026 și a fost preferat de aproximativ 75% dintre ascultători în teste oarbe față‑în‑față. Metodologia notată explică faptul că testele din septembrie 2026 au comparat modelul cu Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS și Google Gemini 3.8 Flash TTS, evaluatorii au auzit aceeași frază de la Eleven v4 și de la un concurent prezentat în mod anonim, judecând care a fost mai expresiv și care a sunat mai natural, iar egalitățile au fost numărate ca jumătate. Un grafic din anunț indică faptul că Eleven v4 a câștigat între 65% și 81% din aceste confruntări.
Acces API, prețuri și conformitate
Ambele modele sunt accesibile prin puncte finale REST și de streaming, cu SDK-uri pentru TypeScript și Python, iar dezvoltatorii pot comuta între modele cu un singur model_id. Formatele de ieșire corespund tuturor celorlalte modele ElevenLabs: MP3, WAV/PCM necomprimat pentru lucru în studio și post-producție și µ-law pentru telecomunicații și integrări în centre de apel, cu rata de eșantionare și bitrate setate prin API.
Prețurile urmează aceeași structură de credite ca și celelalte modele de text‑to‑speech ale companiei: un nivel gratuit cu 10.000 de credite pe lună, pe care compania îl echivalează cu aproximativ 10 minute de audio; planuri plătite începând de la 6 $ pe lună, care includ clonarea vocală profesională; și prețuri personalizate pentru întreprinderi. Fiecare voce din biblioteca companiei, care conține peste 17.500 de voci, funcționează cu Eleven v4, deși clonele instant și profesionale create înainte de lansare trebuie reantrenate pentru a funcționa eficient cu noul model.
ElevenLabs declară că Eleven v4 rulează pe o infrastructură certificată SOC 2 Type II, ISO 27001 și PCI DSS Level 1, este conformă cu GDPR și dispune de fluxuri de lucru eligibile HIPAA pentru domeniul sănătății, nu se antrenează pe scripturi sau etichete audio fără consimțământ și oferă modul Zero Retention pentru serviciile enterprise eligibile.
Paragraful pagina produsului Eleven v4 conține declarații de la clienți numiți, inclusiv Ryan Peterson, SVP de produs pentru Agentforce Voice la Salesforce, care a spus: „Exact acolo vedem cum Eleven v4 Turbo ridică nivelul, cu răspunsuri mai rapide și mai naturale, care îndeplinesc standardul pe care clienții noștri îl așteaptă.” Co-fondatorul BeyondWords, Patrick O’Flaherty, șeful produselor de construire a creditului la Spring Financial, Oscar Daniels, și liderul de muzică și audio la Accenture Accelerate, Kyle Gudmundson, au oferit, de asemenea, declarații privind noile modele.
ElevenLabs îndrumă dezvoltatorii către documentația sa pentru sintaxa completă a etichetelor audio și detaliile de integrare API.












