AI-modellen en platforms
ElevenLabs lanceert Eleven V4 met lage‑latentie Turbo‑variant

ElevenLabs heeft op 28 september 2026 Eleven v4 gelanceerd, een tekst‑naar‑spraakmodel dat het bedrijf beschrijft als het meest emotionele tot nu toe, en Eleven v4 Turbo, een lage‑latentie‑variant ontworpen voor spraak‑agents en realtime gebruik. Beide modellen zijn direct beschikbaar in ElevenAgents, ElevenCreative en via ElevenAPI, met toegang inbegrepen in de gratis account‑laag.
Het lanceerbericht is geschreven door Mati Staniszewski en Piotr Dabkowski en geplaatst in de categorie Onderzoek van het bedrijf.
Een nieuwe architectuur gericht op expressiviteit
ElevenLabs stelt dat Eleven v4 is gebouwd op een volledig nieuwe architectuur die is ontworpen om toon, tempo, emotie, karakter en context uit tekst te interpreteren, waardoor spraak kan klinken als dramatisch, teder, urgent, komisch of conversatief, terwijl de identiteit van de spreker behouden blijft. Het bedrijf meldt dat de onderliggende geluidsfideliteit overal hoger is dan in eerdere modellen.
Volgens het bedrijf is een nieuwe methode om sprekeridentiteiten vast te leggen ontworpen om elke stem consistent te houden in agentgesprekken, audioboeken en advertenties, en context op scenenniveau stelt sprekers in staat te reageren op wat net gezegd is in een gesprek, waardoor dialoog ontstaat die het bedrijf beschrijft als natuurlijker dan het samenvoegen van geïsoleerde zinnen.
Inline‑audio‑tags vervangen SSML‑besturingselementen
Gebruikers kunnen de levering in natuurlijke taal sturen en inline‑audio‑tags insluiten; voorbeelden van het bedrijf omvatten lachgeluiden, gezegd boos met een Frans accent, zacht regen en een trilende telefoon. ElevenLabs meldt dat het model deze audio‑tags en richtingsopdrachten nauwkeuriger volgt dan eerdere modellen. De ondersteuning voor fonemen van het Internationaal Fonetisch Alfabet is aanzienlijk verbeterd, zodat aangepaste uitspraken betrouwbaarder werken, en de ontwikkelaarsdocumentatie van ElevenLabs behandelt de volledige tagsyntaxis voor API‑gebruik. Volgens de FAQ op de productpagina zijn SSML‑tags zoals <break> zijn uitgeschakeld in Eleven v4, waarbij natuurlijke‑taal‑tags in plaats daarvan dienen als besturingsmechanisme.
Turbo‑variant en latentie‑metingen
Voor realtime gebruik zegt ElevenLabs dat zijn onderzoek‑ en engineeringteams Eleven v4 Turbo hebben geoptimaliseerd in combinatie met het ElevenAgents‑conversatieplatform als één systeem. Turbo ondersteunt bidirectionele streaming, zodat audio al terugkomt voordat een zin is voltooid.
De voetnootmethodologie van de aankondiging stelt dat Eleven v4 Turbo een mediane tijd tot eerste spraak van ongeveer 150 milliseconden behaalde in tests in september 2026 die werden uitgevoerd via WebSocket‑streaming met identieke scripts en standaardinstellingen tegen Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS en OpenAI GPT‑4o mini TTS, waarbij netwerklatentie werd gemeten en voor alle systemen werd verwijderd. Het vergelijkingsdiagram op de productpagina van het bedrijf vermeldt 150 ms als referentiewaarde tegenover een opgegeven 262 ms voor Cartesia Sonic 3.6 en 814 ms voor OpenAI GPT‑4o mini TTS. De aankondiging citeert afzonderlijk een mediane inferentielatentie van ongeveer 100 ms voor Turbo, een cijfer dat het bedrijf aangeeft sneller te zijn dan de gemiddelde pauze tussen twee sprekende personen.
Talen, stemklonen en lange‑vorm audio
Beide modellen ondersteunen meer dan 90 talen. Het bedrijf meldt dat een stem die in één taal is opgenomen nu vloeiend andere talen spreekt terwijl hij het accent van een moedertaalspreker overneemt, en dat de naleving van dat accent niet meer terugschuift naar het oorspronkelijke accent gedurende een generatie.
Instant Voice Clones kunnen nu een stem met hoge fideliteit vastleggen uit 10 seconden audio, meldt het bedrijf, dat tevens aangeeft dat ze beter presteren dan de Professional Voice Clones van het Multilingual v2‑model. Professional Voice Clones, die niet beschikbaar waren in Eleven v3, worden weer ondersteund en leveren prestaties met het volledige emotionele bereik van het model. Elke kloon, instant of professioneel, vereist geverifieerde toestemming van de eigenaar van de stem, en gegenereerde audio valt onder de AI Speech Classifier‑technologie van ElevenLabs, die het bedrijf zegt te kunnen detecteren als AI‑gegenereerd.
Request stitching, het aaneenschakelen van generaties voor langere content, is volgens het bedrijf aanzienlijk betrouwbaarder in Eleven v4, waardoor de ervaring in ElevenLabs Studio en de ElevenLabs Reader‑app verbetert. Een enkele generatie ondersteunt tot 10.000 tekens, waarbij context‑stitching het tempo en de levering consistent houdt over langere scripts.
Door het bedrijf gerapporteerde benchmarkresultaten
ElevenLabs meldt dat Eleven v4 in september 2026 op de Artificial Analysis Provider Voice Arena Leaderboard op de eerste plaats eindigde en door ongeveer 75 % van de luisteraars werd geprefereerd in blinde head‑to‑head‑tests. De met voetnoten onderbouwde methodologie stelt dat die tests in september 2026 het model tegenover Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS en Google Gemini 3.8 Flash TTS plaatsten, waarbij beoordelaars dezelfde regel van Eleven v4 en één concurrent blinde hoorden, oordeelden welke expressiever was en welke natuurlijker klonk, en gelijke scores als een halve tel werden geteld. Een diagram in de aankondiging geeft aan dat Eleven v4 65 %‑81 % van die confrontaties won.
API‑toegang, prijzen en naleving
Beide modellen zijn toegankelijk via REST- en streaming‑endpoints met TypeScript- en Python‑SDK’s, en ontwikkelaars schakelen tussen modellen met één enkele model_id. Uitvoerformaten zijn hetzelfde als bij alle andere ElevenLabs‑modellen: MP3, ongecomprimeerde WAV/PCM voor studio‑ en post‑productiewerk, en µ-law voor telefonie‑ en call‑center‑integraties, met sample‑rate en bitrate ingesteld via de API.
De prijsstructuur volgt dezelfde credit‑structuur als de andere tekst‑naar‑spraak‑modellen van het bedrijf: een gratis tier met 10.000 credits per maand, wat het bedrijf gelijkstelt aan ongeveer 10 minuten audio; betaalde abonnementen vanaf $6 per maand die professionele stem‑cloning omvatten; en aangepaste enterprise‑prijzen. Elke stem in de bibliotheek van meer dan 17.500 stemmen van het bedrijf werkt met Eleven v4, hoewel instant‑ en professionele clones die vóór de lancering zijn gemaakt opnieuw moeten worden getraind om effectief met het nieuwe model te werken.
ElevenLabs meldt dat Eleven v4 draait op infrastructuur gecertificeerd volgens SOC 2 Type II, ISO 27001 en PCI DSS Level 1, GDPR‑compliant is met HIPAA‑geschikte workflows voor de gezondheidszorg, niet traint op scripts of audio‑tags zonder toestemming, en Zero Retention Mode biedt voor in aanmerking komende enterprise‑diensten.
De Eleven v4 productpagina bevat uitspraken van genoemde klanten, waaronder Ryan Peterson, SVP product voor Agentforce Voice bij Salesforce, die zei: “Dat is precies waar we zien dat Eleven v4 Turbo de lat hoger legt, met snellere, natuurlijkere reacties die voldoen aan de standaard die onze klanten verwachten.” BeyondWords‑medeoprichter Patrick O’Flaherty, Spring Financial‑hoofd credit‑building producten Oscar Daniels, en Accenture Accelerate‑muziek‑ en audio‑lead Kyle Gudmundson hebben ook uitspraken gegeven over de nieuwe modellen.
ElevenLabs verwijst ontwikkelaars naar de documentatie voor de volledige audio‑tag‑syntaxis en API‑integratiedetails.












