AI-modeller og platforme

ElevenLabs lancerer Eleven V4 med lav-latens Turbo-variant

mm
Føj Unite.AI til dine foretrukne kilder på Google

ElevenLabs lancerede den 28. september 2026 Eleven v4, en tekst-til-tale-model, som virksomheden beskriver som den mest følelsesfulde hidtil, samt Eleven v4 Turbo, en lav-latens variant designet til stemmeagenter og realtidsbrug. Begge modeller er tilgængelige med det samme i ElevenAgents, ElevenCreative og via ElevenAPI, med adgang inkluderet i den gratis kontotype.

Lanceringen blev skrevet af Mati Staniszewski og Piotr Dabkowski og arkiveret i virksomhedens forskningskategori.

En ny arkitektur fokuseret på udtryksfuldhed

ElevenLabs siger, at Eleven v4 er bygget på en helt ny arkitektur, der er designet til at fortolke tone, tempo, følelser, karakter og kontekst ud fra tekst og generere tale, der kan lyde dramatisk, blid, presserende, komisk eller samtalende, mens talerens identitet bevares. Virksomheden hævder, at den underliggende lydkvalitet er højere på tværs af alle områder sammenlignet med deres tidligere modeller.

Ifølge virksomheden er en ny metode til indfangning af taleridentiteter designet til at holde hver stemme konsistent på tværs af agent-samtaler, lydbøger og reklamer, og kontekst på sceneniveau giver talere mulighed for at reagere på, hvad der netop blev sagt i en samtale, hvilket skaber dialog, som virksomheden beskriver som mere naturlig end at samle isolerede linjer.

Inline-lyd-tags erstatter SSML-kontroller

Brugere kan styre leveringen med naturligt sprog og indsætte inline-lyd-tags; virksomhedens eksempler omfatter latter, sagde vredt med fransk accent, let regn og telefonvibration. ElevenLabs siger, at modellen følger disse lyd-tags og retningsprompt mere præcist end sine tidligere modeller. Understøttelsen af fonemer fra det internationale fonetiske alfabet er blevet markant forbedret, så brugerdefinerede udtaler fungerer mere pålideligt, og ElevenLabs’ udviklerdokumentation dækker den fulde tagsyntaks til API-brug. Ifølge FAQ’en på produktsiden er SSML-tags såsom <break> deaktiveret i Eleven v4, hvor naturlige sprog-tags i stedet fungerer som kontrolmekanisme.

Turbo-variant og latenstider

Til realtidsbrug siger ElevenLabs, at deres forsknings- og ingeniørteams har optimeret Eleven v4 Turbo sammen med ElevenAgents’ samtaleplatform som ét system. Turbo understøtter tovejstrømning, så lyden begynder at returnere, før en sætning er færdig.

Den meddelelse’s fodnoterede metode angiver, at Eleven v4 Turbo opnåede en median tid til første tale på cirka 150 millisekunder i tests i september 2026 udført over WebSocket-streaming med identiske scripts og standardindstillinger mod Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS og OpenAI GPT-4o mini TTS, hvor netværkslatens blev målt og fjernet for alle systemer. Sammenligningsdiagrammet på virksomhedens produktside angiver 150 ms som referenceværdi mod en angivet 262 ms for Cartesia Sonic 3.6 og 814 ms for OpenAI GPT-4o mini TTS. Meddelelsen nævner desuden en median inferenslatens på omkring 100 ms for Turbo, et tal som virksomheden siger er hurtigere end den gennemsnitlige pause mellem to personer, der taler.

Sprog, stemmekloning og langtidslyd

Begge modeller understøtter mere end 90 sprog. Virksomheden siger, at en stemme optaget på ét sprog nu kan tale andre sprog flydende, mens den bevarer accent fra en indfødt taler, og at denne accentbevarelse ikke længere glider tilbage mod kildeaccenten i løbet af en generering.

Instant Voice Clones kan nu indfange en stemme med høj nøjagtighed fra 10 sekunders lyd, ifølge virksomheden, som også siger, at de overgår de professionelle stemmekloner i deres Multilingual v2-model. Professionelle stemmekloner, som ikke var tilgængelige i Eleven v3, understøttes igen og leverer med modellens fulde følelsesmæssige rækkevidde. Hver klon, både instant og professionel, kræver bekræftet samtykke fra stemmeejeren, og den genererede lyd er dækket af ElevenLabs’ AI Speech Classifier-teknologi, som virksomheden siger kan opdage, at den er AI-genereret.

Anmodnings‑stitching, kædning af generationer sammen for længere indhold, er betydeligt mere pålidelig i Eleven v4, siger virksomheden, hvilket forbedrer oplevelsen af at arbejde i ElevenLabs Studio og ElevenLabs Reader App. En enkelt generation understøtter op til 10.000 tegn, hvor kontekst‑stitching holder tempo og levering konsistente på længere manuskripter.

Virksomheden rapporterede benchmark‑resultater

ElevenLabs rapporterer, at Eleven v4 indtog førstepladsen på Artificial Analysis Provider Voice Arena Leaderboard for september 2026 og blev foretrukket af cirka 75 % af lytterne i blinde side‑om‑side‑tests. Den fodnoterede metode angiver, at de september‑2026‑tests satte modellen op mod Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS og Google Gemini 3.8 Flash TTS, hvor bedømmerne hørte den samme linje fra Eleven v4 og en konkurrent præsenteret blinde, og vurderede hvilken der var mere udtryksfuld og hvilken der lød mere naturlig, mens uafgjorte blev talt som halve. Et diagram i meddelelsen angiver, at Eleven v4 vandt 65 %–81 % af disse sammenligninger.

API-adgang, prisfastsættelse og overholdelse

Begge modeller er tilgængelige via REST- og streaming‑endpoints med TypeScript‑ og Python‑SDK’er, og udviklere skifter mellem modeller med et enkelt model_id. Output‑formaterne svarer til alle andre ElevenLabs‑modeller: MP3, ukomprimeret WAV/PCM til studie‑ og efterproduktionsarbejde samt µ-law til telefoni‑ og call‑center‑integrationer, med prøvehastighed og bitrate indstillet via API’en.

Priserne følger den samme kreditstruktur som virksomhedens andre tekst‑til‑tale‑modeller: et gratis niveau med 10.000 kreditter pr. måned, hvilket virksomheden svarer til cirka 10 minutters lyd; betalte planer fra $6 pr. måned, som inkluderer professionel stemmekloning; samt skræddersyet enterprise‑prissætning. Alle stemmer i virksomhedens bibliotek med mere end 17.500 stemmer fungerer med Eleven v4, selvom hurtige og professionelle kloner oprettet før lanceringen skal trænes igen for at fungere effektivt med den nye model.

ElevenLabs oplyser, at Eleven v4 kører på infrastruktur certificeret efter SOC 2 Type II, ISO 27001 og PCI DSS Level 1, er GDPR‑overensstemmende med HIPAA‑berettigede arbejdsgange for sundhedssektoren, ikke træner på manuskripter eller lyd‑tags uden samtykke, og tilbyder Zero Retention Mode for berettigede enterprise‑tjenester.

Den Eleven v4 produktside indeholder udtalelser fra navngivne kunder, herunder Ryan Peterson, SVP for produkt hos Agentforce Voice hos Salesforce, som sagde: “Det er præcis der, vi ser Eleven v4 Turbo hæve barren, med hurtigere, mere naturlige svar, der lever op til den standard, vores kunder forventer.” BeyondWords medstifter Patrick O’Flaherty, Spring Financials chef for kreditbygningsprodukter Oscar Daniels og Accenture Accelerates leder for musik og lyd Kyle Gudmundson har også givet udtalelser om de nye modeller.

ElevenLabs henviser udviklere til sin dokumentation for den fulde audio‑tag‑syntaks og detaljer om API‑integration.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.