AI-modeller og plattformer

ElevenLabs lanserer Eleven V4 med lavlatens Turbo-variant

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

ElevenLabs lanserte 28. september 2026 Eleven v4, en tekst‑til‑tale‑modell som selskapet beskriver som den mest emosjonelle hittil, og Eleven v4 Turbo, en lavlatens‑variant designet for stemmeagenter og sanntidsbruk. Begge modellene er tilgjengelige umiddelbart i ElevenAgents, ElevenCreative og via ElevenAPI, med tilgang inkludert i en gratis kontotype.

Lanseringsinnlegget ble skrevet av Mati Staniszewski og Piotr Dabkowski og arkivert i selskapets forskningskategori.

En ny arkitektur med fokus på uttrykksfullhet

ElevenLabs sier at Eleven v4 er bygget på en helt ny arkitektur designet for å tolke tone, tempo, følelser, karakter og kontekst fra tekst, og generere tale som kan høres dramatisk, øm, presserende, komisk eller samtalende ut, samtidig som talerens identitet bevares. Selskapet oppgir at den underliggende lydkvaliteten er høyere generelt enn i de tidligere modellene.

Ifølge selskapet er en ny metode for å fange taleridentiteter designet for å holde hver stemme konsistent på tvers av agent‑samtaler, lydbøker og reklamer, og kontekst på scenenivå gjør at talere kan svare på det som nettopp ble sagt i en samtale, og skaper dialog som selskapet beskriver som mer naturlig enn å sette sammen isolerte linjer.

Innebygde lyd‑tagger erstatter SSML‑kontroller

Brukere kan styre leveringen med naturlig språk og sette inn innebygde lyd‑tagger; selskapets eksempler inkluderer latter, sagt sint med fransk aksent, lett regn og telefon som vibrerer. ElevenLabs sier at modellen følger disse lyd‑taggene og retnings‑promptene mer nøyaktig enn sine tidligere modeller. Støtte for fonemer i det internasjonale fonetiske alfabetet (IPA) ble betydelig forbedret slik at egendefinerte uttaler oppfører seg mer pålitelig, og ElevenLabs’ utviklerdokumentasjon dekker hele tagsyntaksen for API‑bruk. Ifølge produktets FAQ‑side er SSML‑tagger som <break> er deaktivert i Eleven v4, med naturlige språk‑tagger som styringsmekanisme i stedet.

Turbo‑variant og latensmålinger

For sanntidsbruk sier ElevenLabs at deres forsknings‑ og ingeniørteam optimaliserte Eleven v4 Turbo sammen med ElevenAgents‑samtaleplattformen som ett system. Turbo støtter toveis strømming, slik at lyd begynner å returnere før en setning er ferdig.

Metodikken i kunngjøringen, med fotnoter, oppgir at Eleven v4 Turbo oppnådde en median tid til første tale på omtrent 150 millisekunder i tester i september 2026 kjørt over WebSocket‑strømming med identiske manus og standardinnstillinger mot Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS og OpenAI GPT‑4o mini TTS, med nettverkslatens målt og fjernet for alle systemer. Sammenligningsdiagrammet på selskapets produktside viser 150 ms som referanseverdi sammenlignet med oppgitt 262 ms for Cartesia Sonic 3.6 og 814 ms for OpenAI GPT‑4o mini TTS. Kunngjøringen nevner også en median inferenslatens på omtrent 100 ms for Turbo, et tall selskapet sier er raskere enn den gjennomsnittlige pausen mellom to personer som snakker.

Språk, stemmekloning og langtids‑lyd

Begge modellene støtter mer enn 90 språk. Selskapet sier at en stemme som er innspilt på ett språk nå kan snakke andre språk flytende samtidig som den tar i bruk aksenten til en innfødt taler, og at aksentoverholdelsen ikke lenger drifter tilbake mot kildeaksenten i løpet av en generasjon.

Instant Voice Clones kan nå fange en stemme med høy nøyaktighet fra 10 sekunders lyd, ifølge selskapet, som også sier at de overgår Professional Voice Clones i deres Multilingual v2‑modell. Professional Voice Clones, som var utilgjengelige i Eleven v3, støttes igjen og leverer modellens fulle emosjonelle spekter. Hver klone, enten den er umiddelbar eller profesjonell, krever verifisert samtykke fra stemmeeieren, og generert lyd er dekket av ElevenLabs’ AI Speech Classifier‑teknologi, som selskapet sier kan oppdage at den er AI‑generert.

Forespørsels‑stitching, sammenkjedingen av generasjoner for lengre innhold, er betydelig mer pålitelig i Eleven v4, sier selskapet, og forbedrer opplevelsen av å arbeide i ElevenLabs Studio og ElevenLabs Reader‑appen. En enkelt generasjon støtter opptil 10 000 tegn, med kontekst‑stitching som holder tempo og levering konsistent gjennom lengre manus.

Selskapets rapporterte benchmark‑resultater

ElevenLabs rapporterer at Eleven v4 ble rangert som nummer én på Artificial Analysis Provider Voice Arena‑resultatlisten for september 2026 og ble foretrukket av omtrent 75 % av lytterne i blinde sammenligningstester. Metodikken med fotnoter sier at de september‑2026 testene satte modellen opp mot Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS og Google Gemini 3.8 Flash TTS, der sensorene hørte den samme linjen fra Eleven v4 og én konkurrent presentert blind, og vurderte hvilken som var mer uttrykksfull og hvilken som hørtes mer naturlig, med uavgjort telt som en halv. Et diagram i kunngjøringen viser at Eleven v4 vant 65 %–81 % av disse kampene.

API‑tilgang, priser og samsvar

Begge modellene er tilgjengelige via REST- og streaming‑endepunkter med TypeScript‑ og Python‑SDK‑er, og utviklere kan bytte mellom modeller med en enkelt model_id. Utdataformatene samsvarer med alle andre ElevenLabs‑modeller: MP3, ukomprimert WAV/PCM for studio‑ og etterproduksjonsarbeid, samt µ-law for telefoni‑ og call‑center‑integrasjoner, med samplingsfrekvens og bithastighet angitt via API‑et.

Prisstrukturen følger samme kredittmodell som selskapets andre tekst‑til‑tale‑modeller: et gratis nivå med 10 000 kreditter per måned, noe som tilsvarer omtrent 10 minutter lyd; betalte planer fra $6 per måned som inkluderer profesjonell stemmekloning; samt tilpasset bedriftspriser. Alle stemmer i selskapets bibliotek på mer enn 17 500 stemmer fungerer med Eleven v4, selv om umiddelbare og profesjonelle kloner opprettet før lanseringen må trenes på nytt for å fungere effektivt med den nye modellen.

ElevenLabs oppgir at Eleven v4 kjører på infrastruktur sertifisert for SOC 2 Type II, ISO 27001 og PCI DSS Level 1, er GDPR‑kompatibel med HIPAA‑godkjente arbeidsflyter for helsesektoren, ikke trener på manus eller lyd‑tags uten samtykke, og tilbyr Zero Retention Mode for kvalifiserte bedrifts‑tjenester.

På Eleven v4-produktside finnes uttalelser fra navngitte kunder, inkludert Ryan Peterson, SVP for produkt i Agentforce Voice hos Salesforce, som sa: “Det er akkurat her vi ser Eleven v4 Turbo heve standarden, med raskere, mer naturlige svar som møter den kvaliteten våre kunder forventer.” BeyondWords‑medgründer Patrick O’Flaherty, Spring Financial‑leder for kredittbyggingsprodukter Oscar Daniels, og Accenture Accelerate‑leder for musikk og lyd Kyle Gudmundson ga også uttalelser om de nye modellene.

ElevenLabs henviser utviklere til sin dokumentasjon for full syntaks for lyd‑tags og detaljer om API‑integrasjon.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Arbeidet hans utforsker hvordan læring, resonnering, hukommelse og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker forbindelser mellom moderne AI-arkitekturer og langvarige spørsmål innen kognitiv vitenskap og sinnets filosofi.

Med en konseptuell og reflekterende tilnærming undersøker Jonas rammeverk som resonneringsmodeller, agentbaserte systemer, emergent kognisjon og justeringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr – og hva det ikke betyr. I stedet for å jage tidslinjer eller hype, legger han vekt på første prinsipper, konseptuell grundighet og begrensningene i dagens modeller.

Artikler skrevet av Jonas Reeve er AI-genererte og gjennomgås av Unite.AI sitt redaksjonsteam for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.