AI-modeller och plattformar

ElevenLabs lanserar Eleven V4 med låglatens Turbo-variant

mm
Lägg till Unite.AI bland dina föredragna källor på Google

ElevenLabs lanserade den 28 september 2026 Eleven v4, en text‑till‑tal‑modell som företaget beskriver som sin mest känslosamma hittills, samt Eleven v4 Turbo, en låg‑latens‑variant avsedd för röstagenter och realtidsanvändning. Båda modellerna är omedelbart tillgängliga i ElevenAgents, ElevenCreative och via ElevenAPI, med åtkomst inkluderad i den kostnadsfria kontonivån.

Lanseringsinlägget skrevs av Mati Staniszewski och Piotr Dabkowski och arkiverades i företagets forskningskategori.

En ny arkitektur fokuserad på uttrycksfullhet

ElevenLabs säger att Eleven v4 är byggd på en helt ny arkitektur som är utformad för att tolka ton, tempo, känsla, karaktär och sammanhang från text, och generera tal som kan låta dramatiskt, mjukt, brådskande, komiskt eller samtalston samtidigt som talarens identitet bevaras. Företaget uppger att den underliggande ljudfideliteten är högre över hela linjen jämfört med dess tidigare modeller.

En ny metod för att fånga talaridentiteter är avsedd att hålla varje röst konsekvent över agentkonversationer, ljudböcker och reklam, enligt företaget, och kontext på scennivå låter talare svara på vad som just sagts i en konversation, vilket skapar dialog som företaget beskriver som mer naturlig än att sätta ihop isolerade rader.

Inbäddade ljudtaggar ersätter SSML‑kontroller

Användare kan styra leveransen med naturligt språk och bädda in inbäddade ljudtaggar; företagets exempel inkluderar skratt, sade argt med fransk accent, lätt regn och telefonens surr. ElevenLabs säger att modellen följer dessa ljudtaggar och riktningsuppmaningar mer exakt än sina tidigare modeller. Stödet för fonem i Internationella fonetiska alfabetet förbättrades avsevärt så att anpassade uttal beter sig mer pålitligt, och ElevenLabs utvecklardokumentation täcker hela taggsyntaxen för API‑användning. Enligt produktens FAQ‑sida är SSML‑taggar såsom <break> inaktiverade i Eleven v4, där naturliga språk‑taggar fungerar som kontrollmekanism istället.

Turbo‑variant och latensmätningar

För realtidsanvändning säger ElevenLabs att deras forsknings‑ och ingenjörsteam optimerade Eleven v4 Turbo tillsammans med ElevenAgents konversationsplattform som ett enda system. Turbo stödjer bidirektionell streaming, så ljudet börjar återges innan en mening är färdig.

Meddelandeets fotnoterade metodologi anger att Eleven v4 Turbo uppnådde en median tid till första tal på ungefär 150 millisekunder i tester i september 2026 som kördes över WebSocket‑streaming med identiska skript och standardinställningar mot Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS och OpenAI GPT‑4o mini TTS, där nätverkslatens mättes och togs bort för alla system. Jämförelsetabellen på företagets produktsida listar 150 ms som referensvärde mot ett angivet 262 ms för Cartesia Sonic 3.6 och 814 ms för OpenAI GPT‑4o mini TTS. Meddelandet nämner dessutom en median inferenslatens på cirka 100 ms för Turbo, ett tal som företaget säger är snabbare än det genomsnittliga pausintervallet mellan två personer som talar.

Språk, röstkloning och långformigt ljud

Båda modellerna stödjer fler än 90 språk. Företaget säger att en röst inspelad på ett språk nu talar andra språk flytande samtidigt som den antar accent från en modersmålstalare, och att accentbehållningen inte längre drar tillbaka mot ursprungsaccenten under en generering.

Instant Voice Clones kan nu fånga en röst med hög kvalitet från 10 sekunders ljud, enligt företaget, som också säger att de överträffar Professional Voice Clones i deras Multilingual v2‑modell. Professional Voice Clones, som var otillgängliga i Eleven v3, stöds återigen och levererar modellens fulla känslomässiga spektrum. Varje klon, oavsett om den är instant eller professionell, kräver verifierat samtycke från röstens ägare, och genererat ljud omfattas av ElevenLabs AI Speech Classifier‑teknik, som företaget säger kan identifiera det som AI‑genererat.

Request stitching, kedjning av generationer för längre innehåll, är betydligt mer pålitligt i Eleven v4, enligt företaget, vilket förbättrar upplevelsen av att arbeta i ElevenLabs Studio och ElevenLabs Reader‑appen. En enskild generation stödjer upp till 10 000 tecken, där kontext‑stitching håller tempo och leverans konsekvent över längre manus.

Företagsrapporterade benchmarkresultat

ElevenLabs rapporterar att Eleven v4 rankades först på Artificial Analysis Provider Voice Arena Leaderboard för september 2026 och föredrogs av ungefär 75 procent av lyssnarna i blinda jämförelsetester. Den fotnoterade metodologin anger att dessa tester i september 2026 ställde modellen mot Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS och Google Gemini 3.8 Flash TTS, där bedömare hörde samma rad från Eleven v4 och en konkurrent presenterad blint, och bedömde vilken som var mer uttrycksfull och vilken som lät mer naturlig, med oavgjorda räknade som hälften. Ett diagram i meddelandet visar att Eleven v4 vann 65 %–81 % av dessa matchningar.

API‑åtkomst, prissättning och efterlevnad

Båda modellerna är tillgängliga via REST- och streaming‑endpoints med TypeScript‑ och Python‑SDK:er, och utvecklare kan växla mellan modeller med ett enda model_id. Utdataformaten matchar alla andra ElevenLabs‑modeller: MP3, okomprimerad WAV/PCM för studio‑ och efterproduktionsarbete, samt µ-law för telefoni‑ och call‑center‑integrationer, med samplingsfrekvens och bithastighet som ställs in via API‑et.

Prissättningen följer samma kreditsstruktur som företagets andra text‑till‑tal‑modeller: en gratisnivå med 10 000 krediter per månad, vilket företaget motsvarar ungefär 10 minuter ljud; betalda planer som börjar på $6 per månad och inkluderar professionell röstkloning; samt anpassad företagsprissättning. Varje röst i företagets bibliotek med mer än 17 500 röster fungerar med Eleven v4, även om instant‑ och professionella kloner som skapades före lanseringen måste tränas om för att fungera effektivt med den nya modellen.

ElevenLabs uppger att Eleven v4 körs på infrastruktur certifierad enligt SOC 2 Type II, ISO 27001 och PCI DSS Level 1, är GDPR‑kompatibel med HIPAA‑godkända arbetsflöden för sjukvård, inte tränar på manus eller ljud‑taggar utan samtycke, och erbjuder Zero Retention Mode för berättigade företags‑tjänster.

Den Eleven v4 produktsida innehåller uttalanden från namngivna kunder, inklusive Ryan Peterson, SVP för produkt hos Agentforce Voice på Salesforce, som sade: “Det är exakt där vi ser Eleven v4 Turbo höja ribban, med snabbare, mer naturliga svar som uppfyller den standard våra kunder förväntar sig.” BeyondWords medgrundare Patrick O’Flaherty, Spring Financial chef för kreditbyggande produkter Oscar Daniels, och Accenture Accelerate musik- och ljudchef Kyle Gudmundson gav också uttalanden om de nya modellerna.

ElevenLabs hänvisar utvecklare till sin dokumentation för den fullständiga audio‑tag‑syntaxen och detaljer om API‑integration.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.