AI-mallit ja alustat
ElevenLabs julkaisee Eleven V4:n matalan viiveen Turbo-versiolla

ElevenLabs lanseerasi 28. syyskuuta 2026 Eleven v4 -tekstistä puheeksi -mallin, jonka yritys kuvaa olevan sen tähän mennessä tunteikkaimpana, sekä Eleven v4 Turbo -mallin, matalan viiveen variantin, joka on suunniteltu äänitoimijoille ja reaaliaikaiseen käyttöön. Molemmat mallit ovat heti saatavilla ElevenAgentsissa, ElevenCreativessa ja ElevenAPI:n kautta, ja käyttö sisältyy ilmaiseen tilitasoon.
Lanseerausjulkaisu kirjoitettiin Mati Staniszewskin ja Piotr Dabkowskin toimesta, ja se luokiteltiin yrityksen Tutkimus‑kategoriaan.
Uusi arkkitehtuuri, joka keskittyy ilmaisukykyyn
ElevenLabs kertoo, että Eleven v4 on rakennettu täysin uudelle arkkitehtuurille, joka on suunniteltu tulkitsemaan sävyä, tempoa, tunteita, hahmoa ja kontekstia tekstistä, tuottaen puhetta, joka voi kuulostaa dramaattiselta, herkältä, kiireiseltä, humoristiselta tai keskustelevalta säilyttäen puhujan identiteetin. Yritys väittää, että taustalla oleva äänenlaatu on kaikilla osa-alueilla korkeampi kuin aikaisemmissa malleissa.
Yrityksen mukaan uusi menetelmä puhujan identiteettien tallentamiseen on suunniteltu pitämään jokainen ääni yhtenäisenä agenttikeskusteluissa, äänikirjoissa ja mainoksissa, ja kohtauksen tasoinen konteksti antaa puhujien vastata juuri keskustelussa sanottuun, tuottaen dialogia, jonka yritys kuvaa luonnollisemmaksi kuin erillisten lauseiden kokoaminen.
Rivinsisäiset äänitunnisteet korvaavat SSML‑ohjaimet
Käyttäjät voivat ohjata toimitusta luonnollisella kielellä ja upottaa rivinsisäisiä äänitunnisteita; yrityksen esimerkkeihin kuuluvat naurut, sanottu vihaisena ranskalaisella aksentilla, kevyet sateen äänet ja puhelimen värinä. ElevenLabs kertoo, että malli noudattaa näitä äänitunnisteita ja ohjauskehotteita tarkemmin kuin aikaisemmat mallinsa. Kansainvälisen foneettisen aakkoston (IPA) fonemien tuki on merkittävästi parantunut, jotta mukautetut ääntämiset toimivat luotettavammin, ja ElevenLabsin kehittäjädokumentaatio kattaa koko tunnistesyntaksin API‑käyttöön. Tuotesivun UKK:n mukaan SSML‑tunnisteet, kuten <break> ovat pois käytöstä Eleven v4:ssä, ja luonnollisen kielen tunnisteet toimivat sen sijaan ohjausmekanismina.
Turbo‑variantti ja viiveen mittaukset
Reaaliaikaista käyttöä varten ElevenLabs kertoo, että sen tutkimus- ja insinööritiimit optimoivat Eleven v4 Turbo -mallin yhdessä ElevenAgents‑keskustelualustan kanssa yhtenä järjestelmänä. Turbo tukee kaksisuuntaista suoratoistoa, jolloin ääni alkaa palautua ennen kuin lause on valmis.
Ilmoituksen alaviitteessä esitetyn menetelmän mukaan Eleven v4 Turbo saavutti mediaanin ensimmäisen puheen aloitusajassa noin 150 millisekuntia syyskuun 2026 testeissä, jotka suoritettiin WebSocket‑suoratoistolla käyttäen identtisiä skriptejä ja oletusasetuksia verrattuna Cartesia Sonic 3.6:een, xAI TTS:ään, Google Gemini Flash‑Lite TTS:ään ja OpenAI GPT‑4o mini TTS:ään, ja verkon viive mitattiin ja poistettiin kaikista järjestelmistä. Yrityksen tuotesivun vertailukaaviossa 150 ms on viitearvo, kun Cartesia Sonic 3.6:lle on ilmoitettu 262 ms ja OpenAI GPT‑4o mini TTS:lle 814 ms. Ilmoituksessa mainitaan erikseen, että Turbo:n mediaanin inferenssiviive on noin 100 ms, mikä yrityksen mukaan on nopeampi kuin kahden puhuvan välinen keskimääräinen tauko.
Kielet, äänikloonaus ja pitkän muodon ääni
Molemmat mallit tukevat yli 90 kieltä. Yritys kertoo, että yhdessä kielessä äänitetty ääni puhuu nyt sujuvasti myös muita kieliä omaksuen alkuperäiskielen puhujan aksentin, eikä aksentin noudattaminen enää poikkea alkuperäisestä aksentista generaation aikana.
Instant Voice Clones -työkalun avulla voidaan nyt tallentaa ääni korkealla tarkkuudella 10 sekunnin ääninäytteestä, yrityksen mukaan, ja ne myös ylittävät Multilingual v2 -mallin Professional Voice Clones -työkalujen suorituskyvyn. Professional Voice Clones, jotka eivät olleet saatavilla Eleven v3:ssa, ovat jälleen tuettuja ja toimivat mallin koko tunnevalikoiman kanssa. Jokainen klooni, olipa se instant- tai ammattilaisklooni, edellyttää äänen omistajan vahvistettua suostumusta, ja tuotettua ääntä suojaa ElevenLabsin AI Speech Classifier -teknologia, jonka yritys väittää pystyvän havaitsemaan sen tekoälyn tuottamaksi.
Pyyntöjen yhdistäminen, eli generointien ketjuttaminen pidempää sisältöä varten, on Eleven v4:ssä merkittävästi luotettavampaa, yrityksen mukaan, mikä parantaa työskentelykokemusta ElevenLabs Studiossa ja ElevenLabs Reader -sovelluksessa. Yksi generointi tukee jopa 10 000 merkkiä, ja kontekstin yhdistäminen pitää tempon ja toimituksen johdonmukaisena pidemmillä käsikirjoituksilla.
Yrityksen raportoimat vertailutulokset
ElevenLabs raportoi, että Eleven v4 sijoittui ensimmäiseksi Artificial Analysis Provider Voice Arena -tulostaululla syyskuussa 2026 ja sai noin 75 prosentin kuuntelijoiden suosimman arvostelun sokeissa vertailutesteissä. Alaviitteessä esitetyn menetelmän mukaan kyseiset syyskuun 2026 testit asettivat mallin vastaan Cartesia Sonic 3.6:n, Inworld TTS-2:n, Google Gemini 3.8 Flash‑Lite TTS:n ja Google Gemini 3.8 Flash TTS:n, ja arvioijat kuuntelivat saman lauseen Eleven v4:stä ja yhdestä kilpailijasta sokeasti, arvioiden kumpi oli ilmaisullisesti parempi ja kumpi kuulosti luonnollisemmalta; tasapelit laskettiin puoleksi. Ilmoituksen kaaviossa kerrotaan, että Eleven v4 voitti 65 %–81 % näistä kohtaamisista.
API‑pääsy, hinnoittelu ja vaatimustenmukaisuus
Molemmat mallit ovat käytettävissä REST- ja suoratoisto-rajapintojen kautta TypeScript- ja Python SDK:illa, ja kehittäjät voivat vaihtaa malleja yhdellä model_id-tunnuksella. Tulostusmuodot vastaavat kaikkia muita ElevenLabsin malleja: MP3, pakkaamaton WAV/PCM studiossa ja jälkituotannossa, sekä µ-law puhelin- ja puhelinkeskusintegraatioihin, ja näytteenottotaajuus sekä bittinopeus asetetaan API:n kautta.
Hinnoittelu noudattaa samaa krediittirakennetta kuin yrityksen muut puheentunnistusmallit: ilmainen taso, jossa on 10 000 kredittiä kuukaudessa, mikä vastaa noin 10 minuuttia ääntä; maksulliset suunnitelmat, jotka alkavat 6 USD:sta kuukaudessa ja sisältävät ammatillisen ääniklonaamisen; sekä räätälöidyt yrityshinnat. Jokainen ääni yrityksen yli 17 500 äänen kirjastoista toimii Eleven v4:n kanssa, vaikka ennen julkaisua luodut välittömät ja ammatilliset kloonit on koulutettava uudelleen toimimaan tehokkaasti uuden mallin kanssa.
ElevenLabs ilmoittaa, että Eleven v4 toimii SOC 2 Type II, ISO 27001 ja PCI DSS Level 1 -sertifioidulla infrastruktuurilla, on GDPR-yhteensopiva HIPAA-kelpoisten terveydenhuollon työnkulkujen kanssa, ei kouluta skripteillä tai äänitunnisteilla ilman suostumusta, ja tarjoaa Zero Retention Mode -tilan oikeutettuihin yrityspalveluihin.
Eleven v4 -tuotesivu sisältää lausuntoja nimetyiltä asiakkailta, mukaan lukien Ryan Peterson, Agentforce Voice -tuotteen SVP Salesforce-yrityksessä, joka sanoi: \”Tässä juuri näemme Eleven v4 Turbo:n nostavan kynnystä, nopeampien ja luonnollisempien vastausten avulla, jotka täyttävät asiakkaidemme odottaman tason.\” BeyondWordsin perustaja Patrick O’Flaherty, Spring Financialin luottorakennustuotteiden johtaja Oscar Daniels ja Accenture Accelerate -musiikin ja äänen johtaja Kyle Gudmundson antoivat myös lausuntoja uusista malleista.
ElevenLabs ohjaa kehittäjät dokumentaatioonsa, jossa on täysi audio-tag -syntaksi ja API-integraation tiedot.












