KI-Modelle und Plattformen

ElevenLabs stellt Eleven V4 mit einer latenzarmen Turbo-Variante vor

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

ElevenLabs hat am 28. September 2026 Eleven v4 eingeführt, ein Text‑zu‑Sprache‑Modell, das das Unternehmen als sein bislang emotionalstes bezeichnet, sowie Eleven v4 Turbo, eine latenzarme Variante, die für Sprachagenten und Echtzeitanwendungen konzipiert ist. Beide Modelle sind sofort in ElevenAgents, ElevenCreative und über ElevenAPI verfügbar, wobei der Zugriff bereits im kostenlosen Kontingent enthalten ist.

Der Ankündigungsbeitrag wurde von Mati Staniszewski und Piotr Dabkowski verfasst und in der Forschungs‑Kategorie des Unternehmens abgelegt.

Eine neue Architektur, die auf Ausdrucksfähigkeit ausgerichtet ist

ElevenLabs gibt an, dass Eleven v4 auf einer völlig neuen Architektur basiert, die darauf ausgelegt ist, Ton, Rhythmus, Emotion, Charakter und Kontext aus dem Text zu interpretieren und Sprache zu erzeugen, die dramatisch, zärtlich, dringlich, komisch oder gesprächig klingen kann, während die Identität des Sprechers erhalten bleibt. Das Unternehmen behauptet, dass die zugrunde liegende Audio‑Fidelity im Vergleich zu früheren Modellen durchweg höher ist.

Laut dem Unternehmen wurde eine neue Methode zur Erfassung von Sprecheridentitäten entwickelt, die jede Stimme über Agentengespräche, Hörbücher und Werbespots hinweg konsistent hält, und kontextbezogene Szenenebene ermöglicht es Sprechern, auf das gerade Gesagte in einer Unterhaltung zu reagieren, wodurch Dialoge entstehen, die das Unternehmen als natürlicher beschreibt als das Zusammenfügen isolierter Zeilen.

Inline‑Audio‑Tags ersetzen SSML‑Steuerungen

Benutzer können die Ausgabe in natürlicher Sprache steuern und Inline‑Audio‑Tags einbetten; Unternehmensbeispiele umfassen Lachen, gesagt wütend mit französischem Akzent, leichtes Regenrauschen und ein vibrierendes Telefon. ElevenLabs gibt an, dass das Modell diesen Audio‑Tags und Richtungsaufforderungen genauer folgt als seine Vorgängermodelle. Die Unterstützung für phonetische Zeichen des Internationalen Phonetischen Alphabets wurde deutlich verbessert, sodass benutzerdefinierte Aussprachen zuverlässiger funktionieren, und die ElevenLabs‑Entwicklerdokumentation enthält die vollständige Tag‑Syntax für die API‑Nutzung. Laut den FAQ auf der Produktseite sind SSML‑Tags wie <break> in Eleven v4 deaktiviert, wobei stattdessen natürlichsprachige Tags als Steuermechanismus dienen.

Turbo‑Variante und Latenzmessungen

Für den Echtzeit‑Einsatz sagt ElevenLabs, dass seine Forschungs‑ und Ingenieurteams Eleven v4 Turbo zusammen mit der ElevenAgents‑Konversationsplattform als ein System optimiert haben. Turbo unterstützt bidirektionales Streaming, sodass Audio bereits zurückgesendet wird, bevor ein Satz beendet ist.

Die im Hinweis vermerkte Methodik der Ankündigung besagt, dass Eleven v4 Turbo in im September 2026 durchgeführten Tests über WebSocket‑Streaming mit identischen Skripten und Standardeinstellungen gegenüber Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS und OpenAI GPT‑4o mini TTS eine mediane Zeit bis zur ersten Sprache von etwa 150 Millisekunden erreichte, wobei die Netzwerklatenz für alle Systeme gemessen und entfernt wurde. Das Vergleichsdiagramm auf der Produktseite des Unternehmens gibt 150 ms als Referenzwert an, im Vergleich zu angegebenen 262 ms für Cartesia Sonic 3.6 und 814 ms für OpenAI GPT‑4o mini TTS. Die Ankündigung nennt zudem eine mediane Inferenzlatenz von etwa 100 ms für Turbo, ein Wert, den das Unternehmen als schneller als die durchschnittliche Pause zwischen zwei sprechenden Personen bezeichnet.

Sprachen, Stimmklonen und Langform‑Audio

Beide Modelle unterstützen mehr als 90 Sprachen. Das Unternehmen gibt an, dass eine in einer Sprache aufgezeichnete Stimme nun andere Sprachen fließend spricht und dabei den Akzent eines Muttersprachlers übernimmt, und dass diese Akzenttreue im Verlauf einer Generierung nicht mehr zum Ausgangsakzent zurückkehrt.

Instant‑Voice‑Clones können laut dem Unternehmen nun eine Stimme mit hoher Treue aus 10 Sekunden Audio erfassen, wobei das Unternehmen zudem behauptet, dass sie die Professional‑Voice‑Clones seines Multilingual‑v2‑Modells übertreffen. Professional‑Voice‑Clones, die in Eleven v3 nicht verfügbar waren, werden wieder unterstützt und nutzen das volle emotionale Spektrum des Modells. Jeder Clone, ob instant oder professionell, erfordert die verifizierte Zustimmung des Stimminhabers, und erzeugtes Audio wird durch die AI Speech Classifier‑Technologie von ElevenLabs abgedeckt, die das Unternehmen als in der Lage beschreibt, es als KI‑generiert zu erkennen.

Request‑Stitching, das Verketten von Generationen für länger­formige Inhalte, sei laut dem Unternehmen in Eleven v4 deutlich zuverlässiger, was die Arbeit in ElevenLabs Studio und der ElevenLabs Reader‑App verbessere. Eine einzelne Generation unterstützt bis zu 10.000 Zeichen, wobei das Kontext‑Stitching das Tempo und die Wiedergabe über längere Skripte hinweg konsistent halte.

Unternehmensberichtete Benchmark‑Ergebnisse

ElevenLabs berichtet, dass Eleven v4 im September 2026 den ersten Platz in der Voice‑Arena‑Rangliste des Artificial Analysis Provider belegt habe und von etwa 75 Prozent der Zuhörer in blinden Direktvergleichen bevorzugt wurde. Die im Hinweis erläuterte Methodik besagt, dass diese Tests im September 2026 das Modell gegen Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS und Google Gemini 3.8 Flash TTS antreten ließen, wobei die Bewerter dieselbe Zeile von Eleven v4 und einem Konkurrenten blind hörten und bewerteten, welche ausdrucksstärker und natürlicher klang, wobei Unentschieden als halbe Punkte gezählt wurden. Ein Diagramm in der Ankündigung gibt an, dass Eleven v4 in 65 %–81 % dieser Begegnungen gewann.

API‑Zugang, Preisgestaltung und Compliance

Beide Modelle sind über REST- und Streaming-Endpunkte mit TypeScript- und Python‑SDKs zugänglich, und Entwickler können zwischen den Modellen mit einer einzigen model_id wechseln. Die Ausgabeformate entsprechen denen aller anderen ElevenLabs‑Modelle: MP3, unkomprimiertes WAV/PCM für Studio‑ und Post‑Production‑Arbeiten sowie µ-law für Telefonie‑ und Call‑Center‑Integrationen, wobei Abtastrate und Bitrate über die API festgelegt werden.

Die Preisgestaltung folgt derselben Kreditstruktur wie bei den anderen Text‑to‑Speech‑Modellen des Unternehmens: ein kostenloser Tarif mit 10.000 Credits pro Monat, den das Unternehmen etwa 10 Minuten Audio entspricht; kostenpflichtige Pläne ab $6 pro Monat, die professionelles Voice‑Cloning beinhalten; sowie individuelle Unternehmenspreise. Jede Stimme in der Bibliothek des Unternehmens mit mehr als 17.500 Stimmen funktioniert mit Eleven v4, wobei jedoch Instant‑ und Professional‑Clones, die vor dem Start erstellt wurden, neu trainiert werden müssen, um mit dem neuen Modell effektiv zu arbeiten.

ElevenLabs gibt an, dass Eleven v4 auf einer Infrastruktur läuft, die nach SOC 2 Type II, ISO 27001 und PCI DSS Level 1 zertifiziert ist, DSGVO‑konform mit HIPAA‑fähigen Workflows für das Gesundheitswesen, nicht ohne Zustimmung auf Skripten oder Audio‑Tags trainiert und einen Zero‑Retention‑Mode für berechtigte Unternehmensdienste anbietet.

Die Eleven v4 Produktseite enthält Aussagen von genannten Kunden, darunter Ryan Peterson, SVP für Produkt für Agentforce Voice bei Salesforce, der sagte: “Genau hier sehen wir, dass Eleven v4 Turbo die Messlatte höher legt, mit schnelleren, natürlicheren Antworten, die den Standard erfüllen, den unsere Kunden erwarten.” BeyondWords‑Mitbegründer Patrick O’Flaherty, Spring Financial‑Leiter für Kreditaufbauprodukte Oscar Daniels und Accenture Accelerate‑Leiter für Musik und Audio Kyle Gudmundson haben ebenfalls Aussagen zu den neuen Modellen abgegeben.

ElevenLabs verweist Entwickler auf seine Dokumentation für die vollständige Audio‑Tag‑Syntax und API‑Integrationsdetails.

Jonas Reeve ist ein KI-generierter Analyst bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.