Modèles et plateformes d’IA
ElevenLabs lance Eleven V4 avec une variante Turbo à faible latence

ElevenLabs, le 28 septembre 2026, a lancé Eleven v4, un modèle de synthèse vocale qu’elle décrit comme le plus émotive à ce jour, ainsi que Eleven v4 Turbo, une variante à faible latence conçue pour les agents vocaux et les usages en temps réel. Les deux modèles sont immédiatement disponibles dans ElevenAgents, ElevenCreative et via ElevenAPI, l’accès étant inclus dans le niveau de compte gratuit.
Le billet de lancement a été rédigé par Mati Staniszewski et Piotr Dabkowski et classé dans la catégorie Recherche de l’entreprise.
Une nouvelle architecture axée sur l’expressivité
ElevenLabs affirme qu’Eleven v4 repose sur une toute nouvelle architecture conçue pour interpréter le ton, le rythme, l’émotion, le caractère et le contexte à partir du texte, générant une parole qui peut sembler dramatique, tendre, urgente, comique ou conversationnelle tout en conservant l’identité du locuteur. L’entreprise indique que la fidélité audio sous‑jacente est globalement supérieure à celle de ses modèles précédents.
Une nouvelle méthode de capture des identités vocales est conçue pour maintenir chaque voix cohérente à travers les conversations d’agents, les livres audio et les publicités, selon l’entreprise, et le contexte au niveau de la scène permet aux locuteurs de répondre à ce qui vient d’être dit dans une conversation, produisant un dialogue que l’entreprise décrit comme plus naturel que l’assemblage de lignes isolées.
Les balises audio intégrées remplacent les contrôles SSML
Les utilisateurs peuvent orienter la diffusion en langage naturel et intégrer des balises audio en ligne ; des exemples d’entreprises incluent des rires, « said angrily » avec un accent français, une légère pluie et le bourdonnement d’un téléphone. ElevenLabs indique que le modèle suit ces balises audio et ces invites directionnelles avec plus de précision que ses modèles précédents. La prise en charge des phonèmes de l’Alphabet phonétique international a été considérablement améliorée, de sorte que les prononciations personnalisées fonctionnent de façon plus fiable, et la documentation développeur d’ElevenLabs couvre la syntaxe complète des balises pour une utilisation via l’API. Selon la FAQ de la page produit, les balises SSML telles que <break> sont désactivées dans Eleven v4, les balises en langage naturel servant à la place de mécanisme de contrôle.
Variante Turbo et mesures de latence
Pour les usages en temps réel, ElevenLabs indique que ses équipes de recherche et d’ingénierie ont optimisé Eleven v4 Turbo conjointement avec la plateforme conversationnelle ElevenAgents comme un système unique. Turbo prend en charge le streaming bidirectionnel, de sorte que l’audio commence à être renvoyé avant la fin d’une phrase.
La méthodologie annotée de l’annonce indique qu’Eleven v4 Turbo a affiché un temps médian jusqu’à la première parole d’environ 150 millisecondes lors de tests réalisés en septembre 2026 via le streaming WebSocket avec des scripts identiques et les paramètres par défaut, comparé à Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS et OpenAI GPT‑4o mini TTS, la latence réseau étant mesurée et retirée pour tous les systèmes. Le tableau comparatif sur la page produit de l’entreprise indique 150 ms comme référence contre 262 ms déclarés pour Cartesia Sonic 3.6 et 814 ms pour OpenAI GPT‑4o mini TTS. L’annonce cite séparément une latence d’inférence médiane d’environ 100 ms pour Turbo, un chiffre que l’entreprise affirme être plus rapide que la pause moyenne entre deux personnes qui parlent.
Langues, clonage vocal et audio long format
Les deux modèles prennent en charge plus de 90 langues. L’entreprise indique qu’une voix enregistrée dans une langue peut désormais parler les autres couramment tout en adoptant l’accent d’un locuteur natif, et que le respect de l’accent ne dérive plus vers l’accent d’origine au cours d’une génération.
Les clones vocaux instantanés peuvent désormais capturer une voix avec une haute fidélité à partir de 10 secondes d’audio, selon l’entreprise, qui affirme également qu’ils surpassent les clones vocaux professionnels de son modèle Multilingual v2. Les clones vocaux professionnels, indisponibles dans Eleven v3, sont à nouveau pris en charge et offrent la pleine gamme émotionnelle du modèle. Chaque clone, instantané ou professionnel, nécessite le consentement vérifié du propriétaire de la voix, et l’audio généré est couvert par la technologie AI Speech Classifier d’ElevenLabs, que l’entreprise affirme capable de le détecter comme généré par IA.
Le « request stitching », c’est‑à‑dire l’enchaînement de générations pour du contenu long, est nettement plus fiable dans Eleven v4, selon l’entreprise, améliorant l’expérience de travail dans ElevenLabs Studio et l’application ElevenLabs Reader. Une génération unique prend en charge jusqu’à 10 000 caractères, le « context stitching » maintenant le rythme et la livraison cohérents sur des scripts plus longs.
Résultats de référence rapportés par l’entreprise
ElevenLabs rapporte qu’Eleven v4 s’est classé premier sur le tableau de bord Voice Arena de l’Artificial Analysis Provider pour septembre 2026 et a été préféré par environ 75 pour cent des auditeurs lors de tests aveugles en confrontation directe. La méthodologie annotée indique que ces tests de septembre 2026 ont opposé le modèle à Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS et Google Gemini 3.8 Flash TTS, les évaluateurs entendant la même phrase d’Eleven v4 et d’un concurrent présenté de façon aveugle, jugeant laquelle était la plus expressive et la plus naturelle, les égalités comptant pour la moitié. Un graphique dans l’annonce indique qu’Eleven v4 a remporté entre 65 % et 81 % de ces confrontations.
Accès API, tarification et conformité
Les deux modèles sont accessibles via les points de terminaison REST et de streaming avec les SDK TypeScript et Python, et les développeurs basculent entre les modèles avec un seul model_id. Les formats de sortie correspondent à ceux de tous les autres modèles ElevenLabs : MP3, WAV/PCM non compressé pour le travail en studio et en post‑production, et µ‑law pour les intégrations téléphoniques et les centres d’appels, avec la fréquence d’échantillonnage et le débit binaire définis via l’API.
Les tarifs suivent la même structure de crédits que les autres modèles de synthèse vocale de l’entreprise : un niveau gratuit avec 10 000 crédits par mois, que l’entreprise estime à environ 10 minutes d’audio ; des forfaits payants à partir de 6 $ par mois incluant le clonage vocal professionnel ; et des tarifs d’entreprise personnalisés. Chaque voix de la bibliothèque de l’entreprise, qui compte plus de 17 500 voix, fonctionne avec Eleven v4, bien que les clones instantanés et professionnels créés avant le lancement doivent être réentraînés pour fonctionner efficacement avec le nouveau modèle.
ElevenLabs indique que Eleven v4 fonctionne sur une infrastructure certifiée SOC 2 Type II, ISO 27001 et PCI DSS Niveau 1, est conforme au RGPD avec des flux de travail éligibles HIPAA pour le secteur de la santé, ne s’entraîne pas sur des scripts ou des balises audio sans consentement, et propose le Zero Retention Mode pour les services d’entreprise éligibles.
La Eleven v4 page produit contient des déclarations de clients nommés, dont Ryan Peterson, vice‑président senior du produit pour Agentforce Voice chez Salesforce, qui a déclaré : « C’est exactement là où nous constatons que Eleven v4 Turbo élève le niveau, avec des réponses plus rapides et plus naturelles qui répondent aux standards attendus par nos clients. » Le cofondateur de BeyondWords, Patrick O’Flaherty, le responsable des produits de construction de crédit chez Spring Financial, Oscar Daniels, et le responsable musique et audio d’Accenture Accelerate, Kyle Gudmundson, ont également fourni des déclarations sur les nouveaux modèles.
ElevenLabs dirige les développeurs vers sa documentation pour la syntaxe complète des balises audio et les détails d’intégration de l’API.












