Modelos y plataformas de IA

ElevenLabs lanza Eleven V4 con variante Turbo de baja latencia

mm
Añade Unite.AI a tus fuentes preferidas en Google

ElevenLabs, el 28 de septiembre de 2026, lanzó Eleven v4, un modelo de texto a voz que la empresa describe como el más emotivo hasta la fecha, y Eleven v4 Turbo, una variante de baja latencia diseñada para agentes de voz y uso en tiempo real. Ambos modelos están disponibles de inmediato en ElevenAgents, ElevenCreative y a través de ElevenAPI, con acceso incluido en el nivel de cuenta gratuito.

La publicación de lanzamiento fue escrita por Mati Staniszewski y Piotr Dabkowski y archivada en la categoría de Investigación de la empresa.

Una nueva arquitectura centrada en la expresividad

ElevenLabs afirma que Eleven v4 está construida sobre una arquitectura completamente nueva diseñada para interpretar el tono, el ritmo, la emoción, el carácter y el contexto del texto, generando una voz que puede sonar dramática, tierna, urgente, cómica o conversacional, al tiempo que mantiene la identidad del hablante. La empresa señala que la fidelidad de audio subyacente es superior en todos los aspectos respecto a sus modelos anteriores.

Según la empresa, un nuevo método para capturar identidades de hablantes está diseñado para mantener cada voz coherente en conversaciones de agentes, audiolibros y anuncios, y el contexto a nivel de escena permite que los hablantes respondan a lo que se acaba de decir en una conversación, produciendo diálogos que la compañía describe como más naturales que al ensamblar líneas aisladas.

Las etiquetas de audio en línea reemplazan los controles SSML

Los usuarios pueden dirigir la entrega en lenguaje natural e incrustar etiquetas de audio en línea; los ejemplos de la empresa incluyen risas, dicho enojado con acento francés, lluvia ligera y zumbido de teléfono. ElevenLabs afirma que el modelo sigue estas etiquetas de audio y las indicaciones de dirección con mayor precisión que sus modelos anteriores. El soporte para fonemas del Alfabeto Fonético Internacional se mejoró significativamente, de modo que las pronunciaciones personalizadas funcionan de manera más fiable, y la documentación para desarrolladores de ElevenLabs cubre la sintaxis completa de las etiquetas para su uso en la API. Según las preguntas frecuentes de la página del producto, las etiquetas SSML como <break> están deshabilitadas en Eleven v4, utilizándose en su lugar etiquetas de lenguaje natural como mecanismo de control.

Variante Turbo y mediciones de latencia

Para uso en tiempo real, ElevenLabs afirma que sus equipos de investigación e ingeniería optimizaron Eleven v4 Turbo junto con la plataforma conversacional ElevenAgents como un único sistema. Turbo admite transmisión bidireccional, de modo que el audio comienza a devolverse antes de que termine una frase.

La metodología con notas al pie del anuncio indica que Eleven v4 Turbo registró un tiempo medio hasta el primer habla de aproximadamente 150 milisegundos en pruebas realizadas en septiembre de 2026 mediante transmisión WebSocket con guiones idénticos y configuraciones predeterminadas, comparado con Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS y OpenAI GPT‑4o mini TTS, con la latencia de red medida y eliminada para todos los sistemas. El gráfico comparativo en la página del producto de la empresa muestra 150 ms como cifra de referencia frente a 262 ms declarados para Cartesia Sonic 3.6 y 814 ms para OpenAI GPT‑4o mini TTS. El anuncio también menciona una latencia media de inferencia de alrededor de 100 ms para Turbo, una cifra que la compañía dice ser más rápida que la pausa promedio entre dos personas que hablan.

Idiomas, clonación de voz y audio de formato largo

Ambos modelos admiten más de 90 idiomas. La empresa afirma que una voz grabada en un idioma ahora habla otros con fluidez mientras adopta el acento de un hablante nativo, y que la adherencia al acento ya no vuelve a desviarse hacia el acento original durante el transcurso de una generación.

Los clones de voz instantáneos ahora pueden capturar una voz con alta fidelidad a partir de 10 segundos de audio, según la empresa, que también afirma que superan a los Clones de Voz Profesionales de su modelo Multilingual v2. Los Clones de Voz Profesionales, que no estaban disponibles en Eleven v3, vuelven a estar soportados y funcionan con todo el rango emocional del modelo. Cada clon, instantáneo o profesional, requiere el consentimiento verificado del propietario de la voz, y el audio generado está cubierto por la tecnología AI Speech Classifier de ElevenLabs, que la compañía dice puede detectarlo como generado por IA.

La unión de solicitudes, la concatenación de generaciones para contenido de formato largo, es significativamente más fiable en Eleven v4, según la empresa, mejorando la experiencia de trabajo en ElevenLabs Studio y la aplicación ElevenLabs Reader. Una generación única admite hasta 10 000 caracteres, y la unión de contexto mantiene el ritmo y la entrega consistentes a lo largo de guiones más extensos.

Resultados de referencia reportados por la empresa

ElevenLabs informa que Eleven v4 ocupó el primer puesto en la tabla de clasificación del Artificial Analysis Provider Voice Arena para septiembre de 2026 y fue preferido por aproximadamente el 75 % de los oyentes en pruebas ciegas cara a cara. La metodología con notas al pie indica que esas pruebas de septiembre de 2026 enfrentaron al modelo contra Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS y Google Gemini 3.8 Flash TTS, con evaluadores escuchando la misma línea de Eleven v4 y de un competidor presentado de forma ciega, juzgando cuál era más expresivo y cuál sonaba más natural, y los empates contándose como medio punto. Un gráfico en el anuncio indica que Eleven v4 ganó entre el 65 % y el 81 % de esos enfrentamientos.

Acceso API, precios y cumplimiento

Ambos modelos son accesibles a través de endpoints REST y de streaming con SDKs de TypeScript y Python, y los desarrolladores cambian entre modelos con un único model_id. Los formatos de salida coinciden con los de cualquier otro modelo de ElevenLabs: MP3, WAV/PCM sin comprimir para trabajo de estudio y postproducción, y µ-law para integraciones de telefonía y centros de llamadas, con la frecuencia de muestreo y la tasa de bits configuradas mediante la API.

Los precios siguen la misma estructura de créditos que los demás modelos de texto a voz de la empresa: un nivel gratuito con 10 000 créditos al mes, que la compañía equipara a aproximadamente 10 minutos de audio; planes de pago a partir de $6 al mes que incluyen clonación de voz profesional; y precios personalizados para empresas. Cada voz de la biblioteca de la empresa, que supera los 17 500 voces, funciona con Eleven v4, aunque los clones instantáneos y profesionales creados antes del lanzamiento deben volver a entrenarse para trabajar eficazmente con el nuevo modelo.

ElevenLabs afirma que Eleven v4 funciona sobre una infraestructura certificada SOC 2 Tipo II, ISO 27001 y PCI DSS Nivel 1, cumple con el RGPD y dispone de flujos de trabajo elegibles para HIPAA en el sector sanitario, no entrena con guiones ni etiquetas de audio sin consentimiento, y ofrece el modo Zero Retention para los servicios empresariales que lo requieran.

La página del producto Eleven v4 incluye declaraciones de clientes nombrados, entre ellos Ryan Peterson, vicepresidente senior de producto para Agentforce Voice en Salesforce, quien dijo: “Eso es exactamente donde vemos que Eleven v4 Turbo eleva el nivel, con respuestas más rápidas y naturales que cumplen con el estándar que nuestros clientes esperan.” El cofundador de BeyondWords, Patrick O’Flaherty, el responsable de productos de construcción de crédito de Spring Financial, Oscar Daniels, y el líder de música y audio de Accenture Accelerate, Kyle Gudmundson, también proporcionaron declaraciones sobre los nuevos modelos.

ElevenLabs dirige a los desarrolladores a su documentación para la sintaxis completa de audio-tag y los detalles de integración de la API.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.