Modelli e piattaforme di IA
ElevenLabs lancia Eleven V4 con variante Turbo a bassa latenza

ElevenLabs, il 28 settembre 2026, ha lanciato Eleven v4, un modello text-to-speech che l’azienda descrive come il più emotivo finora, e Eleven v4 Turbo, una variante a bassa latenza progettata per agenti vocali e utilizzo in tempo reale. Entrambi i modelli sono disponibili immediatamente in ElevenAgents, ElevenCreative e tramite ElevenAPI, con accesso incluso nel livello gratuito dell’account.
Il post di lancio è stato scritto da Mati Staniszewski e Piotr Dabkowski e inserito nella categoria Ricerca dell’azienda.
Una nuova architettura incentrata sull’espressività
ElevenLabs afferma che Eleven v4 è costruito su un’architettura completamente nuova, progettata per interpretare tono, ritmo, emozione, carattere e contesto dal testo, generando una voce che può suonare drammatica, tenera, urgente, comica o conversazionale mantenendo l’identità del parlante. L’azienda sostiene che la fedeltà audio di base è più alta in tutti gli aspetti rispetto ai modelli precedenti.
Un nuovo metodo per catturare le identità dei parlanti è stato ideato per mantenere ogni voce coerente tra conversazioni con agenti, audiolibri e spot pubblicitari, secondo l’azienda, e il contesto a livello di scena consente ai parlanti di rispondere a quanto appena detto in una conversazione, producendo dialoghi che l’azienda descrive come più naturali rispetto all’assemblaggio di linee isolate.
Tag audio in linea sostituiscono i controlli SSML
Gli utenti possono dirigere la consegna in linguaggio naturale e incorporare tag audio in linea; esempi forniti dall’azienda includono risate, detto arrabbiato con accento francese, pioggia leggera e vibrazione del telefono. ElevenLabs afferma che il modello segue questi tag audio e i prompt di direzione con maggiore precisione rispetto ai modelli precedenti. Il supporto per i fonemi dell’Alfabeto Fonetico Internazionale è stato notevolmente migliorato, così le pronunce personalizzate si comportano in modo più affidabile, e la documentazione per sviluppatori di ElevenLabs copre l’intera sintassi dei tag per l’uso tramite API. Secondo le FAQ della pagina prodotto, i tag SSML come <break> sono disabilitati in Eleven v4, con i tag in linguaggio naturale che fungono da meccanismo di controllo.
Variante Turbo e misurazioni della latenza
Per l’uso in tempo reale, ElevenLabs dichiara che i suoi team di ricerca e ingegneria hanno ottimizzato Eleven v4 Turbo insieme alla piattaforma conversazionale ElevenAgents come un unico sistema. Turbo supporta lo streaming bidirezionale, così l’audio inizia a restituirsi prima che una frase sia terminata.
La metodologia con note a piè di pagina dell’annuncio afferma che Eleven v4 Turbo ha registrato un tempo medio al primo discorso di circa 150 millisecondi nei test di settembre 2026 eseguiti tramite streaming WebSocket con script identici e impostazioni predefinite, confrontato con Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS e OpenAI GPT‑4o mini TTS, con la latenza di rete misurata e rimossa per tutti i sistemi. Il grafico comparativo sulla pagina prodotto dell’azienda indica 150 ms come valore di riferimento rispetto a 262 ms dichiarati per Cartesia Sonic 3.6 e 814 ms per OpenAI GPT‑4o mini TTS. L’annuncio cita separatamente una latenza media di inferenza di circa 100 ms per Turbo, cifra che l’azienda sostiene essere più veloce della pausa media tra due persone che parlano.
Lingue, clonazione vocale e audio a lungo termine
Entrambi i modelli supportano più di 90 lingue. L’azienda afferma che una voce registrata in una lingua ora parla le altre fluentemente adottando l’accento di un madrelingua, e che l’aderenza all’accento non tende più a ritornare all’accento originale nel corso della generazione.
I Cloni Vocali Instantanei possono ora catturare una voce con alta fedeltà da 10 secondi di audio, secondo l’azienda, che aggiunge che superano i Professional Voice Clones del suo modello Multilingual v2. I Professional Voice Clones, non disponibili in Eleven v3, sono nuovamente supportati e operano con l’intera gamma emotiva del modello. Ogni clone, sia istantaneo che professionale, richiede il consenso verificato del proprietario della voce, e l’audio generato è coperto dalla tecnologia AI Speech Classifier di ElevenLabs, che l’azienda dichiara possa rilevarlo come generato da IA.
Il stitching delle richieste, ovvero l’unione di generazioni successive per contenuti più lunghi, è notevolmente più affidabile in Eleven v4, secondo l’azienda, migliorando l’esperienza di lavoro in ElevenLabs Studio e nell’App ElevenLabs Reader. Una singola generazione supporta fino a 10.000 caratteri, con lo stitching contestuale che mantiene ritmo e consegna coerenti su script più lunghi.
Risultati di benchmark riportati dall’azienda
ElevenLabs riferisce che Eleven v4 si è classificato al primo posto nella classifica Voice Arena di Artificial Analysis Provider per settembre 2026 ed è stato preferito da circa il 75 percento degli ascoltatori nei test ciechi testa a testa. La metodologia a piè di pagina indica che quei test di settembre 2026 hanno messo a confronto il modello con Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS e Google Gemini 3.8 Flash TTS, con i valutatori che hanno ascoltato la stessa frase di Eleven v4 e di un concorrente presentata in forma cieca, giudicando quale fosse più espressiva e quale più naturale, e i pareggi conteggiati come mezzo punto. Un grafico nell’annuncio indica che Eleven v4 ha vinto dal 65 % all’81 % di questi confronti.
Accesso API, prezzi e conformità
Entrambi i modelli sono accessibili tramite endpoint REST e di streaming con SDK TypeScript e Python, e gli sviluppatori passano da un modello all’altro con un unico model_id. I formati di output corrispondono a quelli di tutti gli altri modelli ElevenLabs: MP3, WAV/PCM non compresso per lavori di studio e post-produzione, e µ-law per integrazioni telefoniche e di call‑center, con frequenza di campionamento e bitrate impostati tramite l’API.
La tariffazione segue la stessa struttura a crediti degli altri modelli text‑to‑speech dell’azienda: un livello gratuito con 10.000 crediti al mese, che l’azienda equipara a circa 10 minuti di audio; piani a pagamento a partire da $6 al mese che includono il clonaggio vocale professionale; e prezzi personalizzati per le imprese. Ogni voce nella libreria dell’azienda, composta da più di 17.500 voci, funziona con Eleven v4, sebbene i cloni istantanei e professionali creati prima del lancio debbano essere riaddestrati per funzionare efficacemente con il nuovo modello.
ElevenLabs afferma che Eleven v4 gira su un’infrastruttura certificata SOC 2 Type II, ISO 27001 e PCI DSS Level 1, è conforme al GDPR con flussi di lavoro idonei a HIPAA per il settore sanitario, non addestra su script o tag audio senza consenso e offre la Zero Retention Mode per i servizi aziendali idonei.
La pagina del prodotto Eleven v4 riporta dichiarazioni da clienti nominati, tra cui Ryan Peterson, SVP del prodotto per Agentforce Voice presso Salesforce, che ha affermato: “È proprio qui che vediamo Eleven v4 Turbo alzare l’asticella, con risposte più rapide e naturali che soddisfano lo standard che i nostri clienti si aspettano.” Anche il co‑fondatore di BeyondWords Patrick O’Flaherty, il responsabile dei prodotti per la costruzione del credito di Spring Financial Oscar Daniels e il responsabile di musica e audio di Accenture Accelerate Kyle Gudmundson hanno fornito dichiarazioni sui nuovi modelli.
ElevenLabs indirizza gli sviluppatori alla sua documentazione per la sintassi completa dei tag audio e i dettagli dell’integrazione API.












