Modelos e plataformas de IA
ElevenLabs lança Eleven V4 com variante Turbo de baixa latência

ElevenLabs, em 28 de setembro de 2026, lançou Eleven v4, um modelo de texto para fala que a empresa descreve como o mais emotivo até agora, e Eleven v4 Turbo, uma variante de baixa latência projetada para agentes de voz e uso em tempo real. Ambos os modelos estão disponíveis imediatamente no ElevenAgents, ElevenCreative e através do ElevenAPI, com acesso incluído no plano gratuito.
O post de lançamento foi escrito por Mati Staniszewski e Piotr Dabkowski e arquivado na categoria Pesquisa da empresa.
Uma nova arquitetura focada na expressividade
ElevenLabs afirma que o Eleven v4 foi construído sobre uma arquitetura totalmente nova, projetada para interpretar tom, ritmo, emoção, caráter e contexto a partir do texto, gerando fala que pode soar dramática, terna, urgente, cômica ou conversacional, mantendo a identidade do locutor. A empresa diz que a fidelidade de áudio subjacente é superior em todos os aspectos em relação aos seus modelos anteriores.
Segundo a empresa, um novo método de captura de identidades de locutores foi desenvolvido para manter cada voz consistente em conversas de agentes, audiolivros e anúncios, e o contexto em nível de cena permite que os locutores respondam ao que acabou de ser dito em uma conversa, produzindo diálogos que a empresa descreve como mais naturais do que a montagem de linhas isoladas.
Tags de áudio embutidas substituem controles SSML
Os usuários podem direcionar a entrega em linguagem natural e incorporar tags de áudio embutidas; exemplos da empresa incluem risos, dito com raiva em sotaque francês, chuva leve e vibração de telefone. ElevenLabs afirma que o modelo segue essas tags de áudio e instruções de direção com mais precisão que seus modelos anteriores. O suporte a fonemas do International Phonetic Alphabet foi aprimorado significativamente, de modo que pronúncias personalizadas se comportam de forma mais confiável, e a documentação para desenvolvedores da ElevenLabs cobre toda a sintaxe de tags para uso na API. De acordo com as perguntas frequentes da página do produto, tags SSML como <break> estão desativadas no Eleven v4, com tags em linguagem natural servindo como mecanismo de controle em seu lugar.
Variante Turbo e Medidas de Latência
Para uso em tempo real, a ElevenLabs afirma que suas equipes de pesquisa e engenharia otimizaram o Eleven v4 Turbo juntamente com a plataforma conversacional ElevenAgents como um único sistema. O Turbo suporta streaming bidirecional, de modo que o áudio começa a ser retornado antes que uma frase termine.
A metodologia com notas de rodapé do anúncio indica que o Eleven v4 Turbo registrou um tempo mediano até a primeira fala de aproximadamente 150 milissegundos em testes realizados em setembro de 2026 via streaming WebSocket com scripts idênticos e configurações padrão, comparado ao Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS e OpenAI GPT-4o mini TTS, com a latência de rede medida e removida para todos os sistemas. O gráfico comparativo na página de produtos da empresa lista 150 ms como a referência, contra 262 ms declarados para o Cartesia Sonic 3.6 e 814 ms para o OpenAI GPT-4o mini TTS. O anúncio também cita uma latência mediana de inferência de cerca de 100 ms para o Turbo, um valor que a empresa afirma ser mais rápido que a pausa média entre duas pessoas conversando.
Idiomas, clonagem de voz e áudio de longa duração
Ambos os modelos suportam mais de 90 idiomas. A empresa afirma que uma voz gravada em um idioma agora fala outros fluentemente, adotando o sotaque de um falante nativo, e que a aderência ao sotaque não volta mais a se aproximar do sotaque original ao longo da geração.
Clones de voz instantâneos agora podem capturar uma voz com alta fidelidade a partir de 10 segundos de áudio, segundo a empresa, que também afirma que eles superam os Clones de Voz Profissionais de seu modelo Multilingual v2. Os Clones de Voz Profissionais, indisponíveis no Eleven v3, voltaram a ser suportados e operam com toda a gama emocional do modelo. Cada clone, seja instantâneo ou profissional, requer consentimento verificado do proprietário da voz, e o áudio gerado está coberto pela tecnologia AI Speech Classifier da ElevenLabs, que a empresa diz ser capaz de detectá-lo como gerado por IA.
A costura de solicitações, o encadeamento de gerações para conteúdo de formato mais longo, é significativamente mais confiável no Eleven v4, afirma a empresa, aprimorando a experiência de uso no ElevenLabs Studio e no ElevenLabs Reader App. Uma única geração suporta até 10.000 caracteres, com a costura de contexto mantendo o ritmo e a entrega consistentes em scripts mais extensos.
Resultados de benchmark reportados pela empresa
A ElevenLabs informa que o Eleven v4 ficou em primeiro lugar no ranking Voice Arena da Artificial Analysis Provider para setembro de 2026 e foi preferido por aproximadamente 75 % dos ouvintes em testes cegos de confronto direto. A metodologia com notas de rodapé indica que esses testes de setembro de 2026 colocaram o modelo contra o Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS e Google Gemini 3.8 Flash TTS, com avaliadores ouvindo a mesma frase do Eleven v4 e de um concorrente apresentado de forma cega, julgando qual era mais expressivo e qual soava mais natural, e empates contabilizados como metade. Um gráfico no anúncio afirma que o Eleven v4 venceu de 65 % a 81 % desses confrontos.
Acesso à API, preços e conformidade
Ambos os modelos são acessíveis por meio de endpoints REST e de streaming com SDKs para TypeScript e Python, e os desenvolvedores alternam entre os modelos usando um único model_id. Os formatos de saída correspondem a todos os outros modelos da ElevenLabs: MP3, WAV/PCM sem compressão para trabalho de estúdio e pós‑produção, e µ‑law para telecomunicações e integrações de call‑center, com taxa de amostragem e taxa de bits definidas através da API.
A precificação segue a mesma estrutura de créditos dos demais modelos de texto‑para‑fala da empresa: um nível gratuito com 10,000 créditos por mês, que a empresa equipara a aproximadamente 10 minutos de áudio; planos pagos a partir de $6 por mês que incluem clonagem de voz profissional; e preços personalizados para empresas. Todas as vozes da biblioteca da empresa, que conta com mais de 17,500 vozes, funcionam com o Eleven v4, embora clones instantâneos e profissionais criados antes do lançamento precisem ser re‑treinados para operar efetivamente com o novo modelo.
A ElevenLabs afirma que o Eleven v4 opera em infraestrutura certificada SOC 2 Tipo II, ISO 27001 e PCI DSS Nível 1, está em conformidade com o GDPR e possui fluxos de trabalho elegíveis ao HIPAA para o setor de saúde, não treina em roteiros ou tags de áudio sem consentimento e oferece o Modo de Retenção Zero para serviços empresariais elegíveis.
A Página do produto Eleven v4 contém declarações de clientes nomeados, incluindo Ryan Peterson, SVP de produto da Agentforce Voice na Salesforce, que disse: “É exatamente aí que vemos o Eleven v4 Turbo elevar o padrão, com respostas mais rápidas e naturais que atendem ao nível que nossos clientes esperam.” O cofundador da BeyondWords, Patrick O’Flaherty, o chefe de produtos de construção de crédito da Spring Financial, Oscar Daniels, e o líder de música e áudio da Accenture Accelerate, Kyle Gudmundson, também forneceram declarações sobre os novos modelos.
A ElevenLabs direciona os desenvolvedores à sua documentação para a sintaxe completa de audio-tag e detalhes de integração da API.












