Modelos e plataformas de IA

ElevenLabs lança Eleven V4 com variante Turbo de baixa latência

mm
Adicione Unite.AI às suas fontes preferidas no Google

ElevenLabs, em 28 de setembro de 2026, lançou Eleven v4, um modelo de texto para fala que a empresa descreve como o mais emotivo até agora, e Eleven v4 Turbo, uma variante de baixa latência projetada para agentes de voz e uso em tempo real. Ambos os modelos estão disponíveis imediatamente no ElevenAgents, ElevenCreative e através do ElevenAPI, com acesso incluído no plano gratuito.

O post de lançamento foi escrito por Mati Staniszewski e Piotr Dabkowski e arquivado na categoria Pesquisa da empresa.

Uma nova arquitetura focada na expressividade

ElevenLabs afirma que o Eleven v4 foi construído sobre uma arquitetura totalmente nova, projetada para interpretar tom, ritmo, emoção, caráter e contexto a partir do texto, gerando fala que pode soar dramática, terna, urgente, cômica ou conversacional, mantendo a identidade do locutor. A empresa diz que a fidelidade de áudio subjacente é superior em todos os aspectos em relação aos seus modelos anteriores.

Segundo a empresa, um novo método de captura de identidades de locutores foi desenvolvido para manter cada voz consistente em conversas de agentes, audiolivros e anúncios, e o contexto em nível de cena permite que os locutores respondam ao que acabou de ser dito em uma conversa, produzindo diálogos que a empresa descreve como mais naturais do que a montagem de linhas isoladas.

Tags de áudio embutidas substituem controles SSML

Os usuários podem direcionar a entrega em linguagem natural e incorporar tags de áudio embutidas; exemplos da empresa incluem risos, dito com raiva em sotaque francês, chuva leve e vibração de telefone. ElevenLabs afirma que o modelo segue essas tags de áudio e instruções de direção com mais precisão que seus modelos anteriores. O suporte a fonemas do International Phonetic Alphabet foi aprimorado significativamente, de modo que pronúncias personalizadas se comportam de forma mais confiável, e a documentação para desenvolvedores da ElevenLabs cobre toda a sintaxe de tags para uso na API. De acordo com as perguntas frequentes da página do produto, tags SSML como <break> estão desativadas no Eleven v4, com tags em linguagem natural servindo como mecanismo de controle em seu lugar.

Variante Turbo e Medidas de Latência

Para uso em tempo real, a ElevenLabs afirma que suas equipes de pesquisa e engenharia otimizaram o Eleven v4 Turbo juntamente com a plataforma conversacional ElevenAgents como um único sistema. O Turbo suporta streaming bidirecional, de modo que o áudio começa a ser retornado antes que uma frase termine.

A metodologia com notas de rodapé do anúncio indica que o Eleven v4 Turbo registrou um tempo mediano até a primeira fala de aproximadamente 150 milissegundos em testes realizados em setembro de 2026 via streaming WebSocket com scripts idênticos e configurações padrão, comparado ao Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS e OpenAI GPT-4o mini TTS, com a latência de rede medida e removida para todos os sistemas. O gráfico comparativo na página de produtos da empresa lista 150 ms como a referência, contra 262 ms declarados para o Cartesia Sonic 3.6 e 814 ms para o OpenAI GPT-4o mini TTS. O anúncio também cita uma latência mediana de inferência de cerca de 100 ms para o Turbo, um valor que a empresa afirma ser mais rápido que a pausa média entre duas pessoas conversando.

Idiomas, clonagem de voz e áudio de longa duração

Ambos os modelos suportam mais de 90 idiomas. A empresa afirma que uma voz gravada em um idioma agora fala outros fluentemente, adotando o sotaque de um falante nativo, e que a aderência ao sotaque não volta mais a se aproximar do sotaque original ao longo da geração.

Clones de voz instantâneos agora podem capturar uma voz com alta fidelidade a partir de 10 segundos de áudio, segundo a empresa, que também afirma que eles superam os Clones de Voz Profissionais de seu modelo Multilingual v2. Os Clones de Voz Profissionais, indisponíveis no Eleven v3, voltaram a ser suportados e operam com toda a gama emocional do modelo. Cada clone, seja instantâneo ou profissional, requer consentimento verificado do proprietário da voz, e o áudio gerado está coberto pela tecnologia AI Speech Classifier da ElevenLabs, que a empresa diz ser capaz de detectá-lo como gerado por IA.

A costura de solicitações, o encadeamento de gerações para conteúdo de formato mais longo, é significativamente mais confiável no Eleven v4, afirma a empresa, aprimorando a experiência de uso no ElevenLabs Studio e no ElevenLabs Reader App. Uma única geração suporta até 10.000 caracteres, com a costura de contexto mantendo o ritmo e a entrega consistentes em scripts mais extensos.

Resultados de benchmark reportados pela empresa

A ElevenLabs informa que o Eleven v4 ficou em primeiro lugar no ranking Voice Arena da Artificial Analysis Provider para setembro de 2026 e foi preferido por aproximadamente 75 % dos ouvintes em testes cegos de confronto direto. A metodologia com notas de rodapé indica que esses testes de setembro de 2026 colocaram o modelo contra o Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS e Google Gemini 3.8 Flash TTS, com avaliadores ouvindo a mesma frase do Eleven v4 e de um concorrente apresentado de forma cega, julgando qual era mais expressivo e qual soava mais natural, e empates contabilizados como metade. Um gráfico no anúncio afirma que o Eleven v4 venceu de 65 % a 81 % desses confrontos.

Acesso à API, preços e conformidade

Ambos os modelos são acessíveis por meio de endpoints REST e de streaming com SDKs para TypeScript e Python, e os desenvolvedores alternam entre os modelos usando um único model_id. Os formatos de saída correspondem a todos os outros modelos da ElevenLabs: MP3, WAV/PCM sem compressão para trabalho de estúdio e pós‑produção, e µ‑law para telecomunicações e integrações de call‑center, com taxa de amostragem e taxa de bits definidas através da API.

A precificação segue a mesma estrutura de créditos dos demais modelos de texto‑para‑fala da empresa: um nível gratuito com 10,000 créditos por mês, que a empresa equipara a aproximadamente 10 minutos de áudio; planos pagos a partir de $6 por mês que incluem clonagem de voz profissional; e preços personalizados para empresas. Todas as vozes da biblioteca da empresa, que conta com mais de 17,500 vozes, funcionam com o Eleven v4, embora clones instantâneos e profissionais criados antes do lançamento precisem ser re‑treinados para operar efetivamente com o novo modelo.

A ElevenLabs afirma que o Eleven v4 opera em infraestrutura certificada SOC 2 Tipo II, ISO 27001 e PCI DSS Nível 1, está em conformidade com o GDPR e possui fluxos de trabalho elegíveis ao HIPAA para o setor de saúde, não treina em roteiros ou tags de áudio sem consentimento e oferece o Modo de Retenção Zero para serviços empresariais elegíveis.

A Página do produto Eleven v4 contém declarações de clientes nomeados, incluindo Ryan Peterson, SVP de produto da Agentforce Voice na Salesforce, que disse: “É exatamente aí que vemos o Eleven v4 Turbo elevar o padrão, com respostas mais rápidas e naturais que atendem ao nível que nossos clientes esperam.” O cofundador da BeyondWords, Patrick O’Flaherty, o chefe de produtos de construção de crédito da Spring Financial, Oscar Daniels, e o líder de música e áudio da Accenture Accelerate, Kyle Gudmundson, também forneceram declarações sobre os novos modelos.

A ElevenLabs direciona os desenvolvedores à sua documentação para a sintaxe completa de audio-tag e detalhes de integração da API.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.