Modelos e plataformas de IA
Decagon apresenta o agente Voice 3 com o modelo de fala Chord

Decagon apresentou o Voice 3, seu agente de IA de voz para chamadas de clientes, e o Chord, o primeiro modelo de fala da Decagon Labs, no evento Decagon Dialogues 2026 da empresa, em 1 de outubro de 2026, afirmando que o agente suporta mais de 70 idiomas e funciona em uma nova arquitetura duplex.
No anúncio do Voice 3, escrito pelo Gerente de Produto Quique Lores e pela Gerente Sênior de Marketing de Produto Ariana Xiang, a Decagon descreveu o Voice 3 como seu agente de IA de voz mais avançado até agora. O agente fala através do Chord e foi lançado juntamente com três outros produtos no Decagon Dialogues 2026.
No post do Decagon Dialogues 2026, os cofundadores Jesse Zhang, CEO da Decagon, e Ashwin Sreenivas, seu presidente, nomearam as outras três versões: Personal Agent Gateway, que identifica os agentes de IA pessoais dos clientes e lhes oferece um canal dedicado para interagir com uma empresa; Agent Modules, que estende um agente ao longo de jornadas além do suporte; e Duet Apprentice, que permite ao sistema Duet da empresa aprender sobre um negócio a partir de recursos internos e conversas de clientes escaladas.
As empresas primeiro colocaram agentes Decagon para resolver tickets de suporte, escreveram os cofundadores, e esses agentes agora qualificam leads, integram clientes, coletam pagamentos e desenvolvem relacionamentos. As quatro versões ampliam como os clientes acessam o que a Decagon chama de concierge de IA e o que ele pode fazer por eles.
Voice 3 e o modelo de fala Chord
Chord é o primeiro modelo de voz treinado pela Decagon Labs, e a empresa afirma que ele foi pós-treinado com conversas reais de experiência do cliente, em vez de atender à ampla variedade de usos que a maioria dos modelos de voz cobre, desde narração de audiolivros até dublagem de videogames. A Decagon diz que o modelo molda a fala frase a frase, desacelerando para um código de confirmação ou número de telefone e depois retornando a um ritmo conversacional, em vez de depender de uma única configuração de velocidade global. Os controles existentes de personalização de voz são mantidos: seleção de voz, pronúncia de termos específicos do negócio e entrega ajustada ao negócio.
O Voice 3 suporta mais de 70 idiomas sem exigir que as equipes criem um agente separado para cada um, de acordo com o anúncio. Ele detecta o idioma do interlocutor e troca automaticamente, mesmo quando o interlocutor alterna entre idiomas no meio da frase, e a Decagon afirma que suas vozes específicas por localidade refletem como as pessoas falam em cada mercado e são validadas por falantes nativos antes de serem lançadas.
A Decagon afirma que o Chord é treinado com dados licenciados e talentos de voz consentidos, nunca com dados de propriedade do cliente. Christian Niedworok, líder de Comunicação de Serviços Digitais na Deutsche Telekom, disse no anúncio que anos de sistemas de URA treinaram os clientes a falar em fragmentos curtos apenas para alcançar um humano, e que a voz da Decagon soa como se realmente estivesse ouvindo e mantém a conversa fluindo em vez de ficar em silêncio enquanto trabalha. Janelle Sallenave, diretora de operações da Chime, afirmou que o Decagon Voice permite que a Chime combine alto desempenho e personalização de marca perfeita com memória multicanal, mantendo cada interação conectada e fiel aos seus valores centrados no membro.
Pipeline de treinamento e modelo base
Um post complementar de Samuel Zhang, membro da equipe técnica da Decagon focada em orquestração de agentes, descreve como o Chord foi construído. Seu pipeline de treinamento foi projetado para preservar a textura da conversa real, incluindo variação de ritmo, ênfase natural, pausas e palavras de preenchimento, em vez de limpar as gravações para um áudio uniforme, o que, segundo o post, faz as vozes parecerem sintéticas. Dois métodos sustentam essa abordagem: um processo de transcrição literal que preserva o ritmo, a ênfase e as disfluências, e um método de gravação que combina o conteúdo de um roteiro com a naturalidade de uma conversa fluida, em vez de uma leitura performática por atores de voz.
Para o modelo base, a Decagon pós-treinou um modelo de difusão sem tokenizador. O post argumenta que discretizar áudio em tokens descarta informações a cada etapa de tokenização, enquanto uma representação sem tokens permanece próximo de lossless e preserva o detalhe fino que separa uma voz apenas inteligível de uma que soa presente. Também torna o modelo muito mais controlável, segundo o post, permitindo que a Decagon modele emoção, ritmo e ênfase com precisão. Em produção, o Chord é oferecido na Modal.
Arquitetura duplex
A Decagon afirma que a maioria dos agentes de voz opera em um pipeline em cascata, no qual o reconhecimento de fala converte o interlocutor em texto, um grande modelo de linguagem decide como responder e a síntese de voz reproduz a resposta, com cada etapa adicionando atraso e a coordenação entre elas dificultando a troca natural de turnos. O Voice 3 substitui essa configuração por uma arquitetura duplex que executa duas camadas em paralelo: um modelo conversacional de baixa latência lida com a escuta e a fala, desde respostas até atualizações de progresso, enquanto um modelo mais potente gerencia raciocínio, chamadas de ferramentas e aplicação de limites por trás da conversa.
De acordo com a empresa, o agente processa o áudio recebido mesmo enquanto está falando, de modo que responde a um interlocutor que diz “mhm” mas cede diante de uma interrupção genuína. Ele narra seu progresso durante buscas longas, responde a perguntas de acompanhamento enquanto uma tarefa ainda está em execução e auxilia em solicitações menores entre elas, em vez de deixar o interlocutor em silêncio ou em espera.
Resultados de Avaliação Reportados pela Empresa
O post de Zhang relata clientes nos setores de telecomunicações, serviços financeiros e viagens e hospitalidade que migraram de uma voz padrão para uma voz baseada no Chord, comparando os mesmos programas antes e depois, alterando apenas a voz. A taxa de resolução aumentou em todos os casos, segundo a Decagon: +6,1 pontos para o cliente de telecomunicações, +7,1 pontos para o provedor de serviços financeiros e +2,6 pontos para a marca de viagens. As taxas de barganha, que a Decagon define como a parcela de chamadas em que o único objetivo do interlocutor é alcançar um ser humano, diminuíram 14,5, 6,1 e 5,3 pontos nos três clientes.
Em um teste de audição às cegas envolvendo três vozes, os ouvintes ouviram as mesmas amostras de áudio pronunciadas uma vez pelo Chord e uma vez pelo talento vocal em que ele foi modelado, e foram solicitados a identificar qual era a IA. A Decagon relata que 45,7 % dos ouvintes acreditaram que a voz humana real era a IA, resultado que a empresa descreve como próximo o suficiente de um lançamento de moeda 50‑50 para que as duas fossem efetivamente indistinguíveis. O anúncio do Voice 3 resume o resultado como aproximadamente 90 % dos usuários incapazes de distinguir.
A Decagon também relata um teste de preferência que colocou o Chord frente a frente com três outros modelos de fala que descreve como líderes, com as mesmas palavras pronunciadas por cada um e os ouvintes convidados a escolher a voz com a qual mais gostariam de conversar como cliente com um problema. Entre 185 ouvintes, a empresa afirma que o Chord ficou em primeiro lugar geral com 36,2 % e chegou a até 48,4 % em rodadas individuais.
Olhando para o futuro, a Decagon afirma que o desafio mais difícil e valioso é como uma voz se comporta em uma conversa real, incluindo se ela conquista confiança ao longo de cinco minutos e se mantém firme quando a chamada se complica. A empresa descreve o Chord como a mais recente expressão da aposta central da Decagon Labs: que, para interações com clientes, um modelo ajustado para uma tarefa específica supera um modelo de fronteira de uso geral construído para tudo.












