Modelos y plataformas de IA
Decagon presenta el agente Voice 3 con el modelo de voz Chord

Decagon presentó Voice 3, su agente de IA de voz para llamadas de clientes, y Chord, el primer modelo de voz de Decagon Labs, en el evento Decagon Dialogues 2026 de la compañía el 1 de octubre de 2026, indicando que el agente admite más de 70 idiomas y funciona con una nueva arquitectura dúplex.
En el anuncio de Voice 3, redactado por el Gerente de Producto Quique Lores y la Gerente Senior de Marketing de Producto Ariana Xiang, Decagon describió Voice 3 como su agente de IA de voz más avanzado hasta la fecha. El agente habla a través de Chord y se lanzó junto a tres productos más en Decagon Dialogues 2026.
En la publicación de Decagon Dialogues 2026, los cofundadores Jesse Zhang, director ejecutivo de Decagon, y Ashwin Sreenivas, su presidente, anunciaron los otros tres lanzamientos: Personal Agent Gateway, que identifica los agentes de IA personales de los clientes y les brinda un canal dedicado para interactuar con una empresa; Agent Modules, que extiende un agente a lo largo de recorridos más allá del soporte; y Duet Apprentice, que permite que el sistema Duet de la compañía aprenda una empresa a partir de recursos internos y conversaciones de clientes escaladas.
Las empresas primero pusieron en funcionamiento los agentes Decagon para resolver tickets de soporte, escribieron los cofundadores, y esos agentes ahora califican prospectos, incorporan clientes, recaudan pagos y fomentan relaciones. Los cuatro lanzamientos amplían la forma en que los clientes acceden a lo que Decagon llama un conserje de IA y lo que puede hacer por ellos.
Voice 3 y el modelo de voz Chord
Chord es el primer modelo de voz entrenado por Decagon Labs, y la compañía afirma que se entrenó posteriormente con conversaciones reales de experiencia del cliente, en lugar de para el amplio abanico de usos que la mayoría de los modelos de voz cubren, desde la narración de audiolibros hasta la locución de videojuegos. Decagon dice que el modelo moldea el habla frase por frase, ralentizando para un código de confirmación o número de teléfono y luego retomando un ritmo conversacional, en lugar de depender de una única configuración de velocidad global. Los controles de personalización de voz existentes se mantienen: selección de voz, pronunciación de términos específicos del negocio y entrega ajustada al negocio.
Voice 3 admite más de 70 idiomas sin requerir que los equipos construyan un agente separado para cada uno, según el anuncio. Detecta el idioma del interlocutor y cambia automáticamente, incluso cuando el interlocutor pasa de un idioma a otro a mitad de frase, y Decagon afirma que sus voces específicas por localidad reflejan cómo habla la gente en cada mercado y son validadas por hablantes nativos antes de su lanzamiento.
Decagon afirma que Chord se entrena con datos con licencia y talento vocal consentido, nunca con datos propiedad de los clientes. Christian Niedworok, líder de Comunicación de Servicios Digitales en Deutsche Telekom, dijo en el anuncio que años de sistemas IVR han entrenado a los clientes a hablar en fragmentos breves solo para alcanzar a un humano, y que la voz de Decagon suena como si realmente estuviera escuchando y mantiene la conversación en movimiento en lugar de quedarse en silencio mientras trabaja. Janelle Sallenave, directora de operaciones de Chime, dijo que Decagon Voice permite a Chime combinar alto rendimiento y personalización de marca sin fisuras con memoria multicanal, manteniendo cada interacción conectada y fiel a sus valores centrados en el miembro.
Pipeline de entrenamiento y modelo base
Una publicación complementaria de Samuel Zhang, miembro del personal técnico de Decagon centrado en la orquestación de agentes, describe cómo se construyó Chord. Su pipeline de entrenamiento está diseñado para preservar la textura de la conversación real, incluyendo cambios de ritmo, énfasis natural, pausas y palabras de relleno, en lugar de limpiar las grabaciones para que suenen uniformes, como dice la publicación, lo que hace que las voces suenen sintéticas. Dos métodos respaldan ese enfoque: un proceso de transcripción literal que preserva el ritmo, el énfasis y las disfluencias, y un método de grabación que combina el contenido de un guion con la naturalidad de una conversación fluida en lugar de una lectura interpretativa de actores de voz.
Para el modelo base, Decagon entrenó posteriormente un modelo de difusión sin tokenizador. La publicación argumenta que discretizar el audio en tokens descarta información en cada paso de tokenización, mientras que una representación sin tokens se mantiene cercana a la pérdida nula y preserva el detalle fino que separa una voz meramente inteligible de una que suena presente. También hace que el modelo sea mucho más direccionable, según la publicación, permitiendo a Decagon moldear la emoción, el ritmo y el énfasis con precisión. En producción, Chord se ofrece a través de Modal.
Arquitectura dúplex
Decagon afirma que la mayoría de los agentes de voz operan con una pipeline en cascada en la que el reconocimiento de voz transcribe al interlocutor, un modelo de gran lenguaje decide cómo responder y la síntesis de voz pronuncia la respuesta, con cada etapa añadiendo retraso y la coordinación entre etapas dificultando la toma de turnos natural. Voice 3 reemplaza esa disposición con una arquitectura dúplex que ejecuta dos capas en paralelo: un modelo conversacional de baja latencia se encarga de escuchar y hablar, desde respuestas hasta actualizaciones de progreso, mientras que un modelo más potente gestiona el razonamiento, la invocación de herramientas y la aplicación de restricciones detrás de la conversación.
Según la compañía, el agente procesa el audio entrante incluso mientras habla, de modo que continúa la conversación cuando el interlocutor dice “mhm” pero cede ante una interrupción genuina. Narra su progreso durante búsquedas extensas, responde preguntas de seguimiento mientras una tarea sigue en ejecución y ayuda con solicitudes menores entre medio, en lugar de dejar al interlocutor en silencio o en espera.
Resultados de la evaluación reportados por la empresa
La publicación de Zhang informa sobre clientes en telecomunicaciones, servicios financieros y viajes y hospitalidad que cambiaron de una voz estándar a una voz en Chord, comparando los mismos programas antes y después con solo la voz modificada. La tasa de resolución aumentó en todos los casos, informa Decagon: +6,1 puntos para el cliente de telecomunicaciones, +7,1 puntos para el proveedor de servicios financieros y +2,6 puntos para la marca de viajes. Las tasas de barge, que Decagon define como la proporción de llamadas en las que el único objetivo del llamante es contactar a un humano, disminuyeron 14,5, 6,1 y 5,3 puntos entre los tres clientes.
En una prueba de escucha a ciegas con tres voces, los oyentes escucharon las mismas muestras de audio pronunciadas una vez por Chord y una vez por el talento vocal en el que se basó, y se les pidió que identificaran cuál era la IA. Decagon informa que el 45,7 % de los oyentes creyeron que la voz humana real era la IA, un resultado que la empresa describe como lo suficientemente cercano a una tirada de moneda 50‑50 como para que ambas fueran efectivamente indistinguibles. El anuncio de Voice 3 resume el resultado como aproximadamente el 90 % de los usuarios incapaces de distinguir.
Decagon también informa de una prueba de preferencia que enfrentó a Chord contra otros tres modelos de voz que describe como líderes, con las mismas palabras pronunciadas por cada uno y pidiendo a los oyentes que eligieran la voz con la que más les gustaría conversar como cliente con un problema. Entre 185 oyentes, la empresa afirma que Chord se ubicó primero en general con un 36,2 % y alcanzó hasta un 48,4 % en rondas individuales.
De cara al futuro, Decagon afirma que el problema más difícil y valioso es cómo se comporta una voz dentro de una conversación real, incluyendo si gana confianza durante cinco minutos y se mantiene firme cuando una llamada se complica. La empresa describe a Chord como la última expresión de la apuesta central de Decagon Labs: que, para las interacciones con clientes, un modelo afinado para una tarea específica supera a un modelo de frontera de propósito general construido para todo.












