Modèles et plateformes d’IA
Decagon présente l’agent Voice 3 avec le modèle vocal Chord

Decagon a présenté Voice 3, son agent IA vocal pour les appels clients, ainsi que Chord, le premier modèle vocal de Decagon Labs, lors de l’événement Decagon Dialogues 2026 de l’entreprise le 1er octobre 2026, affirmant que l’agent prend en charge plus de 70 langues et fonctionne sur une nouvelle architecture duplex.
Dans l’Annonce Voice 3, rédigée par le chef de produit Quique Lores et la responsable senior du marketing produit Ariana Xiang, Decagon a décrit Voice 3 comme son agent IA vocal le plus avancé à ce jour. L’agent s’exprime via Chord et a été lancé en même temps que trois autres produits lors de Decagon Dialogues 2026.
Dans l’article Decagon Dialogues 2026, les cofondateurs Jesse Zhang, directeur général de Decagon, et Ashwin Sreenivas, son président, ont présenté les trois autres lancements : Personal Agent Gateway, qui identifie les agents IA personnels des clients et leur offre un canal dédié pour interagir avec une entreprise ; Agent Modules, qui étend un agent à travers des parcours au‑delà du support ; et Duet Apprentice, qui permet au système Duet de l’entreprise d’apprendre une activité à partir de ressources internes et de conversations client escaladées.
Les entreprises ont d’abord mis les agents Decagon à contribution pour résoudre des tickets de support, ont écrit les cofondateurs, et ces agents qualifient désormais les prospects, intègrent les clients, collectent les paiements et développent les relations. Les quatre lancements élargissent la manière dont les clients accèdent à ce que Decagon appelle un concierge IA et à ce qu’il peut faire pour eux.
Voice 3 et le modèle vocal Chord
Chord est le premier modèle vocal entraîné par Decagon Labs, et l’entreprise affirme qu’il a été post‑entraîné sur des conversations réelles d’expérience client plutôt que pour le large éventail d’utilisations que la plupart des modèles vocaux couvrent, de la narration de livres audio aux doublages de jeux vidéo. Decagon indique que le modèle façonne la parole phrase par phrase, ralentissant pour un code de confirmation ou un numéro de téléphone, puis revenant à un rythme conversationnel, au lieu de s’appuyer sur un réglage de vitesse global. Les contrôles de personnalisation vocale existants sont conservés : sélection de la voix, prononciation des termes spécifiques à l’entreprise et rendu adapté à l’activité.
Voice 3 prend en charge plus de 70 langues sans obliger les équipes à créer un agent distinct pour chacune, selon l’annonce. Il détecte la langue de l’appelant et bascule automatiquement, même lorsqu’un appelant passe d’une langue à l’autre au milieu d’une phrase, et Decagon affirme que ses voix spécifiques à chaque locale reflètent la façon dont les gens parlent dans chaque marché et sont validées par des locuteurs natifs avant leur mise en service.
Decagon indique que Chord est entraîné sur des données sous licence et des talents vocaux consentis, jamais sur des données détenues par les clients. Christian Niedworok, responsable de la communication des services numériques chez Deutsche Telekom, a déclaré dans l’annonce que des années de systèmes IVR ont conditionné les clients à parler en fragments courts simplement pour atteindre un humain, et que la voix de Decagon donne l’impression d’écouter réellement et maintient la conversation en mouvement au lieu de se taire pendant le traitement. Janelle Sallenave, directrice des opérations de Chime, a affirmé que Decagon Voice permet à Chime de combiner haute performance et personnalisation de marque fluide avec une mémoire cross‑canal, gardant chaque interaction connectée et fidèle à ses valeurs centrées sur les membres.
Pipeline d’entraînement et modèle de base
Un article compagnon de Samuel Zhang, membre du personnel technique de Decagon spécialisé dans l’orchestration des agents, décrit comment Chord a été construit. Son pipeline d’entraînement est conçu pour préserver la texture d’une vraie conversation, incluant les variations de rythme, les accents naturels, les pauses et les mots de remplissage, plutôt que de nettoyer les enregistrements en une lecture uniforme, ce qui, selon le post, rend les voix synthétiques. Deux méthodes soutiennent cette approche : un processus de transcription verbatim qui conserve le rythme, les accents et les disfluences, et une méthode d’enregistrement qui combine le contenu d’un script avec la naturalité d’une conversation fluide plutôt qu’une lecture performative par des acteurs vocaux.
Pour le modèle de base, Decagon a post‑entraîné un modèle de diffusion sans tokenizer. Le post soutient que la discrétisation de l’audio en jetons supprime des informations à chaque étape de tokenisation, tandis qu’une représentation sans jeton reste proche du lossless et préserve les détails fins qui distinguent une voix simplement intelligible d’une voix qui semble présente. Cela rend également le modèle beaucoup plus dirigable, indique le post, permettant à Decagon de façonner l’émotion, le rythme et les accents avec précision. En production, Chord est déployé sur Modal.
Architecture duplex
Decagon indique que la plupart des agents vocaux fonctionnent avec un pipeline en cascade où la conversion parole‑texte transcrit l’appelant, un grand modèle de langage décide de la réponse, et la conversion texte‑parole prononce la réponse, chaque étape ajoutant du retard et la coordination entre les étapes rendant la prise de parole naturelle difficile. Voice 3 remplace cette configuration par une architecture duplex qui exécute deux couches en parallèle : un modèle conversationnel à faible latence gère l’écoute et la parole, des réponses aux mises à jour de progression, tandis qu’un modèle plus puissant gère le raisonnement, l’appel d’outils et l’application des garde‑fous derrière la conversation.
Selon l’entreprise, l’agent traite l’audio entrant même pendant qu’il parle, de sorte qu’il continue de parler lorsqu’un appelant dit « mhm » mais cède en cas d’interruption réelle. Il raconte son avancement lors de longues recherches, répond aux questions de suivi pendant qu’une tâche est encore en cours, et aide avec de petites demandes entre‑temps, plutôt que de laisser l’appelant dans le silence ou en attente.
Résultats d’évaluation rapportés par l’entreprise
Le post de Zhang rapporte des clients dans les télécommunications, les services financiers et le secteur du voyage et de l’hôtellerie qui sont passés d’une voix prête à l’emploi à une voix sur Chord, en comparant les mêmes programmes avant et après avec uniquement la voix modifiée. Le taux de résolution a augmenté dans chaque cas, indique Decagon : +6,1 points pour le client des télécommunications, +7,1 points pour le prestataire de services financiers et +2,6 points pour la marque de voyage. Les taux de « barge », que Decagon définit comme la part des appels où l’objectif unique de l’appelant est de parler à un humain, ont diminué de 14,5, 6,1 et 5,3 points chez les trois clients.
Dans un test d’écoute à l’aveugle portant sur trois voix, les auditeurs ont entendu les mêmes échantillons audio prononcés une fois par Chord et une fois par le talent vocal sur lequel il a été modélisé, puis on leur a demandé de choisir laquelle était l’IA. Decagon indique que 45,7 % des auditeurs pensaient que la vraie voix humaine était l’IA, un résultat que l’entreprise décrit comme suffisamment proche d’un tirage à pile ou face pour que les deux soient pratiquement indiscernables. L’annonce de Voice 3 résume ce résultat à environ 90 % des utilisateurs incapables de faire la différence.
Decagon rapporte également un test de préférence qui a opposé Chord à trois autres modèles de parole qu’elle décrit comme leaders, les mêmes mots étant prononcés par chacun et les auditeurs invités à choisir la voix avec laquelle ils souhaiteraient le plus parler en tant que client confronté à un problème. Sur 185 auditeurs, l’entreprise indique que Chord s’est classé premier globalement avec 36,2 % et a atteint jusqu’à 48,4 % lors de certaines sessions.
En regardant vers l’avenir, Decagon affirme que le problème le plus difficile et le plus précieux est la façon dont une voix se comporte dans une vraie conversation, notamment si elle gagne la confiance sur cinq minutes et reste fiable lorsqu’un appel devient chaotique. L’entreprise décrit Chord comme la dernière incarnation de la conviction centrale de Decagon Labs : pour les interactions client, un modèle affiné pour une tâche précise surpasse un modèle de pointe à usage général conçu pour tout.












