Modelli e piattaforme di IA
Decagon presenta l’agente Voice 3 con il modello vocale Chord

Decagon ha presentato Voice 3, il suo agente IA vocale per le chiamate dei clienti, e Chord, il primo modello vocale di Decagon Labs, durante l’evento Decagon Dialogues 2026 dell’azienda, tenutosi l’1 ottobre 2026, affermando che l’agente supporta più di 70 lingue e funziona su una nuova architettura duplex.
Nell’annuncio di Voice 3, redatto dal Product Manager Quique Lores e dalla Senior Product Marketing Manager Ariana Xiang, Decagon ha descritto Voice 3 come il suo agente IA vocale più avanzato finora. L’agente parla tramite Chord e è stato lanciato insieme a tre altri prodotti durante Decagon Dialogues 2026.
Nel post di Decagon Dialogues 2026, i cofondatori Jesse Zhang, amministratore delegato di Decagon, e Ashwin Sreenivas, presidente, hanno presentato le altre tre uscite: Personal Agent Gateway, che identifica gli agenti IA personali dei clienti e fornisce loro un canale dedicato per interagire con un’azienda; Agent Modules, che estende un agente lungo i percorsi oltre il supporto; e Duet Apprentice, che consente al sistema Duet dell’azienda di apprendere un’attività dalle risorse interne e dalle conversazioni dei clienti in escalation.
Le imprese hanno inizialmente impiegato gli agenti Decagon per risolvere ticket di supporto, hanno scritto i cofondatori, e quegli agenti ora qualificano i lead, accolgono i clienti, raccolgono pagamenti e sviluppano relazioni. Le quattro uscite ampliano il modo in cui i clienti accedono a quello che Decagon definisce un concierge IA e a ciò che può fare per loro.
Voice 3 e il modello vocale Chord
Chord è il primo modello vocale addestrato da Decagon Labs e l’azienda afferma che è stato post-addestrato su conversazioni reali di esperienza cliente, anziché per l’ampia gamma di usi a cui servono la maggior parte dei modelli vocali, dalla narrazione di audiolibri ai doppiaggi di videogiochi. Decagon dichiara che il modello modella il discorso frase per frase, rallentando per un codice di conferma o un numero di telefono e poi tornando a un ritmo conversazionale, invece di basarsi su un’impostazione di velocità globale. I controlli di personalizzazione vocale esistenti vengono mantenuti: selezione della voce, pronuncia di termini specifici dell’azienda e consegna ottimizzata per il business.
Voice 3 supporta più di 70 lingue senza richiedere ai team di creare un agente separato per ciascuna, secondo l’annuncio. Rileva la lingua del chiamante e passa automaticamente, anche quando il chiamante cambia lingua a metà frase, e Decagon afferma che le voci specifiche per ciascuna località riflettono il modo in cui le persone parlano in ogni mercato e sono validate da madrelingua prima del rilascio.
Decagon afferma che Chord è addestrato su dati con licenza e talenti vocali consenzienti, mai su dati di proprietà dei clienti. Christian Niedworok, responsabile della Digital Service Communication presso Deutsche Telekom, ha dichiarato nell’annuncio che anni di sistemi IVR hanno abituato i clienti a parlare a frammenti brevi solo per raggiungere un operatore umano, e che la voce di Decagon sembra ascoltare davvero e mantiene la conversazione fluida invece di interrompersi mentre elabora. La Chief Operating Officer di Chime, Janelle Sallenave, ha affermato che Decagon Voice consente a Chime di combinare alte prestazioni e personalizzazione del brand senza soluzione di continuità con una memoria cross-channel, mantenendo ogni interazione collegata e fedele ai valori incentrati sui membri.
Pipeline di addestramento e modello di base
Un post di accompagnamento di Samuel Zhang, membro dello staff tecnico di Decagon focalizzato sull’orchestrazione degli agenti, descrive come è stato costruito Chord. La sua pipeline di addestramento è progettata per preservare la trama della conversazione reale, includendo variazioni di ritmo, enfasi naturale, pause e parole di riempimento, anziché pulire le registrazioni in una lettura uniforme, come afferma il post, che rende le voci sintetiche. Due metodi supportano questo approccio: un processo di trascrizione verbatim che conserva ritmo, enfasi e disfluenze, e un metodo di registrazione che combina il contenuto di uno script con la naturalezza di una conversazione fluida, piuttosto che una lettura performativa da parte di doppiatori.
Per il modello di base, Decagon ha post-addestrato un modello di diffusione privo di tokenizzatore. Il post sostiene che discretizzare l’audio in token scarta informazioni a ogni passaggio di tokenizzazione, mentre una rappresentazione senza token rimane quasi lossless e preserva i dettagli fini che distinguono una voce appena intelligibile da una che sembra presente. Inoltre, rende il modello molto più guidabile, secondo il post, consentendo a Decagon di modellare emozione, ritmo ed enfasi con precisione. In produzione, Chord è erogato su Modal.
Architettura duplex
Decagon afferma che la maggior parte degli agenti vocali utilizza una pipeline a cascata in cui il riconoscimento vocale trascrive il chiamante, un modello di linguaggio di grandi dimensioni decide la risposta e la sintesi vocale pronuncia la risposta, con ogni fase che aggiunge ritardi e la coordinazione tra le fasi rende difficile il turn-taking naturale. Voice 3 sostituisce questa configurazione con un’architettura duplex che esegue due livelli in parallelo: un modello conversazionale a bassa latenza gestisce l’ascolto e la parlata, dalle risposte agli aggiornamenti di avanzamento, mentre un modello più potente gestisce il ragionamento, le chiamate agli strumenti e l’applicazione delle barriere di sicurezza dietro la conversazione.
Secondo l’azienda, l’agente elabora l’audio in ingresso anche mentre sta parlando, così risponde a un chiamante che dice “mhm” ma cede a un’interruzione reale. Narra i propri progressi durante ricerche lunghe, risponde a domande di follow-up mentre un compito è ancora in esecuzione e assiste con richieste più piccole nel frattempo, invece di lasciare il chiamante in silenzio o in attesa.
Risultati della valutazione riportati dall’azienda
Il post di Zhang riporta clienti nei settori delle telecomunicazioni, dei servizi finanziari e dei viaggi e dell’ospitalità che sono passati da una voce preconfezionata a una voce su Chord, confrontando gli stessi programmi prima e dopo con solo la voce modificata. Il tasso di risoluzione è aumentato in tutti i casi, secondo Decagon: +6,1 punti per il cliente telecom, +7,1 punti per il fornitore di servizi finanziari e +2,6 punti per il marchio del settore viaggi. I tassi di “barge”, che Decagon definisce come la quota di chiamate in cui l’unico obiettivo del chiamante è parlare con un umano, sono diminuiti di 14,5, 6,1 e 5,3 punti nei tre clienti.
In un test di ascolto cieco su tre voci, gli ascoltatori hanno sentito gli stessi campioni audio pronunciati una volta da Chord e una volta dal talento vocale su cui è stato modellato, e sono stati invitati a indicare quale fosse l’IA. Decagon riporta che il 45,7% degli ascoltatori credeva che la voce umana reale fosse l’IA, un risultato che l’azienda descrive come sufficientemente vicino a una divisione 50‑50 da rendere le due voci praticamente indistinguibili. L’annuncio di Voice 3 riassume il risultato come circa il 90% degli utenti incapaci di distinguere.
Decagon riporta inoltre un test di preferenza che ha messo Chord a confronto diretto con altri tre modelli vocali che descrive come leader, con le stesse parole pronunciate da ciascuno e gli ascoltatori invitati a scegliere la voce con cui preferirebbero parlare come cliente con un problema. Su 185 ascoltatori, l’azienda afferma che Chord si è classificato primo complessivamente con il 36,2% e ha raggiunto fino al 48,4% in round individuali.
Guardando al futuro, Decagon afferma che il problema più difficile e più prezioso è come una voce si comporta in una conversazione reale, inclusa la capacità di guadagnare fiducia in cinque minuti e di mantenere la qualità quando una chiamata diventa caotica. L’azienda descrive Chord come l’ultima espressione della scommessa centrale di Decagon Labs: che per le interazioni con i clienti, un modello ottimizzato per un compito specifico supera un modello di frontiera generico costruito per tutto.












