Modele și platforme AI
Decagon prezintă agentul Voice 3 cu modelul de vorbire Chord

Decagon a prezentat Voice 3, agentul său AI vocal pentru apeluri de clienți, și Chord, primul model de vorbire de la Decagon Labs, la evenimentul companiei Decagon Dialogues 2026, desfășurat pe 1 octombrie 2026, afirmând că agentul suportă peste 70 de limbi și rulează pe o nouă arhitectură duplex.
În anunțul Voice 3, redactat de Product Manager Quique Lores și Senior Product Marketing Manager Ariana Xiang, Decagon a descris Voice 3 ca fiind cel mai avansat agent AI vocal de până acum. Agentul vorbește prin Chord și a fost lansat alături de alte trei produse la Decagon Dialogues 2026.
În postarea Decagon Dialogues 2026, co-fondatorii Jesse Zhang, directorul executiv al Decagon, și Ashwin Sreenivas, președintele său, au numit celelalte trei lansări: Personal Agent Gateway, care identifică agenții AI personali ai clienților și le oferă un canal dedicat pentru a interacționa cu o afacere; Agent Modules, care extind un agent pe parcursul călătoriilor dincolo de suport; și Duet Apprentice, care permite sistemului Duet al companiei să învețe o afacere din resurse interne și din conversații escaladate ale clienților.
Întreprinderile au început să folosească agenții Decagon pentru rezolvarea tichetelor de suport, au scris co-fondatorii, iar acești agenți califică acum potențiali clienți, înregistrează clienți, colectează plăți și dezvoltă relații. Cele patru lansări extind modul în care clienții accesează ceea ce Decagon numește un concierge AI și ce poate face pentru ei.
Voice 3 și modelul de vorbire Chord
Chord este primul model vocal antrenat de Decagon Labs, iar compania afirmă că a fost post-antrenat pe conversații reale de experiență ale clienților, în loc să fie conceput pentru gama largă de utilizări pe care majoritatea modelelor vocale le servesc, de la nararea de cărți audio la voice-over-uri pentru jocuri video. Decagon spune că modelul modelează vorbirea frază cu frază, încetinind pentru un cod de confirmare sau un număr de telefon și apoi revenind la un ritm conversațional, în loc să se bazeze pe o setare globală de viteză. Controalele existente de personalizare vocală sunt păstrate: selecția vocii, pronunția termenilor specifici afacerii și livrarea ajustată la afacere.
Voice 3 suportă peste 70 de limbi fără a necesita echipelor să construiască un agent separat pentru fiecare, conform anunțului. Detectează limba apelantului și comută automat, chiar și atunci când apelantul trece de la o limbă la alta în mijlocul propoziției, iar Decagon afirmă că vocile sale specifice fiecărei regiuni reflectă modul în care oamenii vorbesc în fiecare piață și sunt validate de vorbitori nativi înainte de a fi lansate.
Decagon declară că Chord este antrenat pe date licențiate și pe talente vocale consimțite, niciodată pe date deținute de clienți. Christian Niedworok, lider al Digital Service Communication la Deutsche Telekom, a spus în anunț că anii de sisteme IVR au învățat clienții să vorbească în fragmente scurte doar pentru a ajunge la un om și că vocea Decagon pare că ascultă cu adevărat și menține conversația în mișcare în loc să tacă în timp ce lucrează. Chief Operating Officer al Chime, Janelle Sallenave, a declarat că Decagon Voice permite Chime să combine performanță înaltă și personalizare de brand fără cusur cu memorie cross-channel, menținând fiecare interacțiune conectată și fidelă valorilor sale orientate spre membru.
Fluxul de antrenament și modelul de bază
Un post însoțitor de Samuel Zhang, membru al echipei tehnice a Decagon axat pe orchestrarea agenților, descrie cum a fost construit Chord. Fluxul său de antrenament este conceput să păstreze textura conversației reale, inclusiv schimbarea ritmului, accentuarea naturală, pauzele și cuvintele de umplutură, în loc să curețe înregistrările într-un citit uniform și curat, conform postului, ceea ce face ca vocile să pară sintetice. Două metode susțin această abordare: un proces de transcriere verbatim care păstrează ritmul, accentuarea și disfluențele, și o metodă de înregistrare care combină conținutul unui scenariu cu naturalitatea unei conversații libere, în loc de o lectură performativă de la actori vocali.
Pentru modelul de bază, Decagon a post-antrenat un model de difuzie fără tokenizator. Postarea susține că discretizarea audio în tokenuri elimină informații la fiecare pas de tokenizare, în timp ce o reprezentare fără token rămâne aproape de lipsă de pierdere și păstrează detaliul fin care separă o voce doar inteligibilă de una care pare prezentă. De asemenea, face modelul mult mai controlabil, conform postului, permițând Decagon să modeleze emoția, ritmul și accentuarea cu precizie. În producție, Chord este furnizat pe Modal.
Arhitectura duplex
Decagon afirmă că majoritatea agenților vocali rulează un flux în cascadă în care speech-to-text transcrie apelantul, un model de limbaj mare decide cum să răspundă și text-to-speech rostește răspunsul, fiecare etapă adăugând întârziere și coordonarea dintre etape îngreunând luarea naturală a cuvântului. Voice 3 înlocuiește această aranjare cu o arhitectură duplex care rulează două straturi în paralel: un model conversațional cu latență scăzută gestionează ascultarea și vorbirea, de la răspunsuri la actualizări de progres, în timp ce un model mai puternic se ocupă de raționament, apelarea instrumentelor și aplicarea limitărilor în spatele conversației.
Conform companiei, agentul procesează audio-ul intrat chiar și în timp ce vorbește, astfel că răspunde unui apelant care spune „mhm” dar cedează la o întrerupere autentică. Nară progresul său în timpul căutărilor lungi, răspunde la întrebări de follow-up în timp ce o sarcină este încă în desfășurare și ajută cu cereri mai mici între timp, în loc să lase apelantul în tăcere sau în așteptare.
Rezultatele evaluării raportate de companie
Postarea lui Zhang raportează despre clienți din telecomunicații, servicii financiare și turism și ospitalitate care au trecut de la o voce standard la o voce pe Chord, comparând aceleași programe înainte și după, cu singura modificare fiind vocea. Rata de rezoluție a crescut în fiecare caz, raportează Decagon: cu 6,1 puncte pentru clientul din telecomunicații, 7,1 puncte pentru furnizorul de servicii financiare și 2,6 puncte pentru brandul de călătorii. Ratele de baraj, pe care Decagon le definește ca ponderea apelurilor în care singurul scop al apelantului este să ajungă la un om, au scăzut cu 14,5, 6,1 și 5,3 puncte la cei trei clienți.
Într-un test de ascultare în orb pe trei voci, ascultătorii au auzit aceleași mostre audio rostite o dată de Chord și o dată de talentul vocal pe care a fost modelat, și li s-a cerut să aleagă care era AI-ul. Decagon raportează că 45,7% dintre ascultători au crezut că vocea umană reală era AI-ul, un rezultat pe care compania îl descrie ca fiind suficient de apropiat de o aruncare de monedă 50-50 încât cele două să fie practic indistinguibile. Anunțul Voice 3 rezumă rezultatul ca fiind aproximativ 90% dintre utilizatori incapabili să distingă.
Decagon raportează, de asemenea, un test de preferință care a pus Chord față în față cu alte trei modele de vorbire pe care le descrie ca fiind de top, cu aceleași cuvinte rostite de fiecare și ascultătorilor li s-a cerut să aleagă vocea cu care ar dori cel mai mult să vorbească ca client cu o problemă. În rândul a 185 de ascultători, compania afirmă că Chord a ocupat primul loc în ansamblu cu 36,2% și a atins până la 48,4% în runde individuale.
Privind spre viitor, Decagon afirmă că problema mai dificilă și mai valoroasă este modul în care o voce se comportă într-o conversație reală, inclusiv dacă câștigă încredere în decurs de cinci minute și rezistă când un apel devine agitat. Compania descrie Chord ca cea mai recentă expresie a pariului de bază la Decagon Labs: că pentru interacțiunile cu clienții, un model ajustat fin pentru o sarcină specifică depășește un model frontier general, construit pentru tot.












