AI-modellen en platforms
Decagon introduceert Voice 3-agent met Chord-spraakmodel

Decagon introduceerde Voice 3, zijn spraak‑AI‑agent voor klantgesprekken, en Chord, het eerste spraakmodel van Decagon Labs, tijdens het Decagon Dialogues 2026‑evenement van het bedrijf op 1 oktober 2026, en stelde dat de agent meer dan 70 talen ondersteunt en draait op een nieuwe duplex‑architectuur.
In de Voice 3‑aankondiging, geschreven door productmanager Quique Lores en senior productmarketingmanager Ariana Xiang, beschreef Decagon Voice 3 als zijn meest geavanceerde spraak‑AI‑agent tot nu toe. De agent spreekt via Chord en werd gelanceerd naast drie andere producten tijdens Decagon Dialogues 2026.
In het Decagon Dialogues 2026‑bericht noemden medeoprichters Jesse Zhang, de chief executive van Decagon, en Ashwin Sreenivas, de president, de andere drie releases: Personal Agent Gateway, dat de persoonlijke AI‑agenten van klanten identificeert en hen een toegewijd kanaal geeft om met een bedrijf te communiceren; Agent Modules, die een agent uitbreiden over trajecten buiten de ondersteuning; en Duet Apprentice, waarmee het Duet‑systeem van het bedrijf een bedrijf kan leren kennen aan de hand van interne bronnen en geëscaleerde klantgesprekken.
Bedrijven zetten eerst Decagon-agenten in om supporttickets op te lossen, schreven de medeoprichters, en die agenten kwalificeren nu leads, nemen klanten aan, innen betalingen en bouwen relaties op. De vier releases breiden uit hoe klanten toegang krijgen tot wat Decagon een AI‑concierge noemt en wat die voor hen kan doen.
Voice 3 en het Chord-spraakmodel
Chord is het eerste stemmodel dat door Decagon Labs is getraind, en het bedrijf zegt dat het natraining heeft ondergaan op gesprekken uit de echte klantbeleving in plaats van voor het brede scala aan toepassingen waarvoor de meeste stemmodellen worden gebruikt, van het voorlezen van audioboeken tot videogame‑stemopnames. Decagon stelt dat het model spraak frase voor frase vormgeeft, vertraagt voor een bevestigingscode of telefoonnummer en vervolgens terugkeert naar een gesprekstempo, in plaats van te vertrouwen op één globale snelheidsinstelling. Bestaande stem‑aanpassingsinstellingen blijven behouden: stemselectie, uitspraak van bedrijfsspecifieke termen en levering afgestemd op het bedrijf.
Voice 3 ondersteunt meer dan 70 talen zonder dat teams een aparte agent voor elke taal hoeven te bouwen, volgens de aankondiging. Het detecteert de taal van de beller en schakelt automatisch over, zelfs wanneer een beller halverwege een zin van taal wisselt, en Decagon meldt dat de op locatie afgestemde stemmen weerspiegelen hoe mensen in elke markt spreken en dat ze door moedertaalsprekers worden gevalideerd voordat ze worden uitgebracht.
Decagon stelt dat Chord is getraind op gelicentieerde data en toestemming van stemacteurs, nooit op door de klant eigendom zijnde data. Christian Niedworok, lead van Digital Service Communication bij Deutsche Telekom, zei in de aankondiging dat jarenlange IVR‑systemen klanten hebben getraind om in korte fragmenten te spreken alleen om een mens te bereiken, en dat de stem van Decagon klinkt alsof hij echt luistert en het gesprek voortzet in plaats van stil te vallen terwijl hij werkt. Chime‑chief operating officer Janelle Sallenave verklaarde dat Decagon Voice Chime in staat stelt om hoge prestaties en naadloze merk‑aanpassing te combineren met cross‑channel‑geheugen, waardoor elke interactie verbonden blijft en trouw is aan de member‑first‑waarden van het bedrijf.
Trainings‑pipeline en basismodel
Een aanvullend bericht van Samuel Zhang, een lid van Decagon’s technische staf gericht op agent‑orchestratie, beschrijft hoe Chord is gebouwd. De trainings‑pipeline is ontworpen om de textuur van echte gesprekken te behouden, inclusief wisselend tempo, natuurlijke nadruk, pauzes en opvulwoorden, in plaats van opnames te zuiveren tot een glad, gelijkmatig voorlezen, wat volgens het bericht stemmen synthetisch laat klinken. Twee methoden ondersteunen die aanpak: een letter‑voor‑letter transcriptieproces dat tempo, nadruk en disfluënties behoudt, en een opnamemethode die de inhoud van een script combineert met de natuurlijkheid van een vrijlopend gesprek in plaats van een uitvoerende voorlezing door stemacteurs.
Voor het basismodel heeft Decagon een tokenizer‑vrij diffusie‑model natraining ondergaan. Het bericht betoogt dat het discretiseren van audio in tokens bij elke tokenisatie‑stap informatie verliest, terwijl een token‑vrije representatie dicht bij verliesloos blijft en de fijne details behoudt die een stem die slechts verstaanbaar is scheidt van een stem die echt aanwezig klinkt. Het maakt het model bovendien veel beter bestuurbaar, aldus het bericht, waardoor Decagon emotie, tempo en nadruk nauwkeurig kan vormgeven. In productie wordt Chord aangeboden via Modal.
Duplex‑architectuur
Decagon meldt dat de meeste stem‑agenten een cascaderende pipeline gebruiken waarbij spraak‑naar‑tekst de beller transcribeert, een groot taalmodel beslist hoe te reageren, en tekst‑naar‑spraak het antwoord uitspreekt, waarbij elke fase vertraging toevoegt en de coördinatie tussen fasen natuurlijk beurtnemen bemoeilijkt. Voice 3 vervangt die opzet door een duplex‑architectuur die twee lagen parallel draait: een laag‑latentie‑conversatiemodel behandelt luisteren en spreken, van antwoorden tot voortgangsupdates, terwijl een krachtiger model redeneren, tool‑aanroepen en handhaving van veiligheidsregels achter het gesprek beheert.
Volgens het bedrijf verwerkt de agent binnenkomende audio zelfs terwijl hij spreekt, zodat hij doorpraat wanneer een beller “mhm” zegt, maar stopt bij een echte onderbreking. Hij vertelt zijn voortgang tijdens lange opzoekacties, beantwoordt vervolgvragen terwijl een taak nog loopt, en helpt tussendoor met kleinere verzoeken, in plaats van de beller in stilte of in de wacht te laten.
Door het Bedrijf Gerapporteerde Evaluatieresultaten
In de post van Zhang wordt gerapporteerd over klanten in telecom, financiële dienstverlening en reizen en horeca die zijn overgestapt van een kant-en-klare stem naar een stem op Chord, waarbij dezelfde programma’s vóór en na de wijziging werden vergeleken met alleen de stem veranderd. Het oplossingspercentage steeg in elk geval, meldt Decagon: +6,1 punten voor de telecomklant, +7,1 punten voor de financiële dienstverlener en +2,6 punten voor het reismerk. Barge‑percentages, die Decagon definieert als het aandeel gesprekken waarbij het enige doel van de beller is een mens te bereiken, daalden met respectievelijk 14,5, 6,1 en 5,3 punten bij de drie klanten.
In een blinde luistertest met drie stemmen hoorden luisteraars dezelfde audiosamples één keer uitgesproken door Chord en één keer door het stemtalent waarop het model is gebaseerd, en werden ze gevraagd te bepalen welke de AI was. Decagon meldt dat 45,7 % van de luisteraars geloofde dat de echte menselijke stem de AI was, een resultaat dat het bedrijf beschrijft als dicht genoeg bij een 50‑50 kans dat de twee praktisch niet van elkaar te onderscheiden waren. De aankondiging van Voice 3 vat het resultaat samen als ongeveer 90 % van de gebruikers die het niet konden onderscheiden.
Decagon meldt ook een voorkeurstest waarin Chord tegenover drie andere spraakmodellen, die het bedrijf als toonaangevend beschrijft, werd geplaatst, waarbij dezelfde woorden door elk model werden uitgesproken en luisteraars werden gevraagd de stem te kiezen waarmee ze het liefst zouden praten als klant met een probleem. Over 185 luisteraars zegt het bedrijf dat Chord gemiddeld op de eerste plaats eindigde met 36,2 % en in individuele rondes tot 48,4 % bereikte.
Vooruitkijkend zegt Decagon dat het moeilijkere en waardevollere vraagstuk is hoe een stem zich gedraagt binnen een echt gesprek, inclusief of deze binnen vijf minuten vertrouwen wint en standhoudt wanneer een gesprek rommelig wordt. Het bedrijf beschrijft Chord als de nieuwste uitdrukking van de kernzetting bij Decagon Labs: dat voor klantinteracties een model dat is afgestemd op een specifieke taak beter presteert dan een algemeen frontmodel dat voor alles is gebouwd.












