AI-modeller og platforme
Decagon introducerer Voice 3‑agent med Chord‑talesmodel

Decagon introducerede Voice 3, deres stemme‑AI‑agent til kundesamtaler, samt Chord, den første talesmodel fra Decagon Labs, ved virksomhedens Decagon Dialogues 2026‑arrangement den 1. oktober 2026, og sagde, at agenten understøtter mere end 70 sprog og kører på en ny duplex‑arkitektur.
I Voice 3‑meddelelse, forfattet af produktchef Quique Lores og senior produktmarketingchef Ariana Xiang, beskrev Decagon Voice 3 som deres mest avancerede stemme‑AI‑agent indtil nu. Agenten taler gennem Chord, og den blev lanceret sammen med tre andre produkter ved Decagon Dialogues 2026.
I Decagon Dialogues 2026‑indlæg navngav medstifterne Jesse Zhang, Decagons administrerende direktør, og Ashwin Sreenivas, deres præsident, de øvrige tre udgivelser: Personal Agent Gateway, som identificerer kundernes personlige AI‑agenter og giver dem en dedikeret kanal til at interagere med en virksomhed; Agent Modules, som udvider en agent på tværs af rejser ud over support; og Duet Apprentice, som lader virksomhedens Duet‑system lære en forretning fra interne ressourcer og eskalerede kundesamtaler.
Virksomheder satte først Decagon-agenter i arbejde med at løse support‑billetter, skrev medstifterne, og disse agenter kvalificerer nu leads, indfører kunder, indsamler betalinger og opbygger relationer. De fire udgivelser udvider, hvordan kunder får adgang til det, Decagon kalder en AI‑concierge, og hvad den kan gøre for dem.
Voice 3 og Chord‑talesmodel
Chord er den første stemmemodel, der er trænet af Decagon Labs, og virksomheden siger, at den er eftertrænet på virkelige kundesamtaler frem for den brede vifte af anvendelser, som de fleste stemmemodeller dækker, fra lydbogfortælling til videospils‑voice‑overs. Decagon siger, at modellen former tale frase for frase, sænker tempoet for en bekræftelseskode eller et telefonnummer og derefter vender tilbage til et samtaletempo, i stedet for at stole på én global hastighedsindstilling. Eksisterende stemmetilpasningskontroller overføres: stemmevalg, udtale af forretningsspecifikke termer og levering tilpasset virksomheden.
Voice 3 understøtter mere end 70 sprog uden at kræve, at teams bygger en separat agent for hvert sprog, ifølge meddelelsen. Den registrerer opkalderens sprog og skifter automatisk, selv når en opkalder skifter mellem sprog midt i en sætning, og Decagon siger, at deres lokalespecifikke stemmer afspejler, hvordan folk taler i hvert marked, og at de valideres af modersmåls‑talere, inden de udgives.
Decagon oplyser, at Chord er trænet på licenserede data og samtykkede stemmetalenter, aldrig på kundeejede data. Christian Niedworok, leder af Digital Service Communication hos Deutsche Telekom, sagde i meddelelsen, at mange års IVR‑systemer har trænet kunder til at tale i korte fragmenter blot for at nå en menneskelig operatør, og at Decagons stemme lyder, som om den virkelig lytter og holder samtalen i gang i stedet for at blive tavs, mens den arbejder. Chimes driftschef, Janelle Sallenave, sagde, at Decagon Voice gør det muligt for Chime at kombinere høj ydeevne og problemfri brand‑tilpasning med tværkanals‑hukommelse, så hver interaktion forbliver forbundet og tro mod deres medlem‑først‑værdier.
Træningspipeline og grundmodel
Et tilhørende indlæg af Samuel Zhang, et medlem af Decagons tekniske personale med fokus på agent‑orchestrering, beskriver, hvordan Chord blev bygget. Dens træningspipeline er designet til at bevare strukturen i en ægte samtale, herunder skiftende tempo, naturlig betoning, pauser og fyldord, i stedet for at rense optagelser til en ensartet, glat læsning, som ifølge indlægget får stemmer til at lyde kunstige. To metoder understøtter denne tilgang: en ordret transkriptionsproces, der bevarer tempo, betoning og ufuldkommenheder, og en optagelsesmetode, der kombinerer indholdet af et manuskript med naturligheden i en fri samtale i stedet for en performativ læsning fra stemmeskuespillere.
For grundmodellen eftertrænede Decagon en token‑fri diffusionsmodel. Indlægget argumenterer for, at diskretisering af lyd til tokens kasserer information ved hvert tokeniserings‑trin, mens en token‑fri repræsentation forbliver tæt på tabsfri og bevarer de fine detaljer, der adskiller en stemme, som kun er forståelig, fra en stemme, der lyder til stede. Det gør også modellen langt mere styrbar, ifølge indlægget, så Decagon kan forme følelser, tempo og betoning med præcision. I produktion leveres Chord på Modal.
Duplex‑arkitektur
Decagon siger, at de fleste stemmeagenter kører en kaskaderet pipeline, hvor tale‑til‑tekst transskriberer opkalderen, en stor sprogmodel beslutter, hvordan der skal svare, og tekst‑til‑tale udtaler svaret, med hver fase der tilføjer forsinkelse, og koordineringen mellem faserne gør naturlig samtaletagning vanskelig. Voice 3 erstatter denne opsætning med en duplex‑arkitektur, der kører to lag parallelt: en lav‑latens samtalemodel håndterer lytning og tale, fra svar til statusopdateringer, mens en mere kraftfuld model håndterer ræsonnement, værktøjskald og håndhævelse af sikkerhedsrammer bag samtalen.
Ifølge virksomheden behandler agenten indkommende lyd, selv mens den taler, så den taler videre, når en opkalder siger “mhm”, men giver plads ved en ægte afbrydelse. Den fortæller om sin fremdrift under lange opslag, besvarer opfølgende spørgsmål, mens en opgave stadig kører, og hjælper med mindre anmodninger imellem, i stedet for at efterlade opkalderen i stilhed eller på hold.
Virksomhedsrapporterede evalueringsresultater
Zhangs indlæg rapporterer om kunder inden for telekommunikation, finansielle tjenester og rejse‑ og hospitality‑sektoren, som skiftede fra en standardstemme til en stemme på Chord, idet de sammenlignede de samme programmer før og efter med kun stemmen ændret. Løsningsraten steg i alle tilfælde, rapporterer Decagon: op 6,1 point for telekundskabs‑kunden, 7,1 point for den finansielle tjenesteudbyder og 2,6 point for rejsemærket. Barge‑rater, som Decagon definerer som andelen af opkald, hvor den eneste mål for opkalderen er at nå et menneske, faldt med 14,5, 6,1 og 5,3 point på tværs af de tre kunder.
I en blind lytte‑test med tre stemmer hørte lytterne de samme lydprøver, der blev udtalt én gang af Chord og én gang af den stemmetalent, den er baseret på, og de blev bedt om at vælge, hvilken der var AI. Decagon rapporterer, at 45,7 % af lytterne troede, at den rigtige menneskelige stemme var AI, et resultat som virksomheden beskriver som tæt på et 50‑50‑kast, så de to i praksis var uadskillelige. Voice 3‑meddelelsen opsummerer resultatet som cirka 90 % af brugerne ikke kan skelne.
Decagon rapporterer også om en præferencetest, hvor Chord blev sat ansigt til ansigt mod tre andre tale‑modeller, som virksomheden beskriver som førende, med de samme ord udtalt af hver, og lytterne blev bedt om at vælge den stemme, de mest ville tale med som kunde med et problem. På tværs af 185 lyttere siger virksomheden, at Chord kom på førstepladsen samlet med 36,2 % og nåede op på så meget som 48,4 % i enkelte runder.
Ser man fremad, siger Decagon, at den sværere og mere værdifulde udfordring er, hvordan en stemme opfører sig i en ægte samtale, herunder om den opnår tillid over fem minutter og holder stand, når et opkald bliver rodet. Virksomheden beskriver Chord som den seneste udgave af den grundlæggende satsning i Decagon Labs: at for kundesamtaler vil en model, der er finjusteret til en specifik opgave, overgå en generel frontmodel, der er bygget til alt.












