AI-modeller og plattformer

Decagon introduserer Voice 3-agent med Chord tale-modell

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Decagon introduserte Voice 3, sin stemme‑AI‑agent for kundesamtaler, og Chord, den første tale‑modellen fra Decagon Labs, på selskapets Decagon Dialogues 2026‑arrangement 1. oktober 2026, og oppga at agenten støtter mer enn 70 språk og kjører på en ny duplex‑arkitektur.

I Voice 3 kunngjøring, skrevet av produktleder Quique Lores og senior produktmarkedsføringsleder Ariana Xiang, beskrev Decagon Voice 3 som sin mest avanserte stemme‑AI‑agent hittil. Agenten snakker gjennom Chord, og den ble lansert sammen med tre andre produkter på Decagon Dialogues 2026.

I Decagon Dialogues 2026‑innlegg navnga medgründere Jesse Zhang, Decagons administrerende direktør, og Ashwin Sreenivas, selskapets president, de tre andre utgivelsene: Personal Agent Gateway, som identifiserer kundenes personlige AI‑agenter og gir dem en dedikert kanal for å samhandle med en virksomhet; Agent Modules, som utvider en agent over reiser utover support; og Duet Apprentice, som lar selskapets Duet‑system lære en virksomhet fra interne ressurser og eskalerte kundesamtaler.

Bedrifter satte først Decagon-agenter i arbeid med å løse support‑billetter, skrev medgrunnleggerne, og disse agentene kvalifiserer nå potensielle kunder, onboarder kunder, samler inn betalinger og bygger relasjoner. De fire utgivelsene utvider hvordan kunder får tilgang til det Decagon kaller en AI‑concierge og hva den kan gjøre for dem.

Voice 3 og Chord tale-modell

Chord er den første stemmemodellen trent av Decagon Labs, og selskapet sier at den ble ettertrent på samtaler fra virkelige kundeserviceopplevelser i stedet for for det brede spekteret av bruksområder som de fleste stemmemodeller betjener, fra lydbokfortelling til videospill‑voice‑overs. Decagon sier at modellen former tale frase for frase, senker farten for en bekreftelseskode eller telefonnummer og deretter vender tilbake til en samtaletempo, i stedet for å basere seg på én global hastighetsinnstilling. Eksisterende stemmetilpasningskontroller overføres: stemmevalg, uttale av forretningsspesifikke termer og levering tilpasset virksomheten.

Voice 3 støtter mer enn 70 språk uten at teamene må bygge en separat agent for hvert språk, ifølge kunngjøringen. Den oppdager samtalerens språk og bytter automatisk, selv når en samtaler skifter språk midt i en setning, og Decagon sier at de lokalespesifikke stemmene gjenspeiler hvordan folk snakker i hvert marked og er validert av morsmålstalere før de lanseres.

Decagon oppgir at Chord er trent på lisensiert data og samtykkede stemmetalenter, aldri på kundeeid data. Christian Niedworok, leder for digital tjenestekommunikasjon i Deutsche Telekom, sa i kunngjøringen at år med IVR‑systemer har lært kunder å snakke i korte fragmenter bare for å nå en menneskelig operatør, og at Decagons stemme høres ut som om den faktisk lytter og holder samtalen i gang i stedet for å bli stille mens den arbeider. Chime sin administrerende direktør Janelle Sallenave sa at Decagon Voice lar Chime kombinere høy ytelse og sømløs merkevaretilpasning med kanal‑overgripende hukommelse, og holder hver interaksjon koblet og tro mot selskapets medlem‑først‑verdier.

Treningspipeline og basismodell

Et tilhørende innlegg av Samuel Zhang, et medlem av Decagons tekniske stab med fokus på agent‑orkestrering, beskriver hvordan Chord ble bygget. Treningspipelinen er designet for å bevare teksturen av ekte samtaler, inkludert skiftende tempo, naturlig betoning, pauser og fyllord, i stedet for å rense opptak til en jevn, ren lesning som innlegget sier gjør stemmer syntetiske. To metoder støtter denne tilnærmingen: en ordrett transkripsjonsprosess som bevarer tempo, betoning og dysfluens, og en opptaksmetode som kombinerer innholdet i et manus med naturligheten i en fri flytende samtale i stedet for en performativ lesning fra stemmeskuespillere.

For basismodellen ettertrente Decagon en tokeniser‑fri diffusionsmodell. Innlegget argumenterer for at diskretisering av lyd til token kaster bort informasjon ved hvert tokeniseringssteg, mens en token‑fri representasjon holder seg nær tapsfri og bevarer de fine detaljene som skiller en stemme som bare er forståelig fra en som høres tilstedeværende ut. Det gjør også modellen langt mer styrbar, hevder innlegget, og gjør det mulig for Decagon å forme følelser, tempo og betoning med presisjon. I produksjon leveres Chord på Modal.

Duplex‑arkitektur

Decagon sier at de fleste stemmeagenter kjører en kaskadert pipeline der tale‑til‑tekst transkriberer samtaleren, en stor språkmodell bestemmer hvordan den skal svare, og tekst‑til‑tale uttaler svaret, med hvert trinn som legger til forsinkelse og koordineringen mellom trinnene gjør naturlig taletaking vanskelig. Voice 3 erstatter denne ordningen med en duplex‑arkitektur som kjører to lag parallelt: en lav‑latens samtalemodell håndterer lytting og tale, fra svar til fremdriftsoppdateringer, mens en kraftigere modell håndterer resonnering, verktøykalling og håndheving av sikkerhetsregler bak samtalen.

Ifølge selskapet behandler agenten innkommende lyd selv mens den snakker, så den svarer på en samtaler som sier “mhm”, men gir fra seg ved et ekte avbrudd. Den forteller om sin fremdrift under lange oppslag, svarer på oppfølgingsspørsmål mens en oppgave fortsatt kjører, og hjelper med mindre forespørsler i mellomtiden, i stedet for å la samtaleren være i stillhet eller på vent.

Bedriftens rapporterte evalueringsresultater

Zhangs innlegg rapporterer om kunder innen telekom, finansielle tjenester og reise- og hotellbransjen som byttet fra en standardstemme til en stemme på Chord, og sammenlignet de samme programmene før og etter med kun stemmen endret. Løsningsraten økte i alle tilfeller, rapporterer Decagon: opp 6,1 poeng for telekomkunden, 7,1 poeng for leverandøren av finansielle tjenester, og 2,6 poeng for reise­merket. Barge‑rater, som Decagon definerer som andelen samtaler der innringers eneste mål er å nå en menneskelig operatør, falt med 14,5, 6,1 og 5,3 poeng hos de tre kundene.

I en blind lyttetest med tre stemmer hørte lytterne de samme lydprøvene én gang fremført av Chord og én gang av stemmetalenten den er modellert etter, og ble bedt om å velge hvilken som var AI. Decagon rapporterer at 45,7 % av lytterne trodde den ekte menneskelige stemmen var AI, et resultat som selskapet beskriver som så nært en 50‑50-terningkast at de to i praksis var uatskillelige. Voice 3‑kunngjøringen oppsummerer resultatet som omtrent 90 % av brukerne som ikke klarte å skille dem.

Decagon rapporterer også om en preferansetest der Chord ble satt opp mot tre andre talemodeller som selskapet beskriver som ledende, med de samme ordene uttalt av hver, og lytterne ble bedt om å velge stemmen de helst ville snakke med som kunde med et problem. På tvers av 185 lyttere sier selskapet at Chord kom først samlet med 36,2 % og nådde opptil 48,4 % i enkelte runder.

Ser man fremover, sier Decagon at den vanskeligere og mer verdifulle utfordringen er hvordan en stemme oppfører seg i en ekte samtale, inkludert om den oppnår tillit over fem minutter og holder stand når en samtale blir kaotisk. Selskapet beskriver Chord som den nyeste manifestasjonen av hovedhypotesen i Decagon Labs: at for kundesamtaler vil en modell finjustert for en spesifikk oppgave overgå en generell frontmodell som er bygget for alt.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Arbeidet hans utforsker hvordan læring, resonnering, hukommelse og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker forbindelser mellom moderne AI-arkitekturer og langvarige spørsmål innen kognitiv vitenskap og sinnets filosofi.

Med en konseptuell og reflekterende tilnærming undersøker Jonas rammeverk som resonneringsmodeller, agentbaserte systemer, emergent kognisjon og justeringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr – og hva det ikke betyr. I stedet for å jage tidslinjer eller hype, legger han vekt på første prinsipper, konseptuell grundighet og begrensningene i dagens modeller.

Artikler skrevet av Jonas Reeve er AI-genererte og gjennomgås av Unite.AI sitt redaksjonsteam for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.