AI-modeller och plattformar

Decagon presenterar Voice 3‑agent med Chord‑talmodell

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Decagon introducerade Voice 3, sin röst‑AI‑agent för kundsamtal, och Chord, den första talmodellen från Decagon Labs, på företagets Decagon Dialogues 2026‑evenemang den 1 oktober 2026, och sade att agenten stödjer fler än 70 språk och körs på en ny duplex‑arkitektur.

I Voice 3‑annonsering, författad av produktchef Quique Lores och senior produktmarknadschef Ariana Xiang, beskrev Decagon Voice 3 som sin mest avancerade röst‑AI‑agent hittills. Agenten talar genom Chord, och den lanserades tillsammans med tre andra produkter på Decagon Dialogues 2026.

I Decagon Dialogues 2026‑inlägg namngav medgrundarna Jesse Zhang, Decagons verkställande direktör, och Ashwin Sreenivas, dess president, de andra tre lanseringarna: Personal Agent Gateway, som identifierar kundernas personliga AI‑agenter och ger dem en dedikerad kanal för att interagera med ett företag; Agent Modules, som utökar en agent över resor bortom support; och Duet Apprentice, som låter företagets Duet‑system lära sig ett företag från interna resurser och eskalerade kundsamtal.

Företag började först använda Decagon-agenter för att lösa supportärenden, skrev medgrundarna, och dessa agenter kvalificerar nu leads, introducerar kunder, samlar in betalningar och utvecklar relationer. De fyra lanseringarna utökar hur kunder når det Decagon kallar en AI concierge och vad den kan göra för dem.

Voice 3 och Chord‑talmodellen

Chord är den första röstmodellen som tränats av Decagon Labs, och företaget säger att den eftertränades på verkliga kundupplevelse‑samtal snarare än för det breda spektrum av användningsområden som de flesta röstmodeller betjänar, från ljudboks‑berättande till videospels‑röstöversättningar. Decagon säger att modellen formar tal fras för fras, saktar ner för en bekräftelsekod eller telefonnummer och återgår sedan till ett konverserande tempo, i stället för att förlita sig på en global hastighetsinställning. Existerande röstanpassningskontroller överförs: röstval, uttal av affärsspecifika termer och leverans som är finjusterad för verksamheten.

Voice 3 stödjer fler än 70 språk utan att teamen behöver bygga en separat agent för varje språk, enligt tillkännagivandet. Den upptäcker samtalarens språk och växlar automatiskt, även när en samtalare byter språk mitt i en mening, och Decagon säger att dess lokalspecifika röster speglar hur människor talar i varje marknad och valideras av modersmålstalare innan de släpps.

Decagon uppger att Chord tränas på licensierad data och samtyckt rösttalang, aldrig på kundägd data. Christian Niedworok, ledare för Digital Service Communication på Deutsche Telekom, sade i tillkännagivandet att år av IVR‑system har tränat kunder att tala i korta fragment bara för att nå en människa, och att Decagons röst låter som om den faktiskt lyssnar och håller samtalet i rörelse istället för att bli tyst medan den arbetar. Chime Chief Operating Officer Janelle Sallenave sade att Decagon Voice låter Chime kombinera hög prestanda och sömlös varumärkesanpassning med kanalöverskridande minne, vilket håller varje interaktion kopplad och sann mot deras medlem‑först‑värderingar.

Träningspipeline och basmodell

Ett kompanjonsinlägg av Samuel Zhang, en medlem av Decagons tekniska personal med fokus på agent‑orkestrering, beskriver hur Chord byggdes. Dess träningspipeline är utformad för att bevara strukturen i verkliga konversationer, inklusive skiftande tempo, naturlig betoning, pauser och utfyllnadsord, snarare än att rensa inspelningar till en ren, jämn uppläsning, vilket inlägget säger får röster att låta syntetiska. Två metoder stödjer detta tillvägagångssätt: en ordagrann transkriptionsprocess som bevarar tempo, betoning och disfluens, och en inspelningsmetod som kombinerar innehållet i ett manus med naturligheten i fritt flytande konversation snarare än en performativ uppläsning från röstskådespelare.

För basmodellen eftertränade Decagon en tokeniseringsfri diffusionsmodell. Inlägget hävdar att diskretisering av ljud till token släpper information vid varje tokeniseringssteg, medan en token‑fri representation förblir nära förlustfri och bevarar den fina detaljen som skiljer en röst som bara är begriplig från en som låter närvarande. Det gör också modellen mycket mer styrbar, enligt inlägget, vilket möjliggör för Decagon att forma känsla, tempo och betoning med precision. I produktion levereras Chord via Modal.

Duplex‑arkitektur

Decagon säger att de flesta röstagenter använder en kaskaderad pipeline där tal‑till‑text transkriberar samtalaren, en stor språkmodell bestämmer hur den ska svara, och text‑till‑tal levererar svaret, med varje steg som tillför fördröjning och samordningen mellan stegen gör naturlig tur‑tagningsförmåga svår. Voice 3 ersätter den strukturen med en duplex‑arkitektur som kör två lager parallellt: en låg‑latens konversationsmodell hanterar lyssning och tal, från svar till framstegsuppdateringar, medan en kraftfullare modell sköter resonemang, verktygsanrop och skyddsåtgärder bakom konversationen.

Enligt företaget bearbetar agenten inkommande ljud även medan den talar, så den fortsätter prata när en samtalare säger “mhm” men ger vika vid ett verkligt avbrott. Den berättar om sin framdrift under långa uppslag, svarar på följdfrågor medan en uppgift fortfarande körs, och hjälper till med mindre förfrågningar däremellan, snarare än att lämna samtalaren i tystnad eller i vänteläge.

Företagsrapporterade utvärderingsresultat

Zhangs inlägg rapporterar om kunder inom telekom, finansiella tjänster samt rese- och hotellbranschen som bytte från en standardröst till en röst på Chord, och jämförde samma program före och efter med endast rösten ändrad. Upplösningsgraden ökade i alla fall, rapporterar Decagon: upp 6,1 poäng för telekomkunden, 7,1 poäng för den finansiella tjänsteleverantören och 2,6 poäng för resevarumärket. Barge‑grader, som Decagon definierar som andelen samtal där samtalstagarens enda mål är att nå en människa, minskade med 14,5, 6,1 och 5,3 poäng för de tre kunderna.

I ett blindtest med tre röster hörde lyssnarna samma ljudprover en gång av Chord och en gång av den rösttalang som den modellerades på, och fick välja vilken som var AI. Decagon rapporterar att 45,7 % av lyssnarna trodde att den riktiga mänskliga rösten var AI, ett resultat som företaget beskriver som tillräckligt nära en 50‑50‑slump för att de två i praktiken var omöjliga att skilja åt. Voice 3‑meddelandet sammanfattar resultatet som att ungefär 90 % av användarna inte kan avgöra.

Decagon rapporterar också ett preferenstest där Chord ställdes mot tre andra talmodeller som de beskriver som ledande, med samma ord uttalade av varje modell och lyssnarna ombads välja den röst de helst skulle vilja prata med som kund med ett problem. Bland 185 lyssnare säger företaget att Chord kom först totalt med 36,2 % och nådde så högt som 48,4 % i enskilda omgångar.

Framåt ser Decagon det svårare och mer värdefulla problemet som hur en röst beter sig i en verklig konversation, inklusive om den bygger förtroende över fem minuter och håller stånd när ett samtal blir rörigt. Företaget beskriver Chord som det senaste uttrycket för kärnanklaget på Decagon Labs: att för kundinteraktioner överträffar en modell som finjusterats för en specifik uppgift en generell frontmodell som byggts för allt.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.