AI-mallit ja alustat

Decagon esittelee Voice 3 -agentin Chord-puhemallilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Decagon esitteli Voice 3 -ääniai-agenttinsa asiakaspuheluihin sekä Chord -ensimmäisen puhemallin Decagon Labsilta Decagon Dialogues 2026 -tapahtumassa 1. lokakuuta 2026, ja kertoi, että agentti tukee yli 70 kieltä ja toimii uudessa duplex-arkkitehtuurissa.

Voice 3 -julistuksessa, jonka ovat kirjoittaneet tuotepäällikkö Quique Lores ja vanhempi tuotemarkkinointipäällikkö Ariana Xiang, Decagon kuvasi Voice 3:ta tähän mennessä kehittyneimmäksi ääniai-agentikseen. Agentti puhuu Chordin kautta, ja se lanseerattiin yhdessä kolmen muun tuotteen kanssa Decagon Dialogues 2026 -tapahtumassa.

Decagon Dialogues 2026 -julkaisussa perustajat Jesse Zhang, Decagonin toimitusjohtaja, ja Ashwin Sreenivas, sen presidentti, nimittivät muut kolme julkaisua: Personal Agent Gateway, joka tunnistaa asiakkaiden henkilökohtaiset AI-agentit ja tarjoaa niille omistetun kanavan yrityksen kanssa vuorovaikutukseen; Agent Modules, joka laajentaa agenttia matkoilla tukitoimintojen ulkopuolelle; ja Duet Apprentice, joka antaa yrityksen Duet-järjestelmän oppia liiketoimintaa sisäisistä resursseista ja eskaloiduista asiakaskeskusteluista.

Yritykset alkoivat aluksi käyttää Decagon-agentteja tukipyyntöjen ratkaisemiseen, kirjoittivat perustajat, ja nämä agentit nyt kvalifioivat liidejä, ottavat asiakkaat käyttöön, keräävät maksut ja kasvattavat suhteita. Neljä julkaisua laajentavat tapaa, jolla asiakkaat pääsevät Decagonin kutsuman AI‑conciergen puoleen ja mitä se voi heille tehdä.

Voice 3 ja Chord-puhemalli

Chord on Decagon Labsin ensimmäinen koulutettu äänimalli, ja yritys kertoo, että se on jälkikoulutettu todellisista asiakaskokouskeskusteluista sen sijaan, että se palvelee laajaa käyttöalueita, joita useimmat äänimallit kattavat, kuten äänikirjojen kerronta tai videopelien ääninäyttelijät. Decagon sanoo, että malli muokkaa puhetta lause kerrallaan, hidastaen vahvistuskoodin tai puhelinnumeron kohdalla ja palaten sitten keskustelutahdin, sen sijaan että luottaisi yhteen globaaliin nopeusasetukseen. Olemassa olevat äänien räätälöintikontrollit siirtyvät mukana: äänen valinta, liiketoimintaan liittyvien termien ääntäminen ja toimitus, joka on sovitettu yritykseen.

Voice 3 tukee yli 70 kieltä ilman, että tiimien täytyy rakentaa erillinen agentti jokaiselle, ilmoituksen mukaan. Se havaitsee soittajan kielen ja vaihtaa automaattisesti, vaikka soittaja vaihtaisi kieltä lauseen keskellä, ja Decagon kertoo, että sen paikallisille markkinoille räätälöidyt äänet heijastavat kunkin markkinan puhetyyliä ja ne tarkistetaan äidinkielenään puhuvien toimesta ennen julkaisua.

Decagon toteaa, että Chord on koulutettu lisensoidulla aineistolla ja suostumuksella varustetulla ääninäyttelijäresurssilla, eikä koskaan asiakasomaisella datalla. Christian Niedworok, Digital Service Communication -johtaja Deutsche Telekomilla, sanoi ilmoituksessa, että vuosien IVR-järjestelmät ovat opettaneet asiakkaita puhumaan lyhyinä fragmentteina vain päästäkseen ihmisen puheelle, ja että Decagonin ääni kuulostaa siltä kuin se todella kuuntelisi ja pitää keskustelun liikkeessä sen sijaan, että se hiljenisi työskennellessään. Chimen operatiivinen johtaja Janelle Sallenave totesi, että Decagon Voice antaa Chimelle mahdollisuuden yhdistää korkean suorituskyvyn ja saumattoman brändin räätälöinnin kanavien välisen muistin kanssa, pitäen jokaisen vuorovaikutuksen yhteydessä ja uskollisena jäsenkeskeisille arvoille.

Koulutusputki ja perusmalli

seurava julkaisu, jonka on kirjoittanut Samuel Zhang, Decagonin teknisen henkilökunnan jäsen, joka keskittyy agenttien orkestrointiin, kuvaa, miten Chord rakennettiin. Sen koulutusputki on suunniteltu säilyttämään todellisen keskustelun tekstuurin, mukaan lukien tahdin vaihtelu, luonnollinen painotus, tauot ja täytesanat, sen sijaan että äänitteet puhdistettaisiin tasaiseksi luetuksi, mikä postauksen mukaan saa äänet kuulostamaan synteettisiltä. Kaksi menetelmää tukevat tätä lähestymistapaa: tarkka transkriptioprosessi, joka säilyttää tahdin, painotuksen ja epätäydellisyykset, sekä äänitystapa, joka yhdistää käsikirjoituksen sisällön vapaan keskustelun luonnollisuuteen sen sijaan, että se olisi näyttävä luettu ääniartistien toimesta.

Perusmallille Decagon jälkikoulutti tokenisoimattoman diffuusiomallin. Postaus väittää, että äänen jakaminen tokeneiksi poistaa tietoa jokaisessa tokenisointivaiheessa, kun taas tokenisoimaton esitys pysyy lähellä häviötöntä ja säilyttää hienovaraiset yksityiskohdat, jotka erottavat pelkästään ymmärrettävän äänen sellaisesta, joka kuulostaa läsnäolevalta. Se tekee myös mallista paljon ohjattavamman, postauksen mukaan, mahdollistaen Decagonin muokata tunteita, tahtia ja painotuksia tarkasti. Tuotannossa Chordia tarjotaan Modal-alustalla.

Duplex-arkkitehtuuri

Decagon kertoo, että useimmat ääniajanet toimivat ketjuttamalla putken, jossa puhetekstiksi-muunnos (speech-to-text) litteroi soittajan, suuri kielimalli päättää, miten vastata, ja tekstistä-puheeksi (text-to-speech) puhuu vastauksen, ja jokainen vaihe lisää viivettä sekä vaiheiden välinen koordinointi vaikeuttaa luonnollista vuoronottoa. Voice 3 korvaa tämän järjestelyn duplex-arkkitehtuurilla, jossa kaksi kerrosta toimivat rinnakkain: matalan viiveen keskustelumalli käsittelee kuuntelua ja puhumista, vastauksista edistymispäivityksiin, kun taas tehokkaampi malli hallitsee päättelyä, työkalukutsuja ja suojarakenteiden valvontaa keskustelun taustalla.

Yrityksen mukaan agentti käsittelee saapuvaa ääntä samalla kun se puhuu, joten se jatkaa puhumista, vaikka soittaja sanoisi “mhm”, mutta antaa periksi todelliselle keskeytykselle. Se kertoo edistymisestään pitkien hakujen aikana, vastaa jatkokysymyksiin tehtävän ollessa vielä käynnissä, ja avustaa pienemmissä pyynnöissä sen väliin, sen sijaan että jättäisi soittajan hiljaisuuteen tai odotuslinjalle.

Yrityksen raportoimat arviointitulokset

Zhangin julkaisu raportoi telekommunikaatio-, rahoituspalvelu- ja matkailu- ja majoitusasiakkaista, jotka siirtyivät valmiista äänestä Chord-äänelle, vertaillen samoja ohjelmia ennen ja jälkeen, jolloin ainoa muutos oli ääni. Ratkaisuprosentti nousi kaikissa tapauksissa, Decagon raportoi: telekommunikaatioasiakkaalla +6.1 pistettä, rahoituspalveluntarjoajalla +7.1 pistettä ja matkailubrändillä +2.6 pistettä. Barge-prosentit, jotka Decagon määrittelee puheluiden osuudeksi, joissa soittajan ainoa tavoite on päästä ihmiseen, laskivat 14.5, 6.1 ja 5.3 pistettä kolmen asiakkaan välillä.

Sokeassa kuuntelutestissä, jossa vertailtiin kolmea ääntä, kuuntelijat kuulivat samat ääninäytteet kerran Chordin ja kerran sen mallintaman äänenäytteen puhuvan henkilön toimesta, ja heitä pyydettiin valitsemaan, kumpi oli tekoäly. Decagon raportoi, että 45.7 % kuuntelijoista uskoi, että todellinen ihmisen ääni oli tekoäly, tulosta yritys kuvaa riittävän lähellä 50‑50‑kolikkoheittoa, että ne olivat käytännössä erottamattomia. Voice 3 -julkaisu tiivistää tuloksen siten, että noin 90 % käyttäjistä ei pysty erottamaan.

Decagon raportoi myös mieltymyskokeesta, jossa Chord asetettiin suoraan vertailuun kolmen muun johtavana pidetyn puhemallin kanssa; jokainen puhui samat sanat ja kuuntelijoita pyydettiin valitsemaan ääni, jonka kanssa he haluaisivat mieluiten puhua ongelman kanssa asiakkaana. 185 kuuntelijan kesken yritys kertoo, että Chord sijoittui ensimmäiseksi kokonaisuudessaan 36.2 %:lla ja saavutti jopa 48.4 %:n osuuden yksittäisissä kierroksissa.

Tulevaisuutta ajatellen Decagon toteaa, että vaikeampi ja arvokkaampi haaste on se, miten ääni käyttäytyy todellisessa keskustelussa, mukaan lukien se, ansaitseeko se luottamuksen viiden minuutin aikana ja kestääkö se, kun puhelu käy sekavaksi. Yritys kuvaa Chordia Decagon Labsin keskeisen panostuksen viimeisimpänä ilmaisuna: että asiakasvuorovaikutuksessa tarkkaan tiettyyn tehtävään hienosäädetty malli ylittää yleiskäyttöisen frontier-mallin, joka on rakennettu kaikkeen.

Jonas Reeve on AI‑luotu analyytikko Unite.AI:ssa, keskittyen kognitiiviseen tekoälyyn, yleiseen tekoälyyn (AGI) ja koneälyn teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio syntyvät sekä biologisissa että keinotekoisissa järjestelmissä, ja luo yhteyksiä nykyaikaisten tekoälyarkkitehtuurien ja kognitiivisen tieteen sekä mielenfilosofian pitkään kestäneisiin kysymyksiin.

Käsitteellisellä ja pohdiskelevalla lähestymistavalla Jonas tarkastelee kehyksiä, kuten päättelymalleja, agenttijärjestelmiä, emergenttiä kognitiota ja sovitus-teoriaa, pyrkien selventämään, mitä edistyminen kohti AGI:ta todella merkitsee – ja mitä se ei merkitse. Sen sijaan, että hän jahdataisiin aikatauluja tai hypeä, hän korostaa perusperiaatteita, käsitteellistä tarkkuutta ja nykyisten mallien rajoja.

Jonas Reeven kirjoittamat artikkelit ovat AI‑luotuja ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen tarkkuuden, selkeyden ja vastuullisen keskustelun kehittyneistä tekoälykäsitteistä.