Modely a platformy AI
Decagon představuje agenta Voice 3 s řečovým modelem Chord

Decagon představil Voice 3, svého hlasového AI agenta pro zákaznické hovory, a Chord, první řečový model od Decagon Labs, na akci společnosti Decagon Dialogues 2026 konané 1. října 2026, přičemž uvedl, že agent podporuje více než 70 jazyků a běží na nové duplexní architektuře.
V oznámení Voice 3, které sepsali produktový manažer Quique Lores a senior produktová marketingová manažerka Ariana Xiang, Decagon popsal Voice 3 jako svého dosud nejpokročilejšího hlasového AI agenta. Agent mluví prostřednictvím modelu Chord a byl uveden současně se třemi dalšími produkty na Decagon Dialogues 2026.
V příspěvku Decagon Dialogues 2026 spoluzakladatelé Jesse Zhang, výkonný ředitel Decagon, a Ashwin Sreenivas, prezident společnosti, představili další tři vydání: Personal Agent Gateway, který identifikuje osobní AI agenty zákazníků a poskytuje jim vyhrazený kanál pro komunikaci s firmou; Agent Modules, které rozšiřují agenta napříč cestami mimo podporu; a Duet Apprentice, který umožňuje systému Duet společnosti učit se o firmě z interních zdrojů a eskalovaných konverzací se zákazníky.
Podniky poprvé nasadily agenty Decagon k řešení podpůrných tiketů, napsali spoluzakladatelé, a tito agenti nyní kvalifikují potenciální zákazníky, přivádějí nové klienty, sbírají platby a rozvíjejí vztahy. Čtyři vydání rozšiřují způsoby, jakými zákazníci dosahují toho, co Decagon nazývá AI concierge, a co jim může nabídnout.
Voice 3 a řečový model Chord
Chord je první hlasový model vycvičený Decagon Labs a společnost uvádí, že byl následně trénován na reálných konverzacích se zákazníky, nikoli pro širokou škálu použití, pro která slouží většina hlasových modelů, od vyprávění audioknih po dabing videoher. Decagon tvrdí, že model formuje řeč fráze po frázi, zpomaluje při potvrzovacím kódu nebo telefonním čísle a poté se vrací k konverzačnímu tempu, místo aby se spoléhal na jediné globální nastavení rychlosti. Stávající ovládací prvky pro přizpůsobení hlasu přetrvávají: výběr hlasu, výslovnost obchodně specifických termínů a doručení laděné na konkrétní podnik.
Voice 3 podporuje více než 70 jazyků, aniž by týmy musely vytvářet samostatného agenta pro každý z nich, podle oznámení. Detekuje jazyk volajícího a automaticky přepíná, i když volající během věty přechází mezi jazyky, a Decagon uvádí, že jeho hlasové varianty specifické pro konkrétní lokalitu odrážejí způsob, jakým lidé v jednotlivých trzích mluví, a jsou před uvedením ověřeny rodilými mluvčími.
Decagon uvádí, že Chord je trénován na licencovaných datech a souhlasném hlasovém talentu, nikdy na datech vlastněných zákazníky. Christian Niedworok, vedoucí digitální komunikace služeb ve společnosti Deutsche Telekom, řekl v oznámení, že roky systémů IVR naučily zákazníky mluvit v krátkých úsecích jen proto, aby se dostali k člověku, a že hlas Decagon zní, jako by skutečně naslouchal a udržuje konverzaci v pohybu místo toho, aby během práce ztichl. Janelle Sallenave, provozní ředitelka společnosti Chime, uvedla, že Decagon Voice umožňuje Chime kombinovat vysoký výkon a plynulé přizpůsobení značky s pamětí napříč kanály, což udržuje každou interakci propojenou a věrnou hodnotám zaměřeným na členy.
Tréninková pipeline a základní model
doprovodný příspěvek od Samuela Zhanga, člena technického týmu Decagon zaměřeného na orchestraci agentů, popisuje, jak byl Chord vytvořen. Jeho tréninková pipeline je navržena tak, aby zachovávala strukturu skutečné konverzace, včetně měnícího se tempa, přirozeného důrazu, pauz a výplňových slov, místo aby nahrávky čistila do rovnoměrného čtení, což podle příspěvku způsobuje, že hlasy znějí synteticky. Dvě metody tento přístup podporují: proces doslovné transkripce, který zachovává tempo, důraz a nesrozumitelnosti, a metoda nahrávání, která kombinuje obsah scénáře s přirozeností volného rozhovoru místo performativního čtení hlasovými herci.
Pro základní model Decagon následně vycvičil difúzní model bez tokenizátoru. Příspěvek tvrdí, že diskrétizace audia na tokeny ztrácí informace v každém kroku tokenizace, zatímco reprezentace bez tokenů zůstává blízká bezztrátovému stavu a zachovává jemné detaily, které odlišují hlas jen srozumitelný od hlasu působivého. Dále podle příspěvku činí model mnohem lépe ovladatelným, což Decagonu umožňuje precizně formovat emoce, tempo a důraz. V produkci je Chord nasazen na platformě Modal.
Duplexní architektura
Decagon uvádí, že většina hlasových agentů používá kaskádovou pipeline, ve které převod řeči na text přepisuje volajícího, velký jazykový model rozhoduje, jak odpovědět, a převod textu na řeč vysloví odpověď, přičemž každá fáze přidává zpoždění a koordinace mezi fázemi ztěžuje přirozené střídání řeči. Voice 3 nahrazuje toto uspořádání duplexní architekturou, která provozuje dva vrstvy paralelně: model s nízkou latencí pro konverzaci zajišťuje naslouchání a mluvení, od odpovědí po aktualizace postupu, zatímco výkonnější model řídí uvažování, volání nástrojů a vynucování bezpečnostních omezení v pozadí konverzace.
Podle společnosti agent zpracovává příchozí audio i během toho, co mluví, takže dokáže mluvit přes volajícího, který říká „mhm“, ale ustoupí při skutečném přerušení. Vypráví o svém postupu během dlouhých vyhledávání, odpovídá na doplňující otázky, zatímco úloha stále běží, a mezi tím pomáhá s menšími požadavky, místo aby volajícího nechal v tichu nebo na čekací lince.
Výsledky hodnocení uváděné společností
Příspěvek od Zhanga uvádí zákazníky v telekomunikacích, finančních službách a cestovním ruchu a pohostinství, kteří přešli z komerčně dostupného hlasu na hlas na platformě Chord, přičemž porovnávali stejné programy před a po změně hlasu. Podle Decagon se míra vyřešení zvýšila ve všech případech: o 6,1 bodu u telekomunikačního zákazníka, o 7,1 bodu u poskytovatele finančních služeb a o 2,6 bodu u cestovní značky. Barge rates, které Decagon definuje jako podíl hovorů, kde je jediným cílem volajícího dosáhnout na člověka, klesly o 14,5, 6,1 a 5,3 bodu u tří zákazníků.
V neoznačeném poslechovém testu se třemi hlasy posluchači slyšeli stejné zvukové ukázky jednou od Chord a jednou od hlasového talentu, na kterém byl model založen, a byli požádáni, aby určili, který je AI. Decagon uvádí, že 45,7 % posluchačů si myslelo, že skutečný lidský hlas je AI, což společnost popisuje jako výsledek dostatečně blízký 50:50 náhodě, že byly prakticky nerozeznatelné. Oznámení Voice 3 shrnuje výsledek jako přibližně 90 % uživatelů, kteří nedokážou rozlišit.
Decagon také uvádí test preference, ve kterém byl Chord postaven proti třem dalším řečovým modelům, které popisuje jako špičkové, přičemž každý pronášel stejná slova a posluchači byli požádáni, aby vybrali hlas, se kterým by jako zákazník s problémem nejraději mluvili. Z celkového počtu 185 posluchačů společnost uvádí, že Chord obsadil první místo celkově s 36,2 % a v jednotlivých kolech dosáhl až 48,4 %.
Do budoucna Decagon uvádí, že obtížnější a hodnotnější problém spočívá v tom, jak se hlas chová v reálné konverzaci, včetně toho, zda během pěti minut získá důvěru a zda obstojí, když se hovor zkomplikuje. Společnost popisuje Chord jako nejnovější projev hlavní sázky v Decagon Labs: že pro zákaznické interakce model jemně doladěný pro konkrétní úkol překonává obecný špičkový model určený pro vše.












