Modele i platformy AI

Decagon wprowadza agenta Voice 3 z modelem mowy Chord

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Decagon przedstawił Voice 3, swojego agenta AI głosowego do rozmów z klientami, oraz Chord, pierwszy model mowy opracowany przez Decagon Labs, podczas wydarzenia Decagon Dialogues 2026, które odbyło się 1 października 2026 roku, podkreślając, że agent obsługuje ponad 70 języków i działa w oparciu o nową architekturę duplex.

W ogłoszeniu Voice 3, autorstwa menedżera produktu Quique Loresa i starszego menedżera ds. marketingu produktu Ariana Xiang, Decagon opisał Voice 3 jako najnowocześniejszego dotąd agenta AI głosowego. Agent wypowiada się przy pomocy Chord i został uruchomiony razem z trzema innymi produktami podczas Decagon Dialogues 2026.

W poście Decagon Dialogues 2026, współzałożyciele Jesse Zhang, dyrektor generalny Decagon, oraz Ashwin Sreenivas, prezes firmy, wymienili pozostałe trzy wydania: Personal Agent Gateway, które identyfikuje osobiste agenty AI klientów i zapewnia im dedykowany kanał do interakcji z firmą; Agent Modules, które rozszerzają agenta na ścieżki poza wsparciem; oraz Duet Apprentice, które pozwala systemowi Duet firmy uczyć się biznesu z zasobów wewnętrznych i eskalowanych rozmów z klientami.

Przedsiębiorstwa po raz pierwszy wykorzystały agenty Decagon do rozwiązywania zgłoszeń wsparcia, napisali współzałożyciele, a te agenty teraz kwalifikują leady, wprowadzają klientów, pobierają płatności i rozwijają relacje. Cztery wydania rozszerzają możliwości, w jaki sposób klienci docierają do tego, co Decagon określa jako AI concierge, oraz co może dla nich zrobić.

Voice 3 i model mowy Chord

Chord jest pierwszym modelem głosowym wytrenowanym przez Decagon Labs, a firma twierdzi, że został dodatkowo wytrenowany na rzeczywistych rozmowach z klientami, a nie pod kątem szerokiego zakresu zastosowań, które obsługują większość modeli głosowych, od narracji audiobooków po dubbing w grach wideo. Decagon podaje, że model kształtuje mowę fraza po frazie, zwalniając przy kodzie potwierdzającym lub numerze telefonu, a następnie powraca do tempa konwersacji, zamiast polegać na jednej globalnej ustawieniu prędkości. Istniejące kontrolki personalizacji głosu pozostają dostępne: wybór głosu, wymowa terminów specyficznych dla firmy oraz dostawa dostosowana do przedsiębiorstwa.

Voice 3 obsługuje ponad 70 języków bez konieczności tworzenia oddzielnego agenta dla każdego z nich, jak podano w ogłoszeniu. Wykrywa język rozmówcy i przełącza się automatycznie, nawet gdy rozmówca zmienia język w trakcie zdania, a Decagon twierdzi, że jego głosy specyficzne dla poszczególnych regionów odzwierciedlają sposób mówienia w każdym rynku i są weryfikowane przez native speakerów przed udostępnieniem.

Decagon podaje, że Chord jest trenowany na licencjonowanych danych i zgodnych talentach głosowych, nigdy na danych należących do klientów. Christian Niedworok, lider ds. komunikacji usług cyfrowych w Deutsche Telekom, powiedział w ogłoszeniu, że lata systemów IVR nauczyły klientów mówić w krótkich fragmentach, aby dotrzeć do człowieka, oraz że głos Decagon brzmi tak, jakby naprawdę słuchał i utrzymuje rozmowę w toku, zamiast milczeć podczas przetwarzania. Dyrektor operacyjny Chime, Janelle Sallenave, stwierdziła, że Decagon Voice pozwala Chime połączyć wysoką wydajność i płynną personalizację marki z pamięcią wielokanałową, utrzymując każdą interakcję połączoną i zgodną z wartościami stawiającymi członka na pierwszym miejscu.

Potok szkoleniowy i model bazowy

A post towarzyszący autorstwa Samuela Zhanga, członka zespołu technicznego Decagon skoncentrowanego na orkiestracji agentów, opisuje, jak zbudowano Chord. Jego potok szkoleniowy został zaprojektowany tak, aby zachować fakturę prawdziwej rozmowy, w tym zmieniające się tempo, naturalne akcentowanie, pauzy i wypełniacze, zamiast przetwarzać nagrania w czyste, równomierne odczyty, co, jak podaje post, sprawia, że głosy brzmią syntetycznie. Dwa sposoby wspierają to podejście: proces transkrypcji dosłownej, który zachowuje tempo, akcentowanie i niepłynności, oraz metoda nagrywania łącząca treść scenariusza z naturalnością swobodnej konwersacji, zamiast performatywnego odczytu przez aktorów głosowych.

W przypadku modelu bazowego Decagon dodatkowo wytrenował model dyfuzyjny bez tokenizera. Post twierdzi, że dyskretyzacja dźwięku na tokeny powoduje utratę informacji na każdym etapie tokenizacji, podczas gdy reprezentacja bez tokenów pozostaje bliska bezstratności i zachowuje drobne szczegóły, które odróżniają jedynie zrozumiały głos od tego, który brzmi pełniej. Dodatkowo, jak podaje post, sprawia to, że model jest znacznie bardziej sterowalny, umożliwiając Decagon precyzyjne kształtowanie emocji, tempa i akcentowania. W środowisku produkcyjnym Chord jest udostępniany na platformie Modal.

Architektura duplex

Decagon twierdzi, że większość agentów głosowych działa w oparciu o kaskadowy potok, w którym technologia speech-to-text transkrybuje rozmówcę, duży model językowy decyduje o odpowiedzi, a technologia text-to-speech odtwarza odpowiedź, przy czym każdy etap wprowadza opóźnienie, a koordynacja między etapami utrudnia naturalne przechodzenie głosu. Voice 3 zastępuje to rozwiązanie architekturą duplex, w której dwa warstwy działają równolegle: model konwersacyjny o niskim opóźnieniu obsługuje słuchanie i mówienie, od odpowiedzi po aktualizacje postępu, podczas gdy bardziej zaawansowany model zarządza rozumowaniem, wywoływaniem narzędzi i egzekwowaniem zabezpieczeń w tle rozmowy.

Według firmy, agent przetwarza przychodzące audio nawet podczas własnej wypowiedzi, więc kontynuuje rozmowę, gdy rozmówca mówi „mhm”, ale ustępuje przy prawdziwym przerywaniu. Opowiada o postępie podczas długich zapytań, odpowiada na pytania uzupełniające, gdy zadanie wciąż trwa, i pomaga w mniejszych żądaniach w międzyczasie, zamiast pozostawiać rozmówcę w ciszy lub na poczekalni.

Wyniki oceny zgłoszone przez firmę

W poście Zhanga podano informacje o klientach z sektora telekomunikacji, usług finansowych oraz podróży i hotelarstwa, którzy przeszli z gotowego rozwiązania głosowego na głos oparty na Chord, porównując te same programy przed i po zmianie jedynie głosu. Wskaźnik rozwiązania problemu wzrósł we wszystkich przypadkach, podaje Decagon: o 6,1 punktu dla klienta telekomunikacyjnego, 7,1 punktu dla dostawcy usług finansowych i 2,6 punktu dla marki podróżniczej. Wskaźniki „barge”, które Decagon definiuje jako odsetek połączeń, w których jedynym celem dzwoniącego jest dotarcie do człowieka, spadły o 14,5, 6,1 i 5,3 punktu wśród trzech klientów.

W ślepym teście słuchowym obejmującym trzy głosy słuchacze usłyszeli te same próbki audio, raz wypowiedziane przez Chord, a raz przez talent głosowy, na którym model został oparty, i zostali poproszeni o wskazanie, który z nich jest sztuczną inteligencją. Decagon podaje, że 45,7 % słuchaczy uznało, że prawdziwy ludzki głos był AI, co firma opisuje jako wynik zbliżony do 50‑50, czyli praktycznie nieodróżnialny. Ogłoszenie Voice 3 podsumowuje wynik jako około 90 % użytkowników niezdolnych do odróżnienia.

Decagon informuje również o teście preferencji, w którym Chord został zestawiony z trzema innymi modelami mowy, które firma opisuje jako wiodące, przy użyciu tych samych słów wypowiedzianych przez każdy z nich, a słuchacze zostali poproszeni o wybranie głosu, z którym najchętniej rozmawialiby jako klient z problemem. Wśród 185 słuchaczy firma twierdzi, że Chord zajął pierwsze miejsce ogólnie z wynikiem 36,2 % i osiągnął nawet 48,4 % w poszczególnych rundach.

Patrząc w przyszłość, Decagon podkreśla, że trudniejszym i cenniejszym wyzwaniem jest zachowanie się głosu w rzeczywistej rozmowie, w tym to, czy buduje zaufanie w ciągu pięciu minut i jak radzi sobie, gdy połączenie staje się chaotyczne. Firma opisuje Chord jako najnowsze wyrażenie kluczowego założenia Decagon Labs: że w interakcjach z klientami model dostosowany do konkretnego zadania przewyższa ogólnego modelu granicznego przeznaczonego do wszystkiego.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.