Моделі та платформи ШІ

Decagon представляє агента Voice 3 з мовною моделлю Chord

mm
Додайте Unite.AI до бажаних джерел у Google

Decagon представив Voice 3, свого голосового AI‑агента для дзвінків клієнтів, та Chord, першу мовну модель від Decagon Labs, на заході компанії Decagon Dialogues 2026, який відбувся 1 жовтня 2026 року, зазначивши, що агент підтримує понад 70 мов і працює на новій дуплекс‑архітектурі.

У оголошенні Voice 3, автори – менеджер продукту Quique Lores та старший менеджер з маркетингу продукту Ariana Xiang, Decagon описав Voice 3 як свого найпросунутішого голосового AI‑агента на сьогодні. Агент говорить через Chord і був запущений разом із ще трьома продуктами на Decagon Dialogues 2026.

У пості Decagon Dialogues 2026 співзасновники Джессі Чжан, генеральний директор Decagon, та Ашвін Срінівас, президент компанії, назвали інші три випуски: Personal Agent Gateway, який ідентифікує персональні AI‑агенти клієнтів і надає їм окремий канал для взаємодії з бізнесом; Agent Modules, який розширює агента на подорожі поза підтримкою; і Duet Apprentice, який дозволяє системі Duet компанії вивчати бізнес на основі внутрішніх ресурсів та ескалованих розмов з клієнтами.

Підприємства спочатку залучили агентів Decagon для вирішення заявок підтримки, написали співзасновники, і ці агенти тепер кваліфікують потенційних клієнтів, залучають нових клієнтів, збирають платежі та розвивають відносини. Чотири випуски розширюють можливості того, як клієнти отримують те, що Decagon називає AI‑консьєрж і що він може для них зробити.

Voice 3 та мовна модель Chord

Chord — це перша голосова модель, навчена Decagon Labs, і компанія стверджує, що її додаткове навчання проводилося на реальних розмовах з клієнтами, а не для широкого спектра застосувань, які зазвичай обслуговують голосові моделі, від озвучування аудіокниг до озвучування відеоігор. Decagon зазначає, що модель формує мову фраза за фразою, уповільнюючись для коду підтвердження або телефонного номера, а потім повертаючись до розмовного темпу, замість використання одного глобального налаштування швидкості. Існуючі налаштування кастомізації голосу залишаються: вибір голосу, вимова специфічних для бізнесу термінів та подача, налаштована під бізнес.

Voice 3 підтримує понад 70 мов без потреби створювати окремий агент для кожної, згідно з оголошенням. Він виявляє мову абонента і автоматично перемикається, навіть коли абонент переходить між мовами в середині речення, і Decagon стверджує, що його голоси, специфічні для конкретних локалей, відображають спосіб мовлення людей у кожному ринку та проходять валідацію носіями мови перед випуском.

Decagon заявляє, що Chord навчена на ліцензованих даних та згоджених голосових талантах, ніколи не на даних, що належать клієнтам. Крістіан Нідворок, керівник цифрових сервісних комунікацій у Deutsche Telekom, сказав у оголошенні, що роки використання IVR‑систем навчали клієнтів говорити короткими фрагментами лише для того, щоб дістатися до людини, і що голос Decagon звучить так, ніби він дійсно слухає, підтримуючи діалог, а не замовкаючи під час обробки. Операційний директор Chime Джанель Салленаве зазначила, що Decagon Voice дозволяє Chime поєднувати високу продуктивність і безшовну кастомізацію бренду з крос‑канальною пам’яттю, зберігаючи кожну взаємодію зв’язаною та вірною цінностям, орієнтованим на членів.

Конвеєр навчання та базова модель

У допоміжному пості Самуеля Чжана, члена технічного персоналу Decagon, що зосереджений на оркестрації агентів, описується, як був створений Chord. Його конвеєр навчання розроблений так, щоб зберігати текстуру реальної розмови, включаючи зміну темпу, природні наголоси, паузи та заповнювальні слова, а не очищати записи до рівномірного, чистого читання, що, за словами посту, робить голоси синтетичними. Два методи підтримують цей підхід: процес дослівної транскрипції, який зберігає темп, наголос та дисфлюенції, і метод запису, який поєднує вміст сценарію з природністю вільної розмови, а не виконавчого читання акторів голосу.

Для базової моделі Decagon здійснив пост‑тренування дифузійної моделі без токенізатора. У пості стверджується, що дискретизація аудіо в токени втрачає інформацію на кожному кроці токенізації, тоді як представлення без токенів залишається близьким до без втрат і зберігає тонкі деталі, які розрізняють голос, що лише зрозумілий, і голос, що звучить присутньо. Це також робить модель значно більш керованою, за словами посту, дозволяючи Decagon точно формувати емоції, темп і наголос. У виробництві Chord розміщений на Modal.

Дуплекс‑архітектура

Decagon зазначає, що більшість голосових агентів працюють за каскадним конвеєром, у якому speech‑to‑text транскрибує абонента, велика мовна модель вирішує, як відповісти, а text‑to‑speech озвучує відповідь, причому кожен етап додає затримку, а координація між етапами ускладнює природний обмін репліками. Voice 3 замінює цю схему дуплекс‑архітектурою, яка працює двома шарами паралельно: модель з низькою затримкою обробляє прослуховування та говоріння, від відповідей до оновлень прогресу, тоді як потужніша модель керує міркуваннями, викликом інструментів та забезпеченням правил за межами розмови.

За словами компанії, агент обробляє вхідний аудіо навіть під час власної промови, тому він продовжує говорити, коли абонент каже “mhm”, але зупиняється при справжньому перериванні. Він повідомляє про свій прогрес під час тривалих пошуків, відповідає на уточнюючі питання, поки завдання ще виконується, і допомагає з меншими запитами між ними, замість того, щоб залишати абонента в мовчанні чи на утриманні.

Результати оцінки, повідомлені компанією

У дописі Чжана повідомляється про клієнтів у сфері телекомунікацій, фінансових послуг та подорожей і гостинності, які перейшли від готового голосу до голосу на базі Chord, порівнюючи ті самі програми до і після, змінюючи лише голос. За даними Decagon, рівень вирішення збільшився у всіх випадках: на 6,1 пункту для телекомунікаційного клієнта, на 7,1 пункту для постачальника фінансових послуг і на 2,6 пункту для бренду подорожей. “Barge rates”, які Decagon визначає як частку дзвінків, у яких мета абонента – лише дістатися до людини, знизилися на 14,5, 6,1 і 5,3 пункту відповідно у трьох клієнтів.

У сліпому тесті прослуховування з трьома голосами слухачі чули однакові аудіо‑зразки, один раз озвучені Chord, а інший – голосовим талантам, на якому він був змодельований, і їх просили визначити, який з них є ШІ. Decagon повідомляє, що 45,7 % слухачів вважали, що реальний людський голос є ШІ, результат, який компанія описує як достатньо близький до випадкового підкидання монети 50/50, так що два голоси практично не відрізняються. Оголошення Voice 3 підсумовує результат як приблизно 90 % користувачів, які не змогли розрізнити.

Decagon також повідомляє про тест уподобань, у якому Chord змагався один проти одного з трьома іншими мовними моделями, які компанія називає провідними; кожна модель озвучувала однакові слова, а слухачів просили вибрати голос, з яким вони найбільше хотіли б спілкуватися як клієнт із проблемою. За результатами 185 слухачів компанія зазначає, що Chord зайняв перше місце загалом із 36,2 % і досяг до 48,4 % у окремих раундах.

Дивлячись у майбутнє, Decagon зазначає, що складнішою та більш цінною задачею є те, як голос поводиться в реальній розмові, зокрема чи здобуває він довіру протягом п’яти хвилин і чи витримує складні ситуації під час дзвінка. Компанія описує Chord як найновіший вираз основної ставки Decagon Labs: що для взаємодії з клієнтами модель, доопрацьована під конкретне завдання, перевершує універсальну передову модель, створену для всього.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.