Лідери думок

Що реальне, а що — мрія у голосовому ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

У 2024 році, якщо ви подзвонили на лінію підтримки компанії й вас перенаправили до «голосового агента», ви зрозуміли, що розмовляєте з машиною вже за кілька секунд. Кілька секунд мовчання між вашим запитанням і відповіддю явно вказували, що з іншого боку лінії – програмне забезпечення. Через два роки і кілька мільярдів доларів інвестицій ці ознаки зникають. Найкращі системи голосового ШІ сьогодні настільки добрі, що люди не розпізнають їх у сліпих тестах не зрідка, а регулярно. За більшістю практичних визначень ми спостерігаємо, як голосовий ШІ проходить Turing Test у реальному житті.

Але цей етап варто ретельно перевіряти, оскільки подібні заяви часто залишаються без деталей. Коли технологія перетинає такий поріг, маркетингові обіцянки часто випереджають інженерні можливості, і голосовий ШІ не є винятком. Я провів майже два роки, створюючи моделі текст‑в‑мову та мова‑в‑мову, спілкуючись із корпоративними покупцями, які оцінювали дюжину постачальників з майже ідентичними обіцянками. Деякі з цих обіцянок витримують перевірку, але більшість ще далекі від реальності. У голосовому ШІ існує сім міфів, які я найчастіше зустрічав у розмовах із нашими клієнтами.

Міф #1: Більші моделі не роблять голосовий ШІ більш людським

У галузі зазвичай вважають, що масштаб вирішує все: кинути більшу мовну модель у проблему — і агент стане більш людським. Це не так, бо люди не обробляють розмову, як модель обробляє підказку; ми перериваємо посеред думки, а не чекаємо повного речення. Голосовий агент, який чекає, обробляє, а потім відповідає, звучить роботизовано, незалежно від того, наскільки чітко сформульовано його відповідь, бо головним є таймінг, а не словниковий запас. Менші, спеціалізовані моделі, що обробляють рутинні діалоги в реальному часі, часто звучать більш людсько, підвищуючи складність лише за потреби, залишаючись достатньо гнучкими, щоб встигати за співрозмовником.

Міф #2: «Ми обробляємо 90 % дзвінків» зазвичай означає утримання, а не вирішення

Голосовий ШІ все ще спирається на конкретні метрики для оцінки продуктивності, і «утримання дзвінків» — мабуть, найпомилковіша. Цей показник вимірює відсоток дзвінків, які обробляються голосовим ШІ без залучення людини, і він живе, бо майже ніхто не задає очевидного уточнення: чи дійсно вирішені утримані дзвінки? Дзвінок вважається утриманим, якщо клієнт не був переданий людині; він вирішений лише тоді, коли проблема виправлена. Постачальники підкреслюють утримання, бо це велике число, але воно нічого не каже про ефективність впровадження. Саме цей розрив і є джерелом більшості розчарувань у корпоративних розгортаннях голосового ШІ. Запитайте у будь‑якого постачальника про рівень вирішення, і ви побачите, як зміниться розмова.

Міф #3: Голосовий ШІ, який звучить людськи, але вигадує відповіді, гірший за роботизований ШІ, який їх не дає

Є багато чого привабливого в ШІ, що звучить переконливо людсько; саме це робить голосові взаємодії природними, а не роботизованими. Але справжня мета — поєднати цю людську теплоту з точністю, бо голос, який звучить людсько і завжди правий, завжди переможе той, що лише звучить людсько. Негрунтувані голосові моделі, які спираються лише на внутрішню пам’ять навчання, можуть «галюцинувати» у 15‑30 % реальних дзвінків. Системи голосового ШІ, які підкріплюють кожну відповідь реальними даними про клієнта та бекенд, замість того, щоб дозволяти моделі імпровізувати, менш схильні впевнено надавати неправильну інформацію, вводячи абонентів в оману. Якщо постачальник не може пояснити, як його система контролює галюцинації, ви отримуєте лише половину історії.

Міф #4: Інтелект для голосу полягає в тому, чого *не* зберігаєте, а не в тому, що робите

Впровадження ChatGPT закріпило в технологічній індустрії ідею, що більше параметрів і більше даних навчання неодмінно призводять до більшого і кращого інтелекту. Але це не те, як працює людський інтелект, і, відповідно, не підходить для голосового ШІ. Ми не зберігаємо кожен шматок інформації, яку коли‑небудь чули; ми зберігаємо те, що важливо, а решту відпускаємо. Сучасні великі мовні моделі роблять навпаки: вони стискають усе в собі — це одна з причин, чому попит на дата‑центри стрімко зростає. Проте для більшості реальних випадків використання голосу, таких як підтримка клієнтів, транскрипція, структуровані діалоги тощо, сфокусована мала модель часто перевершує трильйон‑параметрову універсальну модель за вартістю, затримкою і часто за точністю.

Міф #5: Повна заміна людських агентів проти розуміння своїх меж

Зрозуміло, що ніхто не хоче голосового ШІ, який імітує впевненість лише для того, щоб уникнути визнання, що він чогось не знає. Саме тому впровадження, які дійсно приносять цінність, імітують роботу хорошого людського працівника. Вони миттєво обробляють те, що знають, а коли стикаються з незнайомою ситуацією або складним клієнтом, піднімають прапорець, ставлять абонента на коротку та природну паузу і передають справу більшій моделі або людському агенту. Мета ніколи не повинна бути 100 % автоматизації. Ідеальна конфігурація — це агент, який у реальному часі розпізнає межу своєї компетенції, бо саме це робить його безпечним для масштабного розгортання.

Міф #6: Голос не знищує інші інтерфейси, а доповнює те, що ми вже використовуємо

Поширене припущення: коли голосовий ШІ стане достатньо хорошим, введення тексту і екрани просто зникнуть. Я не вірю, що ми прямуємо до нульового вводу, і екрани не зникають; людям і надалі потрібні вони для перегляду відео, сканування панелей управління чи візуальної перевірки. Що змінюється, так це те, що значно більше нашої щоденної взаємодії з машинами перейде на голос, так само, як це вже відбувається між людьми, накладаючись на інтерфейси, які залишаються логічними. Голос не замінить усе; він просто стане стандартною опцією у значно більшій кількості випадків, ніж раніше.

Міф #7: Поєднання LLM з готовим API синтезу мови рахується як голосовий агент

Коли голосовий ШІ стає диференціатором для споживчих брендів, багато «обгорток голосових агентів», які є сервісами над існуючою інфраструктурою для брендингу чи білінгу, виглядають вражаюче у демонстрації, але рідко витримують реальний обсяг кол‑центрів. З’єднання speech‑to‑text, мовної моделі та text‑to‑speech збільшує затримку на кожному етапі передачі. Те, що дійсно тримає систему разом у масштабі, — це не шар API, а економічна ефективність запуску конвеєра під навантаженням і оптимізація на рівні чіпсету, щоб залишатися швидким і доступним. Це непомітна робота, яку більшість обгорток ігнорують, і саме вона визначатиме наступне покоління клієнтського досвіду.

Лінія, що має значення

Кожен цикл ажіотажу зрештою створює власну систему визначення, хто серйозно ставиться до технології, а хто просто їде на хвилі. Оскільки голосові інтерфейси стають все важче відрізнити від людини на іншому кінці лінії, різниця між системами, створеними лише для того, щоб звучати довірливо, і системами, які дійсно довірливі, буде набагато важливішою, ніж сьогодні. Компанії, які вже розглядають це як інженерну дисципліну, а не лише маркетинговий чек‑лист, залишаться тими, кому клієнти будуть довіряти, коли новизна згасне.

Сударшан Каматх є співзасновником і генеральним директором Smallest AI, яку він заснував у 2023 році, щоб зробити голосовий ШІ швидким, доступним за ціною та масштабованим. Випускник IIT Guwahati, він понад десять років розробляє продукти ШІ. Сударшан керує загальним баченням, напрямком та довгостроковою стратегією компанії.