Лідери думок
Розробка голосових агентів на основі штучного інтелекту для підприємств: два ключових виклики

Тепер, ніж будь-коли раніше, час для систем голосового управління на основі штучного інтелекту. Розгляньте дзвінок у службу підтримки клієнтів. Незабаром вся крихкість і негибкість зникнуть – жорсткі роботизовані голоси, меню типу “натисніть 1 для продажів”, дратівливі переживання, які мали нас усіх відчайдушно натискати нуль у надії поговорити з живим агентом. (Або, враховуючи тривалі часи очікування, які можуть супроводжувати перенаправлення до людини-агента, ми всі відмовлялися від дзвінка зовсім.)
Ні більше. Підходи не тільки у великих мовних моделях (LLM), але й у системах автоматичного розпізнавання мови (ASR) та текст-у-голос (TTS) означають, що “наступне покоління” голосових агентів уже тут – якщо ви знаєте, як їх будувати.
Сьогодні ми розглянемо виклики, з якими стикаються ті, хто хоче створити такий сучасний голосовий агент.
Чому голос?
Перед тим, як почати, давайте швидко розглянемо загальні привабливості та актуальність голосових агентів (на відміну від текстових взаємодій). Є багато причин, чому голосова взаємодія може бути більш підходящою, ніж текстова – ці причини включають, у порядку зростання важливості:
-
Відпочинок або звичка – говоріння передує розвитку письма як історично, так і розвитково
-
Повільний текстовий ввод – багато людей можуть говорити швидше, ніж писати
-
Ситуації без рук – наприклад, водіння, зайняття спортом або мити посуду
-
Неграмотність – принаймні в мові (мовах), яку розуміє агент
-
Інвалідність – наприклад, сліпота або відсутність невокальної моторики
У епоху, яка, здавалося б, домінує транзакції, опосередковані веб-сайтами, голос залишається потужним каналом для комерції. Наприклад, недавнє дослідження JD Power щодо задоволеності клієнтів у готельній галузі показало, що гості, які забронювали номер по телефону, були більш задоволені своїм перебуванням, ніж ті, хто забронював через онлайн-агентство з подорожей (OTA) або безпосередньо через веб-сайт готелю.
Але інтерактивні голосові відповіді, або IVR, недостатньо. Дослідження 2023 року компанії Zippia показало, що 88% клієнтів віддають перевагу голосовим дзвінкам з живим агентом, а не навігації по автоматизованому телефонному меню. Дослідження також показало, що найбільш дратівливими речами про телефонні меню є прослуховування неважливих варіантів (69%), неможливість повністю описати проблему (67%), неефективна служба (33%) та плутані варіанти (15%).
І є відкритість до використання голосових помічників. За даними дослідження компанії Accenture, близько 47% споживачів вже комфортно користуються голосовими помічниками для взаємодії з підприємствами, а близько 31% споживачів вже використовували голосовий помічник для взаємодії з підприємством.
Хоч би яка була причина, для багатьох є перевага і попит на усну взаємодію – якщо тільки вона природна і комфортна.
Що робить хороший голосовий агент?
Голосовий агент повинен відповідати користувачеві так, щоб відповідь була:
-
Aktualна: На основі правильного розуміння того, що сказав користувач/що хотів користувач. Нотатка: у деяких випадках відповідь агента не буде тільки усною відповіддю, а певною дією через інтеграцію з бекендом (наприклад, фактичне бронювання номера в готелі, коли клієнт говорить “Відбути бронювання”).
-
Точна: На основі фактів (наприклад, тільки сказати, що номер доступний в готелі 19 січня, якщо це так)
-
Чітка: Відповідь повинна бути зрозумілою
-
Вчасна: З тим самим затримуванням, яке можна очікувати від людини
-
Безпечна: Без образливої або нецензурної мови, розголошення захищеної інформації тощо
Проблема
Поточні голосові автоматизовані системи намагаються задовольнити вищезазначені критерії за рахунок обмеження та дратівливості. Частина цього є результатом високих очікувань, які встановлює контекст голосової взаємодії, з такими очікуваннями, які тільки зростають, чим більше якість голосу в системах TTS стає незрізнюваною від людського голосу. Але ці очікування зруйновані в системах, які зараз широко розгорнуті. Чому?
У одному слові – негибкість:
-
Обмежена мова – користувач зазвичай змушений говорити речі нерівномірно: у коротких фразах, у певному порядку, без зайвої інформації тощо. Це пропонує мало або жодної переваги над старим шкільним системою меню на основі номерів
-
Вузьке, неінклюзивне поняття “прийнятної” мови – низька толерантність до сленгу, ух-ів та ах-ів тощо
-
Немає можливості повернутися назад: якщо щось піде не так, може бути мало шансів “відремонтувати” або виправити проблематичну частину інформації, а натомість потрібно почати спочатку або чекати на переведення до людини.
-
Суворе чергування: немає можливості перервати або говорити агенту
Само собою зрозуміло, що люди вважають ці обмеження дратівливими або розчаровуючими.
Рішення:
Хороша новина полягає в тому, що сучасні системи штучного інтелекту достатньо потужні, щоб суттєво покращити вищеописані досвіди, замість того, щоб наближатися (або перевищувати!) стандарти людської служби підтримки клієнтів. Це відбувається завдяки різним факторам:
-
Швидше, потужніше апаратне забезпечення
-
Покращення в ASR (вищій точності, подоланні шуму, акцентів тощо)
-
Покращення в TTS (природньо звучних або навіть клонованих голосів)
-
Поява генеративних LLM (природньо звучних розмов)
Остання точка – це гра-змінювач. Ключова ідея полягала в тому, що добра передбачувальна модель може служити доброю генеративною моделлю. Штучний агент може наблизитися до людської розмовної продуктивності, якщо він говорить те, що досить добра LLM передбачає бути найбільш імовірним тим, що добрий людський агент служби підтримки клієнтів сказав би в даному контексті розмови.
Сигнал до появи десятків стартапів штучного інтелекту, які сподіваються вирішити проблему голосового агента просто шляхом вибору та підключення готових модулів ASR та TTS до ядра LLM. З цієї точки зору, рішення полягає просто у виборі комбінації, яка мінімізує затримку та вартість. І, звичайно, це важливо. Але це достатньо?
Не так швидко
Є кілька конкретних причин, чому такий простий підхід не спрацює, але вони походять від двох загальних моментів:
-
LLM насправді не можуть самостійно забезпечити добру факт-основану текстову розмову такого типу, який необхідний для корпоративних застосунків, таких як служба підтримки клієнтів. Тому вони не можуть цього зробити і для голосових розмов.
-
Даже якщо ви доповнюєте LLM тим, що потрібно для створення доброго текстового агента, перетворення цього в доброго голосового агента вимагає більше, ніж просто підключення до найкращих модулів ASR та TTS, які ви можете собі дозволити.
Давайте розглянемо конкретний приклад кожного з цих викликів.
Виклик 1: Тримання реальності
Як зараз широко відомо, LLM іноді виробляють неточну або “галюциновану” інформацію. Це катастрофічно в контексті багатьох комерційних застосунків, навіть якщо це може бути добро для розважального застосунку, де точність може не бути головним.
Те, що LLM іноді галюцинують, можна очікувати після роздуму. Це є прямим наслідком використання моделей, навчених на даних з минулого року (або раніше), для генерації відповідей на питання про факти, які не входять до даних (як би великих вони не були) або не витікають з них.
Найпоширеніші способи боротьби з цією проблемою:
-
Файн-тюнінг: Навчання попередньо навченої LLM далі, цього разу на всіх домен-специфічних даних, які ви хочете, щоб вона могла відповісти правильно.
-
Інженерія промптерів: Додавання додаткових даних/інструкцій у вигляді входу до LLM, крім історії розмови
-
Покращення генерації з підтримкою пошукової системи (RAG): Як інженерія промптерів, крім того, що дані, додані до промптера, визначаються на льоту шляхом збігу поточної історії розмови (наприклад, клієнт запитав “Чи є у вашому готелі басейн?”) з індексом домен-специфічних даних (який включає, наприклад, файл, який говорить: “Ось які об’єкти доступні в готелі: басейн, сауна, станція зарядки електромобілів”).
-
Контроль на основі правил: Як RAG, крім того, що те, що додається до промптера (або видалене з нього), не визначається нейронною пам’яттю, а визначається жорсткими (і ручними) правилами.
Нотатка: один розмір не підходить всім. Якесь з цих методів буде підходящим залежатиме, наприклад, від домен-специфічних даних, які інформують відповідь агента. Зокрема, це буде залежати від того, чи часто змінюються дані (наприклад, з дзвінком до дзвінка – наприклад, ім’я клієнта). Файн-тюнінг не буде підходящим для першого випадку, а RAG буде незграбним рішенням для другого. Тому будь-яка працездатна система повинна використовувати різноманітність цих методів.
Що більше, інтеграція цих методів з LLM та один з одним таким чином, щоб мінімізувати затримку та вартість, вимагає ретельної інженерії. Наприклад, ваша модель RAG може покращитися, якщо ви файн-тюніте її для полегшення цього методу.
Можливо, не дивно, що кожен з цих методів у свою чергу вводить свої власні виклики. Наприклад, візьміть файн-тюнінг. Файн-тюнінг вашої попередньо навченої LLM на ваших домен-специфічних даних покращить її продуктивність на цих даних, так. Але файн-тюнінг змінює параметри (ваги), які є основою попередньо навченої моделі (припустимо, досить доброї) загальної продуктивності. Ця зміна спричиняє незворотнє забування (або “катастрофічне забування”) деяких попередніх знань моделі. Це може призвести до того, що модель дає неправильні або недоречні (навіть небезпечні) відповіді. Якщо ви хочете, щоб ваш агент продовжував відповідати точно та безпечно, вам потрібен метод файн-тюнінгу, який пом’якшує катастрофічне забування.
Виклик 2: Ендпоінтинг
Визначення того, коли клієнт закінчив говорити, є критичним для природного потоку розмови. Аналогічно, система повинна обробляти переривання елегантно, забезпечуючи, щоб розмова залишилася сплоченою та відповідною до потреб клієнта. Досягнення цього на рівні, порівнянному з людською взаємодією, – це складне завдання, але воно є необхідним для створення природних та приємних розмовних досвідів.
Рішення, яке працює, вимагає від дизайнерів розгляду питань типу:
-
Як довго після того, як клієнт зупинився говорити, агент повинен чекати, перш ніж вирішити, що клієнт зупинився говорити?
-
Чи залежить вище від того, чи клієнт завершив повну речення?
-
Що слід робити, якщо клієнт перериває агента?
-
Зокрема, повинен агент припускати, що те, що він говорив, не було почуто клієнтом?
Ці питання, які в основному стосуються часу, вимагають ретельної інженерії понад те, що потрібно для отримання правильної відповіді від LLM.
Висновок
Еволюція систем голосового управління на основі штучного інтелекту обіцяє революційний зсув у динаміці служби підтримки клієнтів, заміняючи застарілі телефонні системи сучасними LLM, ASR та TTS-технологіями. Однак подолання викликів у галюцинованій інформації та безперервному ендпоінтингу буде вирішальним для надання природних та ефективних голосових взаємодій.
Автоматизація служби підтримки клієнтів має потенціал стати справжнім гейм-чейнджером для підприємств, але тільки якщо це зроблено правильно. У 2024 році, особливо з цими новими технологіями, ми нарешті можемо створити системи, які можуть відчуватися природними та плавними та повноцінно розуміти нас. Ефект буде полягати у скороченні часу очікування та покращенні поточного досвіду, який ми маємо з голосовими ботами, що позначає трансформаційну епоху у взаємодії клієнтів та якості обслуговування.













