Лидеры мнений

Голосовые агенты на основе ИИ для предприятий: два ключевых вызова

mm mm
Добавьте Unite.AI в избранные источники в Google

Теперь, больше чем когда-либо прежде, время для голосовых систем, основанных на ИИ. Рассмотрим звонок в службу поддержки клиентов. Скоро все хрупкость и негибкость исчезнут – жесткие роботизированные голоса, меню в стиле “нажмите 1 для продаж” с ограничениями, раздражающие опыт, который заставил нас всех отчаянно нажимать 0 в надежде поговорить с живым агентом. (Или, учитывая долгое время ожидания, которое может потребоваться для перевода на человеческого агента, мы отказываемся от звонка совсем.)

Больше нет. Успехи не только в трансформаторных больших языковых моделях (LLM), но и в автоматическом распознавании речи (ASR) и системах текст-в-речь (TTS) означают, что “следующее поколение” голосовых агентов здесь – если вы знаете, как их построить.

Сегодня мы рассматриваем проблемы, с которыми сталкивается любой, кто надеется построить такой современный голосовой разговорный агент.

Почему голос?

Прежде чем приступить, давайте посмотрим на общие привлекательности и актуальность голосовых агентов (в отличие от текстовых взаимодействий). Есть много причин, почему голосовое взаимодействие может быть более подходящим, чем текстовое – это могут включать, в порядке возрастания серьезности:

  • Предпочтение или привычка – речь предшествует развитию и исторически письму

  • Медленное ввод текста – многие могут говорить быстрее, чем могут набирать текст

  • Ситуации без рук – такие как вождение, занятия спортом или мытье посуды

  • Неграмотность – по крайней мере в языке(ах), который понимает агент

  • Инвалидность – такая как слепота или отсутствие невокальной моторной функции

В эпоху, казалось бы, доминирующей веб-опосредованных транзакций, голос остается мощным средством для коммерции. Например, недавнее исследование JD Power о удовлетворенности клиентов в отельной индустрии показало, что гости, которые забронировали номер по телефону, были более удовлетворены своим пребыванием, чем те, кто забронировал через онлайн-агентство по путешествиям (OTA) или直接 через веб-сайт отеля.

Но интерактивные голосовые ответы, или IVR, недостаточно. Исследование 2023 года Zippia показало, что 88% клиентов предпочитают голосовые звонки с живым агентом вместо навигации по автоматизированному телефонному меню. Исследование также показало, что главными вещами, которые раздражают людей больше всего в телефонных меню, являются прослушивание нерелевантных вариантов (69%), невозможность полностью описать проблему (67%), неэффективная служба (33%) и запутанные варианты (15%).

И есть открытость использования голосовых помощников. Согласно исследованию Accenture, около 47% потребителей уже комфортно используют голосовые помощники для взаимодействия с бизнесом, и около 31% потребителей уже использовали голосового помощника для взаимодействия с бизнесом.

Какая бы ни была причина, для многих есть предпочтение и спрос на устное взаимодействие – пока оно естественно и комфортно.

Что делает хорошим голосовым агентом?

Примерно говоря, хороший голосовой агент должен реагировать на пользователя так, что:

  • Релевантно: Основано на правильном понимании того, что сказал/хотел пользователь. Обратите внимание, что в некоторых случаях ответ агента не будет просто устным ответом, но некоторым видом действия через интеграцию с бэкэндом (например, фактическим бронированием номера в отеле, когда звонящий говорит “Идите и забронируйте его”).

  • Точно: Основано на фактах (например, говорите, что есть доступный номер в отеле на 19 января, только если это так)

  • Ясно: Ответ должен быть понятным

  • Своевременно: С задержкой, которую можно ожидать от человека

  • Безопасно: Без оскорбительного или неуместного языка, раскрытия защищенной информации и т. д.

Проблема

Текущие голосовые автоматические системы пытаются удовлетворить вышеуказанным критериям за счет того, что они очень ограничены и очень раздражают использовать. Часть этого является результатом высоких ожиданий, которые голосовой разговорный контекст устанавливает, с такими ожиданиями, которые только растут, когда качество голоса в системах TTS становится неотличимым от человеческого голоса. Но эти ожидания разбиваются в системах, которые в настоящее время широко развернуты. Почему?

В одном слове – негибкость:

  • Ограниченная речь – пользователь обычно вынужден говорить неестественно: в коротких фразах, в определенном порядке, без посторонней информации и т. д. Это предлагает мало или никакого преимущества над старой системой меню на основе номеров

  • Узкое, неинклюзивное понятие “допустимой” речи – низкая терпимость к сленгу, ухм и ах и т. д.

  • Нет возврата – если что-то идет не так, может быть мало шансов “исправить” или исправить проблемную часть информации, но вместо этого начать заново или ждать перевода на человека.

  • Строгая смена поворотов – нет возможности прервать или говорить агенту

Это само собой разумеется, что люди находят эти ограничения раздражающими или раздражающими.

Решение:

Хорошая новость заключается в том, что современные системы ИИ достаточно мощны и быстры, чтобы значительно улучшить вышеуказанные виды опыта, вместо того, чтобы приближаться (или превышать!) человеческие стандарты обслуживания клиентов. Это связано с рядом факторов:

  • Быстрее, более мощное оборудование

  • Улучшения в ASR (более высокая точность, преодоление шума, акцентов и т. д.)

  • Улучшения в TTS (естественно звучащие или даже клонированные голоса)

  • Прибытие генеративных LLM (естественно звучащие разговоры)

Последняя точка является игроком. Ключевым моментом было то, что хорошая прогностическая модель может служить хорошей генеративной моделью. Искусственный агент может приблизиться к человеческому разговорному выступлению, если он говорит все, что достаточно хорошая LLM прогнозирует как наиболее вероятную вещь, которую хороший человеческий агент обслуживания клиентов сказал бы в данном разговорном контексте.

Сигнал прибытия десятков стартапов ИИ, надеющихся решить проблему голосового разговорного агента, просто выбрав и подключив готовые модули ASR и TTS к ядру LLM. На этом взгляде решение заключается просто в выборе комбинации, которая минимизирует задержку и стоимость. И, конечно, это важно. Но достаточно ли этого?

Не так быстро

Есть несколько конкретных причин, почему простой подход не сработает, но они вытекают из двух общих моментов:

  1. LLM не могут, сами по себе, обеспечить хорошую факто-основанную текстовую беседу, необходимую для корпоративных приложений, таких как обслуживание клиентов. Итак, они не могут, сами по себе, сделать это и для голосовых разговоров.

  2. Даже если вы дополните LLM то, что необходимо для создания хорошего текстового разговорного агента, превращение этого в хороший голосовой разговорный агент требует больше, чем просто подключение его к лучшим модулям ASR и TTS, которые вы можете себе позволить.

Давайте рассмотрим конкретный пример каждого из этих вызовов.

Вызов 1: Сохранение реальности

Как теперь широко известно, LLM иногда производят неточные или “галлюцинированные” сведения. Это катастрофично в контексте многих коммерческих приложений, даже если это может быть хорошим развлекательным приложением, где точность может не быть целью.

Тот факт, что LLM иногда галлюцинирует, ожидаем, на размышлении. Это прямое следствие использования моделей, обученных на данных годичной давности (или более), для генерации ответов на вопросы о фактах, которые не являются частью (или вытекают из) набора данных (как бы огромного он ни был), который может быть годичной давности (или более). Когда звонящий спрашивает “Какой мой номер членства?”, простая предобученная LLM может сгенерировать только правдоподобно звучащий ответ, а не точный.

Наиболее распространенные способы решения этой проблемы являются:

  • Настройка: Обучите предобученную LLM дальше, на этот раз на всех доменных данных, которые вы хотите, чтобы она могла правильно ответить.

  • Инженерия подсказок: Добавьте дополнительные данные/инструкции в качестве входных данных в LLM, в дополнение к разговорной истории

  • Усиление генерации поиска (RAG): Как инженерия подсказок, за исключением того, что данные, добавленные в подсказку, определяются на лету путем сопоставления текущего разговорного контекста (например, клиент спросил “Имеет ли ваш отель бассейн?”) с кодированным индексом доменных данных (который включает, например, файл, в котором говорится: “Вот объекты, доступные в отеле: бассейн, сауна, зарядная станция для электромобилей”).

  • Контроль на основе правил: Как RAG, но то, что добавляется к (или вычитается из) подсказки, не определяется путем сопоставления нейронной памяти, а определяется жесткими (и рукописными) правилами.

Обратите внимание, что один размер не подходит всем. Какой из этих методов будет подходящим, будет зависеть, например, от доменных данных, которые информируют ответ агента. В частности, это будет зависеть от того, меняются ли эти данные часто (например, звонок за звонком – например, имя клиента) или почти никогда (например, первоначальное приветствие: “Здравствуйте, спасибо за звонок в отель Будапешт. Как я могу вам помочь сегодня?”). Настройка не будет подходящей для первого, и RAG будет неуклюжим решением для последнего. Итак, любая работающая система должна использовать разнообразие этих методов.

Что более того, интеграция этих методов с LLM и друг с другом в sposób, который минимизирует задержку и стоимость, требует тщательной инженерии. Например, производительность вашей модели RAG может улучшиться, если вы настроите ее для облегчения этого метода.

Может показаться неудивительным, что каждый из этих методов, в свою очередь, вводит свои собственные вызовы. Например, возьмем настройку. Настройка вашей предобученной LLM на ваших доменных данных улучшит ее производительность на этих данных, да. Но настройка изменит параметры (веса), которые являются основой хорошей производительности предобученной модели. Это изменение, таким образом, вызывает “забывание” (или “катастрофическое забывание”) некоторых знаний модели. Это может привести к тому, что модель даст неправильные или неуместные (даже небезопасные) ответы. Если вы хотите, чтобы ваш агент продолжал отвечать точно и безопасно, вам нужен метод настройки, который смягчает катастрофическое забывание.

Вызов 2: Окончательное формирование

Определение того, когда клиент закончил говорить, имеет решающее значение для естественного разговорного потока. Аналогично, система должна обрабатывать прерывания грациозно, обеспечивая, чтобы разговор оставался связным и реагировал на потребности клиента. Достижение этого до стандарта, сравнимого с человеческим взаимодействием, является сложной задачей, но она необходима для создания естественных и приятных разговорных опытов.

Решение, которое работает, требует от разработчиков рассмотреть вопросы, такие как:

  • Как долго после того, как клиент перестал говорить, агент должен ждать, прежде чем решить, что клиент перестал говорить?

  • Зависит ли это от того, что клиент завершил полное предложение?

  • Что следует делать, если клиент прерывает агента?

  • В частности, должен ли агент предположить, что то, что он говорил, не было услышано клиентом?

Эти вопросы, имеющие отношение в основном к времени, требуют тщательной инженерии, выходящей за рамки той, которая участвует в получении правильного ответа от LLM.

Заключение

Эволюция голосовых систем, основанных на ИИ, обещает революционный сдвиг в динамике обслуживания клиентов, заменяя устаревшие телефонные системы на передовые LLM, ASR и TTS-технологии. Однако преодоление вызовов в галлюцинированных сведениях и бесшовном окончательном формировании будет иметь решающее значение для обеспечения естественных и эффективных голосовых взаимодействий.

Автоматизация обслуживания клиентов имеет силу стать настоящим игроком для предприятий, но только если это сделано правильно. В 2024 году, особенно с этими новыми технологиями, мы можем, наконец, построить системы, которые могут чувствовать себя естественными и плавными и могут полноценно понимать нас. Это приведет к уменьшению времени ожидания и улучшению текущего опыта, который мы имеем с голосовыми ботами, отмечая трансформационную эпоху в взаимодействии с клиентами и качестве обслуживания.

Доктор Итамар Арел, в настоящее время являющийся генеральным директором в Tenyx, сочетает свой академический опыт как бывший профессор в Университете Теннесси и лаборатории искусственного интеллекта Стэнфордского университета с предпринимательским успехом, соосновав пионерские компании Binatix, Apprentice (приобретена McDonald’s и IBM) и Tenyx. Итамар недавно занимал должность корпоративного вице-президента и руководителя McD Tech Labs в корпорации McDonald’s и руководителя разговорного ИИ в IBM Watson Orders.

Dr. Ron Chrisley is currently Chief Scientific Advisor at Tenyx, which he co-founded in 2021. He received a BS in Symbolic Systems from Stanford, holds a doctorate from the University of Oxford, and is Professor of Cognitive Science and Artificial Intelligence at the University of Sussex. From 2019 to 2020, he was Visiting Scholar at Stanford’s Institute for Human-Centered AI.