Взгляд Anderson

AI-основной детектор лжи для разговоров в колл-центрах

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи в Германии использовали машинное обучение для создания системы анализа аудио, предназначенной в первую очередь для работы в качестве детектора лжи на основе ИИ для клиентов в аудиосвязи с сотрудниками колл-центра и поддержки.

Система использует специально созданную базу данных аудиозаписей 40 студентов и преподавателей во время дебатов на спорные темы, включая моральность смертной казни и платы за обучение. Модель была обучена на архитектуре, использующей свёрточные нейронные сети (CNN) и долгосрочную память (LSTM), и достигла заявленной точности 98%.

Хотя заявленная цель работы упоминает коммуникации с клиентами, исследователи признают, что она фактически работает как общий детектор лжи:

‘Результаты применимы к широкому кругу сервисных процессов и особенно полезны для всех взаимодействий с клиентами, которые происходят по телефону. Алгоритм, представленный в работе, может быть применен в любой ситуации, когда для агента важно знать, говорит ли клиент искренне.

‘Это, например, может привести к снижению количества сомнительных страховых претензий или ложных заявлений на собеседованиях. Это не только уменьшит операционные потери для сервисных компаний, но и поощрит клиентов быть более правдивыми.’

Генерация базы данных

В отсутствие подходящей публично доступной базы данных на немецком языке исследователи – из Университета прикладных наук Ной-Ульм (HNU) – создали свою собственную базу данных. Флаеры были размещены в университете и в местных школах, и 40 добровольцев были выбраны с минимальным возрастом 16 лет. Добровольцам была выплачена компенсация в размере 10 евро в виде ваучера Amazon.

Сеансы проводились по модели дебат-клуба, предназначенной для поляризации мнений и вызова сильных реакций на провокационные темы, эффективно моделируя стресс, который может возникнуть в проблемных разговорах с клиентами по телефону.

Темы, на которые добровольцам пришлось говорить свободно в течение трех минут в публичном пространстве, были:

– Следует ли восстановить смертную казнь и публичные казни в Германии?
– Следует ли взимать плату за обучение в Германии?
– Следует ли легализовать использование тяжёлых наркотиков, таких как героин и кристаллический метамфетамин, в Германии?
– Следует ли запретить сети ресторанов, подают нездоровую быструю еду, такие как McDonald’s или Burger King, в Германии?

Предварительная обработка

Проект отдал предпочтение анализу акустических характеристик речи в подходе к автоматическому распознаванию речи (ASR) над подходом NLP (где речь анализируется на лингвистическом уровне, и «температура» дискурса выводится напрямую из использования языка).

Предварительно обработанные образцы были проанализированы сначала с помощью коэффициентов мел-частотной цепстральной обработки (MFCC), надёжного и популярного метода в анализе речи. Поскольку метод был впервые предложен в 1980 году, он заметно бережлив в отношении вычислительных ресурсов в плане распознавания повторяющихся закономерностей в речи и устойчив к различным уровням качества аудиозаписи. Поскольку сеансы проводились на платформах VOIP в условиях локдауна в декабре 2020 года, было важно иметь框架 записи, который мог бы учесть плохое качество аудио при необходимости.

Интересно отметить, что два вышеупомянутых технических ограничения (ограниченные ресурсы CPU в начале 1980-х годов и особенности подключения VOIP в контексте загруженной сети) объединяются здесь, чтобы создать то, что effectively является «технически скудной» моделью, которая, по-видимому, необычно устойчива в отсутствие идеальных условий и высокоуровневых ресурсов – имитируя целевую арену для полученного алгоритма.

Затем был применен алгоритм быстрого преобразования Фурье (FFT), чтобы обеспечить спектральный профиль каждого «аудио-кадра», прежде чем окончательное сопоставление с шкалой Мель.

Обучение, результаты и ограничения

Во время обучения извлеченные векторы особенностей передаются в слой свёрточной сети, расплющиваются и затем передаются в слой LSTM.

Архитектура процесса обучения для детектора лжи ИИ. Источник: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

Архитектура процесса обучения для детектора лжи ИИ. Источник: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

Наконец, все нейроны соединены друг с другом, чтобы сгенерировать бинарный прогноз о том, говорит ли говорящий правду или нет.

В тестах после обучения система достигла уровня точности до 98,91% в плане определения намерений (где высказанное содержание может не отражать намерение). Исследователи считают, что работа эмпирически демонстрирует определение убеждения на основе голосовых закономерностей и что это можно сделать без деконструкции языка в стиле NLP.

В плане ограничений исследователи признают, что выборка для тестирования мала. Хотя в работе это не указано явно, низкообъемные тестовые данные могут снизить позднюю применимость в случае, если предположения, архитектурные особенности и общий процесс обучения чрезмерно адаптированы к данным. В работе отмечается, что шесть из восьми моделей, созданных в ходе проекта, были переобучены на某мом этапе процесса обучения, и что есть дальнейшая работа, чтобы обобщить применимость параметров, заданных для модели.

Кроме того, исследования такого рода должны учитывать национальные характеристики, и в работе отмечается, что немецкие участники, участвовавшие в генерации данных, могут иметь закономерности общения, которые не могут быть напрямую воспроизведены в разных культурах – ситуация, которая, вероятно, возникнет в любом таком исследовании в любой стране.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]