Взгляд Anderson
AI-основной детектор лжи для разговоров в колл-центрах

Исследователи в Германии использовали машинное обучение для создания системы анализа аудио, предназначенной в первую очередь для работы в качестве детектора лжи на основе ИИ для клиентов в аудиосвязи с сотрудниками колл-центра и поддержки.
Система использует специально созданную базу данных аудиозаписей 40 студентов и преподавателей во время дебатов на спорные темы, включая моральность смертной казни и платы за обучение. Модель была обучена на архитектуре, использующей свёрточные нейронные сети (CNN) и долгосрочную память (LSTM), и достигла заявленной точности 98%.
Хотя заявленная цель работы упоминает коммуникации с клиентами, исследователи признают, что она фактически работает как общий детектор лжи:
‘Результаты применимы к широкому кругу сервисных процессов и особенно полезны для всех взаимодействий с клиентами, которые происходят по телефону. Алгоритм, представленный в работе, может быть применен в любой ситуации, когда для агента важно знать, говорит ли клиент искренне.
‘Это, например, может привести к снижению количества сомнительных страховых претензий или ложных заявлений на собеседованиях. Это не только уменьшит операционные потери для сервисных компаний, но и поощрит клиентов быть более правдивыми.’
Генерация базы данных
В отсутствие подходящей публично доступной базы данных на немецком языке исследователи – из Университета прикладных наук Ной-Ульм (HNU) – создали свою собственную базу данных. Флаеры были размещены в университете и в местных школах, и 40 добровольцев были выбраны с минимальным возрастом 16 лет. Добровольцам была выплачена компенсация в размере 10 евро в виде ваучера Amazon.
Сеансы проводились по модели дебат-клуба, предназначенной для поляризации мнений и вызова сильных реакций на провокационные темы, эффективно моделируя стресс, который может возникнуть в проблемных разговорах с клиентами по телефону.
Темы, на которые добровольцам пришлось говорить свободно в течение трех минут в публичном пространстве, были:
– Следует ли восстановить смертную казнь и публичные казни в Германии?
– Следует ли взимать плату за обучение в Германии?
– Следует ли легализовать использование тяжёлых наркотиков, таких как героин и кристаллический метамфетамин, в Германии?
– Следует ли запретить сети ресторанов, подают нездоровую быструю еду, такие как McDonald’s или Burger King, в Германии?
Предварительная обработка
Проект отдал предпочтение анализу акустических характеристик речи в подходе к автоматическому распознаванию речи (ASR) над подходом NLP (где речь анализируется на лингвистическом уровне, и «температура» дискурса выводится напрямую из использования языка).
Предварительно обработанные образцы были проанализированы сначала с помощью коэффициентов мел-частотной цепстральной обработки (MFCC), надёжного и популярного метода в анализе речи. Поскольку метод был впервые предложен в 1980 году, он заметно бережлив в отношении вычислительных ресурсов в плане распознавания повторяющихся закономерностей в речи и устойчив к различным уровням качества аудиозаписи. Поскольку сеансы проводились на платформах VOIP в условиях локдауна в декабре 2020 года, было важно иметь框架 записи, который мог бы учесть плохое качество аудио при необходимости.
Интересно отметить, что два вышеупомянутых технических ограничения (ограниченные ресурсы CPU в начале 1980-х годов и особенности подключения VOIP в контексте загруженной сети) объединяются здесь, чтобы создать то, что effectively является «технически скудной» моделью, которая, по-видимому, необычно устойчива в отсутствие идеальных условий и высокоуровневых ресурсов – имитируя целевую арену для полученного алгоритма.
Затем был применен алгоритм быстрого преобразования Фурье (FFT), чтобы обеспечить спектральный профиль каждого «аудио-кадра», прежде чем окончательное сопоставление с шкалой Мель.
Обучение, результаты и ограничения
Во время обучения извлеченные векторы особенностей передаются в слой свёрточной сети, расплющиваются и затем передаются в слой LSTM.

Архитектура процесса обучения для детектора лжи ИИ. Источник: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf
Наконец, все нейроны соединены друг с другом, чтобы сгенерировать бинарный прогноз о том, говорит ли говорящий правду или нет.
В тестах после обучения система достигла уровня точности до 98,91% в плане определения намерений (где высказанное содержание может не отражать намерение). Исследователи считают, что работа эмпирически демонстрирует определение убеждения на основе голосовых закономерностей и что это можно сделать без деконструкции языка в стиле NLP.
В плане ограничений исследователи признают, что выборка для тестирования мала. Хотя в работе это не указано явно, низкообъемные тестовые данные могут снизить позднюю применимость в случае, если предположения, архитектурные особенности и общий процесс обучения чрезмерно адаптированы к данным. В работе отмечается, что шесть из восьми моделей, созданных в ходе проекта, были переобучены на某мом этапе процесса обучения, и что есть дальнейшая работа, чтобы обобщить применимость параметров, заданных для модели.
Кроме того, исследования такого рода должны учитывать национальные характеристики, и в работе отмечается, что немецкие участники, участвовавшие в генерации данных, могут иметь закономерности общения, которые не могут быть напрямую воспроизведены в разных культурах – ситуация, которая, вероятно, возникнет в любом таком исследовании в любой стране.












