Погляд Anderson
Розробка системи виявлення брехні на основі штучного інтелекту для розмов у центрах обслуговування клієнтів

Дослідники в Німеччині використали машинне навчання для створення системи аналізу аудіо, призначеної в основному для виявлення брехні клієнтів під час аудіо-комунікацій з персоналом центрів обслуговування та підтримки.
Система використовує спеціально створену базу даних аудіозаписів 40 студентів і викладачів під час дебатів на спірних темах, включаючи моральність смертної кари та плати за навчання. Модель була навчена на архітектурі, яка використовує卷неві нейронні мережі (CNN) і довгострокову пам’ять (LSTM), і досягла заявленої точності 98%.
Хоча заявлена мета роботи цитує комунікації клієнтів, дослідники погоджуються, що вона ефективно діє як загальна система виявлення брехні:
‘Результати застосовні до широкого спектру сервісних процесів і особливо корисні для всіх взаємодій клієнтів, які відбуваються через телефон. Алгоритм, представлений у цій роботі, можна застосовувати в будь-якій ситуації, коли агенту потрібно знати, чи говорить клієнт переконливо.
‘Це, наприклад, може привести до зменшення сумнівних страхових претензій або нечесних заяв під час робочих інтерв’ю. Це не тільки зменшить операційні втрати для сервісних компаній, але й заохотить клієнтів бути більш чесними.’
Генерація бази даних
Відсутність підходящої публічно доступної бази даних німецькою мовою змусила дослідників – з університету прикладних наук Ной-Ульма (HNU) – створити власний матеріал. Плакати були розміщені в університеті та місцевих школах, і 40 добровольців були обрані з мінімальним віком 16 років. Добровольцям було заплачено 10 євро за Amazon-ваучер.
Сесії проводилися за моделлю дебатного клубу, призначеного для поляризації думок і викликання сильних реакцій на спірні теми, ефективно моделюючи стрес, який може виникнути під час проблемних розмов клієнтів по телефону.
Теми, на яких добровольці мали вільно говорити три хвилини на публіці, були:
– Чи слід відновити смертну кару та публічні страти в Німеччині?
– Чи слід вводити оплату за навчання в Німеччині?
– Чи слід легалізувати використання важких наркотиків, таких як героїн і кристалічний мет, в Німеччині?
– Чи слід заборонити ресторани швидкого харчування, такі як McDonald’s або Burger King, в Німеччині?
Попередня обробка
Проект віддав перевагу аналізу акустичних ознак мови в підході автоматичного розпізнавання мови (ASR) над підходом NLP (де мова аналізується на лінгвістичному рівні, і “температура” дискурсу виводиться безпосередньо з використання мови).
Передбачені зразки були спочатку проаналізовані за допомогою коефіцієнтів Мел-фреквенції (MFCC), надійного старого методу, який все ще дуже популярний у сфері аналізу мови. Оскільки метод був запропонований у 1980 році, він досить ощадливий щодо обчислювальних ресурсів при розпізнаванні повторюваних закономірностей у мові і стійкий до різних рівнів якості аудіозапису. Через те, що сесії проводилися через платформи VOIP у грудні 2020 року, було важливо мати рамку запису, яка могла б враховувати погану якість аудіо при необхідності.
Цікаво відзначити, що дві вищезгадані технічні обмеження (обмежені ресурси процесора на початку 1980-х років і особливості підключення VOIP у завантаженій мережевій ситуації) тут поєднуються, створюючи ефективно “технічно розріджену” модель, яка (очевидно) незвично стійка у відсутності ідеальних робочих умов і високорівневих ресурсів – імітуючи цільову арену для отриманого алгоритму.
Потім алгоритм швидкої Фур’є-перетворення (FFT) був застосований до аудіо-сегментів, щоб забезпечити спектральний профіль кожного “аудіо-kadru”, перед остаточним відображенням на шкалу Мель.
Навчання, результати та обмеження
Під час навчання витягнуті вектори ознак подаються до часово-розподіленого шару зворотного зв’язку, розплющуються, а потім подаються до шару LSTM.

Архітектура процесу навчання системи виявлення брехні на основі штучного інтелекту. Джерело: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf
Нарешті, всі нейрони з’єднані один з одним, щоб генерувати двійкове передбачення щодо того, чи говорить мовець правду.
У тестах після навчання система досягла рівня точності до 98,91% щодо визначення намірів (де висловлювана інформація може не відображати намір). Дослідники вважають, що робота емпірично демонструє ідентифікацію переконань на основі голосових патернів і що це можна зробити без розбору мови у стилі NLP.
Що стосується обмежень, дослідники погоджуються, що вибірка тестів мала обмежений розмір. Хоча робота не містить явного зазначення цього, низький об’єм тестових даних може зменшити пізню застосовність у разі, якщо припущення, архітектурні особливості та загальний процес навчання надмірно підходять до даних. У роботі зазначається, що шість із восьми моделей, створених протягом проекту, мали надмірне підлаштування на певному етапі процесу навчання, і що подальша робота потрібна для узагальнення застосовності встановлених параметрів моделі.
Крім того, дослідження такого роду повинно враховувати національні характеристики, і у роботі зазначається, що німецькі учасники, які брали участь у створенні даних, можуть мати комунікаційні патерни, які не можуть бути безпосередньо повторені в інших культурах – ситуація, яка, ймовірно, виникне в будь-якому подібному дослідженні в будь-якій країні.












