Kąt Andersona
Wykrywacz kłamstw oparty na sztucznej inteligencji dla rozmów w centrach kontaktowych

Naukowcy z Niemiec wykorzystali uczenie maszynowe do stworzenia systemu analizy audio, który ma działać jako wykrywacz kłamstw oparty na sztucznej inteligencji dla klientów w komunikacji audio z personelem centrum kontaktowego i wsparcia.
System wykorzystuje specjalnie stworzony zestaw nagrań audio przez 40 studentów i nauczycieli podczas debat na kontrowersyjne tematy, w tym moralność kary śmierci i opłat za naukę. Model został opracowany na architekturze, która wykorzystuje sieci neuronowe typu Convolutional Neural Networks (CNN) i Long Short-Term Memory (LSTM), i osiągnął zgłoszoną dokładność 98%.
Chociaż deklarowanym celem pracy jest komunikacja z klientami, naukowcy przyznają, że system działa skutecznie jako ogólny wykrywacz kłamstw:
‘Wyniki są stosowane do szerokiego zakresu procesów usługowych i są szczególnie przydatne dla wszystkich interakcji z klientami, które odbywają się przez telefon. Algorytm przedstawiony może być stosowany w każdej sytuacji, w której jest pomocne dla agenta, aby wiedzieć, czy klient mówi z przekonaniem.
‘Mogłoby to, na przykład, doprowadzić do redukcji wątpliwych roszczeń ubezpieczeniowych lub nieprawdziwych oświadczeń w rozmowach kwalifikacyjnych. Nie tylko zmniejszyłoby to straty operacyjne dla firm usługowych, ale także zachęciłoby klientów do większej prawdomówności.’
Generowanie zbioru danych
Wobec braku odpowiedniego, publicznie dostępnego zestawu danych w języku niemieckim, naukowcy – z Neu-Ulm University of Applied Sciences (HNU) – stworzyli własny materiał źródłowy. Plakaty były rozstawione na uczelni i w lokalnych szkołach, a 40 wolontariuszy zostało wybranych z minimalnym wiekiem 16 lat. Wolontariusze otrzymali voucher o wartości 10 euro od Amazon.
Sesje były prowadzone w modelu klubu debat, który miał na celu polaryzować opinię i wywołać silne reakcje wokół kontrowersyjnych tematów, efektywnie modelując stres, jaki może wystąpić w problematycznych rozmowach z klientami przez telefon.
Tematy, na które wolontariusze musieli mówić swobodnie przez trzy minuty na forum publicznym, to:
– Czy kara śmierci i egzekucje publiczne powinny zostać ponownie wprowadzone w Niemczech?
– Czy opłaty za naukę powinny być pobierane w Niemczech?
– Czy używanie twardych narkotyków, takich jak heroina i metamfetamina, powinno zostać zalegalizowane w Niemczech?
– Czy sieci restauracyjne serwujące niezdrowe fast food, takie jak McDonald’s lub Burger King, powinny zostać zabronione w Niemczech?
Przetwarzanie wstępne
Projekt faworyzował analizę cech mowy akustycznej w podejściu Automatic Speech Recognition (ASR) zamiast podejścia NLP (gdzie mowa jest analizowana na poziomie językowym, a “temperatura” dyskursu jest wnioskowana bezpośrednio z użycia języka).
Przetworzone próbki były analizowane początkowo za pomocą Mel-frequency Cepstral Coefficients (MFCCs), niezawodnej, starszej metody, która jest nadal bardzo popularna w analizie mowy. Ponieważ metoda ta została po raz pierwszy przedstawiona w 1980 roku, jest zauważalnie oszczędna pod względem zasobów obliczeniowych w zakresie rozpoznawania powtarzających się wzorców w mowie i jest odporna na różne poziomy jakości nagrywania audio. Ponieważ sesje były prowadzone na platformach VOIP w warunkach lockdownu w grudniu 2020 roku, było ważne, aby mieć ramy nagrywania, które mogłyby uwzględnić słabą jakość audio, gdy było to konieczne.
Interesujące jest to, że dwie wymienione powyżej ograniczenia techniczne (ograniczone zasoby CPU w latach 80. i ekscentryczność połączeń VOIP w zatłoczonym kontekście sieci) łączą się tutaj, tworząc coś, co skutecznie jest “technicznie rzadkim” modelem, który jest (wydaje się) niezwykle wytrzymałym w przypadku braku idealnych warunków pracy i wysokopoziomowych zasobów – naśladując docelowy obszar dla wynikającego algorytmu.
Następnie zastosowano algorytm Fast Fourier Transform (FFT) do dostarczenia profilu widmowego każdego “ramienia audio”, przed ostatecznym mapowaniem na skalę Mel.
Szkolenie, wyniki i ograniczenia
Podczas szkolenia, wyodrębnione wektory cech są przekazywane do warstwy sieci neuronowej czasowo-rozłożonej, spłaszczane, a następnie przekazywane do warstwy LSTM.

Architektura procesu szkolenia dla detektora prawdy AI. Źródło: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf
Ostatecznie wszystkie neurony są połączone ze sobą w celu wygenerowania binarnej predykcji, czy mówca mówi rzeczy, które uważa za prawdziwe.
W testach po szkoleniu system osiągnął poziom dokładności do 98,91% w zakresie rozróżniania intencji (gdzie zawartość mowy może nie odzwierciedlać intencji). Naukowcy uważają, że praca empirycznie demonstruje identyfikację przekonania na podstawie wzorców głosowych i że można to osiągnąć bez dekonstrukcji języka w stylu NLP.
Jeśli chodzi o ograniczenia, naukowcy przyznają, że próbka testowa jest mała. Chociaż praca nie stwierdza tego wyraźnie, niski poziom danych testowych może zmniejszyć późniejszą stosowalność w przypadku, gdy założenia, zaprojektowane cechy i ogólny proces szkolenia są przystosowane do danych. Praca zauważa, że sześć z ośmiu modeli opracowanych w trakcie projektu było przystosowanych w pewnym momencie procesu uczenia, i że jest więcej pracy do wykonania w celu uogólnienia stosowalności parametrów ustawionych dla modelu.
Dalej, badania tego rodzaju muszą uwzględniać cechy narodowe, a praca zauważa, że niemieccy uczestnicy zaangażowani w generowanie danych mogą mieć wzorce komunikacji, które nie są bezpośrednio powtarzalne w różnych kulturach – sytuacja, która prawdopodobnie wystąpi w każdym takim badaniu w każdym kraju.












