Anderson의 관점
콜센터 대화에 대한 AI 기반 거짓말 탐지기

독일의 연구자들은 기계 학습을 사용하여 오디오 분석 시스템을 만들었으며, 이는 주로 콜센터 및 지원 직원과 오디오 통신에 있는 고객을 위한 AI 기반 거짓말 탐지기로 작동하도록 설계되었습니다.
시스템은 특히 제작된 데이터 세트를 사용하며, 이는 40명의 학생과 교사들이 논쟁적인 주제에 대한 토론을 통해 오디오 녹음을 생성했습니다. 이러한 주제에는 독일에서 사형과 공공 처형의 도덕성, 그리고 학费가 포함되었습니다. 모델은 Convolutional Neural Networks (CNNs)와 Long Short-Term Memory (LSTM)를 사용하는 아키텍처에서 훈련되었으며, 98%의 정확도율을 달성했습니다.
연구자들은 고객 통신을 위한 시스템을 만들었다고 말하지만, 사실상 일반적인 거짓말 탐지기로 작동한다는 것을 인정합니다.
‘이 발견은 다양한 서비스 프로세스에 적용할 수 있으며, 특히 전화로 이루어지는 모든 고객 상호작용에 유용합니다. 제시된 알고리즘은 에이전트가 고객이 자신의 신념에 따라 말하고 있는지 여부를 알기 유용한 모든 상황에서 적용할 수 있습니다.
‘예를 들어, 이것은 의심스러운 보험 청구나 면접에서 거짓말을 줄일 수 있습니다. 이것은 서비스 회사들의 운영 손실을 줄일 뿐만 아니라 고객이 더 진실하게 말하도록鼓励할 것입니다.’
데이터 생성
독일어로 된 적절한 공개 데이터 세트가 없기 때문에, 연구자들은 – Neu-Ulm 응용 과학 대학(HNU)에서 -自己的 소스 자료를 만들었습니다. 대학과 지역 학교에 전단지를 게시하여, 최소 16세의 40명의 자원자를 선정했습니다. 자원자들은 10 유로의 아마존 바우처를 받았습니다.
세션은 논쟁 클럽 모델로 설계되었으며, 강한 반응을 일으키는 논쟁적인 주제에 대한 토론을 통해 고객과의 문제가 있는 전화 통화에서 발생할 수 있는 스트레스를 모델링했습니다.
자원자들이 3분 동안 공개적으로 말해야 했던 주제는 다음과 같습니다.
– 독일에서 사형과 공공 처형을 재도입해야 하는가?
– 독일에서 학费를 청구해야 하는가?
– 독일에서 헤로인이나 크리스탈 메스와 같은 강력한 마약의 사용을 합법화해야 하는가?
– 맥도날드나 버거킹과 같은 건강에 해로운 패스트 푸드를 제공하는 레스토랑 체인을 금지해야 하는가?
전처리
이 프로젝트는 언어의 ‘온도’를 직접 언어 사용에서 추론하는 NLP 접근법보다 음성의 음향 특징을 분석하는 자동 음성 인식(ASR) 접근법을 선호했습니다.
전처리된 추출된 샘플은最初에 Mel-frequency Cepstral Coefficients (MFCCs)를 통해 분석되었습니다. 이는 1980년에 처음 제안된 방법으로, 음성 분석에서 여전히 널리 사용되며, 음성의 반복되는 패턴을 인식하는 데 컴퓨팅 자원을 효율적으로 사용하며, 다양한 수준의 오디오 캡처 품질에 강합니다. 2020년 12월에 잠금 상태에서 VOIP 플랫폼을 통해 세션이 수행되었기 때문에, 필요한 경우 저품질 오디오에도 대응할 수 있는 녹음 프레임워크가 중요했습니다.
흥미롭게도, 두 가지 기술적 제한 사항(1980년대 초의 제한된 CPU 자원과 2020년 12월의 VOIP 연결의 특이성)은 여기에서 결합되어, 사실상 ‘기술적으로 희박한’ 모델을 생성하며, 이상적인 작업 조건과 고급 자원이 없는 경우에도异常으로 강력합니다 – 목표 환경을 모방합니다.
그 후, Fast Fourier Transform (FFT) 알고리즘이 오디오 세그먼트에 적용되어 각 ‘오디오 프레임’의 스펙트럼 프로파일을 제공한 후, 최종적으로 Mel 스케일에 매핑되었습니다.
훈련, 결과 및 제한
훈련 중에, 추출된 특징 벡터는 시간 분산 컨볼루션 네트워크 계층에 전달되며, 평탄화된 후 LSTM 계층에 전달됩니다.

AI 진실 탐지기의 훈련 프로세스 아키텍처. 출처: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf
마지막으로, 모든 뉴런이 연결되어 발화자가 진실된 것으로 믿는 것을 말하고 있는지 여부를 예측하기 위해 이진 예측을 생성합니다.
훈련 후 테스트에서, 시스템은 의도 판별에서 최대 98.91%의 정확도 수준을 달성했습니다(발화된 내용이 실제 의도와 일치하지 않을 수 있음). 연구자들은 이 작업이 음성 패턴에 기반한 신념 식별을 경험적으로 입증하며, 이는 언어의 NLP 스타일 해체 없이 달성될 수 있다고 주장합니다.
제한 사항으로, 연구자들은 테스트 샘플이 작다는 것을 인정합니다. 문서에는 명시적으로 언급되어 있지 않지만, 낮은 볼륨의 테스트 데이터는 나중에 적용 가능성이 감소할 수 있습니다. 문서에는 또한 8개의 모델 중 6개가 학습 과정에서 어느 시점에 과적합되었다고 언급하며, 모델의 매개변수를 일반화하는 데 더 많은 작업이 필요하다고 언급합니다.
또한, 이러한 연구는 국가적 특성을 고려해야 하며, 데이터 생성에 참여한 독일인 주제들의 의사 소통 패턴이 다른 문화에서 직접 복제할 수 없는 상황이 발생할 수 있으며, 이러한 연구에서 일반적으로 발생할 수 있는 상황입니다.












