Ãngulo de Anderson
Um Detetor de Mentiras Baseado em IA para Conversas em Centros de Atendimento

Pesquisadores na Alemanha utilizaram aprendizado de mÃĄquina para criar um sistema de anÃĄlise de ÃĄudio destinado principalmente a atuar como um detetor de mentiras baseado em IA para clientes em comunicaçÃĩes de ÃĄudio com funcionÃĄrios de centros de atendimento e suporte.
O sistema utiliza um conjunto de dados especialmente criado de gravaçÃĩes de ÃĄudio por 40 estudantes e professores durante debates sobre temas controversos, incluindo a moralidade da pena de morte e taxas de matrÃcula. O modelo foi treinado em uma arquitetura que utiliza Redes Neurais Convolucionais (CNNs) e MemÃģria de Longo Prazo (LSTM), e alcançou uma taxa de precisÃĢo relatada de 98%.
Embora a intençÃĢo declarada do trabalho cite comunicaçÃĩes de clientes, os pesquisadores admitem que ele efetivamente opera como um detetor de mentiras de propÃģsito geral:
âOs resultados sÃĢo aplicÃĄveis a uma ampla gama de processos de serviço e especificamente Úteis para todas as interaçÃĩes de clientes que ocorrem via telefone. O algoritmo apresentado pode ser aplicado em qualquer situaçÃĢo em que seja Útil para o agente saber se um cliente estÃĄ falando com convicçÃĢo.
âIsso poderia, por exemplo, levar a uma reduçÃĢo de reclamaçÃĩes duvidosas de seguros, ou declaraçÃĩes falsas em entrevistas de emprego. Isso nÃĢo apenas reduziria perdas operacionais para empresas de serviços, mas tambÃĐm incentivaria os clientes a serem mais honestos.â
GeraçÃĢo do Conjunto de Dados
Na ausÊncia de um conjunto de dados pÚblicos adequado na lÃngua alemÃĢ, os pesquisadores â da Universidade de CiÊncias Aplicadas de Neu-Ulm (HNU) â criaram seu prÃģprio material de origem. Folhetos foram postados na universidade e em escolas locais, com 40 voluntÃĄrios selecionados com idade mÃnima de 16 anos. Os voluntÃĄrios foram pagos com um voucher de 10 euros da Amazon.
As sessÃĩes foram realizadas em um modelo de clube de debates projetado para polarizar opiniÃĩes e provocar respostas fortes em torno de tÃģpicos incendiÃĄrios, efetivamente modelando o estresse que pode ocorrer em conversas de clientes problemÃĄticas ao telefone.
Os tÃģpicos sobre os quais os voluntÃĄrios tiveram que falar livremente por trÊs minutos em pÚblico foram:
â A pena de morte e execuçÃĩes pÚblicas devem ser reintroduzidas na Alemanha?
â Devem ser cobradas taxas de matrÃcula que cubram os custos na Alemanha?
â O uso de drogas duras, como heroÃna e metanfetamina, deve ser legalizado na Alemanha?
â Cadeias de restaurantes que servem comida rÃĄpida nÃĢo saudÃĄvel, como McDonaldâs ou Burger King, devem ser proibidas na Alemanha?
PrÃĐ-Processamento
O projeto favoreceu a anÃĄlise de recursos de fala acÚstica em uma abordagem de Reconhecimento AutomÃĄtico de Fala (ASR) sobre uma abordagem de PLN (onde a fala ÃĐ analisada em um nÃvel linguÃstico, e a âtemperaturaâ do discurso ÃĐ inferida diretamente do uso da linguagem).
As amostras extraÃdas prÃĐ-processadas foram analisadas inicialmente por meio de Coeficientes Cepstrais de FrequÊncia de Mel (MFCCs), um mÃĐtodo confiÃĄvel e antigo ainda muito popular na anÃĄlise de fala. Desde que o mÃĐtodo foi proposto pela primeira vez em 1980, ÃĐ notavelmente frugal em termos de recursos de computaçÃĢo para reconhecer padrÃĩes recorrentes na fala, e ÃĐ resistente a vÃĄrios nÃveis de qualidade de captura de ÃĄudio. Como as sessÃĩes foram realizadas em plataformas de VOIP em condiçÃĩes de lockdown em dezembro de 2020, foi importante ter um quadro de gravaçÃĢo que pudesse levar em conta ÃĄudio de baixa qualidade quando necessÃĄrio.
à interessante notar que as duas limitaçÃĩes tÃĐcnicas mencionadas (recursos de CPU limitados nos anos 80 e as peculiaridades da conectividade VOIP em um contexto de rede congestionada) se combinam aqui para criar o que ÃĐ efetivamente um modelo âtecnicamente esparsamenteâ que ÃĐ (aparentemente) incomumente robusto na ausÊncia de condiçÃĩes de trabalho ideais e recursos de alto nÃvel â imitando o arena-alvo para o algoritmo resultante.
Em seguida, um algoritmo de Transformada RÃĄpida de Fourier (FFT) foi aplicado contra os segmentos de ÃĄudio para fornecer um perfil espectral de cada âquadro de ÃĄudioâ, antes do mapeamento final para a Escala de Mel.
Treinamento, Resultados e LimitaçÃĩes
Durante o treinamento, os vetores de recursos extraÃdos sÃĢo passados para uma camada de rede convolucional distribuÃda no tempo, achatados e, em seguida, passados para uma camada LSTM.

Arquitetura do processo de treinamento do detetor de mentiras de IA. Fonte: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf
Finalmente, todos os neurÃīnios sÃĢo conectados uns aos outros para gerar uma previsÃĢo binÃĄria de se o falante estÃĄ dizendo coisas que acredita serem verdadeiras.
Nos testes apÃģs o treinamento, o sistema alcançou um nÃvel de precisÃĢo de atÃĐ 98,91% em termos de discernimento de intençÃĢo (onde o conteÚdo falado pode nÃĢo refletir a intençÃĢo). Os pesquisadores consideram que o trabalho demonstra empiricamente a identificaçÃĢo de convicçÃĢo com base em padrÃĩes de voz, e que isso pode ser alcançado sem a desconstruçÃĢo de linguagem no estilo PLN.
Em termos de limitaçÃĩes, os pesquisadores admitem que a amostra de teste ÃĐ pequena. Embora o artigo nÃĢo afirme explicitamente, dados de teste de baixo volume podem reduzir a aplicabilidade posterior no evento de que as suposiçÃĩes, recursos arquitetados e o processo de treinamento geral sejam superajustados aos dados. O artigo observa que seis dos oito modelos construÃdos durante o projeto foram superajustados em algum ponto do processo de aprendizado, e que hÃĄ mais trabalho a ser feito na generalizaçÃĢo da aplicabilidade dos parÃĒmetros definidos para o modelo.
AlÃĐm disso, a pesquisa deste tipo deve levar em conta as caracterÃsticas nacionais, e o artigo observa que os sujeitos alemÃĢes envolvidos na geraçÃĢo dos dados podem ter padrÃĩes de comunicaçÃĢo que nÃĢo sÃĢo diretamente replicÃĄveis entre culturas â uma situaçÃĢo que provavelmente surgiria em qualquer estudo desse tipo em qualquer naçÃĢo.












