Ãngulo de Anderson
Un detector de mentiras basado en IA para conversaciones en centros de llamadas

Investigadores en Alemania han utilizado el aprendizaje automÃĄtico para crear un sistema de anÃĄlisis de audio destinado principalmente a actuar como un detector de mentiras basado en IA para clientes en comunicaciones de audio con personal de centros de llamadas y soporte.
El sistema utiliza un conjunto de datos de audio creado especialmente con grabaciones de audio de 40 estudiantes y profesores durante debates sobre temas controvertidos, incluida la moralidad de la pena de muerte y las tasas de matrÃcula. El modelo se entrenÃģ en una arquitectura que utiliza Redes Neuronales Convolucionales (CNN) y Memoria a Corto Plazo (LSTM), y logrÃģ una tasa de precisiÃģn del 98%.
Aunque la intenciÃģn declarada del trabajo cita la comunicaciÃģn con los clientes, los investigadores admiten que efectivamente opera como un detector de mentiras de propÃģsito general:
âLos hallazgos son aplicables a una amplia gama de procesos de servicio y especÃficamente Útiles para todas las interacciones con clientes que tienen lugar a travÃĐs del telÃĐfono. El algoritmo presentado se puede aplicar en cualquier situaciÃģn en la que sea Útil para el agente saber si un cliente estÃĄ hablando con convicciÃģn.
âEsto podrÃa, por ejemplo, llevar a una reducciÃģn de reclamaciones de seguros dudosas o declaraciones falsas en entrevistas de trabajo. Esto no solo reducirÃa las pÃĐrdidas operativas para las empresas de servicios, sino que tambiÃĐn alentarÃa a los clientes a ser mÃĄs honestos.â
GeneraciÃģn del conjunto de datos
En ausencia de un conjunto de datos pÚblico adecuado en alemÃĄn, los investigadores â de la Universidad de Ciencias Aplicadas de Neu-Ulm (HNU) â crearon su propio material de origen. Se publicaron folletos en la universidad y en escuelas locales, y se seleccionaron 40 voluntarios con una edad mÃnima de 16 aÃąos. Los voluntarios recibieron un vale de 10 euros de Amazon.
Las sesiones se llevaron a cabo segÚn un modelo de club de debate diseÃąado para polarizar la opiniÃģn y provocar respuestas fuertes alrededor de temas incendiarios, efectivamente modelando el estrÃĐs que puede ocurrir en conversaciones problemÃĄticas de clientes por telÃĐfono.
Los temas sobre los que los voluntarios tenÃan que hablar libremente durante tres minutos en pÚblico fueron:
â ÂŋDeberÃan reintroducirse la pena de muerte y las ejecuciones pÚblicas en Alemania?
â ÂŋDeberÃan cobrarse tasas de matrÃcula que cubran los costos en Alemania?
â ÂŋDeberÃa legalizarse el uso de drogas duras como la heroÃna y el cristal de metanfetamina en Alemania?
â ÂŋDeberÃan prohibirse las cadenas de restaurantes que sirven comida rÃĄpida insalubre, como McDonaldâs o Burger King, en Alemania?
Preprocesamiento
El proyecto favoreciÃģ el anÃĄlisis de caracterÃsticas de habla acÚstica en un enfoque de Reconocimiento AutomÃĄtico del Habla (ASR) sobre un enfoque de NLP (donde se analiza el habla a nivel lingÞÃstico, y se infiere la âtemperaturaâ del discurso directamente del uso del lenguaje).
Las muestras extraÃdas y preprocesadas se analizaron inicialmente a travÃĐs de Coeficientes Cepstrales de Frecuencia de Mel (MFCC), un mÃĐtodo antiguo pero fiable que sigue siendo muy popular en el anÃĄlisis del habla. Dado que el mÃĐtodo se propuso por primera vez en 1980, es notablemente frugal en tÃĐrminos de recursos de computaciÃģn para reconocer patrones recurrentes en el habla, y es resistente a varios niveles de calidad de captura de audio. Debido a que las sesiones se llevaron a cabo en plataformas de VOIP en condiciones de bloqueo en diciembre de 2020, fue importante tener un marco de grabaciÃģn que pudiera tener en cuenta la mala calidad del audio cuando fuera necesario.
Es interesante destacar que las dos limitaciones tÃĐcnicas mencionadas (recursos de CPU limitados a principios de la dÃĐcada de 1980 y las excentricidades de la conectividad de VOIP en un contexto de red congestionada) se combinan aquà para crear lo que es efectivamente un modelo âtÃĐcnicamente escasoâ que es (aparentemente) inusualmente robusto en ausencia de condiciones de trabajo ideales y recursos de alto nivel â imitando el ÃĄmbito objetivo para el algoritmo resultante.
Posteriormente, se aplicÃģ un algoritmo de Transformada RÃĄpida de Fourier (FFT) a los segmentos de audio para suministrar un perfil espectral de cada âmarco de audioâ, antes de asignar finalmente a la Escala de Mel.
Entrenamiento, Resultados y Limitaciones
Durante el entrenamiento, los vectores de caracterÃsticas extraÃdos se pasan a una capa de red neuronal convolucional distribuida en el tiempo, se aplanan y luego se pasan a una capa de LSTM.

Arquitectura del proceso de entrenamiento para el detector de verdad de IA. Fuente: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf
Finalmente, todos los neuronas estÃĄn conectados entre sà para generar una predicciÃģn binaria sobre si el hablante estÃĄ diciendo cosas que cree que son verdaderas.
En pruebas despuÃĐs del entrenamiento, el sistema logrÃģ un nivel de precisiÃģn de hasta el 98,91% en tÃĐrminos de discernimiento de la intenciÃģn (donde el contenido hablado puede no reflejar la intenciÃģn). Los investigadores consideran que el trabajo demuestra empÃricamente la identificaciÃģn de la convicciÃģn basada en patrones de voz, y que esto se puede lograr sin descomposiciÃģn de lenguaje al estilo de NLP.
En cuanto a las limitaciones, los investigadores admiten que la muestra de prueba es pequeÃąa. Aunque el documento no lo establece explÃcitamente, los datos de prueba de bajo volumen pueden reducir la aplicabilidad posterior en el caso de que las suposiciones, las caracterÃsticas arquitectÃģnicas y el proceso de entrenamiento general estÃĐn sobreajustados a los datos. El documento seÃąala que seis de los ocho modelos construidos a lo largo del proyecto estaban sobreajustados en algÚn momento del proceso de aprendizaje, y que hay mÃĄs trabajo por hacer para generalizar la aplicabilidad de los parÃĄmetros establecidos para el modelo.
AdemÃĄs, la investigaciÃģn de este tipo debe tener en cuenta las caracterÃsticas nacionales, y el documento seÃąala que los sujetos alemanes involucrados en la generaciÃģn de los datos pueden tener patrones de comunicaciÃģn que no son directamente replicables en diferentes culturas â una situaciÃģn que probablemente surgirÃa en cualquier estudio de este tipo en cualquier naciÃģn.












