Ángulo de Anderson

Un detector de mentiras basado en IA para conversaciones en centros de llamadas

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Investigadores en Alemania han utilizado el aprendizaje automÃĄtico para crear un sistema de anÃĄlisis de audio destinado principalmente a actuar como un detector de mentiras basado en IA para clientes en comunicaciones de audio con personal de centros de llamadas y soporte.

El sistema utiliza un conjunto de datos de audio creado especialmente con grabaciones de audio de 40 estudiantes y profesores durante debates sobre temas controvertidos, incluida la moralidad de la pena de muerte y las tasas de matrícula. El modelo se entrenÃģ en una arquitectura que utiliza Redes Neuronales Convolucionales (CNN) y Memoria a Corto Plazo (LSTM), y logrÃģ una tasa de precisiÃģn del 98%.

Aunque la intenciÃģn declarada del trabajo cita la comunicaciÃģn con los clientes, los investigadores admiten que efectivamente opera como un detector de mentiras de propÃģsito general:

‘Los hallazgos son aplicables a una amplia gama de procesos de servicio y específicamente Útiles para todas las interacciones con clientes que tienen lugar a travÃĐs del telÃĐfono. El algoritmo presentado se puede aplicar en cualquier situaciÃģn en la que sea Útil para el agente saber si un cliente estÃĄ hablando con convicciÃģn.

‘Esto podría, por ejemplo, llevar a una reducciÃģn de reclamaciones de seguros dudosas o declaraciones falsas en entrevistas de trabajo. Esto no solo reduciría las pÃĐrdidas operativas para las empresas de servicios, sino que tambiÃĐn alentaría a los clientes a ser mÃĄs honestos.’

GeneraciÃģn del conjunto de datos

En ausencia de un conjunto de datos pÚblico adecuado en alemÃĄn, los investigadores – de la Universidad de Ciencias Aplicadas de Neu-Ulm (HNU) – crearon su propio material de origen. Se publicaron folletos en la universidad y en escuelas locales, y se seleccionaron 40 voluntarios con una edad mínima de 16 aÃąos. Los voluntarios recibieron un vale de 10 euros de Amazon.

Las sesiones se llevaron a cabo segÚn un modelo de club de debate diseÃąado para polarizar la opiniÃģn y provocar respuestas fuertes alrededor de temas incendiarios, efectivamente modelando el estrÃĐs que puede ocurrir en conversaciones problemÃĄticas de clientes por telÃĐfono.

Los temas sobre los que los voluntarios tenían que hablar libremente durante tres minutos en pÚblico fueron:

– ÂŋDeberían reintroducirse la pena de muerte y las ejecuciones pÚblicas en Alemania?
– ÂŋDeberían cobrarse tasas de matrícula que cubran los costos en Alemania?
– ÂŋDebería legalizarse el uso de drogas duras como la heroína y el cristal de metanfetamina en Alemania?
– ÂŋDeberían prohibirse las cadenas de restaurantes que sirven comida rÃĄpida insalubre, como McDonald’s o Burger King, en Alemania?

Preprocesamiento

El proyecto favoreciÃģ el anÃĄlisis de características de habla acÚstica en un enfoque de Reconocimiento AutomÃĄtico del Habla (ASR) sobre un enfoque de NLP (donde se analiza el habla a nivel lingÞístico, y se infiere la “temperatura” del discurso directamente del uso del lenguaje).

Las muestras extraídas y preprocesadas se analizaron inicialmente a travÃĐs de Coeficientes Cepstrales de Frecuencia de Mel (MFCC), un mÃĐtodo antiguo pero fiable que sigue siendo muy popular en el anÃĄlisis del habla. Dado que el mÃĐtodo se propuso por primera vez en 1980, es notablemente frugal en tÃĐrminos de recursos de computaciÃģn para reconocer patrones recurrentes en el habla, y es resistente a varios niveles de calidad de captura de audio. Debido a que las sesiones se llevaron a cabo en plataformas de VOIP en condiciones de bloqueo en diciembre de 2020, fue importante tener un marco de grabaciÃģn que pudiera tener en cuenta la mala calidad del audio cuando fuera necesario.

Es interesante destacar que las dos limitaciones tÃĐcnicas mencionadas (recursos de CPU limitados a principios de la dÃĐcada de 1980 y las excentricidades de la conectividad de VOIP en un contexto de red congestionada) se combinan aquí para crear lo que es efectivamente un modelo “tÃĐcnicamente escaso” que es (aparentemente) inusualmente robusto en ausencia de condiciones de trabajo ideales y recursos de alto nivel – imitando el ÃĄmbito objetivo para el algoritmo resultante.

Posteriormente, se aplicÃģ un algoritmo de Transformada RÃĄpida de Fourier (FFT) a los segmentos de audio para suministrar un perfil espectral de cada “marco de audio”, antes de asignar finalmente a la Escala de Mel.

Entrenamiento, Resultados y Limitaciones

Durante el entrenamiento, los vectores de características extraídos se pasan a una capa de red neuronal convolucional distribuida en el tiempo, se aplanan y luego se pasan a una capa de LSTM.

Arquitectura del proceso de entrenamiento para el detector de verdad de IA. Fuente: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

Arquitectura del proceso de entrenamiento para el detector de verdad de IA. Fuente: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

Finalmente, todos los neuronas estÃĄn conectados entre sí para generar una predicciÃģn binaria sobre si el hablante estÃĄ diciendo cosas que cree que son verdaderas.

En pruebas despuÃĐs del entrenamiento, el sistema logrÃģ un nivel de precisiÃģn de hasta el 98,91% en tÃĐrminos de discernimiento de la intenciÃģn (donde el contenido hablado puede no reflejar la intenciÃģn). Los investigadores consideran que el trabajo demuestra empíricamente la identificaciÃģn de la convicciÃģn basada en patrones de voz, y que esto se puede lograr sin descomposiciÃģn de lenguaje al estilo de NLP.

En cuanto a las limitaciones, los investigadores admiten que la muestra de prueba es pequeÃąa. Aunque el documento no lo establece explícitamente, los datos de prueba de bajo volumen pueden reducir la aplicabilidad posterior en el caso de que las suposiciones, las características arquitectÃģnicas y el proceso de entrenamiento general estÃĐn sobreajustados a los datos. El documento seÃąala que seis de los ocho modelos construidos a lo largo del proyecto estaban sobreajustados en algÚn momento del proceso de aprendizaje, y que hay mÃĄs trabajo por hacer para generalizar la aplicabilidad de los parÃĄmetros establecidos para el modelo.

AdemÃĄs, la investigaciÃģn de este tipo debe tener en cuenta las características nacionales, y el documento seÃąala que los sujetos alemanes involucrados en la generaciÃģn de los datos pueden tener patrones de comunicaciÃģn que no son directamente replicables en diferentes culturas – una situaciÃģn que probablemente surgiría en cualquier estudio de este tipo en cualquier naciÃģn.

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]