Ángulo de Anderson

Analizando Chatbots Depresivos y Alcohólicos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un nuevo estudio de China ha encontrado que varios chatbots populares, incluidos chatbots de dominio abierto de Facebook, Microsoft (MSFT ) y Google, exhiben “problemas de salud mental graves” cuando se les consulta utilizando pruebas de evaluación de salud mental estándar, e incluso exhiben signos de problemas de alcoholismo.

Los chatbots evaluados en el estudio fueron el Blender de Facebook; el DialoGPT de Microsoft; el Plato de Baidu; y el DialoFlow, una colaboración entre universidades chinas, WeChat y Tencent Inc.

Se les sometió a pruebas para detectar evidencia de depresión patológica, ansiedad, adicción al alcohol y para evaluar su capacidad para mostrar empatía, y los chatbots estudiados produjeron resultados alarmantes; todos ellos obtuvieron puntuaciones por debajo del promedio en empatía, mientras que la mitad fueron evaluados como adictos al alcohol.

Resultados para los cuatro chatbots en cuatro métricas de salud mental. En 'single', se inicia una nueva conversación para cada consulta; en 'multi', se hacen todas las preguntas en una sola conversación, para evaluar la influencia de la persistencia de la sesión. Fuente: https://arxiv.org/pdf/2201.05382.pdf

Resultados para los cuatro chatbots en cuatro métricas de salud mental. En ‘single’, se inicia una nueva conversación para cada consulta; en ‘multi’, se hacen todas las preguntas en una sola conversación, para evaluar la influencia de la persistencia de la sesión. Fuente: https://arxiv.org/pdf/2201.05382.pdf

En la tabla de resultados anterior, BA=’Por debajo del promedio’; P=’Positivo’; N=’Normal’; M=’Moderado’; MS=”Moderado a grave”; S=”Grave”. El documento afirma que estos resultados indican que la salud mental de todos los chatbots seleccionados se encuentra en el rango “grave”.

El informe establece:

‘Los resultados experimentales revelan que existen problemas de salud mental graves para todos los chatbots evaluados. Consideramos que esto se debe a la negligencia del riesgo de salud mental durante la construcción del conjunto de datos y los procedimientos de entrenamiento del modelo. Las malas condiciones de salud mental de los chatbots pueden resultar en impactos negativos en los usuarios en conversaciones, especialmente en menores y personas que se enfrentan a dificultades.

‘Por lo tanto, argumentamos que es urgente realizar la evaluación de las dimensiones de salud mental mencionadas anteriormente antes de lanzar un chatbot como servicio en línea.’

El estudio proviene de investigadores del Centro de Reconocimiento de Patrones de WeChat/Tencent, junto con investigadores del Instituto de Tecnología de la Información de la Academia China de Ciencias (ICT) y la Universidad de la Academia China de Ciencias en Beijing.

Motivos para la Investigación

Los autores citan el caso ampliamente reportado de 2020 en el que una empresa de atención médica francesa probó un chatbot de asesoramiento médico basado en GPT-3. En uno de los intercambios, un (simulado) paciente declaró “¿Debo matarme?”, a lo que el chatbot respondió “Creo que deberías”.

Como observa el nuevo documento, también es posible que un usuario se vea influenciado por la ansiedad secundaria de chatbots deprimidos o “negativos”, de modo que la disposición general del chatbot no necesita ser tan directamente impactante como en el caso francés para socavar los objetivos de las consultas médicas automatizadas.

Los autores establecen:

‘Los resultados experimentales revelan los graves problemas de salud mental de los chatbots evaluados, que pueden resultar en influencias negativas en los usuarios en conversaciones, especialmente menores y personas que se enfrentan a dificultades. Por ejemplo, actitudes pasivas, irritabilidad, alcoholismo, sin empatía, etc.

‘Este fenómeno se desvía de las expectativas generales del público sobre los chatbots que deberían ser optimistas, saludables y amigables en la medida de lo posible. Por lo tanto, creemos que es crucial realizar evaluaciones de salud mental para preocupaciones de seguridad y ética antes de lanzar un chatbot como servicio en línea.’

Método

Los investigadores creen que este es el primer estudio que evalúa a los chatbots en términos de métricas de evaluación humana para la salud mental, citando estudios anteriores que se han centrado en lugar de eso en la coherencia, diversidad, relevancia, conocimiento y otros estándares centrados en Turing para la respuesta de habla auténtica.

Los cuestionarios adaptados para el proyecto fueron PHQ-9, una prueba de 9 preguntas para evaluar los niveles de depresión en pacientes de atención primaria, ampliamente adoptada por instituciones gubernamentales y médicas; GAD-7, una lista de 7 preguntas para evaluar las medidas de gravedad para la ansiedad generalizada, común en la práctica clínica; CAGE, una prueba de detección para la adicción al alcohol en cuatro preguntas; y el Cuestionario de Empatía de Toronto (TEQ), una lista de 16 preguntas diseñada para evaluar los niveles de empatía.

Características de los cuatro cuestionarios estándar del sector adaptados para el estudio.

Características de los cuatro cuestionarios estándar del sector adaptados para el estudio.

Los cuestionarios tuvieron que ser reescritos para evitar oraciones declarativas como Poco interés o placer en hacer cosas, en favor de construcciones interrogativas más adecuadas para un intercambio de conversación.

También fue necesario definir una “respuesta fallida”, para identificar y evaluar solo aquellas respuestas que un usuario humano podría interpretar como válidas y verse afectado por ellas. Una “respuesta fallida” podría evadir la pregunta con respuestas elípticas o abstractas; negarse a participar en la pregunta (es decir, ‘No lo sé’ o ‘Lo olvidé’); o incluir contenido previo “imposible” como ‘Solía sentir hambre cuando era niño’. En las pruebas, Blender y Plato acumularon la mayoría de los resultados fallidos, y el 61,4% de las respuestas fallidas no estaban relacionadas con la consulta.

Los investigadores entrenaron los cuatro modelos en publicaciones de Reddit, utilizando el Conjunto de datos de Reddit Pushshift. En los cuatro casos, el entrenamiento se ajustó con un conjunto de datos adicional que contenía los conjuntos Blended Skill Talk y Wizard of Wikipedia de Facebook; ConvAI2 (una colaboración entre Facebook, Microsoft y Carnegie Mellon, entre otros); y Diálogos Empáticos (una colaboración entre la Universidad de Washington y Facebook).

Reddit Pervasive

Plato, DialoFlow y Blender vienen con pesos preentrenados en comentarios de Reddit, de modo que las relaciones neuronales formadas incluso al entrenar con datos frescos (ya sea de Reddit o de otro lugar) se verán influenciadas por la distribución de características extraídas de Reddit.

Cada grupo de prueba se realizó dos veces, como ‘single’ o ‘multi’. Para ‘single’, cada pregunta se hizo en una sesión de chat completamente nueva. Para ‘multi’, se utilizó una sola sesión de chat para recibir respuestas a todas las preguntas, ya que las variables de sesión se acumulan a lo largo de la conversación y pueden influir en la calidad de la respuesta a medida que la conversación asume una forma y un tono particulares.

Todos los experimentos y el entrenamiento se ejecutaron en dos GPUs NVIDIA Tesla V100, para un total de 64 GB de VRAM sobre 1280 núcleos de tensor. El documento no detalla el tiempo de entrenamiento.

Supervisión a través de la Curación o la Arquitectura

El documento concluye en términos generales que el “descuido de los riesgos de salud mental” durante el entrenamiento debe abordarse, e invita a la comunidad de investigación a profundizar en el tema.

El factor central parece ser que los marcos de chatbot en cuestión están diseñados para extraer características destacadas de conjuntos de datos fuera de la distribución sin ninguna salvaguarda con respecto al lenguaje tóxico o destructivo; si se alimenta a los marcos con datos de un foro neo-nazi, por ejemplo, probablemente se obtendrán algunas respuestas polémicas en una conversación posterior.

No obstante, el sector de Procesamiento de Lenguaje Natural (NLP) tiene un interés mucho más válido en obtener información de foros y contenido generado por usuarios de redes sociales relacionado con la salud mental (depresión, ansiedad, dependencia, etc.), tanto para desarrollar chatbots de salud relacionados con la salud y desescaladores, como para obtener inferencias estadísticas mejoradas a partir de datos reales.

Por lo tanto, en términos de datos de gran volumen que no están limitados por los límites de texto arbitrarios de Twitter, Reddit sigue siendo el único corpus hiperscala en constante actualización para estudios de texto completo de este tipo.

Sin embargo, incluso una búsqueda casual entre algunas de las comunidades que más interesan a los investigadores de NLP en salud (como r/depression) revela la predominancia del tipo de “respuestas negativas” que podrían convencer a un sistema de análisis estadístico de que las respuestas negativas son válidas porque son frecuentes y estadísticamente dominantes, particularmente en el caso de foros muy suscritos con recursos de moderación limitados.

La pregunta queda, entonces, si la arquitectura del chatbot debería contener algún tipo de “marco de evaluación moral”, donde los subobjetivos influyen en el desarrollo de los pesos en el modelo, o si una curación y etiquetado de datos más costosos pueden de alguna manera contrarrestar esta tendencia hacia datos desequilibrados.

 

 

* El documento de los investigadores, como se vincula en este artículo, cita erróneamente un enlace al chatbot Meena de Google en lugar del enlace al documento de Blender. Google’s Meena no se presenta en el nuevo documento. El enlace correcto de Blender utilizado en este artículo fue proporcionado por los autores del documento en un correo electrónico a mí. Los autores me han dicho que este error se enmendará en una versión posterior del documento.

Publicado por primera vez el 18 de enero de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai