Ángulo de Anderson

Reconocimiento de estrés laboral a través del análisis facial en el trabajo

mm
Añade Unite.AI a tus fuentes preferidas en Google

En el contexto de la cambiente cultura en torno a la etiqueta de las reuniones de Zoom, y la emergencia de fatiga de Zoom, investigadores de Cambridge han publicado un estudio que utiliza el aprendizaje automático para determinar nuestros niveles de estrés a través de la cobertura de nuestra expresión facial en el trabajo mediante cámaras web habilitadas por IA.

A la izquierda, el entorno de recopilación de datos, con varios equipos de monitoreo entrenados o conectados a un voluntario; a la derecha, ejemplos de expresiones faciales generadas por los sujetos de prueba en diferentes niveles de dificultad de la tarea. Fuente: https://arxiv.org/pdf/2111.11862.pdf

A la izquierda, el entorno de recopilación de datos, con varios equipos de monitoreo entrenados o conectados a un voluntario; a la derecha, ejemplos de expresiones faciales generadas por los sujetos de prueba en diferentes niveles de dificultad de la tarea. Fuente: https://arxiv.org/pdf/2111.11862.pdf

La investigación está destinada al análisis de afecto (es decir, reconocimiento de emociones) en sistemas de “Vida Asistida Ambiental”, y presumiblemente está diseñada para permitir marcos de monitoreo de expresiones faciales basados en video y IA en dichos sistemas; aunque el documento no amplía este aspecto, el esfuerzo de investigación no tiene sentido en ningún otro contexto.

El ámbito específico del proyecto es aprender patrones de expresión facial en entornos de trabajo – incluyendo arreglos de trabajo remoto – en lugar de situaciones de “ocio” o “pasivas”, como viajar.

Reconocimiento de emociones basado en la cara en el lugar de trabajo

Mientras que “Vida Asistida Ambiental” puede sonar como un esquema para el cuidado de los ancianos, eso está lejos de ser el caso. Hablando de los “usuarios finales” destinados, los autores afirman*:

‘Los sistemas creados para entornos de vida asistida ambiental [†] tienen como objetivo poder realizar análisis de afecto automático y responder. La vida asistida ambiental se basa en el uso de tecnología de la información y la comunicación (TIC) para ayudar en el entorno de vida y trabajo diario de una persona para mantenerla más saludable y activa durante más tiempo, y permitirle vivir de forma independiente a medida que envejece. Por lo tanto, la vida asistida ambiental tiene como objetivo facilitar a los trabajadores de la salud, enfermeras, médicos, trabajadores de fábrica, conductores, pilotos, maestros y diversas industrias a través de la detección, evaluación e intervención.

‘El sistema tiene como objetivo determinar la tensión física, emocional y mental y responder y adaptarse según sea necesario, por ejemplo, un automóvil equipado con un sistema de detección de somnolencia puede informar al conductor que debe prestar atención y puede sugerirle que tome un descanso para evitar accidentes [††].’

El documento se titula Infiriendo el afecto facial del usuario en entornos de trabajo, y proviene de tres investigadores del Laboratorio de Inteligencia Afectiva y Robótica de Cambridge.

Condiciones de prueba

Dado que trabajos anteriores en este campo han dependido en gran medida de colecciones de imágenes ad hoc recopiladas de Internet, los investigadores de Cambridge realizaron experimentos de recopilación de datos locales con 12 voluntarios del campus, 5 hombres y 7 mujeres. Los voluntarios provenían de nueve países y tenían edades entre 22 y 41 años.

El proyecto tenía como objetivo recrear tres entornos de trabajo potencialmente estresantes: una oficina; una línea de producción de fábrica; y una llamada de teleconferencia – como el tipo de chat de grupo de Zoom que se ha convertido en una característica frecuente del trabajo en casa desde el comienzo de la pandemia.

Los sujetos fueron monitoreados por diversos medios, incluyendo tres cámaras, un micrófono de cuello Jabra, una pulsera Empatica (un dispositivo de sensores inalámbrico que ofrece retroalimentación biofísica en tiempo real), y una banda sensora Muse 2 (que también ofrece retroalimentación biofísica). Además, se les pidió a los voluntarios que completaran encuestas y autoevaluaran su estado de ánimo periódicamente.

Sin embargo, esto no significa que los futuros equipos de Vida Asistida Ambiental los “conecten” hasta ese punto (al menos por razones de costo); todo el equipo de monitoreo y los métodos utilizados en la recopilación de datos, incluyendo las autoevaluaciones escritas, están destinados a verificar los sistemas de reconocimiento de afecto basados en la cara que se habilitan mediante footage de cámara.

Aumentando la presión: El escenario de la oficina

En los dos primeros de los tres escenarios (‘Oficina’ y ‘Fábrica’), los voluntarios comenzaron con un ritmo fácil, con la presión aumentando gradualmente durante cuatro fases, con diferentes tipos de tareas para cada una.

En el nivel más alto de estrés inducido, los voluntarios también tuvieron que soportar el ‘efecto del abrigo blanco’ de alguien mirando sobre su hombro, más 85 db de ruido adicional, que es solo cinco decibelios por debajo del límite legal para un entorno de oficina en los EE. UU., y el límite máximo especificado por el Instituto Nacional de Seguridad y Salud Ocupacional (NIOSH).

En la fase de recopilación de datos en un entorno de oficina, los sujetos fueron asignados para recordar letras anteriores que habían aparecido en su pantalla, con niveles de dificultad crecientes (como tener que recordar secuencias de dos letras que ocurrieron dos pantallas atrás).

El escenario de la fábrica

Para simular un entorno de trabajo manual, se les pidió a los sujetos que jugaran el juego Operación, que desafía la destreza del usuario al requerir que el jugador extraiga objetos pequeños de una tabla a través de aberturas estrechas con bordes metálicos sin tocar los lados, lo que activa una alarma de “fracaso”.

Al llegar a la fase más difícil, el voluntario fue desafiado a extraer los 12 objetos sin error en un minuto. Para poner esto en perspectiva, el récord mundial para esta tarea, establecido en el Reino Unido en 2019, está en 12,68 segundos.

El escenario de la teleconferencia

Finalmente, en la prueba de trabajo en casa/teleconferencia, se les pidió a los voluntarios que recordaran sus recuerdos positivos y negativos por un experimentador a través de una llamada de MS Teams. Para la fase más estresante de este escenario, el voluntario fue requerido para recordar un recuerdo muy negativo o triste de su pasado reciente.

Los diversas tareas y escenarios se ejecutaron en orden aleatorio, y se compilaron en un conjunto de datos personalizado titulado Working-Environment-Context-Aware Dataset (WECARE-DB).

Método y capacitación

Los resultados de las autoevaluaciones de los usuarios de su estado de ánimo se utilizaron como verdad fundamental, y se mapearon a dimensiones de valencia y arousal. El video capturado de los experimentos se procesó a través de una red de detección de puntos de referencia facial network, y las imágenes alineadas se alimentaron a una red ResNet-18 entrenada en el conjunto de datos AffectNet.

450,000 imágenes de AffectNet, todas extraídas y etiquetadas de Internet utilizando consultas relacionadas con emociones, fueron anotadas manualmente, según el documento.

A continuación, los investigadores refinaron la red solo en función de su propio conjunto de datos WECARE, mientras que la codificación de representación espectral se utilizó para resumir predicciones basadas en fotogramas.

Resultados

El rendimiento del modelo se evaluó en tres métricas comúnmente asociadas con la predicción automática de afecto: Coeficiente de Correlación de Concordancia; Coeficiente de Correlación de Pearson; y Error Cuadrático Medio (ECM).

Los autores observan que el modelo ajustado en su propio conjunto de datos WECARE superó a ResNet-18, y deducen de esto que la forma en que gobernamos nuestras expresiones faciales es muy diferente en un entorno de trabajo que en los contextos más abstractos de los que se derivan los materiales de estudio de Internet.

Afirmaron:

‘Al mirar la tabla, observamos que el modelo ajustado en WECARE-DB superó al modelo ResNet-18 preentrenado en [AffectNet], lo que indica que los comportamientos faciales exhibidos en entornos de trabajo son diferentes en comparación con los entornos de Internet utilizados en la base de datos AffectNet. Por lo tanto, es necesario adquirir conjuntos de datos y entrenar modelos para reconocer el afecto facial en entornos de trabajo.’

En cuanto al futuro del reconocimiento de afecto en el trabajo, habilitado por redes de cámaras entrenadas en empleados y haciendo predicciones constantes de sus estados emocionales, los autores concluyen*:

‘El objetivo final es implementar y utilizar los modelos entrenados en tiempo real y en entornos de trabajo reales para proporcionar entrada a sistemas de apoyo a la decisión para promover la salud y el bienestar de las personas durante su edad laboral en el contexto del Proyecto de Edad Laboral de la UE.’

 

 

* Mi énfasis.

† Aquí los autores hacen tres citas:

Reconocimiento automático, dimensional y continuo de emociones – https://ibug.doc.ic.ac.uk/media/uploads/documents/GunesPantic_IJSE_2010_camera.pdf
Explorando el dominio de la vida asistida ambiental: una revisión sistemática – https://link.springer.com/article/10.1007/s12652-016-0374-3
Una revisión de las tecnologías de Internet de las cosas para entornos de vida asistida ambiental – https://mdpi-res.com/d_attachment/futureinternet/futureinternet-11-00259/article_deploy/futureinternet-11-00259-v2.pdf

†† Aquí los autores hacen dos citas:

Detección de somnolencia del conductor en tiempo real para sistemas integrados utilizando la compresión de modelos de redes neuronales profundas – https://openaccess.thecvf.com/content_cvpr_2017_workshops/w4/papers/Reddy_Real-Time_Driver_Drowsiness_CVPR_2017_paper.pdf
Sistema de detección de somnolencia del conductor en tiempo real utilizando características faciales – https://www.semanticscholar.org/paper/Real-Time-Driver-Drowsiness-Detection-System-Using-Deng-Wu/1f4b0094c9e70bf7aa287234e0fdb4c764a5c532

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]