Взгляд Anderson

Распознавание стресса сотрудников через анализ лица на работе

mm
Добавьте Unite.AI в избранные источники в Google

В контексте изменения культуры вокруг этикета видеоконференций и возникновения усталости от Zoom, исследователи из Кембриджа опубликовали исследование, которое использует машинное обучение для определения уровня стресса по выражению лица сотрудников на работе с помощью веб-камер, оснащенных ИИ.

Слева, среда сбора данных с несколькими устройствами мониторинга, либо обученными на волонтере, либо прикрепленными к нему; справа, примеры выражений лица, сгенерированные испытуемыми на различных уровнях сложности задач. Источник: https://arxiv.org/pdf/2111.11862.pdf

Слева, среда сбора данных с несколькими устройствами мониторинга, либо обученными на волонтере, либо прикрепленными к нему; справа, примеры выражений лица, сгенерированные испытуемыми на различных уровнях сложности задач. Источник: https://arxiv.org/pdf/2111.11862.pdf

Исследование предназначено для анализа эмоций (т. е. распознавания эмоций) в системах “Ambient Assistive Living” и, вероятно, предназначено для реализации видео-основанных систем мониторинга выражения лица на основе ИИ в таких системах; хотя статья не расширяет этот аспект, усилия исследователей не имеют смысла в любом другом контексте.

Конкретная цель проекта – изучить закономерности выражения лица на рабочем месте – включая удаленную работу – а не “досуг” или “пассивные” ситуации, такие как путешествия.

Распознавание эмоций по выражению лица на рабочем месте

Хотя “Ambient Assistive Living” может звучать как схема для ухода за пожилыми людьми, это далеко не так. Говоря об “конечных пользователях”, авторы заявляют*:

‘Системы, созданные для среды Ambient Assistive Living, [†] предназначены для выполнения автоматического анализа эмоций и реагирования. Ambient Assistive Living полагается на использование информационных и коммуникационных технологий (ИКТ) для помощи людям в их повседневной жизни и работе, чтобы сохранить их здоровье и активность на более долгий период и позволить им жить самостоятельно, когда они стареют. Таким образом, Ambient Assistive Living направлена на поддержку медицинских работников, медсестер, врачей, рабочих на производстве, водителей, пилотов, учителей, а также различных отраслей промышленности посредством сенсорного, оценочного и вмешательного подхода.

‘Система предназначена для определения физического, эмоционального и психического напряжения и реагирования и адаптации по мере необходимости, например, автомобиль, оснащенный системой обнаружения сонливости, может предупредить водителя быть внимательным и предложить ему сделать короткий перерыв, чтобы избежать аварий [††].’

Статья называется Определение эмоционального состояния пользователя в рабочей среде и написана тремя исследователями из лаборатории Affective Intelligence & Robotics в Кембридже.

Условия тестирования

Поскольку предыдущие исследования в этой области в основном опирались на случайные коллекции изображений, собранные из интернета, исследователи из Кембриджа провели местные эксперименты по сбору данных с 12 волонтерами, 5 мужчинами и 7 женщинами. Волонтеры были из девяти стран и имели возраст от 22 до 41 года.

Проект был направлен на воссоздание трех потенциально стрессовых рабочих сред: офиса; производственной линии; и видеоконференции – такого типа, который стал частым явлением в домашних условиях с момента появления пандемии.

Испытуемые были отслежены различными методами, включая три камеры, микрофон Jabra, носимый на шее, Empatica-часы (беспроводной многосенсорный носимый устройство, предоставляющий реальное биологическое обратное связие), и сенсор Muse 2 (который также предоставляет биологическое обратное связие). Кроме того, волонтерам было предложено заполнить опросы и оценить свое настроение периодически.

Однако это не означает, что будущие системы Ambient Assistive Living будут “подключать” людей таким же образом (хотя бы по причинам стоимости); все не-камерные методы мониторинга, использованные при сборе данных, включая письменные самооценки, предназначены для проверки систем распознавания эмоций по выражению лица, которые включают видеозаписи.

Повышение давления: Сценарий офиса

В первых двух из трех сценариев (“Офис” и “Производство”) волонтеры начали с легкого темпа, и давление постепенно увеличивалось в четыре фазы, с разными типами задач для каждой.

На самом высоком уровне индуцированного стресса волонтеры также должны были выдержать “эффект белого халата” наличия человека, наблюдающего за ними, а также дополнительный шум в 85 дБ, что всего на пять децибел ниже допустимого уровня для офисной среды в США и соответствует максимальному пределу, указанному Национальным институтом охраны труда и здоровья (NIOSH).

В офисной фазе сбора данных испытуемые были задействованы в задаче, требующей запоминания предыдущих букв, которые мелькали на их экране, с возрастающей сложностью (такой как запоминание последовательностей из двух букв, которые появлялись на экране два раза ранее).

Сценарий производства

Чтобы смоделировать среду ручного труда, испытуемым было предложено сыграть в игру Operation, которая требует от игрока извлечь небольшие объекты из доски через узкие металлические отверстия без касания краев, что вызывает срабатывание “сигнала неудачи”.

К моменту самого сложного этапа волонтеру было предложено извлечь все 12 предметов без ошибки в течение одной минуты. Для сравнения, мировой рекорд по этому заданию, установленный в Великобритании в 2019 году, составляет 12,68 секунды.

Сценарий видеоконференции

Наконец, в тесте домашней работы/видеоконференции волонтерам было предложено вспомнить свои положительные и отрицательные воспоминания по просьбе экспериментатора через вызов MS Teams. На самом стрессовом этапе этого сценария волонтеру было предложено вспомнить очень негативное или печальное воспоминание из недавнего прошлого.

Различные задачи и сценарии были выполнены в случайном порядке и собраны в пользовательскую базу данных под названием Working-Environment-Context-Aware Dataset (WECARE-DB).

Метод и обучение

Результаты самооценок настроения испытуемых были использованы в качестве эталона и сопоставлены с размерностями валентности и возбуждения. Видеозаписи экспериментов были обработаны через сеть обнаружения ориентиров лица, а выровненные изображения были поданы в сеть ResNet-18, обученную на базе данных AffectNet.

450 000 изображений из AffectNet, все нарисованные и помеченные из интернета с помощью запросов, связанных с эмоциями, были вручную аннотированы, как говорится в статье, с размерностями валентности и возбуждения.

Далее исследователи усовершенствовали сеть исключительно на основе своей собственной базы данных WECARE, а спектральное представление кодирования было использовано для суммирования прогнозов на основе кадров.

Результаты

Производительность модели была оценена по трем метрикам, обычно связанным с автоматическим прогнозированием эмоций: коэффициент корреляции, коэффициент корреляции Пирсона и среднеквадратическая ошибка (RMSE).

Авторы отмечают, что модель, дообученная на их собственной базе данных WECARE, превосходит ResNet-18, и делают вывод, что то, как мы управляем нашими выражениями лица, очень отличается на рабочем месте, чем в более абстрактных контекстах, из которых были получены предыдущие исследования.

Они заявляют:

‘Изучая таблицу, мы видим, что модель, дообученная на WECARE-DB, превосходит модель ResNet-18, предварительно обученную на [AffectNet], что указывает на то, что поведение лица, проявляемое в рабочей среде, отличается от того, что используется в интернет-средах, используемых в базе данных AffectNet. Следовательно, необходимо получать базы данных и обучать модели для распознавания эмоций в рабочей среде.’

Что касается будущего распознавания эмоций на рабочем месте, облегченного сетями камер, обученных на сотрудниках, и постоянно делающих прогнозы об их эмоциональном состоянии, авторы заключают*:

‘Конечная цель – реализовать и использовать обученные модели в реальном времени и в реальных рабочих условиях, чтобы предоставить входные данные системам поддержки принятия решений для содействия здоровью и благополучию людей во время их рабочего возраста в контексте проекта EU Working Age.’

 

 

* Мое подчеркивание.

† Здесь авторы ссылаются на три источника:

Автоматическое, размерное и непрерывное распознавание эмоций – https://ibug.doc.ic.ac.uk/media/uploads/documents/GunesPantic_IJSE_2010_camera.pdf
Изучение области Ambient Assistive Living: систематический обзор – https://link.springer.com/article/10.1007/s12652-016-0374-3
Обзор технологий Интернета вещей для сред Ambient Assistive Living – https://mdpi-res.com/d_attachment/futureinternet/futureinternet-11-00259/article_deploy/futureinternet-11-00259-v2.pdf

†† Здесь авторы ссылаются на два источника:

Обнаружение сонливости водителя в режиме реального времени для встроенной системы с использованием сжатия глубоких нейронных сетей – https://openaccess.thecvf.com/content_cvpr_2017_workshops/w4/papers/Reddy_Real-Time_Driver_Drowsiness_CVPR_2017_paper.pdf
Система обнаружения сонливости водителя в режиме реального времени с использованием лицевых черт – https://www.semanticscholar.org/paper/Real-Time-Driver-Drowsiness-Detection-System-Using-Deng-Wu/1f4b0094c9e70bf7aa287234e0fdb4c764a5c532

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]