Ochrona zdrowia

Rozpoznawanie stresu pracowników za pomocą analizy twarzy w miejscu pracy

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W kontekście zmieniającej się kultury wokół etykiety spotkań na Zoomie oraz pojawienia się zmęczenia Zoom, badacze z Cambridge opublikowali badanie, które wykorzystuje uczenie maszynowe do określenia naszych poziomów stresu za pomocą kamer internetowych i analizy twarzy w miejscu pracy.

Po lewej stronie, środowisko gromadzenia danych, z wieloma urządzeniami monitorującymi albo przypinanymi do wolontariusza; po prawej stronie, przykładowe wyrażenia twarzy wygenerowane przez osoby badane na różnych poziomach trudności zadania. Źródło: https://arxiv.org/pdf/2111.11862.pdf

Po lewej stronie, środowisko gromadzenia danych, z wieloma urządzeniami monitorującymi albo przypinanymi do wolontariusza; po prawej stronie, przykładowe wyrażenia twarzy wygenerowane przez osoby badane na różnych poziomach trudności zadania. Źródło: https://arxiv.org/pdf/2111.11862.pdf

Badanie jest przeznaczone do analizy afektywnej (tj. rozpoznawania emocji) w systemach “Ambient Assistive Living”, i przypuszczalnie jest zaprojektowane do umożliwienia monitorowania wyrażeń twarzy za pomocą kamer w takich systemach; choć artykuł nie rozwija tego aspektu, wysiłek badawczy nie ma sensu w żadnym innym kontekście.

Konkretny zakres projektu obejmuje naukę wzorców wyrażeń twarzy w środowisku pracy – w tym również w przypadku pracy zdalnej – a nie “wypoczynku” lub “bierności”, takich jak podróżowanie.

Rozpoznawanie emocji twarzy w miejscu pracy

Podczas gdy “Ambient Assistive Living” może brzmieć jak plan opieki nad osobami starszymi, to zupełnie inna sprawa. Mówiąc o “końcowych użytkownikach”, autorzy stwierdzają*:

‘Systemy stworzone dla ambient assistive living environments [†] mają na celu wykonywanie automatycznej analizy afektywnej i odpowiedzi. Ambient assistive living opiera się na wykorzystaniu technologii informacyjnej i komunikacyjnej (ICT) w celu wspomagania osób w ich codziennym życiu i pracy, aby utrzymać ich zdrowie i aktywność na dłużej, i umożliwić im samodzielne życie w miarę starzenia się. Zatem, ambient assistive living ma na celu wspomaganie pracowników służby zdrowia, pielęgniarek, lekarzy, pracowników fabrycznych, kierowców, pilotów, nauczycieli oraz różnych branż poprzez sensoryzację, ocenę i interwencję.

‘System jest przeznaczony do określenia fizycznego, emocjonalnego i psychicznego obciążenia i odpowiedzi oraz dostosowania się w razie potrzeby, na przykład, samochód wyposażony w system wykrywania senności może poinformować kierowcę, aby był czujny i może zasugerować, aby zrobił krótką przerwę, aby uniknąć wypadków [††].’

Artykuł pt. Inferring User Facial Affect in Work-like Settings, pochodzi od trzech badaczy z Affective Intelligence & Robotics Lab w Cambridge.

Warunki testowe

Ponieważ poprzednie badania w tej dziedzinie opierały się głównie na przypadkowych zbiorach obrazów pobranych z Internetu, badacze z Cambridge przeprowadzili eksperymenty z 12 wolontariuszami, 5 mężczyznami i 7 kobietami. Wolontariusze pochodzili z dziewięciu krajów i mieli od 22 do 41 lat.

Projekt miał na celu odtworzenie trzech potencjalnie stresujących środowisk pracy: biura; linii produkcyjnej fabryki; oraz wideokonferencji – takiej, jak ta, która stała się częstym elementem pracy zdalnej od czasu pandemii.

Osoby badane były monitorowane za pomocą różnych środków, w tym trzech kamer, mikrofonu Jabra noszonego na szyi, opaski Empatica (bezprzewodowego, wieloczujnikowego urządzenia oferującego informacje zwrotne w czasie rzeczywistym), oraz czujnika Muse 2 (który również oferuje informacje zwrotne). Dodatkowo, wolontariusze zostali poproszeni o wypełnienie ankiet i samoocenę swojego nastroju w regularnych odstępach czasu.

Jednakże, nie oznacza to, że przyszłe systemy Ambient Assistive Living będą “podłączać” ludzi w ten sposób (przynajmniej z powodów ekonomicznych); wszystkie niekamerowe urządzenia monitorujące i metody użyte w eksperymentach były przeznaczone do weryfikacji systemów rozpoznawania emocji twarzy, które są umożliwione przez nagrania wideo.

Zwiększanie presji: Scenariusz biurowy

W pierwszych dwóch z trzech scenariuszy (“Biuro” i “Fabryka”), wolontariusze rozpoczęli pracę w tempie łatwym, z presją stopniowo zwiększaną w czterech fazach, z różnymi typami zadań dla każdej.

Na najwyższym poziomie wywołanego stresu, wolontariusze musieli również znosić “efekt białego kitla” kogoś stojącego za ich plecami, plus hałas na poziomie 85 decybeli, co jest tylko pięć decybeli poniżej limitu prawnego dla środowiska biurowego w Stanach Zjednoczonych, i dokładnie maksymalny limit określony przez Narodowy Instytut Bezpieczeństwa i Zdrowia w Pracy (NIOSH).

W fazie gromadzenia danych w środowisku biurowym, osoby badane zostały poproszone o zapamiętanie poprzednich liter, które pojawiały się na ich ekranie, z rosnącym poziomem trudności (takim jak zapamiętanie sekwencji dwóch liter, które wystąpiły dwa ekrany temu).

Scenariusz fabryczny

Aby symulować środowisko pracy fizycznej, osoby badane zostały poproszone o grę w Operację, która wymaga od gracza wykazania się zręcznością, wymagając od niego wyjęcia małych obiektów z deski przez wąskie, metalowe otwory, bez dotyku krawędzi, co powoduje uruchomienie “sygnału awaryjnego”.

Gdy nadszedł najtrudniejszy etap, wolontariusz został wyzwany do wyjęcia wszystkich 12 obiektów bez błędu w ciągu jednej minuty. Dla porównania, rekord świata w tym zadaniu, ustanowiony w Wielkiej Brytanii w 2019 roku, wynosi 12,68 sekund.

Scenariusz wideokonferencyjny

Wreszcie, w teście pracy zdalnej/wideokonferencyjnej, wolontariusze zostali poproszeni przez eksperymentatora za pośrednictwem połączenia MS Teams o przypomnienie sobie pozytywnych i negatywnych wspomnień. W najbardziej stresującej fazie tego scenariusza, wolontariusz został poproszony o przypomnienie sobie bardzo negatywnego lub smutnego wspomnienia z niedawnego przeszłości.

Różne zadania i scenariusze zostały wykonane w losowej kolejności i skompilowane w niestandardową bazę danych zatytułowaną Working-Environment-Context-Aware Dataset (WECARE-DB).

Metoda i szkolenie

Wyniki samooceny nastroju przez użytkowników zostały wykorzystane jako punkt odniesienia, i zostały przyporządkowane do wymiarów walencji i pobudzenia. Nagrania wideo eksperymentów zostały przetworzone za pomocą sieci wykrywania punktów charakterystycznych twarzy, a wyrównane obrazy zostały podane do sieci ResNet-18, przeszkolonej na bazie danych AffectNet.

450 000 obrazów z AffectNet, wszystkie pobrane i opisane z Internetu przy użyciu zapytań związanych z emocjami, zostało ręcznie opisanych, jak podaje artykuł, z wymiarami walencji i pobudzenia.

Następnie badacze udoskonalili sieć wyłącznie na podstawie własnej bazy danych WECARE, podczas gdy kodowanie reprezentacji widmowej zostało wykorzystane do podsumowania predykcji klatkowych.

Wyniki

Wyniki modelu zostały ocenione na podstawie trzech wskaźników zwykle skojarzonych z automatyczną predykcją afektywną: współczynnika korelacji, współczynnika korelacji Pearsona oraz błędu średniego kwadratowego (RMSE).

Autorzy zauważają, że model dostosowany do ich własnej bazy danych WECARE-DB przewyższył model ResNet-18, i wnioskują z tego, że sposób, w jaki kontrolujemy nasze wyrażenia twarzy, jest bardzo inny w środowisku pracy niż w bardziej abstrakcyjnych kontekstach, z których pochodzą materiały źródłowe z Internetu.

Stwierdzają:

‘Patrząc na tabelę, obserwujemy, że model dostosowany do WECARE-DB przewyższył model ResNet-18 przeszkolony na [AffectNet], co wskazuje, że zachowania twarzy wyświetlane w środowiskach pracy są różne w porównaniu z ustawieniami internetowymi wykorzystywanymi w bazie danych AffectNet. Zatem, konieczne jest pozyskanie danych i przeszkolenie modeli do rozpoznawania afektywnych wyrażeń twarzy w środowiskach pracy.’

Jeśli chodzi o przyszłość rozpoznawania afektywnego w miejscu pracy, umożliwionego przez sieci kamer skierowanych na pracowników i ciągle dokonujących predykcji ich stanów emocjonalnych, autorzy konkludują*:

‘Ostatecznym celem jest wdrożenie i użycie przeszkolonych modeli w czasie rzeczywistym i w rzeczywistych środowiskach pracy, aby dostarczyć dane do systemów wspomagania decyzji w celu promowania zdrowia i dobrostanu ludzi w wieku produkcyjnym w ramach projektu EU Working Age.’

 

 

* Mój nacisk.

† Tutaj autorzy cytują trzy źródła:

Automatyczne, wymiarowe i ciągłe rozpoznawanie emocji – https://ibug.doc.ic.ac.uk/media/uploads/documents/GunesPantic_IJSE_2010_camera.pdf
Badanie dziedziny ambient assistive living – https://link.springer.com/article/10.1007/s12652-016-0374-3
Przegląd technologii Internetu Rzeczy dla środowisk ambient assistive living – https://mdpi-res.com/d_attachment/futureinternet/futureinternet-11-00259/article_deploy/futureinternet-11-00259-v2.pdf

†† Tutaj autorzy cytują dwa źródła:

Wykrywanie senności kierowców w czasie rzeczywistym dla systemów osadzonych przy użyciu kompresji modeli sieci neuronowych – https://openaccess.thecvf.com/content_cvpr_2017_workshops/w4/papers/Reddy_Real-Time_Driver_Drowsiness_CVPR_2017_paper.pdf
System wykrywania senności kierowców w czasie rzeczywistym przy użyciu cech twarzy – https://www.semanticscholar.org/paper/Real-Time-Driver-Drowsiness-Detection-System-Using-Deng-Wu/1f4b0094c9e70bf7aa287234e0fdb4c764a5c532

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai