Kąt Andersona

Wykrywanie kontaktu wzrokowego z pozycji ciała za pomocą uczenia maszynowego

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy z Francji i Szwajcarii opracowali system wizji komputerowej, który może oszacować, czy osoba patrzy bezpośrednio na kamerę systemu AI, wyłącznie na podstawie sposobu, w jaki osoba stoi lub porusza się.

Nowy framework wykorzystuje bardzo ograniczone informacje do tej oceny, w postaci semantycznych punktów kluczowych (patrz poniższy obraz), zamiast próby analizy położenia oczu na zdjęciach twarzy. To sprawia, że wynikowa metoda wykrywania jest bardzo lekka i zwinna w porównaniu z bardziej danych-intensywnymi architekturami wykrywania obiektów, takimi jak YOLO.

Nowy framework ocenia, czy osoba na ulicy patrzy na czujnik AI, wyłącznie na podstawie ułożenia jej ciała. Tutaj osoby zaznaczone na zielono są prawdopodobnie patrzące na kamerę, podczas gdy te na czerwono są bardziej prawdopodobne, że patrzą gdzie indziej.

Nowy framework ocenia, czy osoba na ulicy patrzy na czujnik AI, wyłącznie na podstawie ułożenia jej ciała. Tutaj osoby zaznaczone na zielono są prawdopodobnie patrzące na kamerę, podczas gdy te na czerwono są bardziej prawdopodobne, że patrzą gdzie indziej. Źródło: https://arxiv.org/pdf/2112.04212.pdf

Chociaż praca jest zmotywowana rozwojem lepszych systemów bezpieczeństwa dla pojazdów autonomicznych, autorzy nowego artykułu przyznają, że może mieć bardziej ogólne zastosowania w innych branżach, obserwując ‘nawet w inteligentnych miastach, wykrywanie kontaktu wzrokowego może być przydatne do lepszego zrozumienia zachowań pieszych, np. określenia, gdzie kierują swoją uwagę lub które znaki drogowe obserwują’.

Aby ułatwić dalszy rozwój tego i następnych systemów, naukowcy skompilowali nowy i kompleksowy zestaw danych o nazwie LOOK, który bezpośrednio rozwiązuje specyficzne wyzwania związane z wykrywaniem kontaktu wzrokowego w dowolnych scenariuszach, takich jak sceny uliczne postrzegane z kamery samochodu autonomicznego lub przypadkowe tłumy, przez które robot może musieć się poruszać i ustąpić pieszym.

Wyniki z frameworku, z 'patrzącymi' zaznaczonymi na zielono.

Wyniki z frameworku, z ‘patrzącymi’ zaznaczonymi na zielono.

Badanie naukowe nosi tytuł Czy piesi zwracają uwagę? Wykrywanie kontaktu wzrokowego w terenie i pochodzi od czterech naukowców z inicjatywy badawczej Visual Intelligence for Transportation (VITA) w Szwajcarii oraz jednego z Uniwersytetu Sorbona.

Architektura

Większość poprzedniej pracy w tej dziedzinie koncentrowała się na uwadze kierowcy, wykorzystując uczenie maszynowe do analizy danych z kamer skierowanych na kierowcę, oraz opierała się na stałym, stałym i bliskim widoku kierowcy – luksusie, który nie jest prawdopodobnie dostępny w często niskiej rozdzielczości kamer telewizyjnych, gdzie ludzie mogą być zbyt oddaleni, aby system analizy twarzy mógł rozpoznać ich ułożenie oczu, a także gdzie inne przeszkody (takie jak okulary przeciwsłoneczne) również stanowią przeszkodę.

Bardziej centralne dla deklarowanego celu projektu, kamery zewnętrzne w pojazdach autonomicznych nie będą koniecznie w optymalnej sytuacji, co sprawia, że ‘niskopoziomowe’ informacje o punktach kluczowych są idealne jako podstawa ramy analizy spojrzenia. Systemy pojazdów autonomicznych potrzebują bardzo responsywnego i błyskawicznie szybkiego sposobu zrozumienia, czy pieszy – który może wystąpić z chodnika na ścieżkę samochodu – zobaczył pojazd autonomiczny. W takiej sytuacji opóźnienie może oznaczać różnicę między życiem a śmiercią.

Modularna architektura opracowana przez naukowców przyjmuje (zwykle) pełne ciało obrazu osoby, z którego 2D stawy są wyodrębnione w postaci szkieletowej.

Architektura nowego francusko-szwajcarskiego systemu wykrywania kontaktu wzrokowego.

Architektura nowego francusko-szwajcarskiego systemu wykrywania kontaktu wzrokowego.

Pozycja jest normalizowana, aby usunąć informacje na osi Y, tworząc ‘płaską’ reprezentację pozycji, która ją równa z tysiącami znanych pozycji nauczonej przez algorytm (które również zostały ‘spłaszczone’), oraz ich skojarzone flagi binarne/etykiety (tj. 0: Nie patrzy lub 1: Patrzy).

Pozycja jest porównywana z wewnętrzną wiedzą algorytmu o tym, jak dobrze ta postawa odpowiada obrazom innych pieszych, które zostały zidentyfikowane jako ‘patrzące na kamerę’ – adnotacje wykonane przy użyciu niestandardowych narzędzi przeglądarki opracowanych przez autorów dla pracowników Amazon Mechanical Turk, którzy wzięli udział w rozwoju zestawu danych LOOK.

Każde zdjęcie w LOOK zostało poddane ocenie przez czterech pracowników AMT, a tylko zdjęcia, w których trzej z czterech pracowników zgadzali się co do wyniku, zostały uwzględnione w końcowej kolekcji.

Informacje o obcięciu głowy, które są podstawą poprzedniej pracy, są jednym z najmniej wiarygodnych wskaźników spojrzenia w dowolnych scenariuszach miejskich i są uwzględnione jako opcjonalny strumień danych w architekturze, gdzie jakość i pokrycie są wystarczające, aby wesprzeć decyzję o tym, czy osoba patrzy na kamerę, czy nie. W przypadku bardzo oddalonych osób nie będzie to przydatna informacja.

Dane

Naukowcy wyprowadzili LOOK z kilku poprzednich zestawów danych, które nie są domyślnie przystosowane do tego zadania. Dwa zestawy danych, które bezpośrednio dzielą zakres projektu, to JAAD i PIE, i każdy z nich ma ograniczenia.

JAAD to oferta z 2017 roku z Uniwersytetu w Toronto, zawierająca 390 000 oznaczonych przykładów pieszych, w tym prostokąty i adnotacje zachowania. Spośród nich tylko 17 000 jest oznaczonych jako Patrzący na kierowcę (tj. kamerę ego). Zestaw danych zawiera 346 klipów 30 klatek na sekundę, nagranych w Ameryce Północnej i Europie. JAAD ma wysoki wskaźnik powtórzeń, a łączna liczba unikalnych pieszych wynosi tylko 686.

Bardziej niedawny (2019) PIE, z Uniwersytetu w Toronto, jest podobny do JAAD, ponieważ zawiera nagrania z kamer zainstalowanych w pojeździe, tym razem pochodzące z sześciu godzin jazdy przez centrum Toronto, co daje 700 000 oznaczonych pieszych i 1842 unikalne piesze, z których tylko 180 patrzy na kamerę.

Zamiast tego naukowcy z nowego artykułu skompilowali najbardziej odpowiednie dane z trzech poprzednich zestawów danych dla pojazdów autonomicznych: KITTI, JRDB i NuScenes, odpowiednio z Instytutu Technologicznego w Karlsruhe w Niemczech, Stanford i Uniwersytetu Monash w Australii, oraz jednego z byłych spin-offów MIT, Nutonomy.

To kuracja wynikła w szeroko zróżnicowany zestaw ujęć z czterech miast – Boston, Singapur, Tübingen i Palo Alto. Z około 8000 oznaczonych perspektyw pieszych, autorzy twierdzą, że LOOK jest najbardziej zróżnicowanym zestawem danych do wykrywania kontaktu wzrokowego “w terenie”.

Szkolenie i wyniki

Ekstrakcja, szkolenie i ocena zostały wykonane na jednej karcie NVIDIA GeForce GTX 1080ti z 11 GB pamięci VRAM, działającej na procesorze Intel Core i7-8700 o częstotliwości 3,20 GHz.

Autorzy stwierdzili, że ich metoda nie tylko poprawia wyniki w porównaniu z dotychczasowymi wynikami o co najmniej 5%, ale także, że wynikowe modele szkolone na JAAD bardzo dobrze generalizują na niewidoczne dane, co zostało przetestowane przez połączenie różnych zestawów danych.

Ponieważ przeprowadzona ocena była złożona i musiała uwzględniać modele oparte na obcięciu (podczas gdy izolacja twarzy i obcięcie nie są centralnymi elementami nowej inicjatywy), zobacz artykuł, aby uzyskać szczegółowe wyniki.

Wyniki dla średniej precyzji (AP) jako procent i funkcja wysokości prostokąta ograniczającego w pikselach dla testowania w całym zestawie danych JAAD, z wynikami autorów wytłuszczonymi.

Wyniki dla średniej precyzji (AP) jako procent i funkcja wysokości prostokąta ograniczającego w pikselach dla testowania w całym zestawie danych JAAD, z wynikami autorów wytłuszczonymi.

Naukowcy udostępnili swój kod publicznie, z zestawem danych dostępnym tutaj, a kod źródłowy na GitHub.

Autorzy kończą, wyrażając nadzieję, że ich praca zainspiruje dalsze badania w tym, co określają jako ‘ważny, ale zaniedbany temat’.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai