KÄ t Andersona
Wykrywanie kontaktu wzrokowego z pozycji ciaÅa za pomocÄ uczenia maszynowego

Naukowcy z Francji i Szwajcarii opracowali system wizji komputerowej, ktÃģry moÅže oszacowaÄ, czy osoba patrzy bezpoÅrednio na kamerÄ systemu AI, wyÅÄ cznie na podstawie sposobu, w jaki osoba stoi lub porusza siÄ.
Nowy framework wykorzystuje bardzo ograniczone informacje do tej oceny, w postaci semantycznych punktÃģw kluczowych (patrz poniÅžszy obraz), zamiast prÃģby analizy poÅoÅženia oczu na zdjÄciach twarzy. To sprawia, Åže wynikowa metoda wykrywania jest bardzo lekka i zwinna w porÃģwnaniu z bardziej danych-intensywnymi architekturami wykrywania obiektÃģw, takimi jak YOLO.

Nowy framework ocenia, czy osoba na ulicy patrzy na czujnik AI, wyÅÄ cznie na podstawie uÅoÅženia jej ciaÅa. Tutaj osoby zaznaczone na zielono sÄ prawdopodobnie patrzÄ ce na kamerÄ, podczas gdy te na czerwono sÄ bardziej prawdopodobne, Åže patrzÄ gdzie indziej. ÅđrÃģdÅo: https://arxiv.org/pdf/2112.04212.pdf
ChociaÅž praca jest zmotywowana rozwojem lepszych systemÃģw bezpieczeÅstwa dla pojazdÃģw autonomicznych, autorzy nowego artykuÅu przyznajÄ , Åže moÅže mieÄ bardziej ogÃģlne zastosowania w innych branÅžach, obserwujÄ c ânawet w inteligentnych miastach, wykrywanie kontaktu wzrokowego moÅže byÄ przydatne do lepszego zrozumienia zachowaÅ pieszych, np. okreÅlenia, gdzie kierujÄ swojÄ uwagÄ lub ktÃģre znaki drogowe obserwujÄ â.
Aby uÅatwiÄ dalszy rozwÃģj tego i nastÄpnych systemÃģw, naukowcy skompilowali nowy i kompleksowy zestaw danych o nazwie LOOK, ktÃģry bezpoÅrednio rozwiÄ zuje specyficzne wyzwania zwiÄ zane z wykrywaniem kontaktu wzrokowego w dowolnych scenariuszach, takich jak sceny uliczne postrzegane z kamery samochodu autonomicznego lub przypadkowe tÅumy, przez ktÃģre robot moÅže musieÄ siÄ poruszaÄ i ustÄ piÄ pieszym.

Wyniki z frameworku, z âpatrzÄ cymiâ zaznaczonymi na zielono.
Badanie naukowe nosi tytuÅ Czy piesi zwracajÄ uwagÄ? Wykrywanie kontaktu wzrokowego w terenie i pochodzi od czterech naukowcÃģw z inicjatywy badawczej Visual Intelligence for Transportation (VITA) w Szwajcarii oraz jednego z Uniwersytetu Sorbona.
Architektura
WiÄkszoÅÄ poprzedniej pracy w tej dziedzinie koncentrowaÅa siÄ na uwadze kierowcy, wykorzystujÄ c uczenie maszynowe do analizy danych z kamer skierowanych na kierowcÄ, oraz opieraÅa siÄ na staÅym, staÅym i bliskim widoku kierowcy â luksusie, ktÃģry nie jest prawdopodobnie dostÄpny w czÄsto niskiej rozdzielczoÅci kamer telewizyjnych, gdzie ludzie mogÄ byÄ zbyt oddaleni, aby system analizy twarzy mÃģgÅ rozpoznaÄ ich uÅoÅženie oczu, a takÅže gdzie inne przeszkody (takie jak okulary przeciwsÅoneczne) rÃģwnieÅž stanowiÄ przeszkodÄ.
Bardziej centralne dla deklarowanego celu projektu, kamery zewnÄtrzne w pojazdach autonomicznych nie bÄdÄ koniecznie w optymalnej sytuacji, co sprawia, Åže âniskopoziomoweâ informacje o punktach kluczowych sÄ idealne jako podstawa ramy analizy spojrzenia. Systemy pojazdÃģw autonomicznych potrzebujÄ bardzo responsywnego i bÅyskawicznie szybkiego sposobu zrozumienia, czy pieszy â ktÃģry moÅže wystÄ piÄ z chodnika na ÅcieÅžkÄ samochodu â zobaczyÅ pojazd autonomiczny. W takiej sytuacji opÃģÅšnienie moÅže oznaczaÄ rÃģÅžnicÄ miÄdzy Åžyciem a ÅmierciÄ .
Modularna architektura opracowana przez naukowcÃģw przyjmuje (zwykle) peÅne ciaÅo obrazu osoby, z ktÃģrego 2D stawy sÄ wyodrÄbnione w postaci szkieletowej.

Architektura nowego francusko-szwajcarskiego systemu wykrywania kontaktu wzrokowego.
Pozycja jest normalizowana, aby usunÄ Ä informacje na osi Y, tworzÄ c âpÅaskÄ â reprezentacjÄ pozycji, ktÃģra jÄ rÃģwna z tysiÄ cami znanych pozycji nauczonej przez algorytm (ktÃģre rÃģwnieÅž zostaÅy âspÅaszczoneâ), oraz ich skojarzone flagi binarne/etykiety (tj. 0: Nie patrzy lub 1: Patrzy).
Pozycja jest porÃģwnywana z wewnÄtrznÄ wiedzÄ algorytmu o tym, jak dobrze ta postawa odpowiada obrazom innych pieszych, ktÃģre zostaÅy zidentyfikowane jako âpatrzÄ ce na kamerÄâ â adnotacje wykonane przy uÅžyciu niestandardowych narzÄdzi przeglÄ darki opracowanych przez autorÃģw dla pracownikÃģw Amazon Mechanical Turk, ktÃģrzy wziÄli udziaÅ w rozwoju zestawu danych LOOK.
KaÅžde zdjÄcie w LOOK zostaÅo poddane ocenie przez czterech pracownikÃģw AMT, a tylko zdjÄcia, w ktÃģrych trzej z czterech pracownikÃģw zgadzali siÄ co do wyniku, zostaÅy uwzglÄdnione w koÅcowej kolekcji.
Informacje o obciÄciu gÅowy, ktÃģre sÄ podstawÄ poprzedniej pracy, sÄ jednym z najmniej wiarygodnych wskaÅšnikÃģw spojrzenia w dowolnych scenariuszach miejskich i sÄ uwzglÄdnione jako opcjonalny strumieÅ danych w architekturze, gdzie jakoÅÄ i pokrycie sÄ wystarczajÄ ce, aby wesprzeÄ decyzjÄ o tym, czy osoba patrzy na kamerÄ, czy nie. W przypadku bardzo oddalonych osÃģb nie bÄdzie to przydatna informacja.
Dane
Naukowcy wyprowadzili LOOK z kilku poprzednich zestawÃģw danych, ktÃģre nie sÄ domyÅlnie przystosowane do tego zadania. Dwa zestawy danych, ktÃģre bezpoÅrednio dzielÄ zakres projektu, to JAAD i PIE, i kaÅždy z nich ma ograniczenia.
JAAD to oferta z 2017 roku z Uniwersytetu w Toronto, zawierajÄ ca 390 000 oznaczonych przykÅadÃģw pieszych, w tym prostokÄ ty i adnotacje zachowania. SpoÅrÃģd nich tylko 17 000 jest oznaczonych jako PatrzÄ cy na kierowcÄ (tj. kamerÄ ego). Zestaw danych zawiera 346 klipÃģw 30 klatek na sekundÄ, nagranych w Ameryce PÃģÅnocnej i Europie. JAAD ma wysoki wskaÅšnik powtÃģrzeÅ, a ÅÄ czna liczba unikalnych pieszych wynosi tylko 686.
Bardziej niedawny (2019) PIE, z Uniwersytetu w Toronto, jest podobny do JAAD, poniewaÅž zawiera nagrania z kamer zainstalowanych w pojeÅšdzie, tym razem pochodzÄ ce z szeÅciu godzin jazdy przez centrum Toronto, co daje 700 000 oznaczonych pieszych i 1842 unikalne piesze, z ktÃģrych tylko 180 patrzy na kamerÄ.
Zamiast tego naukowcy z nowego artykuÅu skompilowali najbardziej odpowiednie dane z trzech poprzednich zestawÃģw danych dla pojazdÃģw autonomicznych: KITTI, JRDB i NuScenes, odpowiednio z Instytutu Technologicznego w Karlsruhe w Niemczech, Stanford i Uniwersytetu Monash w Australii, oraz jednego z byÅych spin-offÃģw MIT, Nutonomy.
To kuracja wynikÅa w szeroko zrÃģÅžnicowany zestaw ujÄÄ z czterech miast â Boston, Singapur, TÞbingen i Palo Alto. Z okoÅo 8000 oznaczonych perspektyw pieszych, autorzy twierdzÄ , Åže LOOK jest najbardziej zrÃģÅžnicowanym zestawem danych do wykrywania kontaktu wzrokowego âw terenieâ.
Szkolenie i wyniki
Ekstrakcja, szkolenie i ocena zostaÅy wykonane na jednej karcie NVIDIA GeForce GTX 1080ti z 11 GB pamiÄci VRAM, dziaÅajÄ cej na procesorze Intel Core i7-8700 o czÄstotliwoÅci 3,20 GHz.
Autorzy stwierdzili, Åže ich metoda nie tylko poprawia wyniki w porÃģwnaniu z dotychczasowymi wynikami o co najmniej 5%, ale takÅže, Åže wynikowe modele szkolone na JAAD bardzo dobrze generalizujÄ na niewidoczne dane, co zostaÅo przetestowane przez poÅÄ czenie rÃģÅžnych zestawÃģw danych.
PoniewaÅž przeprowadzona ocena byÅa zÅoÅžona i musiaÅa uwzglÄdniaÄ modele oparte na obciÄciu (podczas gdy izolacja twarzy i obciÄcie nie sÄ centralnymi elementami nowej inicjatywy), zobacz artykuÅ, aby uzyskaÄ szczegÃģÅowe wyniki.

Wyniki dla Åredniej precyzji (AP) jako procent i funkcja wysokoÅci prostokÄ ta ograniczajÄ cego w pikselach dla testowania w caÅym zestawie danych JAAD, z wynikami autorÃģw wytÅuszczonymi.
Naukowcy udostÄpnili swÃģj kod publicznie, z zestawem danych dostÄpnym tutaj, a kod ÅšrÃģdÅowy na GitHub.
Autorzy koÅczÄ , wyraÅžajÄ c nadziejÄ, Åže ich praca zainspiruje dalsze badania w tym, co okreÅlajÄ jako âwaÅžny, ale zaniedbany tematâ.












