Kąt Andersona

Wykrywanie kontaktu wzrokowego z pozycji ciała za pomocą uczenia maszynowego

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Naukowcy z Francji i Szwajcarii opracowali system wizji komputerowej, ktÃģry moÅže oszacować, czy osoba patrzy bezpośrednio na kamerę systemu AI, wyłącznie na podstawie sposobu, w jaki osoba stoi lub porusza się.

Nowy framework wykorzystuje bardzo ograniczone informacje do tej oceny, w postaci semantycznych punktÃģw kluczowych (patrz poniÅžszy obraz), zamiast prÃģby analizy połoÅženia oczu na zdjęciach twarzy. To sprawia, Åže wynikowa metoda wykrywania jest bardzo lekka i zwinna w porÃģwnaniu z bardziej danych-intensywnymi architekturami wykrywania obiektÃģw, takimi jak YOLO.

Nowy framework ocenia, czy osoba na ulicy patrzy na czujnik AI, wyłącznie na podstawie ułoÅženia jej ciała. Tutaj osoby zaznaczone na zielono są prawdopodobnie patrzące na kamerę, podczas gdy te na czerwono są bardziej prawdopodobne, Åže patrzą gdzie indziej.

Nowy framework ocenia, czy osoba na ulicy patrzy na czujnik AI, wyłącznie na podstawie ułoÅženia jej ciała. Tutaj osoby zaznaczone na zielono są prawdopodobnie patrzące na kamerę, podczas gdy te na czerwono są bardziej prawdopodobne, Åže patrzą gdzie indziej. ÅđrÃģdło: https://arxiv.org/pdf/2112.04212.pdf

ChociaÅž praca jest zmotywowana rozwojem lepszych systemÃģw bezpieczeństwa dla pojazdÃģw autonomicznych, autorzy nowego artykułu przyznają, Åže moÅže mieć bardziej ogÃģlne zastosowania w innych branÅžach, obserwując ‘nawet w inteligentnych miastach, wykrywanie kontaktu wzrokowego moÅže być przydatne do lepszego zrozumienia zachowań pieszych, np. określenia, gdzie kierują swoją uwagę lub ktÃģre znaki drogowe obserwują’.

Aby ułatwić dalszy rozwÃģj tego i następnych systemÃģw, naukowcy skompilowali nowy i kompleksowy zestaw danych o nazwie LOOK, ktÃģry bezpośrednio rozwiązuje specyficzne wyzwania związane z wykrywaniem kontaktu wzrokowego w dowolnych scenariuszach, takich jak sceny uliczne postrzegane z kamery samochodu autonomicznego lub przypadkowe tłumy, przez ktÃģre robot moÅže musieć się poruszać i ustąpić pieszym.

Wyniki z frameworku, z 'patrzącymi' zaznaczonymi na zielono.

Wyniki z frameworku, z ‘patrzącymi’ zaznaczonymi na zielono.

Badanie naukowe nosi tytuł Czy piesi zwracają uwagę? Wykrywanie kontaktu wzrokowego w terenie i pochodzi od czterech naukowcÃģw z inicjatywy badawczej Visual Intelligence for Transportation (VITA) w Szwajcarii oraz jednego z Uniwersytetu Sorbona.

Architektura

Większość poprzedniej pracy w tej dziedzinie koncentrowała się na uwadze kierowcy, wykorzystując uczenie maszynowe do analizy danych z kamer skierowanych na kierowcę, oraz opierała się na stałym, stałym i bliskim widoku kierowcy – luksusie, ktÃģry nie jest prawdopodobnie dostępny w często niskiej rozdzielczości kamer telewizyjnych, gdzie ludzie mogą być zbyt oddaleni, aby system analizy twarzy mÃģgł rozpoznać ich ułoÅženie oczu, a takÅže gdzie inne przeszkody (takie jak okulary przeciwsłoneczne) rÃģwnieÅž stanowią przeszkodę.

Bardziej centralne dla deklarowanego celu projektu, kamery zewnętrzne w pojazdach autonomicznych nie będą koniecznie w optymalnej sytuacji, co sprawia, Åže ‘niskopoziomowe’ informacje o punktach kluczowych są idealne jako podstawa ramy analizy spojrzenia. Systemy pojazdÃģw autonomicznych potrzebują bardzo responsywnego i błyskawicznie szybkiego sposobu zrozumienia, czy pieszy – ktÃģry moÅže wystąpić z chodnika na ścieÅžkę samochodu – zobaczył pojazd autonomiczny. W takiej sytuacji opÃģÅšnienie moÅže oznaczać rÃģÅžnicę między Åžyciem a śmiercią.

Modularna architektura opracowana przez naukowcÃģw przyjmuje (zwykle) pełne ciało obrazu osoby, z ktÃģrego 2D stawy są wyodrębnione w postaci szkieletowej.

Architektura nowego francusko-szwajcarskiego systemu wykrywania kontaktu wzrokowego.

Architektura nowego francusko-szwajcarskiego systemu wykrywania kontaktu wzrokowego.

Pozycja jest normalizowana, aby usunąć informacje na osi Y, tworząc ‘płaską’ reprezentację pozycji, ktÃģra ją rÃģwna z tysiącami znanych pozycji nauczonej przez algorytm (ktÃģre rÃģwnieÅž zostały ‘spłaszczone’), oraz ich skojarzone flagi binarne/etykiety (tj. 0: Nie patrzy lub 1: Patrzy).

Pozycja jest porÃģwnywana z wewnętrzną wiedzą algorytmu o tym, jak dobrze ta postawa odpowiada obrazom innych pieszych, ktÃģre zostały zidentyfikowane jako ‘patrzące na kamerę’ – adnotacje wykonane przy uÅžyciu niestandardowych narzędzi przeglądarki opracowanych przez autorÃģw dla pracownikÃģw Amazon Mechanical Turk, ktÃģrzy wzięli udział w rozwoju zestawu danych LOOK.

KaÅžde zdjęcie w LOOK zostało poddane ocenie przez czterech pracownikÃģw AMT, a tylko zdjęcia, w ktÃģrych trzej z czterech pracownikÃģw zgadzali się co do wyniku, zostały uwzględnione w końcowej kolekcji.

Informacje o obcięciu głowy, ktÃģre są podstawą poprzedniej pracy, są jednym z najmniej wiarygodnych wskaÅšnikÃģw spojrzenia w dowolnych scenariuszach miejskich i są uwzględnione jako opcjonalny strumień danych w architekturze, gdzie jakość i pokrycie są wystarczające, aby wesprzeć decyzję o tym, czy osoba patrzy na kamerę, czy nie. W przypadku bardzo oddalonych osÃģb nie będzie to przydatna informacja.

Dane

Naukowcy wyprowadzili LOOK z kilku poprzednich zestawÃģw danych, ktÃģre nie są domyślnie przystosowane do tego zadania. Dwa zestawy danych, ktÃģre bezpośrednio dzielą zakres projektu, to JAAD i PIE, i kaÅždy z nich ma ograniczenia.

JAAD to oferta z 2017 roku z Uniwersytetu w Toronto, zawierająca 390 000 oznaczonych przykładÃģw pieszych, w tym prostokąty i adnotacje zachowania. SpośrÃģd nich tylko 17 000 jest oznaczonych jako Patrzący na kierowcę (tj. kamerę ego). Zestaw danych zawiera 346 klipÃģw 30 klatek na sekundę, nagranych w Ameryce PÃģłnocnej i Europie. JAAD ma wysoki wskaÅšnik powtÃģrzeń, a łączna liczba unikalnych pieszych wynosi tylko 686.

Bardziej niedawny (2019) PIE, z Uniwersytetu w Toronto, jest podobny do JAAD, poniewaÅž zawiera nagrania z kamer zainstalowanych w pojeÅšdzie, tym razem pochodzące z sześciu godzin jazdy przez centrum Toronto, co daje 700 000 oznaczonych pieszych i 1842 unikalne piesze, z ktÃģrych tylko 180 patrzy na kamerę.

Zamiast tego naukowcy z nowego artykułu skompilowali najbardziej odpowiednie dane z trzech poprzednich zestawÃģw danych dla pojazdÃģw autonomicznych: KITTI, JRDB i NuScenes, odpowiednio z Instytutu Technologicznego w Karlsruhe w Niemczech, Stanford i Uniwersytetu Monash w Australii, oraz jednego z byłych spin-offÃģw MIT, Nutonomy.

To kuracja wynikła w szeroko zrÃģÅžnicowany zestaw ujęć z czterech miast – Boston, Singapur, TÞbingen i Palo Alto. Z około 8000 oznaczonych perspektyw pieszych, autorzy twierdzą, Åže LOOK jest najbardziej zrÃģÅžnicowanym zestawem danych do wykrywania kontaktu wzrokowego “w terenie”.

Szkolenie i wyniki

Ekstrakcja, szkolenie i ocena zostały wykonane na jednej karcie NVIDIA GeForce GTX 1080ti z 11 GB pamięci VRAM, działającej na procesorze Intel Core i7-8700 o częstotliwości 3,20 GHz.

Autorzy stwierdzili, Åže ich metoda nie tylko poprawia wyniki w porÃģwnaniu z dotychczasowymi wynikami o co najmniej 5%, ale takÅže, Åže wynikowe modele szkolone na JAAD bardzo dobrze generalizują na niewidoczne dane, co zostało przetestowane przez połączenie rÃģÅžnych zestawÃģw danych.

PoniewaÅž przeprowadzona ocena była złoÅžona i musiała uwzględniać modele oparte na obcięciu (podczas gdy izolacja twarzy i obcięcie nie są centralnymi elementami nowej inicjatywy), zobacz artykuł, aby uzyskać szczegÃģłowe wyniki.

Wyniki dla średniej precyzji (AP) jako procent i funkcja wysokości prostokąta ograniczającego w pikselach dla testowania w całym zestawie danych JAAD, z wynikami autorÃģw wytłuszczonymi.

Wyniki dla średniej precyzji (AP) jako procent i funkcja wysokości prostokąta ograniczającego w pikselach dla testowania w całym zestawie danych JAAD, z wynikami autorÃģw wytłuszczonymi.

Naukowcy udostępnili swÃģj kod publicznie, z zestawem danych dostępnym tutaj, a kod ÅšrÃģdłowy na GitHub.

Autorzy kończą, wyraÅžając nadzieję, Åže ich praca zainspiruje dalsze badania w tym, co określają jako ‘waÅžny, ale zaniedbany temat’.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]