Kąt Andersona

Dane syntetyczne: Przezwyciężanie luki w okluzji za pomocą Grand Theft Auto

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Uniwersytetu Illinois stworzyli nowy zestaw danych wizji komputerowej, który wykorzystuje syntetyczne obrazy generowane przez silnik gry Grand Theft Auto, aby pomóc rozwiązać jeden z najtrudniejszych problemów w segmencie semantycznym – rozpoznawaniu obiektów, które są tylko częściowo widoczne w źródłowych obrazach i filmach.

W tym celu, jak opisano w artykule, badacze wykorzystali silnik gry GTA-V do wygenerowania syntetycznego zestawu danych, który nie tylko zawiera rekordową liczbę przypadków okluzji, ale także posiada idealną segmentację semantyczną i etykietowanie, oraz uwzględnia informacje czasowe w sposób, który nie jest uwzględniony w podobnych zestawach danych open source.

Pełne zrozumienie sceny

Poniższy film, opublikowany jako materiał wspierający badania, ilustruje zalety pełnego zrozumienia sceny 3D, w którym ukryte obiekty są znane i ujawnione w scenie we wszystkich okolicznościach, umożliwiając systemowi oceny naukę kojarzenia częściowo okluzji z całością (oznaczonego) obiektu.

Źródło: http://sailvos.web.illinois.edu/_site/index.html

Wynikowy zestaw danych, nazwany SAIL-VOS 3D, jest przez autorów określany jako pierwszy syntetyczny zestaw danych wideo z siatką, z klatka po klatce, z poziomem instancji, z głębią sceny i z adnotacjami 2D wyznaczonymi przez prostokąty ograniczające.

Źródło (Kliknij, aby powiększyć)

Adnotacje SAIL-VOS 3D obejmują głębię, poziom instancji, modalną i amodalną segmentację, etykiety semantyczne i siatki 3D. Dane obejmują 484 filmy, łącznie 237 611 klatek w rozdzielczości 1280×800, w tym przejścia między ujęciami.

Powyżej, oryginalne ramki CGI; drugi rząd, segmentacja na poziomie instancji; trzeci rząd, amodalna segmentacja, która ilustruje głębię zrozumienia sceny i przejrzystość dostępną w danych. Źródło

Powyżej, oryginalne ramki CGI; drugi rząd, segmentacja na poziomie instancji; trzeci rząd, amodalna segmentacja, która ilustruje głębię zrozumienia sceny i przejrzystość dostępną w danych. Źródło (Kliknij, aby powiększyć)

Zestaw dzieli się na 6 807 klipów o średniej długości 34,6 klatek, a dane są adnotowane z 3 460 213 instancji obiektów pochodzących z 3 576 modeli siatki w silniku gry GTA-V. Są one przypisane do łącznie 178 kategorii semantycznych.

Rekonstrukcja siatki i automatyczne etykietowanie

Ponieważ późniejsze badania nad zestawem danych prawdopodobnie będą prowadzone na rzeczywistych obrazach, siatki w SAIL-VOS 3D są generowane przez ramę uczenia maszynowego, a nie pochodzą z silnika gry GTA-V.

Z programowym i w zasadzie 'holograficznym' zrozumieniem całej reprezentacji sceny, obrazy SAIL-VOS 3D mogą syntetyzować reprezentacje obiektów zwykle ukrytych przez okluzje, takich jak odwrócona ręka postaci tutaj, w sposób, który w przeciwnym razie zależałby od wielu reprezentatywnych przypadków w rzeczywistych nagraniach. Źródło: https://arxiv.org/pdf/2105.08612.pdf

Z programowym i w zasadzie ‘holograficznym’ zrozumieniem całej reprezentacji sceny, obrazy SAIL-VOS 3D mogą syntetyzować reprezentacje obiektów zwykle ukrytych przez okluzje, takich jak odwrócona ręka postaci tutaj, w sposób, który w przeciwnym razie zależałby od wielu reprezentatywnych przypadków w rzeczywistych nagraniach. (Kliknij, aby powiększyć) Źródło: https://arxiv.org/pdf/2105.08612.pdf

Ponieważ każdy obiekt w świecie GTA-V zawiera unikalny identyfikator, SAIL-VOS pobiera je z silnika renderującego za pomocą biblioteki haków skryptowych GTA-V. Rozwiązuje to problem ponownego pozyskania obiektu, jeśli tymczasowo opuści pole widzenia, ponieważ etykietowanie jest trwałe i godne zaufania. Dostępnych jest 162 obiektów w środowisku, które badacze przypisali do odpowiedniej liczby klas.

Różnorodność scen i obiektów

Wiele obiektów w silniku gry GTA-V jest powszechne w naturze, a zatem inwentarz SAIL-VOS zawiera szczęśliwie 60% klas obecnych w często używanym zestawie danych MS-COCO z 2014 roku.

Zestaw danych SAIL-VOS zawiera dużą różnorodność wnętrz i zewnętrznych scen w różnych warunkach pogodowych, z postaciami noszącymi różne ubrania.

Zestaw danych SAIL-VOS zawiera dużą różnorodność wnętrz i zewnętrznych scen w różnych warunkach pogodowych, z postaciami noszącymi różne ubrania. (Kliknij, aby powiększyć)

Stosowalność

Aby zapewnić zgodność z ogólnym nurtem badań w tej dziedzinie oraz potwierdzić, że ten syntetyczny podejście może przynieść korzyści nie-syntetycznym projektom, badacze ocenili zestaw danych za pomocą podejścia wykrywania klatka po klatce zastosowanego dla MS-COCO i wyzwania PASCAL Visual Object Classes (VOC) z 2012 roku, z dokładnością średnią jako miarą.

Badacze stwierdzili, że wstępne szkolenie na zestawie danych SAIL-VOS poprawia wydajność współczynnika przecięcia i związku (IoU) o 19%, z odpowiadającą poprawą wydajności VideoMatch, z 55% do 74% na nieznanym danych.

Jednak w przypadkach ekstremalnej okluzji zdarzały się sytuacje, w których wszystkie starsze metody pozostawały niezdolne do identyfikacji obiektu lub osoby, chociaż badacze przewidują, że może to być w przyszłości naprawione poprzez analizę sąsiednich klatek w celu ustalenia powodu maski amodalnej.

W dwóch prawych obrazach tradycyjne algorytmy segmentacji nie były w stanie zidentyfikować postaci kobiecej z bardzo ograniczonej części jej głowy, która jest widoczna. Późniejsze innowacje z oceną optycznego przepływu mogą poprawić te wyniki.

W dwóch prawych obrazach tradycyjne algorytmy segmentacji nie były w stanie zidentyfikować postaci kobiecej z bardzo ograniczonej części jej głowy, która jest widoczna. Późniejsze innowacje z oceną optycznego przepływu mogą poprawić te wyniki. (Kliknij, aby powiększyć)

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai