Kąt Andersona
Dane syntetyczne: Przezwyciężanie luki w okluzji za pomocą Grand Theft Auto

Badacze z Uniwersytetu Illinois stworzyli nowy zestaw danych wizji komputerowej, który wykorzystuje syntetyczne obrazy generowane przez silnik gry Grand Theft Auto, aby pomóc rozwiązać jeden z najtrudniejszych problemów w segmencie semantycznym – rozpoznawaniu obiektów, które są tylko częściowo widoczne w źródłowych obrazach i filmach.
W tym celu, jak opisano w artykule, badacze wykorzystali silnik gry GTA-V do wygenerowania syntetycznego zestawu danych, który nie tylko zawiera rekordową liczbę przypadków okluzji, ale także posiada idealną segmentację semantyczną i etykietowanie, oraz uwzględnia informacje czasowe w sposób, który nie jest uwzględniony w podobnych zestawach danych open source.
Pełne zrozumienie sceny
Poniższy film, opublikowany jako materiał wspierający badania, ilustruje zalety pełnego zrozumienia sceny 3D, w którym ukryte obiekty są znane i ujawnione w scenie we wszystkich okolicznościach, umożliwiając systemowi oceny naukę kojarzenia częściowo okluzji z całością (oznaczonego) obiektu.
Źródło: http://sailvos.web.illinois.edu/_site/index.html
Wynikowy zestaw danych, nazwany SAIL-VOS 3D, jest przez autorów określany jako pierwszy syntetyczny zestaw danych wideo z siatką, z klatka po klatce, z poziomem instancji, z głębią sceny i z adnotacjami 2D wyznaczonymi przez prostokąty ograniczające.

Źródło (Kliknij, aby powiększyć)
Adnotacje SAIL-VOS 3D obejmują głębię, poziom instancji, modalną i amodalną segmentację, etykiety semantyczne i siatki 3D. Dane obejmują 484 filmy, łącznie 237 611 klatek w rozdzielczości 1280×800, w tym przejścia między ujęciami.

Powyżej, oryginalne ramki CGI; drugi rząd, segmentacja na poziomie instancji; trzeci rząd, amodalna segmentacja, która ilustruje głębię zrozumienia sceny i przejrzystość dostępną w danych. Źródło (Kliknij, aby powiększyć)
Zestaw dzieli się na 6 807 klipów o średniej długości 34,6 klatek, a dane są adnotowane z 3 460 213 instancji obiektów pochodzących z 3 576 modeli siatki w silniku gry GTA-V. Są one przypisane do łącznie 178 kategorii semantycznych.
Rekonstrukcja siatki i automatyczne etykietowanie
Ponieważ późniejsze badania nad zestawem danych prawdopodobnie będą prowadzone na rzeczywistych obrazach, siatki w SAIL-VOS 3D są generowane przez ramę uczenia maszynowego, a nie pochodzą z silnika gry GTA-V.

Z programowym i w zasadzie ‘holograficznym’ zrozumieniem całej reprezentacji sceny, obrazy SAIL-VOS 3D mogą syntetyzować reprezentacje obiektów zwykle ukrytych przez okluzje, takich jak odwrócona ręka postaci tutaj, w sposób, który w przeciwnym razie zależałby od wielu reprezentatywnych przypadków w rzeczywistych nagraniach. (Kliknij, aby powiększyć) Źródło: https://arxiv.org/pdf/2105.08612.pdf
Ponieważ każdy obiekt w świecie GTA-V zawiera unikalny identyfikator, SAIL-VOS pobiera je z silnika renderującego za pomocą biblioteki haków skryptowych GTA-V. Rozwiązuje to problem ponownego pozyskania obiektu, jeśli tymczasowo opuści pole widzenia, ponieważ etykietowanie jest trwałe i godne zaufania. Dostępnych jest 162 obiektów w środowisku, które badacze przypisali do odpowiedniej liczby klas.
Różnorodność scen i obiektów
Wiele obiektów w silniku gry GTA-V jest powszechne w naturze, a zatem inwentarz SAIL-VOS zawiera szczęśliwie 60% klas obecnych w często używanym zestawie danych MS-COCO z 2014 roku.

Zestaw danych SAIL-VOS zawiera dużą różnorodność wnętrz i zewnętrznych scen w różnych warunkach pogodowych, z postaciami noszącymi różne ubrania. (Kliknij, aby powiększyć)
Stosowalność
Aby zapewnić zgodność z ogólnym nurtem badań w tej dziedzinie oraz potwierdzić, że ten syntetyczny podejście może przynieść korzyści nie-syntetycznym projektom, badacze ocenili zestaw danych za pomocą podejścia wykrywania klatka po klatce zastosowanego dla MS-COCO i wyzwania PASCAL Visual Object Classes (VOC) z 2012 roku, z dokładnością średnią jako miarą.
Badacze stwierdzili, że wstępne szkolenie na zestawie danych SAIL-VOS poprawia wydajność współczynnika przecięcia i związku (IoU) o 19%, z odpowiadającą poprawą wydajności VideoMatch, z 55% do 74% na nieznanym danych.
Jednak w przypadkach ekstremalnej okluzji zdarzały się sytuacje, w których wszystkie starsze metody pozostawały niezdolne do identyfikacji obiektu lub osoby, chociaż badacze przewidują, że może to być w przyszłości naprawione poprzez analizę sąsiednich klatek w celu ustalenia powodu maski amodalnej.













