Unghiul lui Anderson
Date Synthetică: Podurile Lacunei de Occluzie Cu Grand Theft Auto

Cercetătorii de la Universitatea din Illinois au creat o nouă bază de date de viziune computerizată care utilizează imagini sintetice generate de un motor de joc Grand Theft Auto pentru a ajuta la rezolvarea uneia dintre cele mai spinoase obstacole în segmentarea semantică – recunoașterea obiectelor care sunt doar parțial vizibile în imagini și videouri sursă.
În acest scop, așa cum este descris în articol, cercetătorii au utilizat motorul de joc GTA-V pentru a genera o bază de date sintetică care nu numai că prezintă un număr record de instanțe de occluzie, dar care are și o segmentare semantică perfectă și etichetare, și ia în considerare informații temporale într-un mod care nu este abordat de seturile de date deschise similare.
Înțelegerea Completa a Scenei
Videoul de mai jos, publicat ca material de susținere pentru cercetare, ilustrează avantajele unei înțelegeri complete 3D a scenei, în care obiectele ascunse sunt cunoscute și expuse în scena în toate circumstanțele, permițând sistemului de evaluare să învețe să asocieze vederi parțial ocluzionate cu obiectul întreg (etichetat).
Sursă: http://sailvos.web.illinois.edu/_site/index.html
Baza de date rezultată, numită SAIL-VOS 3D, este descrisă de autori ca fiind prima bază de date video sintetică cu anotare cadru cu cadru, segmentare la nivel de instanță, adâncime de scenă și anotări 2D delimitate de cutii de încadrare.

Sursă (Click pentru mărire)
Anotările SAIL-VOS 3D includ adâncime, segmentare modală la nivel de instanță și segmentare amodală, etichete semantice și rețele 3D. Datele includ 484 de videouri care totalizează 237.611 de cadre la rezoluția 1280×800, incluzând tranziții de filmare.

Deasupra, cadrele CGI originale; al doilea rând, segmentarea la nivel de instanță; al treilea rând, segmentarea amodală, care ilustrează profunzimea înțelegerii scenei și transparența disponibilă în date. Sursă (Click pentru mărire)
Setul se descompune în 6.807 de clipuri cu o medie de 34,6 de cadre fiecare, iar datele sunt anotate cu 3.460.213 de instanțe de obiecte provenite de la 3.576 de modele de rețea din motorul de joc GTA-V. Acestea sunt atribuite unui total de 178 de categorii semantice.
Reconstrucția Rețelei și Etichetarea Automată
Deoarece cercetările ulterioare asupra bazei de date vor avea loc probabil pe imagini din lumea reală, rețelele din SAIL-VOS 3D sunt generate de cadrul de învățare automată, și nu derivate din motorul GTA-V.

Cu o înțelegere programatică și esențialmente ‘holografică’ a întregii reprezentări a scenei, imagini SAIL-VOS 3D pot sintetiza reprezentări ale obiectelor care sunt în mod normal ascunse de ocluzii, cum ar fi brațul personajului care se întoarce aici, într-un mod care ar depinde altfel de multe exemple reprezentative în imagini din lumea reală. (Click pentru mărire) Sursă: https://arxiv.org/pdf/2105.08612.pdf
Deoarece fiecare obiect din lumea GTA-V conține un ID unic, SAIL-VOS recuperează acestea din motorul de render utilizând biblioteca de hook-uri de script GTA-V. Acest lucru rezolvă problema de a reobține subiectul dacă acesta ar trebui să părăsească temporar câmpul vizual, deoarece etichetarea este persistentă și de încredere. Există 162 de obiecte disponibile în mediu, pe care cercetătorii le-au mapat la un număr corespunzător de clase.
O Varietate De Scene Și Obiecte
Multe dintre obiectele din motorul GTA-V sunt comune în natură, și prin urmare, inventarul SAIL-VOS conține o parte norocoasă de 60% din clasele prezente în setul de date MS-COCO din 2014, frecvent utilizat de Microsoft.

Baza de date SAIL-VOS include o varietate mare de scene interioare și exterioare în diferite condiții meteorologice, cu personaje care poartă îmbrăcăminte variată. (Click pentru mărire)
Aplicabilitate
Pentru a asigura compatibilitatea cu cercetarea generală în acest domeniu și pentru a confirma că această abordare sintetică poate beneficia și proiecte non-sintetice, cercetătorii au evaluat baza de date utilizând abordarea de detectare pe bază de cadre utilizată pentru MS-COCO și provocarea PASCAL Visual Object Classes (VOC) din 2012, cu precizie medie ca metrică.
Cercetătorii au constatat că antrenarea prealabilă pe baza de date SAIL-VOS îmbunătățește performanța intersecției peste uniune (IoU) cu 19%, cu o îmbunătățire corespunzătoare a performanței VideoMatch, de la 55% la 74% pe date nevizionate.
În cazuri de ocluzie extremă, au existat ocazii când toate metodele mai vechi au rămas incapabile să identifice un obiect sau o persoană, deși cercetătorii prevăd că acest lucru ar putea fi remediat în viitor prin examinarea cadrului adiacent pentru a stabili motivul mascării amodale.













