Andersonin kulma
Synteettinen Data: Siltauskuilun Sulkeminen Grand Theft Auton Avulla

Tutkijat Illinoisin yliopistosta ovat luoneet uuden tietokoneen näön aineiston, joka käyttää synteettistä kuvamateriaalia Grand Theft Auto -pelimoottorista, jotta voidaan ratkaista yksi tietokoneen näön merkittävimmistä ongelmista – tunnistaa osittain näkyvät objektit lähdemateriaaleista ja videoista.
Tähän tarkoitukseen tutkijat ovat käyttäneet GTA-V-pelimoottoria luomaan synteettisen aineiston, joka sisältää ennätyksellisen määrän osittain näkyvien objektien esimerkkejä, täydellisen semanttisen segmentoinnin ja merkinnän, sekä ottaa huomioon aikaisemman tiedon tavalla, jota ei muissa avoimissa aineistoissa käsitellä.
Täydellinen Kohteen Ymmärtäminen
Alla oleva video, joka on julkaistu tutkimuksen tueksi, osoittaa täydellisen 3D-kohteen ymmärtämisen edut, jossa peitetyt objektit ovat tiedossa ja paljastuvat kohteessa kaikissa olosuhteissa, mahdollistaen arviointijärjestelmän oppimisen liittämään osittain peitetyt näkymät koko (merkitty) objektiin.
Lähde: http://sailvos.web.illinois.edu/_site/index.html
Tuloksena oleva aineisto, joka on nimeltään SAIL-VOS 3D, on ensimmäinen synteettinen videoaineisto, jossa on kehyskohtaiset merkinnät, instanssitason segmentointi, syvyyden totuus näkymistä ja 2D-merkinnät, jotka on määritelty rajoittimilla.

Lähde (Klikkaa suurennusta varten)
SAIL-VOS 3D -aineiston merkinnät sisältävät syvyyden, instanssitason modaaliset ja amodaaliset segmentoinnit, semanttiset merkinnät ja 3D-mallit. Aineistossa on 484 videota, jotka sisältävät yhteensä 237 611 kehystä 1280×800-resoluutiolla, mukaan lukien leikkausSiirtymät.

Ylempänä alkuperäiset CGI-kehykset; toisella rivillä instanssitason segmentointi; kolmannella rivillä amodaalinen segmentointi, joka osoittaa kohteen ymmärtämisen syvyyden ja läpinäkyvyyden, jotka ovat saatavilla aineistossa. Lähde (Klikkaa suurennusta varten)
Aineisto jakautuu 6 807 klippiin, joissa on keskimäärin 34,6 kehystä kussakin, ja aineistossa on yhteensä 3 460 213 objektin instanssia, jotka on peräisin 3 576 mallista GTA-V-pelimoottorissa. Nämä on liitetty yhteensä 178 semanttiseen luokkaan.
Verkkomallien Rakentaminen Ja Automatisoitu Merkintä
Koska myöhempi aineistotutkimus tapahtuu todellisista kuvista, SAIL-VOS 3D -aineistossa olevat verkkomallit on luotu koneoppimisalgoritmin avulla, eikä ne ole johdettu GTA-V-pelimoottorista.

Ohjelmallinen ja holografisen kaltaisen kohteen esitystavan ansiosta SAIL-VOS 3D -kuvat voivat synnyttää edustuksia objekteista, jotka ovat normaalisti piilossa peittävien objektien takana, kuten hahmon kääntymisen aikana osoittama käsivarsi, jota voidaan muuten vain havaita useiden edustavien esimerkkien kautta oikeasta kuvamateriaalista. (Klikkaa suurennusta varten) Lähde: https://arxiv.org/pdf/2105.08612.pdf
Koska jokainen objektissa GTA-V-maailmassa on yksilöivä tunniste, SAIL-VOS hakee nämä renderöintimoottorista käyttäen GTA-V-skriptihakukirjastoa. Tämä ratkaisee ongelman objektin uudelleenhankkimisesta, jos se poistuu väliaikaisesti näkyvistä, koska merkintä on kestävä ja luotettava. Ympäristössä on 162 objektitia, jotka tutkijat ovat kartoittaneet vastaavaan määrään luokkia.
Monipuolinen Valikoima Kohteita Ja Objekteja
Monet GTA-V-pelimoottorin objekteista ovat yleisiä luonnossa, ja siten SAIL-VOS-inventointi sisältää onnekkaan 60 % Microsoftin vuoden 2014 MS-COCO-aineistosta olevista luokista.

SAIL-VOS-aineistossa on laaja valikoima sisä- ja ulkokohteita eri sääolosuhteissa, ja hahmot ovat pukeutuneet eri vaatteisiin. (Klikkaa suurennusta varten)
Soveltuvuus
Tutkijat ovat arvioineet aineistoa kehyspohjaisen havaintomenetelmän avulla, jota käytetään MS-COCO- ja vuoden 2012 PASCAL Visual Object Classes (VOC) -haasteessa, ja keskiarvoisen tarkinäisyysarvon avulla.
Tutkijat totesivat, että esikoulutus SAIL-VOS-aineistolla parantaa leikkausympäristön (IoU) suorituskykyä 19 %, ja vastaavasti parantaa VideoMatch -suorituskykyä 55 %:sta 74 %:iin näkymättömissä aineistoissa.
Kuitenkin äärimmäisen peittävien tapauksissa vanhemmat menetelmät eivät pystyneet tunnistamaan objektia tai henkilöä, vaikka tutkijat ennustavat, että tämä voidaan korjata tulevaisuudessa tutkimalla viereisiä kehyksiä, jotta voidaan perustella amodaalisen maskin syy.













