Andersons vinkel

Syntetisk data: Broer gapet med okklusjon med Grand Theft Auto

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere ved University of Illinois har laget en ny datasett for datavisjon som bruker syntetiske bilder generert av Grand Theft Auto-spillmotoren for å løse ett av de største hindrene i semantisk segmentering – å gjenkjenne objekter som bare delvis er synlige i kildebilder og videoer.

For å oppnå dette, som beskrevet i artikkelen, har forskerne brukt GTA-V-spillmotoren til å generere en syntetisk datasett som ikke bare inneholder et rekordhøyt antall okklusjonsinstanser, men som også har perfekt semantisk segmentering og merking, og som tar hensyn til tidsinformasjon på en måte som ikke håndteres av lignende åpne datasett.

Fullstendig forståelse av scenen

Videoen under, som er publisert som støtteinformasjon for forskningen, illustrerer fordelen med en fullstendig 3D-forståelse av en scene, hvor skjulte objekter er kjent og avdekket i scenen under alle omstendigheter, og som gjør det mulig for vurderingssystemet å lære å assosiere delvis okkluderte visninger med hele (merkede) objektet.

Kilde: http://sailvos.web.illinois.edu/_site/index.html

Den resulterende datasetten, kalt SAIL-VOS 3D, hevdes av forfatterne å være den første syntetiske video-mesh-datasetten med ramme-for-ramme-merking, instansnivå-segmentering, grunntruth-dybde for scenvisninger og 2D-merking avgrenset av avgrensningsskjermer.

Kilde (Klikk for å forstørre)

Merkningene i SAIL-VOS 3D inkluderer dybde, instansnivå-modus og amodal segmentering, semantiske merker og 3D-mesh. Dataene inkluderer 484 videoer som tilsammen består av 237 611 ramer i oppløsning 1280×800, inkludert skift mellom scener.

Ovenfor, de originale CGI-rammene; andre rad, instansnivå-segmentering; tredje rad, amodal segmentering, som viser dybden av sceneforståelse og gjennomsiktighet tilgjengelig i dataene. Kilde

Ovenfor, de originale CGI-rammene; andre rad, instansnivå-segmentering; tredje rad, amodal segmentering, som viser dybden av sceneforståelse og gjennomsiktighet tilgjengelig i dataene. Kilde (Klikk for å forstørre)

Datasettene deles inn i 6 807 klipp med en gjennomsnittlig lengde på 34,6 ramer hver, og dataene er merket med 3 460 213 objektinstanser som stammer fra 3 576 mesh-modeller i GTA-V-spillmotoren. Disse er tilordnet til totalt 178 semantiske kategorier.

Mesh-rekonstruksjon og automatisert merking

Ettersom senere datasett-forskning sannsynligvis vil skje på virkelige bilder, er meshene i SAIL-VOS 3D generert av maskinlæringsrammeverket, i stedet for å være avledet fra GTA-V-motoren.

Med en programmerbar og i hovedsak 'holografisk' forståelse av hele scenerepresentasjonen, kan SAIL-VOS 3D-bilder syntetisere representasjoner av objekter som vanligvis er skjult av okklusjoner, som den fjerne armen til figuren som snur rundt her, på en måte som ellers ville avhenge av mange representative eksempler i virkelige bilder. Kilde: https://arxiv.org/pdf/2105.08612.pdf

Med en programmerbar og i hovedsak ‘holografisk’ forståelse av hele scenerepresentasjonen, kan SAIL-VOS 3D-bilder syntetisere representasjoner av objekter som vanligvis er skjult av okklusjoner, som den fjerne armen til figuren som snur rundt her, på en måte som ellers ville avhenge av mange representative eksempler i virkelige bilder. (Klikk for å forstørre) Kilde: https://arxiv.org/pdf/2105.08612.pdf

Ettersom hvert objekt i GTA-V-verdenen inneholder en unik ID, henter SAIL-VOS disse fra renderingmotoren ved hjelp av GTA-V-skriptkroken. Dette løser problemet med å gjenopprette emnet hvis det forlater synsfeltet midlertidig, da merkingen er varig og pålitelig. Det er 162 objekter tilgjengelige i miljøet, som forskerne har kartlagt til en tilsvarende antall klasser.

En variasjon av scener og objekter

Mange av objektene i GTA-V-motoren er vanlige i naturen, og derfor inneholder SAIL-VOS-inventaret en heldig 60% av klassene til stede i Microsofts ofte brukte 2014 MS-COCO-datasett.

SAIL-VOS-datasettene inkluderer en stor variasjon av interiør- og eksteriørscener under forskjellige værforhold, med figurer som bærer varierte klær.

SAIL-VOS-datasettene inkluderer en stor variasjon av interiør- og eksteriørscener under forskjellige værforhold, med figurer som bærer varierte klær. (Klikk for å forstørre)

Anvendelighet

For å sikre kompatibilitet med den generelle forskningen i dette området, og for å bekrefte at denne syntetiske tilnærmingen kan være til nytte for ikke-syntetiske prosjekter, evaluerte forskerne datasettene ved hjelp av ramme-basert deteksjonsmetode brukt for MS-COCO og 2012 PASCAL Visual Object Classes (VOC) Challenge, med gjennomsnittlig nøyaktighet som målestokk.

Forskerne fant at fortrening på SAIL-VOS-datasettene forbedrer Intersection over Union (IoU) med 19%, med en tilsvarende forbedring i VideoMatch-ytelse, fra 55% til 74% på usette data.

Men i tilfeller med ekstreme okklusjoner, var det noen ganger når alle de eldre metodene fortsatt ikke kunne gjenkjenne et objekt eller en person, selv om forskerne forutså at dette kunne være løst i fremtiden ved å undersøke naboframer for å etablere grunnene for den amodale masken.

I de to høyre bildene, har tradisjonelle segmenteringsalgoritmer feilet i å gjenkjenne den kvinnelige figuren fra den svært begrensede delen av hodet som er synlig. Senere innovasjoner med optisk flytevaluering kan forbedre disse resultater.

I de to høyre bildene, har tradisjonelle segmenteringsalgoritmer feilet i å gjenkjenne den kvinnelige figuren fra den svært begrensede delen av hodet som er synlig. Senere innovasjoner med optisk flytevaluering kan forbedre disse resultater. (Klikk for å forstørre)

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai