Andersons vinkel
Syntetisk Data: Broen Over Occlusion Gap Med Grand Theft Auto

Forskere ved University of Illinois har oprettet en ny computer vision-dataset, der bruger syntetisk billedmateriale genereret af en Grand Theft Auto-spilmotor til at løse et af de største problemer i semantisk segmentering – at genkende objekter, der kun er delvist synlige i kildebilleder og -videoer.
Til dette formål har forskerne, som beskrevet i artiklen, brugt GTA-V-spilmotoren til at generere en syntetisk dataset, der ikke kun indeholder et rekordstort antal occlusionseksempler, men også har perfekt semantisk segmentering og mærkning, og tager højde for temporal information på en måde, der ikke er dækket af lignende åbne datasets.
Komplet Sceneforståelse
Videoen nedenfor, offentliggjort som supplement til forskningen, illustrerer fordelene ved en komplet 3D-forståelse af en scene, hvor skjulte objekter er kendt og afsløret i scenen under alle omstændigheder, hvilket giver evalueringssystemet mulighed for at lære at associerer delvist occlerede visninger med det hele (mærkede) objekt.
Kilde: http://sailvos.web.illinois.edu/_site/index.html
Det resulterende dataset, kaldet SAIL-VOS 3D, påstås af forfatterne at være det første syntetiske video-mesh-dataset med ramme-for-ramme-mærkning, instance-niveau-segmentering, ground truth-dybde for scenvisninger og 2D-mærkninger afgrænsede af begrænsningsbokse.

Kilde (Klik for at forstørre)
Mærkningerne af SAIL-VOS 3D inkluderer dybde, instance-niveau-modal og amodal segmentering, semantiske mærkninger og 3D-mesh. Dataen inkluderer 484 videoer med i alt 237.611 rammer i 1280×800 opløsning, herunder skudovergange.

Ovenfor, de originale CGI-rammer; anden række, instance-niveau-segmentering; tredje række, amodal segmentering, som illustrerer dybden af sceneforståelse og gennemsigtighed, der er tilgængelig i dataen. Kilde (Klik for at forstørre)
Sættet består af 6.807 klip med en gennemsnitlig længde på 34,6 rammer hver, og dataen er mærket med 3.460.213 objektinstanser, der stammer fra 3.576 mesh-modeller i GTA-V-spilmotoren. Disse er tildelt i alt 178 semantiske kategorier.
Mesh-Rekonstruktion Og Automatisk Mærkning
Da senere dataset-forskning sandsynligvis vil finde sted på virkelige billeder, genereres meshene i SAIL-VOS 3D af maskinlæringsrammen i stedet for at være afledt fra GTA-V-motoren.

Med en programmatisk og i virkeligheden ‘holografisk’ forståelse af hele scenerepræsentationen, kan SAIL-VOS 3D-billedmateriale syntetisere repræsentationer af objekter, der normalt er skjult af occlusioner, såsom den fjernvendte arm af karakteren, der drejer rundt her, på en måde, der ellers ville afhænge af mange repræsentative eksempler i virkelige billeder. (Klik for at forstørre) Kilde: https://arxiv.org/pdf/2105.08612.pdf
Da hvert objekt i GTA-V-verdenen indeholder en unik ID, henter SAIL-VOS disse fra rendering-motoren ved hjælp af GTA-V-script-hook-biblioteket. Dette løser problemet med at genopnå subjektet, hvis det forlader synsfeltet midlertidigt, da mærkningen er varig og pålidelig. Der er 162 objekter tilgængelige i miljøet, som forskerne har tilknyttet til en tilsvarende antal klasser.
En Variation Af Scener Og Objekter
Mange af objekterne i GTA-V-motoren er almindelige i naturen, og derfor indeholder SAIL-VOS-inventaret en heldig 60% af klasserne, der er til stede i Microsofts ofte brugte 2014 MS-COCO-dataset.

SAIL-VOS-datasættet indeholder en stor variation af indendørs- og udendørs-scener under forskellige vejrforhold, med karakterer, der bærer varieret tøj. (Klik for at forstørre)
Anvendelighed
For at sikre kompatibilitet med den generelle forskning i dette område og for at bekræfte, at denne syntetiske tilgang kan være til fordel for ikke-syntetiske projekter, har forskerne evaluaret datasættet ved hjælp af ramme-baseret-detektionsmetoden, der anvendes til MS-COCO og 2012 PASCAL Visual Object Classes (VOC) Challenge, med gennemsnitlig præcision som målet.
Forskerne fandt, at fortræning på SAIL-VOS-datasættet forbedrer Intersection over Union (IoU) med 19%, med en tilsvarende forbedring af VideoMatch-præstation, fra 55% til 74% på usete data.
Men i tilfælde af ekstreme occlusioner var der lejligheder, hvor alle de ældre metoder forblev ude af stand til at identificere et objekt eller en person, selv om forskerne forudsagde, at dette kunne være afhjulpet i fremtiden ved at undersøge nærliggende rammer for at etablere grunden til den amodale maske.













