Andersons vinkel
Syntetisk data: Överbrygga luckan i occlusion med Grand Theft Auto

Forskare vid University of Illinois har skapat en ny datamängd för datorseende som använder syntetiska bilder genererade av Grand Theft Auto-spelmotorn för att hjälpa till att lösa ett av de mest besvärliga hindren i semantisk segmentering – att känna igen objekt som endast delvis syns i källbilder och videor.
Till detta ändamål, som beskrivs i artikeln, har forskarna använt GTA-V-spelmotorn för att generera en syntetisk datamängd som inte bara innehåller ett rekordantal occlusionsinstanser, utan också perfekt semantisk segmentering och märkning, och som tar hänsyn till temporal information på ett sätt som inte behandlas av liknande öppen källkodsdatamängder.
Komplett scenförståelse
Videon nedan, publicerad som stödmaterial för forskningen, visar fördelarna med en komplett 3D-förståelse av en scen, där dolda objekt är kända och exponeras i scenen under alla omständigheter, vilket möjliggör för utvärderingssystemet att lära sig att associera delvis ocklerade vyer med det fullständiga (märkta) objektet.
Källa: http://sailvos.web.illinois.edu/_site/index.html
Den resulterande datamängden, som kallas SAIL-VOS 3D, påstås av författarna vara den första syntetiska videomesh-datamängden med ram-för-ram-märkning, instansnivåsegmentering, grundtruthdjup för scenvyer och 2D-märkningar avgränsade av begränsningsrutor.

Källa (Klicka för att förstora)
Märkningarna i SAIL-VOS 3D innehåller djup, instansnivåmodalt och amodalt segmentering, semantiska etiketter och 3D-nät. Datamängden innehåller 484 videor som totalt innehåller 237 611 ramar i upplösningen 1280×800, inklusive skottövergångar.

Ovan, de ursprungliga CGI-ramarna; andra raden, instansnivåsegmentering; tredje raden, amodalt segmentering, som visar djupet i scenförståelse och transparensen i datamängden. Källa (Klicka för att förstora)
Datamängden delas upp i 6 807 klipp med i genomsnitt 34,6 ramar vardera, och datamängden är märkt med 3 460 213 objektinstanser som härstammar från 3 576 nätmodeller i GTA-V-spelmotorn. Dessa tilldelas totalt 178 semantiska kategorier.
Nätrekonstruktion och automatiserad märkning
Eftersom senare datamängdsforskning sannolikt kommer att ske på riktiga världsbilder, genereras nätverken i SAIL-VOS 3D av maskinlärningsramverket, snarare än hämtade från GTA-V-motorn.

Med ett programmatiskt och i princip ‘holografiskt’ förståelse av hela scenrepresentationen, kan SAIL-VOS 3D-bilder syntetisera representationer av objekt som vanligtvis är dolda av ocklusioner, såsom den långsiktiga armen på figuren som vänder sig här, på ett sätt som annars skulle bero på många representativa instanser i riktiga världsbilder. (Klicka för att förstora) Källa: https://arxiv.org/pdf/2105.08612.pdf
Eftersom varje objekt i GTA-V-världen innehåller ett unikt ID, hämtar SAIL-VOS dessa från renderingsmotorn med hjälp av GTA-V-skriptkroken. Detta löser problemet med att återfå ämnet om det tillfälligt lämnar synfältet, eftersom märkningen är beständig och tillförlitlig. Det finns 162 objekt tillgängliga i miljön, som forskarna har kartlagt till ett motsvarande antal klasser.
En mängd scener och objekt
Många av objekten i GTA-V-motorn är vanliga i naturen, och därför innehåller SAIL-VOS-inventeringen en lycklig 60% av klasserna som finns i Microsofts ofta använda 2014 MS-COCO-datamängd.

SAIL-VOS-datamängden innehåller en stor mängd interiör- och exteriörscener under olika väderförhållanden, med figurer som bär varierande kläder. (Klicka för att förstora)
Tillämpbarhet
För att säkerställa kompatibilitet med den allmänna forskningen inom detta område, och för att bekräfta att denna syntetiska metod kan gynna icke-syntetiska projekt, utvärderade forskarna datamängden med hjälp av ram-baserad upptäkt tillvägagångssätt som används för MS-COCO och 2012 PASCAL Visual Object Classes (VOC) Challenge, med genomsnittlig precision som mått.
Forskarna fann att förträning på SAIL-VOS-datamängden förbättrar prestandan för Intersection over Union (IoU) med 19%, med en motsvarande förbättring av VideoMatch-prestanda, från 55% till 74% på osedda data.
Men i fall av extrem ocklusion, fanns det tillfällen då alla äldre metoder förblev oförmögna att identifiera ett objekt eller en person, även om forskarna förutsåg att detta kunde åtgärdas i framtiden genom att undersöka angränsande ramar för att fastställa skälet till den amodala masken.













