Angolo di Anderson
Dati sintetici: colmare il divario di occlusione con Grand Theft Auto

I ricercatori dell’Università dell’Illinois hanno creato un nuovo set di dati di visione computerizzata che utilizza immagini sintetiche generate da un motore di gioco Grand Theft Auto per aiutare a risolvere uno degli ostacoli più spinosi nella segmentazione semantica – il riconoscimento di oggetti che sono solo parzialmente visibili nelle immagini e nei video sorgente.
A questo scopo, come descritto in il paper, i ricercatori hanno utilizzato il motore di gioco GTA-V per generare un set di dati sintetici che non solo presenta un numero record di istanze di occlusione, ma che presenta anche una segmentazione semantica e un’etichettatura perfette, e tiene conto delle informazioni temporali in un modo che non è affrontato da set di dati open source simili.
Comprensione completa della scena
Il video qui sotto, pubblicato come materiale di supporto per la ricerca, illustra i vantaggi di una comprensione completa 3D di una scena, in cui gli oggetti oscurati sono noti e esposti nella scena in tutte le circostanze, abilitando il sistema di valutazione a imparare ad associare viste parzialmente oscurate con l’oggetto intero (etichettato).
Fonte: http://sailvos.web.illinois.edu/_site/index.html
Il set di dati risultante, chiamato SAIL-VOS 3D, è rivendicato dagli autori come il primo set di dati di video mesh sintetici con annotazione frame-per-frame, segmentazione a livello di istanza, profondità di verità per le viste della scena e annotazioni 2D delimitate da box di bounding.

Fonte (Clicca per ingrandire)
Le annotazioni di SAIL-VOS 3D includono profondità, segmentazione modale e amodale, etichette semantiche e mesh 3D. I dati includono 484 video per un totale di 237.611 frame alla risoluzione di 1280×800, inclusi transizioni di scena.

Sopra, i frame CGI originali; seconda riga, segmentazione a livello di istanza; terza riga, segmentazione amodale, che illustra la profondità della comprensione della scena e la trasparenza disponibile nei dati. Fonte (Clicca per ingrandire)
Il set si divide in 6.807 clip con una media di 34,6 frame ciascuno, e i dati sono annotati con 3.460.213 istanze di oggetti originate da 3.576 modelli di mesh nel motore di gioco GTA-V. Questi sono assegnati a un totale di 178 categorie semantiche.
Ricostruzione della mesh e etichettatura automatica
Poiché le ricerche successive sui set di dati saranno probabilmente condotte su immagini del mondo reale, le mesh in SAIL-VOS 3D sono generate dal framework di apprendimento automatico, piuttosto che derivate dal motore di gioco GTA-V.

Con una comprensione programmatica e essenzialmente ‘olografica’ della rappresentazione della scena completa, le immagini SAIL-VOS 3D possono sintetizzare rappresentazioni di oggetti normalmente nascosti da occlusione, come il braccio rivolto lontano del personaggio che si gira qui, in un modo che altrimenti dipenderebbe da molte istanze rappresentative in filmati del mondo reale. (Clicca per ingrandire) Fonte: https://arxiv.org/pdf/2105.08612.pdf
Poiché ogni oggetto nel mondo di GTA-V contiene un ID univoco, SAIL-VOS recupera questi dal motore di rendering utilizzando la libreria di hook di script di GTA-V. Ciò risolve il problema di riacquisire l’oggetto se dovesse lasciare temporaneamente il campo visivo, poiché l’etichettatura è persistente e affidabile. Ci sono 162 oggetti disponibili nell’ambiente, che i ricercatori hanno mappato su un numero corrispondente di classi.
Una varietà di scene e oggetti
Molti degli oggetti nel motore di gioco GTA-V sono comuni in natura, e quindi l’inventario SAIL-VOS contiene una fortunata percentuale del 60% delle classi presenti nel set di dati MS-COCO del 2014 di Microsoft, frequentemente utilizzato.

Il set di dati SAIL-VOS include una grande varietà di scene interne ed esterne in diverse condizioni meteorologiche, con personaggi che indossano abbigliamento variato. (Clicca per ingrandire)
Applicabilità
Per garantire la compatibilità con la ricerca generale in questo settore e per confermare che questo approccio sintetico può beneficiare progetti non sintetici, i ricercatori hanno valutato il set di dati utilizzando l’approccio di rilevamento basato su frame impiegato per MS-COCO e la sfida PASCAL Visual Object Classes (VOC) del 2012, con precisione media come metrica.
I ricercatori hanno scoperto che il pre-addestramento sul set di dati SAIL-VOS migliora le prestazioni dell’Intersezione su Unione (IoU) del 19%, con un miglioramento corrispondente nelle prestazioni di VideoMatch, dal 55% al 74% su dati non visti.
Tuttavia, in casi di occlusione estrema, ci sono stati occasioni in cui tutti i metodi più vecchi sono rimasti incapaci di identificare un oggetto o una persona, sebbene i ricercatori prevedano che ciò potrebbe essere risolto in futuro esaminando i frame adiacenti per stabilire la ragione della maschera amodale.

Nelle due immagini a destra, gli algoritmi di segmentazione tradizionali non sono riusciti a identificare la figura femminile dalla porzione molto limitata della sua testa che è visibile. Le innovazioni future con la valutazione del flusso ottico potrebbero migliorare questi risultati. (Clicca per ingrandire)












