Andersonův úhel

Syntetická data: Překlenutí mezery v okluzi pomocí Grand Theft Auto

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z University of Illinois vytvořili novou sadu počítačového vidění, která využívá syntetické obrazové údaje generované herním enginem Grand Theft Auto, aby pomohli vyřešit jednu z největším překážek v semantické segmentaci – rozpoznání objektů, které jsou pouze částečně viditelné ve zdrojových obrazech a videích.

Toho bylo dosaženo tím, že, jak je popsáno v článku, výzkumníci použili herní engine GTA-V k vytvoření syntetické sady dat, která nejen obsahuje rekordní počet instancí okluzí, ale také dokonalou semantickou segmentaci a označení, a zohledňuje časové informace způsobem, který není řešen podobnými otevřenými sadami dat.

Úplné pochopení scény

Níže uvedené video, publikované jako podpůrný materiál pro výzkum, ilustruje výhody úplného 3D pochopení scény, kdy skryté objekty jsou známy a odhaleny ve scéně ve všech okolnostech, což umožňuje hodnotícímu systému naučit se spojovat částečně okludované pohledy s celým (označeným) objektem.

Zdroj: http://sailvos.web.illinois.edu/_site/index.html

Výsledná sada dat, nazvaná SAIL-VOS 3D, je podle autorů první syntetická video sada dat s rámcovou anotací, instancí-level segmentací, hloubkovou pravdou pro scénické pohledy a 2D anotacemi vymezenými ohraničujícím obdélníkem.

Zdroj (Klikněte pro zvětšení)

Označení SAIL-VOS 3D zahrnují hloubku, instancí-level modální a amodální segmentaci, semantické štítky a 3D sítě. Data zahrnují 484 videa s celkovými 237 611 snímky v rozlišení 1280×800, včetně přechodů mezi snímky.

Nahoře, původní rámce CGI; druhá řada, instancí-level segmentace; třetí řada, amodální segmentace, která ilustruje hloubku pochopení scény a průhlednost dostupnou ve datech. Zdroj

Nahoře, původní rámce CGI; druhá řada, instancí-level segmentace; třetí řada, amodální segmentace, která ilustruje hloubku pochopení scény a průhlednost dostupnou ve datech. Zdroj (Klikněte pro zvětšení)

Sada se skládá z 6 807 klipů s průměrnými 34,6 snímky každý, a data jsou označena 3 460 213 instancemi objektů pocházejících z 3 576 modelů sítí ve hře GTA-V. Tyto jsou přiřazeny k celkovému počtu 178 semantických kategorií.

Rekonstrukce sítí a automatizované označení

Jelikož pozdější výzkum dat bude pravděpodobně probíhat na reálných obrazech, sítě v SAIL-VOS 3D jsou generovány pomocí rámce strojového učení, spíše než odvozeny z engine GTA-V.

S programatickým a esenciálně 'holografickým' pochopením celé scény, obrazová data SAIL-VOS 3D mohou syntetizovat reprezentace objektů, které jsou obvykle skryty okluzemi, jako je například vzdálená paže postavy, otočená zde, způsobem, který by jinak závisel na mnoha reprezentativních instancích v reálném záběru. Zdroj: https://arxiv.org/pdf/2105.08612.pdf

S programatickým a esenciálně ‘holografickým’ pochopením celé scény, obrazová data SAIL-VOS 3D mohou syntetizovat reprezentace objektů, které jsou obvykle skryty okluzemi, jako je například vzdálená paže postavy, otočená zde, způsobem, který by jinak závisel na mnoha reprezentativních instancích v reálném záběru. (Klikněte pro zvětšení) Zdroj: https://arxiv.org/pdf/2105.08612.pdf

Jelikož každý objekt ve světě GTA-V obsahuje jedinečný ID, SAIL-VOS získá tyto ID z renderovacího engine pomocí knihovny hooků GTA-V. To řeší problém znovuzískání předmětu, pokud by dočasně opustil zorné pole, jelikož označení je trvalé a spolehlivé. K dispozici je 162 objektů v prostředí, které výzkumníci mapovali na odpovídající počet tříd.

Široká škála scén a objektů

Mnohé objekty ve hře GTA-V jsou běžné v přírodě, a proto inventář SAIL-VOS obsahuje šťastnou 60% tříd přítomných v často používané sadě dat MS-COCO z roku 2014.

Sada dat SAIL-VOS zahrnuje velkou škálu interiérových a exteriérových scén v různých povětrnostních podmínkách, s postavami oblečeným v různých oděvech.

Sada dat SAIL-VOS zahrnuje velkou škálu interiérových a exteriérových scén v různých povětrnostních podmínkách, s postavami oblečeným v různých oděvech. (Klikněte pro zvětšení)

Aplikovatelnost

Aby byla zajištěna kompatibilita s obecným směrem výzkumu v této oblasti a aby bylo potvrzeno, že tento syntetický přístup může prospět nesyntetickým projektům, výzkumníci vyhodnotili sadu dat pomocí rámcové detekce založené na MS-COCO a výzevu PASCAL Visual Object Classes (VOC) z roku 2012, s průměrnou přesností jako metrikou.

Výzkumníci zjistili, že předtrénování na sadě dat SAIL-VOS zlepšuje výkon průniku nad unií (IoU) o 19%, s odpovídajícím zlepšením výkonu VideoMatch, z 55% na 74% na neviditelných datech.

Jednak v případech extrémní okluzí byly chvíle, kdy všechny starší metody zůstaly neschopné identifikovat objekt nebo osobu, ačkoli výzkumníci předpovídají, že to může být v budoucnu napraveno zkoumáním sousedních snímků, aby se stanovilo zdůvodnění pro amodální masku.

Ve dvou pravých obrazech tradiční algoritmy segmentace selhaly při identifikaci ženské postavy z velmi omezené části její hlavy, která je viditelná. Pozdější inovace s hodnocením optického toku mohou zlepšit tyto výsledky.

Ve dvou pravých obrazech tradiční algoritmy segmentace selhaly při identifikaci ženské postavy z velmi omezené části její hlavy, která je viditelná. Pozdější inovace s hodnocením optického toku mohou zlepšit tyto výsledky. (Klikněte pro zvětšení)

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai