Andersonův úhel

Zlepšení fotorealistického zobrazení simulací jízdy pomocí generativních adversativních sítí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová výzkumná iniciativa mezi Spojenými státy a Čínou navrhla použití generativních adversativních sítí (GAN) ke zvýšení realismu simulátorů jízdy.

V novém přístupu k výzvám spojeným s vytvářením fotorealistických scénářů jízdy z pohledu řidiče vyvinuli výzkumníci hybridní metodu, která kombinuje výhody různých přístupů, a to kombinací více fotorealistického výstupu systémů založených na CycleGAN s konvenčně generovanými prvky, které vyžadují vyšší úroveň detailů a konzistence, jako jsou například vozovky a vozidla pozorovaná z pohledu řidiče.

Hybrid Generative Neural Graphics (HGNG) nabízí nový směr pro simulace jízdy, který zachovává přesnost 3D modelů pro základní prvky (jako vozovky a vozidla), zatímco využívá výhody GAN při generování zajímavých a neopakovatelných pozadí a ambientních detailů. Source

Hybrid Generative Neural Graphics (HGNG) nabízí nový směr pro simulace jízdy, který zachovává přesnost 3D modelů pro základní prvky (jako vozovky a vozidla), zatímco využívá výhody GAN při generování zajímavých a neopakovatelných pozadí a ambientních detailů. Source

Systém, nazvaný Hybrid Generative Neural Graphics (HGNG), vkládá omezený výstup z konvenčního, CGI-založeného simulátoru jízdy do GAN potrubí, kde framework NVIDIA SPADE přebírá práci generování prostředí.

Výhoda, podle autorů, spočívá v tom, že prostředí pro jízdu se stanou potenciálně rozmanitější, což vytváří více imerzivní zkušenost. Jak tomu je nyní, tak ani přepnutí CGI výstupu na fotorealistické neuronové vykreslování nemůže vyřešit problém opakování, protože původní záběry vstupující do neuronového potrubí jsou omezeny limity modelových prostředí a jejich tendencí opakovat textury a sítě.

Source: https://www.youtube.com/watch?v=0fhUJT21-bs

Přepnuté záběry z roku 2021 článku ‘Zlepšení fotorealistického zobrazení’, které zůstávají závislé na CGI-vykreslených záběrech, včetně pozadí a obecných ambientních detailů, omezují rozmanitost prostředí ve simulované zkušenosti. Source: https://www.youtube.com/watch?v=P1IcaBn3ej0

Článek uvádí*:

‘Věrnost konvenčního simulátoru jízdy závisí na kvalitě jeho počítačové grafické pipeline, která se skládá z 3D modelů, textur a vykreslovacího engine. Vysokokvalitní 3D modely a textury vyžadují řemeslnou práci, zatímco vykreslovací engine musí provádět komplikované fyzikální výpočty pro realistické zobrazení osvětlení a stínování.’

Nový článek se nazývá Fotorealistické zobrazení v simulacích jízdy: Kombinace generativní adversativní image syntézy s vykreslováním a pochází od výzkumníků z oddělení elektrotechniky a počítačového inženýrství na Ohijské státní univerzitě a Chongqing Changan Automobile Co Ltd v Čchung-čchingu, Číně.

Pozadí

HGNG transformuje semantickou dispozici vstupní CGI-generované scény kombinací částečně vykresleného popředí s GAN-generovanými prostředími. Ačkoli výzkumníci experimentovali s různými datovými sadami pro školení modelů, nejúčinnější se ukázala být KITTI Vision Benchmark Suite, která převážně obsahuje záběry z pohledu řidiče z německého města Karlsruhe.

HGNG generuje semantickou segmentační dispozici z CGI-vykresleného výstupu a poté vkládá SPADE s různými stylovými kódováními, aby vytvořil náhodné a rozmanité fotorealistické pozadí, včetně blízkých objektů v městských scénách. Nový článek uvádí, že opakující se vzory, které jsou společné pro omezená CGI potrubí, 'ruší imerzivní zkušenost' pro lidské řidiče pomocí simulátoru, a že více variabilní pozadí, které může GAN poskytnout, může tento problém zmírnit.

HGNG generuje semantickou segmentační dispozici z CGI-vykresleného výstupu a poté vkládá SPADE s různými stylovými kódováními, aby vytvořil náhodné a rozmanité fotorealistické pozadí, včetně blízkých objektů v městských scénách. Nový článek uvádí, že opakující se vzory, které jsou společné pro omezená CGI potrubí, ‘ruší imerzivní zkušenost’ pro lidské řidiče pomocí simulátoru, a že více variabilní pozadí, které může GAN poskytnout, může tento problém zmírnit.

Výzkumníci experimentovali s Conditional GAN (cGAN) a CYcleGAN (CyGAN) jako generativními sítěmi, přičemž nakonec zjistili, že každá má své silné a slabé stránky: cGAN vyžaduje spárované datové sady, zatímco CyGAN nikoli. Nicméně, CyGAN nemůže目前 outperform konvenční simulátory, dokud nebude dále vylepšen v doménové adaptaci a cyklické konzistenci. Proto cGAN, s jeho dodatečnými požadavky na spárovaná data,目前 dosahuje nejlepších výsledků.

Konceptuální architektura HGNG.

Konceptuální architektura HGNG.

V HGNG neuronovém grafickém potrubí se vytvářejí 2D reprezentace z CGI-syntetizovaných scén. Objekty, které jsou předávány do GAN toku z CGI vykreslování, jsou omezeny na ‘základní’ prvky, včetně vozovek a vozidel, které GAN sám nemůže目前 dostatečně renderovat pro simulátor jízdy. cGAN-syntetizovaná obraz je poté kombinována s částečně fyzikálně založeným renderem.

Testy

Pro testování systému použili výzkumníci SPADE, školený na Cityscapes, pro převod semantické dispozice scény na fotorealistický výstup. CGI zdroj pocházel z open source simulátoru jízdy CARLA, který využívá Unreal Engine 4 (UE4).

Výstup z open source simulátoru jízdy CARLA. Source: https://arxiv.org/pdf/1711.03938.pdf

Výstup z open source simulátoru jízdy CARLA. Source: https://arxiv.org/pdf/1711.03938.pdf

Stínování a osvětlovací engine UE4 poskytl semantickou dispozici a částečně vykreslené obrázky, s pouze vozidly a vozovkami jako výstup. Kombinace byla dosažena pomocí GP-GAN instance, školené na Transient Attributes Database, a všechny experimenty byly spuštěny na NVIDIA RTX 2080 s 8 GB GDDR6 VRAM.

Výzkumníci testovali semantickou retenci – schopnost výstupního obrázku odpovídat počáteční semantické segmentační masce určené jako šablona pro scénu.

V testovacích obrazech výše vidíme, že v ‘render only’ obraze (dole vlevo) plný render nezískává přesvědčivé stíny. Výzkumníci poznamenávají, že zde (žlutý kruh) stíny stromů, které padají na chodník, byly chybně klasifikovány DeepLabV3 (semantická segmentační framework použitá pro tyto experimenty) jako ‘vozovka’ obsah.

V prostředním sloupci toku vidíme, že cGAN-vytvořená vozidla nemají dostatečnou konzistentní definici, aby byla použitelná v simulátoru jízdy (červený kruh). V pravém sloupci toku kombinovaný obraz odpovídá původní semantické definici, zatímco zachovává základní CGI-založené prvky.

Pro hodnocení realismu použili výzkumníci Frechet Inception Distance (FID) jako metriku výkonu, protože může fungovat na spárovaných datech nebo nespařených datech.

Tři datové sady byly použity jako referenční bod: Cityscapes, KITTI a ADE20K.

Výstupní obrázky byly porovnány navzájem pomocí FID skóre a proti fyzikálně založenému (tj. CGI) potrubí, zatímco semantická retence byla také vyhodnocena.

V výsledcích výše, které se týkají semantické retence, jsou vyšší skóre lepší, s CGAN pyramidovým přístupem (jedním z několika potrubí testovaných výzkumníky) skórujícím nejvyšší.

Výsledky výše se týkají FID skóre, s HGNG skórujícím nejvyšší pomocí KITTI datové sady.

‘Only render’ metoda (označená jako [23]) se týká výstupu z CARLA, CGI toku, který se neočekává, že bude fotorealistický.

Kvalitativní výsledky na konvenčním vykreslovacím engine (‘c’ v obraze přímo výše) vykazují nerealistické vzdálené pozadí, jako jsou stromy a vegetace, zatímco vyžadují detailní modely a just-in-time mesh loading, jakož i další procesorově náročné postupy. V prostředním (b), vidíme, že cGAN nezískává dostatečnou definici pro základní prvky, auta a vozovky. V navrhovaném kombinovaném výstupu (a) je definice vozidel a vozovek dobrá, zatímco ambientní prostředí je rozmanité a fotorealistické.

Článek uzavírá tím, že navrhne, že časová konzistence GAN-generované části vykreslovacího potrubí by mohla být zvýšena pomocí větších městských datových sad, a že budoucí práce v tomto směru by mohla nabídnout skutečnou alternativu k nákladným neuronovým transformacím CGI-založených toků, zatímco poskytuje větší realismus a rozmanitost.

 

* Mé převodu autorů inline citací na hypertextové odkazy.

Poprvé publikováno 23. července 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai