Andersons hoek

Verbetering van de fotorealistische weergave van rijsimulaties met Generative Adversarial Networks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een nieuw onderzoeksinitiatief tussen de VS en China heeft voorgesteld om Generative Adversarial Networks (GAN’s) te gebruiken om de realiteit van rijsimulatoren te vergroten.

In een noviteit op de uitdaging om fotorealistische POV-rijscenarios te produceren, hebben de onderzoekers een hybride methode ontwikkeld die de sterktes van verschillende benaderingen combineert, door de meer fotorealistische output van CycleGAN-gebaseerde systemen te mengen met conventioneel gegenereerde elementen, die een grotere mate van detail en consistentie vereisen, zoals wegmarkeringen en de daadwerkelijke voertuigen die vanuit het oogpunt van de bestuurder worden waargenomen.

Hybrid Generative Neural Graphics (HGNG) biedt een nieuwe richting voor rijsimulaties die de nauwkeurigheid van 3D-modellen voor essentiële elementen (zoals wegmarkeringen en voertuigen) behoudt, terwijl het de sterktes van GAN's in het genereren van interessante en niet-repetitieve achtergrond- en omgevingsdetails benut.

Hybrid Generative Neural Graphics (HGNG) biedt een nieuwe richting voor rijsimulaties die de nauwkeurigheid van 3D-modellen voor essentiële elementen (zoals wegmarkeringen en voertuigen) behoudt, terwijl het de sterktes van GAN’s in het genereren van interessante en niet-repetitieve achtergrond- en omgevingsdetails benut. Bron

Het systeem, genaamd Hybrid Generative Neural Graphics (HGNG), injecteert zeer beperkte output van een conventionele, CGI-gebaseerde rijsimulator in een GAN-pijplijn, waar de NVIDIA SPADE-framework de taak van omgevingsgeneratie overneemt.

Het voordeel, volgens de auteurs, is dat rijsimulaties mogelijk meer diverse omgevingen kunnen creëren, waardoor een meer immersieve ervaring ontstaat. Zoals het er nu voor staat, kan zelfs het omzetten van CGI-output naar fotorealistische neurale rendering-output het probleem van herhaling niet oplossen, aangezien de oorspronkelijke beelden die de neurale pijplijn binnenkomen, beperkt zijn door de grenzen van de modelomgevingen en hun neiging om textures en meshes te herhalen.

Bron: https://www.youtube.com/watch?v=0fhUJT21-bs

Omgezette beelden uit het artikel van 2021 ‘Verbetering van de fotorealistische weergave’, die nog steeds afhankelijk zijn van CGI-gegenereerde beelden, inclusief de achtergrond en algemene omgevingsdetails, waardoor de variëteit van de omgeving in de gesimuleerde ervaring wordt beperkt. Bron: https://www.youtube.com/watch?v=P1IcaBn3ej0

Het artikel vermeldt*:

‘De geloofwaardigheid van een conventionele rijsimulator hangt af van de kwaliteit van de computergraphicspijplijn, die bestaat uit 3D-modellen, textures en een rendering-engine. Hoge-kwaliteit 3D-modellen en textures vereisen ambachtelijkheid, terwijl de rendering-engine ingewikkelde fysieke berekeningen moet uitvoeren voor de realistische weergave van licht en schaduw.’

Het nieuwe artikel heeft als titel Fotorealistische weergave in rijsimulaties: Het combineren van Generative Adversarial Image Synthesis met Rendering en komt van onderzoekers aan de afdeling Elektrotechniek en Informatica van de Ohio State University en Chongqing Changan Automobile Co Ltd in Chongqing, China.

Achtergrondmateriaal

HGNG transformeert de semantische lay-out van een ingevoerde CGI-gegenereerde scène door gedeeltelijk gerenderde voorgrondmateriaal te mengen met GAN-gegenereerde omgevingen. Hoewel de onderzoekers met verschillende datasets hebben geëxperimenteerd om de modellen te trainen, bleek de meest effectieve te zijn de KITTI-Visiebenchmarksuite, die voornamelijk bestaat uit opnames vanuit het oogpunt van de bestuurder van de Duitse stad Karlsruhe.

HGNG genereert een semantische segmentatielay-out vanuit CGI-gegenereerde output en voegt vervolgens SPADE toe, met variabele stijlencoders, om willekeurige en diverse fotorealistische achtergrondbeelden te creëren, inclusief nabijgelegen objecten in stedelijke scènes. Het artikel vermeldt dat herhalingspatronen, die gebruikelijk zijn in CGI-pijplijnen met beperkte middelen, 'de immersie breken' voor menselijke bestuurders die een simulator gebruiken, en dat de meer gevarieerde achtergronden die een GAN kan bieden, dit probleem kunnen verlichten.

HGNG genereert een semantische segmentatielay-out vanuit CGI-gegenereerde output en voegt vervolgens SPADE toe, met variabele stijlencoders, om willekeurige en diverse fotorealistische achtergrondbeelden te creëren, inclusief nabijgelegen objecten in stedelijke scènes. Het artikel vermeldt dat herhalingspatronen, die gebruikelijk zijn in CGI-pijplijnen met beperkte middelen, ‘de immersie breken’ voor menselijke bestuurders die een simulator gebruiken, en dat de meer gevarieerde achtergronden die een GAN kan bieden, dit probleem kunnen verlichten.

De onderzoekers hebben geëxperimenteerd met zowel Conditional GAN (cGAN) als CYcleGAN (CyGAN) als generatieve netwerken, en hebben uiteindelijk vastgesteld dat elk zijn sterktes en zwaktes heeft: cGAN vereist gepaarde datasets, en CyGAN niet. Echter, CyGAN kan op dit moment niet de staat van de kunst in conventionele simulators evenaren, totdat er verdere verbeteringen zijn in domeinadaptatie en cyclusconsistentie. Daarom behaalt cGAN, met zijn aanvullende vereiste van gepaarde gegevens, op dit moment de beste resultaten.

De conceptuele architectuur van HGNG.

De conceptuele architectuur van HGNG.

In de HGNG-neurale graphicspijplijn worden 2D-weergaven gevormd uit CGI-gegenereerde scènes. De objecten die vanuit de CGI-rendering naar de GAN-pijplijn gaan, zijn beperkt tot ‘essentiële’ elementen, waaronder wegmarkeringen en voertuigen, die een GAN op dit moment niet kan renderen met voldoende temporele consistentie en integriteit voor een rijsimulator. Het cGAN-gegenereerde beeld wordt vervolgens gemengd met de gedeeltelijke fysica-gebaseerde rendering.

Tests

Om het systeem te testen, hebben de onderzoekers SPADE gebruikt, getraind op Cityscapes, om de semantische lay-out van de scène om te zetten in fotorealistische output. De CGI-bron kwam van de open source-rijsimulator CARLA, die de Unreal Engine 4 (UE4) gebruikt.

Output van de open source-rijsimulator CARLA. Bron: https://arxiv.org/pdf/1711.03938.pdf

Output van de open source-rijsimulator CARLA. Bron: https://arxiv.org/pdf/1711.03938.pdf

De schaduw- en verlichtingsengine van UE4 heeft de semantische lay-out en de gedeeltelijk gerenderde beelden geleverd, met alleen voertuigen en wegmarkeringen als output. Menging is bereikt met een GP-GAN-instantie getraind op de Transient Attributes Database, en alle experimenten zijn uitgevoerd op een NVIDIA RTX 2080 met 8 GB GDDR6 VRAM.

De onderzoekers hebben getest op semantische retentie – de mogelijkheid van de uitvoerbeeld om overeen te komen met de initiële semantische segmentatiemasker dat als sjabloon voor de scène was bedoeld.

In de bovenstaande testbeelden zien we dat in het ‘alleen renderen’-beeld (onderaan links) de volledige rendering geen geloofwaardige schaduwen oplevert. De onderzoekers merken op dat hier (gele cirkel) schaduwen van bomen die op het trottoir vallen, ten onrechte zijn geclassificeerd door DeepLabV3 (de semantische segmentatieframework die voor deze experimenten is gebruikt) als ‘weg’-inhoud.

In de middelste kolom zien we dat cGAN-gegenereerde voertuigen niet genoeg consistente definitie hebben om in een rijsimulator te worden gebruikt (rode cirkel). In de rechterkolom zien we dat het gemengde beeld overeenkomt met de oorspronkelijke semantische definitie, terwijl het essentiële CGI-gebaseerde elementen behoudt.

Om de realiteit te beoordelen, hebben de onderzoekers Frechet Inception Distance (FID) gebruikt als prestatiekengetal, aangezien het zowel met gepaarde als ongepaarde gegevens kan werken.

Drie datasets zijn gebruikt als grondwaarheid: Cityscapes, KITTI en ADE20K.

De uitvoerbeelden zijn vergeleken met elkaar met behulp van FID-scores en met de fysica-gebaseerde (d.w.z. CGI-) pijplijn, terwijl semantische retentie ook is geëvalueerd.

In de bovenstaande resultaten, die betrekking hebben op semantische retentie, zijn hogere scores beter, met de CGAN-pyramide-approach (een van de verschillende pijplijnen die door de onderzoekers zijn getest) als hoogste score.

De bovenstaande resultaten hebben betrekking op FID-scores, met HGNG als hoogste score door het gebruik van de KITTI-dataset.

De ‘Alleen renderen’-methode (aangeduid als [23]) heeft betrekking op de output van CARLA, een CGI-pijplijn die niet is bedoeld om fotorealistisch te zijn.

Kwalitatieve resultaten op de conventionele rendering-engine (‘c’ in het bovenstaande beeld) vertonen onrealistische achtergrondinformatie op afstand, zoals bomen en vegetatie, en vereisen gedetailleerde modellen en just-in-time mesh-loading, evenals andere processor-intensieve procedures. In het midden (b) zien we dat cGAN niet genoeg definitie kan behalen voor de essentiële elementen, auto’s en wegmarkeringen. In de voorgestelde gemengde output (a) is de definitie van voertuigen en wegmarkeringen goed, terwijl de omgevingsomgeving gevarieerd en fotorealistisch is.

Het artikel concludeert door te suggereren dat de temporele consistentie van het GAN-gegenereerde deel van de renderingpijplijn kan worden verhoogd door het gebruik van grotere stedelijke datasets, en dat toekomstig onderzoek in deze richting een echte alternatief kan bieden voor dure neurale transformaties van CGI-gebaseerde streams, terwijl het meer realisme en diversiteit biedt.

 

* Mijn conversie van de inline-citaten van de auteurs naar hyperlinks.

Voor het eerst gepubliceerd op 23 juli 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai