Andersons vinkel
Forbedring av fotorealistisk bilsimulering med Generative Adversarial Networks

En ny forskningsinitiativ mellom USA og Kina har foreslått å bruke Generative Adversarial Networks (GANs) for å øke realisme i bilsimuleringer.
I en ny tilnærming til utfordringen med å produsere fotorealistiske POV-bilsimulatorer, har forskerne utviklet en hybridmetode som kombinerer styrkene til ulike tilnærminger, ved å blande det mer fotorealistiske utgangspunktet til CycleGAN-baserte systemer med mer konvensjonelt genererte elementer, som krever en høyere nivå av detalj og konsistens, som f.eks. veimarkeringer og de faktiske kjøretøyene sett fra førerens synspunkt.

Hybrid Generative Neural Graphics (HGNG) tilbyr en ny retning for bilsimuleringer som beholder nøyaktigheten til 3D-modeller for essensielle elementer (som veimarkeringer og kjøretøy), samtidig som det utnytter styrkene til GANs i å generere interessante og ikke-repetitive bakgrunns- og ambientdetaljer. Kilde
Systemet, kalt Hybrid Generative Neural Graphics (HGNG), injiserer høyt begrensede utgangspunkt fra en konvensjonell, CGI-basert bilsimulator inn i en GAN-pipeline, hvor NVIDIA SPADE-rammeverket tar over arbeidet med miljøgenerering.
Fordelen, ifølge forfatterne, er at kjøremiljøer vil bli potensielt mer diverse, og skape en mer immersiv opplevelse. Som det er nå, kan ikke sogar konvertering av CGI-utgangspunkt til fotorealistisk neural rendering-utgangspunkt løse problemet med gjentakelse, siden det opprinnelige fotomaterialet som går inn i neuralpipeline er begrenset av modellmiljøets begrensninger, og deres tendens til å gjenta teksturer og mesh.

Konvertert fotomateriale fra 2021-artikkelen ‘Forbedring av fotorealistisk utgangspunkt’, som fortsatt er avhengig av CGI-renderet fotomateriale, inkludert bakgrunn og generell ambientdetalj, og begrenser variasjonen i simuleringsopplevelsen. Kilde: https://www.youtube.com/watch?v=P1IcaBn3ej0
Artikkelen sier*:
‘Troverdigheten til en konvensjonell bilsimulator avhenger av kvaliteten på dets datagrafikkpipeline, som består av 3D-modeller, teksturer og en renderingmotor. Høykvalitets 3D-modeller og teksturer krever håndverk, mens renderingmotoren må kjøre kompliserte fysikkberegninger for realistisk representasjon av lys og skygge.’
Den nye artikkelen heter Fotorealisme i bilsimuleringer: Blending av Generative Adversarial Image Synthesis med Rendering, og kommer fra forskere ved Department of Electrical and Computer Engineering ved Ohio State University, og Chongqing Changan Automobile Co Ltd i Chongqing, Kina.
Bakgrunnsstoff
HGNG transformerer den semantiske layouten til et innputt-CGI-generert scene ved å blande delvis renderet forgrunnsstoff med GAN-genererte miljøer. Selv om forskerne eksperimenterte med ulike datasett for å trene modellene, var det mest effektive datasettet KITTI Vision Benchmark Suite, som hovedsakelig består av bilder tatt fra førerens synspunkt i den tyske byen Karlsruhe.

HGNG genererer en semantisk segmenteringslayout fra CGI-renderet utgangspunkt, og deretter setter inn SPADE, med varierende stil-koding, for å skape tilfeldige og diverse fotorealistiske bakgrunnsbilder, inkludert nærliggende objekter i byscener. Den nye artikkelen sier at gjentakende mønster, som er vanlig i ressursbegrensede CGI-pipelines, ‘bryter innlevelse’ for menneskelige førere som bruker en simulator, og at de mer varierende bakgrunnene som en GAN kan tilby kan lett denne problemet.
Forskerne eksperimenterte med både Conditional GAN (cGAN) og CYcleGAN (CyGAN) som generative nettverk, og fant til slutt at hver har styrker og svakheter: cGAN krever parrede datasett, og CyGAN gjør ikke. Imidlertid kan CyGAN ikke nå utkonkurrere den beste i konvensjonelle simuleringsmotorer, avhengig av videre forbedringer i domeneadapsjon og syklisk konsistens. Derfor er cGAN, med sine ekstra parrede datakrav, den beste nå.

Den konseptuelle arkitekturen til HGNG.
I HGNGs neurale grafikkmotor, dannes 2D-representasjoner fra CGI-syntetiserte scener. Objektene som overføres til GAN-strømmen fra CGI-renderingen er begrensede til ‘essensielle’ elementer, inkludert veimarkeringer og kjøretøy, som en GAN selv ikke kan rendre tilstrekkelig temporalt konsistent og integritet for en bil simulator. cGAN-syntetisert bilde blir deretter blandet med delvis fysikkbasert rendering.
Tester
For å teste systemet, brukte forskerne SPADE, trent på Cityscapes, for å konvertere den semantiske layouten til scenen til fotorealistisk utgangspunkt. CGI-kilden kom fra åpen kildekode-bil simulator CARLA, som utnytter Unreal Engine 4 (UE4).

Utgangspunkt fra åpen kildekode-bil simulator CARLA. Kilde: https://arxiv.org/pdf/1711.03938.pdf
Skuggemotoren og lysmotoren til UE4 leverte den semantiske layouten og delvis renderet bildene, med kun kjøretøy og veimarkeringer som utgangspunkt. Blending ble oppnådd med en GP-GAN-instans trent på Transient Attributes Database, og alle eksperimenter kjørte på en NVIDIA RTX 2080 med 8 GB GDDR6 VRAM.
Forskerne testet for semantisk bevaring – evnen til utgangspunktet til å korrespondere med den opprinnelige semantiske segmenteringsmasken som var ment som mal for scenen.
I testbildene ovenfor ser vi at i ‘render kun’-bildet (nederst til venstre), fullstendig rendering ikke oppnår troverdige skygger. Forskerne merker at her (gul sirkel) skygger av trær som faller på fortauen ble feilaktig klassifisert av DeepLabV3 (den semantiske segmenteringsrammeverket som ble brukt for disse eksperimentene) som ‘vei’-innhold.
I midtkolonne-strømmen ser vi at cGAN-oppcreatede kjøretøy ikke har nok konsistent definisjon til å være brukbare i en bil simulator (rød sirkel). I høyre kolonne-strømmen konformerer det blandede bildet til den opprinnelige semantiske definisjonen, samtidig som det beholder essensielle CGI-baserte elementer.
For å evaluere realisme, brukte forskerne Frechet Inception Distance (FID) som en ytelsesmetode, siden det kan operere på parrede data eller uparrede data.
Tre datasett ble brukt som grunntruth: Cityscapes, KITTI og ADE20K.
Utgangspunktene ble sammenlignet med hverandre ved hjelp av FID-poeng, og mot den fysikkbaserte (dvs. CGI) pipeline, mens semantisk bevaring også ble evaluert.

I resultater ovenfor, som angår semantisk bevaring, er høyere poeng bedre, med cGAN-pyramidebasert tilnærming (en av flere pipelines testet av forskerne) som scorer høyest.

Resultatene ovenfor angår FID-poeng, med HGNG som scorer høyest ved hjelp av KITTI-datasettet.
‘Kun rendering’-metoden (betegnet som [23]) angår utgangspunktet fra CARLA, en CGI-strøm som ikke forventes å være fotorealistisk.
Kvalitative resultater på den konvensjonelle renderingmotoren (‘c’ i bildet ovenfor) viser urealistisk fjernbakgrunnsinformasjon, som f.eks. trær og vegetasjon, samtidig som det krever detaljerte modeller og just-in-time mesh-lastning, samt andre prosessorintensive prosedyrer. I midten (b), ser vi at cGAN ikke kan oppnå tilstrekkelig definisjon for essensielle elementer, som kjøretøy og veimarkeringer. I det foreslåtte blandede utgangspunktet (a), er kjøretøy- og veidefinisjon god, samtidig som bakgrunnsmiljøet er divers og fotorealistisk.
Artikkelen konkluderer med å foreslå at den temporale konsistensen til GAN-genererte delen av renderingpipelinen kunne økes gjennom bruk av større bydatasett, og at fremtidig arbeid i denne retningen kunne tilby en reell alternativ til kostbare neurale transformasjoner av CGI-baserte strømmer, samtidig som det tilbyr større realisme og variasjon.
* Min konvertering av forfatternes inline-citater til hyperlenker.
Først publisert 23. juli 2022.














