Andersons vinkel
Forbedring af fotorealistisk billedkvalitet i køresimulationer med Generative Adversarial Networks

Et nyt forskningsinitiativ mellem USA og Kina har foreslået at bruge Generative Adversarial Networks (GANs) til at øge realisme i køresimulatorer.
I en ny tilgang til udfordringen med at producere fotorealistiske POV-kørescener, har forskerne udviklet en hybridmetode, der kombinerer de mere fotorealistiske output fra CycleGAN-baserede systemer med mere konventionelt genererede elementer, som kræver en højere niveau af detaljer og konsistens, såsom vejmarkeringer og de faktiske køretøjer set fra chaufførens synsvinkel.

Hybrid Generative Neural Graphics (HGNG) tilbyder en ny retning for køresimulationer, der fastholder nøjagtigheden af 3D-modeller for essentielle elementer (såsom vejmarkeringer og køretøjer), samtidig med at den udnytter GANs styrker i generering af interessante og ikke-repetitive baggrund og ambient detaljer. Kilde
Systemet, der kaldes Hybrid Generative Neural Graphics (HGNG), indsætter højtbegrænsede output fra en konventionel, CGI-baseret køresimulator i en GAN-pipeline, hvor NVIDIA SPADE-rammen overtager arbejdet med miljøgenerering.
Fordelen, ifølge forfatterne, er, at køremiljøer vil blive potentielt mere diverse, hvilket skaber en mere immersiv oplevelse. Som det er nu, kan selv omdannelsen af CGI-output til fotorealistisk neural rendering-output ikke løse problemet med repetition, da den originale footage, der indgår i den neurale pipeline, er begrænset af modellens miljøer og deres tendens til at gentage teksturer og mesh.

Omformet footage fra 2021-papiret ‘Forbedring af fotorealistisk billedkvalitet’, der stadig afhænger af CGI-renderet footage, herunder baggrund og generel ambient detalje, hvilket begrænser variationen i den simulerede oplevelse. Kilde: https://www.youtube.com/watch?v=P1IcaBn3ej0
Artiklen fastslår*:
‘Trofastheden af en konventionel køresimulator afhænger af kvaliteten af dens computergrafikpipeline, der består af 3D-modeller, teksturer og en renderingsmotor. Højkvalitets 3D-modeller og teksturer kræver håndværk, mens renderingsmotoren skal udføre komplicerede fysikberegnninger for en realistisk repræsentation af lys og skygge.’
Den nye artikel har titlen Fotorealistisk billedkvalitet i køresimulationer: En blanding af Generative Adversarial Image Synthesis og rendering og kommer fra forskere ved Department of Electrical and Computer Engineering på Ohio State University og Chongqing Changan Automobile Co Ltd i Chongqing, Kina.
Baggrundsmateriale
HGNG transformerer den semantiske layout af en input CGI-genereret scene ved at kombinere delvist renderet forgrundsmateriale med GAN-genererede miljøer. Selv om forskerne eksperimenterede med forskellige datasæt til at træne modellerne, viste det sig, at det mest effektive var KITTI Vision Benchmark Suite, der overvejende består af optagelser af chaufførens synsvinkel fra den tyske by Karlsruhe.

HGNG genererer en semantisk segmenteringslayout fra CGI-renderet output og indsætter derefter SPADE med varierende stil-kodninger for at skabe tilfældige og diverse fotorealistiske baggrundsbilleder, herunder nærliggende objekter i byscener. Den nye artikel fastslår, at gentagne mønstre, der er almindelige for CGI-pipelines med begrænsede ressourcer, ‘bryder immersionen’ for menneskelige chauffører, der bruger en simulator, og at de mere varierede baggrunde, som en GAN kan tilbyde, kan lette dette problem.
Forskerne eksperimenterede med både Conditional GAN (cGAN) og CYcleGAN (CyGAN) som generative netværk, og fandt til sidst, at hver har styrker og svagheder: cGAN kræver parrede datasæt, og CyGAN gør ikke. Men CyGAN kan ikke i øjeblikket overgå den hidtidige standard i konventionelle simulatorer, indtil der sker yderligere forbedringer i domæneadaptation og cyklus-konsistens. Derfor får cGAN, med dens ekstra krav til parrede datasæt, de bedste resultater i øjeblikket.

Den konceptuelle arkitektur af HGNG.
I HGNGs neurale grafikpipeline dannes 2D-repræsentationer fra CGI-synthesiserede scener. De objekter, der overføres til GAN-flowet fra CGI-renderingen, er begrænset til ‘essentielle’ elementer, herunder vejmarkeringer og køretøjer, som en GAN selv ikke kan renderere med tilstrækkelig temporal konsistens og integritet til en køresimulator. cGAN-synthesiseret billede bliver derefter kombineret med den delvise fysik-baserede render.
Tests
For at teste systemet brugte forskerne SPADE, trænet på Cityscapes, til at konvertere den semantiske layout af scenen til fotorealistisk output. CGI-kilden kom fra den åbne kilde-køresimulator CARLA, der udnytter Unreal Engine 4 (UE4).

Output fra den åbne kilde-køresimulator CARLA. Kilde: https://arxiv.org/pdf/1711.03938.pdf
Skærmnings- og lysmotoren i UE4 leverede den semantiske layout og de delvise renderede billeder, med kun køretøjer og vejmarkeringer som output. Blending blev opnået med en GP-GAN-instance trænet på Transient Attributes Database, og alle eksperimenter kørte på en NVIDIA RTX 2080 med 8 GB GDDR6 VRAM.
Forskerne testede for semantisk retention – evnen af outputbilledet til at korresponderer med den oprindelige semantiske segmenteringsmaske, der var tiltænkt som skabelon for scenen.
I testbillederne ovenfor ser vi, at i ‘render kun’-billedet (nederst til venstre) får den fulde render ikke plausibele skygger. Forskerne bemærker, at her (gul cirkel) skygger af træer, der falder på fortovet, blev fejltolket af DeepLabV3 (den semantiske segmenteringsramme, der blev brugt til disse eksperimenter) som ‘vej’-indhold.
I midterkolonne-flowet ser vi, at cGAN-oprettede køretøjer ikke har nok konsistent definition til at være brugbare i en køresimulator (rød cirkel). I højre kolonne-flowet overholder den blendede billedkvalitet den oprindelige semantiske definition, samtidig med at den fastholder essentielle CGI-baserede elementer.
Til at evaluere realisme brugte forskerne Frechet Inception Distance (FID) som en performances-måling, da den kan fungere på parrede eller uparrede data.
Tre datasæt blev brugt som grundsand: Cityscapes, KITTI og ADE20K.
Outputbillederne blev sammenlignet med hinanden ved hjælp af FID-scores, og sammenlignet med den fysik-baserede (dvs. CGI) pipeline, mens semantisk retention også blev evalueret.

I resultaterne ovenfor, der relaterer til semantisk retention, er højere scores bedre, med CGAN-pyramide-tilgangen (en af flere pipelines, der blev testet af forskerne) som den højeste score.

Resultaterne ovenfor vedrører FID-scores, med HGNG som den højeste score ved brug af KITTI-datasættet.
‘Kun render’-metoden (betegnet som [23]) vedrører output fra CARLA, en CGI-flow, der ikke forventes at være fotorealistisk.
Kvalitative resultater på den konventionelle renderingsmotor (‘c’ i billedet ovenfor) viser urealistiske fjerne baggrundsinformationer, såsom træer og vegetation, samtidig med at de kræver detaljerede modeller og just-in-time mesh-loading, samt andre processor-intensiverende procedurer. I midten (b) ser vi, at cGAN ikke kan opnå tilstrækkelig definition for de essentielle elementer, biler og vejmarkeringer. I den foreslåede blendede output (a) er køretøj- og vejdefinition god, samtidig med at den ambient miljø er divers og fotorealistisk.
Artiklen slutter med at foreslå, at den temporale konsistens af den GAN-genererede del af renderingspipelinen kunne øges gennem brug af større by-datasæt, og at fremtidigt arbejde i denne retning kunne tilbyde en reel alternativ til dyre neurale transformationer af CGI-baserede streams, samtidig med at den tilbyder større realisme og diversitet.
* Min konvertering af forfatternes inline-citationer til hyperlinks.
Først publiceret 23. juli 2022.














