Andersons vinkel
Neuralt rendering: Hvad er det laveste niveau af input, der kan bruges?

I gÃĨr fik nyt arbejde inden for neuralt billedsyn opmÃĶrksomhed og fantasi fra internettet, da Intel -forskere afslÃļrede en ny metode til at forbedre realisme i syntetiske billeder.
Systemet, som demonstreres i en video fra Intel, griber direkte ind i billedpipeline for videospillet Grand Theft Auto V og forbedrer automatisk billederne gennem en billedsynsalgoritme trÃĶnet pÃĨ en convolutional neuralt netvÃĶrk (CNN), ved hjÃĶlp af virkelige billeder fra Mapillary-datasettet og udskifter mindre realistiske lys- og teksturering fra GTA-spilmotoren.

Kommentarerne, i en bred vifte af reaktioner i fÃĶllesskaber som Reddit og Hacker News, stiller ikke kun spÃļrgsmÃĨl om, hvorvidt neuralt rendering af denne type kunne erstatter mindre fotorealistiske output fra traditionelle spilmotorer og VFX-niveau CGI, men ogsÃĨ om dette kunne opnÃĨs med langt mere basis-input end det, der blev demonstreret i Intel GTA5-demonstrationen â effektivt skabende âdukkeâ-proxy-input med massivt realistiske output.
Parret datasets
Princippet er blevet eksemplificeret af en ny generation af GAN og encoder/decoder-systemer over de sidste tre ÃĨr, sÃĨsom NVIDIAâs GauGAN, som genererer fotorealistiske landskabsbilleder fra grove skitser.
Effektivt flipper denne princip den konventionelle brug af semantisk segmentering i computer vision fra en passiv metode, der tillader maskinsystemer at identificere og isolere observerede objekter, til en kreativ input, hvor brugeren âmalerâ en falsk semantisk segmenteringskort og systemet genererer billeder, der er konsistente med relationerne, det forstÃĨr fra at have klassificeret og segmenteret et bestemt domÃĶne, sÃĨsom landskab.

En maskinlÃĶringsramme anvender semantisk segmentering til forskellige ydre scener, og giver den arkitektoniske paradigme, der tillader udviklingen af interaktive systemer, hvor brugeren maler en semantisk segmenteringsblok, og systemet udfylder blokken med passende billeder fra et domÃĶnespecifikt dataset, sÃĨsom Tysklands Mapillary-gadesynsÃĶt, brugt i Intels GTA5-neuralt renderingsdemo. Kilde: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Parret dataset billedsynssystemer arbejder ved at korrelere semantiske mÃĶrker pÃĨ to datasets: et rigt og fuldt udviklet billedsÃĶt, enten genereret fra virkelige billeder (sÃĨsom Mapillary-sÃĶttet, der bruges til at forbedre GTA5 i Intels demo i gÃĨr) eller fra syntetiske billeder, sÃĨsom CGI-billeder.

Parret dataset eksempler til et billedsynssystem designet til at skabe neuralt-renderede karakterer fra klodsede skitser. Til venstre, eksempler fra CGI-datasettet. Midten, tilsvarende eksempler fra âskitseâ-datasettet. HÃļjre, neuralt-renderede billeder, der har oversat skitser tilbage til hÃļjkvalitetsbilleder. Kilde: https://www.youtube.com/watch?v=miLIwQ7yPkA
Ydre miljÃļer er relativt ukomplicerede, nÃĨr det kommer til at skabe parret dataset-transformationer af denne type, fordi fremspring normalt er ret begrÃĶnsede, topografien har en begrÃĶnsende variation, der kan indfanges i et dataset, og vi behÃļver ikke at skabe kunstige mennesker eller forhandle den Uncanny Valley (endnu).
Invertering af segmenteringskort
Google har udviklet en animeret version af GauGAN-skemaet, kaldet Infinite Nature, der kan bevidst âhallucinereâ kontinuert og uendelige fiktive landskaber ved at oversÃĶtte falske semantiske kort til fotorealistiske billeder via NVIDIAâs SPADE-infill-system:

Kilde: https://www.youtube.com/watch?v=oXUf6anNAtc
Men Infinite Nature bruger et enkelt billede som udgangspunkt og bruger kun SPADE til at male i de manglende sektioner i efterfÃļlgende billeder, hvorimod SPADE selv skaber billedtransformationer direkte fra segmenteringskort.
Det er denne kapacitet, der synes at have vÃĶret ÃĨrsag til, at beundrere af Intels billedforbedringssystem har bemÃĶrket muligheden for at udlede meget hÃļjkvalitetsfotorealistiske billeder, selv i realtid (til sidst), fra ekstremt grove input.
Erstatning af teksturer og lys med neuralt rendering
I tilfÃĶldet med GTA5-input har nogen undret, om nogen af de beregningsmÃĶssigt dyre procedurer og bitmap-teksturer og lys fra spilmotorens output virkelig er nÃļdvendige i fremtidige neuralt renderingsystemer, eller om det mÃĨske er muligt at transformere lavoplÃļselige, wireframe-niveau-input til fotorealistiske video, der overgÃĨr skygge-, tekstur- og lyskvaliteterne fra spilmotorer, og skaber hyperrealistiske scener fra âproxyâ-input.
Det kan synes ÃĨbenlyst, at spilgenererede aspekter som refleksioner, teksturer og andre typer miljÃļdetaljer er essentielle informationskilder for et neuralt renderingsystem af den type, der er demonstreret af Intel. Men det er nu flere ÃĨr siden, NVIDIAâs UNIT (UNsupervised Image-to-image Translation Networks) demonstrerede, at kun domÃĶnet er vigtigt, og at selv omfattende aspekter som ânat eller dagâ i princippet er spÃļrgsmÃĨl, der skal hÃĨndteres af stiloverfÃļring:
I forhold til nÃļdvendig input kan dette potentielt efterlade spilmotoren kun til at generere basegeometri og fysiksimuleringer, da neuralt renderingsmotoren kan overmale alle andre aspekter ved at syntetisere det Ãļnskede billede fra det indfangede dataset, ved hjÃĶlp af semantiske kort som en fortolkningsskikt.

Intels system forbedrer en fuldt fÃĶrdig og rendered billede fra GTA5, og tilfÃļjer segmentering og vurderede dybdekort â to aspekter, der potentielt kan leveres direkte af en nedskaleret spilmotor. Kilde: https://www.youtube.com/watch?v=P1IcaBn3ej0
Intels neuralt renderingsapproach indebÃĶrer analyse af fuldt renderede billeder fra GTA5-buffere, og neuralt system har den ekstra byrde at skabe bÃĨde dybdekort og segmenteringskort. Da dybdekort implicit er tilgÃĶngelige i traditionelle 3D-pipelines (og er mindre krÃĶvende at generere end tekstur, ray-tracing eller global illumination), kan det mÃĨske vÃĶre en bedre brug af ressourcer at lade spilmotoren hÃĨndtere dem.
Nedskaleret input til et neuralt renderingsmotor
Den nuvÃĶrende implementering af Intels billedforbedringsnetvÃĶrk indebÃĶrer mÃĨske en stor mÃĶngde redundant beregning, da spilmotoren genererer beregningsmÃĶssigt dyre teksturer og lys, som neuralt renderingsmotoren ikke virkelig har brug for. Systemet synes at vÃĶre designet pÃĨ denne mÃĨde, ikke fordi det nÃļdvendigvis er en optimal tilgang, men fordi det er lettere at tilpasse et neuralt renderingsmotor til en eksisterende pipeline end at skabe en ny spilmotor, der er optimeret til en neuralt renderingsapproach.
Den mest Ãļkonomiske brug af ressourcer i et spilsystem af denne art kunne vÃĶre fuldstÃĶndig overtagelse af GPUâen af neuralt renderingsmotoren, med den nedskalerede proxy-input hÃĨndteret af CPUâen.
Desuden kunne spilmotoren let producere reprÃĶsentative segmenteringskort selv, ved at slukke for alle skygge- og lys-effekter i dens output. Derudover kunne det leverer video i en langt lavere oplÃļsning, end det normalt krÃĶves af det, da videoen kun behÃļver at vÃĶre bredt reprÃĶsentativ for indholdet, med hÃļj oplÃļsning detaljer hÃĨndteret af neuralt motoren, og yderligere frigÃļr lokale beregningsressourcer.
Intel ISLâs tidligere arbejde med segmentering>billede
Den direkte oversÃĶttelse af segmentering til fotorealistiske video er langt fra hypotetisk. I 2017 udgav Intel ISL, skaberen af i gÃĨr, initialt forskning, der kan udfÃļre byvideo-syntese direkte fra semantisk segmentering.

Intel ISLâs segmentering til billede-arbejde fra 2017. Kilde: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
I virkeligheden er det oprindelige pipeline fra 2017 blot blevet udvidet til at passe GTA5âs fuldt renderede output.
Neuralt rendering i VFX
Neuralt rendering fra kunstige segmenteringskort synes ogsÃĨ at vÃĶre en lovende teknologi til VFX, med muligheden for direkte at oversÃĶtte meget basisvideogrammer til fÃĶrdige visuelle effekter, ved at generere domÃĶnespecifikke datasets fra modeller eller syntetiske (CGI)-billeder.


En hypotetisk neuralt renderingsmotor, hvor omfattende dÃĶkning af hvert mÃĨl-objekt er abstraheret til et bidragende dataset, og hvor kunstigt genererede segmenteringskort bruges som grundlag for fuldoplÃļsningsfotorealistiske output. Kilde: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Udviklingen og antagelsen af sÃĨdanne systemer ville flytte fokus for kunstnerisk indsats fra en fortolknings til en reprÃĶsentativ arbejdsgang, og ville hÃĶve domÃĶne-drevet dataindsamling fra en stÃļttende til en central rolle i de visuelle kunstarter.
Artiklen er opdateret kl. 16:55 til at tilfÃļje materiale om Intel ISLâs forskning fra 2017.














