Andersons vinkel
Nevralt renderings: Hvor lavt kan du gå i forhold til innputt?

I går fanget noen ekstraordinære nye arbeider i nevralt bilde syntese oppmerksomheten og fantasien til internettet, da Intel -forskere avdekket en ny metode for å forbedre realisme i syntetiske bilder.
Systemet, som er demonstrert i en video fra Intel, griper direkte inn i bildepipeline for videospillet Grand Theft Auto V og forbedrer automatisk bildene gjennom en bilde syntese algoritme trent på en konvolusjonsnevralt nettverk (CNN), ved hjelp av virkelige verdens bilder fra Mapillary-datasettet og bytter ut mindre realistiske lys og tekstur fra GTA-spillmotoren.

Kommentatorer, i en rekke reaksjoner i samfunn som Reddit og Hacker News, stiller spørsmål om ikke bare om nevralt rendering av denne typen kunne effektivt erstatte mindre fotorealistiske utdata fra tradisjonelle spillmotorer og VFX-nivå CGI, men om prosessen kunne oppnås med langt mer grunnleggende innputt enn det som ble demonstrert i Intel GTA5-demoen – effektivt å lage “dukke” proxy-innputt med massivt realistiske utdata.
Parret datasett
Prinsippet har blitt eksemplifisert av en ny generasjon GAN og encoder/decoder-systemer over de siste tre årene, som NVIDIA’s GauGAN, som genererer fotorealistiske landskapsbilder fra grove skisser.
Effektivt snur dette prinsippet den konvensjonelle bruken av semantisk segmentering i datamaskinsyn fra en passiv metode som tillater maskinsystemer å identifisere og isolere observerte objekter til en kreativ innputt, der brukeren “maler” en falsk semantisk segmenteringskart og systemet genererer bilder som er konsistente med forholdene det forstår fra å ha klassifisert og segmentert et bestemt område, som landskap.

En maskinlæringsramme anvender semantisk segmentering til ulike ytre scener, og gir det arkitektoniske paradigmet som tillater utviklingen av interaktive systemer, der brukeren maler en semantisk segmenteringsblokk og systemet fyller blokken med passende bilder fra et domenespesifikt datasett, som Tysklands Mapillary gatevisningssett, brukt i Intels GTA5 nevralt renderingsdemo. Kilde: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Parret datasett bilde syntese systemer fungerer ved å korrelere semantiske merker på to datasett: et rikt og fullstendig bilde sett, enten generert fra virkelige bilder (som Mapillary settet brukt til å forbedre GTA5 i Intels demo i går) eller fra syntetiske bilder, som CGI bilder.

Parret datasett eksempler for et bilde syntese system designet til å lage nevralt renderede karakterer fra klumske skisser. Venstre, prøver fra CGI-datasettet. Midten, tilsvarende prøver fra ‘skisse’ datasettet. Høyre, nevralt renderinger som har oversatt skisser tilbake til høykvalitetsbilder. Kilde: https://www.youtube.com/watch?v=miLIwQ7yPkA
Ytre miljøer er relativt uutfordrende når det gjelder å lage parret datasett transformasjoner av denne typen, fordi utstikkere vanligvis er ganske begrensede, topografien har en begrenset variasjonsområde som kan fanges i et datasett, og vi ikke må håndtere å lage kunstige mennesker eller forhandle den ukomfortable dalen (endå).
Omveltning av segmenteringskart
Google har utviklet en animert versjon av GauGAN-skjemaet, kalt Infinite Nature, som kan bevisst “hallusinere” kontinuerlige og aldri-sluttende fiktive landskaper ved å oversette falske semantiske kart til fotorealistiske bilder via NVIDIA’s SPADE infill system:

Kilde: https://www.youtube.com/watch?v=oXUf6anNAtc
Men Infinite Nature bruker et enkelt bilde som utgangspunkt og bruker SPADE bare til å male inn de manglende seksjonene i påfølgende rammeverk, mens SPADE selv skaper bilde transformasjoner direkte fra segmenteringskart.
Det er denne kapasiteten som synes å ha begeistret beundrere av Intels bildeforbedrings system – muligheten til å avlede svært høykvalitets fotorealistiske bilder, selv i sanntid (til slutt), fra ekstremt grove innputt.
Stripped-Down innputt for en nevralt renderingsmotor
Den nåværende implementeringen av Intels bildeforbedringsnettverk innebærer kanskje en stor mengde redundante beregningscykler, da spillmotoren genererer beregningskrevende tekstur og lys som nevralt renderingsmotoren ikke virkelig trenger. Systemet synes å være designet på denne måten ikke fordi dette er en nødvendig tilnærming, men fordi det er lettere å tilpasse en nevralt renderingsmotor til en eksisterende pipeline enn å lage en ny spillmotor som er optimalisert for en nevralt renderings tilnærming.
Den mest økonomiske bruken av ressurser i et spill system av denne typen kunne være fullstendig overtakelse av GPU-en av nevralt renderingsmotoren, med stripped-down proxy-innputt håndtert av CPU-en.
I tillegg kunne spillmotoren lett produsere representative segmenteringskart selv, ved å slå av all skygging og lys i utdata. Dessuten kunne den levere video i en mye lavere oppløsning enn det som vanligvis kreves av den, da videoen bare ville trenge å være bredt representativ for innholdet, med høyoppløst detalj håndtert av nevralt motoren, og ytterligere frigjøre lokale beregningsressurser.
Intel ISLs tidligere arbeid med segmentering>bilde
Den direkte oversettelsen av segmentering til fotorealistiske video er langt fra hypotetisk. I 2017 slapp Intel ISL, skaperne av gårsdagens sensasjon, initialt forskning som kunne utføre urban video syntese direkte fra semantisk segmentering.

Intel ISLs segmentering til bilde arbeid fra 2017. Kilde: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
I virkeligheten har det opprinnelige 2017-pipelinekortet bare blitt utvidet til å passe GTA5s fullstendig renderede utdata.
Nevralt rendering i VFX
Nevralt rendering fra kunstige segmenteringskart synes å være en lovende teknologi for VFX, med muligheten til å oversette svært grunnleggende videogrammer direkte til ferdige visuelle effekter, ved å generere domenespesifikke datasett tatt fra modeller eller syntetiske (CGI) bilder.


En hypotetisk nevralt renderings system, der omfattende dekning av hvert målobjekt er abstrahert til et bidragende datasett, og der kunstig genererte segmenteringskart brukes som grunnlag for full-oppløst fotorealistisk utdata. Kilde: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Utviklingen og tilpasningen av slike systemer ville flytte fokus for kunstnerisk innsats fra en tolkende til en representativ arbeidsflyt, og heve domene-drevet datainnsamling fra en støttende til en sentral rolle i de visuelle kunstene.
Artikkel oppdatert 16:55 til å legge til materiale om Intel ISL 2017 forskning.














