Andersons hoek
Neurale rendering: hoe laag kun je gaan in termen van invoer?

Gisteren trok nieuw onderzoek in neurale beeldsynthese de aandacht en de verbeelding van het internet, toen Intel -onderzoekers een nieuwe methode onthulden om de realisme van synthetische beelden te verbeteren.
Het systeem, zoals gedemonstreerd in een video van Intel, grijpt rechtstreeks in in de beeldpijplijn voor het videospel Grand Theft Auto V en verbetert de beelden automatisch door een beeldsyntheseralgoritme getraind op een convolutioneel neuronaal netwerk (CNN), met behulp van echte wereldbeelden van de Mapillary-dataset, en door het minder realistische licht en textuur van de GTA-game-engine te vervangen.

Reageerders, in een breed scala aan reacties in gemeenschappen zoals Reddit en Hacker News, zijn van mening dat neurale rendering van dit type niet alleen de minder fotorealistische output van traditionele game-engines en VFX-niveau CGI kan vervangen, maar dat dit proces ook kan worden bereikt met veel basisinvoer dan in de Intel GTA5-demo werd gedemonstreerd – effectief ‘poppen’-proxy-invoer creërend met enorm realistische output.
Gebruikte datasets
Het principe is geïllustreerd door een nieuwe generatie GAN- en encoder/decoder-systemen in de afgelopen drie jaar, zoals NVIDIA’s GauGAN, die fotorealistische landschapsbeelden genereert uit grove schetsen.
Effectief keert dit principe de conventionele gebruik van semantische segmentatie in computer vision van een passieve methode die machine-systemen in staat stelt om waargenomen objecten te identificeren en te isoleren, om in een creatieve invoer, waar de gebruiker een nep-semantische segmentatiemap ‘schildert’ en het systeem beelden genereert die consistent zijn met de relaties die het begrijpt uit een bepaald domein, zoals landschappen.

Een machine learning-framework past semantische segmentatie toe op verschillende buiten-scènes, waardoor een architectonisch paradigma ontstaat dat de ontwikkeling van interactieve systemen mogelijk maakt, waar de gebruiker een semantische segmentatieblok ‘schildert’ en het systeem het blok vult met passende beelden uit een domeinspecifieke dataset, zoals Duitslands Mapillary-straatbeeldset, gebruikt in Intel’s GTA5-neurale rendering-demo. Bron: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Gebruikte dataset-beeldsynthesesystemen werken door semantische labels op twee datasets te correleren: een rijke en volledige beeldenset, die wordt gegenereerd uit echte wereldbeelden (zoals de Mapillary-set die wordt gebruikt om GTA5 in de Intel-demo te verbeteren) of uit synthetische beelden, zoals CGI-beelden.

Gebruikte dataset-voorbeelden voor een beeldsynthesesysteem dat is ontworpen om neurale gerenderde personages te creëren uit onhandige schetsen. Links, voorbeelden uit de CGI-dataset. Midden, overeenkomstige voorbeelden uit de ‘schets’-dataset. Rechts, neurale renders die schetsen hebben vertaald in hoge kwaliteit beelden. Bron: https://www.youtube.com/watch?v=miLIwQ7yPkA
Buitenomgevingen zijn relatief onuitdagend bij het creëren van dergelijke gebruikt dataset-transformaties, omdat uitsteeksels meestal vrij beperkt zijn, de topografie een beperkt bereik van variatie heeft dat volledig in een dataset kan worden vastgelegd, en we niet hoeven te maken met het creëren van kunstmatige mensen of het navigeren door de Uncanny Valley (nog niet).
Omgekeerde segmentatiemappen
Google heeft een geanimeerde versie van het GauGAN-schema ontwikkeld, genaamd Infinite Nature, die in staat is om bewust ‘hallucinerende’ continue en eindeloze fictieve landschappen te creëren door nep-semantische mappen om te zetten in fotorealistische beelden via NVIDIA’s SPADE-infill-systeem:

Bron: https://www.youtube.com/watch?v=oXUf6anNAtc
Echter, Infinite Nature gebruikt één beeld als startpunt en gebruikt SPADE alleen om de ontbrekende secties in opeenvolgende frames in te vullen, terwijl SPADE zelf beeldtransformaties rechtstreeks uit segmentatiemappen creëert.
Het is deze capaciteit die lijkt te hebben gestimuleerd de bewonderaars van het Intel Image Enhancement-systeem – de mogelijkheid om zeer hoge kwaliteit fotorealistische beelden te verkrijgen, zelfs in real-time (uiteindelijk), uit extreem grove invoer.
Verwijderde invoer voor een neurale rendering-engine
De huidige implementatie van het Intel-beeldverbeteringsnetwerk omvat mogelijk een grote hoeveelheid redundante berekeningscycli, omdat de game-engine computationeel dure textuur- en lichtberekeningen uitvoert die de neurale rendering-engine niet echt nodig heeft. Het systeem lijkt te zijn ontworpen op deze manier niet omdat dit noodzakelijkerwijs een optimale aanpak is, maar omdat het gemakkelijker is om een neurale rendering-engine aan te passen aan een bestaande pijplijn dan om een nieuwe game-engine te creëren die is geoptimaliseerd voor een neurale rendering-aanpak.
Het meest economische gebruik van resources in een dergelijk gamingsysteem zou het volledig overnemen van de GPU door de neurale rendering-engine zijn, met de verwijderde proxy-invoer die wordt afgehandeld door de CPU.
Bovendien kan de game-engine gemakkelijk representatieve segmentatiemappen zelf produceren, door alle schaduw- en lichteffecten in zijn output uit te schakelen. Bovendien kan het video leveren op een veel lagere resolutie dan normaal vereist is, omdat de video alleen maar globaal representatief hoeft te zijn voor de inhoud, met hoge resolutie details die worden afgehandeld door de neurale engine, waardoor lokale rekenresources verder worden vrijgemaakt.
Intel ISL’s eerdere werk met segmentatie>beeld
De directe vertaling van segmentatie naar fotorealistische video is verre van hypothetisch. In 2017 publiceerde Intel ISL, de makers van gisteren, initieel onderzoek dat in staat was om stedelijke video-synthese rechtstreeks uit semantische segmentatie te produceren.

Intel ISL’s segmentatie naar beeld werk uit 2017. Bron: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
In feite is die oorspronkelijke 2017-pijplijn slechts uitgebreid om de volledig gerenderde output van GTA5 te passen.
Neurale rendering in VFX
Neurale rendering vanuit kunstmatige segmentatiemappen lijkt ook een veelbelovende technologie te zijn voor VFX, met de mogelijkheid om rechtstreeks zeer basisvideogrammen om te zetten in afgewerkte visuele effectenbeelden, door domeinspecifieke datasets te genereren uit modellen of synthetische (CGI)-beelden.


Een hypothetisch neurale rendering-systeem, waarin uitgebreide dekking van elk doelobject wordt geabstraheerd in een bijdragende dataset, en waar kunstmatig gegenereerde segmentatiemappen worden gebruikt als basis voor volledige resolutie fotorealistische output. Bron: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
De ontwikkeling en adoptie van dergelijke systemen zouden het centrum van artistieke inspanning verplaatsen van een interpretatieve naar een representatieve workflow, en domein-gedreven dataverzameling verheffen van een ondersteunende naar een centrale rol in de visuele kunst.
Artikel bijgewerkt om 16:55 uur om materiaal over Intel ISL 2017-onderzoek toe te voegen.














