Andersons vinkel

Neuralt renderering: Hur lågt kan du gå i termer av indata?

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Igår fångade något extraordinärt nytt arbete inom neural bildsyntes uppmärksamheten och fantasin hos internet, eftersom Intel (INTC ) -forskare avslöjade en ny metod för att förbättra realismen i syntetiska bilder.

Systemet, som demonstreras i en video från Intel, ingriper direkt i bildpipelinen för videospel Grand Theft Auto V och förbättrar automatiskt bilderna genom en bildsyntesalgoritm som tränats på en konvolutionsneuronnätverk (CNN), med hjälp av verkliga världsbilder från Mapillary-dataseten och byter ut den mindre realistiska belysningen och textureringen av GTA-spelmotorn.

Kommentatorer, i en stor mängd reaktioner i samhällen som Reddit och Hacker News, hävdar inte bara att neuralt renderering av detta slag kan effektivt ersätta den mindre fotorealistiska utmatningen från traditionella spelmotorer och VFX-nivå CGI, utan att denna process kan uppnås med mycket mer grundläggande indata än vad som demonstrerades i Intel GTA5-demon.

Parade datamängder

Principen har exemplifierats av en ny generation GAN och encoder/decoder-system under de senaste tre åren, såsom NVIDIA’s GauGAN, som genererar fotorealistiska landskapsbilder från grova penseldrag.

Effektivt vänder denna princip den konventionella användningen av semantisk segmentering i datorseende från en passiv metod som tillåter maskinsystem att identifiera och isolera observerade föremål till en kreativ inmatning, där användaren “målar” en falsk semantisk segmenteringskarta och systemet genererar bilder som är konsekventa med de relationer det förstår från att ha klassificerat och segmenterat ett visst område, såsom landskap.

En maskinlärningsramverk tillämpar semantisk segmentering på olika yttre scener, vilket ger den arkitektoniska paradigm som tillåter utvecklingen av interaktiva system, där användaren målar en semantisk segmenteringsblock och systemet fyller i blocket med lämpliga bilder från en domänspecifik dataset, såsom Tysklands Mapillary-gatuvyssamling, som används i Intels GTA5-neuralt renderingsdemo. Källa: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

En maskinlärningsramverk tillämpar semantisk segmentering på olika yttre scener, vilket ger den arkitektoniska paradigm som tillåter utvecklingen av interaktiva system, där användaren målar en semantisk segmenteringsblock och systemet fyller i blocket med lämpliga bilder från en domänspecifik dataset, såsom Tysklands Mapillary-gatuvyssamling, som används i Intels GTA5-neuralt renderingsdemo. Källa: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Parade datamängdsbildsyntessystem fungerar genom att korrelera semantiska etiketter på två datamängder: en rik och fullständig bildmängd, antingen genererad från verkliga världsbilder (såsom Mapillary-mängden som används för att förbättra GTA5 i Intels demo igår) eller från syntetiska bilder, såsom CGI-bilder.

Parade datamängdexempel för ett bildsyntessystem som är utformat för att skapa neuralt renderade tecken från klumpiga skisser. Till vänster, prover från CGI-dataseten. Mitten, motsvarande prover från 'skiss'-dataseten. Höger, neuralt renderade bilder som har översatt skisser tillbaka till högkvalitetsbilder. Källa: https://www.youtube.com/watch?v=miLIwQ7yPkA

Parade datamängdexempel för ett bildsyntessystem som är utformat för att skapa neuralt renderade tecken från klumpiga skisser. Till vänster, prover från CGI-dataseten. Mitten, motsvarande prover från ‘skiss’-dataseten. Höger, neuralt renderade bilder som har översatt skisser tillbaka till högkvalitetsbilder. Källa: https://www.youtube.com/watch?v=miLIwQ7yPkA

Yttre miljöer är relativt odiskutabla när man skapar parade datamängdstransformationer av detta slag, eftersom utskjutningar vanligtvis är ganska begränsade, topografin har en begränsad variation som kan fångas i en datamängd, och vi behöver inte hantera skapandet av artificiella människor eller förhandla om den obehagliga dalen (ännu).

Inverterande segmenteringskartor

Google har utvecklat en animerad version av GauGAN-schemat, kallad Infinite Nature, som kan medvetet “hallucinera” kontinuerliga och aldrig slutande fiktiva landskap genom att översätta falska semantiska kartor till fotorealistiska bilder via NVIDIA’s SPADE-infillsystem:

Källa: https://www.youtube.com/watch?v=oXUf6anNAtc

Källa: https://www.youtube.com/watch?v=oXUf6anNAtc

Men Infinite Nature använder en enda bild som startpunkt och använder SPADE bara för att måla i de saknade sektionerna i efterföljande ramar, medan SPADE själv skapar bildtransformeringar direkt från segmenteringskartor.

Källa: https://nvlabs.github.io/SPADE/

Källa: https://nvlabs.github.io/SPADE/

Det är denna kapacitet som tycks ha väckt beundrare av Intels bildförbättringssystem – möjligheten att erhålla mycket högkvalitativa fotorealistiska bilder, även i realtid (till slut), från extremt grov inmatning.

Ersättning av texturer och belysning med neuralt renderingsverktyg

I fallet med GTA5-inmatningen har vissa undrat om någon av de beräkningsmässigt dyra procedur- och bitmap-texturerna och belysningen från spelmotorns utmatning verkligen kommer att vara nödvändig i framtida neuralt renderingsystem, eller om det skulle vara möjligt att omvandla lågupplösta, wireframe-nivåinmatning till fotorealistiska videor som överträffar skuggning-, textur- och belysningsförmågan hos spelmotorer, och skapa hyperrealistiska scener från “proxy”-inmatning.

Det kan tyckas uppenbart att spelmotorgenererade aspekter som reflektioner, texturer och andra typer av miljödetaljer är viktiga informationskällor för ett neuralt renderingsystem av det slag som demonstrerats av Intel. Men det har varit några år sedan NVIDIA’s UNIT (UNsupervised Image-to-image Translation Networks) visade att endast domänen är viktig, och att till och med omfattande aspekter som “natt eller dag” i princip är frågor som ska hanteras av stilöverföring:

I termer av erforderlig inmatning, lämnar detta potentiellt spelmotorn att endast generera basgeometri och fysiksimuleringar, eftersom det neuralt renderingsmotorn kan övermåla alla andra aspekter genom att syntetisera önskad bild från den fångade datamängden, med hjälp av semantiska kartor som en tolkningslager.

Intels system förbättrar en komplett och renderad ram från GTA5, lägger till segmentering och utvärderade djupkartor — två aspekter som potentiellt kan tillhandahållas direkt av en nedskalad spelmotor. Källa: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intels system förbättrar en komplett och renderad ram från GTA5, lägger till segmentering och utvärderade djupkartor — två aspekter som potentiellt kan tillhandahållas direkt av en nedskalad spelmotor. Källa: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intels neuralt renderingsansats innefattar analys av komplett renderade ramar från GTA5-buffertar, och det neurala systemet har den extra bördan att skapa både djupkartor och segmenteringskartor. Eftersom djupkartor implicit är tillgängliga i traditionella 3D-pipeliner (och är mindre krävande att generera än texturering, ray-tracing eller global belysning) kan det vara en bättre användning av resurser att låta spelmotorn hantera dem.

Nedskalad inmatning för ett neuralt renderingsverktyg

Den nuvarande implementeringen av Intels bildförbättringsnätverk kan därför innehålla en stor mängd redundanta beräkningscykler, eftersom spelmotorn genererar beräkningsmässigt dyra texturering och belysning som det neuralt renderingsmotorn inte verkligen behöver. Systemet verkar ha utformats på detta sätt inte för att det nödvändigtvis är en optimal approach, utan för att det är lättare att anpassa ett neuralt renderingsverktyg till en befintlig pipeline än att skapa en ny spelmotor som är optimerad för en neuralt renderingsansats.

Den mest ekonomiska användningen av resurser i ett system av detta slag kan vara fullständig övertagande av GPU av det neuralt renderingsverktyget, med den nedskalade proxy-inmatningen hanterad av CPU.

Förutom att spelmotorn kan producera representativa segmenteringskartor själv, genom att stänga av all skuggning och belysning i dess utmatning. Dessutom kan den tillhandahålla video i en mycket lägre upplösning än vad som vanligtvis krävs av den, eftersom videon endast behöver vara grovt representativ för innehållet, med högupplösta detaljer hanterade av det neuralt renderingsverktyget, vilket ytterligare frigör lokala beräkningsresurser.

Intel ISL:s tidigare arbete med segmentering>bild

Den direkta översättningen av segmentering till fotorealistiska video är långt ifrån hypotetisk. 2017 släppte Intel ISL, skaparna av gårdagens sensation, initial forskning som kunde utföra urban videosyntes direkt från semantisk segmentering.

Intel ISL - segmentering till bild

Intel ISL:s segmentering till bild från 2017. Källa: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

I själva verket har den ursprungliga 2017-pipelinen bara utvidgats för att passa GTA5:s fullständigt renderade utmatning.

Neuralt renderingsverktyg i VFX

Neuralt renderingsverktyg från artificiella segmenteringskartor verkar också vara en lovande teknik för VFX, med möjligheten att direkt översätta mycket grundläggande videogram direkt till färdiga visuella effekter, genom att generera domänspecifika datamängder från modeller eller syntetiska (CGI)-bilder.

En hypotetisk neuralt renderingsverktyg, där omfattande täckning av varje målföremål abstraheras till en bidragande datamängd, och där artificiellt genererade segmenteringskartor används som grund för fullupplösta fotorealistiska utmatningar. Källa: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

En hypotetisk neuralt renderingsverktyg, där omfattande täckning av varje målföremål abstraheras till en bidragande datamängd, och där artificiellt genererade segmenteringskartor används som grund för fullupplösta fotorealistiska utmatningar. Källa: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Utvecklingen och antagandet av sådana system skulle förskjuta fokus för konstnärliga ansträngningar från en tolkande till en representativ arbetsflöde, och höja domänstyrd datainsamling från en stödjande till en central roll i de visuella konsterna.

Artikeln uppdaterad 16:55 för att lägga till material om Intel ISL 2017-forskning.

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai