Andersons vinkel

Neuralt renderering: Hur lÃĨgt kan du gÃĨ i termer av indata?

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

IgÃĨr fÃĨngade nÃĨgot extraordinÃĪrt nytt arbete inom neural bildsyntes uppmÃĪrksamheten och fantasin hos internet, eftersom Intel -forskare avslÃķjade en ny metod fÃķr att fÃķrbÃĪttra realismen i syntetiska bilder.

Systemet, som demonstreras i en video frÃĨn Intel, ingriper direkt i bildpipelinen fÃķr videospel Grand Theft Auto V och fÃķrbÃĪttrar automatiskt bilderna genom en bildsyntesalgoritm som trÃĪnats pÃĨ en konvolutionsneuronnÃĪtverk (CNN), med hjÃĪlp av verkliga vÃĪrldsbilder frÃĨn Mapillary-dataseten och byter ut den mindre realistiska belysningen och textureringen av GTA-spelmotorn.

Kommentatorer, i en stor mÃĪngd reaktioner i samhÃĪllen som Reddit och Hacker News, hÃĪvdar inte bara att neuralt renderering av detta slag kan effektivt ersÃĪtta den mindre fotorealistiska utmatningen frÃĨn traditionella spelmotorer och VFX-nivÃĨ CGI, utan att denna process kan uppnÃĨs med mycket mer grundlÃĪggande indata ÃĪn vad som demonstrerades i Intel GTA5-demon.

Parade datamÃĪngder

Principen har exemplifierats av en ny generation GAN och encoder/decoder-system under de senaste tre ÃĨren, sÃĨsom NVIDIA’s GauGAN, som genererar fotorealistiska landskapsbilder frÃĨn grova penseldrag.

Effektivt vÃĪnder denna princip den konventionella anvÃĪndningen av semantisk segmentering i datorseende frÃĨn en passiv metod som tillÃĨter maskinsystem att identifiera och isolera observerade fÃķremÃĨl till en kreativ inmatning, dÃĪr anvÃĪndaren “mÃĨlar” en falsk semantisk segmenteringskarta och systemet genererar bilder som ÃĪr konsekventa med de relationer det fÃķrstÃĨr frÃĨn att ha klassificerat och segmenterat ett visst omrÃĨde, sÃĨsom landskap.

En maskinlÃĪrningsramverk tillÃĪmpar semantisk segmentering pÃĨ olika yttre scener, vilket ger den arkitektoniska paradigm som tillÃĨter utvecklingen av interaktiva system, dÃĪr anvÃĪndaren mÃĨlar en semantisk segmenteringsblock och systemet fyller i blocket med lÃĪmpliga bilder frÃĨn en domÃĪnspecifik dataset, sÃĨsom Tysklands Mapillary-gatuvyssamling, som anvÃĪnds i Intels GTA5-neuralt renderingsdemo. KÃĪlla: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

En maskinlÃĪrningsramverk tillÃĪmpar semantisk segmentering pÃĨ olika yttre scener, vilket ger den arkitektoniska paradigm som tillÃĨter utvecklingen av interaktiva system, dÃĪr anvÃĪndaren mÃĨlar en semantisk segmenteringsblock och systemet fyller i blocket med lÃĪmpliga bilder frÃĨn en domÃĪnspecifik dataset, sÃĨsom Tysklands Mapillary-gatuvyssamling, som anvÃĪnds i Intels GTA5-neuralt renderingsdemo. KÃĪlla: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Parade datamÃĪngdsbildsyntessystem fungerar genom att korrelera semantiska etiketter pÃĨ tvÃĨ datamÃĪngder: en rik och fullstÃĪndig bildmÃĪngd, antingen genererad frÃĨn verkliga vÃĪrldsbilder (sÃĨsom Mapillary-mÃĪngden som anvÃĪnds fÃķr att fÃķrbÃĪttra GTA5 i Intels demo igÃĨr) eller frÃĨn syntetiska bilder, sÃĨsom CGI-bilder.

Parade datamÃĪngdexempel fÃķr ett bildsyntessystem som ÃĪr utformat fÃķr att skapa neuralt renderade tecken frÃĨn klumpiga skisser. Till vÃĪnster, prover frÃĨn CGI-dataseten. Mitten, motsvarande prover frÃĨn 'skiss'-dataseten. HÃķger, neuralt renderade bilder som har Ãķversatt skisser tillbaka till hÃķgkvalitetsbilder. KÃĪlla: https://www.youtube.com/watch?v=miLIwQ7yPkA

Parade datamÃĪngdexempel fÃķr ett bildsyntessystem som ÃĪr utformat fÃķr att skapa neuralt renderade tecken frÃĨn klumpiga skisser. Till vÃĪnster, prover frÃĨn CGI-dataseten. Mitten, motsvarande prover frÃĨn ‘skiss’-dataseten. HÃķger, neuralt renderade bilder som har Ãķversatt skisser tillbaka till hÃķgkvalitetsbilder. KÃĪlla: https://www.youtube.com/watch?v=miLIwQ7yPkA

Yttre miljÃķer ÃĪr relativt odiskutabla nÃĪr man skapar parade datamÃĪngdstransformationer av detta slag, eftersom utskjutningar vanligtvis ÃĪr ganska begrÃĪnsade, topografin har en begrÃĪnsad variation som kan fÃĨngas i en datamÃĪngd, och vi behÃķver inte hantera skapandet av artificiella mÃĪnniskor eller fÃķrhandla om den obehagliga dalen (ÃĪnnu).

Inverterande segmenteringskartor

Google har utvecklat en animerad version av GauGAN-schemat, kallad Infinite Nature, som kan medvetet “hallucinera” kontinuerliga och aldrig slutande fiktiva landskap genom att ÃķversÃĪtta falska semantiska kartor till fotorealistiska bilder via NVIDIA’s SPADE-infillsystem:

KÃĪlla: https://www.youtube.com/watch?v=oXUf6anNAtc

KÃĪlla: https://www.youtube.com/watch?v=oXUf6anNAtc

Men Infinite Nature anvÃĪnder en enda bild som startpunkt och anvÃĪnder SPADE bara fÃķr att mÃĨla i de saknade sektionerna i efterfÃķljande ramar, medan SPADE sjÃĪlv skapar bildtransformeringar direkt frÃĨn segmenteringskartor.

KÃĪlla: https://nvlabs.github.io/SPADE/

KÃĪlla: https://nvlabs.github.io/SPADE/

Det ÃĪr denna kapacitet som tycks ha vÃĪckt beundrare av Intels bildfÃķrbÃĪttringssystem – mÃķjligheten att erhÃĨlla mycket hÃķgkvalitativa fotorealistiska bilder, ÃĪven i realtid (till slut), frÃĨn extremt grov inmatning.

ErsÃĪttning av texturer och belysning med neuralt renderingsverktyg

I fallet med GTA5-inmatningen har vissa undrat om nÃĨgon av de berÃĪkningsmÃĪssigt dyra procedur- och bitmap-texturerna och belysningen frÃĨn spelmotorns utmatning verkligen kommer att vara nÃķdvÃĪndig i framtida neuralt renderingsystem, eller om det skulle vara mÃķjligt att omvandla lÃĨgupplÃķsta, wireframe-nivÃĨinmatning till fotorealistiska videor som ÃķvertrÃĪffar skuggning-, textur- och belysningsfÃķrmÃĨgan hos spelmotorer, och skapa hyperrealistiska scener frÃĨn “proxy”-inmatning.

Det kan tyckas uppenbart att spelmotorgenererade aspekter som reflektioner, texturer och andra typer av miljÃķdetaljer ÃĪr viktiga informationskÃĪllor fÃķr ett neuralt renderingsystem av det slag som demonstrerats av Intel. Men det har varit nÃĨgra ÃĨr sedan NVIDIA’s UNIT (UNsupervised Image-to-image Translation Networks) visade att endast domÃĪnen ÃĪr viktig, och att till och med omfattande aspekter som “natt eller dag” i princip ÃĪr frÃĨgor som ska hanteras av stilÃķverfÃķring:

I termer av erforderlig inmatning, lÃĪmnar detta potentiellt spelmotorn att endast generera basgeometri och fysiksimuleringar, eftersom det neuralt renderingsmotorn kan ÃķvermÃĨla alla andra aspekter genom att syntetisera Ãķnskad bild frÃĨn den fÃĨngade datamÃĪngden, med hjÃĪlp av semantiska kartor som en tolkningslager.

Intels system fÃķrbÃĪttrar en komplett och renderad ram frÃĨn GTA5, lÃĪgger till segmentering och utvÃĪrderade djupkartor — tvÃĨ aspekter som potentiellt kan tillhandahÃĨllas direkt av en nedskalad spelmotor. KÃĪlla: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intels system fÃķrbÃĪttrar en komplett och renderad ram frÃĨn GTA5, lÃĪgger till segmentering och utvÃĪrderade djupkartor — tvÃĨ aspekter som potentiellt kan tillhandahÃĨllas direkt av en nedskalad spelmotor. KÃĪlla: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intels neuralt renderingsansats innefattar analys av komplett renderade ramar frÃĨn GTA5-buffertar, och det neurala systemet har den extra bÃķrdan att skapa bÃĨde djupkartor och segmenteringskartor. Eftersom djupkartor implicit ÃĪr tillgÃĪngliga i traditionella 3D-pipeliner (och ÃĪr mindre krÃĪvande att generera ÃĪn texturering, ray-tracing eller global belysning) kan det vara en bÃĪttre anvÃĪndning av resurser att lÃĨta spelmotorn hantera dem.

Nedskalad inmatning fÃķr ett neuralt renderingsverktyg

Den nuvarande implementeringen av Intels bildfÃķrbÃĪttringsnÃĪtverk kan dÃĪrfÃķr innehÃĨlla en stor mÃĪngd redundanta berÃĪkningscykler, eftersom spelmotorn genererar berÃĪkningsmÃĪssigt dyra texturering och belysning som det neuralt renderingsmotorn inte verkligen behÃķver. Systemet verkar ha utformats pÃĨ detta sÃĪtt inte fÃķr att det nÃķdvÃĪndigtvis ÃĪr en optimal approach, utan fÃķr att det ÃĪr lÃĪttare att anpassa ett neuralt renderingsverktyg till en befintlig pipeline ÃĪn att skapa en ny spelmotor som ÃĪr optimerad fÃķr en neuralt renderingsansats.

Den mest ekonomiska anvÃĪndningen av resurser i ett system av detta slag kan vara fullstÃĪndig Ãķvertagande av GPU av det neuralt renderingsverktyget, med den nedskalade proxy-inmatningen hanterad av CPU.

FÃķrutom att spelmotorn kan producera representativa segmenteringskartor sjÃĪlv, genom att stÃĪnga av all skuggning och belysning i dess utmatning. Dessutom kan den tillhandahÃĨlla video i en mycket lÃĪgre upplÃķsning ÃĪn vad som vanligtvis krÃĪvs av den, eftersom videon endast behÃķver vara grovt representativ fÃķr innehÃĨllet, med hÃķgupplÃķsta detaljer hanterade av det neuralt renderingsverktyget, vilket ytterligare frigÃķr lokala berÃĪkningsresurser.

Intel ISL:s tidigare arbete med segmentering>bild

Den direkta ÃķversÃĪttningen av segmentering till fotorealistiska video ÃĪr lÃĨngt ifrÃĨn hypotetisk. 2017 slÃĪppte Intel ISL, skaparna av gÃĨrdagens sensation, initial forskning som kunde utfÃķra urban videosyntes direkt frÃĨn semantisk segmentering.

Intel ISL - segmentering till bild

Intel ISL:s segmentering till bild frÃĨn 2017. KÃĪlla: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

I sjÃĪlva verket har den ursprungliga 2017-pipelinen bara utvidgats fÃķr att passa GTA5:s fullstÃĪndigt renderade utmatning.

Neuralt renderingsverktyg i VFX

Neuralt renderingsverktyg frÃĨn artificiella segmenteringskartor verkar ocksÃĨ vara en lovande teknik fÃķr VFX, med mÃķjligheten att direkt ÃķversÃĪtta mycket grundlÃĪggande videogram direkt till fÃĪrdiga visuella effekter, genom att generera domÃĪnspecifika datamÃĪngder frÃĨn modeller eller syntetiska (CGI)-bilder.

En hypotetisk neuralt renderingsverktyg, dÃĪr omfattande tÃĪckning av varje mÃĨlfÃķremÃĨl abstraheras till en bidragande datamÃĪngd, och dÃĪr artificiellt genererade segmenteringskartor anvÃĪnds som grund fÃķr fullupplÃķsta fotorealistiska utmatningar. KÃĪlla: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

En hypotetisk neuralt renderingsverktyg, dÃĪr omfattande tÃĪckning av varje mÃĨlfÃķremÃĨl abstraheras till en bidragande datamÃĪngd, och dÃĪr artificiellt genererade segmenteringskartor anvÃĪnds som grund fÃķr fullupplÃķsta fotorealistiska utmatningar. KÃĪlla: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Utvecklingen och antagandet av sÃĨdana system skulle fÃķrskjuta fokus fÃķr konstnÃĪrliga anstrÃĪngningar frÃĨn en tolkande till en representativ arbetsflÃķde, och hÃķja domÃĪnstyrd datainsamling frÃĨn en stÃķdjande till en central roll i de visuella konsterna.

Artikeln uppdaterad 16:55 fÃķr att lÃĪgga till material om Intel ISL 2017-forskning.

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]