Andersonin kulma

Hermoneurorenderointi: Kuinka alhaisella syötellä voidaan laskea?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Eilinen uusi tutkimus hermoneurokuvansynteesissä sai internetin ja mielikuvituksen, kun Intelin tutkijat paljastivat uuden menetelmän synteettisten kuvien realismin parantamiseksi.

Järjestelmä, kuten Intel (INTC ) esitti videossa, puuttuu suoraan Grand Theft Auto V -pelin kuvaputkeen ja parantaa kuvia kuvansynteesialgoritmin avulla, joka on koulutettu konvoluutioneuraaliverkolla (CNN) ja käyttää maailmanlaajuista kuvamateriaalia Mapillary-aineistosta ja korvaa GTA-pelin moottorin vähemmän realistisen valaistuksen ja teksturoinnin.

Kommentoijat eri yhteisöissä, kuten Redditissä ja Hacker Newsissa, esittävät, että tällainen hermoneurorenderointi voisi korvata perinteisten pelimoottorien ja VFX-tason CGI:n vähemmän fotorealistisen ulostulon, ja että tätä prosessia voisi tehdä paljon perustuvammalla syötellä kuin mitä Intelin GTA5-demossa näytettiin – luomalla “nukke”-välisignaaleja, joiden avulla voidaan luoda massiivisesti realistisia tuloksia.

Parittaiset aineistot

Tämä periaate on todettu uudessa GAN- ja kooderin/dekooderin järjestelmissä, kuten NVIDIAN GauGANissa, joka luo fotorealistisia maisemakuvia karkeista maalauksista.

Tämä periaate kääntää perinteisen semanttisen segmentoinnin käytön tietokoneen näössä passiivisesta menetelmästä, joka sallii konejärjestelmien tunnistaa ja erottaa havaittuja objekteja, luovaan syötteeseen, jossa käyttäjä “maalaa” väärän semanttisen segmentointikartan ja järjestelmä luo kuvamateriaalia, joka on yhdenmukainen suhteiden kanssa, joita se on jo luokitellut ja segmentoinut tietyn alueen, kuten maiseman.

Tietokoneen näön viitekehyksessä sovelletaan semanttista segmentointia eri ulkoisiin kohteisiin, mikä mahdollistaa interaktiivisten järjestelmien kehittämisen, joissa käyttäjä

Tietokoneen näön viitekehyksessä sovelletaan semanttista segmentointia eri ulkoisiin kohteisiin, mikä mahdollistaa interaktiivisten järjestelmien kehittämisen, joissa käyttäjä “maalaa” semanttisen segmentointiblokin ja järjestelmä täyttää blokin soveltuvin kuvamateriaalin tietyn alueen aineistosta, kuten Saksan Mapillary-kadunäkymäaineistosta, jota käytettiin Intelin GTA5-hermoneurorenderointidemossa. Lähde: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Parittaiset aineistojen kuvansynteesijärjestelmät toimivat siten, että ne korreloivat semanttisia merkintöjä kahdessa aineistossa: rikkaassa ja täydellisessä kuvamateriaalissa, joko luodusta maailmanlaajuisesta kuvamateriaalista (kuten Mapillary-aineistosta, jota käytettiin Intelin GTA5-demossa) tai synteettisistä kuvista, kuten CGI-kuvista.

Parittaiset aineistojen esimerkit kuvansynteesijärjestelmälle, joka luo hermoneurorenderoidut hahmot kömpelöistä luonnoksista. Vasemmalla, näytteitä CGI-aineistosta. Keskellä, vastaavat näytteet

Parittaiset aineistojen esimerkit kuvansynteesijärjestelmälle, joka luo hermoneurorenderoidut hahmot kömpelöistä luonnoksista. Vasemmalla, näytteitä CGI-aineistosta. Keskellä, vastaavat näytteet “luonnos”-aineistosta. Oikealla, hermoneurorenderoidut kuvat, jotka ovat kääntäneet luonnokset korkealaatuiseksi kuvamateriaaliksi. Lähde: https://www.youtube.com/watch?v=miLIwQ7yPkA

Ulkoympäristöt ovat suhteellisen helppoja, kun luodaan tällaisia parittaisia aineistojen muunnoksia, koska ulokkeet ovat yleensä melko rajoitettuja, topografia on rajoitettu ja sitä voidaan kattaa kattavasti aineistossa, eikä meidän tarvitse luoda keinotekoisia ihmisiä tai neuvotella Uncanny Valley -ongelmaa (vielä).

Segmentointikarttojen kääntäminen

Google on kehittänyt animoidun version GauGAN-skeemasta, nimeltään Infinite Nature, joka pystyy tarkoituksella “hallusinoimaan” jatkuvia ja loputtomia kuvitteellisia maisemia kääntämällä väärät semanttiset kartat fotorealistiseksi kuvamateriaaliksi NVIDIAN SPADE-täyttöjärjestelmän avulla:

Lähde: https://www.youtube.com/watch?v=oXUf6anNAtc

Lähde: https://www.youtube.com/watch?v=oXUf6anNAtc

Kuitenkin Infinite Nature käyttää yhtä kuvaa aloituspisteenä ja käyttää SPADE:a vain puuttuvien osien täyttämiseen peräkkäisissä kehyksissä, kun taas SPADE itse luo kuvamuodonmuutokset suoraan segmentointikartoista.

Lähde: https://nvlabs.github.io/SPADE/

Lähde: https://nvlabs.github.io/SPADE/

Tämä kyky näyttää herättäneen Intelin kuvaparannusjärjestelmän ihailijoiden mielenkiinnon – mahdollisuus saada erittäin korkealaatuista fotorealistista kuvamateriaalia, jopa reaaliajassa (lopulta), erittäin karkeasta syötteestä.

Kuvatekstuurien ja valaistuksen korvaaminen hermoneurorenderoinnilla

GTA5-syötteen tapauksessa jotkut ovat ihmetelleet, onko järjestelmän tarpeen käyttää kaikkia laskennallisia prosessoreita perinteisissä pelimoottoreissa ja VFX-tasoisissa CGI:ssä, vai voitaisiinko muuttaa matalaresoluutioinen, viivapiirros-tason syöte fotorealistiseksi videoksi, joka ylittää varjostuksen, teksturoinnin ja valaistuksen ominaisuudet pelimoottoreissa, luomalla hyperrealistisia kohtauksia “väljä”-välisignaaleista.

Näyttää ilmeiseltä, että pelimoottorin tuottamatfacet, kuten heijastukset, tekstuurit ja muut ympäristön yksityiskohdat, ovat tärkeitä tietolähteitä hermoneurorenderointijärjestelmälle, kuten Intelin esittämässä. Kuitenkin on jo useita vuosia sitten, kun NVIDIAN UNIT (UNsupervised Image-to-image Translation Networks) osoitti, että vain alue on tärkeä, ja että jopa laajat asiat, kuten “yö tai päivä”, ovat käytännössä tyylin siirtämisen asioita:

Tärkeimmät syötteet voivat jättää pelimoottorin vain perusgeometrian ja fysiikkasimulaatioiden tuottamiseen, koska hermoneurorenderointimoottori voi ylittää kaikki muut asiat syntetisoimalla halutun kuvamateriaalin kerätystä aineistosta, käyttäen semanttisia karttoja tulkintakerroksena.

Intelin järjestelmä parantaa valmiin ja renderoidun kehyksen GTA5:stä, lisäten segmentoinnin ja arvioidut syvyyksikartat - kaksi asiaa, jotka voitaisiin potentiaalisesti toimittaa suoraan yksinkertaistetusta pelimoottorista. Lähde: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intelin järjestelmä parantaa valmiin ja renderoidun kehyksen GTA5:stä, lisäten segmentoinnin ja arvioidut syvyyksikartat – kaksi asiaa, jotka voitaisiin potentiaalisesti toimittaa suoraan yksinkertaistetusta pelimoottorista. Lähde: https://www.youtube.com/watch?v=P1IcaBn3ej0

Intel hermoneurorenderoinnin lähestymistapa käyttää täydellisesti renderoitujen kehysten analyysiä GTA5-puskureista, ja hermoneurojärjestelmällä on lisäkuorma luoda sekä syvyyksikartat että segmentointikartat. Koska syvyyksikartat ovat implisiittisesti saatavilla perinteisissä 3D-piipureissa (ja ovat vähemmän vaativia kuin teksturointi, ray-tracing tai globaali valaistus), se voisi olla parempi resurssien käyttö antaa pelimoottorin käsitellä niitä.

Yksinkertaistettu syöte hermoneurorenderointimoottorille

Intel-kuvaparannusverkon nykyinen toteutus voi sisältää paljon tarpeetonta laskentaa, koska pelimoottori tuottaa laskennallisesti vaativaa teksturointia ja valaistusta, jota hermoneurorenderointimoottori ei välttämättä tarvitse. Järjestelmä on suunniteltu tällaiseksi, koska se on helpompi sovittaa hermoneurorenderointimoottori olemassa olevaan piipuriin kuin luoda uusi pelimoottori, joka on optimoitu hermoneurorenderoinnin lähestymistavalle.

Taloudellisin resurssien käyttö tällaisessa järjestelmässä voisi olla kokonaan hermoneurorenderointijärjestelmän valtaus GPU:sta, ja yksinkertaistettu välisignaali käsiteltäisiin CPU:lla.

Lisäksi pelimoottori voisi helposti tuottaa edustavan segmentointikartan itse sammuttamalla kaiken varjostuksen ja valaistuksen ulostulostaan. Se voisi myös toimittaa videon paljon matalammalla resoluutiolla kuin mitä siitä yleensä vaaditaan, koska video tarvitsisi vain edustaa sisältöä laajasti, ja korkearesoluutioinen yksityiskohta käsiteltäisiin hermoneurojärjestelmällä, vapauttaen paikallisia laskentaresursseja.

Intel ISL:n aiempi työ segmentoinnista>kuvaan

Segmentoinnin suora kääntäminen fotorealistiseksi videoksi ei ole hypoteettinen. Vuonna 2017 Intel ISL, joka loi eilisen kohun, julkaisi alkuaineiston tutkimuksen, joka pystyi suorittamaan kaupunkivideonsynteesiä suoraan semanttisesta segmentoinnista.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai