Unghiul lui Anderson

Renderizarea Neuronală: Cât de Puțin Poate Fi Inputul?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Ieri, o lucrare extraordinară nouă în sinteza de imagini neuronale a atras atenția și imaginația internetului, întrucât cercetătorii de la Intel (INTC ) au dezvăluit o metodă nouă pentru îmbunătățirea realismului imaginilor sintetice.

Sistemul, așa cum a fost demonstrat într-un video de la Intel, intervine direct în pipeline-ul de imagine pentru jocul video Grand Theft Auto V și îmbunătățește automat imaginile prin intermediul unui algoritm de sinteză de imagini instruit pe o rețea neuronală convoluțională (CNN), utilizând imagini din lumea reală din setul de date Mapillary și înlocuind iluminarea și texturarea mai puțin realistă a motorului de joc GTA.

Comentatorii, într-o gamă largă de reacții în comunități precum Reddit și Hacker News, susțin nu numai că renderizarea neuronală de acest tip ar putea înlocui cu succes ieșirile mai puțin fotorealiste ale motoarelor de joc tradiționale și ale efectelor vizuale (VFX) de nivel CGI, dar și că acest proces ar putea fi realizat cu intrări mult mai de bază decât cele demonstrate în demo-ul Intel GTA5 — creând efectiv “păpuși” proxy cu intrări realistice.

Date Paired

Principiul a fost exemplificat de o nouă generație de sisteme GAN și encoder/decoder în ultimii trei ani, precum GauGAN de la NVIDIA, care generează imagini peisagistice fotorealiste din schițe crude.

În esență, acest principiu inversează utilizarea convențională a segmentării semantice în viziunea computerizată de la o metodă pasivă care permite sistemelor mașinilor să identifice și să izoleze obiectele observate într-o intrare creativă, unde utilizatorul “pictează” o hartă de segmentare semantică falsă și sistemul generează imagini care sunt consecvente cu relațiile pe care le înțelege din clasificarea și segmentarea unui anumit domeniu, cum ar fi peisajele.

Un cadru de învățare automată aplică segmentarea semantică la diverse scene exterioare, oferind paradigma arhitecturală care permite dezvoltarea de sisteme interactive, unde utilizatorul pictează un bloc de segmentare semantică și sistemul umple blocul cu imagini potrivite dintr-un set de date specific domeniului, cum ar fi setul de vedere stradală Mapillary din Germania, utilizat în demo-ul de renderizare neuronală Intel GTA5. Sursă: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Un cadru de învățare automată aplică segmentarea semantică la diverse scene exterioare, oferind paradigma arhitecturală care permite dezvoltarea de sisteme interactive, unde utilizatorul pictează un bloc de segmentare semantică și sistemul umple blocul cu imagini potrivite dintr-un set de date specific domeniului, cum ar fi setul de vedere stradală Mapillary din Germania, utilizat în demo-ul de renderizare neuronală Intel GTA5. Sursă: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Sistemele de sinteză de imagini cu date pereche funcționează prin corelarea etichetelor semantice pe două seturi de date: un set de imagini bogat și complet, fie generat din imagini din lumea reală (cum ar fi setul Mapillary utilizat pentru a îmbunătăți GTA5 în demo-ul de ieri de la Intel), fie din imagini sintetice, cum ar fi imagini CGI.

Exemple de seturi de date pereche pentru un sistem de sinteză de imagini destinat să creeze caractere renderizate neuronal din schițe neîndemânatice. Stânga, mostre din setul de date CGI. Mijloc, mostre corespunzătoare din setul de date 'schiță'. Dreapta, renderizări neuronale care au transformat schițele înapoi în imagini de înaltă calitate. Sursă: https://www.youtube.com/watch?v=miLIwQ7yPkA

Exemple de seturi de date pereche pentru un sistem de sinteză de imagini destinat să creeze caractere renderizate neuronal din schițe neîndemânatice. Stânga, mostre din setul de date CGI. Mijloc, mostre corespunzătoare din setul de date ‘schiță’. Dreapta, renderizări neuronale care au transformat schițele înapoi în imagini de înaltă calitate. Sursă: https://www.youtube.com/watch?v=miLIwQ7yPkA

Mediile exterioare sunt relativ puțin provocatoare atunci când se creează transformări de seturi de date pereche de acest tip, deoarece proeminențele sunt de obicei destul de limitate, topografia are o varianță limitată care poate fi capturată în mod cuprinzător într-un set de date, și nu trebuie să ne ocupăm de crearea de oameni artificiali sau de negocierea Văii Încântătoare (încă).

Inversarea Hărților de Segmentare

Google a dezvoltat o versiune animată a schemei GauGAN, numită Natură Infinită, capabilă să “halucineze” deliberate peisaje fictive continue și fără sfârșit prin traducerea hărților semantice false în imagini fotorealiste prin sistemul de umplere SPADE de la NVIDIA:

Sursă: https://www.youtube.com/watch?v=oXUf6anNAtc

Sursă: https://www.youtube.com/watch?v=oXUf6anNAtc

Însă, Natură Infinită utilizează o imagine ca punct de plecare și utilizează SPADE doar pentru a picta secțiunile lipsă în cadrele consecutive, în timp ce SPADE însuși creează transformări de imagini direct din hărți de segmentare.

Sursă: https://nvlabs.github.io/SPADE/

Sursă: https://nvlabs.github.io/SPADE/

Este această capacitate care pare să fi stârnit admiratorii sistemului de îmbunătățire a imaginilor Intel – posibilitatea de a obține imagini fotorealiste de foarte bună calitate, chiar și în timp real (în cele din urmă), din intrări extrem de crude.

Înlocuirea Texturilor și Iluminării cu Renderizarea Neuronală

În cazul intrării GTA5, unii s-au întrebat dacă oricare dintre texturarea procedurală și bitmap și iluminarea consumatoare de calcul din ieșirea motorului de joc ar putea fi cu adevărat necesară în sistemele viitoare de renderizare neuronală, sau dacă ar putea fi posibil să se transforme intrări de joasă rezoluție, de nivel wireframe, în videouri fotorealiste care să depășească capacitățile de umbrire, texturare și iluminare ale motoarelor de joc, creând scene hiperrealiste din intrări proxy “de titular”.

Ar putea părea evident că aspectele generate de joc, cum ar fi reflexiile, texturile și alte tipuri de detalii de mediu, sunt surse esențiale de informații pentru un sistem de renderizare neuronală de tipul demonstrat de Intel. Cu toate acestea, de câțiva ani, UNIT (Rețele de traducere imagine-la-imagine nesupravegheată) de la NVIDIA a demonstrat că doar domeniul este important, și că aspecte precum “noapte sau zi” sunt, în esență, chestiuni care trebuie gestionate prin transfer de stil:

În ceea ce privește intrările necesare, acest lucru ar putea lăsa motorul de joc să genereze doar geometrie de bază și simulări fizice, deoarece motorul de renderizare neuronală poate suprapicta toate celelalte aspecte prin sintetizarea imaginilor dorite din setul de date capturat, utilizând hărți semantice ca strat de interpretare.

Sistemul Intel îmbunătățește un cadru complet renderizat și terminat din GTA5, adăugând hărți de segmentare și hărți de adâncime evaluate — două aspecte care ar putea fi furnizate în mod direct de un motor de joc simplificat. Sursă: https://www.youtube.com/watch?v=P1IcaBn3ej0

Sistemul Intel îmbunătățește un cadru complet renderizat și terminat din GTA5, adăugând hărți de segmentare și hărți de adâncime evaluate — două aspecte care ar putea fi furnizate în mod direct de un motor de joc simplificat. Sursă: https://www.youtube.com/watch?v=P1IcaBn3ej0

Abordarea de renderizare neuronală a Intel implică analiza cadrelor complet renderizate din buffer-urile GTA5, iar sistemul neuronal are sarcina suplimentară de a crea atât hărțile de adâncime, cât și hărțile de segmentare. Deoarece hărțile de adâncime sunt disponibile în mod implicit în pipeline-urile 3D tradiționale (și sunt mai puțin solicitante pentru a fi generate decât texturarea, urmărirea razelor sau iluminarea globală), ar putea fi o utilizare mai bună a resurselor să lăsăm motorul de joc să se ocupe de ele.

Intrare Simplificată pentru un Motor de Renderizare Neuronală

Implementarea actuală a rețelei de îmbunătățire a imaginilor Intel poate implica multe cicluri de calcul redundante, deoarece motorul de joc generează texturare și iluminare consumatoare de calcul care motorul de renderizare neuronală nu are nevoie în mod real. Sistemul pare să fi fost proiectat în acest fel nu pentru că acesta este neapărat o abordare optimă, ci pentru că este mai ușor să adaptezi un motor de renderizare neuronală la un pipeline existent decât să creezi un motor de joc nou, optimizat pentru o abordare de renderizare neuronală.

Cea mai economică utilizare a resurselor într-un sistem de joc de acest tip ar putea fi preluarea completă a GPU de către sistemul de renderizare neuronală, cu intrarea proxy simplificată gestionată de CPU.

În plus, motorul de joc ar putea produce cu ușurință hărți de segmentare reprezentative, prin dezactivarea tuturor umbrelor și iluminărilor în ieșirea sa. De asemenea, ar putea furniza video la o rezoluție mult mai mică decât cea normal solicitată de la el, deoarece videoul ar trebui să fie doar reprezentativ pentru conținut, cu detalii de înaltă rezoluție gestionate de motorul neuronal, eliberând astfel resursele de calcul locale.

Lucrările Anterioare ale Intel ISL cu Segmentarea>Imagine

Traducerea directă a segmentării în videouri fotorealiste nu este deloc ipotetică. În 2017, Intel ISL, creatorii furtunii de ieri, au lansat o cercetare inițială capabilă să efectueze sinteza video urbană direct din segmentarea semantică.

Intel ISL - segmentare la imagine

Lucrarea Intel ISL cu segmentarea la imagine din 2017. Sursă: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

În esență, acea pipeline inițială din 2017 a fost extinsă doar pentru a se potrivi ieșirii complet renderizate a GTA5.

Renderizarea Neuronală în VFX

Renderizarea neuronală din hărți de segmentare artificiale pare a fi, de asemenea, o tehnologie promițătoare pentru VFX, cu posibilitatea de a traduce direct videograme foarte de bază în filme de efecte vizuale finite, prin generarea de seturi de date specifice domeniului, luate fie din modele, fie din imagini sintetice (CGI).

Un sistem de renderizare neuronală ipotetic, în care o acoperire extinsă a fiecărui obiect țintă este abstractizată într-un set de date contributor, și în care hărți de segmentare artificiale generate sunt utilizate ca bază pentru ieșiri fotorealiste de înaltă rezoluție. Sursă: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Un sistem de renderizare neuronală ipotetic, în care o acoperire extinsă a fiecărui obiect țintă este abstractizată într-un set de date contributor, și în care hărți de segmentare artificiale generate sunt utilizate ca bază pentru ieșiri fotorealiste de înaltă rezoluție. Sursă: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Dezvoltarea și adoptarea unor astfel de sisteme ar putea muta centrul de efort artistic de la un flux de lucru interpretativ la unul reprezentativ, și ar putea ridica colectarea de date condusă de domeniu de la un rol suportiv la unul central în artele vizuale.

Articolul a fost actualizat la ora 16:55 pentru a adăuga material despre cercetarea Intel ISL din 2017.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai