Angolo di Anderson

Rendering Neurale: Quanto Puoi Scendere in Termini di Input?

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Ieri alcuni straordinari nuovi lavori sulla sintesi di immagini neurali hanno attirato l’attenzione e l’immaginazione di Internet, poiché i ricercatori di Intel hanno rivelato un nuovo metodo per migliorare la realismo delle immagini sintetiche.

Il sistema, come dimostrato in un video di Intel, interviene direttamente nel flusso di immagini del videogioco Grand Theft Auto V e migliora automaticamente le immagini attraverso un algoritmo di sintesi di immagini addestrato su una rete neurale convoluzionale (CNN), utilizzando immagini del mondo reale dal set di dati Mapillary e sostituendo l’illuminazione e la texture meno realistiche del motore di gioco di GTA.

I commentatori, in una vasta gamma di reazioni in comunità come Reddit e Hacker News, stanno ipotizzando non solo che il rendering neurale di questo tipo potrebbe sostituire efficacemente la produzione meno fotorealistica dei motori di gioco tradizionali e del CGI di livello VFX, ma che questo processo potrebbe essere realizzato con input molto più basilare di quello dimostrato nel demo di GTA5 di Intel – creando effettivamente ‘proxy’ di input con output realisticissimi.

Dataset Accoppiati

Il principio è stato esemplificato da una nuova generazione di sistemi GAN ed encoder/decoder negli ultimi tre anni, come GauGAN di NVIDIA, che genera immagini paesaggistiche fotorealistiche da schizzi grezzi.

Effettivamente, questo principio capovolge l’uso convenzionale della segmentazione semantica nella visione artificiale da un metodo passivo che consente ai sistemi di macchina di identificare e isolare gli oggetti osservati in un input creativo, dove l’utente ‘dipinge’ una mappa di segmentazione semantica fasulla e il sistema genera immagini coerenti con le relazioni che comprende dall’aver già classificato e segmentato un particolare dominio, come un paesaggio.

Un framework di apprendimento automatico applica la segmentazione semantica a vari scenari esterni, fornendo il paradigma architettonico che consente lo sviluppo di sistemi interattivi, dove l'utente dipinge un blocco di segmentazione semantica e il sistema riempie il blocco con immagini adeguate da un set di dati specifico del dominio, come il set di viste stradali di Mapillary utilizzato nel demo di rendering neurale di GTA5 di Intel. Fonte: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Un framework di apprendimento automatico applica la segmentazione semantica a vari scenari esterni, fornendo il paradigma architettonico che consente lo sviluppo di sistemi interattivi, dove l’utente dipinge un blocco di segmentazione semantica e il sistema riempie il blocco con immagini adeguate da un set di dati specifico del dominio, come il set di viste stradali di Mapillary utilizzato nel demo di rendering neurale di GTA5 di Intel. Fonte: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

I sistemi di sintesi di immagini con dataset accoppiati funzionano correlando etichette semantiche su due dataset: un set di immagini ricco e completo, generato da immagini del mondo reale (come il set di Mapillary utilizzato per migliorare GTA5 nel demo di Intel) o da immagini sintetiche, come immagini CGI.

Esempi di dataset accoppiati per un sistema di sintesi di immagini progettato per creare personaggi neurali resi da schizzi goffi. A sinistra, campioni dal set di dati CGI. Al centro, campioni corrispondenti dal set di dati 'schizzo'. A destra, render neurali che hanno tradotto gli schizzi in immagini di alta qualità. Fonte: https://www.youtube.com/watch?v=miLIwQ7yPkA

Esempi di dataset accoppiati per un sistema di sintesi di immagini progettato per creare personaggi neurali resi da schizzi goffi. A sinistra, campioni dal set di dati CGI. Al centro, campioni corrispondenti dal set di dati ‘schizzo’. A destra, render neurali che hanno tradotto gli schizzi in immagini di alta qualità. Fonte: https://www.youtube.com/watch?v=miLIwQ7yPkA

Gli ambienti esterni sono relativamente poco impegnativi quando si creano trasformazioni di dataset accoppiati di questo tipo, perché le protuberanze sono generalmente molto limitate, la topografia ha una varianza limitata che può essere catturata in modo completo in un dataset e non dobbiamo affrontare la creazione di persone artificiali o negoziare la Valle dell’Uncanny (ancora).

Invertendo Mappe di Segmentazione

Google ha sviluppato una versione animata dello schema GauGAN, chiamata Infinite Nature, in grado di ‘allucinare’ deliberatamente paesaggi finti continui e infiniti traducendo mappe semantiche fasulle in immagini fotorealistiche tramite il sistema di riempimento SPADE di NVIDIA:

Fonte: https://www.youtube.com/watch?v=oXUf6anNAtc

Fonte: https://www.youtube.com/watch?v=oXUf6anNAtc

Tuttavia, Infinite Nature utilizza un’immagine come punto di partenza e utilizza SPADE solo per dipingere le sezioni mancanti in frame successivi, mentre SPADE stesso crea trasformazioni di immagini direttamente dalle mappe di segmentazione.

Fonte: https://nvlabs.github.io/SPADE/

Fonte: https://nvlabs.github.io/SPADE/

È questa capacità che sembra aver suscitato l’ammirazione degli estimatori del sistema di miglioramento delle immagini di Intel – la possibilità di derivare immagini fotorealistiche di alta qualità, anche in tempo reale (alla fine), da input estremamente grezzi.

Sostituendo Texture e Illuminazione con Rendering Neurale

Nel caso dell’input di GTA5, alcuni si sono chiesti se alcune delle operazioni di texturing e illuminazione procedurali e bitmap del motore di gioco siano realmente necessarie in futuri sistemi di rendering neurale, o se potrebbe essere possibile trasformare input a bassa risoluzione e a livello di wireframe in video fotorealistici che superino le capacità di ombreggiatura, texturing e illuminazione dei motori di gioco, creando scene iperrealistiche da input di proxy.

Potrebbe sembrare ovvio che aspetti del gioco come riflessi, texture e altri tipi di dettagli ambientali siano fonti essenziali di informazione per un sistema di rendering neurale del tipo dimostrato da Intel. Eppure, è stato alcuni anni da quando NVIDIA ha dimostrato che solo il dominio è importante e che aspetti come ‘notte o giorno’ sono essenzialmente questioni da gestire con il trasferimento di stile:

In termini di input richiesto, ciò potrebbe lasciare il motore di gioco solo per generare la geometria di base e le simulazioni fisiche, poiché il motore di rendering neurale può sovrascrivere tutti gli altri aspetti sintetizzando le immagini desiderate dal set di dati catturato, utilizzando mappe semantiche come livello di interpretazione.

Il sistema di Intel migliora un frame completamente finito e renderizzato da GTA5, aggiungendo segmentazione e mappe di profondità valutate — due aspetti che potrebbero potenzialmente essere forniti direttamente da un motore di gioco semplificato. Fonte: https://www.youtube.com/watch?v=P1IcaBn3ej0

Il sistema di Intel migliora un frame completamente finito e renderizzato da GTA5, aggiungendo segmentazione e mappe di profondità valutate — due aspetti che potrebbero potenzialmente essere forniti direttamente da un motore di gioco semplificato. Fonte: https://www.youtube.com/watch?v=P1IcaBn3ej0

L’approccio di Intel al rendering neurale coinvolge l’analisi di frame completamente renderizzati dai buffer di GTA5 e il sistema neurale ha l’onere aggiuntivo di creare sia le mappe di profondità che le mappe di segmentazione. Poiché le mappe di profondità sono implicitamente disponibili nelle pipeline 3D tradizionali (e sono meno impegnative da generare rispetto al texturing, ray-tracing o illuminazione globale), potrebbe essere un uso più efficiente delle risorse lasciare che il motore di gioco gestisca queste.

Input Semplificato per un Motore di Rendering Neurale

L’attuale implementazione della rete di miglioramento delle immagini di Intel, quindi, potrebbe coinvolgere molti cicli di calcolo ridondanti, poiché il motore di gioco genera texturing e illuminazione computazionalmente costose che il motore di rendering neurale non necessita realmente. Il sistema sembra essere stato progettato in questo modo non perché questo sia necessariamente un approccio ottimale, ma perché è più facile adattare un motore di rendering neurale a una pipeline esistente che creare un nuovo motore di gioco ottimizzato per un approccio di rendering neurale.

L’uso più economico delle risorse in un sistema di gioco di questo tipo potrebbe essere il completo coinvolgimento della GPU da parte del motore di rendering neurale, con l’input di proxy semplificato gestito dalla CPU.

Inoltre, il motore di gioco potrebbe facilmente produrre mappe di segmentazione rappresentative semplicemente disabilitando tutte le ombreggiature e le luci nel suo output. Inoltre, potrebbe fornire video a una risoluzione molto inferiore a quella normalmente richiesta, poiché il video dovrebbe essere solo rappresentativo del contenuto, con dettagli ad alta risoluzione gestiti dal motore neurale, liberando ulteriormente le risorse di calcolo locali.

Il Lavoro Precedente di Intel ISL con Segmentazione>Immagine

La traduzione diretta di segmentazione in video fotorealistico non è affatto ipotetica. Nel 2017 Intel ISL, creatori dell’entusiasmo di ieri, hanno rilasciato una ricerca iniziale capace di eseguire la sintesi di video urbani direttamente dalle mappe di segmentazione semantica.

Intel ISL - segmentazione in immagine

Il lavoro di Intel ISL sulla segmentazione in immagine del 2017. Fonte: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

In effetti, quella pipeline originale del 2017 è stata semplicemente estesa per adattarsi all’output completamente renderizzato di GTA5.

Rendering Neurale in VFX

Il rendering neurale da mappe di segmentazione artificiali sembra anche essere una tecnologia promettente per gli effetti visivi (VFX), con la possibilità di tradurre direttamente videogrammi molto basilari in footage di effetti visivi finiti, generando set di dati specifici del dominio presi da modelli o immagini sintetiche (CGI).

Un sistema di rendering neurale ipotetico, in cui una copertura estensiva di ogni oggetto di destinazione è astratta in un set di dati contributivo, e in cui mappe di segmentazione artificiali generate vengono utilizzate come base per output fotorealistici ad alta risoluzione. Fonte: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Un sistema di rendering neurale ipotetico, in cui una copertura estensiva di ogni oggetto di destinazione è astratta in un set di dati contributivo, e in cui mappe di segmentazione artificiali generate vengono utilizzate come base per output fotorealistici ad alta risoluzione. Fonte: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Lo sviluppo e l’adozione di tali sistemi sposterebbero il fulcro dello sforzo artistico da un flusso di lavoro interpretativo a uno rappresentativo e eleverebbero la raccolta di dati guidata dal dominio da un ruolo di supporto a uno centrale nelle arti visive.

Articolo aggiornato alle 16:55 per aggiungere materiale sulla ricerca di Intel ISL del 2017.

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]