Angolo di Anderson
Rendering neurale: NeRF fa una passeggiata all’aria aperta

Una collaborazione tra Google Research e l’Università di Harvard ha sviluppato un nuovo metodo per creare video neurali a 360 gradi di scene complete usando Neural Radiance Fields (NeRF). L’approccio innovativo avvicina NeRF a un uso astratto e informale in qualsiasi ambiente, senza limitarsi a modelli da tavolo o scenari interni chiusi.

Vedi la fine dell’articolo per il video completo. Fonte: https://www.youtube.com/watch?v=zBSH-k9GbV4
Mip-NeRF 360 può gestire sfondi estesi e oggetti “infinito” come il cielo, perché, a differenza della maggior parte delle versioni precedenti, imposta limiti sul modo in cui i raggi di luce vengono interpretati e crea confini di attenzione che razionalizzano tempi di addestramento altrimenti lunghi. Vedi il nuovo video allegato, incorporato alla fine di questo articolo, per ulteriori esempi e una visione più approfondita del processo.
Il nuovo documento è intitolato Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields ed è guidato dal Senior Staff Research Scientist di Google Research Jon Barron.
Per comprendere la svolta, è necessario avere una comprensione di base di come funzioni la sintesi di immagini basata sui campi di radianza neurale.
Cos’è NeRF?
È difficile descrivere una rete NeRF in termini di “video”, poiché si avvicina più a un ambiente virtuale completamente realizzato in 3D ma basato sull’IA, in cui molteplici punti di vista da foto singole (incluse le fotogramme video) vengono usati per assemblare una scena che esiste tecnicamente solo nello spazio latente di un algoritmo di apprendimento automatico, ma da cui è possibile estrarre a piacere un numero straordinario di punti di vista e video.

Una rappresentazione dei molteplici punti di cattura della fotocamera che forniscono i dati che NeRF assembla in una scena neurale (illustrata a destra).
Le informazioni derivanti dalle foto contributive vengono addestrate in una matrice simile a una tradizionale griglia di voxel nei flussi di lavoro CGI, poiché ogni punto nello spazio 3D ottiene un valore, rendendo la scena navigabile.

Una matrice voxel tradizionale colloca le informazioni dei pixel (che normalmente esistono in un contesto 2D, come la griglia di pixel di un file JPEG) in uno spazio tridimensionale. Fonte: ResearchGate
Dopo aver calcolato lo spazio interstiziale tra le foto (se necessario), il percorso di ogni possibile pixel di ciascuna foto contributiva viene effettivamente “tracciato a raggi” e gli viene assegnato un valore di colore, inclusa una trasparenza (senza la quale la matrice neurale sarebbe completamente opaca o completamente vuota).
Come le griglie di voxel, e contrariamente allo spazio di coordinate 3D basato su CGI, l’‘interno’ di un oggetto ‘chiuso’ non ha esistenza in una matrice NeRF. Puoi aprire un set di batteria CGI e guardare dentro, se vuoi; ma per quanto riguarda NeRF, l’esistenza del set termina quando il valore di opacità della sua superficie è pari a ‘1’.
Una visuale più ampia di un pixel
Mip-NeRF 360 è un’estensione della ricerca di marzo 2021, che ha introdotto efficacemente l’anti-aliasing efficiente in NeRF senza un campionamento eccessivo.
NeRF tradizionalmente calcola un solo percorso di pixel, il che tende a produrre il tipo di ‘jaggies’ che caratterizzavano i primi formati di immagine su internet, così come i sistemi di gioco precedenti. questi bordi frastagliati sono stati risolti con vari metodi, solitamente coinvolgendo il campionamento dei pixel adiacenti e la ricerca di una rappresentazione media.
Poiché il NeRF tradizionale campiona solo quel singolo percorso di pixel, Mip-NeRF ha introdotto un’area di cattura ‘conica’, simile a una torcia a fascio largo, che fornisce sufficienti informazioni sui pixel adiacenti per produrre un anti-aliasing economico con dettagli migliorati.

Il cono di cattura conico utilizzato da Mip-NeRF è suddiviso in tronchi conici (immagine inferiore), che vengono ulteriormente ‘sfocati’ per creare spazi gaussiani vaghi utilizzabili per calcolare l’accuratezza e l’aliasing di un pixel. Fonte: https://www.youtube.com/watch?v=EpH175PY1A0
Il miglioramento rispetto a un’implementazione standard di NeRF è stato notevole:

Mip-NeRF (a destra), rilasciato a marzo 2021, offre dettagli migliorati attraverso una pipeline di aliasing più completa ma economica, invece di semplicemente ‘sfocare’ i pixel per evitare bordi frastagliati. Fonte: https://jonbarron.info/mipnerf/
NeRF illimitato
Il documento di marzo lasciava tre problemi irrisolti riguardo all’uso di Mip-NeRF in ambienti illimitati che potrebbero includere oggetti molto distanti, come il cielo. Il nuovo documento risolve questo applicando una deformazione in stile Kalman ai Gaussiani di Mip-NeRF.
In secondo luogo, le scene più grandi richiedono maggiore potenza di calcolo e tempi di addestramento prolungati, cosa che Mip-NeRF 360 risolve “distillando” la geometria della scena con un piccolo perceptron multistrato (MLP) di “proposta”, che predefinisce la geometria prevista da un grande MLP NeRF standard. Questo velocizza l’addestramento di un fattore tre.
Infine, le scene più grandi tendono a rendere ambigua la discretizzazione della geometria interpretata, generando il tipo di artefatti a cui i giocatori sono abituati quando il rendering di un gioco “si strappa”. Il nuovo documento affronta questo creando un nuovo regolarizzatore per gli intervalli di raggio di Mip-NeRF.

A destra, vediamo artefatti indesiderati in Mip-NeRF a causa della difficoltà nel delimitare una scena così ampia. A sinistra, vediamo che il nuovo regolarizzatore ha ottimizzato la scena sufficientemente da rimuovere queste perturbazioni.
Per saperne di più sul nuovo documento, guarda il video qui sotto, e anche l’introduzione video di marzo 2021 a Mip-NeRF. Puoi inoltre approfondire la ricerca su NeRF consultando la nostra copertura finora.
Pubblicato originariamente il 25 novembre 2021
21 dicembre 2021, 12:25 – Video sostituito. – MA












