Angle d’Anderson

Rendering Neural : NeRF se promène dans l’air frais

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une collaboration entre Google Research et l’Université de Harvard a développé une nouvelle méthode pour créer des vidéos neurales 360 degrés de scènes complètes en utilisant des Champs de rayonnement neurals (NeRF). La nouvelle approche rapproche NeRF d’une utilisation abstraite occasionnelle dans n’importe quel environnement, sans être limité à des modèles de table ou à des scénarios d’intérieur fermés.

Source: https://www.youtube.com/watch?v=YStDS2-Ln1s

Voir la fin de l’article pour la vidéo complète. Source: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 peut gérer des arrières-plans étendus et des objets ‘infinis’ tels que le ciel, car, contrairement à la plupart des itérations précédentes, il impose des limites à la façon dont les rayons lumineux sont interprétés, et crée des limites d’attention qui rationalisent les temps de formation autrement longs. Voir la nouvelle vidéo accompagnante intégrée à la fin de cet article pour plus d’exemples, et une compréhension approfondie du processus.

Le nouvel article est intitulé Mip-NeRF 360: Champs de rayonnement neurals anti-aliasés non bornés, et est dirigé par le chercheur principal Jon Barron de Google Research.

Pour comprendre la percée, il est nécessaire d’avoir une compréhension de base de la façon dont la synthèse d’images basée sur les champs de rayonnement neurals fonctionne.

Qu’est-ce que NeRF?

Il est problématique de décrire un réseau NeRF en termes de ‘vidéo’, car il est plus proche d’un environnement virtuel 3D réalisé mais basé sur l’IA, où plusieurs points de vue à partir de photos uniques (y compris des cadres de vidéo) sont utilisés pour assembler une scène qui existe techniquement uniquement dans l’espace latent d’un algorithme d’apprentissage automatique – mais dont un nombre extraordinaire de points de vue et de vidéos peut être extrait à volonté.

Une représentation des points de capture de caméra multiples qui fournissent les données que NeRF assemble en une scène neurale (représentée à droite).

Une représentation des points de capture de caméra multiples qui fournissent les données que NeRF assemble en une scène neurale (représentée à droite).

Les informations dérivées des photos contributives sont formées dans une matrice qui est similaire à une grille de voxels dans les flux de travail CGI, dans la mesure où chaque point dans l’espace 3D se termine avec une valeur, ce qui rend la scène navigable.

Une matrice de voxels traditionnelle place les informations de pixel (qui existent normalement dans un contexte 2D, tel que la grille de pixel d'un fichier JPEG) dans un espace tridimensionnel. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Une matrice de voxels traditionnelle place les informations de pixel (qui existent normalement dans un contexte 2D, tel que la grille de pixel d’un fichier JPEG) dans un espace tridimensionnel. Source: ResearchGate

Après avoir calculé l’espace interstitiel entre les photos (si nécessaire), le chemin de chaque pixel possible de chaque photo contributive est effectivement ‘suivi’ et assigné une valeur de couleur, y compris une valeur de transparence (sans laquelle la matrice neurale serait complètement opaque, ou complètement vide).

Comme les grilles de voxels, et contrairement à l’espace 3D basé sur CGI, l’ ‘intérieur’ d’un objet ‘fermé’ n’a pas d’existence dans une matrice NeRF. Vous pouvez ouvrir un kit de batterie CGI et regarder à l’intérieur, si vous le souhaitez; mais autant que NeRF est concerné, l’existence du kit de batterie se termine lorsque la valeur d’opacité de sa surface est égale à ‘1’.

Une vision plus large d’un pixel

Mip-NeRF 360 est une extension de la recherche de mars 2021, qui a introduit efficacement un anti-aliasing efficient à NeRF sans échantillonnage exhaustif.

NeRF calcule traditionnellement un seul chemin de pixel, qui est enclin à produire le type de ‘jaggies’ qui caractérisaient les formats d’images Internet précoces, ainsi que les systèmes de jeux précoces. Ces bords dentelés ont été résolus par diverses méthodes, généralement en échantillonnant des pixels adjacents et en trouvant une représentation moyenne.

Puisque NeRF traditionnel ne sample qu’un seul chemin de pixel, Mip-NeRF a introduit une zone de capture ‘conique’ comme un projecteur à large faisceau, qui fournit suffisamment d’informations sur les pixels adjacents pour produire un anti-aliasing économique avec des détails améliorés.

La zone de capture conique que Mip-NeRF utilise est découpée en frustums coniques (en bas), qui sont ensuite 'floutés' pour représenter un espace gaussien vague qui peut être utilisé pour calculer la précision et l'aliasing d'un pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

La zone de capture conique que Mip-NeRF utilise est découpée en frustums coniques (image inférieure), qui sont ensuite ‘floutés’ pour créer des espaces gaussiens vagues qui peuvent être utilisés pour calculer la précision et l’aliasing d’un pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

L’amélioration par rapport à une implémentation standard NeRF était notable:

Mip-NeRF (droite), publié en mars 2021, fournit des détails améliorés grâce à un pipeline d'aliasing plus complet mais économique, plutôt que de simplement 'flouter' les pixels pour éviter les bords dentelés. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (droite), publié en mars 2021, fournit des détails améliorés grâce à un pipeline d’aliasing plus complet mais économique, plutôt que de simplement ‘flouter’ les pixels pour éviter les bords dentelés. Source: https://jonbarron.info/mipnerf/

NeRF non borné

L’article de mars a laissé trois problèmes non résolus en ce qui concerne l’utilisation de Mip-NeRF dans des environnements non bornés qui pourraient inclure des objets très éloignés, y compris les cieux. Le nouvel article résout cela en appliquant un style de Kalman à la gaussienne Mip-NeRF.

Deuxièmement, les scènes plus grandes nécessitent une plus grande puissance de traitement et des temps de formation plus longs, que Mip-NeRF 360 résout en ‘distillant’ la géométrie de la scène avec un petit perceptron multi-couches (MLP), qui pré-encadre la géométrie prédite par un grand NeRF standard MLP. Cela accélère la formation de trois fois.

Enfin, les scènes plus grandes ont tendance à rendre la discrétisation de la géométrie interprétée ambiguë, ce qui entraîne le type d’artefacts que les joueurs pourraient connaître lorsque la sortie du jeu ‘déchire’. Le nouvel article aborde cela en créant un nouveau régulateur pour les intervalles de rayons Mip-NeRF.

À droite, nous voyons des artefacts indésirables dans Mip-NeRF en raison de la difficulté à encadrer une scène aussi grande. À gauche, nous voyons que le nouveau régulateur a optimisé la scène suffisamment pour supprimer ces perturbations.

À droite, nous voyons des artefacts indésirables dans Mip-NeRF en raison de la difficulté à encadrer une scène aussi grande. À gauche, nous voyons que le nouveau régulateur a optimisé la scène suffisamment pour supprimer ces perturbations.

Pour en savoir plus sur le nouvel article, consultez la vidéo ci-dessous, ainsi que la vidéo d’introduction de mars 2021 à Mip-NeRF. Vous pouvez également en savoir plus sur la recherche NeRF en consultant notre couverture jusqu’à présent.

Publié à l’origine le 25 novembre 2021
21 décembre 2021, 12h25 – Remplacement de la vidéo morte. – MA

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai