Angle d’Anderson

Rendu neuronal: NeRF se promène en plein air

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une collaboration entre Google Research et l’Université Harvard a mis au point une nouvelle méthode pour créer des vidéos neuronales à 360 ° de scènes complètes en utilisant les Champs de Radiance Neuronaux (NeRF). Cette approche novatrice rapproche le NeRF d’une utilisation abstraite et décontractée dans n’importe quel environnement, sans être limité aux modèles de table ou aux scénarios d’intérieur fermés.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Voir la fin de l’article pour la vidéo complète. Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 peut gérer des arrière-plans étendus et des objets « infinites » tels que le ciel, car, contrairement à la plupart des itérations précédentes, il impose des limites à l’interprétation des rayons lumineux et crée des frontières d’attention qui rationalisent des temps d’entraînement autrement longs. Consultez la nouvelle vidéo d’accompagnement intégrée à la fin de cet article pour plus d’exemples et un aperçu approfondi du processus.

Le nouvel article s’intitule Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields et est dirigé par le Senior Staff Research Scientist de Google Research, Jon Barron.

Pour comprendre cette avancée, il est nécessaire de posséder une compréhension de base du fonctionnement de la synthèse d’images basée sur les champs de radiance neuronaux.

Qu’est‑ce que le NeRF ?

Il est problématique de décrire un réseau NeRF en termes de « vidéo », car il se rapproche davantage d’un environnement virtuel entièrement réalisé en 3D mais basé sur l’IA, où plusieurs points de vue issus de photos uniques (y compris des images vidéo) sont utilisés pour assembler une scène qui n’existe techniquement que dans l’espace latent d’un algorithme d’apprentissage automatique – mais dont un nombre extraordinaire de points de vue et de vidéos peuvent être extraits à volonté.

Une représentation des multiples points de capture caméra qui fournissent les données que le NeRF assemble en une scène neuronale (illustrée à droite).

Une représentation des multiples points de capture caméra qui fournissent les données que le NeRF assemble en une scène neuronale (illustrée à droite).

Les informations provenant des photos contributrices sont entraînées dans une matrice similaire à une grille de voxels traditionnelle dans les flux de travail CGI, de sorte que chaque point de l’espace 3D possède une valeur, rendant la scène navigable.

Une matrice de voxels traditionnelle place les informations de pixels (qui existent normalement dans un contexte 2D, comme la grille de pixels d'un fichier JPEG) dans un espace tridimensionnel. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Une matrice de voxels traditionnelle place les informations de pixels (qui existent normalement dans un contexte 2D, comme la grille de pixels d’un fichier JPEG) dans un espace tridimensionnel. Source: ResearchGate

Après avoir calculé l’espace interstitiel entre les photos (si nécessaire), le trajet de chaque pixel possible de chaque photo contributrice est effectivement « tracé par rayons » et se voit attribuer une valeur de couleur, incluant une valeur de transparence (sans laquelle la matrice neuronale serait complètement opaque ou totalement vide).

Comme les grilles de voxels, et contrairement à l’espace de coordonnées 3D basé sur le CGI, « l’intérieur » d’un objet « fermé » n’existe pas dans une matrice NeRF. Vous pouvez ouvrir un kit de batterie CGI et regarder à l’intérieur, si vous le souhaitez ; mais du point de vue du NeRF, l’existence du kit de batterie s’arrête lorsque la valeur d’opacité de sa surface atteint « 1 ».

Une vue plus large d’un pixel

Mip-NeRF 360 est une extension de la recherche de mars 2021, qui a introduit efficacement l’anti‑aliasing dans le NeRF sans recours à un sur‑échantillonnage exhaustif.

Le NeRF calcule traditionnellement un seul trajet de pixel, ce qui a tendance à produire les fameux « jaggies » qui caractérisaient les premiers formats d’images sur Internet, ainsi que les systèmes de jeux antérieurs. Ces bords dentelés ont été résolus par diverses méthodes, généralement en échantillonnant les pixels adjacents et en trouvant une représentation moyenne.

Comme le NeRF traditionnel ne prélève que ce unique trajet de pixel, le Mip-NeRF a introduit une zone de capture « conique », semblable à une torche à faisceau large, qui fournit suffisamment d’informations sur les pixels adjacents pour produire un anti‑aliasing économique avec davantage de détails.

La zone de capture conique utilisée par Mip-NeRF est découpée en tronçons coniques (ci‑dessous), qui sont ensuite « floutés » pour représenter un espace gaussien plus vague pouvant être utilisé pour calculer la précision et l'aliasing d'un pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

La zone de capture conique utilisée par Mip-NeRF est découpée en tronçons coniques (image inférieure), qui sont ensuite « floutés » pour créer des espaces gaussiens vagues pouvant être utilisés pour calculer la précision et l’aliasing d’un pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

L’amélioration par rapport à une implémentation standard du NeRF était notable:

Mip-NeRF (à droite), publié en mars 2021, offre davantage de détails grâce à une chaîne d'aliasing plus complète mais économique, plutôt que de simplement « flouter » les pixels pour éviter les bords dentelés. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (à droite), publié en mars 2021, offre davantage de détails grâce à une chaîne d’aliasing plus complète mais économique, plutôt que de simplement « flouter » les pixels pour éviter les bords dentelés. Source: https://jonbarron.info/mipnerf/

NeRF sans limites

L’article de mars laissait trois problèmes non résolus concernant l’utilisation du Mip-NeRF dans des environnements sans limites pouvant inclure des objets très éloignés, comme le ciel. Le nouvel article résout cela en appliquant une déformation de type Kalman aux gaussiennes du Mip-NeRF.

Deuxièmement, les scènes plus grandes nécessitent davantage de puissance de calcul et des temps d’entraînement prolongés, ce que Mip-NeRF 360 résout en « distillant » la géométrie de la scène à l’aide d’un petit « proposition » perceptron multicouche (MLP), qui prélimite la géométrie prédite par un grand MLP NeRF standard. Cela accélère l’entraînement d’un facteur trois.

Enfin, les scènes plus vastes tendent à rendre la discrétisation de la géométrie interprétée ambiguë, entraînant le type d’artefacts que les joueurs connaissent lorsque le rendu d’un jeu « se déchire ». Le nouvel article y répond en créant un nouveau régularisateur pour les intervalles de rayons du Mip-NeRF.

À droite, nous voyons des artefacts indésirables dans le Mip-NeRF en raison de la difficulté à délimiter une scène aussi vaste. À gauche, nous constatons que le nouveau régularisateur a suffisamment optimisé la scène pour éliminer ces perturbations.

À droite, nous voyons des artefacts indésirables dans le Mip-NeRF en raison de la difficulté à délimiter une scène aussi vaste. À gauche, nous constatons que le nouveau régularisateur a suffisamment optimisé la scène pour éliminer ces perturbations.

Pour en savoir plus sur le nouvel article, consultez la vidéo ci‑dessous, ainsi que l’introduction vidéo de mars 2021 à Mip-NeRF. Vous pouvez également en apprendre davantage sur la recherche NeRF en parcourant notre couverture à ce jour.

Publié à l’origine le 25 novembre 2021
21 décembre 2021, 12:25pm – Vidéo remplacée. – MA

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai