Angle d’Anderson

Le Nouveau CGI : Créer des Quartiers Neuronaux avec Block-NeRF

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les Champs de Rayonnement Neuronaux (NeRF) permettent de recréer et d’explorer des objets à l’intérieur de réseaux neuronaux en utilisant uniquement des photographies prises sous différents angles comme entrée, sans la complexité et le coût des méthodes de CGI traditionnelles.

Cependant, le processus est coûteux en termes de calcul, ce qui a initialement limité les environnements NeRF à des scénarios de modèles de table. Néanmoins, NeRF a été adopté par une communauté de recherche dédiée, qui a au cours de la dernière année permis des reconstructions extérieures ainsi que des humains neuronaux éditables, outre de nombreuses autres innovations.

Maintenant, une nouvelle initiative de recherche, qui inclut la participation de Google Research, reconnaît les limites possibles pour optimiser NeRF, et se concentre plutôt sur la création de quartiers neuronaux en assemblant des environnements NeRF pour créer des quartiers à la demande composés de plusieurs instances NeRF coordonnées.

Vue d'un réseau Block-NeRF de NeRF liés. Voir la vidéo intégrée à la fin de l'article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

Vue d’un réseau Block-NeRF de NeRF liés. Voir la vidéo intégrée à la fin de l’article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

Naviguer dans le réseau de NeRF liés rend NeRF évolutif et modulaire, fournissant des environnements navigables qui chargent des parties supplémentaires du quartier au fur et à mesure que cela est nécessaire, de manière similaire aux méthodes d’optimisation des ressources des jeux vidéo, où ce qui se trouve derrière le coin n’est rarement chargé jusqu’à ce que cela devienne clair que l’environnement sera nécessaire.

Dans un effort majeur pour dissocier des facettes distinctes telles que le temps et la météo, Block-NeRF introduit également des « codes d’apparence », permettant de modifier dynamiquement l’heure de la journée:

Changement de l'heure de la journée avec Block-NeRF. Voir la vidéo intégrée à la fin de l'article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

Changement de l’heure de la journée avec Block-NeRF. Voir la vidéo intégrée à la fin de l’article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

Le nouveau document suggère que l’optimisation de NeRF approche ses propres limites thermiques, et que les déploiements futurs d’environnements de radiance neuronaux dans la réalité virtuelle, d’autres types de sphères interactives et les effets visuels, dépendront probablement d’opérations parallèles, similaires à la façon dont la loi de Moore a finalement cédé la place à des architectures multi-cœur, des optimisations parallèles et de nouvelles approches de mise en cache.

Les auteurs du document (intitulé Block-NeRF: Synthèse de vues neuronaux pour scènes grandes et évolutives) ont utilisé 2,8 millions d’images pour créer la plus grande scène neurale jamais tentée – une série de quartiers à San Francisco.

Block-NeRF navigue la cathédrale Grace de San Francisco. Voir la vidéo intégrée à la fin de l'article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

Block-NeRF navigue la cathédrale Grace de San Francisco. Voir la vidéo intégrée à la fin de l’article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

L’auteur principal du document, représentant l’UC Berkley, est Matthew Tancik, le co-inventeur des Champs de Rayonnement Neuronaux, qui a effectué ce travail pendant son stage chez l’entreprise de développement de technologie de conduite autonome Waymo, hôte du projet. L’initiative propose également une vidéo de présentation sur YouTube, intégrée à la fin de cet article, ainsi que de nombreux exemples de vidéos supplémentaires sur la page du projet.

Le document est co-écrit par plusieurs autres créateurs de NeRF, notamment Ben Mildenhall (Google Research), Pratul P. Srinivasan (Google Research) et Jonathan T. Barron (Google Research). Les autres contributeurs sont Vincent Casser, Xinchen Yan, Sabeek Pradhan, Henrik Kretzschmar et Vincent Casser, tous de Waymo.

Block-NeRF a été développé principalement pour la recherche sur les environnements virtuels pour les systèmes de véhicules autonomes, y compris les voitures et les drones autonomes.

La route Embarcadero depuis un point de vue à 180 degrés dans Block-NeRF. Voir la vidéo intégrée à la fin de l'article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

La route Embarcadero depuis un point de vue à 180 degrés dans Block-NeRF. Voir la vidéo intégrée à la fin de l’article, ainsi que le lien source pour les vidéos supplémentaires haute définition. Source: https://waymo.com/research/block-nerf/

D’autres facteurs qui peuvent être modifiés dynamiquement dans Block-NeRF sont l’ouverture du diaphragme (voir image ci-dessus), la météo et les saisons.

Cependant, modifier la saison peut entraîner des changements connexes dans l’environnement, tels que des arbres sans feuilles, ce qui nécessite un ensemble de données d’entrée encore plus important que celui construit pour Block-NeRF. Le document indique:

‘[La végétation] change de saison et se déplace dans le vent; cela entraîne des représentations floues des arbres et des plantes. De même, les incohérences temporelles dans les données d’entraînement, telles que les travaux de construction, ne sont pas gérées automatiquement et nécessitent une rééducation manuelle des blocs affectés.’

Rendering Apocalyptique

Si vous regardez la vidéo intégrée à la fin, vous remarquerez une ambiance de type Walking Dead dans l’environnement Block-NeRF en réseau. Pour diverses raisons, notamment pour fournir un environnement simulé de démarrage pour les systèmes robotiques, les voitures, les piétons et d’autres objets transitoires ont été intentionnellement masqués à partir du matériel source, mais cela a laissé certains artefacts derrière, tels que les ombres de véhicules « effacés »:

L'ombre fantôme d'une voiture effacée. Source: https://waymo.com/research/block-nerf/

L’ombre fantôme d’une voiture effacée. Source: https://waymo.com/research/block-nerf/

Pour accueillir une gamme d’environnements d’éclairage tels que le jour ou la nuit, les réseaux ont été formés pour intégrer des flux de données dissociés liés à chaque condition souhaitée. Dans l’image ci-dessous, nous voyons les flux contributifs pour les images Block-NeRF d’une autoroute le jour et la nuit:

Les facettes à la demande derrière un rendu Block-NeRF « cuit », permettant à l'utilisateur de basculer sur la nuit au besoin. Source: https://waymo.com/research/block-nerf/

Les facettes à la demande derrière un rendu Block-NeRF « cuit », permettant à l’utilisateur de basculer sur la nuit au besoin. Source: https://waymo.com/research/block-nerf/

Considérations Environnementales et Éthiques

Au cours des dernières années, les soumissions de recherche ont commencé à inclure des avertissements et des déclarations concernant les conséquences éthiques et environnementales possibles du travail proposé. Dans le cas de Block-NeRF, les auteurs notent que les exigences énergétiques sont élevées, et que la prise en compte des objets transitoires à court et à long terme (tels que les feuilles sur les arbres et les travaux de construction, respectivement) nécessiterait un balayage régulier des données source, entraînant une « surveillance » accrue dans les zones urbaines dont les modèles neuronaux doivent être mis à jour.

Les auteurs déclarent:

‘En fonction de l’échelle à laquelle ce travail est appliqué, les exigences de calcul peuvent entraîner ou aggraver les dommages environnementaux si l’énergie utilisée pour le calcul entraîne une augmentation des émissions de carbone. Comme indiqué dans le document, nous prévoyons d’autres travaux, tels que des méthodes de mise en cache, qui pourraient réduire les exigences de calcul et atténuer ainsi les dommages environnementaux.’

En ce qui concerne la surveillance, ils poursuivent:

‘Les applications futures de ce travail pourraient impliquer des efforts de collecte de données encore plus importants, ce qui soulève des préoccupations en matière de confidentialité. Bien que des images détaillées des routes publiques puissent déjà être trouvées sur des services tels que Google Street View, notre méthodologie pourrait promouvoir des analyses répétées et plus régulières de l’environnement. Plusieurs entreprises dans le domaine des véhicules autonomes sont également connues pour effectuer des analyses d’aire régulières à l’aide de leur flotte de véhicules; cependant, certaines n’utilisent que des analyses LiDAR qui peuvent être moins sensibles que la collecte d’images de caméra.’

Méthodes et Solutions

Les environnements NeRF individuels peuvent être réduits, en théorie, à n’importe quelle taille avant d’être assemblés en un tableau Block-NeRF. Cela ouvre la voie à l’inclusion granulaire de contenu qui est certainement susceptible de changer, tel que les arbres, et à l’identification et à la gestion des travaux de construction, qui peuvent persister dans le temps sur plusieurs années de récapture, mais sont susceptibles d’évoluer et de devenir finalement des entités cohérentes.

Cependant, dans cette première sortie de recherche, les blocs NeRF distincts sont limités aux blocs de ville réels de chaque environnement représenté, assemblés avec un chevauchement de 50 % pour assurer une transition cohérente d’un bloc à l’autre lorsque l’utilisateur navigue dans le réseau.

Chaque bloc est contraint par un filtre géographique. Les auteurs notent que cette partie du cadre est ouverte à l’automatisation, et, de manière surprenante, que leur mise en œuvre repose sur OpenStreetMap plutôt que sur Google Maps.

Le rayon d'intersection pour un espace de rendu « actif » Block-NeRF. Source: Waymo

Le rayon d’intersection pour un espace de rendu « actif » Block-NeRF. Source: Waymo

Les blocs sont formés en parallèle, avec les blocs nécessaires rendus à la demande. Les codes d’apparence innovants sont également orchestrés parmi l’ensemble de blocs, garantissant que l’on ne se déplace pas inopinément dans différents temps, météos ou même saisons.

Les segments Block-NeRF sont conditionnés à l'exposition d'une manière analogue à la plage dynamique (HDR) dans le matériel source photographique. Source: Waymo

Les segments Block-NeRF sont conditionnés à l’exposition d’une manière analogue à la plage dynamique (HDR) dans le matériel source photographique. Source: Waymo

La capacité de basculer les variables d’éclairage et d’autres variables environnementales est dérivée des Optimisations Latentales Génératives introduites dans NeRF dans la nature (NeRF-W), qui a lui-même dérivé la méthode du document de recherche de Facebook AI de 2019 Optimiser l’espace latent des réseaux génératifs.

Un modèle de segmentation sémantique originaire de Panoptic-DeepLab en 2020 est utilisé pour bloquer les éléments indésirables (tels que les personnes et les véhicules)

Données

En constatant que les ensembles de données urbains courants tels que CityScapes n’étaient pas adaptés à un travail de détail intensif tel que Block-NeRF, les chercheurs ont créé leur propre ensemble de données. Les données d’images ont été capturées à partir de 12 caméras couvrant une vue à 360 degrés, avec des images prises à 10 Hz avec une valeur d’exposition scalaire.

Les quartiers de San Francisco couverts étaient Alamo Square et Mission Bay. Pour les captures d’Alamo Square, une zone d’environ 960m x 570m a été couverte, divisée en 35 instances Block-NeRF, chacune formée sur des données de 38 à 48 différentes courses de collecte de données, avec un temps de conduite total de 18-28 minutes.

Le nombre d’images contributives pour chaque Block-NeRF allait de 64 575 à 108 216, et le temps de conduite représenté pour cette zone était de 13,4 heures sur 1 330 différentes courses de collecte de données. Cela a donné lieu à 2 818 745 images de formation pour Alamo Square seulement. Voir le document pour plus de détails sur la collecte de données pour Mission Bay.

 

Publié pour la première fois le 11 février 2022.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai