Angle d’Anderson
NeRF : Facebook Co-Recherche Développe une Synthèse Vidéo Statique/Dynamique Mixte

Une collaboration entre le Virginia Polytechnic Institute and State University et Facebook a résolu l’un des principaux défis de la synthèse vidéo NeRF: mélanger librement des images et des vidéos statiques et dynamiques dans les champs de radiance neuronaux (NeRF) de sortie.
Le système peut générer des scènes navigables qui présentent à la fois des éléments de vidéo dynamiques et des environnements statiques, chacun enregistré sur place, mais séparés en facettes contrôlables d’un environnement virtuel:
En outre, il atteint cet objectif à partir d’un seul point de vue, sans avoir besoin du type de matrice de caméras multiples qui peut lier des initiatives comme celle-ci à un environnement de studio.
L’article paper, intitulé Synthèse de vues dynamiques à partir de vidéos monoculaires dynamiques, n’est pas le premier à développer un flux de travail NeRF monocular, mais semble être le premier à former simultanément un modèle à variation temporelle et un modèle temporel statique à partir de la même entrée, et à générer un cadre qui permet à la vidéo en mouvement d’exister à l’intérieur d’un lieu NeRF « pré-cartographié », semblable au type d’environnements virtuels qui entourent souvent les acteurs dans les sorties SF à gros budget.
Au-delà de D-NeRF
Les chercheurs ont dû recréer essentiellement la polyvalence de Dynamic NeRF (D-NeRF) avec un seul point de vue, et non la multiplicité de caméras que D-NeRF utilise. Pour résoudre ce problème, ils ont prédit le flux de scène avant et arrière et ont utilisé ces informations pour développer un champ de radiance déformé qui est temporellement cohérent.
Avec un seul point de vue, il a été nécessaire d’utiliser l’analyse du flux optique 2D pour obtenir des points 3D dans des cadres de référence. Le point 3D calculé est ensuite réinjecté dans la caméra virtuelle afin d’établir un « flux de scène » qui correspond au flux optique calculé avec le flux optique estimé.
Lors de la formation, les éléments dynamiques et statiques sont réconciliés dans un modèle complet en tant que facettes accessibles séparément.
En incluant un calcul de perte d’ordre de profondeur, le modèle et en appliquant une régularisation rigoureuse de la prédiction du flux de scène dans D-NeRF, le problème du flou de mouvement est grandement atténué.

Bien que la recherche ait beaucoup à offrir en termes de régularisation du calcul NeRF, et améliore considérablement la souplesse et la facilité d’exploration pour la sortie d’un seul point de vue, d’au moins la même importance est la séparation et la réintégration novatrices des éléments NeRF dynamiques et statiques.
En s’appuyant sur une seule caméra, un tel système ne peut pas reproduire la vue panoptique d’une matrice de caméras multiples NeRF, mais il peut aller partout, et sans camion.
NeRF – Statique ou Vidéo?
Récemment, nous avons examiné certaines recherches impressionnantes NeRF en Chine qui peuvent séparer les éléments d’une scène NeRF dynamique capturée avec 16 caméras.

ST-NeRF (ci-dessus) permet au spectateur de repositionner des éléments individuels dans une scène capturée, et même de les redimensionner, de modifier leur taux de lecture, de les geler ou de les faire marche arrière. De plus, ST-NeRF permet à l’utilisateur de « faire défiler » n’importe quelle partie de l’arc de 180 degrés capturé par les 16 caméras.
Cependant, les chercheurs de l’article ST-NeRF concèdent en conclusion que le temps s’écoule toujours dans une direction ou une autre sous ce système, et qu’il est difficile de modifier l’éclairage et d’appliquer des effets à des environnements qui sont en fait des vidéos, plutôt que des environnements NeRF « cartographiés de manière statique » qui ne contiennent pas de composants mobiles et n’ont pas besoin d’être capturés sous forme de vidéo.
Environnements NeRF Statiques Haute Édition
Une scène NeRF statique, maintenant isolée de tout segment de vidéo en mouvement, est plus facile à traiter et à améliorer de diverses manières, notamment la rééclairage, comme proposé plus tôt cette année par NeRV (Neural Reflectance and Visibility Fields for Relighting and View Synthesis), qui offre une première étape pour modifier l’éclairage et/ou le texturage d’un environnement ou d’un objet NeRF:

Relighting a NeRF object with NeRV. Source: https://www.youtube.com/watch?v=4XyDdvhhjVo

Retexturing in NeRV, even including photorealistic specular effects. Since the basis of the array of images is static, it is easier to process and augment a NeRF facet in this way than to encompass the effect across a range of video frames, making initial pre-processing and eventual training lighter and easier.














