Angle d’Anderson

Vers l’homme réel en temps réel avec le rendu de Neural Lumigraph

mm
Ajouter Unite.AI à vos sources préférées sur Google
Neural Lumigraph Rendering

Malgré la vague actuelle d’intérêt pour les champs de rayonnement neuronaux (NeRF), une technologie capable de créer des environnements et des objets 3D générés par IA, cette nouvelle approche de la technologie de synthèse d’images nécessite encore beaucoup de temps d’entraînement et manque d’une mise en œuvre qui permet des interfaces réactives en temps réel.

Cependant, une collaboration entre des noms impressionnants de l’industrie et de l’université propose une nouvelle approche de ce défi (génériquement connu sous le nom de synthèse de vues nouvelles, ou NVS).

Le document de recherche, intitulé Neural Lumigraph Rendering, affirme une amélioration de l’état de l’art d’environ deux ordres de grandeur, représentant plusieurs étapes vers le rendu CG en temps réel via les pipelines d’apprentissage automatique.

Neural Lumigraph Rendering (droite) offre une meilleure résolution des artefacts de mélange et une meilleure gestion de l'occlusion par rapport aux méthodes précédentes. Source: https://www.youtube.com/watch?v=maVF-7x9644

Neural Lumigraph Rendering (droite) offre une meilleure résolution des artefacts de mélange et une meilleure gestion de l’occlusion par rapport aux méthodes précédentes. Source.

Bien que les crédits pour le document ne citent que l’Université de Stanford et la société de technologie d’affichage holographique Raxium (actuellement en mode furtif), les contributeurs incluent un architecte principal d’apprentissage automatique chez Google, un scientifique informatique chez Adobe et le CTO chez StoryFile (qui a récemment fait les actualités avec une version IA de William Shatner).

En ce qui concerne la récente campagne de publicité de Shatner, StoryFile semble utiliser NLR dans son nouveau processus de création d’entités interactives générées par IA basées sur les caractéristiques et les récits de personnes individuelles.

StoryFile envisage l’utilisation de cette technologie dans les expositions de musées, les récits interactifs en ligne, les affichages holographiques, la réalité augmentée (AR) et la documentation du patrimoine – et semble également examiner de nouvelles applications potentielles de NLR dans les entretiens de recrutement et les applications de rencontres virtuelles:

Utilisations proposées à partir d'une vidéo en ligne de StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Utilisations proposées à partir d’une vidéo en ligne de StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Capture volumétrique pour les interfaces de synthèse de vues nouvelles et la vidéo

Le principe de capture volumétrique, à travers la série de documents qui s’accumulent sur le sujet, est l’idée de prendre des images fixes ou des vidéos d’un sujet, et d’utiliser l’apprentissage automatique pour « remplir » les points de vue qui n’ont pas été couverts par l’array initial de caméras.

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Dans l’image ci-dessus, tirée de la recherche AI 2019 de Facebook (voir ci-dessous), nous voyons les quatre étapes de la capture volumétrique: plusieurs caméras obtiennent des images/vidéos; l’architecture encodeur/décodeur (ou d’autres architectures) calcule et concatène la relativité des vues; les algorithmes de marche de rayon calculent les voxels (ou d’autres unités géométriques spatiales XYZ) de chaque point dans l’espace volumétrique; et (dans la plupart des documents récents) la formation se produit pour synthétiser une entité complète qui peut être manipulée en temps réel.

C’est cette phase de formation souvent extensive et gourmande en données qui, à ce jour, a tenu la synthèse de vues nouvelles hors du domaine du temps réel ou de la capture hautement réactive.

Le fait que la synthèse de vues nouvelles crée une carte 3D complète d’un espace volumétrique signifie qu’il est relativement trivial de coudre ces points ensemble en un maillage CG traditionnel, capturant et articulant efficacement un humain CG (ou tout autre objet relativement délimité) sur le vif.

Les approches qui utilisent NeRF s’appuient sur des nuages de points et des cartes de profondeur pour générer les interpolations entre les points de vue épars des appareils de capture:

NeRF peut générer une profondeur volumétrique via le calcul des cartes de profondeur, plutôt que la génération de maillages CG. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF peut générer une profondeur volumétrique via le calcul des cartes de profondeur, plutôt que la génération de maillages CG. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

Bien que NeRF soit capable de calculer des maillages, la plupart des mises en œuvre n’utilisent pas cela pour générer des scènes volumétriques.

En revanche, l’approche de rendu différentiable implicite (IDR), publiée par l’Institut de science Weizmann en octobre 2020, repose sur l’exploitation des informations de maillage 3D générées automatiquement à partir des arrays de capture:

Exemples de captures IDR transformées en maillages CG interactifs. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Exemples de captures IDR transformées en maillages CG interactifs. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Alors que NeRF manque de la capacité d’estimation de forme d’IDR, IDR ne peut pas non plus égaler la qualité d’image de NeRF, et les deux nécessitent des ressources considérables pour la formation et la collecte (bien que les innovations récentes dans NeRF soient en train de s’attaquer à cela).

Trépied de caméra personnalisé de NLR avec 16 GoPro HERO7 et 6 caméras centrales Back-Bone H7PRO. Pour un rendu « en temps réel », celles-ci fonctionnent à un minimum de 60 fps. Source: https://arxiv.org/pdf/2103.11571.pdf

Trépied de caméra personnalisé de NLR avec 16 GoPro HERO7 et 6 caméras centrales Back-Bone H7PRO. Pour un rendu « en temps réel », celles-ci fonctionnent à un minimum de 60 fps. Source: https://arxiv.org/pdf/2103.11571.pdf

Au lieu de cela, Neural Lumigraph Rendering utilise SIREN (Sinusoidal Representation Networks) pour incorporer les forces de chaque approche dans son propre cadre, qui est destiné à générer une sortie directement utilisable dans les pipelines graphiques en temps réel existants.

SIREN a été utilisé pour des mises en œuvre similaires au cours de la dernière année, et représente maintenant un appel d’API populaire pour les Colabs dans les communautés de synthèse d’images; cependant, l’innovation de NLR est d’appliquer SIRENs à la supervision d’images multi-vues bidimensionnelles, ce qui est problématique en raison de la mesure dans laquelle SIREN produit une sortie surajustée plutôt que généralisée.

Une fois que le maillage CG est extrait des images de l’array, le maillage est rasterisé via OpenGL, et les positions de sommet du maillage sont mappées aux pixels appropriés, après quoi le mélange des cartes contributives est calculé.

Le maillage résultant est plus généralisé et représentatif que celui de NeRF (voir image ci-dessous), nécessite moins de calcul et n’applique pas d’excès de détails dans les zones (telles que la peau faciale lisse) qui ne peuvent pas en bénéficier:

Source: https://arxiv.org/pdf/2103.11571.pdf

Source: https://arxiv.org/pdf/2103.11571.pdf

En revanche, NLR ne dispose pas encore de capacité pour l’éclairage dynamique ou la relumination, et la sortie est limitée aux cartes d’ombre et à d’autres considérations d’éclairage obtenues au moment de la capture. Les chercheurs prévoient de s’attaquer à cela dans les travaux futurs.

En outre, le document concède que les formes générées par NLR ne sont pas aussi précises que certaines approches alternatives, telles que Pixelwise View Selection for Unstructured Multi-View Stereo, ou la recherche de l’Institut Weizmann mentionnée précédemment.

L’essor de la synthèse d’images volumétriques

L’idée de créer des entités 3D à partir d’une série limitée de photos avec des réseaux neuronaux précède NeRF, avec des documents visionnaires remontant à 2007 ou plus tôt. En 2019, le département de recherche en IA de Facebook a produit un document de recherche seminal, Neural Volumes: Learning Dynamic Renderable Volumes from Images, qui a permis pour la première fois des interfaces réactives pour des humains synthétiques générés par la capture volumétrique basée sur l’apprentissage automatique.

La recherche de Facebook en 2019 a permis la création d'une interface utilisateur réactive pour une personne volumétrique. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

La recherche de Facebook en 2019 a permis la création d’une interface utilisateur réactive pour une personne volumétrique. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai