Ángulo de Anderson

NeRF: El desafío de editar el contenido de los campos de radiación neural

mm
Añade Unite.AI a tus fuentes preferidas en Google

Al comienzo de este año, NVIDIA avanzó notablemente en la investigación de Neural Radiance Fields (NeRF) con InstantNeRF, aparentemente capaz de generar escenas neurales explorables en apenas segundos, a partir de una técnica que, cuando emergió en 2020, frecuentemente requería horas o incluso días para entrenar.

NVIDIA's InstantNeRF proporciona resultados impresionantes y rápidos. Fuente: https://www.youtube.com/watch?v=DJ2hcC1orc4

NVIDIA’s InstantNeRF proporciona resultados impresionantes y rápidos. Fuente: https://www.youtube.com/watch?v=DJ2hcC1orc4

Aunque este tipo de interpolación produce una escena estática, NeRF también es capaz de representar movimiento, y de edición básica ‘copiar y pegar’, donde los NeRF individuales pueden ser combinados en escenas compuestas o insertados en escenas existentes.

NeRF anidados, presentados en la investigación de 2021 de la Universidad de Tecnología de Shanghái y DGene Digital Technology. Fuente: https://www.youtube.com/watch?v=Wp4HfOwFGP4

NeRF anidados, presentados en la investigación de 2021 de la Universidad de Tecnología de Shanghái y DGene Digital Technology. Fuente: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Sin embargo, si se busca intervenir en un NeRF calculado y cambiar algo que está sucediendo dentro de él (de la misma manera que se pueden cambiar elementos en una escena CGI tradicional), el ritmo acelerado del interés en el sector ha generado muy pocas soluciones hasta la fecha, y ninguna que siquiera comience a igualar las capacidades de los flujos de trabajo CGI.

Aunque la estimación de la geometría es esencial para crear una escena NeRF, el resultado final está compuesto por valores bastante ‘bloqueados’. Aunque hay algunos avances en el cambio de valores de textura en NeRF, los objetos reales en una escena NeRF no son mallas paramétricas que puedan ser editadas y manipuladas, sino más bien como nubes de puntos frágiles y congeladas.

En este escenario, una persona renderizada en un NeRF es esencialmente una estatua (o una serie de estatuas, en NeRF de video); las sombras que proyectan sobre sí mismas y otros objetos son texturas, en lugar de cálculos flexibles basados en fuentes de luz; y la edición del contenido NeRF se limita a las opciones realizadas por el fotógrafo que toma las fotos de fuente dispersa a partir de las cuales se genera el NeRF. Parámetros como sombras y postura permanecen no editables, en cualquier sentido creativo.

Edición de NeRF

Una nueva colaboración de investigación académica entre China y el Reino Unido aborda este desafío con Edición de NeRF, donde se extraen mallas de estilo CGI de un NeRF, se deforman a voluntad por el usuario y las deformaciones se pasan de regreso a los cálculos neurales del NeRF:

Marioneta de NeRF con edición de NeRF, ya que las deformaciones calculadas a partir de la filmación se aplican a puntos equivalentes dentro de una representación de NeRF.

Marioneta de NeRF con edición de NeRF, ya que las deformaciones calculadas a partir de la filmación se aplican a puntos equivalentes dentro de una representación de NeRF. Fuente: http://geometrylearning.com/NeRFEditing/

El método adapta la técnica reconstructiva NeuS de 2021 de EE. UU. / China, que extrae una Función de Distancia Firmada (SDF, un método mucho más antiguo de reconstrucción volumétrica) que puede aprender la geometría representada dentro del NeRF.

Este objeto SDF se convierte en la base de escultura del usuario, con capacidades de deformación y modelado proporcionadas por la técnica venerable As-Rigid-As-Possible (ARAP).

ARAP permite a los usuarios deformar la malla SDF extraída, aunque otros métodos, como los enfoques basados en esqueleto y jaula (es decir, NURBs), también funcionarían bien.

ARAP permite a los usuarios deformar la malla SDF extraída, aunque otros métodos, como los enfoques basados en esqueleto y jaula (es decir, NURBs), también funcionarían bien. Fuente: https://arxiv.org/pdf/2205.04978.pdf

Con las deformaciones aplicadas, es necesario traducir esta información desde el nivel de vector hasta el nivel de píxel / RGB nativo de NeRF, lo que es un viaje ligeramente más largo.

Los vértices triangulares de la malla que el usuario ha deformado se traducen primero en una malla tetraédrica, que forma una piel alrededor de la malla del usuario. Un campo de deformación discreto espacial se extrae de esta malla adicional, y finalmente se obtiene un campo de deformación continuo compatible con NeRF, que se puede pasar de regreso al entorno de radiación neural, reflejando los cambios y ediciones del usuario, y afectando directamente los rayos interpretados en el NeRF objetivo.

Objetos deformados y animados por el nuevo método.

Objetos deformados y animados por el nuevo método.

El artículo afirma:

‘Después de transferir la deformación de la superficie a la malla tetraédrica, podemos obtener el campo de deformación discreto del “espacio efectivo”. Ahora utilizamos estas transformaciones discretas para doblar los rayos de proyección. Para generar una imagen del campo de radiación deformado, lanzamos rayos al espacio que contiene la malla tetraédrica deformada.’

El artículo se titula Edición de NeRF: Edición de geometría de campos de radiación neural, y proviene de investigadores de tres universidades chinas e instituciones, junto con un investigador de la Escuela de Ciencias de la Computación e Informática de la Universidad de Cardiff, y otros dos investigadores del Grupo Alibaba.

Límites

Como se mencionó anteriormente, la geometría transformada no ‘actualizará’ ningún aspecto relacionado en el NeRF que no haya sido editado, ni reflejará las consecuencias secundarias del elemento deformado, como las sombras. Los investigadores proporcionan un ejemplo, donde las sombras debajo de una figura humana en un NeRF permanecen inalteradas, incluso aunque la deformación debería alterar la iluminación:

Del artículo: vemos que la sombra horizontal en el brazo de la figura permanece en su lugar incluso cuando el brazo se mueve hacia arriba.

Del artículo: vemos que la sombra horizontal en el brazo de la figura permanece en su lugar incluso cuando el brazo se mueve hacia arriba.

Experimentos

Los autores observan que actualmente no hay métodos comparables para la intervención directa en la geometría de NeRF. Por lo tanto, los experimentos realizados para la investigación fueron más exploratorios que comparativos.

Los investigadores demostraron la edición de NeRF en varios conjuntos de datos públicos, incluidos personajes de Mixamo, y el icónico bulldozer y silla de Lego del implementación original de NeRF. También experimentaron con una estatua de caballo capturada en el conjunto de datos FVS, así como con sus propias capturas originales.

La cabeza de un caballo inclinada.

La cabeza de un caballo inclinada.

Para el trabajo futuro, los autores pretenden desarrollar su sistema en el marco de aprendizaje automático compilado just-in-time (JIT) Jittor.

 

Publicado por primera vez el 16 de mayo de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai