Ángulo de Anderson

NeRF: Facebook Co-Research Desarrolla Síntesis de Vídeo Mixto Estático/Dinámico

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una colaboración entre el Instituto Politécnico y la Universidad Estatal de Virginia y Facebook ha resuelto uno de los principales desafíos en la síntesis de vídeo NeRF: mezclar libremente imágenes y vídeo estático y dinámico en los campos de radiación neural (NeRF) de salida.

El sistema puede generar escenas navegables que presentan elementos de vídeo dinámico y entornos estáticos, cada uno grabado en ubicación, pero separados en facetas controlables de un entorno virtual:

Además, logra esto desde un solo punto de vista, sin la necesidad de un arreglo de cámaras múltiples que puede vincular iniciativas como esta a un entorno de estudio.

El artículo, titulado Síntesis de vista dinámica desde vídeo monocular dinámico, no es el primero en desarrollar un flujo de trabajo NeRF monocular, pero parece ser el primero en entrenar simultáneamente un modelo de tiempo variable y un modelo de tiempo estático a partir de la misma entrada, y en generar un marco que permita que el vídeo en movimiento exista dentro de un entorno NeRF ‘pre-mapeado’, similar al tipo de entornos virtuales que a menudo encapsulan a actores en salidas de SF de gran presupuesto.

Más allá de D-NeRF

Los investigadores han tenido que recrear esencialmente la versatilidad de Dynamic NeRF (D-NeRF) con solo un punto de vista, y no la multiplicidad de cámaras que utiliza D-NeRF. Para resolver esto, predijeron el flujo de escena hacia adelante y hacia atrás y utilizaron esta información para desarrollar un campo de radiación distorsionado que es temporalmente coherente.

Con solo un punto de vista, fue necesario utilizar el análisis de flujo óptico 2D para obtener puntos 3D en cuadros de referencia. El punto 3D calculado se vuelve a introducir en la cámara virtual para establecer un ‘flujo de escena’ que coincide con el flujo óptico calculado y el flujo óptico estimado.

En el momento del entrenamiento, los elementos dinámicos y estáticos se reconcilian en un modelo completo como facetas accesibles por separado.

Al incluir un cálculo de pérdida de orden de profundidad, el modelo y aplicar una regularización rigurosa de la predicción del flujo de escena en D-NeRF, el problema del desenfoque de movimiento se mitiga en gran medida.

Aunque la investigación tiene mucho que ofrecer en términos de regularizar el cálculo NeRF, y mejora en gran medida la destreza y la facilidad de exploración para la salida de un solo punto de vista, de al menos igual nota es la separación y reintegración novedosa de elementos NeRF dinámicos y estáticos.

Dependiendo de una sola cámara, tal sistema no puede replicar la vista panóptica de los arreglos de cámaras múltiples NeRF, pero puede ir a cualquier lugar, y sin un camión.

NeRF – Estático o Vídeo

Recientemente examinamos algunas investigaciones NeRF impresionantes de China que pueden separar elementos en una escena NeRF dinámica capturada con 16 cámaras.

ST-NeRF

ST-NeRF (arriba) permite al espectador reubicar elementos individuales en una escena capturada, y incluso cambiar su tamaño, cambiar su velocidad de reproducción, congelarlos o ejecutarlos hacia atrás. Además, ST-NeRF permite al usuario ‘desplazarse’ a través de cualquier parte del arco de 180 grados capturado por las 16 cámaras.

Sin embargo, los investigadores del artículo ST-NeRF admiten al final que el tiempo siempre está funcionando en alguna dirección bajo este sistema, y que es difícil cambiar la iluminación y aplicar efectos a entornos que son en realidad vídeo, en lugar de entornos NeRF ‘estáticamente mapeados’ que en sí mismos no contienen componentes en movimiento, y no necesitan ser capturados como vídeo.

Entornos NeRF Estáticos Altamente Editables

Una escena NeRF estática, ahora aislada de cualquier segmento de vídeo en movimiento, es más fácil de tratar y aumentar de varias maneras, incluyendo la reiluminación, como se propuso anteriormente este año por NeRV (Campos de reflectancia y visibilidad neural para reiluminación y síntesis de vistas), que ofrece un paso inicial para cambiar la iluminación y/o la texturización de un entorno o objeto NeRF:

Reiluminación de un objeto NeRF con NeRV. Fuente: https://www.youtube.com/watch?v=4XyDdvhhjVo

Reiluminación de un objeto NeRF con NeRV. Fuente: https://www.youtube.com/watch?v=4XyDdvhhjVo

Texturización en NeRV, incluso con efectos especulares fotorealistas. Dado que la base del conjunto de imágenes es estática, es más fácil procesar y aumentar una faceta NeRF de esta manera que abarcar el efecto en todo un rango de cuadros de vídeo, lo que hace que el procesamiento inicial y el entrenamiento eventual sean más ligeros y fáciles.

Texturización en NeRV, incluso con efectos especulares fotorealistas. Dado que la base del conjunto de imágenes es estática, es más fácil procesar y aumentar una faceta NeRF de esta manera que abarcar el efecto en todo un rango de cuadros de vídeo, lo que hace que el procesamiento inicial y el entrenamiento eventual sean más ligeros y fáciles.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]