Ángulo de Anderson
ST-NeRF: Composición y Edición para Síntesis de Video

Un consorcio de investigación chino ha desarrollado técnicas para traer capacidades de edición y composición a uno de los sectores de investigación de síntesis de imágenes más calientes del último año: Campos de Radiancia Neural (NeRF). El sistema se llama ST-NeRF (Campo de Radiancia Neural Coherente Espacio-Temporal).
Lo que parece ser un movimiento de cámara física en la imagen a continuación es en realidad solo un usuario “desplazándose” a través de puntos de vista en contenido de video que existe en un espacio 4D. El punto de vista no está bloqueado para el rendimiento de las personas representadas en el video, cuyos movimientos pueden ser vistos desde cualquier parte de un radio de 180 grados.

Cada faceta dentro del video es un elemento capturado discretamente, compuesto en una escena coherente que puede ser explorada dinámicamente.
Las facetas pueden ser duplicadas libremente dentro de la escena, o cambiadas de tamaño:

Además, el comportamiento temporal de cada faceta puede ser alterado fácilmente, ralentizado, ejecutado hacia atrás o manipulado de cualquier manera, abriendo el camino a arquitecturas de filtros y un nivel extremadamente alto de interpretación.

Dos facetas de NeRF separadas que se ejecutan a diferentes velocidades en la misma escena. Fuente: https://www.youtube.com/watch?v=Wp4HfOwFGP4

No hay necesidad de rotoscopiar a los intérpretes o entornos, o de que los intérpretes ejecuten sus movimientos ciegos y fuera del contexto de la escena pretendida. En cambio, la filmación se captura de manera natural a través de una matriz de 16 cámaras de video que cubren 180 grados:


Los tres elementos representados arriba, las dos personas y el entorno, son distintos y están delineados solo con fines ilustrativos. Cada uno puede ser intercambiado y cada uno puede ser insertado en la escena en un punto anterior o posterior en su cronología de captura individual.
ST-NeRF es una innovación en la investigación de Campos de Radiancia Neural (NeRF), un marco de aprendizaje automático mediante el cual se sintetizan múltiples capturas de puntos de vista en un espacio virtual navegable mediante un entrenamiento extensivo (aunque la captura de un solo punto de vista también es un subsector de la investigación de NeRF).

Los Campos de Radiancia Neural funcionan reuniendo múltiples capturas de puntos de vista en un solo espacio 3D coherente y navegable, con los espacios entre la cobertura estimados y renderizados por una red neuronal. Donde se utiliza video (en lugar de imágenes fijas), los recursos de renderizado necesarios son a menudo considerables. Fuente: https://www.matthewtancik.com/nerf
El interés en NeRF se ha vuelto intenso en los últimos nueve meses, y una lista mantenida por Reddit de documentos derivados o exploratorios de NeRF actualmente enumera sesenta proyectos.

Solo algunos de los muchos subproductos del documento original de NeRF. Fuente: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/
Capacitación Asequible
El documento es una colaboración entre investigadores de la Universidad de Tecnología de Shanghái y DGene Digital Technology, y ha sido aceptado con entusiasmo en Open Review.
ST-NeRF ofrece una serie de innovaciones sobre las iniciativas anteriores en espacios de video navegable derivados de ML. No menos, logra un alto nivel de realismo con solo 16 cámaras. Aunque el DyNeRF de Facebook utiliza solo dos cámaras más que esto, ofrece un arco de navegación mucho más restringido.

Un ejemplo del entorno de DyNeRF de Facebook, con un arco de movimiento más limitado y más cámaras por pie cuadrado necesarias para reconstruir la escena. Fuente: https://neural-3d-video.github.io
Además de carecer de la capacidad de editar y componer facetas individuales, DyNeRF es particularmente costoso en términos de recursos computacionales. En contraste, los investigadores chinos afirman que el costo de capacitación para sus datos es de alrededor de $900-$3,000, en comparación con los $30,000 para el modelo de generación de video de estado del arte DVDGAN, y sistemas intensivos como DyNeRF.
Los revisores también han observado que ST-NeRF hace una innovación importante al separar el proceso de aprendizaje de movimiento del proceso de síntesis de imagen. Esta separación es lo que permite la edición y la composición, con enfoques anteriores restrictivos y lineales en comparación.
Aunque 16 cámaras es una matriz muy limitada para un círculo completo de vista, los investigadores esperan reducir este número aún más en trabajos posteriores a través del uso de fondos estáticos pre-escaneados y enfoques de modelado de escena más basados en datos. También esperan incorporar capacidades de re-iluminación, una innovación reciente en la investigación de NeRF.
Abordar las Limitaciones de ST-NeRF
En el contexto de los documentos de investigación de CS académicos que tienden a desechar la usabilidad real de un nuevo sistema en un párrafo final descartable, incluso las limitaciones que los investigadores reconocen para ST-NeRF son inusuales.
Observan que el sistema no puede individuar y renderizar objetos particulares en una escena, porque las personas en la filmación se segmentan en entidades individuales a través de un sistema diseñado para reconocer humanos y no objetos – un problema que parece fácil de solucionar con YOLO y marcos similares, con el trabajo más difícil de extraer video humano ya realizado.
Aunque los investigadores observan que actualmente no es posible generar movimiento en cámara lenta, no parece haber nada que impida la implementación de esto utilizando innovaciones existentes en interpolación de cuadros como DAIN y RIFE.
Al igual que con todas las implementaciones de NeRF, y en muchos otros sectores de la investigación de visión por computadora, ST-NeRF puede fallar en casos de oclusión severa, donde el sujeto está temporalmente oculto por otra persona u objeto, y puede ser difícil de rastrear continuamente o de re-adquirir con precisión después. Como en otros lugares, esta dificultad puede tener que esperar soluciones upstream. Mientras tanto, los investigadores conceden que la intervención manual es necesaria en estos marcos ocluidos.
Finalmente, los investigadores observan que los procedimientos de segmentación de humanos actualmente dependen de diferencias de color, lo que podría llevar a la colación no intencional de dos personas en un bloque de segmentación – un obstáculo que no se limita a ST-NeRF, sino que es intrínseco a la biblioteca utilizada, y que podría ser solucionado mediante el análisis de flujo óptico y otras técnicas emergentes.
Publicado por primera vez el 7 de mayo de 2021.












