Ángulo de Anderson
El Nuevo CGI: Creando Vecindarios Neurales con Block-NeRF

Los Campos de Radiancia Neuronal (NeRF) permiten recrear y explorar objetos dentro de redes neurales utilizando solo múltiples fotografías de puntos de vista como entrada, sin la complejidad y el gasto de los métodos tradicionales de CGI.
Sin embargo, el proceso es computacionalmente costoso, lo que inicialmente limitó los entornos de NeRF a escenarios de modelos de mesa. No obstante, NeRF ha sido adoptado por una comunidad de investigación dedicada, incluso frenética, que ha habilitado durante el último año reconstrucciones exteriores así como humanos neurales editables, además de muchas otras innovaciones.
Ahora, una nueva iniciativa de investigación, que incluye la participación de Google Research, reconoce los posibles límites difíciles para optimizar NeRF, y se concentra en lugar de eso en coser entornos de NeRF para crear vecindarios a demanda que comprenden múltiples instancias de NeRF coordinadas.

Punto de vista desde una red de Block-NeRF de NeRFs enlazados. Ver video incrustado al final del artículo y también enlace de fuente para videos suplementarios de alta resolución y longitud completa. Fuente: https://waymo.com/research/block-nerf/
Navegar la red de NeRFs enlazados efectivamente hace que NeRF sea escalable y modular, proporcionando entornos navegables que cargan partes adicionales del vecindario según sea necesario, de manera similar a los métodos de optimización de recursos de los videojuegos, donde lo que está alrededor de la esquina rara vez se carga hasta que se hace evidente que el entorno será necesario.
En un gran esfuerzo por desentrelazar facetas separadas como el clima y la hora, Block-NeRF también introduce ‘códigos de apariencia’, lo que hace posible cambiar dinámicamente la hora del día:


Cambiar la hora del día con Block-NeRF. Ver video incrustado al final del artículo y también enlace de fuente para videos suplementarios de alta resolución y longitud completa. Fuente: https://waymo.com/research/block-nerf/
El nuevo artículo sugiere que la optimización de NeRF se acerca a su propio límite térmico, y que los despliegues futuros de entornos de radiancia neural en realidad virtual, otros tipos de esferas interactivas y trabajo de VFX, probablemente dependerán de operaciones paralelas, similares a la forma en que la Ley de Moore eventualmente dio paso a arquitecturas multi-núcleo, optimizaciones paralelas y nuevos enfoques de almacenamiento en caché.
Los autores del artículo (titulado Block-NeRF: Síntesis de Vista Neural de Escena Grande Escalable) utilizaron 2,8 millones de imágenes para crear la escena neural más grande jamás intentada – una serie de vecindarios en San Francisco.

Block-NeRF navega la Catedral de Gracia de San Francisco. Ver video incrustado al final del artículo y también enlace de fuente para videos suplementarios de alta resolución y longitud completa. Fuente: https://waymo.com/research/block-nerf/
El autor principal del artículo, representando a UC Berkley, es Matthew Tancik, el co-inventor de los Campos de Radiancia Neuronal, quien realizó el trabajo mientras era pasante en la empresa de tecnología de conducción autónoma Waymo, anfitrión de la página del proyecto. La iniciativa también ofrece una visión general de video en YouTube, incrustada al final de este artículo, además de muchos ejemplos de video suplementarios en la página del proyecto.
El artículo es co-escrito por varios otros originadores de NeRF, incluyendo a Ben Mildenhall (Google Research), Pratul P. Srinivasan (Google Research) y Jonathan T. Barron (Google Research). Los otros contribuyentes son Vincent Casser, Xinchen Yan, Sabeek Pradhan, Henrik Kretzschmar y Vincent Casser, todos de Waymo.
Block-NeRF se desarrolló principalmente como investigación en entornos virtuales para sistemas de vehículos autónomos, incluyendo coches y drones autónomos.

La carretera de Embarcadero desde una postura de 180 grados en Block-NeRF. Ver video incrustado al final del artículo y también enlace de fuente para videos suplementarios de alta resolución y longitud completa. Fuente: https://waymo.com/research/block-nerf/
Otros factores que se pueden cambiar dinámicamente en Block-NeRF son la apertura de la lente (ver imagen arriba), el clima y las estaciones.
Sin embargo, cambiar la estación puede causar cambios relacionados en el entorno, como árboles sin hojas, lo que requiere un conjunto de datos de entrada aún más extenso de lo que se construyó para Block-NeRF. El artículo establece:
‘[La vegetación] cambia estacionalmente y se mueve en el viento; esto resulta en representaciones borrosas de árboles y plantas. De manera similar, las inconsistencias temporales en los datos de entrenamiento, como la construcción, no se manejan automáticamente y requieren el entrenamiento manual de los bloques afectados.’
Representación Apocalíptica
Si se observa el video incrustado al final, se notará una espaciosidad al estilo de The Walking Dead en el entorno de Block-NeRF enlazado. Por varias razones, no menos para proporcionar un entorno simulado de inicio para sistemas robóticos, coches, peatones y otros objetos transitorios se eliminaron deliberadamente del material de origen, pero esto ha dejado algunos artefactos detrás, como las sombras de vehículos ‘borrados’ estacionados:

La sombra fantasma de un coche eliminado. Fuente: https://waymo.com/research/block-nerf/
Para acomodar una variedad de entornos de iluminación, como el día o la noche, las redes se han entrenado para incorporar flujos de datos desentrelazados relacionados con cada condición deseada. En la imagen a continuación, vemos los flujos contribuyentes para la filmación de Block-NeRF de una carretera durante el día y la noche:

Las facetas a demanda detrás de una renderización ‘preparada’ de Block-NeRF, que permite al usuario activar la noche según sea necesario. Fuente: https://waymo.com/research/block-nerf/
Consideraciones Ambientales y Éticas
En los últimos años, las presentaciones de investigación han comenzado a incluir advertencias y descargos de responsabilidad sobre las posibles implicaciones éticas y ambientales del trabajo propuesto. En el caso de Block-NeRF, los autores señalan que los requisitos energéticos son altos y que la contabilización de objetos transitorios a corto y largo plazo (como las hojas de los árboles y la construcción, respectivamente) requeriría un escaneo regular de los datos de origen, lo que llevaría a un aumento de la ‘vigilancia’ en áreas urbanas cuyos modelos neurales necesitan mantenerse actualizados.
Los autores establecen:
‘Dependiendo de la escala en la que se aplique este trabajo, sus demandas de cálculo pueden llevar a o empeorar el daño ambiental si la energía utilizada para el cálculo conduce a un aumento de las emisiones de carbono. Como se menciona en el artículo, predecimos un trabajo adicional, como métodos de almacenamiento en caché, que podrían reducir las demandas de cálculo y, por lo tanto, mitigar el daño ambiental.’
En cuanto a la vigilancia, continúan:
‘Las aplicaciones futuras de este trabajo pueden implicar esfuerzos de recopilación de datos aún mayores, lo que plantea preocupaciones de privacidad adicionales. Si bien ya se pueden encontrar imágenes detalladas de carreteras públicas en servicios como Google Street View, nuestra metodología podría promover escaneos repetidos y más regulares del entorno. Varias empresas en el espacio de vehículos autónomos también son conocidas por realizar escaneos de área regulares utilizando su flota de vehículos; sin embargo, algunas solo utilizan escaneos LiDAR, que pueden ser menos sensibles que la recopilación de imágenes de cámara.’
Métodos y Soluciones
Los entornos de NeRF individuales se pueden reducir, en teoría, a cualquier tamaño antes de ser ensamblados en una matriz de Block-NeRF. Esto abre el camino a la inclusión granular de contenido que seguramente estará sujeto a cambios, como los árboles, y a la identificación y gestión de obras de construcción, que pueden persistir en el tiempo durante años de recaptura, pero es probable que evolucionen y eventualmente se conviertan en entidades coherentes.
Sin embargo, en esta primera salida de investigación, los bloques de NeRF discretos están limitados a los bloques de ciudad reales de cada entorno representado, cosidos juntos, con un 50% de superposición que garantiza una transición coherente de un bloque a otro a medida que el usuario navega por la red.
Cada bloque está restringido por un filtro geográfico. Los autores señalan que esta parte del marco está abierta a la automatización y, sorprendentemente, que su implementación depende de OpenStreetMap en lugar de Google Maps.

El radio de intersección para un espacio de renderizado ‘activo’ de Block-NeRF. Fuente: Waymo
Los bloques se entrenan en paralelo, con los bloques necesarios renderizados a demanda. Los códigos de apariencia innovadores también se orquestan entre el conjunto de bloques, garantizando que no se viaje inesperadamente a diferentes condiciones climáticas, hora del día o incluso a una estación diferente.

Los segmentos de Block-NeRF están condicionados a la exposición de manera análoga a la gama dinámica alta (HDR) en material de origen fotográfico. Fuente: Waymo
La capacidad de cambiar la iluminación y otras variables ambientales se deriva de las Optimizaciones Generativas Latentes introducidas en NeRF en el Salvaje (NeRF-W), que a su vez derivó el método del artículo de investigación de Facebook AI de 2019 Optimizando el Espacio Latente de Redes Generativas.
Un modelo de segmentación semántica originado para Panoptic-DeepLab en 2020 se utiliza para bloquear elementos no deseados (como personas y vehículos)
Datos
Al encontrar que los conjuntos de datos urbanos comunes como CityScapes no eran adecuados para un trabajo de detalles tan intensivo como el que Block-NeRF implica, los investigadores originaron su propio conjunto de datos. Los datos de imagen se capturaron desde 12 cámaras que abarcan una vista de 360 grados, con filmaciones tomadas a 10 Hz con un valor de exposición escalar.

Los vecindarios de San Francisco cubiertos fueron Alamo Square y Mission Bay. Para las capturas de Alamo Square, un área de aproximadamente 960m x 570m se cubrió, dividida en 35 instancias de Block-NeRF, cada una entrenada en datos de 38 a 48 diferentes corridas de recopilación de datos, con un tiempo de conducción total de 18-28 minutos.
La cantidad de imágenes contribuyentes para cada Block-NeRF varió entre 64,575 y 108,216, y el tiempo de conducción representado para esta área fue de 13,4 horas a través de 1.330 diferentes corridas de recopilación de datos. Esto resultó en 2.818.745 imágenes de entrenamiento solo para Alamo Square. Ver el artículo para obtener más detalles sobre la recopilación de datos para Mission Bay.
Publicado por primera vez el 11 de febrero de 2022.












