Ángulo de Anderson

Representación neural: NeRF da un paseo en el aire fresco

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una colaboración entre Google Research y la Universidad de Harvard ha desarrollado un nuevo método para crear videos neurales de 360 grados de escenas completas utilizando Campos de Radiancia Neuronal (NeRF). El enfoque novedoso acerca a NeRF a un uso abstracto casual en cualquier entorno, sin limitarse a modelos de mesa o escenarios interiores cerrados.

Fuente: https://www.youtube.com/watch?v=YStDS2-Ln1s

Ver el video completo al final del artículo. Fuente: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 puede manejar fondos extendidos y objetos ‘infinitos’ como el cielo, porque, a diferencia de la mayoría de las iteraciones anteriores, establece límites en la forma en que se interpretan los rayos de luz y crea límites de atención que racionalizan los tiempos de entrenamiento largos. Ver el video acompañante incrustado al final de este artículo para más ejemplos y una visión más profunda del proceso.

El nuevo artículo se titula Mip-NeRF 360: Campos de Radiancia Neuronal Anti-Aliased Ilimitados, y es liderado por el científico de investigación senior de Google Research Jon Barron.

Para entender el avance, es necesario tener una comprensión básica de cómo funciona la síntesis de imágenes basada en campos de radiancia neural.

¿Qué es NeRF?

Es problemático describir una red NeRF en términos de un ‘video’, ya que se acerca más a un entorno virtual completamente realizado en 3D pero basado en IA, donde múltiples puntos de vista de fotos individuales (incluyendo fotogramas de video) se utilizan para unir una escena que técnicamente existe solo en el espacio latente de un algoritmo de aprendizaje automático – pero del que se pueden extraer una cantidad extraordinaria de puntos de vista y videos a voluntad.

Una representación de los puntos de captura de cámara múltiple que proporcionan los datos que NeRF ensambla en una escena neural (imagen de la derecha).

Una representación de los puntos de captura de cámara múltiple que proporcionan los datos que NeRF ensambla en una escena neural (imagen de la derecha).

La información derivada de las fotos contribuyentes se entrena en una matriz que se asemeja a una cuadrícula de voxel en flujos de trabajo de CGI, en el sentido de que cada punto en el espacio 3D termina con un valor, lo que hace que la escena sea navegable.

Una matriz de voxel tradicional coloca la información de píxeles (que normalmente existe en un contexto 2D, como la cuadrícula de píxeles de un archivo JPEG) en un espacio tridimensional. Fuente: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Una matriz de voxel tradicional coloca la información de píxeles (que normalmente existe en un contexto 2D, como la cuadrícula de píxeles de un archivo JPEG) en un espacio tridimensional. Fuente: ResearchGate

Después de calcular el espacio intersticial entre las fotos (si es necesario), la trayectoria de cada píxel posible de cada foto contribuyente se traza efectivamente y se asigna un valor de color, incluyendo un valor de transparencia (sin el cual la matriz neural sería completamente opaca o completamente vacía).

Al igual que las cuadrículas de voxel, y a diferencia del espacio de coordenadas 3D basado en CGI, el ‘interior’ de un objeto ‘cerrado’ no tiene existencia en una matriz NeRF. Puedes abrir un kit de batería CGI y mirar dentro, si lo deseas; pero en lo que respecta a NeRF, la existencia del kit de batería termina cuando el valor de opacidad de su superficie es igual a ‘1’.

Una visión más amplia de un píxel

Mip-NeRF 360 es una extensión de la investigación de marzo de 2021, que introdujo eficientemente el anti-aliasing a NeRF sin muestreo exhaustivo.

NeRF tradicionalmente calcula solo una trayectoria de píxel, lo que tiende a producir el tipo de ‘jaggies’ que caracterizaron los formatos de imagen de internet tempranos, así como sistemas de juegos anteriores. Estos bordes dentados se resolvieron mediante varios métodos, generalmente involucrando la muestra de píxeles adyacentes y la búsqueda de una representación promedio.

Debido a que NeRF tradicional solo muestrea esa trayectoria de píxel, Mip-NeRF introdujo un área de captación ‘cónica’, como un haz de luz ancho, que proporciona suficiente información sobre los píxeles adyacentes para producir un anti-aliasing económico con detalles mejorados.

El cono de captación cónico que utiliza Mip-NeRF se corta en conos truncados (abajo), que se difuminan aún más para representar un espacio gaussiano vago que se puede utilizar para calcular la precisión y el aliasing de un píxel. Fuente: https://www.youtube.com/watch?v=EpH175PY1A0

El cono de captación cónico que utiliza Mip-NeRF se corta en conos truncados (imagen inferior), que se difuminan aún más para crear espacios gaussianos vagos que se pueden utilizar para calcular la precisión y el aliasing de un píxel. Fuente: https://www.youtube.com/watch?v=EpH175PY1A0

La mejora sobre una implementación estándar de NeRF fue notable:

Mip-NeRF (derecha), lanzado en marzo de 2021, proporciona detalles mejorados a través de una tubería de aliasing más completa pero económica, en lugar de simplemente 'difuminar' píxeles para evitar bordes dentados. Fuente: https://jonbarron.info/mipnerf/

Mip-NeRF (derecha), lanzado en marzo de 2021, proporciona detalles mejorados a través de una tubería de aliasing más completa pero económica, en lugar de simplemente ‘difuminar’ píxeles para evitar bordes dentados. Fuente: https://jonbarron.info/mipnerf/

NeRF Ilimitado

El artículo de marzo dejó tres problemas sin resolver con respecto al uso de Mip-NeRF en entornos ilimitados que podrían incluir objetos muy distantes, incluidos cielos. El nuevo artículo resuelve esto aplicando una transformación de estilo Kalman a los gaussianos de Mip-NeRF.

En segundo lugar, las escenas más grandes requieren más potencia de procesamiento y tiempos de entrenamiento extendidos, lo que Mip-NeRF 360 resuelve ‘destilando’ la geometría de la escena con un pequeño perceptrón multicapa (MLP), que pre-delimita la geometría predicha por un MLP de NeRF estándar grande. Esto acelera el entrenamiento en un factor de tres.

Finalmente, las escenas más grandes tienden a hacer que la discretización de la geometría interpretada sea ambigua, lo que resulta en el tipo de artefactos que los jugadores pueden estar familiarizados con cuando la salida del juego ‘se rompe’. El nuevo artículo aborda esto creando un nuevo regularizador para los intervalos de rayos de Mip-NeRF.

A la derecha, vemos artefactos no deseados en Mip-NeRF debido a la dificultad para delimitar una escena tan grande. A la izquierda, vemos que el nuevo regularizador ha optimizado la escena lo suficiente como para eliminar estas perturbaciones.

A la derecha, vemos artefactos no deseados en Mip-NeRF debido a la dificultad para delimitar una escena tan grande. A la izquierda, vemos que el nuevo regularizador ha optimizado la escena lo suficiente como para eliminar estas perturbaciones.

Para saber más sobre el nuevo artículo, ver el video a continuación, y también la introducción al video de marzo de 2021 a Mip-NeRF. También puede encontrar más información sobre la investigación de NeRF en nuestra cobertura hasta ahora.

Publicado originalmente el 25 de noviembre de 2021
21 de diciembre de 2021, 12:25 pm – Reemplazado video muerto. – MA

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai