Ángulo de Anderson

Renderizado Neural: NeRF Da un Paseo al Aire Libre

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una colaboración entre Google Research y Harvard University ha desarrollado un nuevo método para crear video neural de 360 grados de escenas completas usando Neural Radiance Fields (NeRF). El novedoso enfoque lleva a NeRF un paso más cerca del uso abstracto casual en cualquier entorno, sin estar restringido a modelos de mesa o escenarios interiores cerrados.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Ver al final del artículo para el video completo. Fuente: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 puede manejar fondos extendidos y objetos ‘infinitos’ como el cielo, porque, a diferencia de la mayoría de iteraciones anteriores, establece límites en la forma en que se interpretan los rayos de luz y crea límites de atención que racionalizan los tiempos de entrenamiento, que de otro modo serían extensos. Consulte el nuevo video adjunto incrustado al final de este artículo para más ejemplos y una visión ampliada del proceso.

El nuevo artículo se titula Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, y está liderado por el Senior Staff Research Scientist de Google Research, Jon Barron.

Para comprender el avance, es necesario tener una comprensión básica de cómo funciona la síntesis de imágenes basada en campos de radiancia neural.

¿Qué es NeRF?

Resulta problemático describir una red NeRF en términos de un ‘video’, ya que se asemeja más a un entorno virtual totalmente realizado en 3D pero basado en IA, donde múltiples puntos de vista a partir de fotos individuales (incluidos fotogramas de video) se utilizan para ensamblar una escena que técnicamente solo existe en el espacio latente de un algoritmo de aprendizaje automático, pero del cual se pueden extraer a voluntad una extraordinaria cantidad de puntos de vista y videos.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Una representación de los múltiples puntos de captura de cámara que proporcionan los datos que NeRF ensambla en una escena neural (imagen a la derecha).

La información derivada de las fotos contribuyentes se entrena en una matriz similar a una cuadrícula de vóxeles tradicional en flujos de trabajo CGI, en el sentido de que cada punto en el espacio 3D termina con un valor, lo que hace que la escena sea navegable.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Una matriz de vóxeles tradicional coloca la información de píxeles (que normalmente existe en un contexto 2D, como la cuadrícula de píxeles de un archivo JPEG) en un espacio tridimensional. Fuente: ResearchGate Fuente: ResearchGate

Después de calcular el espacio intersticial entre fotos (si es necesario), la trayectoria de cada posible píxel de cada foto contribuyente se rastrea efectivamente mediante ‘ray tracing’ y se le asigna un valor de color, incluido un valor de transparencia (sin el cual la matriz neural sería completamente opaca o completamente vacía).

Al igual que las cuadrículas de vóxeles, y a diferencia de el espacio de coordenadas 3D basado en CGI, el ‘interior’ de un objeto ‘cerrado’ no tiene existencia en una matriz NeRF. Puedes abrir un kit de batería CGI y mirar dentro, si lo deseas; pero en lo que respecta a NeRF, la existencia del kit de batería termina cuando el valor de opacidad de su superficie es ‘1’.

Una Vista Más Amplia de un Píxel

Mip-NeRF 360 es una extensión de la investigación de marzo de 2021, que introdujo de manera efectiva anti-aliasing eficiente a NeRF sin un muestreo excesivo.

NeRF tradicionalmente calcula solo una trayectoria de píxel, lo que tiende a producir el tipo de ‘jaggies’ que caracterizaba los formatos de imagen de los primeros internet, así como los sistemas de videojuegos anteriores. Estos bordes dentados se resolvieron mediante varios métodos, generalmente involucrando el muestreo de píxeles adyacentes y la obtención de una representación promedio.

Debido a que el NeRF tradicional solo muestrea esa única trayectoria de píxel, Mip-NeRF introdujo un área de captura ‘cónica’, como una linterna de haz amplio, que brinda suficiente información sobre los píxeles adyacentes para producir anti-aliasing económico con mayor detalle.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

La zona de captura cónica que usa Mip-NeRF se divide en troncos cónicos (imagen inferior), que se ‘desdibujan’ más para crear espacios gaussianos más vagos que pueden usarse para calcular la precisión y aliasing de un píxel. Fuente: https://www.youtube.com/watch?v=EpH175PY1A0

La mejora sobre una implementación estándar de NeRF fue notable:

Mip-NeRF (right), released in marzo de 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (derecha), lanzado en marzo de 2021, ofrece mayor detalle mediante una canalización de aliasing más completa pero económica, en lugar de simplemente ‘desdibujar’ los píxeles para evitar bordes dentados. Fuente: https://jonbarron.info/mipnerf/

NeRF Ilimitado

El artículo de marzo dejó tres problemas sin resolver respecto al uso de Mip-NeRF en entornos ilimitados que podrían incluir objetos muy distantes, como los cielos. El nuevo artículo resuelve esto aplicando una deformación de estilo Kalman a los gaussianos de Mip-NeRF.

En segundo lugar, las escenas más grandes requieren mayor potencia de procesamiento y tiempos de entrenamiento prolongados, lo que Mip-NeRF 360 resuelve ‘destilando’ la geometría de la escena con un pequeño ‘propuesta’ perceptrón multicapa (MLP), que predelimita la geometría predicha por un gran MLP estándar de NeRF. Esto acelera el entrenamiento en un factor de tres.

Finalmente, las escenas más grandes tienden a hacer que la discretización de la geometría interpretada sea ambigua, lo que genera el tipo de artefactos que los jugadores pueden conocer cuando la salida del juego se ‘desgarra’. El nuevo artículo aborda esto creando un nuevo regularizador para los intervalos de rayos de Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

A la derecha, vemos artefactos no deseados en Mip-NeRF debido a la dificultad de delimitar una escena tan grande. A la izquierda, vemos que el nuevo regularizador ha optimizado la escena lo suficiente como para eliminar estas perturbaciones.

Para obtener más información sobre el nuevo artículo, consulte el video a continuación, y también la introducción en video de marzo de 2021 a Mip-NeRF. También puede obtener más información sobre la investigación de NeRF revisando nuestra cobertura hasta ahora.

Publicado originalmente el 25 de noviembre de 2021
21 de diciembre de 2021, 12:25 p.m. – Video reemplazado. – MA

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai