Ángulo de Anderson

Hacia humanos de tiempo real con Neural Lumigraph Rendering

mm
Añade Unite.AI a tus fuentes preferidas en Google
Neural Lumigraph Rendering

A pesar de la actual ola de interés en Neural Radiance Fields (NeRF), una tecnología capaz de crear entornos y objetos 3D generados por IA, este nuevo enfoque de la tecnología de síntesis de imágenes todavía requiere una gran cantidad de tiempo de entrenamiento y carece de una implementación que permita interfaces de respuesta en tiempo real.

Sin embargo, una colaboración entre algunos nombres impresionantes en la industria y la academia ofrece un nuevo enfoque de este desafío (genéricamente conocido como Síntesis de Nuevas Vistas, o NVS).

El artículo de investigación, titulado Neural Lumigraph Rendering, afirma una mejora en el estado actual de aproximadamente dos órdenes de magnitud, lo que representa varios pasos hacia la renderización de CG en tiempo real a través de pipelines de aprendizaje automático.

Neural Lumigraph Rendering (derecha) ofrece una mejor resolución de artefactos de mezcla y una mejor manipulación de occlusión que los métodos anteriores. Fuente: https://www.youtube.com/watch?v=maVF-7x9644

Neural Lumigraph Rendering (derecha) ofrece una mejor resolución de artefactos de mezcla y una mejor manipulación de occlusión que los métodos anteriores. Fuente.

Aunque los créditos del artículo solo citan a la Universidad de Stanford y a la empresa de tecnología de displays holográficos Raxium (actualmente operando en modo sigiloso), los contribuyentes incluyen a un arquitecto principal de aprendizaje automático en Google, un científico informático en Adobe y al director técnico de StoryFile (que hizo titulares recientemente con una versión de IA de William Shatner).

En cuanto a la reciente publicidad de Shatner, StoryFile parece estar empleando NLR en su nuevo proceso para la creación de entidades interactivas generadas por IA basadas en las características y narrativas de personas individuales.

StoryFile prevé el uso de esta tecnología en displays de museos, narrativas interactivas en línea, displays holográficos, realidad aumentada (AR) y documentación de patrimonio – y también parece estar explorando posibles nuevas aplicaciones de NLR en entrevistas de contratación y aplicaciones de citas virtuales:

Usos propuestos desde un video en línea de StoryFile. Fuente: https://www.youtube.com/watch?v=2K9J6q5DqRc

Usos propuestos desde un video en línea de StoryFile. Fuente: https://www.youtube.com/watch?v=2K9J6q5DqRc

Captura Volumétrica Para Interfaces De Síntesis De Nuevas Vistas Y Video

El principio de la captura volumétrica, a lo largo de la gama de artículos que se están acumulando sobre el tema, es la idea de tomar imágenes fijas o videos de un sujeto y utilizar el aprendizaje automático para ‘rellenar’ las vistas que no fueron cubiertas por la matriz original de cámaras.

Fuente: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Fuente: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

En la imagen de arriba, tomada de la investigación de IA de Facebook de 2019 (ver abajo), vemos las cuatro etapas de la captura volumétrica: múltiples cámaras obtienen imágenes o tomas; la arquitectura del codificador/decodificador (o otras arquitecturas) calcula y concatena la relatividad de las vistas; los algoritmos de ray-marching calculan los voxels (o otras unidades geométricas espaciales XYZ) de cada punto en el espacio volumétrico; y (en la mayoría de los artículos recientes) se produce un entrenamiento para sintetizar una entidad completa que pueda ser manipulada en tiempo real.

Es esta fase de entrenamiento a menudo extensa y pesada en datos la que, hasta la fecha, ha mantenido la síntesis de nuevas vistas fuera del ámbito de la captura en tiempo real o de respuesta altamente interactiva.

El hecho de que la síntesis de nuevas vistas cree un mapa 3D completo de un espacio volumétrico significa que es relativamente trivial coser estos puntos juntos en una malla de CG tradicional, capturando y articulando efectivamente un humano de CG (o cualquier otro objeto relativamente acotado) sobre la marcha.

Los enfoques que utilizan NeRF dependen de nubes de puntos y mapas de profundidad para generar las interpolaciones entre los puntos de vista dispersos de los dispositivos de captura:

NeRF puede generar profundidad volumétrica a través del cálculo de mapas de profundidad, en lugar de la generación de mallas de CG. Fuente: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF puede generar profundidad volumétrica a través del cálculo de mapas de profundidad, en lugar de la generación de mallas de CG. Fuente: https://www.youtube.com/watch?v=JuH79E8rdKc

Aunque NeRF es capaz de calcular mallas, la mayoría de las implementaciones no utilizan esto para generar escenas volumétricas.

Por contraste, el enfoque de Renderizado Diferenciable Implícito (IDR), publicado por el Instituto de Ciencia Weizmann en octubre de 2020, se basa en explotar la información de la malla 3D generada automáticamente a partir de las matrices de captura:

Ejemplos de capturas IDR convertidas en mallas de CG interactivas. Fuente: https://www.youtube.com/watch?v=C55y7RhJ1fE

Ejemplos de capturas IDR convertidas en mallas de CG interactivas. Fuente: https://www.youtube.com/watch?v=C55y7RhJ1fE

Mientras que NeRF carece de la capacidad de estimación de forma de IDR, IDR no puede igualar la calidad de imagen de NeRF, y ambos requieren recursos extensos para entrenar y recopilar (aunque las innovaciones recientes en NeRF están comenzando a abordar esto).

Montaje de cámara personalizado de NLR con 16 cámaras GoPro HERO7 y 6 cámaras centrales Back-Bone H7PRO. Para 'renderizado en tiempo real', estas operan a un mínimo de 60 fps. Fuente: https://arxiv.org/pdf/2103.11571.pdf

Montaje de cámara personalizado de NLR con 16 cámaras GoPro HERO7 y 6 cámaras centrales Back-Bone H7PRO. Para ‘renderizado en tiempo real’, estas operan a un mínimo de 60 fps. Fuente: https://arxiv.org/pdf/2103.11571.pdf

En lugar de eso, Neural Lumigraph Rendering utiliza SIREN (Redes de Representación Sinusoidal) para incorporar las fortalezas de cada enfoque en su propio marco, que está diseñado para generar una salida directamente utilizable en pipelines de gráficos en tiempo real existentes.

SIREN se ha utilizado para implementaciones similares durante el último año, y ahora representa una llamada popular a la API para Colabs de síntesis de imágenes en comunidades; sin embargo, la innovación de NLR es aplicar SIRENs a la supervisión de imágenes multivista bidimensionales, lo que es problemático debido a la medida en que SIREN produce una salida sobreajustada en lugar de generalizada.

Después de que se extrae la malla de CG de las imágenes de la matriz, la malla se rasteriza a través de OpenGL, y las posiciones de los vértices de la malla se mapean a los píxeles adecuados, después de lo cual se calcula la mezcla de los mapas contribuyentes.

La malla resultante es más generalizada y representativa que la de NeRF (ver imagen a continuación), requiere menos cálculo y no aplica un detalle excesivo a áreas (como la piel facial suave) que no pueden beneficiarse de ello:

Fuente: https://arxiv.org/pdf/2103.11571.pdf

Fuente: https://arxiv.org/pdf/2103.11571.pdf

Por el lado negativo, NLR todavía no tiene capacidad para iluminación dinámica o reiluminación, y la salida se limita a mapas de sombras y otras consideraciones de iluminación obtenidas en el momento de la captura. Los investigadores pretenden abordar esto en trabajos futuros.

Además, el artículo admite que las formas generadas por NLR no son tan precisas como algunos enfoques alternativos, como Selección de vista por píxel para estereoscopía multivista no estructurada, o la investigación del Instituto Weizmann mencionada anteriormente.

El Auge De La Síntesis De Imágenes Volumétricas

La idea de crear entidades 3D a partir de una serie limitada de fotos con redes neuronales precede a NeRF, con artículos visionarios que se remontan a 2007 o antes. En 2019, el departamento de investigación de IA de Facebook produjo un artículo de investigación seminal, Volúmenes Neuronales: Aprendiendo Volúmenes Renderizables Dinámicos a partir de Imágenes, que primero permitió interfaces de respuesta para humanos sintéticos generados por captura volumétrica basada en aprendizaje automático.

La investigación de 2019 de Facebook permitió la creación de una interfaz de usuario de respuesta para una persona volumétrica. Fuente: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

La investigación de 2019 de Facebook permitió la creación de una interfaz de usuario de respuesta para una persona volumétrica. Fuente: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai