Ángulo de Anderson

¿Pueden los entornos de realidad aumentada de Apple con HDR resolver los reflejos para la representación neural?

mm
Añade Unite.AI a tus fuentes preferidas en Google

La inversión a largo plazo y vigorosa de Apple en tecnologías de realidad aumentada se está acelerando este año, con una nueva serie de herramientas para desarrolladores para capturar y convertir objetos del mundo real en facetas de realidad aumentada, y una creciente convicción en la industria de que se están desarrollando gafas de realidad aumentada dedicadas para respaldar las experiencias inmersivas que esta tormenta de I+D puede permitir.

Entre un conjunto de nueva información sobre los esfuerzos de Apple en realidad aumentada, un nuevo documento del departamento de investigación de visión por computadora de la empresa revela un método para utilizar imágenes panorámicas de 360 grados con alta gama dinámica (HDR) para proporcionar reflejos y iluminación específicos de la escena para objetos que se superponen en escenas de realidad aumentada.

Titulado Estimación de mapas de entorno HDR para realidad aumentada en tiempo real, el documento, de los ingenieros de investigación de visión por computadora de Apple, Gowri Somanath y Daniel Kurz, propone la creación dinámica de entornos HDR en tiempo real a través de una red neuronal convolucional (CNN) que se ejecuta en un entorno de procesamiento móvil. El resultado es que los objetos reflectantes pueden literalmente reflejar nuevos y no vistos entornos a demanda:

En el nuevo flujo de trabajo de generación de objetos de AR de Apple, una olla a presión se instancia mediante fotogrametría completa con su entorno ambiental, lo que lleva a reflejos convincentes que no están 'cocidos' en la textura. Fuente: https://docs-assets.developer.apple.com/

En el nuevo flujo de trabajo de generación de objetos de AR de Apple, una olla a presión se instancia mediante fotogrametría completa con su entorno ambiental, lo que lleva a reflejos convincentes que no están ‘cocidos’ en la textura. Fuente: https://docs-assets.developer.apple.com/

El método, presentado en CVPR 2021, toma una instantánea de toda la escena y utiliza la EnvMapNet CNN para estimar una imagen panorámica HDR visualmente completa, también conocida como ‘sonda de luz’.

El mapa resultante identifica fuentes de luz fuertes (bordeadas al final en la animación anterior) y las tiene en cuenta al renderizar los objetos virtuales.

La arquitectura de EnvMapNet, que procesa imágenes limitadas en sondas de luz HDR de escena completa. Fuente: https://arxiv.org/pdf/2011.10687.pdf

La arquitectura de EnvMapNet, que procesa imágenes limitadas en sondas de luz HDR de escena completa. Fuente: https://arxiv.org/pdf/2011.10687.pdf

El algoritmo puede ejecutarse en menos de 9 ms en un iPhone XS y es capaz de renderizar objetos con reflejos en tiempo real, con un error direccional reducido en un 50% en comparación con enfoques anteriores y diferentes para el problema.

Sondas de luz

Los entornos de iluminación HDR han sido un factor en los efectos visuales desde que las imágenes de alta gama dinámica (inventadas en 1986) se convirtieron en una fuerza notable a través de avances en la tecnología informática en la década de 1990. Cualquiera que haya visto detrás de las escenas puede haber notado la presencia surrealista de técnicos sosteniendo bolas de espejo en palos – imágenes de referencia para incorporarse como factores ambientales al reconstruir elementos de CGI para la escena.

Fuente: https://beforesandafters.com/

Fuente: https://beforesandafters.com/

Sin embargo, el uso de bolas de cromo para mapeo de reflejos de texturas se remonta a la década de 1980, específicamente al documento de SIGGRAPH de 1983 Parámetros piramidales, que presentaba imágenes fijas de un robot de CGI reflectante en un estilo que se haría famoso casi una década después a través de los efectos de ‘metal líquido’ de Terminator 2: El juicio final de James Cameron.

Entornos HDR en representación neural

La representación neural ofrece la posibilidad de generar video fotorealista a partir de una entrada muy escasa, incluyendo mapas de segmentación burdos.

Intel ISL, renderizado neural de segmentación a imagen (2017). Fuente: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

Intel ISL, renderizado neural de segmentación a imagen (2017). Fuente: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

En mayo, los investigadores de Intel revelaron una nueva iniciativa en síntesis de imágenes neuronales donde se utilizó footage de Grand Theft Auto V para generar salida fotorealista basada en conjuntos de datos de imágenes de calles alemanas.

Fuente: https://www.youtube.com/watch?v=0fhUJT21-bs

Fuente: https://www.youtube.com/watch?v=0fhUJT21-bs

El desafío en el desarrollo de entornos de representación neural que puedan adaptarse a diversas condiciones de iluminación es separar el contenido del objeto de los factores ambientales que lo afectan.

Como está, los reflejos y los efectos anisotrópicos siguen siendo funciones del conjunto de datos original de footage (lo que los hace inflexibles), o requieren el mismo tipo de esquema que los investigadores de Intel emplearon, que genera salida semifotorealista a partir de un motor de juego (crudo) y aplica transferencia de estilo desde un conjunto de datos ‘cocido’ (como el conjunto de datos de vistas de calles de Mapillary utilizado en la investigación reciente).

En este renderizado neural (el footage de GTA V está a la izquierda), el vehículo delantero demuestra reflejos convincentes y hasta satura el sensor de la cámara virtual ficticia con reflejos del sol. Pero este aspecto de iluminación se deriva del motor de iluminación del footage de juego original, ya que los facetes neuronales en la escena no tienen estructuras de iluminación autónomas y autorreferenciales que puedan cambiarse.

En este renderizado neural derivado del footage de GTA V (izquierda), el vehículo delantero demuestra reflejos convincentes y hasta satura el sensor de la cámara virtual ficticia con reflejos del sol. Pero este aspecto de iluminación se deriva del motor de iluminación del footage de juego original, ya que los facetes neuronales en la escena no tienen estructuras de iluminación autónomas y autorreferenciales que puedan cambiarse.

Reflejos en NeRF

La imagen derivada de Campos de Radiación Neuronal (NeRF) también se enfrenta a desafíos similares. Aunque la investigación reciente sobre NeRF ha hecho avances en la separación de los elementos que componen una escena neural (por ejemplo, la colaboración entre MIT y Google en NeRFactor), los reflejos han seguido siendo un obstáculo.

El enfoque de NeRFactor de MIT y Google separa normales, visibilidad (sombras), textura y albedo local, pero no refleja un entorno, porque existe en el vacío. Fuente: https://arxiv.org/pdf/2106.01970.pdf

El enfoque de NeRFactor de MIT y Google separa normales, visibilidad (sombras), textura y albedo local, pero no refleja un entorno más amplio (o en movimiento), porque existe en el vacío. Fuente: https://arxiv.org/pdf/2106.01970.pdf

NeRF puede resolver este problema con el mismo tipo de mapeo HDR que Apple está utilizando. Cada píxel en un campo de radiación neural se calcula en una trayectoria desde una cámara virtual hasta el punto donde el ‘rayo’ puede viajar más lejos, similar al trazado de rayos en CGI tradicional. Agregar entrada HDR al cálculo de ese rayo es un método potencial para lograr reflejos ambientales genuinos, y es en efecto un análogo a los métodos de iluminación global o renderizado de radiación en CGI, donde una escena o objeto se ilumina parcialmente mediante reflejos percibidos de su propio entorno.

Aunque está garantizado que una matriz HDR no hará nada para aliviar las cargas computacionales notables de NeRF, una gran cantidad de investigación en este campo en este momento se centra en abordar este aspecto de la canalización de procesamiento. Inevitablemente, los reflejos son uno de los muchos factores que esperan en las alas para rellenar y desafiar esa arquitectura recién optimizada. Sin embargo, NeRF no puede alcanzar su máximo potencial como una metodología de síntesis de imagen y video neural discreta sin adoptar una forma de tener en cuenta un entorno circundante.

Reflejos en canalizaciones de representación neural

En una versión putativa de la escena de renderizado neural de Intel con HDR, una sola HDR no podría acomodar los reflejos dinámicos que necesitan expresarse en objetos en movimiento. Por ejemplo, para ver el propio vehículo reflejado en el vehículo delantero mientras se acerca a los semáforos, el vehículo delantero podría tener su propia sonda de luz HDR animada, cuya resolución se degradaría incrementalmente a medida que se aleja del punto de vista del usuario, para convertirse en baja resolución y meramente representativa a medida que se aleja en la distancia – un LOD basado en proximidad similar a los delimitadores de ‘distancia de dibujo’ en videojuegos.

El verdadero potencial del trabajo de Apple en iluminación HDR y mapas de reflejos no radica en que sea particularmente innovador, ya que se basa en trabajos anteriores en síntesis de imágenes generales y en desarrollo de escenas de AR. Más bien, el posible avance se representa en la forma en que las restricciones de cálculo locales severas se han combinado con las innovaciones de hardware de aprendizaje automático de la serie M de Apple para producir mapeo HDR ligero y de baja latencia diseñado para operar bajo recursos restringidos.

Si este problema se puede resolver económicamente, el advenimiento de la síntesis de video fotorealista a través de segmentación semántica puede acercarse significativamente.

Fuente: https://docs-assets.developer.apple.com/

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]