Ángulo de Anderson

Renderizado Neural: ¿Cuán Bajo Puedes Ir En Términos De Entrada?

mm
Añade Unite.AI a tus fuentes preferidas en Google

Ayer, un trabajo extraordinario y nuevo en síntesis de imágenes neuronales captó la atención y la imaginación de internet, ya que los investigadores de Intel revelaron un nuevo método para mejorar la realismo de las imágenes sintéticas.

El sistema, como se demuestra en un video de Intel, interviene directamente en la canalización de imágenes para el juego de video Grand Theft Auto V, y mejora automáticamente las imágenes a través de un algoritmo de síntesis de imágenes entrenado en una red neuronal convolucional (CNN), utilizando imágenes del mundo real de la base de datos Mapillary, y reemplazando la iluminación y texturización menos realistas del motor del juego GTA.

Los comentaristas, en una amplia gama de reacciones en comunidades como Reddit y Hacker News, están planteando no solo que el renderizado neural de este tipo podría reemplazar efectivamente la salida menos fotorealista de los motores de juego tradicionales y el CGI de nivel VFX, sino que este proceso podría lograrse con una entrada mucho más básica de lo que se demostró en la demostración de GTA5 de Intel – creando efectivamente ‘proxies’ de entrada con salidas muy realistas.

Conjuntos De Datos Emparejados

El principio ha sido ejemplificado por una nueva generación de sistemas GAN y codificador/decodificador en los últimos tres años, como GauGAN de NVIDIA, que genera imágenes escénicas fotorealistas a partir de bocetos burdos.

En esencia, este principio invierte el uso convencional de la segmentación semántica en visión por computadora de un método pasivo que permite a los sistemas de máquina identificar y aislar objetos observados en una entrada creativa, donde el usuario ‘pinta’ una mapa de segmentación semántica falsa y el sistema genera imágenes coherentes con las relaciones que entiende de haber clasificado y segmentado previamente un dominio específico, como un paisaje.

Un marco de aprendizaje automático aplica segmentación semántica a varias escenas exteriores, proporcionando el paradigma arquitectónico que permite el desarrollo de sistemas interactivos, donde el usuario pinta un bloque de segmentación semántica y el sistema rellena el bloque con imágenes apropiadas de un conjunto de datos específico del dominio, como el conjunto de vistas de la calle de Mapillary de Alemania, utilizado en la demostración de renderizado neural de GTA5 de Intel. Fuente: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Un marco de aprendizaje automático aplica segmentación semántica a varias escenas exteriores, proporcionando el paradigma arquitectónico que permite el desarrollo de sistemas interactivos, donde el usuario pinta un bloque de segmentación semántica y el sistema rellena el bloque con imágenes apropiadas de un conjunto de datos específico del dominio, como el conjunto de vistas de la calle de Mapillary de Alemania, utilizado en la demostración de renderizado neural de GTA5 de Intel. Fuente: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf

Los sistemas de síntesis de imágenes de conjuntos de datos emparejados funcionan correlacionando etiquetas semánticas en dos conjuntos de datos: un conjunto de imágenes rico y completo, generado a partir de imágenes del mundo real (como el conjunto Mapillary utilizado para mejorar GTA5 en la demostración de Intel de ayer) o de imágenes sintéticas, como imágenes CGI.

Ejemplos de conjuntos de datos emparejados para un sistema de síntesis de imágenes diseñado para crear personajes renderizados neuralmente a partir de bocetos torpes. A la izquierda, muestras del conjunto de datos CGI. En el medio, muestras correspondientes del conjunto de datos 'boceto'. A la derecha, renderizados neuronales que han traducido bocetos de regreso a imágenes de alta calidad. Fuente: https://www.youtube.com/watch?v=miLIwQ7yPkA

Ejemplos de conjuntos de datos emparejados para un sistema de síntesis de imágenes diseñado para crear personajes renderizados neuralmente a partir de bocetos torpes. A la izquierda, muestras del conjunto de datos CGI. En el medio, muestras correspondientes del conjunto de datos ‘boceto’. A la derecha, renderizados neuronales que han traducido bocetos de regreso a imágenes de alta calidad. Fuente: https://www.youtube.com/watch?v=miLIwQ7yPkA

Los entornos exteriores son relativamente fáciles de crear cuando se tratan de transformaciones de conjuntos de datos emparejados de este tipo, porque las protuberancias suelen ser bastante limitadas, la topografía tiene un rango de variación limitado que puede ser capturado de manera integral en un conjunto de datos, y no tenemos que lidiar con la creación de personas artificiales o negociar el Valle Inquietante (aún).

Invertir Mapas De Segmentación

Google ha desarrollado una versión animada del esquema GauGAN, llamada Infinite Nature, capaz de ‘hallucinar’ deliberadamente paisajes ficticios continuos y sin fin, traduciendo mapas semánticos falsos en imágenes fotorealistas a través del sistema de relleno SPADE de NVIDIA:

Fuente: https://www.youtube.com/watch?v=oXUf6anNAtc

Fuente: https://www.youtube.com/watch?v=oXUf6anNAtc

Sin embargo, Infinite Nature utiliza una sola imagen como punto de partida y utiliza SPADE solo para pintar las secciones que faltan en los fotogramas sucesivos, mientras que SPADE en sí crea transformaciones de imágenes directamente a partir de mapas de segmentación.

Fuente: https://nvlabs.github.io/SPADE/

Fuente: https://nvlabs.github.io/SPADE/

Es esta capacidad la que parece haber despertado la admiración de los admiradores del sistema de mejora de imagen de Intel – la posibilidad de derivar imágenes fotorealistas de muy alta calidad, incluso en tiempo real (eventualmente), a partir de entradas muy crudas.

Reemplazar Texturas Y Iluminación Con Renderizado Neural

En el caso de la entrada de GTA5, algunos se han preguntado si alguna de las texturas y la iluminación procedurales y de mapa de bits del motor del juego serán realmente necesarias en los sistemas de renderizado neural del futuro, o si podría ser posible transformar la entrada de bajo nivel en video fotorealista que supere las capacidades de sombreado, texturización y iluminación de los motores de juego, creando escenas hiperrealistas a partir de ‘proxies’ de entrada.

Parece obvio que los aspectos generados por el juego como reflejos, texturas y otros tipos de detalles ambientales son fuentes esenciales de información para un sistema de renderizado neural del tipo demostrado por Intel. Sin embargo, ha pasado algún tiempo desde que la red UNIT (UNsupervised Image-to-image Translation Networks) de NVIDIA demostró que solo el dominio es importante, y que incluso aspectos como ‘día o noche’ son esencialmente cuestiones que deben manejarse mediante transferencia de estilo:

En términos de entrada requerida, esto podría dejar al motor del juego solo necesitando generar geometría base y simulaciones de física, ya que el motor de renderizado neural puede pintar todos los demás aspectos al sintetizar la imagen deseada a partir del conjunto de datos capturado, utilizando mapas semánticos como una capa de interpretación.

El sistema de Intel mejora un fotograma completamente terminado y renderizado de GTA5, agregando segmentación y mapas de profundidad evaluados — dos aspectos que podrían potencialmente ser suministrados directamente por un motor de juego simplificado. Fuente: https://www.youtube.com/watch?v=P1IcaBn3ej0

El sistema de Intel mejora un fotograma completamente terminado y renderizado de GTA5, agregando segmentación y mapas de profundidad evaluados — dos aspectos que podrían potencialmente ser suministrados directamente por un motor de juego simplificado. Fuente: https://www.youtube.com/watch?v=P1IcaBn3ej0

El enfoque de renderizado neural de Intel implica el análisis de fotogramas completamente renderizados de los búferes de GTA5, y el sistema neural tiene la carga adicional de crear tanto los mapas de profundidad como los mapas de segmentación. Dado que los mapas de profundidad están implícitamente disponibles en las canalizaciones 3D tradicionales (y son menos exigentes para generar que la texturización, el trazado de rayos o la iluminación global), podría ser un mejor uso de los recursos dejar que el motor del juego maneje estos aspectos.

Entrada Simplificada Para Un Motor De Renderizado Neural

La implementación actual de la red de mejora de imagen de Intel, por lo tanto, puede involucrar muchos ciclos de computación redundantes, ya que el motor del juego genera texturas y luces computacionalmente costosas que el motor de renderizado neural no necesita realmente. El sistema parece haber sido diseñado de esta manera no porque este sea necesariamente un enfoque óptimo, sino porque es más fácil adaptar un motor de renderizado neural a una canalización existente que crear un nuevo motor de juego que esté optimizado para un enfoque de renderizado neural.

El uso más económico de los recursos en un sistema de juego de este tipo podría ser la copia total de la GPU por el sistema de renderizado neural, con la entrada de proxy simplificada manejada por la CPU.

Además, el motor del juego podría producir fácilmente mapas de segmentación representativos, apagando todo sombreado y iluminación en su salida. Además, podría suministrar video a una resolución mucho más baja de lo que normalmente se requiere de él, ya que el video solo necesitaría ser ampliamente representativo del contenido, con detalles de alta resolución manejados por el motor neural, lo que liberaría aún más los recursos de cómputo locales.

Trabajo Previo De Intel ISL Con Segmentación>Imagen

La traducción directa de segmentación a video fotorealista está lejos de ser hipotética. En 2017, Intel ISL, los creadores del revuelo de ayer, lanzaron una investigación inicial capaz de realizar síntesis de video urbano directamente a partir de segmentación semántica.

Intel ISL - segmentación a imagen

Trabajo de segmentación a imagen de Intel ISL de 2017. Fuente: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

En efecto, esa canalización original de 2017 se ha extendido simplemente para adaptarse a la salida completamente renderizada de GTA5.

Renderizado Neural En VFX

El renderizado neural a partir de mapas de segmentación artificiales también parece ser una tecnología prometedora para VFX, con la posibilidad de traducir directamente videogramas muy básicos en metraje de efectos visuales terminado, generando conjuntos de datos específicos del dominio tomados de modelos o imágenes sintéticas (CGI).

Un sistema de renderizado neural hipotético, donde la cobertura extensa de cada objeto objetivo se abstrae en un conjunto de datos contribuyente, y donde los mapas de segmentación generados artificialmente se utilizan como base para la salida fotorealista de alta resolución. Fuente: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

Un sistema de renderizado neural hipotético, donde la cobertura extensa de cada objeto objetivo se abstrae en un conjunto de datos contribuyente, y donde los mapas de segmentación generados artificialmente se utilizan como base para la salida fotorealista de alta resolución. Fuente: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

El desarrollo y la adopción de tales sistemas cambiarían el foco del esfuerzo artístico de un flujo de trabajo interpretativo a uno representativo, y elevarían la recopilación de datos impulsada por el dominio de un papel de apoyo a uno central en las artes visuales.

Artículo actualizado a las 4:55 pm para agregar material sobre la investigación de Intel ISL de 2017.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]