Modelos y plataformas de IA

Imagen de salpicadura: Un intento de reconstrucción 3D ultra-rápida de una sola vista

mm
Añade Unite.AI a tus fuentes preferidas en Google

La reconstrucción de objetos 3D con redes convolucionales ha demostrado capacidades notables. Los modelos de reconstrucción 3D de una sola vista generan el modelo 3D de cualquier objeto utilizando una sola imagen como referencia, lo que lo convierte en uno de los temas de investigación más calientes en visión por computadora.

Por ejemplo, consideremos la motocicleta en la imagen de arriba. Generar su estructura 3D requiere una tubería compleja que primero combina pistas de imágenes de bajo nivel con información semántica de alto nivel y conocimiento sobre la disposición estructural de las partes.

Debido al proceso complejo, la reconstrucción 3D de una sola vista ha sido un desafío importante en visión por computadora. En un intento de mejorar la eficiencia de la reconstrucción 3D de una sola vista, los desarrolladores han trabajado en Imagen de salpicadura, un método que pretende lograr la construcción ultra-rápida de forma 3D y apariencia 3D de los objetos. En su núcleo, el marco de trabajo de Imagen de salpicadura utiliza el método de salpicadura gaussiana para analizar representaciones 3D, aprovechando la velocidad y la calidad que ofrece.

Recientemente, el método de salpicadura gaussiana ha sido implementado por numerosos modelos de reconstrucción multi-vista para renderizado en tiempo real, escalado mejorado y entrenamiento rápido. Con eso dicho, Imagen de salpicadura es el primer marco de trabajo que implementa el método de salpicadura gaussiana para tareas de reconstrucción de una sola vista.

En este artículo, exploraremos cómo el marco de trabajo de Imagen de salpicadura utiliza la salpicadura gaussiana para lograr la reconstrucción 3D ultra-rápida de una sola vista. Así que comencemos.

Imagen de salpicadura: Un intento de reconstrucción 3D ultra-rápida de una sola vista

Como se mencionó anteriormente, Imagen de salpicadura es un enfoque ultra-rápido para la reconstrucción de objetos 3D de una sola vista basado en el método de salpicadura gaussiana. Imagen de salpicadura es el primer marco de trabajo de visión por computadora en implementar la salpicadura gaussiana para la generación de objetos 3D monocular, ya que tradicionalmente, la salpicadura gaussiana ha estado impulsando los marcos de trabajo de reconstrucción de objetos 3D multi-vista. Sin embargo, lo que separa el marco de trabajo de Imagen de salpicadura de los métodos anteriores es que es un enfoque basado en el aprendizaje, y la reconstrucción en la prueba solo requiere la evaluación hacia adelante de la red neuronal.

Imagen de salpicadura se basa fundamentalmente en las cualidades de renderizado de la salpicadura gaussiana y en la alta velocidad de procesamiento para generar reconstrucciones 3D. El marco de trabajo de Imagen de salpicadura presenta un diseño sencillo: el marco de trabajo utiliza una red neuronal de imagen a imagen 2D para predecir un gaussiano 3D por cada píxel de la imagen de entrada, y asigna la imagen de entrada a un gaussiano 3D por píxel. Los gaussianos 3D resultantes tienen la forma de una imagen, conocida como la Imagen de salpicadura, y también proporcionan una representación de 360 grados de la imagen. El proceso se demuestra en la siguiente imagen.

Aunque el proceso es simple y directo, hay algunos desafíos clave que enfrenta el marco de trabajo de Imagen de salpicadura al utilizar la salpicadura gaussiana para generar gaussianos 3D para representaciones 3D de una sola vista. El primer obstáculo importante es diseñar una red neuronal que acepte la imagen de un objeto como entrada y genere una mezcla de gaussianos que represente todos los lados de la imagen como salida. Para abordar esto, Imagen de salpicadura se aprovecha del hecho de que, aunque la mezcla de gaussianos generada es un conjunto o una colección no ordenada de elementos, aún puede almacenarse en una estructura de datos ordenada. En consecuencia, el marco de trabajo utiliza una imagen 2D como contenedor para los gaussianos 3D como resultado de lo cual cada píxel en el contenedor contiene los parámetros de un gaussiano, incluyendo sus propiedades como forma, opacidad y color.

Al almacenar conjuntos de gaussianos 3D en una imagen, el marco de trabajo de Imagen de salpicadura es capaz de reducir los obstáculos de reconstrucción que se enfrentan al aprender una red neuronal de imagen a imagen. Al utilizar este enfoque, el proceso de reconstrucción se puede implementar solo utilizando operadores 2D eficientes en lugar de confiar en operadores 3D. Además, en el marco de trabajo de Imagen de salpicadura, la representación 3D es una mezcla de gaussianos 3D que le permite explotar las ventajas de velocidad de renderizado y eficiencia de memoria ofrecidas por la salpicadura gaussiana que mejora la eficiencia en el entrenamiento y la inferencia. Continuando, el marco de trabajo de Imagen de salpicadura no solo genera representaciones 3D de una sola vista, sino que también demuestra una notable eficiencia ya que puede ser entrenado incluso en una sola GPU en benchmarks de objetos 3D estándar. Además, el marco de trabajo de Imagen de salpicadura se puede extender para aceptar varias imágenes como entrada. Puede lograrlo registrando las mezclas de gaussianos individuales en una referencia común y luego combinando las mezclas de gaussianos predichas de las vistas individuales. El marco de trabajo también inyecta capas de atención cruzada ligeras en su arquitectura que permiten que las diferentes vistas se comuniquen entre sí durante la predicción.

Desde una perspectiva empírica, es digno de destacar que el marco de trabajo de Imagen de salpicadura puede producir una reconstrucción de 360 grados del objeto incluso aunque solo vea un lado del objeto. El marco de trabajo asigna entonces diferentes gaussianos en un vecindario 2D a diferentes partes del objeto 3D para codificar la información de 360 grados generada en la imagen 2D. Además, el marco de trabajo establece la opacidad de varios gaussianos en cero, lo que los desactiva, lo que permite que se eliminen durante el pos-procesamiento.

Para resumir, el marco de trabajo de Imagen de salpicadura es

  1. Un enfoque novedoso para generar reconstrucciones de objetos 3D de una sola vista al trasladar el enfoque de salpicadura gaussiana.
  2. Extiende el método para la reconstrucción de objetos 3D multi-vista.
  3. Logra un rendimiento de reconstrucción de objetos 3D estatal en benchmarks estándar con una velocidad y calidad excepcionales.

Imagen de salpicadura: Metodología y arquitectura

Salpicadura gaussiana

Como se mencionó anteriormente, la salpicadura gaussiana es el método principal implementado por el marco de trabajo de Imagen de salpicadura para generar reconstrucciones de objetos 3D de una sola vista. En términos simples, la salpicadura gaussiana es un método de rasterización para reconstruir imágenes 3D y renderizar imágenes en tiempo real con múltiples puntos de vista. El espacio 3D en la imagen se refiere a gaussianos, y se implementan técnicas de aprendizaje automático para aprender los parámetros de cada gaussiano. La salpicadura gaussiana no requiere entrenamiento durante el renderizado, lo que facilita tiempos de renderizado más rápidos. La siguiente imagen resume la arquitectura de la salpicadura gaussiana 3D.

La salpicadura gaussiana 3D primero utiliza el conjunto de imágenes de entrada para generar una nube de puntos. La salpicadura gaussiana luego utiliza las imágenes de entrada para estimar los parámetros externos de la cámara, como la inclinación y la posición, al coincidir los píxeles entre las imágenes, y estos parámetros se utilizan para calcular la nube de puntos. Utilizando diferentes métodos de aprendizaje automático, la salpicadura gaussiana luego optimiza cuatro parámetros para cada gaussiano, a saber: posición (dónde se encuentra), covarianza (la extensión de su estiramiento o escalado en una matriz 3×3), color (qué es el esquema de color RGB) y alfa (que mide la transparencia). El proceso de optimización renderiza la imagen para cada posición de la cámara y la utiliza para determinar los parámetros más cercanos a la imagen original. Como resultado, la salida de la salpicadura gaussiana 3D resultante es una imagen, llamada la Imagen de salpicadura, que se asemeja a la imagen original en la posición de la cámara desde la que se capturó.

Además, la función de opacidad y la función de color en la salpicadura gaussiana proporcionan un campo de radiación con la dirección de vista del punto 3D. El marco de trabajo luego renderiza el campo de radiación en una imagen integrando los colores observados a lo largo del rayo que pasa por el píxel. La salpicadura gaussiana representa estas funciones como una combinación de gaussianos coloreados, donde la media del gaussiano o el centro, junto con la covarianza del gaussiano, ayuda a determinar su forma y tamaño. Cada gaussiano también tiene una propiedad de opacidad y una propiedad de color dependiente de la vista que, en conjunto, definen el campo de radiación. La salpicadura gaussiana representa estas funciones como una combinación de gaussianos coloreados, donde la media del gaussiano o el centro, junto con la covarianza del gaussiano, ayuda a determinar su forma y tamaño.

Imagen de salpicadura

El componente del renderizador asigna el conjunto de gaussianos 3D a una imagen. Para realizar la reconstrucción 3D de una sola vista, el marco de trabajo busca una función inversa para los gaussianos 3D que reconstruya la mezcla de gaussianos 3D a partir de una imagen. La inclusión clave aquí es proponer un diseño efectivo y simple para la función inversa. En particular, para una imagen de entrada, el marco de trabajo predice un gaussiano para cada píxel individual utilizando una arquitectura de red neuronal de imagen a imagen para producir una imagen, la Imagen de salpicadura. La red neuronal también predice la forma, la opacidad y el color.

Ahora, podría especularse cómo puede el marco de trabajo de Imagen de salpicadura reconstruir la representación 3D de un objeto incluso aunque solo tenga acceso a una de sus vistas. En tiempo real, el marco de trabajo de Imagen de salpicadura aprende a utilizar algunos de los gaussianos disponibles para reconstruir la vista y utiliza los gaussianos restantes para reconstruir automáticamente las partes no vistas de la imagen. Para maximizar su eficiencia, el marco de trabajo puede desactivar automáticamente cualquier gaussiano al predecir si la opacidad es cero. Si la opacidad es cero, los gaussianos se desactivan y el marco de trabajo no renderiza estos puntos y, en cambio, se eliminan en el pos-procesamiento.

Pérdida a nivel de imagen

Una ventaja importante de explotar la velocidad y la eficiencia ofrecidas por el método de salpicadura gaussiana es que permite que el marco de trabajo renderice todas las imágenes en cada iteración, incluso para lotes con un tamaño de lote relativamente grande. Además, implica que no solo el marco de trabajo puede utilizar pérdidas descomponibles, sino que también puede utilizar pérdidas a nivel de imagen que no se descomponen en pérdidas por píxel.

Normalización de escala

Es un desafío estimar el tamaño de un objeto al mirar una sola vista, y es una tarea desafiante resolver esta ambigüedad cuando se entrena con una pérdida. El mismo problema no se observa en conjuntos de datos sintéticos, ya que todos los objetos se representan con intrínsecas de cámara idénticas y los objetos están a una distancia fija de la cámara, lo que en última instancia ayuda a resolver la ambigüedad. Sin embargo, en conjuntos de datos con imágenes de la vida real, la ambigüedad es bastante evidente, y el marco de trabajo de Imagen de salpicadura emplea varios métodos de pre-procesamiento para fijar aproximadamente la escala de todos los objetos.

Color dependiente de la vista

Para representar colores dependientes de la vista, el marco de trabajo de Imagen de salpicadura utiliza armónicos esféricos para generalizar los colores más allá del modelo de color lambertiano. Para cualquier gaussiano específico, el modelo define coeficientes que son predichos por la red neuronal y los armónicos esféricos. El cambio de vista transforma una dirección de vista en la fuente de la cámara en su dirección de vista correspondiente en el marco de referencia. El modelo luego encuentra los coeficientes correspondientes para encontrar la función de color transformada. El modelo puede hacerlo porque, bajo rotación, los armónicos esféricos están cerrados, junto con todos los demás órdenes.

Arquitectura de red neuronal

La mayoría de la arquitectura del mapeo del predictor que asigna la imagen de entrada a la combinación de gaussianos es idéntica al proceso utilizado en el marco de trabajo SongUNet. La última capa en la arquitectura se reemplaza por una capa de convolución 1×1 con la anchura del canal de salida determinada por el modelo de color. Dada la imagen de entrada, la red neuronal produce un tensor de canal de salida como salida, y para cada píxel del canal, codifica los parámetros que luego se transforman en desplazamiento, opacidad, rotación, profundidad y color. El marco de trabajo luego utiliza funciones no lineales para activar los parámetros y obtener los parámetros del gaussiano.

Para reconstruir representaciones 3D con multi-vista, el marco de trabajo de Imagen de salpicadura aplica la misma red neuronal a cada vista de entrada y luego utiliza el enfoque de la vista para combinar las reconstrucciones individuales. Además, para facilitar la coordinación y el intercambio de información eficientes entre las vistas en la red neuronal, el marco de trabajo de Imagen de salpicadura realiza dos modificaciones en la red neuronal. Primero, el marco de trabajo condiciona el modelo con su pose de cámara respectiva y pasa vectores codificando cada entrada utilizando una codificación de posición sinusoidal que resulta en varias dimensiones. Segundo, el marco de trabajo agrega capas de atención cruzada para facilitar la comunicación entre las características de las diferentes vistas.

Imagen de salpicadura: Experimentos y resultados

El marco de trabajo de Imagen de salpicadura mide la calidad de sus reconstrucciones evaluando la calidad de la síntesis de vista nueva, ya que el marco de trabajo utiliza la vista de origen y renderiza la forma 3D para vistas no vistas para realizar reconstrucciones. El marco de trabajo evalúa su rendimiento midiendo las puntuaciones SSIM o Similitud Estructural, PSNR o Relación de Señal a Ruido de Pico y Calidad Perceptual o puntuaciones LPIPS.

Rendimiento de reconstrucción 3D de una sola vista

La siguiente tabla demuestra el rendimiento del modelo de Imagen de salpicadura en la tarea de reconstrucción 3D de una sola vista en el benchmark ShapeNet.

Como se puede observar, el marco de trabajo de Imagen de salpicadura supera a todos los métodos de reconstrucción determinista en las puntuaciones LPIPS y SSIM. Las puntuaciones indican que el modelo de Imagen de salpicadura genera imágenes con reconstrucciones más nítidas. Además, el modelo de Imagen de salpicadura también supera a todos los métodos de reconstrucción determinista en términos de la puntuación PSNR, lo que indica que las reconstrucciones generadas también son más precisas. Además, además de superar a todos los métodos deterministas, el marco de trabajo de Imagen de salpicadura solo requiere las posiciones de cámara relativas para mejorar su eficiencia en ambas fases de entrenamiento y prueba.

La siguiente imagen demuestra la destreza cualitativa del marco de trabajo de Imagen de salpicadura, y como se puede ver, el modelo genera reconstrucciones con geometrías delgadas e interesantes y captura los detalles de las vistas de acondicionamiento.

La siguiente imagen muestra que las reconstrucciones generadas por el marco de trabajo de Imagen de salpicadura no solo son más nítidas, sino que también tienen una mejor precisión que los modelos anteriores, especialmente en condiciones no convencionales con estructuras delgadas y visibilidad limitada.

Reconstrucción 3D multi-vista

Para evaluar sus capacidades de reconstrucción 3D multi-vista, el marco de trabajo de Imagen de salpicadura se entrena en el conjunto de datos SpaneNet-SRN Cars para predicciones de dos vistas. Los métodos existentes utilizan el acondicionamiento de la pose de cámara absoluta para tareas de reconstrucción 3D multi-vista, lo que significa que el modelo aprende a confiar principalmente en la orientación canónica del objeto en el objeto. Aunque hace el trabajo, limita la aplicabilidad de los modelos, ya que la pose de cámara absoluta a menudo es desconocida para una nueva imagen de un objeto.

Pensamientos finales

En este artículo, hemos hablado sobre Imagen de salpicadura, un método que pretende lograr la construcción ultra-rápida de forma 3D y apariencia 3D de los objetos. En su núcleo, el marco de trabajo de Imagen de salpicadura utiliza el método de salpicadura gaussiana para analizar representaciones 3D, aprovechando la velocidad y la calidad que ofrece. El marco de trabajo de Imagen de salpicadura procesa imágenes utilizando una arquitectura de red neuronal de imagen a imagen 2D estándar para predecir una imagen pseudo que contiene un gaussiano coloreado por cada píxel. Al utilizar el método de salpicadura gaussiana, el marco de trabajo de Imagen de salpicadura es capaz de combinar el renderizado rápido con la inferencia rápida, lo que resulta en un entrenamiento rápido y una evaluación más rápida en benchmarks reales y sintéticos.

Un ingeniero por profesión, un escritor por corazón. Kunal es un escritor técnico con un profundo amor y comprensión de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a través de su documentación atractiva e informativa.