Modelos y plataformas de IA

Partes Neuronales: Descomponiendo Primitivas para Geometría Inferida con Significado

mm
Añade Unite.AI a tus fuentes preferidas en Google

Mientras que los sistemas capaces de generar geometría 3D a partir de imágenes estáticas individuales han proliferado en los últimos años, los objetos que obtienen tienden a estar “fusionados” juntos, sin un esquema semántico real que refleje cómo las partes contribuyen al todo.

Hay varias buenas razones para generar modelos inferidos jerárquicos con una división significativa de partes, incluyendo el análisis industrial, la investigación médica y las aplicaciones de imagen, la generación automática de geometría para videojuegos, simuladores y entornos de realidad virtual y aumentada, y el rigging de efectos visuales, entre otros.

Muchos métodos desarrollados en los últimos años, como el análisis de formas Superquadrics, producen resultados menos que satisfactorios y han luchado por avanzar en el estado del arte más allá del corte indicativo de estilo cuboide.

Segmentación por Superquadrics y otros enfoques proporcionan subpartes crudas o ampliamente representativas a una imagen inferida. Fuente: https://www.youtube.com/watch?v=6WK3B0IZJsw

Segmentación por Superquadrics y otros enfoques proporcionan subpartes crudas o ampliamente representativas a una imagen inferida. Fuente: https://www.youtube.com/watch?v=6WK3B0IZJsw

Sin embargo, una nueva investigación del Instituto Max Planck, titulada Partes Neuronales: Aprendiendo Abstracciones de Formas 3D Expresivas con Redes Neuronales Invertibles, ofrece un nuevo sistema de representación de primitivas neuronales 3D que crea secciones semánticamente útiles.

Los métodos anteriores pueden descomponer objetos inferidos grandes, pero no de manera semánticamente útil. A la derecha, el método de Partes Neuronales crea fragmentos más prácticos. Fuente: https://paschalidoud.github.io/neural_parts

Los métodos anteriores pueden descomponer objetos inferidos grandes, pero no de manera semánticamente útil. A la derecha, el método de Partes Neuronales crea fragmentos más prácticos. Fuente: https://paschalidoud.github.io/neural_parts

La segmentación se logra a través de una Red Neuronal Invertible (INN), que utiliza homeomorfismo condicional para deformar una forma geométrica base en primitivas y viceversa, calculando la jerarquía topológica en ambos sentidos. De esta manera, cada forma primitiva se asocia con una incrustación de primitiva aprendible para generar la incrustación de forma para esa primitiva.

Arquitectura

Partes Neuronales necesita equilibrar la calidad de la reconstrucción y la integridad de las primitivas, ya que las primitivas complejas tenderán el sistema hacia descomposiciones complejas. Por lo tanto, la arquitectura de Partes Neuronales ha sido diseñada para afrontar estas consideraciones conflictivas de manera elegante.

La arquitectura de Partes Neuronales consiste en un extractor de características que asigna la entrada de un vector y un componente de homeomorfismo condicional que aprende mapeos homeomórficos condicionados por la incrustación de forma.

La sección inicial del extractor de características utiliza un componente ResNet-18 para extraer imágenes de características. El componente de homeomorfismo condicional utiliza un módulo de transformación de valor real no conservador de volumen (real NVP).

Evaluación

El sistema se probó contra tres conjuntos de datos: Dynamic FAUST (2017) (D-FAUST), FreiHAND (2019) y el popular conjunto de datos ShapeNet de la Universidad de Stanford (2015). D-FAUST contiene 38.640 mallas centradas en humanos, que resultaron adecuadas para la comparación, mientras que se utilizaron las primeras 5000 posiciones de la mano en FreiHAND para generar mallas. Para ShapeNet, los investigadores siguieron el mismo entrenamiento específico de categoría descrito por los investigadores de Stanford en 2016.

Las pruebas se ejecutaron contra métodos basados en primitivas, incluyendo superquadrics, CvxNet y H-SQs.

Bajo ShapeNet, los investigadores encontraron que el modelo de Partes Neuronales resultó en reconstrucciones más precisas que CvxNet a un nivel de 5 y 25 primitivas. Algunos de los objetos más simples en la base de datos, como las sillas, no contenían suficiente geometría para una descomposición significativa.

Para FreiHAND, Partes Neuronales resultó en reconstrucciones geométricamente más precisas, con una mejor captura de detalles finos como la posición del pulgar. Los investigadores observan que, en comparación, CvxNet y SQs se centran más en la estructura central general y carecen de estos detalles.

Para Dynamic FAUST, CvxNet y SQs se compararon con la salida de Partes Neuronales utilizando cinco primitivas para capturar la integridad del cuerpo humano inicialmente inferido a partir de los datos. Partes Neuronales pudo lograr una segmentación más suave, sin sacrificar los aspectos esenciales de la topología.

Trabajo Futuro

Los investigadores pretenden extender Partes Neuronales a estudios que no ofrecen mallas de destino directamente, mediante el uso de técnicas de renderizado diferenciable. Dado que una esfera base es la primitiva actual empleada en el marco de Partes Neuronales, los investigadores también están considerando el uso de primitivas geométricas más complejas y expresivas.

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai