Modèles et plateformes d’IA
Neural Parts : Décomposition de Primitives pour une Géométrie Inférée Significative

Pendant que les systèmes capables de générer une géométrie 3D à partir d’images statiques se sont multipliés ces dernières années, les objets qu’ils obtiennent tendent à être “fusionnés” ensemble, sans véritable schéma sémantique pour refléter la manière dont les parties contribuent au tout.
Il existe un certain nombre de bonnes raisons pour générer des modèles inférés hiérarchiques avec une division significative de parties, notamment l’analyse industrielle, la recherche médicale et les applications d’imagerie, la génération automatique de géométrie pour les jeux vidéo, les simulateurs et les environnements VR/AR, ainsi que le rigging des effets visuels, entre autres.
De nombreuses méthodes développées ces dernières années, telles que l’analyse de formes Superquadrics, produisent des résultats moins que satisfaisants et ont eu du mal à faire progresser l’état de l’art au-delà de la découpe indicative cuboïde.

Segmentation par Superquadrics et autres approches fournissent des sous-parties grossières ou représentationnelles à une image inférée. Source: https://www.youtube.com/watch?v=6WK3B0IZJsw
Cependant, de nouvelles recherches de l’Institut Max Planck, intitulées Neural Parts: Apprentissage d’abstractions de formes 3D expressives avec des réseaux de neurones invertibles, offrent un nouveau système de représentation de primitives neurales 3D qui crée des sections sémantiquement utiles.

Les méthodes précédentes peuvent décomposer de grands objets inférés, mais pas de manière sémantiquement utile. À droite, la méthode Neural Parts crée des fragments plus pratiques. Source: https://paschalidoud.github.io/neural_parts
La segmentation est réalisée via un réseau de neurones invertible (INN), qui utilise une homéomorphie conditionnelle pour déformer une forme géométrique de base en primitives, et vice versa, en calculant la hiérarchie topologique dans les deux sens. De cette façon, chaque forme primitive est associée à une embedding primitive apprenable afin de générer l’embedding de forme pour cette primitive.

Architecture
Neural Parts doit trouver un équilibre entre la qualité de reconstruction et l’intégrité des primitives, puisque des primitives complexes tendent le système vers des déconstructions complexes. Par conséquent, l’architecture de Neural Parts a été conçue pour équilibrer ces considérations contradictoires de manière élégante.
L’architecture de Neural Parts se compose d’un extracteur de caractéristiques qui mappe l’entrée d’un vecteur, et d’un composant d’homéomorphie conditionnelle qui apprend des mappages homéomorphes conditionnés par l’embedding de forme.
La section initiale de l’extracteur de caractéristiques utilise un composant ResNet-18 pour extraire des images de caractéristiques. Le composant d’homéomorphie conditionnelle utilise un module de transformation à valeur réelle non conservant le volume (réel NVP).
Évaluation
Le système a été testé contre trois jeux de données – 2017’s Dynamic FAUST (D-FAUST), FreiHAND (2019) et l’université de Stanford populaire 2015 ShapeNet. D-FAUST contient 38 640 maillages centrés sur l’homme, qui se sont avérés appropriés pour la comparaison, tandis que les 5 000 premières poses de main dans FreiHAND ont été utilisées pour générer des maillages. Pour ShapeNet, les chercheurs ont suivi la même formation spécifique à la catégorie définie par les chercheurs de Stanford en 2016.
Les tests ont été effectués contre des méthodes basées sur des primitives, notamment les superquadriques, CvxNet et H-SQs.
Sous ShapeNet, les chercheurs ont constaté que le modèle Neural Parts a donné lieu à des reconstructions plus précises que CvxNet à un niveau de 5 et 25 primitives. Certains des objets plus simples de la base de données, tels que les chaises, ne contenaient pas suffisamment de géométrie pour une décomposition significative.

Pour FreiHAND, Neural Parts a donné lieu à des reconstructions plus précises sur le plan géométrique, avec une meilleure capture de détails fins tels que la position du pouce. Les chercheurs notent que, par comparaison, CvxNet et SQs se concentrent davantage sur la structure générale et manquent de ces détails.

Pour Dynamic FAUST, CvxNet et SQs ont été comparés avec la sortie de Neural Parts en utilisant cinq primitives pour capturer l’intégrité du corps humain initialement inféré à partir des données. Neural Parts a pu atteindre une segmentation plus lisse, sans sacrifier les éléments essentiels de la topologie.

Travail Futur
Les chercheurs ont l’intention d’étendre Neural Parts à des études qui n’offrent pas directement de maillages cibles, en utilisant des techniques de rendu différentiables. Puisque la base sphérique est la primitive actuellement employée dans le cadre de Neural Parts, les chercheurs envisagent également d’utiliser des primitives géométriques plus complexes et plus expressives.













