Modèles et plateformes d’IA
Les laboratoires Intel améliorent le développement de la vision par ordinateur avec deux nouveaux modèles d’IA

Les modèles d’IA open source VI-Depth 1.0 et MiDaS 3.1 améliorent l’estimation de la profondeur pour la vision par ordinateur.
L’estimation de la profondeur est une tâche de vision par ordinateur difficile qui est nécessaire pour créer une large gamme d’applications dans les domaines de la robotique, de la réalité augmentée (AR) et de la réalité virtuelle (VR). Les solutions existantes ont souvent du mal à estimer correctement les distances, ce qui est un aspect crucial pour planifier les mouvements et éviter les obstacles lors de la navigation visuelle. Les chercheurs des laboratoires Intel (INTC ) abordent ce problème en lançant deux modèles d’IA pour l’estimation de la profondeur monocular : l’un pour l’estimation de la profondeur visuelle-inertielle et l’autre pour l’estimation de la profondeur relative robuste (RDE).
Le dernier modèle RDE, MiDaS version 3.1, prédit une profondeur relative robuste en utilisant uniquement une image comme entrée. Grâce à sa formation sur un grand et diversifié ensemble de données, il peut effectuer efficacement une large gamme de tâches et d’environnements. La dernière version de MiDaS améliore la précision du modèle pour l’estimation de la profondeur relative de environ 30 % avec son ensemble de formation plus important et ses encodeurs mis à jour.
MiDaS a été intégré à de nombreux projets, notamment Stable Diffusion 2.0, où il permet la fonctionnalité de profondeur à image qui infère la profondeur d’une image d’entrée et génère de nouvelles images en utilisant à la fois les informations textuelles et de profondeur. Par exemple, le créateur numérique Scottie Fox a utilisé une combinaison de Stable Diffusion et MiDaS pour créer un environnement de réalité virtuelle à 360 degrés. Cette technologie pourrait conduire à de nouvelles applications virtuelles, notamment la reconstruction de scènes de crime pour les affaires judiciaires, les environnements thérapeutiques pour les soins de santé et les expériences de jeu immersif.
Alors que l’estimation de la profondeur relative a une bonne généralisation et est utile, le manque d’échelle diminue son utilité pour les tâches en aval qui nécessitent une profondeur métrique, telles que la cartographie, la planification, la navigation, la reconnaissance d’objets, la reconstruction 3D et l’édition d’images. Les chercheurs des laboratoires Intel abordent ce problème en lançant VI-Depth, un autre modèle d’IA qui fournit une estimation de la profondeur précise.
VI-Depth est un pipeline d’estimation de la profondeur visuelle-inertielle qui intègre l’estimation de la profondeur monocular et l’odométrie visuelle-inertielle (VIO) pour produire des estimations de la profondeur denses avec une échelle métrique. Cette approche fournit une estimation de la profondeur précise, qui peut aider à la reconstruction de scènes, à la cartographie et à la manipulation d’objets.
L’intégration des données inertielle peut aider à résoudre l’ambiguïté d’échelle. La plupart des appareils mobiles contiennent déjà des unités de mesure inertielle (IMU). L’alignement global détermine l’échelle globale appropriée, tandis que l’alignement d’échelle dense (SML) opère localement et pousse ou tire les régions vers la profondeur métrique correcte. Le réseau SML utilise MiDaS comme encodeur de base. Dans le pipeline modulaire, VI-Depth combine l’estimation de la profondeur basée sur les données avec le modèle de prédiction de la profondeur relative MiDaS, ainsi que les mesures de l’unité de capteur IMU. La combinaison de sources de données permet à VI-Depth de générer une profondeur métrique dense plus fiable pour chaque pixel d’une image.
MiDaS 3.1 et VI-Depth 1.0 sont disponibles sous licence open source MIT sur GitHub.
Pour plus d’informations, consultez « Vision Transformers for Dense Prediction » et « Towards Robust Monocular Depth Estimation : Mixing Datasets for Zero-shot Cross-dataset Transfer ».












