KI-Modelle und Plattformen
Intel Labs treibt die Entwicklung von Computer-Vision mit zwei neuen KI-Modellen voran

VI-Depth 1.0 und MiDaS 3.1 sind Open-Source-KI-Modelle, die die Tiefenschätzung für die Computer-Vision verbessern.
Die Tiefenschätzung ist eine herausfordernde Aufgabe in der Computer-Vision, die für die Erstellung einer Vielzahl von Anwendungen in der Robotik, der erweiterten Realität (AR) und der virtuellen Realität (VR) erforderlich ist. Bestehende Lösungen haben oft Schwierigkeiten, Entfernungen korrekt zu schätzen, was ein entscheidender Aspekt bei der Planung von Bewegungen und der Vermeidung von Hindernissen bei der visuellen Navigation ist. Forscher bei Intel (INTC ) Labs gehen dieses Problem an, indem sie zwei KI-Modelle für die monokulare Tiefenschätzung veröffentlichen: eines für die visuell-inertiale Tiefenschätzung und eines für die robuste relative Tiefenschätzung (RDE).
Das neueste RDE-Modell, MiDaS-Version 3.1, schätzt die robuste relative Tiefe mithilfe nur eines einzigen Bildes als Eingabe. Aufgrund seiner Ausbildung auf einem großen und vielfältigen Datensatz kann es effizient auf einer Vielzahl von Aufgaben und Umgebungen performen. Die neueste Version von MiDaS verbessert die Modellgenauigkeit für RDE um etwa 30 % durch seinen größeren Trainingsdatensatz und aktualisierte Encoder-Backbones.
MiDaS wurde in viele Projekte integriert, insbesondere in Stable Diffusion 2.0, wo es die Tiefe-zu-Bild-Funktion ermöglicht, die Tiefe eines Eingabebildes ableitet und dann neue Bilder mithilfe der Text- und Tiefeninformationen generiert. Zum Beispiel verwendete der digitale Künstler Scottie Fox eine Kombination aus Stable Diffusion und MiDaS, um eine 360-Grad-VR-Umgebung zu erstellen. Diese Technologie könnte zu neuen virtuellen Anwendungen führen, einschließlich der Rekonstruktion von Tatorten für Gerichtsverfahren, therapeutischen Umgebungen für die Gesundheitsversorgung und immersiven Gaming-Erfahrungen.
Während RDE eine gute Allgemeingültigkeit aufweist und nützlich ist, verringert der Mangel an Skalierbarkeit seine Nützlichkeit für nachgelagerte Aufgaben, die metrische Tiefen erfordern, wie z. B. Kartierung, Planung, Navigation, Objekterkennung, 3D-Rekonstruktion und Bildbearbeitung. Forscher bei Intel Labs gehen dieses Problem an, indem sie VI-Depth veröffentlichen, ein weiteres KI-Modell, das genaue Tiefenschätzungen liefert.
VI-Depth ist eine visuell-inertiale Tiefenschätzungspipeline, die monokulare Tiefenschätzung und visuell-inertiale Odometrie (VIO) integriert, um dichte Tiefenschätzungen mit metrischer Skala zu produzieren. Dieser Ansatz liefert genaue Tiefenschätzungen, die bei der Szenenrekonstruktion, Kartierung und Objektmanipulation helfen können.
Die Einbeziehung von inertialen Daten kann helfen, die Skalierbarkeitsunsicherheit aufzulösen. Die meisten mobilen Geräte enthalten bereits inertiale Messgeräte (IMUs). Die globale Ausrichtung bestimmt die geeignete globale Skala, während die dichte Skalenausrichtung (SML) lokal operiert und Regionen in die richtige metrische Tiefe drängt oder zieht. Das SML-Netzwerk nutzt MiDaS als Encoder-Backbone. In der modularen Pipeline kombiniert VI-Depth datengetriebene Tiefenschätzung mit dem MiDaS-Modell für relative Tiefenschätzung sowie mit den IMU-Sensormessungen. Die Kombination von Datenquellen ermöglicht es VI-Depth, zuverlässige dichte metrische Tiefen für jeden Pixel in einem Bild zu generieren.
MiDaS 3.1 und VI-Depth 1.0 sind unter einer Open-Source-MIT-Lizenz auf GitHub verfügbar.
Für weitere Informationen siehe „Vision Transformers für dichte Vorhersage“ und „Zur robusten monokularen Tiefenschätzung: Mischen von Datensätzen für Zero-Shot-Cross-Dataset-Transfer“.












