AI-modellen en platforms
Intel Labs verbetert computerzichtontwikkeling met twee nieuwe AI-modellen

VI-Depth 1.0 en MiDaS 3.1 open source AI-modellen verbeteren diepteschattingsmogelijkheden voor computerzicht.
Diepteschattingsmogelijkheden zijn een moeilijke taak voor computerzicht die nodig is om een breed scala aan toepassingen te creëren in robotica, augmented reality (AR) en virtual reality (VR). Bestaande oplossingen hebben vaak moeite om afstanden correct te schatten, wat een cruciaal aspect is bij het plannen van bewegingen en het vermijden van obstakels bij visuele navigatie. Onderzoekers bij Intel (INTC ) Labs lossen dit probleem op door twee AI-modellen voor monocular diepteschattingsmogelijkheden vrij te geven: een voor visueel-inertie diepteschattingsmogelijkheden en een voor robuuste relatieve diepteschattingsmogelijkheden (RDE).
Het laatste RDE-model, MiDaS versie 3.1, voorspelt robuuste relatieve diepte met behulp van slechts één afbeelding als invoer. Vanwege de training op een grote en diverse dataset, kan het efficiënt presteren op een bredere range van taken en omgevingen. De laatste versie van MiDaS verbetert de modelnauwkeurigheid voor RDE met ongeveer 30% met zijn grotere trainingsset en bijgewerkte encoder-backbones.
MiDaS is geïntegreerd in veel projecten, meest opvallend Stable Diffusion 2.0, waar het de diepte-naar-afbeelding-functie mogelijk maakt die de diepte van een invoerbeeld afleidt en vervolgens nieuwe afbeeldingen genereert met behulp van zowel de tekst als de diepte-informatie. Bijvoorbeeld, digitale maker Scottie Fox gebruikte een combinatie van Stable Diffusion en MiDaS om een 360-graden VR-omgeving te creëren. Deze technologie kan leiden tot nieuwe virtuele toepassingen, waaronder reconstructie van misdrijven voor rechtszaken, therapeutische omgevingen voor de gezondheidszorg en immersieve gamingservaringen.
Terwijl RDE een goede generaliseerbaarheid heeft en nuttig is, vermindert het gebrek aan schaal de bruikbaarheid voor downstream-taken die metrische diepte vereisen, zoals kaarten, plannen, navigatie, objectherkenning, 3D-reconstructie en afbeeldingsbewerking. Onderzoekers bij Intel Labs lossen dit probleem op door VI-Depth vrij te geven, een ander AI-model dat nauwkeurige diepteschattingsmogelijkheden biedt.
VI-Depth is een visueel-inertie diepteschattingspijplijn die monocular diepteschattingsmogelijkheden en visueel-inertie odometrie (VIO) combineert om dichte diepteschattingsmogelijkheden met een metrische schaal te produceren. Deze benadering biedt nauwkeurige diepteschattingsmogelijkheden, die kunnen helpen bij scène-reconstructie, kaarten en objectmanipulatie.
Het opnemen van inertiegegevens kan helpen bij het oplossen van schaalambiguïteit. De meeste mobiele apparaten bevatten al inertie-meeteenheden (IMU’s). Globale uitlijning bepaalt de juiste globale schaal, terwijl dichte schaaluitlijning (SML) lokaal werkt en regio’s naar de juiste metrische diepte duwt. Het SML-netwerk maakt gebruik van MiDaS als encoder-backbone. In de modulaire pijplijn combineert VI-Depth gegevensgestuurde diepteschattingsmogelijkheden met het MiDaS-relatieve dieptepredictiemodel, naast de IMU-sensor-meeteenheid. De combinatie van gegevensbronnen stelt VI-Depth in staat om meer betrouwbare dichte metrische diepte te genereren voor elke pixel in een afbeelding.
MiDaS 3.1 en VI-Depth 1.0 zijn beschikbaar onder een open source MIT-licentie op GitHub.
Voor meer informatie, zie “Vision Transformers for Dense Prediction” en “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer.”












