AI-modeller och plattformar

Intel Labs Utvecklar Datorseende med Två Nya AI-Modeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

VI-Depth 1.0 och MiDaS 3.1 är öppen källkods AI-modeller som förbättrar djupuppskattning för datorseende.

Djupuppskattning är en utmanande uppgift inom datorseende som krävs för att skapa en mängd olika tillämpningar inom robotik, förstärkt verklighet (AR) och virtuell verklighet (VR). Existerande lösningar har ofta svårt att korrekt uppskatta avstånd, vilket är ett avgörande aspekt för att planera rörelse och undvika hinder när det gäller visuell navigation. Forskare på Intel (INTC ) Labs tar itu med detta problem genom att släppa två AI-modeller för monokulär djupuppskattning: en för visuell-inertial djupuppskattning och en för robust relativ djupuppskattning (RDE).

Den senaste RDE-modellen, MiDaS version 3.1, förutsäger robust relativ djup med endast en enskild bild som indata. På grund av dess utbildning på en stor och varierad dataset kan den effektivt utföra en mängd olika uppgifter och miljöer. Den senaste versionen av MiDaS förbättrar modellens noggrannhet för RDE med cirka 30% med dess större utbildningsuppsättning och uppdaterade encoder-backbones.

MiDaS har införlivats i många projekt, mest anmärkningsvärt Stable Diffusion 2.0, där den möjliggör funktionen djup-till-bild som härleder djupet av en inmatningsbild och sedan genererar nya bilder med hjälp av både text- och djupinformation. Till exempel använde digital skapare Scottie Fox en kombination av Stable Diffusion och MiDaS för att skapa en 360-graders VR-miljö. Denna teknik kan leda till nya virtuella tillämpningar, inklusive rekonstruktion av brottsplatser för rättegångar, terapeutiska miljöer för hälsovård och immersiva spelupplevelser.

Medan RDE har god allmängiltighet och är användbar, minskar bristen på skala dess användbarhet för nedströmsuppgifter som kräver metrisk djup, såsom kartläggning, planering, navigation, objekterkännning, 3D-rekonstruktion och bildredigering. Forskare på Intel Labs tar itu med detta problem genom att släppa VI-Depth, en annan AI-modell som tillhandahåller exakt djupuppskattning.

VI-Depth är en visuell-inertial djupuppskattningspipeline som integrerar monokulär djupuppskattning och visuell-inertial odometri (VIO) för att producera täta djupuppskattningar med en metrisk skala. Denna metod tillhandahåller exakt djupuppskattning, som kan hjälpa till vid scenrekonstruktion, kartläggning och objekthantering.

Att införliva inertialdata kan hjälpa till att lösa skalaambiguiteten. De flesta mobila enheter innehåller redan inertialmätningssystem (IMU). Global justering bestämmer lämplig global skala, medan tät skalajustering (SML) fungerar lokalt och trycker eller drar regioner mot korrekt metrisk djup. SML-nätverket utnyttjar MiDaS som encoder-backbone. I den modulära pipelinen kombinerar VI-Depth datastyrd djupuppskattning med MiDaS relativ djupförutsägelsemodell, tillsammans med IMU-sensormätningssystem. Kombinationen av datakällor gör att VI-Depth kan generera mer tillförlitliga täta metriska djup för varje pixel i en bild.

MiDaS 3.1 och VI-Depth 1.0 är tillgängliga under en öppen källkods MIT-licens på GitHub.

För mer information, se “Vision Transformers for Dense Prediction” och “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer.”

Daniel är en stor förespråkare för hur AI till slut kommer att störa allt. Han andas teknik och lever för att prova nya prylar.