AI-modeller og plattformer

Intel Labs utvider utviklingen av datavisjon med to nye AI-modeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

VI-Depth 1.0 og MiDaS 3.1 åpne kildekode AI-modeller forbedrer dybdeestimering for datavisjon.

Dybdeestimering er en utfordrende oppgave innen datavisjon som kreves for å lage en rekke applikasjoner i robotikk, forbedret virkelighet (AR) og virtuell virkelighet (VR). Eksisterende løsninger har ofte vanskelig for å korrekt estimere avstander, som er et kritisk aspekt i å planlegge bevegelse og unngå hindringer når det gjelder visuell navigasjon. Forskere ved Intel (INTC ) Labs tar tak i dette problemet ved å utgi to AI-modeller for monokulær dybdeestimering: en for visuell-inertial dybdeestimering og en for robust relativ dybdeestimering (RDE).

Den siste RDE-modellen, MiDaS versjon 3.1, forutsier robust relativ dybde ved å bruke bare ett enkelt bilde som innputt. Takket være dens trening på et stort og variert dataset, kan den effektivt utføre en rekke oppgaver og miljøer. Den siste versjonen av MiDaS forbedrer modellens nøyaktighet for RDE med omtrent 30% med sin større treningssett og oppdaterte encoder-rygger.

MiDaS er inkorporert i mange prosjekter, mest merkbart Stable Diffusion 2.0, der den aktiverer dybde-til-bilde-funksjonen som infererer dybden av et innputt-bilde og deretter genererer nye bilder ved å bruke både tekst- og dybdeinformasjon. For eksempel brukte den digitale skaperen Scottie Fox en kombinasjon av Stable Diffusion og MiDaS for å lage en 360-graders VR-miljø. Denne teknologien kan føre til nye virtuelle applikasjoner, inkludert gjenoppbygging av kriminalsteder for rettssaker, terapeutiske miljøer for helsevesen og immersive spill-erfaringer.

Mens RDE har god generaliserbarhet og er nyttig, reduserer mangelen på skala dens nytte for nedstrømsoppgaver som krever metrisk dybde, som kartlegging, planlegging, navigasjon, gjenkjenning av objekter, 3D-rekonstruksjon og bildebehandling. Forskere ved Intel Labs tar tak i dette problemet ved å utgi VI-Depth, en annen AI-modell som gir nøyaktig dybdeestimering.

VI-Depth er en visuell-inertial dybdeestimeringspipeline som integrerer monokulær dybdeestimering og visuell-inertial odometri (VIO) for å produsere tetthetsdybdeestimater med en metrisk skala. Denne tilnærmingen gir nøyaktig dybdeestimering, som kan hjelpe med scenerekonstruksjon, kartlegging og objekthåndtering.

Inkorporering av inertialdata kan hjelpe med å løse skalausikkerheten. De fleste mobile enheter inneholder allerede inertialmålingsenheter (IMUer). Global justering bestemmer en passende global skala, mens tetthetsjustering (SML) opererer lokalt og skyver eller trekker regioner mot korrekt metrisk dybde. SML-nettverket utnytter MiDaS som en encoder-rygg. I den modulære pipelinekombinerer VI-Depth data-drevne dybdeestimering med MiDaS’ relative dybdeprediksjonsmodell, sammen med IMU-sensormålingsenheten. Kombinasjonen av datakilder tillater VI-Depth å generere mer pålitelig tetthetsmetrisk dybde for hvert bilde-pixel.

MiDaS 3.1 og VI-Depth 1.0 er tilgjengelige under en åpen kildekode-MIT-lisens på GitHub.

For mer informasjon, se “Vision Transformers for Dense Prediction” og “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer.”

Daniel er en stor tilhenger av hvordan AI til slutt vil forstyrre alt. Han puster teknologi og lever for å prøve nye gadgeter.