AI-modeller og platforme

Intel Labs fremmer udviklingen af computer vision med to nye AI-modeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

VI-Depth 1.0 og MiDaS 3.1 åbne kildekode AI-modeller forbedrer dybdeestimation for computer vision.

Dybdeestimation er en udfordrende opgave inden for computer vision, der kræves for at skabe en bred vifte af anvendelser inden for robotteknik, forstærket virkelighed (AR) og virtuel virkelighed (VR). Eksisterende løsninger kæmper ofte for at korrekt estimerer afstande, hvilket er et afgørende aspekt i planlægning af bevægelse og undgåelse af hindringer, når det kommer til visuel navigation. Forskere på Intel (INTC ) Labs adresserer dette problem ved at udgive to AI-modeller til monokulær dybdeestimation: en til visuelt-inertial dybdeestimation og en til robust relativ dybdeestimation (RDE).

Den seneste RDE-model, MiDaS version 3.1, forudser robust relativ dybde ved kun at bruge ét billede som input. Takket være dens træning på et stort og varieret dataset, kan den effektivt udføre en bred vifte af opgaver og miljøer. Den seneste version af MiDaS forbedrer modelpræcisionen for RDE med omkring 30% med sin større træningssæt og opdaterede encoder-backbones.

MiDaS er blevet integreret i mange projekter, mest bemærkelsesværdigt Stable Diffusion 2.0, hvor den aktiverer depth-to-image-funktionen, der aflærer dybden af et inputbillede og derefter genererer nye billeder ved hjælp af både tekst og dybdeinformation. For eksempel brugte den digitale skaber Scottie Fox en kombination af Stable Diffusion og MiDaS til at skabe en 360-graders VR-miljø. Denne teknologi kunne føre til nye virtuelle anvendelser, herunder gendannelse af kriminalscener til retssager, terapeutiske miljøer til sundhedspleje og immersive spiloplevelser.

mens RDE har god generalisering og er nyttig, mindsker manglen på skala dets nytte for downstream-opgaver, der kræver metrisk dybde, såsom kortlægning, planlægning, navigation, genkendelse af objekter, 3D-rekonstruktion og billedredigering. Forskere på Intel Labs adresserer dette problem ved at udgive VI-Depth, en anden AI-model, der giver præcis dybdeestimation.

VI-Depth er en visuelt-inertial dybdeestimationspipeline, der integrerer monokulær dybdeestimation og visuelt-inertial odometri (VIO) for at producere tætte dybdeestimationer med en metrisk skala. Denne tilgang giver præcis dybdeestimation, der kan hjælpe med scenerekonstruktion, kortlægning og objekthåndtering.

Indlejring af inertialdata kan hjælpe med at løse skalaambiguiteten. De fleste mobile enheder indeholder allerede inertialmåleenheder (IMU’er). Global justering bestemmer den passende globale skala, mens tæt skalajustering (SML) opererer lokalt og skyder eller trækker regioner mod korrekt metrisk dybde. SML-netværket udnytter MiDaS som encoder-backbone. I den modulære pipeline kombinerer VI-Depth data-dreven dybdeestimation med MiDaS’ relative dybdeforudsigelsesmodel samt IMU-sensormåleenheden. Kombinationen af datakilder giver VI-Depth mulighed for at generere mere pålidelig tæt metrisk dybde for hvert pixel i et billede.

MiDaS 3.1 og VI-Depth 1.0 er tilgængelige under en åben kildekode-MIT-licens på GitHub.

For mere information, se “Vision Transformers for Dense Prediction” og “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer”.

Daniel er en stor tilhænger af, hvordan AI til sidst vil forstyrre alt. Han ånder teknologi og lever for at prøve nye gadgets.