Modele și platforme AI

Intel Labs Avansează Dezvoltarea Viziunii Calculatoarelor cu Două Noi Modele AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Modelele AI VI-Depth 1.0 și MiDaS 3.1 cu sursă deschisă îmbunătățesc estimarea adâncimii pentru viziunea calculatorului.

Estimarea adâncimii este o sarcină dificilă de viziune a calculatorului necesară pentru a crea o gamă largă de aplicații în robotică, realitate augmentată (AR) și realitate virtuală (VR). Soluțiile existente adesea luptă pentru a estima corect distanțele, ceea ce este un aspect crucial în ajutarea planificării mișcării și evitarea obstacolelor atunci când vine vorba de navigația vizuală. Cercetătorii de la Intel (INTC ) Labs abordează această problemă prin lansarea a două modele AI pentru estimarea adâncimii monoculară: unul pentru estimarea adâncimii vizuale-inertiale și unul pentru estimarea adâncimii relative robuste (RDE).

Ultimul model RDE, MiDaS versiunea 3.1, prezice o adâncime relativă robustă utilizând doar o singură imagine ca intrare. Datorită antrenamentului pe un set de date mare și divers, poate funcționa eficient pe o gamă largă de sarcini și medii. Ultima versiune a lui MiDaS îmbunătățește acuratețea modelului pentru RDE cu aproximativ 30% cu setul său de antrenament mai mare și noile backbone-uri ale encoderului.

MiDaS a fost integrat în multe proiecte, cel mai notabil fiind Stable Diffusion 2.0, unde permite funcția de adâncime-la-imagină care inferă adâncimea unei imagini de intrare și apoi generează noi imagini utilizând atât informațiile textuale, cât și cele de adâncime. De exemplu, creatorul digital Scottie Fox a utilizat o combinație de Stable Diffusion și MiDaS pentru a crea un mediu VR de 360 de grade. Această tehnologie ar putea duce la noi aplicații virtuale, inclusiv reconstrucția scenei crimei pentru cazuri în instanță, medii terapeutice pentru îngrijirea sănătății și experiențe de joc imersive.

În timp ce RDE are o bună generalizare și este util, lipsa de scară reduce utilitatea sa pentru sarcinile downstream care necesită o adâncime metrică, cum ar fi cartografierea, planificarea, navigația, recunoașterea obiectelor, reconstrucția 3D și editarea imaginilor. Cercetătorii de la Intel Labs abordează această problemă prin lansarea lui VI-Depth, un alt model AI care oferă o estimare precisă a adâncimii.

VI-Depth este o conductă de estimare a adâncimii vizuale-inertiale care integrează estimarea adâncimii monoculară și odometria vizual-inertială (VIO) pentru a produce estimații dense ale adâncimii cu o scară metrică. Acestă abordare oferă o estimare precisă a adâncimii, care poate ajuta la reconstrucția scenei, cartografiere și manipularea obiectelor.

Incorporarea datelor inerțiale poate ajuta la rezolvarea ambiguității de scară. Majoritatea dispozitivelor mobile conțin deja unități de măsurare inerțială (IMU). Alinierea globală determină scara globală adecvată, în timp ce alinierea densă a scării (SML) funcționează local și împinge sau trage regiunile spre adâncimea metrică corectă. Rețeaua SML utilizează MiDaS ca spate de encoder. În conducta modulară, VI-Depth combină estimarea adâncimii bazată pe date cu modelul de predicție a adâncimii relative MiDaS, alături de unitatea de măsurare a senzorului IMU. Combinarea surselor de date permite lui VI-Depth să genereze o adâncime metrică densă mai fiabilă pentru fiecare pixel din imagine.

MiDaS 3.1 și VI-Depth 1.0 sunt disponibile sub o licență MIT cu sursă deschisă pe GitHub.

Pentru mai multe informații, consultați „Transformatori de viziune pentru predicție densă” și „Spre o estimare monoculară robustă a adâncimii: amestecarea seturilor de date pentru transferul zero-shot între seturi de date”.

Daniel este un mare susținător al modului în care IA va perturba în cele din urmă totul. Respiră tehnologia și trăiește pentru a încerca noi gadgeturi.