Modely a platformy AI

Intel Labs rozšiřuje vývoj počítačového vidění o dvě nové modely AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

VI-Depth 1.0 a MiDaS 3.1 jsou open source modely AI, které zlepšují odhad hloubky pro počítačové vidění.

Odhad hloubky je náročným úkolem počítačového vidění, který je vyžadován pro vytváření širokého spektra aplikací v robotice, rozšířené realitě (AR) a virtuální realitě (VR). Existující řešení často mají problémy s přesným odhadem vzdáleností, což je zásadní aspekt pro plánování pohybu a vyhýbání se překážkám při vizuálním navigování. Výzkumníci z Intel (INTC ) Labs se této problematice věnují vydáním dvou modelů AI pro monokulární odhad hloubky: jeden pro vizuálně-inertionální odhad hloubky a jeden pro robustní relativní odhad hloubky (RDE).

Nejnovější model RDE, MiDaS verze 3.1, předpovídá robustní relativní hloubku pomocí pouze jednoho vstupního obrazu. Díky jeho školení na velkém a rozmanitém datasetu může efektivně pracovat na širším spektru úkolů a prostředí. Nejnovější verze MiDaS zlepšuje přesnost modelu pro RDE o asi 30 % díky většímu tréninkovému datasetu a aktualizovaným encoder backbones.

MiDaS byl začleněn do mnoha projektů, nejvýznamněji do Stable Diffusion 2.0, kde umožňuje funkci depth-to-image, která odvozuje hloubku vstupního obrazu a poté generuje nové obrazy pomocí textu a hloubky. Například digitální tvůrce Scottie Fox použil kombinaci Stable Diffusion a MiDaS k vytvoření 360stupňového VR prostředí. Tato technologie by mohla vést k novým virtuálním aplikacím, včetně rekonstrukce místa činu pro soudní případy, terapeutických prostředí pro zdravotnictví a imerzivních herních zkušeností.

Zatímco RDE má dobrou generalizovatelnost a je užitečná, nedostatek měřítka snižuje jeho užitečnost pro úkoly, které vyžadují metrickou hloubku, jako je mapování, plánování, navigace, rozpoznávání objektů, 3D rekonstrukce a editace obrazu. Výzkumníci z Intel Labs se této problematice věnují vydáním VI-Depth, dalšího modelu AI, který poskytuje přesný odhad hloubky.

VI-Depth je vizuálně-inertionální pipeline pro odhad hloubky, který integruje monokulární odhad hloubky a vizuálně-inertionální odometrii (VIO) pro produkci hustých odhadů hloubky s metrickou škálou. Tento přístup poskytuje přesný odhad hloubky, který může pomoci při rekonstrukci scény, mapování a manipulaci s objekty.

Zahrnutí inertních dat může pomoci vyřešit ambiguitu měřítka. Most mobilních zařízení již obsahuje inertionální měřicí jednotky (IMU). Globální zarovnání určuje vhodnou globální škálu, zatímco husté zarovnání měřítka (SML) funguje lokálně a tlačí nebo táhne oblasti směrem k správné metrické hloubce. SML síť využívá MiDaS jako encoder backbone. V modulárním pipeline VI-Depth kombinuje datově řízený odhad hloubky s modelem relativního odhadu hloubky MiDaS, spolu s měřicí jednotkou IMU. Kombinace zdrojů dat umožňuje VI-Depth generovat více spolehlivé husté metrické hloubky pro každý pixel v obraze.

MiDaS 3.1 a VI-Depth 1.0 jsou k dispozici pod open source licencí MIT na GitHubu.

Pro více informací se podívejte na „Vision Transformers for Dense Prediction“ a „Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer“.

Daniel je velkým zastáncem toho, jak AI nakonec naruší všechno. Dýchá technologií a žije tím, že zkouší nové gadgety.