Modele i platformy AI

Intel Labs rozwija rozwój komputerowego widzenia dzięki dwóm nowym modelom AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

VI-Depth 1.0 i MiDaS 3.1 to modele AI z otwartym kodem źródłowym, które poprawiają szacowanie głębi dla komputerowego widzenia.

Szacowanie głębi jest trudnym zadaniem komputerowego widzenia wymaganym do tworzenia szerokiej gamy aplikacji w robotyce, rozszerzonej rzeczywistości (AR) i wirtualnej rzeczywistości (VR). Istniejące rozwiązania często mają trudności z poprawnym szacowaniem odległości, co jest kluczowym aspektem w planowaniu ruchu i unikaniu przeszkód w przypadku nawigacji wizualnej. Naukowcy z Intel (INTC ) Labs zajmują się tym problemem, wydając dwa modele AI do szacowania głębi monokularnej: jeden do szacowania głębi wzrokowo-inercyjnej i jeden do szacowania głębi względnej (RDE).

Najnowszy model RDE, MiDaS wersja 3.1, przewiduje niezawodną głębię względną przy użyciu tylko jednego obrazu jako danych wejściowych. Dzięki szkoleniu na dużym i zróżnicowanym zbiorze danych, może on wydajnie działać w szerszym zakresie zadań i środowisk. Najnowsza wersja MiDaS poprawia dokładność modelu o około 30% dzięki większemu zbiorowi danych szkoleniowych i zaktualizowanym strukturom kodera.

MiDaS został zintegrowany z wieloma projektami, w tym z Stable Diffusion 2.0, gdzie umożliwia funkcję depth-to-image, która wnioskuje głębię obrazu wejściowego i generuje nowe obrazy przy użyciu zarówno tekstu, jak i informacji o głębi. Na przykład, cyfrowy twórca Scottie Fox użył połączenia Stable Diffusion i MiDaS, aby stworzyć środowisko VR 360 stopni. Ta technologia może prowadzić do nowych aplikacji wirtualnych, w tym odtworzenia miejsc zbrodni dla spraw sądowych, terapeutycznych środowisk dla opieki zdrowotnej i immersyjnych doświadczeń gier.

Pomimo że RDE ma dobrą ogólną użyteczność i jest przydatna, brak skali zmniejsza jej przydatność dla zadań downstream wymagających metrycznej głębi, takich jak mapowanie, planowanie, nawigacja, rozpoznawanie obiektów, rekonstrukcja 3D i edycja obrazu. Naukowcy z Intel Labs zajmują się tym problemem, wydając VI-Depth, inny model AI, który zapewnia dokładne szacowanie głębi.

VI-Depth jest potokiem szacowania głębi wzrokowo-inercyjnej, który łączy szacowanie głębi monokularnej i wzrokowo-inercyjną odometrię (VIO), aby wyprodukować gęste szacowania głębi o skali metrycznej. Ten podejście zapewnia dokładne szacowanie głębi, które może pomóc w rekonstrukcji sceny, mapowaniu i manipulacji obiektami.

Włączenie danych inercyjnych może pomóc w rozwiązaniu niejednoznaczności skali. Większość urządzeń mobilnych zawiera już jednostki pomiaru inercyjnego (IMU). Globalne wyrównanie określa odpowiednią skalę globalną, podczas gdy gęste wyrównanie skali (SML) działa lokalnie i popycha lub ciągnie regiony w kierunku poprawnej metrycznej głębi. Sieć SML wykorzystuje MiDaS jako strukturę kodera. W modułowym potoku VI-Depth łączy szacowanie głębi oparte na danych z modelem przewidywania względnej głębi MiDaS, obok jednostki pomiaru czujnika IMU. Połączenie źródeł danych pozwala VI-Depth na generowanie bardziej niezawodnych gęstych metrycznych głębi dla każdego piksela w obrazie.

MiDaS 3.1 i VI-Depth 1.0 są dostępne na licencji otwartego kodu źródłowego MIT na GitHub.

Więcej informacji można znaleźć w dokumentach „Vision Transformers for Dense Prediction” i „Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer.”

Daniel jest wielkim zwolennikiem tego, jak AI ostatecznie zakłóci wszystko. On żyje technologią i żyje, by próbować nowe gadżety.