Моделі та платформи ШІ

Intel Labs розширює розробку комп’ютерного зору за допомогою двох нових моделей штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Моделі штучного інтелекту VI-Depth 1.0 і MiDaS 3.1 з відкритим кодом покращують оцінку глибини для комп’ютерного зору.

Оцінка глибини – це складна задача комп’ютерного зору, необхідна для створення широкого спектра застосунків у робототехніці, доповненій реальності (AR) та віртуальній реальності (VR). Існуючі рішення часто мають труднощі з правильною оцінкою відстаней, що є важливим аспектом для планування руху та уникнення перешкод при візуальній навігації. Дослідники в Intel (INTC ) Labs звертаються до цієї проблеми, випускаючи дві моделі штучного інтелекту для монокулярної оцінки глибини: одну для візуально-інерційної оцінки глибини та одну для надійної відносної оцінки глибини (RDE).

Остання модель RDE, MiDaS версії 3.1, передбачає надійну відносну глибину, використовуючи лише один зображення як вхідні дані. Завдяки її навчанню на великій та різноманітній базі даних, вона може ефективно виконувати широкий спектр завдань та середовищ. Остання версія MiDaS покращує точність моделі для RDE приблизно на 30% завдяки більшій навчальній базі даних та оновленим енкодерам.

MiDaS було включено до багатьох проєктів, найбільш помітно до Stable Diffusion 2.0, де вона дозволяє функцію глибини-до-зображення, яка витягує глибину вхідного зображення, а потім генерує нові зображення, використовуючи як текст, так і інформацію про глибину. Наприклад, цифровий творець Scottie Fox використав комбінацію Stable Diffusion та MiDaS для створення 360-градусного середовища віртуальної реальності. Ця технологія може привести до нових віртуальних застосунків, включаючи реконструкцію місця злочину для судових справ, терапевтичні середовища для охорони здоров’я та іммерсивні ігрові переживання.

Хоча RDE має добру узагальнюваність і є корисною, відсутність масштабу знижує її корисність для завдань, що вимагають метричної глибини, таких як картографування, планування, навігація, розпізнавання об’єктів, 3D-реконструкція та редагування зображень. Дослідники в Intel Labs звертаються до цієї проблеми, випускаючи VI-Depth, іншу модель штучного інтелекту, яка забезпечує точну оцінку глибини.

VI-Depth – це візуально-інерційна оцінка глибини, яка інтегрує монокулярну оцінку глибини та візуально-інерційну одометрію (VIO) для генерації густої оцінки глибини з метричним масштабом. Цій підхід забезпечує точну оцінку глибини, яка може допомогти у реконструкції сцени, картографуванні та маніпуляції об’єктами.

Включення інерційних даних може допомогти вирішити проблему масштабної двозначності. Більшість мобільних пристроїв вже містять інерційні вимірювальні одиниці (IMU). Глобальна вирівняльна визначає відповідний глобальний масштаб, тоді як густий масштаб вирівняльної мережі (SML) працює локально та штовхає або тягне регіони до правильної метричної глибини. Мережа SML використовує MiDaS як енкодерний хребет. У модульному конвеєрі VI-Depth поєднує даних-орієнтовану оцінку глибини з моделлю відносної глибини MiDaS, поряд з вимірювальною одиницею сенсора IMU. Комбінація джерел даних дозволяє VI-Depth генерувати більш надійну густу метричну глибину для кожного пікселя зображення.

MiDaS 3.1 і VI-Depth 1.0 доступні під відкритою ліцензією MIT на GitHub.

Для отримання додаткової інформації зверніться до “Візуальні трансформатори для густого прогнозування” та “До надійної монокулярної оцінки глибини: змішування наборів даних для нульової передачі між наборами даних”.

Даніель є великим прибічником того, як штучний інтелект в кінцевому підсумку порушить все. Він дихає технологіями і живе, щоб спробувати нові гаджети.