Моделі та платформи ШІ

Нова техніка допомагає штучному інтелекту розпізнавати 3D-об’єкти

mm
Додайте Unite.AI до бажаних джерел у Google

Нова техніка, розроблена дослідниками університету штату Північна Кароліна, покращує здатність програм штучного інтелекту (ШІ) розпізнавати 3D-об’єкти. Техніка, названа MonoCon, також допомагає ШІ вивчати, як 3D-об’єкти пов’язані один з одним у просторі, використовуючи 2D-зображення.

MonoCon потенційно може мати широкий спектр застосувань, включаючи допомогу автономним транспортним засобам орієнтуватися навколо інших транспортних засобів, використовуючи 2D-зображення, отримані з бортової камери. Вона також може відігравати роль у виробництві та робототехніці.

Тяньфу У є відповідальним автором дослідницької роботи та помічником професора електротехніки та комп’ютерних наук університету штату Північна Кароліна.

“Ми живемо у 3D-світі, але коли ви робите фотографію, вона записує цей світ у 2D-зображенні”, – говорить У.

“Програми ШІ отримують візуальну інформацію від камер. Тому якщо ми хочемо, щоб ШІ взаємодіяв зі світом, нам потрібно забезпечити, щоб він міг інтерпретувати, що 2D-зображення можуть розповісти йому про 3D-простір. У цьому дослідженні ми зосереджені на одній частині цієї задачі: як ми можемо змусити ШІ точно розпізнавати 3D-об’єкти – такі як люди або автомобілі – у 2D-зображеннях і розміщувати ці об’єкти у просторі”, – продовжує У.

Автономні транспортні засоби

Автономні транспортні засоби часто використовують лідар для навігації у 3D-просторі. Лідар, який використовує лазери для вимірювання відстані, є дорогим, що означає, що автономні системи не включають багато резервних копій. Розміщення десятків лідар-чутливих датчиків на масово вироблений безпілотний автомобіль було б надзвичайно дорогим.

“Але якщо автономний транспортний засіб міг би використовувати візуальні дані для навігації у просторі, ви могли б побудувати резервні копії”, – говорить У. “Оскільки камери значно дешевші, ніж лідар, було б економічно доцільно включити додаткові камери – побудувати резервні копії у систему і зробити її безпечнішою та більш надійною.

“Це один із практичних застосувань. Однак ми також раді фундаментальному прогресу цієї роботи: що можна отримати 3D-дані з 2D-об’єктів.”

Навчання ШІ

MonoCon може розпізнавати 3D-об’єкти у 2D-зображеннях, перш ніж розміщувати їх у “обмежувальній рамці”, яка повідомляє ШІ про зовнішні межі об’єкта.

“Те, що відрізняє нашу роботу, – це те, як ми тренуємо ШІ, яке будується на попередніх техніках тренування”, – говорить У. “Як і попередні зусилля, ми розміщуємо об’єкти у 3D-обмежувальних рамках під час тренування ШІ. Однак, крім того, що ми просимо ШІ передбачити відстань камери до об’єкта і розміри обмежувальної рамки, ми також просимо ШІ передбачити місця розташування кожної з восьми точок обмежувальної рамки та її відстань від центру обмежувальної рамки у двох вимірах. Ми називаємо це “допоміжним контекстом” і виявили, що це допомагає ШІ більш точно розпізнавати і передбачати 3D-об’єкти на основі 2D-зображень.

“Запропонований метод мотивований добре відомим теоремою у теорії міри, теоремою Крамера-Вольда. Він також потенційно застосовний до інших завдань передбачення структурованого виводу у комп’ютерному баченні.”

MonoCon була протестована з широко використовуваним набором даних KITTI.

“На момент подання цієї статті MonoCon показала кращі результати, ніж десятки інших програм ШІ, спрямованих на отримання 3D-даних про автомобілі з 2D-зображень”, – говорить У.

Команда тепер планує розширити процес з більшим набором даних.

“Ми рухаємося вперед, розширюючи цей процес і працюючи з більшим набором даних для оцінки та налаштування MonoCon для використання в автономному водінні”, – говорить У. “Ми також хочемо дослідити застосування у виробництві, щоб побачити, чи можемо ми покращити виконання завдань, таких як використання роботизованих рук.”

Alex очолює новинні операції Unite.AI, що працюють на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію, щоб підтримувати своєчасне та масштабоване висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок у сфері ШІ, зберігаючи редакційні стандарти видання.