Моделі та платформи ШІ
Нова техніка допомагає штучному інтелекту розпізнавати 3D-об’єкти

Нова техніка, розроблена дослідниками університету штату Північна Кароліна, покращує здатність програм штучного інтелекту (ШІ) розпізнавати 3D-об’єкти. Техніка, названа MonoCon, також допомагає ШІ вивчати, як 3D-об’єкти пов’язані один з одним у просторі, використовуючи 2D-зображення.
MonoCon потенційно може мати широкий спектр застосувань, включаючи допомогу автономним транспортним засобам орієнтуватися навколо інших транспортних засобів, використовуючи 2D-зображення, отримані з бортової камери. Вона також може відігравати роль у виробництві та робототехніці.
Тяньфу У є відповідальним автором дослідницької роботи та помічником професора електротехніки та комп’ютерних наук університету штату Північна Кароліна.
“Ми живемо у 3D-світі, але коли ви робите фотографію, вона записує цей світ у 2D-зображенні”, – говорить У.
“Програми ШІ отримують візуальну інформацію від камер. Тому якщо ми хочемо, щоб ШІ взаємодіяв зі світом, нам потрібно забезпечити, щоб він міг інтерпретувати, що 2D-зображення можуть розповісти йому про 3D-простір. У цьому дослідженні ми зосереджені на одній частині цієї задачі: як ми можемо змусити ШІ точно розпізнавати 3D-об’єкти – такі як люди або автомобілі – у 2D-зображеннях і розміщувати ці об’єкти у просторі”, – продовжує У.
Автономні транспортні засоби
Автономні транспортні засоби часто використовують лідар для навігації у 3D-просторі. Лідар, який використовує лазери для вимірювання відстані, є дорогим, що означає, що автономні системи не включають багато резервних копій. Розміщення десятків лідар-чутливих датчиків на масово вироблений безпілотний автомобіль було б надзвичайно дорогим.
“Але якщо автономний транспортний засіб міг би використовувати візуальні дані для навігації у просторі, ви могли б побудувати резервні копії”, – говорить У. “Оскільки камери значно дешевші, ніж лідар, було б економічно доцільно включити додаткові камери – побудувати резервні копії у систему і зробити її безпечнішою та більш надійною.
“Це один із практичних застосувань. Однак ми також раді фундаментальному прогресу цієї роботи: що можна отримати 3D-дані з 2D-об’єктів.”
Навчання ШІ
MonoCon може розпізнавати 3D-об’єкти у 2D-зображеннях, перш ніж розміщувати їх у “обмежувальній рамці”, яка повідомляє ШІ про зовнішні межі об’єкта.
“Те, що відрізняє нашу роботу, – це те, як ми тренуємо ШІ, яке будується на попередніх техніках тренування”, – говорить У. “Як і попередні зусилля, ми розміщуємо об’єкти у 3D-обмежувальних рамках під час тренування ШІ. Однак, крім того, що ми просимо ШІ передбачити відстань камери до об’єкта і розміри обмежувальної рамки, ми також просимо ШІ передбачити місця розташування кожної з восьми точок обмежувальної рамки та її відстань від центру обмежувальної рамки у двох вимірах. Ми називаємо це “допоміжним контекстом” і виявили, що це допомагає ШІ більш точно розпізнавати і передбачати 3D-об’єкти на основі 2D-зображень.
“Запропонований метод мотивований добре відомим теоремою у теорії міри, теоремою Крамера-Вольда. Він також потенційно застосовний до інших завдань передбачення структурованого виводу у комп’ютерному баченні.”
MonoCon була протестована з широко використовуваним набором даних KITTI.
“На момент подання цієї статті MonoCon показала кращі результати, ніж десятки інших програм ШІ, спрямованих на отримання 3D-даних про автомобілі з 2D-зображень”, – говорить У.
Команда тепер планує розширити процес з більшим набором даних.
“Ми рухаємося вперед, розширюючи цей процес і працюючи з більшим набором даних для оцінки та налаштування MonoCon для використання в автономному водінні”, – говорить У. “Ми також хочемо дослідити застосування у виробництві, щоб побачити, чи можемо ми покращити виконання завдань, таких як використання роботизованих рук.”












