Погляд Anderson

Синтетичні дані: подолання прогалини окулювання за допомогою Grand Theft Auto

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Університету Іллінойсу створили новий набір даних комп’ютерного зору, який використовує синтетичні зображення, згенеровані двигуном гри Grand Theft Auto, щоб допомогти вирішити одну з найбільш складних проблем у семантичному сегментуванні – розпізнавання об’єктів, які лише частково видимі на джерельних зображеннях і відео.

Для цього, як описано в статті, дослідники використали двигун гри GTA-V для генерації синтетичного набору даних, який не тільки містить рекордну кількість екземплярів окулювання, але також має ідеальну семантичну сегментацію та маркування, і враховує тимчасову інформацію таким чином, який не адресується подібними відкритими наборами даних.

Повне розуміння сцени

Нижче наведене відео, опубліковане як допоміжний матеріал для дослідження, демонструє переваги повного 3D-розуміння сцени, при якому приховані об’єкти відомі та відкриті в сцені в усіх обставинах, що дозволяє системі оцінки вивчити асоціацію частково окулюваних видів з цілим (позначеним) об’єктом.

Джерело: http://sailvos.web.illinois.edu/_site/index.html

Результатом став набір даних під назвою SAIL-VOS 3D, який, за заявами авторів, є першим синтетичним відеонабором з кадровим анотацією, інстанс-рівневою сегментацією, глибинною правдою для видів сцени та 2D-анотаціями, обмеженими рамками.

Джерело (Клікніть, щоб збільшити)

Анотації SAIL-VOS 3D включають глибину, інстанс-рівневу модальну та амодальну сегментацію, семантичні мітки та 3D-сітки. Дані включають 484 відео, що складаються з 237 611 кадрів із роздільною здатністю 1280×800, включаючи переходи між кадрами.

Навіть, оригінальні CGI-кадри; другий ряд, інстанс-рівнева сегментація; третій ряд, аمودальна сегментація, яка демонструє глибину розуміння сцени та прозорість, доступну в даних. Джерело

Навіть, оригінальні CGI-кадри; другий ряд, інстанс-рівнева сегментація; третій ряд, аمودальна сегментація, яка демонструє глибину розуміння сцени та прозорість, доступну в даних. Джерело (Клікніть, щоб збільшити)

Набір даних складається з 6 807 кліпів із середньою тривалістю 34,6 кадрів кожний, а дані анотовані 3 460 213 об’єктами, походженням з 3 576 моделей сітки в двигуні гри GTA-V. Ці об’єкти належать до 178 семантичних категорій.

Реконструкція сітки та автоматичне маркування

Оскільки пізніше дослідження наборів даних, ймовірно, буде проводитися над реальними зображеннями, сітки в SAIL-VOS 3D генеруються за допомогою машинного навчання, а не походять з двигуна гри GTA-V.

З програмним і по суті 'голографічним' розумінням всього представлення сцени, зображення SAIL-VOS 3D можуть синтезувати представлення об'єктів, які зазвичай приховані окулюванням, наприклад, далекої руки персонажа, який повертається, в спосіб, який інакше залежав би від багатьох представницьких екземплярів у реальному відео. Джерело: https://arxiv.org/pdf/2105.08612.pdf

З програмним і по суті ‘голографічним’ розумінням всього представлення сцени, зображення SAIL-VOS 3D можуть синтезувати представлення об’єктів, які зазвичай приховані окулюванням, наприклад, далекої руки персонажа, який повертається, в спосіб, який інакше залежав би від багатьох представницьких екземплярів у реальному відео. (Клікніть, щоб збільшити) Джерело: https://arxiv.org/pdf/2105.08612.pdf

Оскільки кожен об’єкт у світі GTA-V містить унікальний ідентифікатор, SAIL-VOS витягує ці ідентифікатори з рендерингового двигуна за допомогою бібліотеки хуків скриптів GTA-V. Це вирішує проблему повторного отримання суб’єкта, якщо він тимчасово покине поле зору, оскільки маркування є постійним і надійним. У середовищі доступно 162 об’єкти, які дослідники відображають на відповідну кількість класів.

Різноманіття сцен і об’єктів

Багато об’єктів у двигуні гри GTA-V є звичайними в природі, тому інвентар SAIL-VOS містить щасливу 60% класів, присутніх у часто використовуваному наборі даних MS-COCO 2014 року Microsoft.

Набір даних SAIL-VOS включає велике різноманіття внутрішніх та зовнішніх сцен під різними погодними умовами, з персонажами, які носять різноманітний одяг.

Набір даних SAIL-VOS включає велике різноманіття внутрішніх та зовнішніх сцен під різними погодними умовами, з персонажами, які носять різноманітний одяг. (Клікніть, щоб збільшити)

Застосовність

Для забезпечення сумісності з загальним напрямком досліджень у цій галузі та для підтвердження того, що цей синтетичний підхід може принести користь не-синтетичним проектам, дослідники оцінили набір даних за допомогою кадрового підходу виявлення, використаного для MS-COCO та виклику PASCAL Visual Object Classes (VOC) 2012 року, з середньою точністю як метрикою.

Дослідники виявили, що попереднє навчання на наборі даних SAIL-VOS покращує продуктивність перетину над об’єднанням (IoU) на 19%, з відповідним покращенням продуктивності VideoMatch, з 55% до 74% на невидимих даних.

Однак, у випадках екстремальної окулювання були випадки, коли всі старі методи залишилися нездатними розпізнати об’єкт або людину, хоча дослідники прогнозують, що це можна буде виправити в майбутньому шляхом дослідження сусідніх кадрів для встановлення підстави для аمودальної маски.

У двох правих зображеннях традиційні алгоритми сегментації не змогли розпізнати жіночу фігуру з дуже обмеженої частини її голови, яка видима. Пізніші інновації з оцінкою оптичного потоку можуть покращити ці результати.

У двох правих зображеннях традиційні алгоритми сегментації не змогли розпізнати жіночу фігуру з дуже обмеженої частини її голови, яка видима. Пізніші інновації з оцінкою оптичного потоку можуть покращити ці результати. (Клікніть, щоб збільшити)

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai