Погляд Anderson
Синтетичні дані: подолання прогалини окулювання за допомогою Grand Theft Auto

Дослідники з Університету Іллінойсу створили новий набір даних комп’ютерного зору, який використовує синтетичні зображення, згенеровані двигуном гри Grand Theft Auto, щоб допомогти вирішити одну з найбільш складних проблем у семантичному сегментуванні – розпізнавання об’єктів, які лише частково видимі на джерельних зображеннях і відео.
Для цього, як описано в статті, дослідники використали двигун гри GTA-V для генерації синтетичного набору даних, який не тільки містить рекордну кількість екземплярів окулювання, але також має ідеальну семантичну сегментацію та маркування, і враховує тимчасову інформацію таким чином, який не адресується подібними відкритими наборами даних.
Повне розуміння сцени
Нижче наведене відео, опубліковане як допоміжний матеріал для дослідження, демонструє переваги повного 3D-розуміння сцени, при якому приховані об’єкти відомі та відкриті в сцені в усіх обставинах, що дозволяє системі оцінки вивчити асоціацію частково окулюваних видів з цілим (позначеним) об’єктом.
Джерело: http://sailvos.web.illinois.edu/_site/index.html
Результатом став набір даних під назвою SAIL-VOS 3D, який, за заявами авторів, є першим синтетичним відеонабором з кадровим анотацією, інстанс-рівневою сегментацією, глибинною правдою для видів сцени та 2D-анотаціями, обмеженими рамками.

Джерело (Клікніть, щоб збільшити)
Анотації SAIL-VOS 3D включають глибину, інстанс-рівневу модальну та амодальну сегментацію, семантичні мітки та 3D-сітки. Дані включають 484 відео, що складаються з 237 611 кадрів із роздільною здатністю 1280×800, включаючи переходи між кадрами.

Навіть, оригінальні CGI-кадри; другий ряд, інстанс-рівнева сегментація; третій ряд, аمودальна сегментація, яка демонструє глибину розуміння сцени та прозорість, доступну в даних. Джерело (Клікніть, щоб збільшити)
Набір даних складається з 6 807 кліпів із середньою тривалістю 34,6 кадрів кожний, а дані анотовані 3 460 213 об’єктами, походженням з 3 576 моделей сітки в двигуні гри GTA-V. Ці об’єкти належать до 178 семантичних категорій.
Реконструкція сітки та автоматичне маркування
Оскільки пізніше дослідження наборів даних, ймовірно, буде проводитися над реальними зображеннями, сітки в SAIL-VOS 3D генеруються за допомогою машинного навчання, а не походять з двигуна гри GTA-V.

З програмним і по суті ‘голографічним’ розумінням всього представлення сцени, зображення SAIL-VOS 3D можуть синтезувати представлення об’єктів, які зазвичай приховані окулюванням, наприклад, далекої руки персонажа, який повертається, в спосіб, який інакше залежав би від багатьох представницьких екземплярів у реальному відео. (Клікніть, щоб збільшити) Джерело: https://arxiv.org/pdf/2105.08612.pdf
Оскільки кожен об’єкт у світі GTA-V містить унікальний ідентифікатор, SAIL-VOS витягує ці ідентифікатори з рендерингового двигуна за допомогою бібліотеки хуків скриптів GTA-V. Це вирішує проблему повторного отримання суб’єкта, якщо він тимчасово покине поле зору, оскільки маркування є постійним і надійним. У середовищі доступно 162 об’єкти, які дослідники відображають на відповідну кількість класів.
Різноманіття сцен і об’єктів
Багато об’єктів у двигуні гри GTA-V є звичайними в природі, тому інвентар SAIL-VOS містить щасливу 60% класів, присутніх у часто використовуваному наборі даних MS-COCO 2014 року Microsoft.

Набір даних SAIL-VOS включає велике різноманіття внутрішніх та зовнішніх сцен під різними погодними умовами, з персонажами, які носять різноманітний одяг. (Клікніть, щоб збільшити)
Застосовність
Для забезпечення сумісності з загальним напрямком досліджень у цій галузі та для підтвердження того, що цей синтетичний підхід може принести користь не-синтетичним проектам, дослідники оцінили набір даних за допомогою кадрового підходу виявлення, використаного для MS-COCO та виклику PASCAL Visual Object Classes (VOC) 2012 року, з середньою точністю як метрикою.
Дослідники виявили, що попереднє навчання на наборі даних SAIL-VOS покращує продуктивність перетину над об’єднанням (IoU) на 19%, з відповідним покращенням продуктивності VideoMatch, з 55% до 74% на невидимих даних.
Однак, у випадках екстремальної окулювання були випадки, коли всі старі методи залишилися нездатними розпізнати об’єкт або людину, хоча дослідники прогнозують, що це можна буде виправити в майбутньому шляхом дослідження сусідніх кадрів для встановлення підстави для аمودальної маски.













