Взгляд Anderson
Синтетические данные: мостящий разрыв в скрытых объектах с помощью Grand Theft Auto

Исследователи из Университета Иллинойса создали новый набор данных компьютерного зрения, который использует синтетические изображения, сгенерированные игровым движком Grand Theft Auto, чтобы помочь решить одну из самых сложных проблем в семантической сегментации – распознавание объектов, которые видны только частично на исходных изображениях и видео.
Для этого, как описано в статье, исследователи использовали игровой движок GTA-V для генерации синтетического набора данных, который не только содержит рекордное количество экземпляров перекрытия, но и имеет идеальную семантическую сегментацию и маркировку, и учитывает временную информацию так, как это не делается в аналогичных открытых наборах данных.
Полное понимание сцены
Видео ниже, опубликованное в качестве вспомогательного материала для исследования, иллюстрирует преимущества полного трехмерного понимания сцены, когда скрытые объекты известны и открыты в сцене во всех обстоятельствах, что позволяет системе оценки учиться ассоциировать частично перекрытые виды с целым (помеченным) объектом.
Источник: http://sailvos.web.illinois.edu/_site/index.html
Результатом является набор данных, называемый SAIL-VOS 3D, который, по утверждению авторов, является первым синтетическим видео-набором данных с кадровой аннотацией, сегментацией на уровне экземпляров, глубиной сцены и 2D-аннотациями, ограниченными рамками.

Источник (Нажмите, чтобы увеличить)
Маркировки SAIL-VOS 3D включают глубину, сегментацию на уровне модального и амодальную сегментацию, семантические метки и 3D-модели. Данные включают 484 видео, всего 237 611 кадров с разрешением 1280×800, включая переходы между кадрами.

Выше, исходные кадры CGI; второй ряд, сегментация на уровне экземпляров; третий ряд, а-modalная сегментация, которая иллюстрирует глубину понимания сцены и прозрачность, доступные в данных. Источник (Нажмите, чтобы увеличить)
Набор данных делится на 6 807 клипов со средней длиной 34,6 кадра каждый, и данные аннотированы 3 460 213 экземплярами объектов, полученными из 3 576 моделей сетки в игровом движке GTA-V. Эти объекты относятся к 178 семантическим категориям.
Реконструкция сетки и автоматическая маркировка
Поскольку последующие исследования наборов данных, скорее всего, будут проводиться на реальных изображениях, сетки в SAIL-VOS 3D генерируются с помощью машинного обучения, а не получены из игрового движка GTA-V.

С помощью программного и по сути ‘голографического’ понимания всего представления сцены, изображения SAIL-VOS 3D могут синтезировать представления объектов, обычно скрытых перекрытиями, таких как отдаленная рука персонажа, поворачивающегося здесь, так, как это было бы невозможно без множества представительных экземпляров в реальных кадрах. (Нажмите, чтобы увеличить) Источник: https://arxiv.org/pdf/2105.08612.pdf
Поскольку каждый объект в мире GTA-V имеет уникальный идентификатор, SAIL-VOS извлекает их из движка рендеринга с помощью библиотеки хуков GTA-V. Это решает проблему повторного получения субъекта, если он временно покидает поле зрения, поскольку маркировка постоянна и надежна. В окружении имеется 162 объекта, которые исследователи сопоставили с соответствующим количеством классов.
Разнообразие сцен и объектов
Многие объекты в игровом движке GTA-V являются общими в природе, и поэтому инвентарь SAIL-VOS содержит 60% классов, присутствующих в часто используемом наборе данных MS-COCO 2014 года Microsoft.

Набор данных SAIL-VOS включает большое разнообразие внутренних и внешних сцен в различных погодных условиях, с персонажами в разнообразной одежде. (Нажмите, чтобы увеличить)
Применимость
Чтобы обеспечить совместимость с общим направлением исследований в этой области и подтвердить, что этот синтетический подход может принести пользу несинтетическим проектам, исследователи оценили набор данных, используя подход кадровой детекции, применяемый для MS-COCO и вызова PASCAL Visual Object Classes (VOC) 2012 года, с средней точностью в качестве метрики.
Исследователи обнаружили, что предварительная тренировка на наборе данных SAIL-VOS улучшает производительность пересечения над объединением (IoU) на 19%, с соответствующим улучшением производительности VideoMatch, с 55% до 74% на невиданных данных.
Однако в случаях экстремального перекрытия были случаи, когда все старые методы оставались не в состоянии идентифицировать объект или человека, хотя исследователи прогнозируют, что это может быть исправлено в будущем путем изучения соседних кадров для установления причины а-modalной маски.













