Взгляд Anderson

Синтетические данные: мостящий разрыв в скрытых объектах с помощью Grand Theft Auto

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Университета Иллинойса создали новый набор данных компьютерного зрения, который использует синтетические изображения, сгенерированные игровым движком Grand Theft Auto, чтобы помочь решить одну из самых сложных проблем в семантической сегментации – распознавание объектов, которые видны только частично на исходных изображениях и видео.

Для этого, как описано в статье, исследователи использовали игровой движок GTA-V для генерации синтетического набора данных, который не только содержит рекордное количество экземпляров перекрытия, но и имеет идеальную семантическую сегментацию и маркировку, и учитывает временную информацию так, как это не делается в аналогичных открытых наборах данных.

Полное понимание сцены

Видео ниже, опубликованное в качестве вспомогательного материала для исследования, иллюстрирует преимущества полного трехмерного понимания сцены, когда скрытые объекты известны и открыты в сцене во всех обстоятельствах, что позволяет системе оценки учиться ассоциировать частично перекрытые виды с целым (помеченным) объектом.

Источник: http://sailvos.web.illinois.edu/_site/index.html

Результатом является набор данных, называемый SAIL-VOS 3D, который, по утверждению авторов, является первым синтетическим видео-набором данных с кадровой аннотацией, сегментацией на уровне экземпляров, глубиной сцены и 2D-аннотациями, ограниченными рамками.

Источник (Нажмите, чтобы увеличить)

Маркировки SAIL-VOS 3D включают глубину, сегментацию на уровне модального и амодальную сегментацию, семантические метки и 3D-модели. Данные включают 484 видео, всего 237 611 кадров с разрешением 1280×800, включая переходы между кадрами.

Выше, исходные кадры CGI; второй ряд, сегментация на уровне экземпляров; третий ряд, а-modalная сегментация, которая иллюстрирует глубину понимания сцены и прозрачность, доступные в данных. Источник

Выше, исходные кадры CGI; второй ряд, сегментация на уровне экземпляров; третий ряд, а-modalная сегментация, которая иллюстрирует глубину понимания сцены и прозрачность, доступные в данных. Источник (Нажмите, чтобы увеличить)

Набор данных делится на 6 807 клипов со средней длиной 34,6 кадра каждый, и данные аннотированы 3 460 213 экземплярами объектов, полученными из 3 576 моделей сетки в игровом движке GTA-V. Эти объекты относятся к 178 семантическим категориям.

Реконструкция сетки и автоматическая маркировка

Поскольку последующие исследования наборов данных, скорее всего, будут проводиться на реальных изображениях, сетки в SAIL-VOS 3D генерируются с помощью машинного обучения, а не получены из игрового движка GTA-V.

С помощью программного и по сути 'голографического' понимания всего представления сцены, изображения SAIL-VOS 3D могут синтезировать представления объектов, обычно скрытых перекрытиями, таких как отдаленная рука персонажа, поворачивающегося здесь, так, как это было бы невозможно без множества представительных экземпляров в реальных кадрах. Источник: https://arxiv.org/pdf/2105.08612.pdf

С помощью программного и по сути ‘голографического’ понимания всего представления сцены, изображения SAIL-VOS 3D могут синтезировать представления объектов, обычно скрытых перекрытиями, таких как отдаленная рука персонажа, поворачивающегося здесь, так, как это было бы невозможно без множества представительных экземпляров в реальных кадрах. (Нажмите, чтобы увеличить) Источник: https://arxiv.org/pdf/2105.08612.pdf

Поскольку каждый объект в мире GTA-V имеет уникальный идентификатор, SAIL-VOS извлекает их из движка рендеринга с помощью библиотеки хуков GTA-V. Это решает проблему повторного получения субъекта, если он временно покидает поле зрения, поскольку маркировка постоянна и надежна. В окружении имеется 162 объекта, которые исследователи сопоставили с соответствующим количеством классов.

Разнообразие сцен и объектов

Многие объекты в игровом движке GTA-V являются общими в природе, и поэтому инвентарь SAIL-VOS содержит 60% классов, присутствующих в часто используемом наборе данных MS-COCO 2014 года Microsoft.

Набор данных SAIL-VOS включает большое разнообразие внутренних и внешних сцен в различных погодных условиях, с персонажами в разнообразной одежде.

Набор данных SAIL-VOS включает большое разнообразие внутренних и внешних сцен в различных погодных условиях, с персонажами в разнообразной одежде. (Нажмите, чтобы увеличить)

Применимость

Чтобы обеспечить совместимость с общим направлением исследований в этой области и подтвердить, что этот синтетический подход может принести пользу несинтетическим проектам, исследователи оценили набор данных, используя подход кадровой детекции, применяемый для MS-COCO и вызова PASCAL Visual Object Classes (VOC) 2012 года, с средней точностью в качестве метрики.

Исследователи обнаружили, что предварительная тренировка на наборе данных SAIL-VOS улучшает производительность пересечения над объединением (IoU) на 19%, с соответствующим улучшением производительности VideoMatch, с 55% до 74% на невиданных данных.

Однако в случаях экстремального перекрытия были случаи, когда все старые методы оставались не в состоянии идентифицировать объект или человека, хотя исследователи прогнозируют, что это может быть исправлено в будущем путем изучения соседних кадров для установления причины а-modalной маски.

На двух правых изображениях традиционные алгоритмы сегментации не смогли идентифицировать женскую фигуру по очень ограниченной части ее головы, видимой здесь. Более поздние инновации с оценкой оптического потока могут улучшить эти результаты.

На двух правых изображениях традиционные алгоритмы сегментации не смогли идентифицировать женскую фигуру по очень ограниченной части ее головы, видимой здесь. Более поздние инновации с оценкой оптического потока могут улучшить эти результаты. (Нажмите, чтобы увеличить)

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai