Взгляд Anderson

UrbanScene3D: Семантически помеченные городские пейзажи для исследований автономных транспортных средств

mm
Добавьте Unite.AI в избранные источники в Google

Исследовательский центр визуальных вычислений в Шэньчжэньском университете в Китае разработал большой набор данных городских сцен, предлагающий разнообразные, полностью семантически помеченные симуляции многих крупных городов мира, в качестве ресурса для исследований в области управления, дронов и других видов машинного обучения.

Называемый UrbanScene3D, симулятор имеет ряд плотных и детальных, навигируемых городских реконструкций с реалистичными текстурами. Многие из сценариев созданы профессиональными модельерами, работающими с публично доступными аэрофотоснимками, и имеют уровень человеческой оптимизации, который в настоящее время трудно или дорого симулировать в полностью программных системах синтеза изображений и захвата RGB-D на основе фотограмметрии, таких как Нейронные радиационные поля (NeRF).

 

Проект решает одну из основных проблем в исследованиях компьютерного зрения – нехватку богатых, семантически помеченных городских окружений с высококачественной структурой моделей по сравнению с очень высоким уровнем доступности подобных семантических и моделей данных, связанных с внутренними сценами.

Симуляции, запущенные в UrbanScene3D, могут обеспечить основу для генерации последующих проектно-специфических наборов данных, связанных с автономными транспортными средствами и дронами, среди прочего.

UrbanScene3D running AirSim, and producing depth maps. Source: https://arxiv.org/pdf/2107.04286.pdf

UrbanScene3D running AirSim, and producing depth maps. Source: https://arxiv.org/pdf/2107.04286.pdf

Исходные файлы проекта, около 70 ГБ, были выпущены бесплатно для целей исследований и образовательного использования. Реализация может работать в среде C++ или Python и требует Unreal Engine 4 (с рекомендованной версией 4.24). Для аэрофотоснимков, таких как обучение и симуляция дронов, проект также поддерживает AirSim от Microsoft.

UrbanScene3D имеет шесть профессионально смоделированных CAD-окружений, созданных профессиональными художниками из изображений или спутниковых карт, вместе с пятью реконструированными реальными окружениями. CAD-сцены включают реконструкции Нью-Йорка, Чикаго, Сан-Франциско, Шэньчжэня, Сучжоу и Шанхая. Изображения, полученные из данных, сосредоточены на пяти конкретных сценах из этих городов, включая больницу и университетский кампус.

Города, представленные в UrbanScene3D.

Города, представленные в UrbanScene3D.

Сырые данные сбора для UrbanScene3D также будут доступны, включая высокоразрешительные аэрофотоснимки размером 6000×4000 пикселей и 4K аэрофотоснимки, вместе с позами и реконструированными 3D-моделями.

Проект направлен на решение ограничений существующих городских наборов данных и является первым, который обеспечивает высококачественные CAD-модели вместе с семантической пометкой и информацией о глубине. Предыдущие попытки включают:

COCO

Выпущенный в 2014 году, набор данных Microsoft Common Objects in Context (COCO) набор данных включает 1,5 миллиона объектов в 80 категориях, вместе с распознаванием объектов в контексте и пятью подписями к каждому изображению. COCO не имеет GT-сетки с информацией о позе или глубине.

Иконка набора COCO.

Иконка набора COCO. Source: https://arxiv.org/pdf/1405.0312.pdf

The KITTI Vision Benchmark Suite

Созданный Карлсруэским технологическим институтом и Технологическим институтом Тойоты в Чикаго, KITTI обеспечивает информацию о глубине, но не имеет масок экземпляров.

CityScape

Набор данных Cityscapes Dataset для семантического понимания городских сцен (также известный как CityScape) был выпущен в 2016 году и включает плотную семантическую сегментацию и сегментацию экземпляров людей и транспортных средств. Таким образом, его основной целью является помощь в разработке систем автономного вождения и смежных секторов городского мониторинга.

Он включает восемь классов, включая плоскость, человек, транспортное средство, строительство, объект, природа, небо и пустота, и предлагает тонкие аннотации по 5000 изображениям.

Источник: https://www.cityscapes-dataset.com/examples/#fine-annotations

Источник: https://www.cityscapes-dataset.com/examples/#fine-annotations

CityScape был выпущен в 2020 году и имеет подобные функции с UrbanScene3D, за исключением того, что он не имеет CAD-моделирования.

ApolloCar3D

Запущенный в 2018 году и возглавляемый исследовательским центром Baidu, ApolloCar3D является сотрудничеством между несколькими академическими исследовательскими подразделениями на Западе и в Азии, включая Университет Калифорнии в Сан-Диего, Австралийский национальный университет и Северо-Западный политехнический университет в Сиане, Китай.

ApolloCar3D специально направлен на исследования автономных транспортных средств на уровне земли и включает 5 277 изображений вождения и более 60 000 экземпляров транспортных средств, обеспеченных подробными 3D-моделями CAD, отображаемыми в абсолютных размерах, и помеченными для семантических ключевых точек. Набор данных более чем в 20 раз больше, чем KITTI, но, в отличие от UrbanScene3D, имеет только частичную информацию о глубине.

66 ключевых точек определены для каждого транспортного средства в наборе данных ApolloCar3D. Источник: https://arxiv.org/pdf/1811.12222.pdf

66 ключевых точек определены для каждого транспортного средства в наборе данных ApolloCar3D. Источник: https://arxiv.org/pdf/1811.12222.pdf

HoliCity

HoliCity, описываемый как ‘Платформа городского масштаба для изучения целостных 3D-структур’, является сотрудничеством 2021 года между Университетом Калифорнии в Беркли, Стэнфордским университетом, Университетом Южной Калифорнии и исследовательским центром Bytedance в Пало-Альто. Он включает набор данных городского масштаба с высоким уровнем структурных деталей и предлагает 6 300 реальных панорамных сцен, покрывающих площадь более 20 квадратных километров.

Проект направлен на реальные приложения, такие как локализация, дополненная реальность, картографирование и реконструкция городского масштаба. Хотя он имеет CAD-моделирование, уровень детализации ниже, чем у UrbanScene3D.

Источник: https://github.com/zhou13/holicity

Источник: https://github.com/zhou13/holicity

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai