Η γωνία του Anderson
UrbanScene3D: Семантически Помеченные Городские Пейзажи для Исследования Автономных Транспортных Средств

Исследовательский центр визуальных вычислений в Шеньженском университете в Китае разработал большую базу данных городских сцен, которая предлагает разнообразные, полностью семантически помеченные симуляции многих крупных городов мира, как ресурс для исследований в области машинного обучения и симуляции среды.

Этот симулятор, названный UrbanScene3D, имеет ряд плотных и детальных, навигируемых городских реконструкций с реалистичными текстурами. Многие из этих сцен созданы профессиональными модельерами на основе публично доступных аэрофотоснимков и имеют уровень человеческой оптимизации, который в настоящее время трудно или дорого симулировать в полностью программных системах синтеза изображений и захвата RGB-D на основе фотограмметрии, таких как Neural Radiance Fields (NeRF).
Этот проект решает одну из основных проблем в исследованиях компьютерного зрения – нехватку богатых, семантически помеченных городских сред с высококачественной структурой моделей по сравнению с очень высоким уровнем доступности подобных семантических и моделей данных, связанных с внутренними сценами.
Симуляции, запущенные в UrbanScene3D, могут обеспечить основу для генерации последующих проектно-специфических наборов данных, связанных с автономными транспортными средствами и беспилотными летательными аппаратами, среди прочего.
Исходные файлы проекта, около 70 ГБ, были опубликованы бесплатно для целей исследований и образовательного использования. Реализация может работать в среде C++ или Python и требует Unreal Engine 4 (с рекомендованной версией 4.24). Для аэрофотосъемки, такой как обучение и симуляция беспилотников, проект также поддерживает AirSim от Microsoft.
UrbanScene3D включает шесть профессионально смоделированных CAD-сред, созданных профессиональными художниками из изображений или спутниковых карт, а также пять реконструированных реальных сред. CAD-сцены включают реконструкции Нью-Йорка, Чикаго, Сан-Франциско, Шэньжэня, Сучжоу и Шанхая. Изображения, полученные из этих городов, включают конкретные сцены, такие как больница и университетский кампус.
Сырые данные сбора для UrbanScene3D также будут доступны, включая высокоразрешительные аэрофотоснимки размером 6000×4000 пикселей и 4K аэрофотосъемку, а также позы и реконструированные 3D-модели.
COCO
Выпущенный в 2014 году, набор данных Common Objects in Context (COCO) от Microsoft набор данных включает 1,5 миллиона объектных экземпляров по 80 категориям, вместе с распознаванием объектов в контексте и пятью подписями к каждому изображению. COCO не включает GT-сетку с информацией о позе или глубине.

The COCO explorer icon set. Source: https://arxiv.org/pdf/1405.0312.pdf
The KITTI Vision Benchmark Suite
Созданный Карлсруэским технологическим институтом и Технологическим институтом Тойоты в Чикаго, KITTI предоставляет информацию о глубине, но не экземплярные маски.
CityScape
Набор данных Cityscapes для семантического понимания городских сцен (также известный как CityScape) был выпущен в 2016 году и включает плотную семантическую сегментацию и сегментацию экземпляров людей и транспортных средств. Таким образом, его основная цель – помочь в разработке систем автономного вождения и смежных секторов городского мониторинга.
Он включает восемь классов, включая плоскую, человека, транспортное средство, строительство, объект, природу, небо и пустоту, и предлагает тонкие аннотации по 5000 изображениям.

Source: https://www.cityscapes-dataset.com/examples/#fine-annotations
CityScape был выпущен в 2020 году и похож по функциям на UrbanScene3D, за исключением того, что он не включает моделирование CAD.
ApolloCar3D
Запущенный в 2018 году и возглавляемый исследовательским центром Baidu, ApolloCar3D – это сотрудничество между несколькими академическими исследовательскими подразделениями на Западе и в Азии, включая Университет Калифорнии в Сан-Диего, Австралийский национальный университет и Северо-Западный политехнический университет в Сиане, Китай.
ApolloCar3D специально предназначен для исследований автономных транспортных средств на уровне земли и включает 5 277 изображений вождения и более 60 000 экземпляров транспортных средств, работающих на основе подробных 3D-моделей CAD, отображаемых в абсолютных размерах, и помеченных для семантических ключевых точек. Набор данных более чем в 20 раз больше, чем KITTI, но, в отличие от UrbanScene3D, включает только частичную информацию о глубине.

66 ключевых точек определены для каждого транспортного средства в наборе данных ApolloCar3D. Source: https://arxiv.org/pdf/1811.12222.pdf
HoliCity
HoliCity, описанный как ‘Платформа городского масштаба для обучения целостным 3D-структурам’, представляет собой сотрудничество 2021 года между Университетом Калифорнии в Беркли, Стэнфордом, Университетом Южной Калифорнии и исследовательским центром Bytedance в Пало-Альто. Он включает городской 3D-набор данных с высоким уровнем структурных деталей и предлагает 6 300 реальных панорамных сцен, покрывающих площадь более 20 квадратных километров.
Проект направлен на реальные применения, такие как локализация, дополненная реальность, картографирование и городское восстановление. Хотя он включает моделирование CAD, уровень детализации ниже, чем у UrbanScene3D.

Source: https://github.com/zhou13/holicity














