Ángulo de Anderson
UrbanScene3D: Paisajes urbanos etiquetados semánticamente para la investigación de vehículos autónomos

El Centro de Investigación de Computación Visual de la Universidad de Shenzhen en China ha desarrollado un conjunto de datos de escena urbana a gran escala que ofrece simulaciones diversificadas y completamente etiquetadas semánticamente de varias ciudades importantes de todo el mundo, como un recurso para iniciativas de investigación de aprendizaje automático que simulan entornos de conducción, drones y otros tipos de entornos.

Llamado UrbanScene3D, el simulador cuenta con una variedad de reconstrucciones urbanas densas y detalladas, con texturas realistas. Muchos de los escenarios se crean mediante modeladores profesionales que trabajan a partir de datos aéreos disponibles públicamente, y presentan un nivel de optimización liderada por humanos que actualmente es difícil o costoso de simular en sistemas de síntesis de imágenes programáticos y captura de RGB-D basados en fotogrametría, como Campos de Radiancia Neural (NeRF).
El proyecto aborda una de las principales desigualdades en la investigación de visión por computadora: la falta de conjuntos de datos de entornos urbanos ricos y etiquetados semánticamente con estructura de modelo de alta calidad, en comparación con la gran disponibilidad de datos semánticos y de modelado relacionados con escenas interiores.
Las simulaciones que se ejecutan en UrbanScene3D pueden proporcionar la verdad fundamental para la generación de conjuntos de datos específicos de proyectos relacionados con vehículos y drones autónomos, entre otras posibilidades.

UrbanScene3D ejecutando AirSim y produciendo mapas de profundidad. Fuente: https://arxiv.org/pdf/2107.04286.pdf
Los archivos fuente del proyecto, alrededor de 70 GB, se han publicado de forma gratuita para fines de investigación y uso educativo. La implementación se puede ejecutar en un entorno C++ o en Python, y requiere Unreal Engine 4 (con 4.24 recomendado). Para proyectos aéreos, como la capacitación y simulación de drones, el proyecto también admite AirSim de Microsoft.
UrbanScene3D cuenta con seis entornos CAD modelados profesionalmente generados por artistas profesionales a partir de imágenes o mapas satelitales, junto con cinco entornos del mundo real reconstruidos. Las escenas CAD presentan reconstrucciones de Nueva York, Chicago, San Francisco, Shenzhen, Suzhou y Shanghái. Los datos derivados de imágenes se centran en cinco escenas específicas de estas ciudades, incluyendo un hospital y un campus universitario.
Los datos de adquisición brutos para UrbanScene3D también se están poniendo a disposición, con imágenes aéreas de alta resolución de 6000×4000 píxeles y videos aéreos en 4K, junto con poses y los modelos 3D reconstruidos.
El proyecto tiene como objetivo abordar las limitaciones de los conjuntos de datos de escenas urbanas existentes y es el primero en proporcionar detalles de modelado CAD de alta calidad junto con etiquetado semántico y información de mapa de profundidad. Esfuerzos anteriores incluyen:
COCO
Lanzado en 2014, el conjunto de datos Common Objects in Context (COCO) de Microsoft conjunto de datos cuenta con 1,5 millones de instancias de objetos en 80 categorías, junto con reconocimiento de objetos en contexto y cinco subtítulos por imagen. COCO no cuenta con malla GT con pose o información de profundidad.

El conjunto de iconos del explorador COCO. Fuente: https://arxiv.org/pdf/1405.0312.pdf
The KITTI Vision Benchmark Suite
Producido por el Instituto de Tecnología de Karlsruhe y el Instituto Tecnológico de Toyota en Chicago, KITTI proporciona información de profundidad, pero no máscaras de instancia.
CityScape
El conjunto de datos Cityscapes Dataset para la comprensión de escenas urbanas semánticas (también conocido como CityScape) se lanzó en 2016 y cuenta con segmentación semántica densa y segmentación de instancias de personas y vehículos. Como tal, su objetivo principal es ayudar en el desarrollo de sistemas de conducción autónoma y sectores adyacentes de monitoreo urbano.
Cuenta con ocho clases, incluyendo plano, humano, vehículo, construcción, objeto, naturaleza, cielo y vacío, y ofrece anotaciones finas en 5000 imágenes.

Fuente: https://www.cityscapes-dataset.com/examples/#fine-annotations
CityScape se lanzó en 2020 y es similar en características a UrbanScene3D, excepto que carece de modelado CAD.
ApolloCar3D
Lanzado en 2018 y liderado por Baidu Research, ApolloCar3D es una colaboración entre varias unidades de investigación académica en Asia y el oeste, incluyendo la Universidad de California en San Diego, la Universidad Nacional de Australia y la Universidad Politécnica del Noroeste en Xi’an, China.
ApolloCar3D se centra específicamente en la investigación de vehículos autónomos a nivel de suelo y cuenta con 5,277 imágenes de conducción y más de 60,000 instancias de vehículos impulsados por modelos 3D CAD detallados renderizados en tamaños absolutos y etiquetados para puntos clave semánticos. El conjunto de datos es más de 20 veces más grande que KITTI, pero, a diferencia de UrbanScene3D, solo cuenta con información de profundidad parcial.

Se definen 66 puntos clave para cada vehículo con modelo CAD en el conjunto de datos ApolloCar3D. Fuente: https://arxiv.org/pdf/1811.12222.pdf
HoliCity
HoliCity, descrito como ‘Una plataforma de datos a escala de ciudad para aprender estructuras 3D holísticas’, es una colaboración de 2021 entre UC Berkeley, Stanford, USC y Bytedance Research en Palo Alto. Consiste en un conjunto de datos 3D a escala de ciudad con un alto nivel de detalle estructural y ofrece 6,300 escenas de panorama del mundo real que cubren un área que supera los 20 kilómetros cuadrados.
El proyecto está dirigido a aplicaciones del mundo real, como la localización, la realidad aumentada, el mapeo y la reconstrucción a escala de ciudad. Aunque cuenta con modelado CAD, el nivel de detalle es inferior al de UrbanScene3D.

Fuente: https://github.com/zhou13/holicity













