Sudut Anderson
UrbanScene3D: Lanskap Kota yang Diberi Label Semantik untuk Penelitian Kendaraan Otonom

Pusat Penelitian Komputasi Visual di Universitas Shenzhen, Cina, telah mengembangkan sebuah dataset adegan kota skala besar yang menawarkan simulasi yang beragam dan sepenuhnya diberi label semantik dari sejumlah kota besar di seluruh dunia, sebagai sumber daya untuk inisiatif penelitian lingkungan simulasi mesin, seperti pengemudi, drone, dan lain-lain.

Bernama UrbanScene3D, simulator ini menampilkan berbagai rekonstruksi kota yang padat dan detail, dengan tekstur yang realistis. Banyak skenario yang dibuat oleh pemodel profesional yang bekerja dari data udara yang tersedia secara publik, dan menampilkan tingkat optimasi yang dipimpin manusia yang saat ini sulit atau mahal untuk disimulasikan dalam sistem sintesis gambar dan pengambilan RGB-D yang sepenuhnya programatis berbasis photogrammetry, seperti Neural Radiance Fields (NeRF).
Proyek ini mengatasi salah satu ketidakseimbangan besar dalam penelitian penglihatan komputer – kurangnya dataset lingkungan kota yang kaya dan diberi label semantik dengan struktur model yang berkualitas tinggi, dibandingkan dengan ketersediaan data semantik dan pemodelan yang sangat tinggi untuk adegan interior.
Simulasi yang dijalankan di UrbanScene3D dapat menyediakan kebenaran tanah untuk generasi dataset proyek-spesifik yang berikutnya yang terkait dengan kendaraan otonom dan drone, di antara kemungkinan lainnya.

UrbanScene3D menjalankan AirSim, dan menghasilkan peta kedalaman. Sumber: https://arxiv.org/pdf/2107.04286.pdf
Berkas sumber proyek, sekitar 70gb, telah dirilis secara gratis untuk tujuan penelitian dan penggunaan pendidikan. Implementasi dapat dijalankan dalam lingkungan C++ atau Python, dan memerlukan Unreal Engine 4 (dengan 4.24 yang disarankan). Untuk proyek udara, seperti pelatihan dan simulasi drone, proyek ini juga mendukung AirSim dari Microsoft.
UrbanScene3D menampilkan enam lingkungan CAD yang dimodelkan secara profesional yang dihasilkan oleh seniman profesional dari gambar atau peta satelit, bersama dengan lima lingkungan dunia nyata yang direkonstruksi. Adegan CAD menampilkan rekonstruksi dari New York City, Chicago, San Francisco, Shenzhen, Suzhou, dan Shanghai. Data yang dihasilkan dari gambar berfokus pada lima adegan spesifik dari kota-kota ini, termasuk rumah sakit dan kampus universitas.
Data akuisisi mentah untuk UrbanScene3D juga sedang dibuat tersedia, menampilkan gambar udara dengan resolusi tinggi 6000×4000 piksel, dan video udara 4K, bersama dengan pose dan model 3D yang direkonstruksi.
Proyek ini bertujuan untuk mengatasi keterbatasan dataset adegan kota yang ada, dan merupakan yang pertama untuk menyediakan detail CAD-level yang tinggi bersama dengan pelabelan semantik dan informasi peta kedalaman. Upaya sebelumnya termasuk:
COCO
Dirilis pada 2014, dataset Common Objects in Context (COCO) dari Microsoft dataset menampilkan 1,5 juta contoh objek di 80 kategori, bersama dengan pengenalan objek dalam konteks, dan lima caption per gambar. COCO tidak menampilkan mesh GT dengan pose atau informasi kedalaman.

Ikone himpunan COCO. Sumber: https://arxiv.org/pdf/1405.0312.pdf
The KITTI Vision Benchmark Suite
Dihasilkan oleh Karlsruhe Institute of Technology dan Toyota Technological Institute at Chicago, KITTI menyediakan informasi kedalaman, tetapi tidak menampilkan masker instansi.
CityScape
Dataset Cityscapes untuk Pemahaman Adegan Kota Semantik (aka CityScape) dirilis pada 2016, dan menampilkan segmentasi semantik yang padat, dan segmentasi instansi dari orang dan kendaraan. Sebagai tujuan utamanya adalah untuk membantu dalam pengembangan sistem pengemudi otonom dan sektor pemantauan kota yang terkait.
Ini menampilkan delapan kelas, termasuk datar, manusia, kendaraan, konstruksi, objek, alam, langit dan kosong, dan menawarkan anotasi yang halus anotasi di 5000 gambar.

Sumber: https://www.cityscapes-dataset.com/examples/#fine-annotations
CityScape dirilis pada 2020, dan serupa dalam fitur dengan UrbanScene3D, kecuali bahwa itu tidak memiliki pemodelan CAD.
ApolloCar3D
Diluncurkan pada 2018 dan dipimpin oleh Baidu Research, ApolloCar3D adalah kolaborasi antara sejumlah unit penelitian akademis di barat dan Asia, termasuk University of California at San Diego, Australian National University, dan Northwestern Polytechnical University at Xi’an, Cina.
ApolloCar3D secara khusus ditujukan untuk penelitian kendaraan otonom tingkat tanah, dan menampilkan 5.277 gambar pengemudi, dan lebih dari 60.000 instansi kendaraan yang ditenagai oleh model CAD 3D yang detail dan diberi label untuk titik kunci semantik. Dataset ini lebih dari 20 kali lebih besar dari KITTI, tetapi, tidak seperti UrbanScene3D, hanya menampilkan informasi kedalaman sebagian.

66 titik kunci didefinisikan untuk setiap kendaraan yang ditingkatkan dengan CAD dalam dataset ApolloCar3D. Sumber: https://arxiv.org/pdf/1811.12222.pdf
HoliCity
HoliCity, yang digambarkan sebagai ‘Platform Data Skala Kota untuk Pembelajaran Struktur 3D Holistik’, adalah kolaborasi 2021 kolaborasi antara UC Berkeley, Stanford, USC dan Bytedance Research at Palo Alto. Ini terdiri dari dataset 3D skala kota dengan tingkat detail struktural yang tinggi, dan menawarkan 6.300 adegan panorama dunia nyata yang mencakup area lebih dari 20 kilometer persegi.
Proyek ini ditujukan untuk aplikasi dunia nyata seperti pelokalan, realitas tambahan, pemetaan dan rekonstruksi skala kota. Meskipun menampilkan pemodelan CAD, tingkat detailnya di bawah UrbanScene3D.

Sumber: https://github.com/zhou13/holicity













