Góc nhìn Anderson

UrbanScene3D: Các Thành Phố Được Gán Nhãn Semantics cho Nghiên Cứu Xe Tự Lái

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trung Tâm Nghiên Cứu Máy Tính tại Đại Học Thẩm Quyến ở Trung Quốc đã phát triển một bộ dữ liệu cảnh quan thành phố quy mô lớn cung cấp các mô phỏng được gán nhãn semantically đa dạng và đầy đủ của một số thành phố lớn trên thế giới, như một tài nguyên cho các sáng kiến nghiên cứu môi trường mô phỏng học máy, bao gồm lái xe, máy bay không người lái và các loại khác.

Được gọi là UrbanScene3D, mô phỏng này có các bản tái tạo đô thị chi tiết và dày đặc với các kết cấu thực tế. Nhiều kịch bản được tạo bởi các người mẫu chuyên nghiệp làm việc từ dữ liệu hàng không công khai, và có mức độ tối ưu hóa do con người dẫn đầu hiện đang khó hoặc tốn kém để mô phỏng trong các hệ thống tổng hợp hình ảnh và thu thập RGB-D hoàn toàn dựa trên photogrammetry, như Trường Neuron Radiance (NeRF).

 

Dự án này giải quyết một trong những sự mất cân bằng lớn trong nghiên cứu thị giác máy tính – sự thiếu hụt của các bộ dữ liệu môi trường đô thị phong phú và được gán nhãn semantically với cấu trúc mô hình chất lượng cao so với mức độ sẵn có rất cao của dữ liệu semantical và mô hình tương tự liên quan đến các cảnh trong nhà.

Các mô phỏng chạy trong UrbanScene3D có thể cung cấp sự thật cơ bản cho việc tạo ra các bộ dữ liệu dự án cụ thể liên quan đến xe tự lái và máy bay không người lái, trong số các khả năng khác.

UrbanScene3D chạy AirSim và tạo ra các bản đồ độ sâu. Nguồn: https://arxiv.org/pdf/2107.04286.pdf

UrbanScene3D chạy AirSim và tạo ra các bản đồ độ sâu. Nguồn: https://arxiv.org/pdf/2107.04286.pdf

Các tệp nguồn của dự án, khoảng 70gb, đã được phát hành miễn phí cho mục đích sử dụng nghiên cứu và giáo dục. Việc triển khai có thể chạy trong môi trường C++ hoặc Python, và yêu cầu Unreal Engine 4 (với 4.24 được khuyến nghị). Đối với các dự án trên không, như đào tạo và mô phỏng máy bay không người lái, dự án cũng hỗ trợ AirSim của Microsoft.

UrbanScene3D có sáu môi trường CAD được mô hình hóa chuyên nghiệp được tạo bởi các nghệ sĩ chuyên nghiệp từ hình ảnh hoặc từ bản đồ vệ tinh, cùng với năm môi trường thế giới thực được tái tạo. Các cảnh CAD có các bản tái tạo của thành phố New York, Chicago, San Francisco, Thẩm Quyến, Tô Châu và Thượng Hải. Dữ liệu được tạo từ hình ảnh tập trung vào năm cảnh cụ thể từ các thành phố này, bao gồm một bệnh viện và một khuôn viên trường đại học.

Các thành phố được đại diện trong UrbanScene3D.

Các thành phố được đại diện trong UrbanScene3D.

Dữ liệu thu được thô cho UrbanScene3D cũng được cung cấp, bao gồm hình ảnh hàng không độ phân giải cao ở 6000×4000 pixel, và video hàng không 4K, cùng với các tư thế và mô hình 3D được tái tạo.

Dự án này nhằm giải quyết các hạn chế của các bộ dữ liệu cảnh thành phố hiện có, và là dự án đầu tiên cung cấp chi tiết mô hình CAD cấp cao cùng với gán nhãn semantically và thông tin bản đồ độ sâu. Các nỗ lực trước đây bao gồm:

COCO

Phát hành vào năm 2014, bộ dữ liệu COCO của Microsoft có 1,5 triệu trường hợp đối tượng trên 80 danh mục, cùng với nhận dạng đối tượng trong ngữ cảnh, và năm chú thích cho mỗi hình ảnh. COCO không có lưới mô hình GT với thông tin tư thế hoặc độ sâu.

Bộ biểu tượng người khám phá COCO.

Bộ biểu tượng người khám phá COCO. Nguồn: https://arxiv.org/pdf/1405.0312.pdf

Bộ Benchmark Thị Giác KITTI

Được sản xuất bởi Viện Công nghệ Karlsruhe và Viện Công nghệ Toyota tại Chicago, KITTI cung cấp thông tin độ sâu, nhưng không có mặt nạ thể hiện.

CityScape

Bộ dữ liệu Cityscapes Dataset cho Sự Hiểu Biết Cảnh Thành Phố Semantics (còn được gọi là CityScape) được phát hành vào năm 2016, và có phân đoạn semantical dày đặc, và phân đoạn thể hiện của người và xe. Như vậy, mục tiêu chính của nó là hỗ trợ sự phát triển của các hệ thống lái xe tự động và các lĩnh vực giám sát đô thị liền kề.

Nó có tám lớp, bao gồm phẳng, con người, xe, xây dựng, đối tượng, tự nhiên, trờikhông, và cung cấp chú thích mịn chú thích trên 5000 hình ảnh.

CityScape được phát hành vào năm 2020, và tương tự như UrbanScene3D, ngoại trừ việc nó thiếu mô hình CAD.

ApolloCar3D

Được ra mắt vào năm 2018 và do Baidu Research dẫn đầu, ApolloCar3D là một sự hợp tác giữa một số đơn vị nghiên cứu học thuật trên khắp thế giới và châu Á, bao gồm Đại học California tại San Diego, Đại học Quốc gia Úc, và Đại học Bách khoa Northwestern tại Tây An, Trung Quốc.

ApolloCar3D nhắm vào nghiên cứu xe tự lái cấp mặt đất, và có 5.277 hình ảnh lái xe, và hơn 60.000 thể hiện xe được cung cấp bởi các mô hình CAD 3D chi tiết được kết xuất ở kích thước tuyệt đối, và được gán nhãn cho các điểm chính semantical. Bộ dữ liệu này lớn hơn 20 lần so với KITTI, nhưng, không giống như UrbanScene3D, chỉ có thông tin độ sâu một phần.

66 điểm chính được định nghĩa cho mỗi xe được tăng cường CAD trong bộ dữ liệu ApolloCar3D. Nguồn: https://arxiv.org/pdf/1811.12222.pdf

66 điểm chính được định nghĩa cho mỗi xe được tăng cường CAD trong bộ dữ liệu ApolloCar3D. Nguồn: https://arxiv.org/pdf/1811.12222.pdf

HoliCity

HoliCity, được mô tả là ‘Một Nền Tảng Dữ Liệu Cấp Thành Phố để Học Cấu Trúc 3D Toàn Diện’, là một sự hợp tác năm 2021 giữa UC Berkeley, Stanford, USC và Bytedance Research tại Palo Alto. Nó bao gồm một bộ dữ liệu 3D cấp thành phố với mức độ chi tiết cấu trúc cao, và cung cấp 6.300 cảnh toàn cảnh thế giới thực bao phủ một khu vực vượt quá 20 kilômét vuông.

Dự án này nhắm vào các ứng dụng thực tế như định vị, thực tế ảo tăng cường, lập bản đồ và tái tạo cấp thành phố. Mặc dù nó có mô hình CAD, nhưng mức độ chi tiết thấp hơn so với UrbanScene3D.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai