Robot học và AI vật lý
Motional phát hành bộ dữ liệu nuReasoning và ra mắt cuộc thi ECCV

Motional công bố việc phát hành nuReasoning vào ngày 8 tháng 9 năm 2026, mô tả nó là bộ dữ liệu mở đầu tiên trên thế giới tập trung vào suy luận, với các kịch bản đuôi dài cho xe tự lái, và ra mắt một cuộc thi nghiên cứu đi kèm tại Hội nghị Máy tính Thị giác Châu Âu (ECCV) ở Thụy Điển. Bộ dữ liệu này được tạo ra hợp tác với UCLA Mobility Lab và giám đốc của nó, Giáo sư Jiaqi Ma.
Thông báo của Motional định vị nuReasoning như tài liệu đào tạo cho các hệ thống tự lái đầu cuối, nhắm vào những trường hợp ngoại lệ hiếm gặp mà chỉ có cảm biến không đủ. Các mô hình Vision-Language-Action (thị giác-ngôn ngữ-hành động) kết hợp nhận dạng cảnh với quyết định về cách hành động, và Motional cho rằng các mô hình này cần dữ liệu đào tạo truyền tải logic phía sau một hành động lái xe chứ không chỉ là hành động đúng. Bộ dữ liệu được thiết kế để dạy các mô hình về mối quan hệ không gian, suy luận quyết định lái xe, dự đoán rủi ro và cân nhắc các kết quả thay thế.
Thành phần bộ dữ liệu
nuReasoning bao gồm 20.000 kịch bản đuôi dài, mỗi kịch bản là một đoạn video dài ít nhất 20 giây được gắn chú thích suy luận đã được con người xác thực. Các sự kiện này được khai thác từ dữ liệu đội xe của Motional thu thập tại Las Vegas, Pittsburgh, Los Angeles, Boston và Singapore, và công ty báo cáo hơn 105 giờ các trường hợp ngoại lệ đòi hỏi suy luận, bao gồm hoạt động người đi bộ bất thường, khu vực công trình và xây dựng đường ban đêm, giao thông động vật, và các kịch bản tầm nhìn hạn chế. Bộ chú thích tổng cộng 247.000 chú thích suy luận đã được con người xác thực, chia thành ba loại: Suy luận không gian, Suy luận quyết định và Suy luận phản thực, cùng với dữ liệu cảm biến đa phương tiện cho việc biểu diễn cảnh ba chiều.
Bản ghi nuReasoning cung cấp cấu trúc bổ sung. Các đoạn video dài khoảng 20 giây và được lấy mẫu ở tần suất 10 Hz, bao gồm 17.000 đoạn video đào tạo, 2.000 đoạn video xác nhận và 1.000 đoạn video kiểm tra riêng tư. Dữ liệu cảm biến bao gồm các camera đa góc đồng bộ, LiDAR cho các đoạn video hỗ trợ, hiệu chuẩn và trạng thái ego, chú thích đối tượng 3D, bản đồ HD dạng vector, đèn giao thông, lộ trình đường đi và lệnh điều hướng. Để chọn tài liệu đuôi dài, một bộ đánh giá AI đã chấm điểm hơn 100.000 đoạn video ứng cử dài 30 giây đã được lọc trước, lấy từ hơn 10.000 giờ lái xe, sau đó được con người xác thực và lựa chọn khung hình chính.
Các chú thích Suy luận không gian bao gồm hiểu biết 2D-3D tập trung vào đối tượng, ngữ cảnh bản đồ và topo, vị trí tương đối, tốc độ, chuyển động tương lai và tương tác với xe ego, được chú thích ở tần suất 1 Hz. Suy luận quyết định ghi lại mô tả cảnh, các thành phần quan trọng, các meta-hành động dọc và ngang, và một chuỗi nguyên nhân giải thích hành vi đã chọn. Suy luận phản thực đánh giá các hành động thay thế của ego so với các kết quả quan trọng về an toàn và mức độ rủi ro được gắn nhãn an toàn, không tối ưu hoặc không an toàn; các chú thích quyết định và phản thực được ghi lại ở tần suất 0.2 Hz. Bản ghi cũng nêu rằng bộ dữ liệu áp dụng quy trình bảo vệ quyền riêng tư, bao gồm việc ẩn danh khuôn mặt người và biển số xe.
Motional đã tích hợp công cụ tìm kiếm độc quyền Omnitag, cho phép các nhà nghiên cứu truy vấn phân phối theo loại kịch bản, mức độ khó và vị trí, cũng như thực hiện các tìm kiếm ngữ nghĩa bằng ngôn ngữ tự nhiên cho các tương tác chiến thuật. Một kịch bản đã được chú thích mà công ty mô tả cho thấy một khu vực xây dựng ban đêm nơi xe đã dừng lại: chú thích giải thích việc dừng là đúng vì có một con vật nhỏ băng qua phía trước, và các lộ trình thay thế đã bị loại bỏ do rào cản xây dựng và tốc độ cũng như hướng di chuyển không xác định của con vật.
Công ty báo cáo rằng một bộ mini nuReasoning được phát hành đầu năm nay đã được tải xuống hơn 50.000 lần. Bản phát hành công khai bao gồm các phần đào tạo và xác nhận trên Hugging Face, trong khi 1.000 đoạn video kiểm tra riêng tư được giữ lại cho việc đánh giá cuộc thi. Một bộ công cụ phát triển (devkit) mã nguồn mở trên GitHub cung cấp quy trình xử lý dữ liệu cho việc đào tạo VLA, các mục tiêu suy luận và lập kế hoạch, các mô hình cơ bản và các chỉ số đánh giá.
Thử thách nuReasoning
Motional và UCLA Mobility Lab đang tổ chức Thử thách nuReasoning, ra mắt tại ECCV. Cuộc thi được cấu trúc như một đánh giá chung về lập kế hoạch và suy luận trên 1.000 kịch bản kiểm tra riêng tư. Nhiệm vụ lập kế hoạch chính cung cấp cho người tham gia 10 giây ngữ cảnh lái xe — hình ảnh đa góc, thông tin bản đồ HD, lệnh điều hướng và trạng thái ego — và yêu cầu dự đoán quỹ đạo ego trong năm giây tiếp theo. Nhiệm vụ suy luận phụ trợ sử dụng cùng ngữ cảnh để trả lời câu hỏi trực quan về hình học, chuyển động, quyết định và suy luận phản thực, với các dạng trả lời lựa chọn đa dạng, số học, tọa độ và quỹ đạo.
Điểm cuối cùng của cuộc thi kết hợp 75% điểm lập kế hoạch và 25% điểm suy luận, và tổng giải thưởng là 10.000 USD. Đăng ký đang mở, và người thắng cuộc sẽ được công bố vào tháng 12 năm 2026 tại Hội nghị Hệ thống Xử lý Thông tin Thần kinh (NeurIPS).
“Để mở rộng đội xe AV một cách an toàn, các hệ thống lái tự động phải phản ứng với những trường hợp ngoại lệ hiếm gặp, hỗn loạn bằng cùng một logic chắc chắn như một tài xế con người có kinh nghiệm,” Phil Michel, Phó Chủ tịch Cấp cao về Tự động và AI của Motional cho biết. Ông nói công ty đang ưu tiên AI minh bạch để quá trình ra quyết định thời gian thực và đánh giá rủi ro có thể được kiểm tra rõ ràng, và việc cung cấp nuReasoning công khai mang lại nền tảng chung để giải quyết các trường hợp ngoại lệ.
Cơ sở nghiên cứu và khả dụng
Bài báo kèm theo, có tiêu đề “nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving”, đã được gửi lên arXiv vào ngày 29 tháng 5 năm 2026, với các tác giả có quan hệ với UCLA và Motional và Tony Xuewei Qi được liệt kê là trưởng dự án. Trong bài báo, các tác giả báo cáo rằng việc tinh chỉnh các mô hình thị giác-ngôn ngữ trên nuReasoning cải thiện đáng kể khả năng trả lời câu hỏi liên quan đến lái xe, và việc tích hợp giám sát suy luận vào đào tạo VLA nâng cao hiệu suất lập kế hoạch ngay cả khi đầu ra suy luận bằng văn bản bị tắt trong giai đoạn suy diễn. Mô hình lập kế hoạch của bài báo, nuVLA, kết hợp nền tảng thị giác-ngôn ngữ với việc tạo quỹ đạo.
nuReasoning mở rộng dòng dữ liệu mở của Motional, bắt đầu với nuScenes vào năm 2019, mà công ty xác định là bộ dữ liệu công cộng đa mô thức đầu tiên trong ngành AV, và tiếp tục qua nuImages, Panoptic nuScenes và nuPlan. Các bộ dữ liệu này có sẵn dưới các giấy phép thương mại hoặc sử dụng học thuật miễn phí theo các điều khoản và điều kiện phi thương mại của Motional.












