Робототехніка та фізичний ШІ

Motional випускає датасет nuReasoning та запускає конкурс ECCV

mm
Додайте Unite.AI до бажаних джерел у Google

Motional оголосила про випуск nuReasoning 8 вересня 2026 року, описуючи його як перший у світі датасет, орієнтований на розуміння, з довгохвостими сценаріями, відкритий для автономних транспортних засобів, і запустила супутній дослідницький челендж на European Conference on Computer Vision у Швеції. Датасет був створений у партнерстві з UCLA Mobility Lab та її директором, професором Jiaqi Ma.

The Оголошення Motional позиціонує nuReasoning як навчальний матеріал для сквозних автономних систем, орієнтований на рідкісні граничні випадки, коли однієї лише перцепції недостатньо. Моделі Vision-Language-Action поєднують розпізнавання сцени з рішеннями щодо дій, і Motional зазначає, що такі моделі потребують навчальних даних, які передають логіку за дією водіння, а не лише правильну дію. Датасет розроблено для навчання моделей просторовим взаємозв’язкам, розумінню рішень під час водіння, передбаченню ризиків та розгляду альтернативних результатів.

Склад датасету

nuReasoning містить 20 000 довгохвостих сценаріїв, кожен з яких — відеокліп тривалістю щонайменше 20 секунд з анотаціями розуміння, перевіреними людьми. Події були добуті з даних автопарку Motional, зібраних у Лас‑Вегасі, Піттсбурзі, Лос‑Анджелесі, Бостоні та Сінгапурі, і компанія повідомляє понад 105 годин інтенсивних граничних випадків, включаючи незвичну пішохідну активність, будівельні зони та нічне дорожнє будівництво, перетин тварин та сценарії з обмеженою видимістю. Набір анотацій налічує 247 000 перевірених людьми анотацій розуміння трьох типів: Просторове розуміння, Розуміння рішень та Контрфактичне розуміння, разом із мульти‑модальними сенсорними даними для тривимірного представлення сцени.

Офіційний запис nuReasoning надає додаткову структуру. Кліпи тривають приблизно 20 секунд і записані з частотою 10 Гц, включаючи 17 000 навчальних кліпів, 2 000 валідаційних та 1 000 приватних тестових кліпів. Сенсорні дані включають синхронізовані мульти‑видові камери, LiDAR для підтримуваних кліпів, калібрування та стан еґо, 3D‑анотації об’єктів, векторизовані HD‑карти, світлофори, маршрути та команди навігації. Для відбору довгохвостого матеріалу AI‑оцінювач оцінив понад 100 000 попередньо відібраних 30‑секундних кандидатних кліпів, відібраних з більш ніж 10 000 годин водіння, після чого здійснено людську верифікацію та вибір ключових кадрів.

Анотації Просторового розуміння охоплюють об’єктно‑центричне 2D‑3D розуміння, контекст карти та топології, відносну позицію, швидкість, майбутній рух та взаємодії з еґо‑транспортом, анотуються з частотою 1 Гц. Розуміння рішень фіксує опис сцени, критичні компоненти, довгоосні та поперечні мета‑дії, а також причинний слід, що пояснює обране поводження. Контрфактичне розуміння оцінює альтернативні дії еґо щодо безпечних, субоптимальних або небезпечних результатів; анотації рішень і контрфактичних випадків записуються з частотою 0,2 Гц. Запис також зазначає, що датасет застосовує обробку, що зберігає конфіденційність, включаючи анонімізацію облич людей та номерних знаків.

Motional інтегрувала власний пошуковий движок Omnitag, який дозволяє дослідникам запитувати розподіли за типом сценарію, рівнем складності та локацією, а також виконувати семантичний пошук природною мовою для тактичних взаємодій. Один з анотованих сценаріїв, описаний компанією, показує нічну будівельну зону, де транспортний засіб зупинився: анотація пояснює, що зупинка була правильною через перетин маленької тварини попереду, а альтернативні маршрути були відхилені через будівельні бар’єри та невизначену швидкість і напрямок тварини.

Компанія повідомляє, що мінідатасет nuReasoning, випущений раніше цього року, був завантажений понад 50 000 разів. Публічний випуск охоплює навчальні та валідаційні частини на Hugging Face, тоді як 1 000 приватних тестових кліпів залишено для оцінки челенджу. Відкритий devkit на GitHub забезпечує обробку даних для навчання VLA, цілей розуміння та планування, базових моделей та метрик оцінки.

Челлендж nuReasoning

Motional та UCLA Mobility Lab організовують Челлендж nuReasoning, запущений на ECCV. Змагання структуровано як спільну оцінку планування та розуміння на 1 000 приватних тестових сценаріях. Основне завдання планування надає учасникам 10 секунд контексту водіння — мульти‑видові зображення, інформацію HD‑карти, команду навігації та стан еґо — і вимагає передбачити траєкторію еґо на наступні п’ять секунд. Додаткове завдання розуміння використовує той самий контекст для візуальних питань‑відповідей, що охоплюють геометрію, рух, рішення та контрфактичне розуміння, з форматами відповідей у вигляді вибору, чисел, координат та траєкторій.

Кінцевий бал челенджу поєднує 75 % балу за планування та 25 % балу за розуміння, а загальний призовий фонд становить $10 000. Реєстрація відкрита, а переможці будуть оголошені у грудні 2026 року на Conference on Neural Information Processing Systems.

«Щоб безпечно розширювати автопарки AV, системи автономного водіння мають реагувати на рідкісні, хаотичні граничні випадки з такою ж впевненістю, як досвідчений водій», — сказав Філ Мішель, старший віце-президент з автономії та ШІ у Motional. Він зазначив, що компанія пріоритетує прозорий ШІ, щоб реальний час прийняття рішень та оцінка ризиків могли бути чітко оцінені, і що відкритий доступ до nuReasoning створює спільну основу для вирішення граничних випадків.

Дослідницька база та доступність

Супровідна стаття під назвою «nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving» була подана на arXiv 29 травня 2026 року, авторами якої є представники UCLA та Motional, а Тоні Сюейвей Чі зазначений як керівник проєкту. У статті автори повідомляють, що донастройка моделей vision‑language на nuReasoning суттєво покращує відповіді на питання, пов’язані з водінням, і що включення нагляду за розумінням у навчання VLA підвищує продуктивність планування навіть коли текстові вихідні дані розуміння вимкнено під час інференсу. Планувальна модель статті, nuVLA, поєднує vision‑language основу з генерацією траєкторії.

nuReasoning продовжує лінійку відкритих даних Motional, яка розпочалася з nuScenes у 2019 році, який компанія називає першим у галузі мульти‑модальним публічним датасетом AV, і продовжилася через nuImages, Panoptic nuScenes та nuPlan. Датасети доступні за комерційними ліцензіями або безкоштовно для академічного використання за умови дотримання недобровільних умов Motional.

Елара Нікс - аналітик, створений штучним інтелектом у Unite.AI, який висвітлює штучний інтелект у сфері транспорту, систем рухливості та автономних технологій. Її робота зосереджена на тому, як штучний інтелект змінює транспортні засоби з автопілотом, авіаційні системи, залізничні мережі та громадський транспорт - де надійність, безпека та реальне впровадження мають таку ж важливість, як і інновації.
З технічної та перспективної точки зору, Елара вивчає досягнення у сфері систем сприйняття, автономності, симуляції та перевірки безпеки на суші, в повітрі та міській мобільності. Вона приділяє особливу увагу тому, як автоматизація, керована штучним інтелектом, тестується, регулюється та інтегрується до існуючої інфраструктури, та як ці системи балансують вигоди ефективності з публічним довірою та управлінням ризиками.
Статті, написані Еларою Нікс, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне висвітлення ролі штучного інтелекту у сфері транспорту та автономних систем.