Взгляд Anderson
Искусственный интеллект предсказывает места аварий на основе спутниковых изображений и данных GPS

Исследователи из MIT и Катарского центра искусственного интеллекта разработали систему машинного обучения, которая анализирует высококачественные спутниковые изображения, координаты GPS и исторические данные о авариях, чтобы создать карту потенциально опасных участков дорог, успешно предсказывая места аварий, где другие методы не смогли бы их обнаружить.

Справа, прогнозируемые места аварий появляются из трех источников данных. Области, выделенные кругами, являются прогнозами высокого риска, которые не имеют исторических данных об авариях. Источник: https://openaccess.thecvf.com/content/ICCV2021/papers/He_Inferring_High-Resolution_Traffic_Accident_Risk_Maps_Based_on_Satellite_Imagery_ICCV_2021_paper.pdf
Система предлагает смелые прогнозы для областей в дорожной сети, которые могут стать местами аварий, даже если в этих областях нет истории аварий. Протестировав систему на данных за четыре года, исследователи обнаружили, что их прогнозы для этих “без истории” потенциальных опасных зон подтвердились событиями в последующие годы.
Новая статья под названием Построение высокоразрешающих карт риска аварий на основе спутниковых изображений и траекторий GPS. Авторы предсказывают использование новой архитектуры за пределами прогнозирования аварий, предполагая, что она может быть применена к картам риска 911 или системам, предсказывающим вероятность спроса на такси и сервисы вызова автомобилей.
Предыдущие попытки создать подобные прогнозирующие системы пытались использовать низкокачественные карты с высоким смещением или использовать частоту аварий в качестве ключевого фактора, что привело к неточным прогнозам. Вместо этого новая система, охватывающая четыре крупных города США, площадью 7488 квадратных километров, превосходит эти ранние схемы, объединяя более разнообразные формы данных.
Редкие данные
Проблема, с которой сталкиваются исследователи, – это редкие данные – очень большие объемы аварий неизбежно будут замечены и устранены без необходимости машинного анализа, но более тонкие опасные корреляции трудно выявить.
Предыдущие системы прогнозирования аварий основаны на методе Монте-Карло исторических данных об авариях и не могут предоставить эффективный механизм прогнозирования, где эти данные отсутствуют. Поэтому новое исследование изучает участки дорожной сети с подобными трафиками, визуальным видом и структурой, выводя склонность к авариям на основе этих характеристик.
Это “выстрел в темноте”, который, кажется, открыл фундаментальные показатели аварий, которые можно использовать при проектировании новых дорожных сетей.

Оценка плотности ядра (KDE) была использована для выделения исторических мест аварий, но не смогла предсказать будущие места аварий. На верхнем левом изображении мы видим, где KDE предсказала аварии в области синего квадрата, по сравнению с тем, где аварии фактически произошли (прилегающая область). Нижний правый, сравнение неудачи прогноза KDE с точным прогнозом (синий квадрат) системы MIT.
Авторы отмечают, что данные траекторий GPS предоставляют информацию о потоке, скорости и плотности трафика, в то время как спутниковые изображения области добавляют информацию о расположении полос, количестве полос, а также о наличии обочины и присутствии пешеходов.
Соавтор Амин Садеги из Катарского исследовательского института вычислительной техники (QCRI) комментировал “Наша модель может обобщать из одного города в другой, объединяя несколько подсказок из, казалось бы, не связанных между собой источников данных. Это шаг к общему искусственному интеллекту, поскольку наша модель может предсказать карты аварий в неисследованных территориях” и продолжил “Модель может быть использована для вывода полезной карты аварий даже в отсутствие исторических данных об авариях, что может быть полезно для городского планирования и принятия решений путем сравнения гипотетических сценариев”.

Архитектура системы прогнозирования трафика генерирует карту риска аварий с разрешением 5 метров, что, по мнению авторов, является критическим для различия различных рисков между магистралями и прилегающими жилыми дорогами.
Проект был оценен на данных об авариях и боковых данных, охватывающих период с 2017 по 2018 год. Прогнозы были сделаны для 2019 и 2020 годов, и несколько “высокорисковых” мест появились даже в отсутствие исторических данных, которые обычно прогнозируют это.
Достижение полезной обобщенности
Переобучение является критическим риском в системе, работающей с редкими данными, даже когда, как в этом случае, есть два дополнительных источника поддерживающих данных. Когда частота события низка, излишние предположения могут быть сделаны из слишком немногих примеров, что приводит к алгоритму, который ожидает очень конкретную, узкую полосу возможных обстоятельств и который не сможет выявить более широкие вероятности.
Следовательно, при обучении модели исследователи случайным образом “выключали” каждый входной источник с вероятностью 20%, чтобы области с меньшим (или отсутствием) данных об авариях могли быть рассмотрены при обучении модели к обобщению, и чтобы параллельные источники данных могли действовать как представительный прокси для отсутствующей информации для любого конкретного исследования перекрестка или участка дороги.
Оценка
Модель была протестирована на наборе данных, состоящем из почти 7500 км городской территории в Бостоне, Лос-Анджелесе, Чикаго и Нью-Йорке. Набор данных был организован в виде 1872 плиток размером 2х2 км, каждая из которых содержала спутниковые изображения от MapBox, с маской дорожной сегментации через данные из OpenStreetMap. И базовые изображения, и карты сегментации имеют разрешение 0,625 метра.
Данные GPS поступают в виде проприетарного набора данных, собранного между 2015-2017 годами над четырьмя городами, в общей сложности 7,6 миллионов километров траекторий GPS с частотой выборки 1 секунда.
Проект также использует 4,2 миллиона записей, охватывающих 2016-2020 годы, в наборе данных об авариях в США. Каждая запись включает временные метки и другие метаданные.
Первые два года исторических данных были поданы в модель, и последние два года использовались для обучения и оценки, что позволило исследователям установить точность системы за два года в коротком временном интервале.
Система была протестирована с историческими данными и без них и была найдена успешно захватывающей основное распределение риска во всех случаях, заметно улучшая предыдущие методы, основанные на KDE (см. выше).
Дороги вперед
Авторы утверждают, что их система может быть применена к другим странам с минимальными архитектурными изменениями, даже в местах, где данные об авариях не доступны. Кроме того, авторы предлагают свою исследование как возможный дополнение к городскому планированию при проектировании новых городских разработок.
Ведущий автор Сонгтао Хе прокомментировал новую работу:
“Поймав основное распределение риска, которое определяет вероятность будущих аварий во всех местах, и без каких-либо исторических данных, мы можем найти более безопасные маршруты, позволить страховым компаниям предоставлять индивидуальные страховые планы на основе траекторий движения клиентов, помочь городским планировщикам проектировать более безопасные дороги и даже предсказать будущие аварии.”
Хотя статья указывает, что код системы был выпущен на GitHub, ссылка на код не активна, не может быть найдена поисковой системой и, вероятно, будет включена в более поздней версии.
Исследование имеет потенциал быть включенным в популярные потребительские GPS-приложения и планировщики маршрутов, согласно Сонгтао Хе:
“Если люди могут использовать карту риска, чтобы выявить потенциально высокорисковые участки дорог, они могут принять меры заранее, чтобы снизить риск поездок, которые они совершают. Приложения, такие как Waze и Apple Maps, имеют инструменты для инцидентов, но мы пытаемся опережать аварии – до того, как они произойдут,”












