Взгляд Anderson

«Секретные маршруты», которые могут обмануть системы распознавания пешеходов

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o: Variation on prompt: ‘a 1792x1024 feature image depicting an orthogonal ariel view looking down on NYC's 42nd street area. Most of the image should have a blue hue, but within the sidewalk areas there should be red-tinted pathways indicated, like a kind of map route. Make it like The Sims.’

Новое исследовательское сотрудничество между Израилем и Японией утверждает, что системы обнаружения пешеходов обладают внутренними слабостями, позволяющими хорошо информированным людям избегать систем распознавания лиц, пройдя тщательно спланированные маршруты через области, где сети видеонаблюдения наименее эффективны.

С помощью общедоступных видеозаписей из Токио, Нью-Йорка и Сан-Франциско исследователи разработали автоматический метод расчета таких путей, основанный на наиболее популярных системах распознавания объектов, которые, вероятно, используются в общественных сетях.

Три перекрестка, использованные в исследовании: перекресток Сибуя в Токио, Япония; Бродвей, Нью-Йорк; и район Кастро, Сан-Франциско. Источник: https://arxiv.org/pdf/2501.15653

Три перекрестка, использованные в исследовании: перекресток Сибуя в Токио, Япония; Бродвей, Нью-Йорк; и район Кастро, Сан-Франциско. Источник: https://arxiv.org/pdf/2501.15653

С помощью этого метода можно сгенерировать карты уверенности, которые обозначают области внутри кадра камеры, где пешеходы наименее вероятно дадут положительный результат распознавания лица:

Справа мы видим карту уверенности, сгенерированную методом исследователей. Красные области указывают на низкую уверенность, и конфигурацию позы, положения камеры и других факторов, которые могут препятствовать распознаванию лица.

Справа мы видим карту уверенности, сгенерированную методом исследователей. Красные области указывают на низкую уверенность, и конфигурацию позы, положения камеры и других факторов, которые могут препятствовать распознаванию лица.

В теории такой метод мог бы быть инструментализирован в виде приложения, осведомленного о местоположении, или какой-либо другой платформы для распространения наименее «распознавательных» путей от А до Б в любом рассчитанном месте.

Новая статья предлагает такую методологию, озаглавленную Метод повышения конфиденциальности на основе местоположения (L-PET); она также предлагает контрмеру, озаглавленную Метод адаптивного порога на основе местоположения (L-BAT), который по сути выполняет те же самые процедуры, но затем использует информацию для укрепления и улучшения мер видеонаблюдения, вместо того, чтобы придумывать способы избежать распознавания; и во многих случаях такие улучшения не были бы возможны без дополнительных инвестиций в инфраструктуру видеонаблюдения.

Статья поэтому устанавливает потенциальную технологическую войну эскалации между теми, кто стремится оптимизировать свои маршруты, чтобы избежать обнаружения, и способностью систем видеонаблюдения максимально использовать технологии распознавания лиц.

Предыдущие методы обмана обнаружения менее элегантны, чем этот, и основаны на противоречивых подходах, таких как TnT Attacks, и использовании распечатанных узоров для запутывания алгоритма обнаружения.

Работа 2019 года «Fooling automated surveillance cameras: adversarial patches to attack person detection» продемонстрировала противоречивый распечатанный узор, способный убедить систему распознавания, что нет обнаруженного человека, позволяя своего рода «невидимость. Источник: https://arxiv.org/pdf/1904.08653

Работа 2019 года «Fooling automated surveillance cameras: adversarial patches to attack person detection» продемонстрировала противоречивый распечатанный узор, способный убедить систему распознавания, что нет обнаруженного человека, позволяя своего рода «невидимость. Источник: https://arxiv.org/pdf/1904.08653

Исследователи, стоящие за новой статьей, отмечают, что их подход требует меньше подготовки, без необходимости создавать противоречивые носимые предметы (см. изображение выше).

Статья названа Метод повышения конфиденциальности для уклонения от обнаружения уличными видеокамерами без использования противоречивых аксессуаров, и исходит от пяти исследователей из Университета Бен-Гуриона Негева и Fujitsu Limited.

Метод и испытания

В соответствии с предыдущими работами, такими как Adversarial Mask, AdvHat, противоречивые патчи, и различные другие подобные выходы, исследователи предполагают, что пешеход-«атакующий» знает, какая система обнаружения объектов используется в сети видеонаблюдения. Это на самом деле не является неразумным предположением, из-за широкого внедрения передовых открытых систем, таких как YOLO в системах видеонаблюдения от компаний, таких как Cisco и Ultralytics (в настоящее время центральная движущая сила в развитии YOLO).

Статья также предполагает, что пешеход имеет доступ к прямой трансляции в интернете, фиксированной на местах, которые необходимо рассчитать, что, снова, является разумным предположением в большинстве мест, которые, вероятно, имеют интенсивность покрытия.

Сайты, такие как 511ny.org, предлагают доступ к многим камерам видеонаблюдения в районе Нью-Йорка. Источник: https://511ny.or

Сайты, такие как 511ny.org, предлагают доступ к многим камерам видеонаблюдения в районе Нью-Йорка. Источник: https://511ny.or

Помимо этого, пешеходу необходимо иметь доступ к предложенному методу и к самой сцене (т.е. к перекресткам и маршрутам, в которых необходимо установить «безопасный» маршрут).

Для разработки L-PET авторы оценили влияние угла пешехода относительно камеры; влияние высоты камеры; влияние расстояния; и влияние времени суток. Чтобы получить основную истину, они сфотографировали человека под углами 0°, 45°, 90°, 135°, 180°, 225°, 270° и 315°.

Наблюдения, проведенные исследователями.

Наблюдения, проведенные исследователями.

Они повторили эти вариации на трех разных высотах камеры (0,6 м, 1,8 м, 2,4 м) и с разными условиями освещения (утро, послеобед, ночь и «лабораторные» условия).

Подключив эти кадры к Faster R-CNN и YOLOv3 детекторам объектов, они обнаружили, что уверенность объекта зависит от остроты угла пешехода, расстояния пешехода, высоты камеры и условий освещения*.

Авторы затем протестировали более широкий спектр детекторов объектов в той же сцене: Faster R-CNN; YOLOv3; SSD; DiffusionDet; и RTMDet.

Авторы заявляют:

«Мы обнаружили, что все пять архитектур детекторов объектов подвержены влиянию положения пешехода и окружающего света. Кроме того, мы обнаружили, что для трех из пяти моделей (YOLOv3, SSD и RTMDet) эффект сохраняется на всех уровнях окружающего света».

Чтобы расширить объем, исследователи использовали кадры, снятые с общедоступных камер трафика в трех местах: перекресток Сибуя в Токио, Бродвей в Нью-Йорке и район Кастро в Сан-Франциско.

Каждое место предоставило от пяти до шести записей, с примерно четырьмя часами кадров на запись. Чтобы проанализировать производительность обнаружения, один кадр был извлечен каждые две секунды и обработан с помощью детектора объектов Faster R-CNN. Для каждого пикселя в полученных кадрах метод оценил среднюю уверенность обнаружения «человека» в этом пикселе.

«Мы обнаружили, что в всех трех местах уверенность детектора объектов варьировалась в зависимости от местоположения людей в кадре. Например, в кадрах перекрестка Сибуя есть большие области низкой уверенности дальше от камеры, а также ближе к камере, где столб частично заслоняет проходящих пешеходов».

Метод L-PET по сути является этой процедурой, аргументируемой «вооруженной», чтобы получить путь через городскую область, который наименее вероятно приведет к успешному распознаванию пешехода.

Напротив, L-BAT следует той же процедуре, с разницей в том, что он обновляет оценки в системе обнаружения, создавая обратную связь, предназначенную для того, чтобы сделать подход L-PET неэффективным и сделать «слепые» области системы более эффективными.

(В практическом смысле, однако, улучшение покрытия на основе полученных карт уверенности потребовало бы больше, чем просто модернизация камеры, сидящей в ожидаемом положении; на основе критериев тестирования, включая местоположение, это потребовало бы установки дополнительных камер для покрытия пренебрегаемых областей – поэтому можно утверждать, что метод L-PET эскалирует эту «холодную войну» в очень дорогостоящий сценарий)

Средняя уверенность обнаружения пешехода для каждого пикселя, на различных рамках детекторов, в наблюдаемой области улицы Кастро, проанализированной на пяти видео. Каждое видео было записано при разных условиях освещения: восход солнца, дневное время, закат и два различных ночных режима. Результаты представлены отдельно для каждого сценария освещения.

Средняя уверенность обнаружения пешехода для каждого пикселя, на различных рамках детекторов, в наблюдаемой области улицы Кастро, проанализированной на пяти видео. Каждое видео было записано при разных условиях освещения: восход солнца, дневное время, закат и два различных ночных режима. Результаты представлены отдельно для каждого сценария освещения.

Переведя матричное представление пикселей в графовое представление, подходящее для задачи, исследователи адаптировали алгоритм Дейкстры, чтобы рассчитать оптимальные пути для пешеходов, чтобы пройти через области с уменьшенной обнаружением видеонаблюдения.

Вместо нахождения кратчайшего пути алгоритм был изменен, чтобы минимизировать уверенность обнаружения, рассматривая области высокой уверенности как области с более высокой «стоимостью». Эта адаптация позволила алгоритму определить маршруты, проходящие через слепые зоны или области с низким обнаружением, эффективно направляя пешеходов по путям с уменьшенной видимостью для систем видеонаблюдения.

Визуализация, изображающая преобразование тепловой карты сцены из матрицы пикселей в графовое представление.

Визуализация, изображающая преобразование тепловой карты сцены из матрицы пикселей в графовое представление.

Исследователи оценили влияние системы L-BAT на обнаружение пешеходов с помощью набора данных, построенного из вышеупомянутых четырехчасовых записей пешеходного трафика. Чтобы заполнить коллекцию, один кадр был обработан каждые две секунды с помощью детектора объектов SSD.

Из каждого кадра был выбран один контур, содержащий обнаруженного человека в качестве положительного образца, и другая случайная область без обнаруженных людей была использована в качестве отрицательного образца. Эти двойные образцы сформировали набор данных для оценки двух моделей Faster R-CNN – одной с применением L-BAT и одной без.

Производительность моделей была оценена путем проверки того, насколько точно они идентифицировали положительные и отрицательные образцы: контур, перекрывающий положительный образец, считался истинным положительным, а контур, перекрывающий отрицательный образец, был помечен как ложный положительный.

Метрики, используемые для определения надежности обнаружения L-BAT, были площадь под кривой (AUC); истинная скорость положительных результатов (TPR); скорость ложных положительных результатов (FPR); и средняя истинная уверенность положительных результатов. Исследователи утверждают, что использование L-BAT повысило уверенность обнаружения, сохраняя при этом высокую истинную скорость положительных результатов (хотя и с небольшим увеличением ложных положительных результатов).

В заключение авторы отмечают, что подход имеет некоторые ограничения. Одним из них является то, что карты уверенности, сгенерированные их методом, специфичны для определенного времени суток. Хотя они не распространяются на это, это будет означать, что более широкий, многоуровневый подход потребуется для учета времени суток в более гибком развертывании.

Они также отмечают, что карты уверенности не будут переноситься на разные архитектуры моделей и привязаны к конкретной модели детектора объектов. Поскольку предложенная работа является по сути доказательством концепции, более изощренные архитектуры, возможно, также могут быть разработаны для исправления этого технического долга.

Заключение

Любой новый метод атаки, для которого решение заключается в «оплате новых камер видеонаблюдения», имеет некоторое преимущество, поскольку расширение сетей камер видеонаблюдения в высоко наблюдаемых районах может быть политически сложным, а также представлять собой значительную гражданскую расход, которая обычно потребует мандата избирателей.

Возможно, самый большой вопрос, поставленный этой работой, заключается в том, «Используют ли закрытые системы видеонаблюдения открытые передовые кадры, такие как YOLO?». Это, конечно, невозможно знать, поскольку создатели проприетарных систем, которые управляют многими государственными и гражданскими сетями камер видеонаблюдения (по крайней мере в США), будут утверждать, что раскрытие такого использования может открыть их для атаки.

Тем не менее, миграция государственных информационных технологий и проприетарного кода на глобальный и открытый код будет означать, что любой, кто проверяет утверждение авторов с помощью (например) YOLO, может хорошо угадать сразу.

 

* Я обычно включал связанные результаты таблиц, когда они предоставлены в статье, но в этом случае сложность таблиц статьи делает их неосвещающими для случайного читателя, и поэтому краткое изложение более полезно.

Опубликовано впервые во вторник, 28 января 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai