Andersonの視点

歩行者認識システムを妨げることができる「秘密ルート」

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o: Variation on prompt: ‘a 1792x1024 feature image depicting an orthogonal ariel view looking down on NYC's 42nd street area. Most of the image should have a blue hue, but within the sidewalk areas there should be red-tinted pathways indicated, like a kind of map route. Make it like The Sims.’

イスラエルと日本の新しい研究協力は、歩行者検出システムには固有の弱点があり、情報に基づいた個人によって、顔認識システムを回避するために、慎重に計画されたルートを通ることで、監視ネットワークの最も効果のない領域をナビゲートできることを示唆しています。

東京、ニューヨーク、サンフランシスコの公開映像を使用して、研究者は、最も一般的なオブジェクト認識システムを使用して、パスの計算方法を自動化しました。

研究で使用された3つの交差点:東京の渋谷交差点、ニューヨークのブロードウェイ、サンフランシスコのカストロ地区。出典:https://arxiv.org/pdf/2501.15653

研究で使用された3つの交差点:東京の渋谷交差点、ニューヨークのブロードウェイ、サンフランシスコのカストロ地区。 出典:https://arxiv.org/pdf/2501.15653

この方法により、カメラ映像内で歩行者が最も認識されにくい領域を示す「信頼度ヒートマップ」を生成することができます。

研究者の方法によって生成された信頼度ヒートマップ。赤い領域は信頼度が低く、姿勢、カメラの位置、他の要因が顔認識を妨げる可能性があります。

研究者の方法によって生成された信頼度ヒートマップ。赤い領域は信頼度が低く、姿勢、カメラの位置、他の要因が顔認識を妨げる可能性があります。

理論的には、この方法は、特定の場所での最も「認識されにくい」パスをAからBまで提供するためのロケーションアウェアアプリまたはプラットフォームに実装することができます。

新しい論文では、Location-based Privacy Enhancing Technique(L-PET)という方法を提案しています。これは、Location-Based Adaptive Threshold(L-BAT)という対策も提案しています。これは、基本的に同じルーチンを実行しますが、代わりに情報を使用して監視対策を強化して改善します。

論文では、監視システムの能力と、顔認識技術を使用するための潜在的な技術的エスカレーションの戦争を設定しています。

以前の検出を妨げる方法は、敵対的なアプローチに基づいており、TnT Attacks印刷されたパターンを使用して検出アルゴリズムを混乱させます。

2019年の研究「Fooling automated surveillance cameras: adversarial patches to attack person detection」は、認識システムが人物を検出しないように説得できる敵対的な印刷パターンを実証しました。

2019年の研究「Fooling automated surveillance cameras: adversarial patches to attack person detection」は、認識システムが人物を検出しないように説得できる敵対的な印刷パターンを実証しました。 出典:https://arxiv.org/pdf/1904.08653

研究者は、新しい論文では、論文A Privacy Enhancing Technique to Evade Detection by Street Video Cameras Without Using Adversarial Accessories」を発表しました。これは、ベン・グリオン大学と富士通の5人の研究者によって行われました。

方法とテスト

以前の研究に従って、Adversarial MaskAdvHat敵対的なパッチなどの研究では、歩行者「攻撃者」が監視ネットワークで使用されているオブジェクト検出システムを知っていることを前提としています。これは、実際には妥当な仮定です。なぜなら、YOLOのような最先端のオープンソースシステムが、シスコやウルトラロジックスなどの監視システムで広く採用されているからです。

論文では、歩行者がインターネット上のライブストリームにアクセスできることを前提としています。これは、多くの場所で妥当な仮定です。

サイトの例:511ny.orgは、ニューヨーク市内の多くの監視カメラにアクセスできます。

サイトの例:511ny.orgは、ニューヨーク市内の多くの監視カメラにアクセスできます。 出典:https://511ny.org

歩行者は、提案された方法と、シーンそのもの(つまり、交差点とルート)にアクセスする必要があります。

L-PETを開発するために、研究者は、歩行者の角度、カメラの高さ、距離、時間帯の影響を評価しました。真実の値を取得するために、0°、45°、90°、135°、180°、225°、270°、315°の角度で人物を撮影しました。

研究者によって行われた真実の観察。

研究者によって行われた真実の観察。

これらのバリエーションは、3つの異なるカメラの高さ(0.6m、1.8m、2.4m)と、変化する照明条件(朝、午後、夜、そして「ラボ」条件)で繰り返されました。

これらの映像をFaster R-CNNYOLOv3オブジェクト検出器に供給すると、オブジェクトの信頼度は、歩行者の角度、距離、カメラの高さ、天候/照明条件によって異なることがわかりました。

研究者は、さらに多くのオブジェクト検出器を同じシナリオでテストしました:Faster R-CNN、YOLOv3、SSDDiffusionDetRTMDet

研究者は次のように述べています:

「すべての5つのオブジェクト検出器アーキテクチャは、歩行者の位置と周囲光によって影響を受けることがわかりました。さらに、5つのモデルの中で3つ(YOLOv3、SSD、RTMDet)は、すべての周囲光レベルで影響が持続することがわかりました。」

研究者は、東京の渋谷交差点、ニューヨークのブロードウェイ、サンフランシスコのカストロ地区の3つの場所で、公開されている交通カメラの映像を使用しました。

各場所では、約4時間の映像が5〜6回録画されました。検出性能を分析するために、2秒ごとに1フレームが抽出され、Faster R-CNNオブジェクト検出器を使用して処理されました。取得したフレームの各ピクセルについて、方法は「人物」検出ボックスが存在する平均信頼度を推定しました。

「3つの場所すべてで、フレーム内の人物の位置によって、オブジェクト検出器の信頼度が変化することがわかりました。たとえば、渋谷交差点の映像では、カメラから遠く離れた場所や、ポールが通行人を部分的に遮る場所に、信頼度が低い大きな領域がありました。」

L-PET方法は、基本的にこの手順ですが、都市部を通るパスを取得するために「兵器化」されたものです。パスは、歩行者が成功的に認識される可能性が最も低いものです。

一方、L-BATは、同じ手順に従いますが、検出システムのスコアを更新することで、フィードバックループを作成し、L-PETアプローチを無効にし、システムの「盲点」をより効果的にします。

(実際には、Heatmapに基づいてカバレッジを改善するには、カメラのアップグレードだけでなく、無視された領域をカバーするために追加のカメラを設置する必要があります。したがって、L-PET方法は、特にこの「冷戦」を非常に高価なシナリオにエスカレートさせる可能性があります)

5つのビデオの平均の歩行者検出信頼度。各ビデオは、日出、昼、日没、2つの異なる夜間設定で録画されました。

5つのビデオの平均の歩行者検出信頼度。各ビデオは、日出、昼、日没、2つの異なる夜間設定で録画されました。

ピクセルベースのマトリックス表現を、タスクに適したグラフ表現に変換した後、研究者は、グラフニューラルネットワークを使用して、歩行者が監視検出を減らす領域をナビゲートするための最適パスを計算するために、ダイクストラ法を適応させました。

代わりに、検出信頼度を最小限に抑えるために、アルゴリズムを修正しました。高信頼度領域を「コスト」の高い領域として扱い、盲点や低検出領域を通過するルートを識別することを可能にしました。

シーンのHeatmapをピクセルベースのマトリックスからグラフベースの表現に変換するプロセスを示す視覚化。

シーンのHeatmapをピクセルベースのマトリックスからグラフベースの表現に変換するプロセスを示す視覚化。

研究者は、L-BATシステムが歩行者検出に与える影響を、約4時間の録音から構成されるデータセットを使用して評価しました。1フレームごとに2秒間隔で処理し、Faster R-CNNオブジェクト検出器を使用して、1フレームから1つのバウンディングボックスを選択しました。

各フレームから、検出された人物を含むバウンディングボックスを正のサンプルとして選択し、検出されていない人物を含むランダムな領域を負のサンプルとして使用しました。これらのサンプルは、L-BATを適用したFaster R-CNNモデルと適用していないモデルを評価するためのデータセットを形成しました。

モデルのパフォーマンスは、正のサンプルと負のサンプルをどの程度正確に識別できるかで評価されました。バウンディングボックスが正のサンプルと重なると、真陽性とみなされ、バウンディングボックスが負のサンプルと重なると、偽陽性とラベル付けされました。

検出の信頼性を評価するために使用された指標は、面積下の曲線(AUC)、真陽性率(TPR)、偽陽性率(FPR)、平均真陽性信頼度でした。研究者は、L-BATの使用により、検出信頼度が向上し、真陽性率が高まっている(ただし、偽陽性がわずかに増加している)と主張しています。

結論として、研究者は、アプローチにはいくつかの限界があることを指摘しています。1つは、Heatmapは特定の時間帯に特有であるということです。ただし、詳細については触れていません。これは、より柔軟な展開に必要な、より大規模なアプローチが必要であることを示唆しています。

彼らはまた、Heatmapは異なるモデルアーキテクチャに転送できないこと、特定のオブジェクト検出器モデルに結び付けられていることを観察しています。提案された研究は基本的に概念実証であるため、より洗練されたアーキテクチャが開発される可能性があります。

結論

新しい攻撃方法の解決策が「新しい監視カメラの購入」である場合、多少の利点があります。なぜなら、高度に監視されている地域での市民カメラネットワークの拡大は、政治的に課題であり、通常、住民の承認が必要な著しい市民的費用を表すからです。

研究によって提起される最大の疑問は、「クローズドソースの監視システムは、YOLOのようなオープンソースSOTAフレームワークを利用しているかどうか」です。これは、もちろん、知ることは不可能です。なぜなら、独自のシステムを動かしているメーカーは、使用を公開することで攻撃を受ける可能性があると主張するからです。

しかし、政府のITと独自のコードが、グローバルなオープンソースコードに移行していることを考えると、誰かが研究者の主張を(たとえばYOLOで)テストした場合、すぐに大当たりを出す可能性があります。

 

* 通常、論文に含まれる関連する表の結果を含めますが、この場合、論文の表の複雑さは、一般の読者にとってあまり参考にならないため、要約がより役立つと思われます。

2025年1月28日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai