Andersonの視点

ドライバーの携帯電話の乱用を偏光フィルタと物体認識で検出する

mm
Unite.AI を Google の優先ソースに追加

イギリスの研究者は、クラシックな光学フィルタと赤外線撮影を使用した道路脇のシステムを提案し、運転中の違法な携帯電話使用を自動検出しています。撮影機器の品質に応じて、システムは現実世界の試験で95.81%の精度率を示しました。

研究者のモデルの一つ。風防面積が最初に特定され、AI支援の携帯電話画像検索のための収集エリアとして分離されます。システムは取り付けられた携帯電話を無視し、運転手がアクティブに保持しているデバイスを検索するように設計されています。出典:https://www.youtube.com/watch?v=PErIUr3Cxvg

研究者のモデルの一つ。風防面積が最初に特定され、AI支援の携帯電話画像検索のための収集エリアとして分離されます。システムは取り付けられた携帯電話を無視し、運転手がアクティブに保持しているデバイスを検索するように設計されています。出典:https://www.youtube.com/watch?v=PErIUr3Cxvg

この研究は、運転手の携帯電話使用違反の検出をための最新の物体検出と追跡と題され、ニューカッスル大学のコンピューティング学部から来ています。

風防の反射を克服する

運転手の携帯電話使用検出への従来のアプローチは、昼間の風防の高反射率によって妨げられてきました。これは、クラウドのグループからの反射によって車両の内部がさらに隠される場合に悪化します。インフラレッド光源では、これらのケースを現実的に対処することはできません。なぜなら、自然の日光を貫通するために必要なインフラレッド照明の量がリソース集約型になるからです。

したがって、ニューカッスル大学の研究者は、1812年から存在する古典的なトリックを提案しています。つまり、道路脇の監視カメラに取り付けられる、安価な物理的な偏光フィルタです。これは、一度調整すると、車両の内部を明確に見ることができます。

上:フィルタなしの車の風防。下:カメラに物理的な偏光フィルタを取り付けた風防。出典:https://arxiv.org/pdf/2109.02119.pdf

上:フィルタなしの車の風防。下:カメラに物理的な偏光フィルタを取り付けた風防。出典:https://arxiv.org/pdf/2109.02119.pdf

専用カメラからモバイルベースのセンサーへの移行により、偏光フィルタの存在は、主に高品質のサングラスでの使用に限定されました。そこでは、着用者は、視点を変えたり、反射物体の視点を変えたりすることで、反射を消去する特性を観察できます。

日光は、酸素と窒素の分子によって散乱され、青色の光は他の波長よりも広く散乱され、青色が昼間の空の自然な色になるため、青色の光は偏光されます。線形または円形の偏光レンズは、この偏光光を効果的に消去し、反射を除去することができます。

論文では、法規制によって制限されているため、スモークウィンドウがこの方法を妨げる可能性があることを認めています。ただし、イギリスでは、州によって異なる規制があります。

YOLO

提案されたシステムは、道路脇の監視カメラなどの市民インフラストラクチャに統合されることを目的としています。コスト上の潜在的な障害に気付いた研究者たちは、さまざまな物体認識システムの構成をさまざまな品質の撮影機器でテストし、安価な偏光フィルタを既存のカメラに追加する最低限のシナリオを提供しました。システムの他のすべての側面はリモートです。

4つの物体認識フレームワークがテストされました:You-Only-Look-Once(YOLO)バージョン3と4;SSDベースネットワーク;Faster R-CNN;およびCenterNet。テストでは、YOLO V3が最も正確な結果をもたらし、2ステップのワークフローで、まず風防エリアを特定し、次にその空間内で携帯電話を探します。

ただし、ビデオを2つのネットワークに通す必要があるため、フレームレートは13.15fpsとなり、シンプルなシステムでは30fpsとなります。結果の品質は入力機器に依存し、研究者は、入力が低価格のカメラと高品質の機器に分割された場合、96%近くの精度率が高品質の機器で達成でき、低価格のカメラでは74.35%の精度率が達成できたことを発見しました。

認識された違反の制限

システムを経済的に実行可能にすることに加えて、研究者は、必要な人間の監視を最小限に抑えた完全に自動化されたシステムを開発することを心配しています。システムは自動的に罰金を課すように設計されています。ただし、運転中の携帯電話使用に関する法律は世界中で厳しくなっており、罰金や免許点の剥奪を超える罰則(例:イギリス)が科せられる可能性があるため、人間の検証がシステムの展開において依然として重要な役割を果たす可能性があります。

オプティカルフローなどの方法を使用してビデオコンテンツの全体を考慮に入れるにもかかわらず、YOLOのような物体認識アルゴリズムは、各フレームを「完全なストーリー」とみなし、次のフレームを別のプロジェクトとしてみなします。したがって、このようなシステムは、たとえば、128フレームの違反を捉えたビデオに対して128個の別々の罰金を課すのを防ぐ必要があります。

これを避けるために、システムには、Deep SORTという物体追跡アルゴリズムが含まれており、各違反認識に一意の「インシデントID」を追加し、フレーム内でそのIDが重複しないようにします。

夜間の監視の処理

夜間の条件では、研究者は以前の研究プロジェクトで使用されたインフラレッド撮影に従います。彼らは、850ナノメートルと730ナノメートルのインフラレッド波長をテストし、730nmで最も詳細な画像が取得できたことを発見しました。

論文では、インフラレッド撮影が昼間の条件で使用できる範囲についてさらに調査する必要があると主張しています。

データ

システムのより経済的な単一ステップバージョンでは、研究者は、Google Open Images Dataset から2,235枚のナンバープレート画像と、2,150枚のストックおよびカスタムメイドの携帯電話画像を使用しました。運転手が携帯電話を保持している画像を含める必要があったため、携帯電話画像の1,700枚はこのプロジェクトのために特に撮影されました。

2ステップシステムでは、プロセスの最初のステップをトレーニングするために487枚の風防画像の注釈が必要でした。これに加えて、1ステッププロセスで使用されたデータも使用されました。

公式の道路監視インフラストラクチャにアクセスできなかったため、すべての画像は、同等の条件を近似するためにボランティアによって撮影されました。

トレードオフ

最終結果は、実装のコストと精度のトレードオフを示しています。より優れた撮影機器と処理結果は、最高の精度を提供し、安価な既存の都市監視機器のリトライ팅によって「受け入れ可能な」精度が得られる可能性があります。

低コストの「単一ステップ」パイプラインは、最低の実装コスト(つまり、安価な偏光フィルタの取り付け)で約75%の精度を達成します。一方、2ステップシステム(風防エリアを分離してから運転手が保持している携帯電話を検索する)は、より高い精度率を達成しますが、新しいインフラストラクチャにのみ適している可能性があり、利用可能な予算によって異なります。両方の場合、撮影機器の品質も別の変数です。

低コストの「単一ステップ」パイプラインは、最低の実装コスト(つまり、安価な偏光フィルタの取り付け)で約75%の精度を達成します。一方、2ステップシステム(風防エリアを分離してから運転手が保持している携帯電話を検索する)は、より高い精度率を達成しますが、新しいインフラストラクチャにのみ適している可能性があり、利用可能な予算によって異なります。両方の場合、撮影機器の品質も別の変数です。

上記のように、研究者のこのプロジェクトの実現可能性に対する認識は、システムが完全に自動化されるべきという仮定によって形成されているようですが、これは疑問の余地がある要件です。

以下のプロジェクトの公式ビデオを参照して、実装や使用されたアプローチについての詳細をご覧ください。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai