Andersonの視点

AIが明らかにする、白い壁に隠された秘密の活動

mm
Unite.AI を Google の優先ソースに追加

NVIDIAとMITを含む研究コラボレーションは、間接的な照明を壁で観察するだけで、隠れた人を識別できる機械学習方法を開発しました。壁に近づいていない照明源からも、人を識別できます。この方法は、隠れた人の数を識別する際に94%の精度を達成し、さらに、隠れた人の特定の活動を、人間の目や標準的な画像増幅方法では見えない光の反射を大量に増幅することで識別できます。

新しい方法で増幅された、光のほとんど見えない変動。Convolutional Neural Networksを使用して変化の領域を識別します。出典: https://www.youtube.com/watch?v=K4PapXyX-bI

新しい方法で増幅された、光のほとんど見えない変動。Convolutional Neural Networksを使用して変化の領域を識別します。出典: https://www.youtube.com/watch?v=K4PapXyX-bI

新しい論文は、NVIDIAとMIT、イスラエル工科大学の貢献により、「白い壁を凝視することで学ぶことができるもの」と題されています。

以前の「壁の向こうを見る」手法は、制御可能な光源や既知の遮蔽源に関する事前の知識に依存していましたが、新しい手法は、どの部屋でも一般化でき、再調整の必要はありません。隠れた人を識別する2つのConvolutional Neural Networksは、20のシーンから得られたデータを使用しました。

このプロジェクトは、高リスクのセキュリティ状況、捜索救助作戦、一般的な法執行機関の監視タスク、緊急対応シナリオ、老人の転倒検知、自動車の隠れた歩行者検知のための手段として目的されています。

受動的な評価

コンピュータビジョンプロジェクトでは、通常、画像ストリーム内の状態の変化を識別、分類、操作化することが中心的なタスクです。変化を結合すると、個人の数または個人の活動を識別するために使用できるシグネチャパターンが生成されます。

この研究は、反射面、Wi-Fi信号、レーダー、音、または他の特殊な状況を必要とせずに、完全に受動的なシーン評価の可能性を示唆しています。

新しい研究で使用されるデータ収集シナリオのサンプル。被験者は影を落とさないように、また光を直接遮らないように慎重に配置され、反射面やその他の「チート」ベクトルは許可されません。出典: https://arxiv.org/pdf/2108.13027.pdf

新しい研究で使用されるデータ収集シナリオのサンプル。被験者は影を落とさないように、また光を直接遮らないように慎重に配置され、反射面やその他の「チート」ベクトルは許可されません。出典: https://arxiv.org/pdf/2108.13027.pdf

シーンの典型的なシナリオでは、周囲の光が、隠れた人々からの反射光による小さな変動を圧倒します。研究者は、個人の光の変動の寄与は、通常、総可視光の1%未満であると計算しています。

静的な照明の除去

静的な壁画像から動きを抽出するには、ビデオの時間平均を計算し、それを各フレームから除去する必要があります。結果として得られる動きのパターンは、通常、良質なビデオ機器のノイズしきい値以下であり、動きの多くは、実質的に負のピクセル空間内で発生します。

これを補うために、研究者はビデオを16倍にダウンサンプリングし、結果の映像を50倍にアップサンプリングしながら、負のピクセルを検出するために中間グレーレベルのベースを追加します。

人間が認識する壁と、隠れた個人の抽出による変動の違い。画像の品質はこの研究の重要な問題であるため、記事の最後にある公式ビデオを参照してください。

人間が認識する壁と、隠れた個人の抽出による変動の違い。画像の品質はこの研究の重要な問題であるため、記事の最後にある公式ビデオを参照してください。

動きを認識するための時間枠は非常に繊細であり、60HzのAC周波数での光の点滅によっても影響を受けるため、この自然な変動も映像から除去する必要があります。

最終的に、システムは、隠れた部屋の居住者の特定の数を示す空間時間プロットを生成します:

隠れた人の数が異なる部屋のシグネチャ空間時間プロット。

隠れた人の数が異なる部屋のシグネチャ空間時間プロット。

異なる人間の活動も、識別および後に認識できるシグネチャ変動を引き起こします:

不活性、歩行、しゃがみ、手の振る、ジャンプの空間時間プロットシグネチャ。

不活性、歩行、しゃがみ、手の振る、ジャンプの空間時間プロットシグネチャ。

隠れた人を識別するための自動化された機械学習ベースのワークフローを生成するために、20のシナリオからのさまざまな映像が使用されて、2つのニューラルネットワークが訓練されました。1つはシーン内の人の数を数えるために、もう1つは動きを識別するために訓練されました。

テスト

研究者は、最終的な展開で予想される制限を再現するために設計された10の未見の現実世界の環境で、訓練されたシステムをテストしました。システムは、256フレーム(通常約8秒のビデオ)で、隠れた人の数を分類する際に最大94.4%の精度を達成し、同条件下で活動を分類する際に最大93.7%の精度を達成しました。精度はフレーム数が減少すると低下しますが、線形低下ではありません。64フレームでは、「人の数」の評価で79.4%の精度率を達成します(約95%に対して、4倍のフレーム数)。

この方法は、天候による照明の変化に強いですが、テレビによって照らされたシーンや、人々が反射壁と同じ色の単色の服を着ている状況では苦労します。

研究の詳細、抽出の高品質の映像については、以下の公式ビデオを参照してください。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai