Andersonの視点
マシンラーニングを用いた身体ポーズからの目線検出

フランスとスイスの研究者は、AIシステムの「ego」カメラを直接見ているかどうかを判断するために、人物の立ち方や動きのみに基づいて目線を推定するコンピュータビジョンシステムを開発しました。
この新しいフレームワークは、画像内の顔の目位置を分析するのではなく、セマンティックキーポイント(以下の画像参照)などの非常に簡略化された情報を使用してこの評価を行います。これにより、YOLOなどのよりデータ集約型のオブジェクト検出アーキテクチャーよりも、検出方法が非常に軽量で敏捷になります。

新しいフレームワークは、AIのキャプチャセンサを見ているかどうかを判断するために、人の身体の配置のみに基づいて評価します。ここでは、緑で強調表示された人はカメラを見ている可能性が高く、赤で強調表示された人はカメラを見ていない可能性が高くなります。出典:https://arxiv.org/pdf/2112.04212.pdf[/em>
この研究は、自律走行車の安全システムの開発に動機付けられていますが、著者は、スマートシティでの歩行者の行動を理解するために目線検出が有用になる可能性があることを認めています。たとえば、「歩行者の注意を向けている場所を特定したり、歩行者が見ている公共の標識を特定したりすることができます」。
このシステムとその後のシステムの開発を支援するために、研究者は、LOOKという新しい包括的なデータセットをコンパイルしました。このデータセットは、自律走行車のローミングカメラから見た通りでのシーンや、ロボットが歩行者に道を譲る必要があるカジュアルな群衆シーンなどの任意のシナリオでの目線検出の特定の課題に対処します。

フレームワークの結果、緑で強調表示された人は「見ている」人です。
この研究は、「Do Pedestrians Pay Attention? Eye Contact Detection in the Wild」というタイトルで、スイスのVisual Intelligence for Transportation(VITA)研究イニシアチブの4人の研究者と、フランスのソルボンヌ大学の1人の研究者によって行われました。
アーキテクチャ
以前の研究の大部分は、運転手の注意を分析するためにマシンラーニングを使用し、運転手に向けられたカメラの出力に依存して、運転手の顔の画像を分析することに重点を置いてきました。これは、公共のテレビカメラの低解像度フィードで、人物が遠すぎて顔の目位置を解析することができない場合や、サングラスなどの他の遮蔽物がある場合には、実現不可能なことです。
このプロジェクトの目標の中心となるのは、自律走行車の外向きカメラが必ずしも最適なシナリオになるとは限らないということです。したがって、「低レベル」のキーポイント情報が、注視分析フレームワークの基礎として理想的です。自律走行車システムは、歩道から車道に出る可能性のある歩行者が自律走行車を見ているかどうかを理解するために、非常に迅速で迅速な方法が必要です。このような状況では、遅延は生死を分けることになるかもしれません。
研究者によって開発されたモジュラー・アーキテクチャは、通常、人物の全身の画像を受け取り、2Dジョイントをベースの、骨格的な形式に抽出します。

新しいフランス/スイスの目線検出システムのアーキテクチャ
ポーズは、Y軸の情報を削除して「平らな」表現を作成するために正規化され、アルゴリズムが学習した数千の既知のポーズ(これらも「平ら」にされた)とその二値ラベル(例:0:見ていないまたは1:見ている)と同等になります。
ポーズは、アルゴリズムの内部知識と比較され、他の歩行者の画像(「カメラを見ている」として識別されたもの)とどれだけよく対応しているかが判断されます。識別は、著者がLOOKデータセットの開発に参加したAmazon Mechanical Turkの作業者を使用して開発したカスタムブラウザツールを使用して行われました。
LOOKの各画像は、4人のAMT作業者によって検討され、3人の作業者が結果に同意した画像のみが最終コレクションに含まれました。
以前の多くの研究の中心であったヘッドクリップ情報は、任意の都市シナリオでの注視の最も信頼性の低い指標の1つであり、キャプチャ品質とカバレッジが十分で、人物がカメラを見ているかどうかについての決定を支援できる場合には、オプションのデータストリームとしてアーキテクチャに組み込まれています。ただし、非常に遠い人物の場合、これは役立たない情報になるでしょう。
データ
研究者は、LOOKを、元のタスクに適していない複数の以前のデータセットから導きました。このプロジェクトの範囲を直接共有する唯一の2つのデータセットは、JAADとPIEです。これらのデータセットにはそれぞれ制限があります。
JAADは、トロントのヨーク大学から2017年に提供されたデータセットで、390,000のラベル付きの歩行者サンプル、バウンディングボックス、動作注釈を含みます。そのうち17,000は「運転手を見ている」とラベル付けされています。このデータセットには、北米とヨーロッパで記録された5〜10秒のオンボードカメラ映像の346の30fpsクリップが含まれています。JAADには繰り返しが多く、ユニークな歩行者の総数は686人だけです。
より最近の(2019年)PIEは、トロントのヨーク大学から提供されたもので、JAADと同様にオンボード30fpsの映像を特徴とし、こちらはトロント市内を6時間運転したものから得られたもので、700,000の注釈付き歩行者と1,842のユニークな歩行者、そして180人の「カメラを見ている」歩行者が含まれています。
代わりに、研究者は、自律走行車の3つの以前のデータセットから最も適切なデータをコンパイルしました:KITTI、JRDB、およびNuScenesです。これらはそれぞれ、ドイツのカールスルーエ工科大学、オーストラリアのスタンフォード大学とモナシュ大学、そしてMITのスピンオフであるNutonomyから提供されています。
このキュレーションにより、ボストン、シンガポール、テュービンゲン、パロアルトの4つの都市からの幅広いキャプチャが得られ、約8,000のラベル付きの歩行者視点を含み、著者は、LOOKが「野外」での目線検出の最も多様なデータセットであると主張しています。
トレーニングと結果
抽出、トレーニング、評価はすべて、11GBのVRAMを備えたNVIDIA GeForce GTX 1080ti、3.20GHzで動作するIntel Core i7-8700 CPU上で実行されました。
著者は、自分の方法が少なくとも5%でSOTAベースラインを上回り、JAADでトレーニングされたモデルが見えないデータに非常に良く一般化することを発見しました。テストは複雑で、クロップベースのモデル(顔の分離とトリミングは新しいイニシアチブのアーキテクチャの中心ではない)を考慮する必要がありました。詳細な結果については、論文を参照してください。

JAADデータセットを使用したテストの平均精度(AP)結果、ピクセル単位のバウンディングボックスの高さの関数、著者の結果は太字です。
研究者は、コードを公開し、データセットはこちらで、ソースコードはGitHubで入手可能です。
著者は、自分の研究が、自分たちが「重要だが見過ごされているトピック」と表現する分野でのさらなる研究の努力を刺激することを希望しています。
JAAD データセット、著者の結果は太字です。研究者はコードを公開し、データセットはこちらで、ソースコードはGitHubで入手可能です。












