Andersonの視点

ラジオ波から人間のイメージを合成する

mm
Unite.AI を Google の優先ソースに追加

中国の研究者は、カメラを使用せずに、ラジオ波と生成対抗ネットワーク(GAN)を使用して、人間の近似写真像を合成する方法を開発しました。彼らが考案したシステムは、明るい光の中で撮影された実際の画像でトレーニングされていますが、暗い条件下や、大きな障害物がある場合でも、比較的本物的な人間の「スナップショット」を捉えることができます。

画像は、天井から下に向かうデータを捉える1つのラジオアンテナと、立ち位置からのラジオ波の変動を記録するもう1つのアンテナからの「熱マップ」に依存しています。

研究者の実証実験からの画像は、顔のない「J-ホラー」のような特徴を持っています:

同じ環境での実際の人間の画像に基づいてトレーニングされたRFGANは、ラジオ波の熱マップを使用して人間の活動を記録し、低周波RF信号の限られた解像度に近似するスナップショットを生成します。光は必要ありません。色は、人間の存在によってラジオ波がどのように変調されるか、またラジオ波がさまざまな信号強度と特性で戻ってくるかによって認識されるようです。ソース:https://arxiv.org/pdf/2112.03727.pdf

RFGANは、制御された環境での実際の人間の画像と、人間の活動を記録するラジオ波の熱マップでトレーニングされています。データから特徴を学習した後、RFGANは新しいRFデータに基づいてスナップショットを生成できます。生成された画像は、利用可能な低周波RF信号の限られた解像度に基づいて近似値です。このプロセスは、暗い環境や、さまざまな障害物の存在下でも機能します。ソース:https://arxiv.org/pdf/2112.03727.pdf

GAN、RFGANをトレーニングするために、研究者は、標準のRGBカメラからのマッチングデータと、正確に同じ時刻に生成された対応するラジオ熱マップを使用しました。新しいプロジェクトでの合成人間の画像は、低解像度のラジオ波が使用されているため、初期のダゲレオタイプ写真のようにぼかされます。深度解像度は7.5cm、角度解像度は約1.3度です。

上部、GANネットワークに供給される画像 - 下部、部屋の中の人物を特徴付ける水平と垂直の2つの熱マップ。これらはアーキテクチャ内で3D表現の乱れたデータに合成されます。

上部、GANネットワークに供給される画像 – 下部、部屋の中の人物を特徴付ける水平と垂直の2つの熱マップ。これらはアーキテクチャ内で3D表現の乱れたデータに合成されます。

新しい論文は、中国の電子科学技術大学の6人の研究者によって書かれたもので、RFGAN:RFベースの人間合成と題されています。

データとアーキテクチャ

このようなスコープを持つ以前のデータセットやプロジェクトがないこと、またRF信号がGAN画像合成フレームワークで以前使われたことがないことから、研究者は新しい方法論を開発しなければなりませんでした。

RFGANのコアアーキテクチャ

RFGANのコアアーキテクチャ

トレーニング中に、双子の熱マップ画像を空間的に画像データと対応させるために、適応正規化が使用されました。

RFキャプチャデバイスは、水平と垂直の2つのアンテナアレイとして構成されたミリメートル波(mmWave)レーダーでした。送信と受信には、周波数変調連続波(FMCW)と線形アンテナが使用されました。

ジェネレータは、入力層としてソースフレームを受け取り、RF融合(熱マップ)表現が、畳み込み層のレベルでの正規化を通じてネットワークをオーケストレートします。

データ

データは、mmWaveアンテナからのRF信号の反射から、たった20Hzで収集されました。同時に、人間のビデオは非常に低い10fpsでキャプチャされました。6人のボランティアを使用して、9つの室内シーンがキャプチャされ、各ボランティアはさまざまなセッションで異なる服を着用しました。

結果は、2つの異なるデータセット、RF-ActivityRF-Walkでした。前者には、68,860枚の人間の画像(例:スクワットウォーク)と、137,760枚の対応する熱マップフレームが含まれていました。後者には、67,860枚の人間のランダムな歩行フレームと、135,720ペアの関連する熱マップが含まれていました。

データは、慣習に従って、トレーニングとテストのために不均等に分割されました。トレーニングには、55,225枚の画像フレームと110,450ペアの熱マップが使用され、残りはテストに使用されました。RGBキャプチャフレームは320×180にリサイズされ、熱マップは201×160にリサイズされました。

モデルは、Adamを使用して、ジェネレータとディスクリミネータの両方で一貫した0.0002の学習率でトレーニングされました。エポックは80、バッチサイズは非常に疎な2でした。トレーニングは、PyTorchを使用して、消費者レベルの単一のGTX-1080 GPUで実行されました。その8GBのVRAMは、通常、そんなタスクにはとても貧弱と見なされます(したがって、バッチサイズが小さくなったのです)。

研究者は、出力のリアリズムをテストするために、従来のメトリックを適応させて、通常の消去テストを実行しましたが、RFGANのパフォーマンスを測定するための以前の研究はありませんでした。

秘密信号への公開の関心

RFGANは、ラジオ周波数を使用して部屋の中のボリューム画像を構築しようとする最初のプロジェクトではありません。2019年に、MIT CSAILの研究者は、Wi-Fi周波数帯のラジオ周波数信号に基づいて3D人間を再構築する能力を持つ、RF-Avatarというアーキテクチャを開発しました。

2019年のMIT CSAILプロジェクトでは、壁や服など、遮蔽物を除去するために、ラジオ波を使用して、従来のCGIベースのワークフローでキャプチャされたサブジェクトを再構築しました。ソース:https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

2019年のMIT CSAILプロジェクトでは、壁や服など、遮蔽物を除去するために、ラジオ波を使用して、従来のCGIベースのワークフローでキャプチャされたサブジェクトを再構築しました。ソース:https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

新しい論文の研究者は、環境マッピングのためのラジオ波(人間の写真を再現しようとはしていない)に関する関連する以前の研究も認めています。人間の速度を推定する壁を介して Wi-Fiで;人間のポーズを評価する;そして、人間のジェスチャーを認識することを目的としたものです。

移植可能性とより広い適用可能性

研究者は、初期のキャプチャ環境とトレーニング状況に過剰適合しているかどうかを確認するために、発見をテストしました。論文では、この実験の段階について詳細は提供されていません。彼らは主張しています:

‘新しいシーンにモデルを展開するには、モデルを最初から再トレーニングする必要はありません。事前トレーニングされたRFGANを使用して、わずか40秒のデータで類似の結果を得ることができます。’

そして続けています:

‘損失関数とハイパーパラメータは、トレーニング段階と同じです。定量的な結果から、事前トレーニングされたRFGANモデルは、新しいシーンでわずかなデータでファインチューニングされた後、望ましい人間の活動フレームを生成できることがわかります。つまり、提案されたモデルは、広く使用される可能性があることを意味します。’

論文の詳細から判断するに、研究者が作成したネットワークが、元の被写体に「フィットトレーニング」されているのか、またはRF-熱マップが、服の色などの詳細を推測できるのかは明らかではありません。光学的およびラジオ波のキャプチャ方法の2つの異なる周波数が関係しているためです。

どちらにせよ、RFGANは、生成対抗ネットワークの模倣力と表現力を利用して、暗い場所や壁を介して機能する、新しい興味深い監視形態を作成するための新しい方法です。最近の、反射光で曲がり角を覗く努力よりも、さらに印象的なものです。

 

 

2021年12月8日(初めて公開された日)、午後8:04、GMT+2 – 重複した単語を削除しました。- MA

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai