Anderson의 관점

라디오파 반사로 인한 인간 이미지 합성

mm
Unite.AI를 Google의 선호 소스에 추가

중국 연구진은 라디오파와 생성적 적대 신경망(Generative Adversarial Networks, GANs)을 사용하여 카메라 없이 거의 사진과 같은 품질의 사람 이미지를 합성하는 방법을 개발했습니다. 그들이 고안한 시스템은 밝은 조건에서 실제 이미지로 훈련되었지만 어두운 환경이나 커다란 장애물이 있어도 사람이 보이지 않는 경우에도 비교적 실제적인 사람의 ‘스냅샷’을 캡처할 수 있습니다.

이미지는 두 개의 라디오 안테나에서 생성된 ‘히트맵’에 의존합니다. 하나는 천장에서 데이터를 캡처하고, 다른 하나는 사람의 위치에서 라디오파의 변화를 기록합니다.

연구진의 실험 결과로 생성된 이미지에는 얼굴이 없는 ‘J-호러’와 같은 특징이 있습니다.

실제 환경에서 사람 이미지를 훈련시킨 RFGAN은 라디오파 히트맵을 사용하여 사람의 활동을 기록하고, 저주파 RF 신호의 제한된 해상도로 인해 근사한 스냅샷을 생성합니다. 빛은 필요하지 않습니다. 라디오파가 사람의 존재에 의해 어떻게 변조되는지와 라디오파가 다양한 신호 강度와 특성으로 돌아오는지를 통해 색상이 인식됩니다. 출처: https://arxiv.org/pdf/2112.03727.pdf

RFGAN은 실제 환경에서 사람 이미지를 훈련시킨 후 라디오파 히트맵을 사용하여 사람의 활동을 기록하고, 저주파 RF 신호의 제한된 해상도로 인해 근사한 스냅샷을 생성합니다. 출처: https://arxiv.org/pdf/2112.03727.pdf

GAN을 훈련시키기 위해, 연구진은 표준 RGB 카메라와 라디오 히트맵에서 생성된 일치하는 데이터를 사용했습니다. 새로운 프로젝트에서 생성된 사람 이미지는 초기 다구레오タイプ 사진과 같은 방식으로 흐릿하게 나타납니다. 이는 사용된 라디오파의 해상도가 매우 낮기 때문입니다. 깊이 해상도는 7.5cm, 각도 해상도는 약 1.3도입니다.

위: GAN 네트워크에 입력된 이미지 - 아래: 수평 및 수직 히트맵, 방 안의 사람을 특성화하고, 아키텍처 내에서 3D 표현으로 합성됩니다.

위: GAN 네트워크에 입력된 이미지 – 아래: 수평 및 수직 히트맵, 방 안의 사람을 특성화하고, 아키텍처 내에서 3D 표현으로 합성됩니다.

새로운 연구 논문은 중국 전자과학 기술대학의 6명의 연구진에 의해 작성되었습니다.

데이터 및 아키텍처

이전에는 이러한 범위의 데이터셋이나 프로젝트가不存在하지 않기 때문에, 연구진은 새로운 방법론을 개발해야 했습니다.

RFGAN의 핵심 아키텍처

RFGAN의 핵심 아키텍처

적응 정규화를 사용하여 훈련 중에 쌍의 히트맵 이미지를 해석하여 캡처된 이미지 데이터와 공간적으로 일치하도록 했습니다.

RF 캡처 장치는 수 밀리미터파(mmWave) 레이더로 구성된 두 개의 안테나 배열입니다. 수신과 송신을 위해 주파수 변조 연속파(FMCW)와 선형 안테나를 사용했습니다.

제너레이터는 입력 레이어로 소스 프레임을 받으며, RF를 융합한(히트맵) 표현이 컨볼루션 레이어 수준에서 정규화를 통해 네트워크를 조정합니다.

데이터

데이터는 20Hz의 mmWave 안테나에서 반사된 RF 신호와同時적으로 캡처된 사람 비디오(매우 낮은 10fps)에서 수집되었습니다. 6명의 자원봉사자가 다양한 세션에서 다른 옷을 입은 9개의 실내 장면이 캡처되었습니다.

결과는 두 개의 별도 데이터셋, RF-ActivityRF-Walk를 생성했습니다. 전자는 다양한 위치(예: 스쿼트걷기)에서 사람 이미지를 포함하며, 68,860개의 이미지와 137,760개의 일치하는 히트맵 프레임이 있습니다. 후자는 67,860개의 사람 랜덤 워킹 프레임과 135,720개의 일치하는 히트맵 쌍을 포함합니다.

데이터는 규칙에 따라 훈련과 테스트를 위해 불균일하게 분할되었습니다. 55,225개의 이미지 프레임과 110,450개의 히트맵 쌍을 훈련에 사용하고, 나머지는 테스트에 사용했습니다. RGB 캡처 프레임은 320×180으로, 히트맵은 201×160으로 리사이즈되었습니다.

모델은 Adam을 사용하여 일관된 학습률 0.0002로 훈련되었으며, 에포크는 80, 배치 크기는 2로 설정되었습니다. 훈련은 PyTorch를 사용하여 소비자 수준의 단일 GTX-1080 GPU에서 수행되었습니다. 이 GPU의 8GB VRAM은 이러한 작업에 일반적으로 MODEST로 간주됩니다(배치 크기가 낮은 이유입니다).

연구진은 출력의 현실성을 테스트하기 위해 일부 일반적인 지표를 수정하여 사용했으며, 논문에 자세히 설명된 아블레이션 테스트를 수행했습니다. 그러나 이전에 수행된 작업과 비교할 수 있는 기준이不存在하지 않습니다.

비밀 신호에 대한 공개 관심

RFGAN은 라디오 주파수를 사용하여 방 안의 3D 이미지를 생성하려는 첫 번째 프로젝트가 아닙니다. 2019년 MIT CSAIL의 연구진은 Wi-Fi 범위의 라디오 주파수 신호를 사용하여 심각한 가림 현상 아래에서 3D 사람을 재구성할 수 있는 RF-Avatar 아키텍처를 개발했습니다.

MIT CSAIL 프로젝트에서 2019년에 라디오파를 사용하여 벽이나 의류와 같은 가림 현상을 제거하여 전통적인 CGI 기반 워크플로에서 캡처된 주체를 재구성했습니다. 출처: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

MIT CSAIL 프로젝트에서 2019년에 라디오파를 사용하여 벽이나 의류와 같은 가림 현상을 제거하여 전통적인 CGI 기반 워크플로에서 캡처된 주체를 재구성했습니다. 출처: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

연구진은 또한 환경 매핑을 위한 라디오파 사용(인간 재구성을 시도하지 않음)과 관련된 이전 연구를 인용했습니다. 이는 라디오파를 사용하여 사람의 속도 추정, 벽을 통해 사람의 위치 감지, 사람의 姿勢 평가, 사람의 제스처 인식 등을 수행했습니다.

이전성 및 보다 넓은 적용 가능성

연구진은 초기 캡처 환경과 훈련 상황에 과도하게 적합된 것이 아닌지 확인하기 위해 실험을 수행했습니다. 그러나 이 단계에 대한 자세한 내용은 논문에 없습니다. 그들은 다음과 같이 주장합니다:

‘새로운 장면에서 모델을 배포하려면 모델을 처음부터 다시 훈련할 필요가 없습니다. 미리 훈련된 RFGAN을 사용하여 매우 적은 데이터(약 40초 데이터)를 사용하여 유사한 결과를 얻을 수 있습니다.’

그리고 계속합니다:

‘손실 함수와 하이퍼파라미터는 훈련 단계와 동일합니다. 정량적 결과에서 미리 훈련된 RFGAN 모델이わず간의 데이터로 미세 조정된 후 새로운 장면에서 바람직한 사람 활동 프레임을 생성할 수 있음을 발견했습니다. 이는 우리가 제안한 모델이 널리 사용될 수 있는 잠재력을 가지고 있음을 의미합니다.’

논문의 세부 사항에 따르면, 생성된 네트워크가 원래 주체에만 ‘적합’되어 훈련되었는지, 아니면 RF-히트맵이 의류 색상과 같은 세부 사항을 유추할 수 있는지 명확하지 않습니다.

어떤 경우에라도, RFGAN은 생성적 적대 신경망의 모방과 대표 능력을 사용하여 어둠과 벽을 통해 작동할 수 있는 새로운 형태의 감시를 생성하는 새로운 방법입니다. 이는 최근 반사된 빛으로 구석을 보는 시도보다 더 인상적인 방식입니다.

 

 

2021년 12월 8일 (초판 발행일), 20:04 GMT+2 – 반복된 단어 제거. – MA

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai