Anderson의 관점

AI가 빈 벽에서 드러나는 비밀 활동을 발견하다

mm
Unite.AI를 Google의 선호 소스에 추가

엔비디아와 MIT의 기여자를 포함한 연구 협력은 간접적으로 근처 벽에 비치는 빛을 관찰함으로써 숨겨진 사람을 식별할 수 있는 기계 학습 방법을 개발했습니다. 이 방법은 숨겨진 사람의 수를 식별하려고 할 때 약 94%의 정확도를 가지고 있으며, 또한 숨겨진 사람의 특정 활동을 식별할 수 있습니다. 이는 인간의 눈과 표준적인 이미지 확대 방법으로는 보이지 않는 빛의 반사를 엄청나게 증폭시킴으로써 가능합니다.

새로운 방법으로 증폭된 빛의 미세한 변동. 이는畳み込み 신경망을 사용하여 변화를 식별하는 영역을 나타냅니다. 출처: https://www.youtube.com/watch?v=K4PapXyX-bI

새로운 방법으로 증폭된 빛의 미세한 변동. 이는畳み込み 신경망을 사용하여 변화를 식별하는 영역을 나타냅니다. 출처: https://www.youtube.com/watch?v=K4PapXyX-bI

새로운 논문빈 벽을 바라보면서 무엇을 배울 수 있는가라는 제목으로, 엔비디아와 MIT, 以及 이스라엘 공과 대학의 기여자들이 참여했습니다.

벽 뒤를 보는 이전 접근 방법은 제어 가능한 광원이나 알려진 가리개의 출처에 의존했지만, 새로운 기술은 새로운 방에 일반화될 수 있으며, 재조정의 필요가 없습니다. 숨겨진 사람을 식별하는 두 개의畳み込み 신경망은 20개의 장면에서 얻은 데이터를 사용했습니다.

이 프로젝트는 고위험, 보안이 중요한 상황, 즉 탐색 및 구조 작전, 일반적인 법 집행 감시 작업, 비상 대응 시나리오, 노인들의 낙상 감지, 그리고 자율 주행 자동차를 위한 숨겨진 보행자의 감지를 위한 것입니다.

수동 평가

컴퓨터 비전 프로젝트에서 흔히 하는 것처럼, 중심 과제는 이미지 스트림에서 인식된 상태 변경을 식별, 분류 및 운영화하는 것이었습니다. 이러한 변경을 연결하면 숨겨진 사람의 수 또는 한 사람 이상의 활동을 식별하는 데 사용할 수 있는 특징적인 패턴이 생성됩니다.

이 연구는 반사면, 와이파이 신호, 레이더, 음성 또는 최근 몇 년 동안 숨겨진 인간 존재를 위험하거나 비상적인 환경에서 설정하기 위해 시도된 다른 연구에서 필요한 ‘특수한 상황’을 사용하지 않고 완전히 수동적인 장면 평가의 가능성을 열어줍니다.

새로운 연구에서 사용된 데이터 수집 시나리오의 샘플. 주제는 그림자나 직접 광원을 가리거나 반사면을 허용하지 않도록 주의하여 배치되었습니다. 출처: https://arxiv.org/pdf/2108.13027.pdf

새로운 연구에서 사용된 데이터 수집 시나리오의 샘플. 주제는 그림자나 직접 광원을 가리거나 반사면을 허용하지 않도록 주의하여 배치되었습니다. 출처: https://arxiv.org/pdf/2108.13027.pdf

일반적인 시나리오에서 적용되는 환경의 주변 빛은 장면의 다른 부분에서 숨겨진 사람으로 인해 발생하는 소규모 섭동을 압도할 것입니다. 연구자들은 개인의 빛 섭동 기여가 일반적으로 전체 가시광선의 1% 미만일 것이라고 계산합니다.

정적 조명을 제거하기

정적으로 보이는 벽 이미지에서 운동을 추출하기 위해 비디오의 시간 평균을 계산하고 각 프레임에서 이를 제거하는 것이 필요합니다. 결과는 일반적으로 좋은 품질의 비디오 장비의 노이즈 임계값 아래에 있습니다. 실제로 많은 운동은 음수 픽셀 공간 내에서 발생합니다.

이를 해결하기 위해 연구자들은 비디오를 16배로 다운샘플링하고 결과 비디오를 50배로 업스케일링하며, 음수 픽셀의 존재를 식별하기 위해 중간 회색 기본 수준을 추가합니다.

인간이 인식하는 벽과 숨겨진 개인의 섭동의 차이. 이미지 품질이 이 연구의 핵심 문제이므로, 더 높은 품질의 이미지를 보려면 본문의 끝에 있는 공식 비디오를 참조하십시오.

인간이 인식하는 벽과 숨겨진 개인의 섭동의 차이. 이미지 품질이 이 연구의 핵심 문제이므로, 더 높은 품질의 이미지를 보려면 본문의 끝에 있는 공식 비디오를 참조하십시오.

운동을 인식할 수 있는 기회 창은 매우 취약하며, 60 Hz의 교류 주파수로 깜빡이는 빛에 의해 영향을 받을 수 있습니다. 따라서 이러한 자연적인 섭동도 평가되어야 하며, 사람으로 인한 운동이 나타나기 전에 비디오에서 제거되어야 합니다.

마지막으로, 시스템은 숨겨진 방 안에 있는 사람의 특정 수를 나타내는 시공간 플롯을 생성합니다:

방 안에 숨겨진 사람의 수를 나타내는 시공간 플롯의 서명.

방 안에 숨겨진 사람의 수를 나타내는 시공간 플롯의 서명.

다른 인간 활동도 분류 및 인식 가능한 섭동의 특징적인 패턴을 생성합니다:

부동, 걷기,屈み, 손 흔들기, 점프의 시공간 플롯 서명.

부동, 걷기,屈み, 손 흔들기, 점프의 시공간 플롯 서명.

숨겨진 사람을 인식하기 위한 자동화된 기계 학습 기반 워크플로우를 생성하기 위해, 20개의 시나리오에서 다양한 비디오가 사용되어 두 개의 신경망을 훈련시켰습니다. 하나는 장면에 있는 사람의 수를 세는 데 사용되고, 다른 하나는 발생하는 운동을 식별하는 데 사용됩니다.

테스트

연구자들은 최종 배포에서 예상되는 제한을 재현하기 위해 설계된 10개의 실제 환경에서 훈련된 시스템을 테스트했습니다. 시스템은 256 프레임(일반적으로 약 8초의 비디오)에서 숨겨진 사람의 수를 분류할 때 최대 94.4%의 정확도를 달성했으며, 같은 조건에서 활동을 분류할 때 최대 93.7%의 정확도를 달성했습니다. 정확도는 프레임 수가 줄어들면 선형적으로 떨어지지 않으며, 64 프레임으로도 ‘사람 수’ 평가에서 79.4%의 정확도率를 달성할 수 있습니다.

이 방법은 날씨에 의한 조명 변화에 강건하지만, 텔레비전으로照らされた 장면이나 사람들이 반사 벽과 같은 색의 단색 의상을 입었을 때에는 어려움을 겪습니다.

연구에 대한 자세한 내용, 추출의 더 높은 품질의 비디오를 포함하여, 아래의 공식 비디오에서 볼 수 있습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai