Anderson의 관점

머신 러닝을 이용한 신체 姿勢에서 시선 접촉 감지

mm
Unite.AI를 Google의 선호 소스에 추가

프랑스와 스위스 연구진은 AI 시스템의 ‘ego’ 카메라를 직접 바라보는지 여부를判断하는 컴퓨터 비전 시스템을 개발했다. 이 시스템은 사람의 신체 姿勢만으로 시선 접촉을 추정할 수 있다.

새로운 프레임워크는 얼굴 이미지의 눈 위치를 분석하는 대신 시맨틱 키포인트(semantic keypoints)를 사용하여 이 평가를 수행한다. 이는 더 가벼우며 데이터 집약적인 객체 감지 아키텍처와 비교하여 매우 경량화된 감지 방법이다.

신체 姿勢만으로 AI의 캡처 센서를 바라보는지 여부를 평가한다. 녹색으로 표시된 사람들은 카메라를 바라보고 있는 반면, 빨간색으로 표시된 사람들은 다른 방향을 바라보고 있다. 출처: https://arxiv.org/pdf/2112.04212.pdf

신체 姿勢만으로 AI의 캡처 센서를 바라보는지 여부를 평가한다. 녹색으로 표시된 사람들은 카메라를 바라보고 있는 반면, 빨간색으로 표시된 사람들은 다른 방향을 바라보고 있다. 출처: https://arxiv.org/pdf/2112.04212.pdf

이 연구는 자율 주행 자동차의 보안 시스템 개발에 의해 동기부여되었지만, 저자들은 이 기술이 다른 산업에서도 유용할 수 있다고 주장한다. 예를 들어, 스마트 시티에서 시선 접촉 감지는 보행자의 행동을 더 잘 이해하는 데 도움이 될 수 있다.

이 기술의 개발을 지원하기 위해 연구진은 새로운 데이터셋인 LOOK를 개발했다. 이 데이터셋은 자율 주행 자동차의 카메라에서 촬영된 거리 장면과 같은 임의 시나리오에서 시선 접촉 감지를 위한 특정 도전을 직접 해결한다.

프레임워크의 결과, 녹색으로 표시된 사람들은 카메라를 바라보고 있다.

프레임워크의 결과, 녹색으로 표시된 사람들은 카메라를 바라보고 있다.

연구도 보행자가 주의를 기울이는가? 야외에서 시선 접촉 감지라는 제목으로, 스위스 Visual Intelligence for Transportation 연구소의 4명과 프랑스 소르본 대학의 1명의 연구진이 수행했다.

아키텍처

이 분야의 이전 연구는 주로 운전자의 주의를 분석하는 데 중점을 두고 있으며, 운전자를 향한 카메라의 출력을 분석하는 데 기계 학습을 사용했다. 그러나 이 접근법은 공공 TV 카메라의 경우에는 적합하지 않다.

자율 주행 자동차의 외부 카메라는 항상 최적의 시나리오에 있지 않을 수 있다. 따라서 ‘저수준’ 키포인트 정보를 기반으로 하는 시선 분석 프레임워크가 필요하다. 자율 주행 자동차 시스템은 보행자가 차의 경로에 들어서지 않았는지 여부를 빠르게 이해해야 한다. 이러한 상황에서 지연은 생명과 죽음의 차이를 만들 수 있다.

연구진이 개발한 모듈식 아키텍처는 사람의 전체 이미지에서 2D 관절을 추출하여 기본적인 골격 형태로 만든다.

신체 姿勢에서 시선 접촉 감지 시스템의 아키텍처

신체 姿勢에서 시선 접촉 감지 시스템의 아키텍처

姿勢는 Y축 정보를 제거하여 ‘평면’ 형태로 만든다. 이렇게 하면 알고리즘이 학습한 수천 개의 알려진 姿勢와 해당 이진 플래그/레이블(예: 0: 미시선 또는 1: 시선)을 비교할 수 있다.

姿勢는 알고리즘이 내부적으로 학습한 다른 보행자의 이미지와 비교하여 카메라를 바라보는지 여부를 결정한다. 이러한 注釈은 저자들이 개발한 Amazon Mechanical Turk 작업자용 맞춤형 브라우저 툴을 사용하여 수행했다.

LOOK 데이터셋의 각 이미지에는 4명의 작업자가 검토했으며, 4명 중 3명이 결과에 동의하는 경우에만 최종 컬렉션에 포함했다.

데이터

연구진은 LOOK 데이터셋을 이전 데이터셋에서 파생시켰다. 이 프로젝트의 범위와 직접 공유하는 두 개의 데이터셋은 JAADPIE이다. 그러나 이 두 데이터셋은 제한이 있다.

JAAD는 토론토 요크 대학교에서 2017년에 제공한 데이터셋으로, 390,000개의 레이블이 지정된 보행자 샘플을 포함한다. 그러나 이 중 17,000개만이 ‘운전자에게 시선을 고정’으로 레이블이 지정되어 있다. 이 데이터셋은 5-10초 동안 녹화된 30fps 클립을 포함한다. JAAD에는 중복된 샘플이 많으며, 고유한 보행자의 총 수는 686명에 불과하다.

2019년에 발표된 PIE는 토론토 요크 대학교에서도 제공한 데이터셋으로, 6시간 동안 녹화된 30fps 동영상에서 700,000개의 레이블이 지정된 보행자 샘플을 포함한다. 그러나 이 중 180명만이 카메라를 바라보고 있다.

대신에, 새로운 논문의 저자들은 이전의 자율 주행 자동차 데이터셋에서 가장 적합한 데이터를 수집했다. 이러한 데이터셋은 독일 카를스루에 기술대학교의 KITTI, 스탠퍼드와 호주 몬애시 대학교의 JRDB, 그리고 MIT의 이전 스핀오프인 NuScenes이다.

이러한 데이터셋을 결합하여 연구진은 보스턴, 싱가포르, 튀빙겐, 팔로알토의 4개 도시에서 촬영된 다양한 장면을 포함하는 LOOK 데이터셋을 만들었다. 약 8,000개의 레이블이 지정된 보행자 관점이 포함되어 있으며, 저자들은 LOOK가 야외에서 시선 접촉 감지를 위한 가장 다양한 데이터셋이라고 주장한다.

훈련 및 결과

추출, 훈련, 평가 모두 NVIDIA GeForce GTX 1080ti와 Intel Core i7-8700 CPU를 사용하여 수행했다.

저자들은 자신의 방법이 기존의 최고 성능을至少 5% 이상 개선한다는 것을 발견했다. 또한 JAAD에서 훈련된 모델이 이전에 보지 못한 데이터에 잘 일반화된다는 것도 발견했다.

테스트는 복잡했으며, 작물 기반 모델을 포함해야 했다. 자세한 결과는 논문을 참조하라.

JAAD 데이터셋에서 평균 정밀도(AP) 결과, 저자들의 결과는 볼드체로 표시되어 있다.

JAAD 데이터셋에서 평균 정밀도(AP) 결과, 저자들의 결과는 볼드체로 표시되어 있다.

연구진은 코드를 공개했으며, 데이터셋은 여기에서, 소스 코드는 GitHub에서 확인할 수 있다.

저자들은 이 연구가 중요한 nhưng 간과된 주제에 대한 추가 연구를 영감을 줄 수 있기를 바란다.

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]