Anderson의 관점
AI, 비디오 회의에서 발표자에게 청중을 읽는 데 도움을 줌

2013년, 공포에 대한 일반적인 여론 조사에서 대중 연설의 가능성이 사망의 가능성보다 더 나쁨 것으로 나타났습니다. 이 증후군은 글로소포비아라고 알려져 있습니다.
COVID-19로 인한 ‘대면’ 회의에서 온라인 줌 회의로의 전환은 예상과 달리 상황을 개선하지 못했습니다. 많은 참가자가 있는 회의에서 저해상도 행과 참가자 아이콘, 그리고 얼굴 표정과 몸 언어의 미묘한 시각적 신호를 읽는 우리의 자연스러운 위협 평가 능력은 손상됩니다. 예를 들어, Skype는 비언어적 단서를 전달하는 데 부적절한 플랫폼으로 밝혀졌습니다.
공개 연설 성과에 대한 인식된 관심과 반응의 영향은 잘 문서화되어 있으며, 대부분의 사람들에게 직관적으로 명백합니다. 불투명한 청중 반응은 연사자가 주저하고 채우기 연설로 돌아갈 수 있습니다. 그들은 자신의 논증이 동의, 경멸, 또는 무관심을 받고 있는지 모르는 채로, 이는 연사자와 청중 모두에게 불편한 경험을 제공합니다.
COVID-19로 인한 비디오 회의로의 전환 압력으로 인해 문제는 더 심해지고 있으며, 지난 2년 동안 컴퓨터 비전 및 감정 연구 커뮤니티에서 여러 개선된 청중 피드백 방안이 제안되었습니다.
하드웨어 중심 솔루션
이러한 솔루션 대부분은 추가 장비 또는 복잡한 소프트웨어가 필요하므로 개인 정보 보호 또는 물류 문제가 발생할 수 있습니다. 2001년, MIT는 Galvactivator를 제안했습니다. 이는 손목에 착용하는 장치로, 청중 참가자의 감정 상태를 추론하고, 하루 동안 심포지엄에서 테스트되었습니다.

2001년 MIT의 Galvactivator, 청중의 감정 상태와 참여도를 이해하기 위해 피부 전도도를 측정한 예시. 출처: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf
학술적 에너지의 상당 부분은 또한 ‘클릭기’를 청중 반응 시스템(ARS)으로 배치하는 가능성에 할애했습니다. 이는 청중의 능동적 참여를 증가시키는 수단으로(이는 자동으로 참여도를 증가시킴) 그리고 연사자에게 격려를 주는 수단으로도 생각되었습니다.
연사자와 청중을 ‘연결’하려는 다른 시도에는 심박수 모니터링, 복잡한 신체 착용 장비를 사용하여 뇌전도, ‘환영 미터’, 컴퓨터 비전 기반 감정 인식, 그리고 연사자의 연설 중에 청중이 보낸 이모티콘이 포함되었습니다.

2017년, LMU 뮌헨과 슈투트가르트 대학교의 공동 학술 연구 프로젝트인 EngageMeter. 출처: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf
사설 분야에서는 특히 시선 추적 및 추적 시스템에 관심을 보였습니다. 여기서 각 청중 참가자는 시선 추적을 통해 참여도와 승인 지수를 측정합니다.
이 모든 방법은 상당히 고마합니다. 대부분이 고유의 하드웨어, 실험실 환경, 특수 소프트웨어 프레임워크, 그리고 비싼 상업용 API 구독이 필요하거나 이러한 제한 요소의 조합이 필요합니다.
따라서, 비디오 회의 도구 외에 거의 아무 것도 필요하지 않는 최소한의 시스템 개발이 지난 18개월 동안 관심을 받게 되었습니다.
청중의 승인을 미묘하게 보고하는 것
이 목적을 위해, 도쿄 대학교와 카네기 멜런 대학교 간의 새로운 연구 협력은 표준 비디오 회의 도구(예: 줌)에 웹캠이 포함된 웹 사이트만 사용하여 후크할 수 있는 새로운 시스템을 제공합니다. 이렇게 하면 로컬 브라우저 플러그인이 필요하지 않습니다.
사용자의 끌기와 추정된 시선 주의는 대표적인 데이터로 번역되어 연사자에게 시각화되므로, 내용이 청중을 얼마나 끌고 있는지에 대한 실시간 리투스 테스트를 허용합니다. 또한 연사자가 청중의 관심을 잃을 수 있는 담론의 기간에 대한 약간의 지시를 제공합니다.

CalmResponses에서 사용자의 주의와 끌기가 청중 피드백 풀에 추가되어 시각적으로 표현되어 연사자에게ประโยชน를 제공합니다. 출처: https://www.youtube.com/watch?v=J_PhB4FCzk0
많은 학술 상황에서, 온라인 강의와 같이, 학생들은 연사자에게 보이지 않습니다. 왜냐하면 그들은 웹캠을 켜지 않았기 때문입니다. CalmResponses는 시청자가 웹캠을 활성화할 필요 없이 연사자가 내용을 보는 방식을 보고 끌고 있는지 여부를 보고할 수 있습니다.
논문의 제목은 CalmResponses: 원격 통신에서 집단 청중 반응 표시이며, 도쿄 대학교의 두 명의 연구자와 카네기 멜런 대학교의 한 명의 연구자 간의 공동 연구입니다.
저자들은 라이브 웹 기반 데모를 제공하며, GitHub에서 소스 코드를 공개했습니다.
CalmResponses 프레임워크
CalmResponses의 끌기, 다른 가능한 머리 자세와 대조적으로, 청중의 머리 움직임의 80% 이상이 끌기라는 연구(일부는 다윈 시대까지 거슬러 올라감)에 기반합니다. 동시에, 시선 움직임은 여러 연구에서 관심이나 참여의 신뢰할 수 있는 지표로 나타났습니다.
CalmResponses는 HTML, CSS, 자바스크립트로 구현되었으며, 세 개의 하위 시스템으로 구성되어 있습니다. 청중 클라이언트, 연사자 클라이언트, 서버입니다. 청중 클라이언트는 사용자의 웹캠에서 시선이나 머리 움직임 데이터를 Heroku 클라우드 애플리케이션 플랫폼을 통해 WebSocket으로 전송합니다.

청중의 끌기가 오른쪽에 애니메이션運動으로 시각화된 CalmResponses. 출처: https://arxiv.org/pdf/2204.02308.pdf
프로젝트의 시선 추적 부분에서, 연구자들은 WebGazer를 사용했습니다. 이는 저지연으로 웹사이트에서 직접 실행할 수 있는 가벼운 자바스크립트 기반 브라우저 내 시선 추적 프레임워크입니다.
입력 포즈 데이터는 거친 집계 반응 인식을 위해 필요한 精密한 시선 및 포즈 추정보다 더 중요하므로, 전체 반응 추정에 고려되기 전에 평균 값에 따라 스무딩됩니다.
끌기 동작은 자바스크립트 라이브러리 clmtrackr을 통해 평가됩니다. 이는 이미지 또는 비디오에서 감지된 얼굴에 얼굴 모델을 맞추는 것을 통해 정규화된 랜드마크 평균 이동을 수행합니다. 저렴하고 저지연을 위해, 저자의 구현에서는 코의 감지된 랜드마크만 활성화하여 끌기 동작을 추적합니다.
히트 맵
끌기 활동은 동적인 점으로 표현되는 반면, 시선 주의는 공유된 발표 화면이나 비디오 회의 환경에서 일반적인 관심의 초점이 어디에 있는지 보여주는 히트 맵으로 보고됩니다.

모든 참가자는 일반적인 사용자 주의가 어디에 집중되어 있는지 볼 수 있습니다.
테스트
CalmResponses를 위해 두 가지 테스트 환경이 설계되었습니다. 첫 번째 실험은 기준선 조건과 CalmResponses-이용자 평가 조건을 비교했습니다. 두 번째 실험은 기준선 조건과 CalmResponses-끌기 조건을 비교했습니다. 피드백은 연사자와 청중 모두로부터 얻었습니다.
각 실험에서 세 가지 요인이 평가되었습니다. 발표에 대한 객관적 및 주관적 평가(연사자에게서 자기 보고 설문조사 포함), ‘채우기’ 연설의 사건 수, 그리고 질적 댓글입니다. 이러한 기준은 연설의 품질과 연사자의 불안을 평가하는 일반적인 추정기입니다.
테스트 풀은 19-44세의 38명으로 구성되었습니다. 29명의 남성과 9명의 여성으로 구성되었으며, 평균 나이는 24.7세였습니다. 모두 일본인 또는 중국인으로, 일본어에 능통했습니다. 그들은 6-7명의 참가자로 구성된 5개의 그룹으로 임의로 나누어졌으며, 주제들은 서로를 개인적으로 알지 못했습니다.
테스트는 줌에서 수행되었으며, 첫 번째 실험에서는 5명의 연사자가 발표를 했으며, 두 번째 실험에서는 6명의 연사자가 발표를 했습니다.

채우기 조건은 오렌지색 박스로 표시됩니다.
연구자들은 한 연사자의 채우기가 현저하게 줄었으며, ‘CR-N 조건’에서 연사자는 거의 채우기 구절을 말하지 않았다고 지적합니다. 본 논문에서 자세한 결과를 참조하십시오. 가장 두드러진 결과는 연사자와 청중 참가자 모두의 주관적 평가에서 나왔습니다.
청중의 댓글에는 다음과 같은 내용이 포함되었습니다.
‘나는 발표에 참여했다고 느꼈어’ [AN2], ‘나는 연사자의 연설이 개선되었는지 확신할 수 없지만, 다른 사람들의 머리 움직임 시각화에서 단결의 감정을 느꼈어.’ [AN6]
‘나는 연사자의 연설이 개선되었는지 확신할 수 없지만, 다른 사람들의 머리 움직임 시각화에서 단결의 감정을 느꼈어.’
연구자들은 시스템이 연사자의 발표에 새로운 인공적인 중지를 도입한다는 점을 주목합니다. 연사자는 청중의 피드백을 평가하기 위해 시각적 시스템을 참조하는 경향이 있습니다.
그들은 또한 일부 참가자가 생체 데이터를 모니터링할 수 있는 가능성에 대한 보안 영향으로 인해 제한을 느꼈을 수 있다는 점을 주목합니다.
결론
이와 같은 시스템의 주목할만한 장점은, 이러한 접근 방식에 필요한 비표준 부수 기술이 사용 후 완전히 사라진다는 것입니다. 브라우저 플러그인을 제거하거나 참가자들이 시스템에서 남아 있는지에 대한 의구심을 없애는 필요가 없습니다. 또한 사용자를 소프트웨어 설치 과정이나 브라우저 기반 추가 기능 및 확장 프로그램을 설치하는 데 필요한 권한을 안내할 필요가 없습니다.
평가된 얼굴과 시선 움직임은 전용 로컬 머신 러닝 프레임워크(예: YOLO 시리즈)를 사용하는 경우보다 정확하지 않을 수 있지만, 이러한 거의 마찰 없는 접근 방식은 일반적인 비디오 회의 시나리오에서 광범위한 감정 및 태도 분석에 충분한 정확도를 제공합니다. 무엇보다도, 이는 매우 저렴합니다.
자세한 내용과 예시는 본문 끝에 있는 임베디드 비디오를 참조하십시오.
最初에 2022년 4월 11일에 게시되었습니다.













