Anderson의 관점
‘부엉이와 도마뱀’을 광고주의 청중에서 찾기

온라인 광고 분야는 2023년에 740.3억 달러를 투자한 것으로 추정되므로, 광고 회사가 이 특정 컴퓨터 비전 연구 분야에 상당한 자원을 투자하는 이유를 쉽게 이해할 수 있습니다.
이 산업은 폐쇄적이고 보호적이지만, 가끔씩 얼굴 인식과 시선 추적에 대한 더 고급의 사유재산 연구에 대한 힌트를 주는 연구를 발표합니다. 이는 인구 통계 분석 통계에 중대한 나이 인식과 같은 것을 포함합니다.

광고에서 특정 인구 통계를 대상으로 하는 광고주에게 관심 있는 야생 광고 환경에서 나이 추정은 관심 대상입니다. 이 자동 얼굴 나이 추정의 실험 예에서 연주자 밥 딜런의 나이가 여러 해에 걸쳐 추적됩니다. 출처: https://arxiv.org/pdf/1906.03625
이러한 연구는 공공 저장소에 거의 나타나지 않으며, 합법적으로 모집된 참가자를 기반으로 광고와의 참여 정도를 결정하기 위한 AI 기반 분석을 수행합니다.

Dlib의 Histogram of Oriented Gradients(HoG)는 종종 얼굴 추정 시스템에서 사용됩니다. 출처: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
동물 본능
이와 관련하여, 자연스럽게 광고 산업은 거짓 양성(분석 시스템이 주체의 행동을 잘못 해석하는 경우)을 결정하고, 콘텐츠와 완전히 참여하지 않는 사람을 위한 명확한 기준을 설정하는 데 관심이 있습니다.
스크린 기반 광고에 관해서는, 연구는 일반적으로 두 가지 문제에 초점을 맞추고 있습니다. 두 가지 환경은 ‘데스크톱’과 ‘모바일’이며, 각 환경에는 별도의 추적 솔루션이 필요합니다. 두 가지 문제는 광고주의 관점에서 ‘부엉이 행동’과 ‘도마뱀 행동’으로 나타납니다. 즉, 시청자가 화면 앞에 있는 광고에 완전히 주의를 기울이지 않는 경향입니다.

광고 연구 프로젝트의 주제에서 ‘부엉이’와 ‘도마뱀’ 행동의 예입니다. 출처: https://arxiv.org/pdf/1508.04028
만약 당신이 의도된 광고에서 머리를 돌리고 시선을 다른 곳으로 돌리면, 이것은 ‘부엉이’ 행동입니다. 만약 당신의 머리 자세는 정적이지만, 당신의 시선이 화면에서 멀어지면, 이것은 ‘도마뱀’ 행동입니다. 분석과 새로운 광고의 테스트에서, 이러한 행동은 시스템이 포착해야 하는 필수적인 행동입니다.
SmartEye의 Affectiva 인수를 통해 새로운 논문은 이러한 문제를 해결하는 아키텍처를 제공하며, 기존 프레임워크를 활용하여 모든 필수 조건과 가능한 반응에 대한 결합된 특징 집합을 제공합니다.

다양한 분산 신호에 대한 새로운 주의 시스템에서 감지된 真과 偽 양성의 예입니다. 데스크톱과 모바일 장치를 별도로 표시합니다. 출처: https://arxiv.org/pdf/2504.06237
저자들은 다음과 같이 말합니다:
‘제한된 연구는 온라인 광고 중 주의를 모니터링하는 데 초점을 맞추고 있습니다. 이러한 연구는 주의를 식별하기 위해 머리 자세나 시선 방향을 추정하는 데 중점을 두었지만, 장치 유형(데스크톱 또는 모바일), 카메라 배치, 화면 크기와 같은 중요한 매개 변수를 무시했습니다. 이러한 요인들은 주의 탐지에 상당한 영향을 미칩니다. ‘
‘본 논문에서, 우리는 다양한 분산 신호(화면 밖 시선, 말하기, 하품, 화면 미처리)를 탐지하는 주의 탐지 아키텍처를 제안합니다. 이전 접근 방식과는 달리, 우리의 방법은 장치별 특징(장치 유형, 카메라 배치, 화면 크기)을 원시 시선 추정과 결합하여 주의 탐지 정확도를 향상시킵니다.’
새로운 연구는 온라인 광고 중 시청자 주의 모니터링이라고 불리며, Affectiva의 4명의 연구자로부터 나왔습니다.
방법과 데이터
이 새로운 논문은 이러한 시스템의 비밀스럽고 폐쇄적인 특성으로 인해, 저자의 접근 방식을 직접적으로 비교하지 않습니다. 대신, 저자들은 그들의 연구를 제시합니다.
저자들은 온라인 광고의 contexto에서 주의 탐지에 대한 연구가 제한적이라고 강조합니다. AFFDEX SDK에서는 실제 시간 다중 얼굴 인식을 제공하며, 주의는 머리 자세만으로 추론됩니다.

Affectiva 시스템에서 주의를 나타내는 머리 자세를 나타내는 예입니다. 출처: https://www.youtube.com/watch?v=c2CWb5jHmbY
2019년 협력 연구 딥 러닝을 사용한 비디오 콘텐츠에 대한 시각적 주의 자동 측정에서는 약 28,000명의 참가자가 다양한 주의 없는 행동(시선 돌리기, 眼을 닫기, 무관한 활동 참여)을 위해 주석이 달렸으며, CNN-LSTM 모델이 시간 경과에 따른 얼굴 외모에서 주의를 감지하도록 훈련되었습니다.

2019년 논문에서 예측된 주의 상태를 나타내는 예입니다. 출처: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
그러나 저자들은 이전 연구가 장치별 요인(데스크톱 또는 모바일 장치 사용 여부)을 고려하지 않았으며, AFFDEX 시스템은 시선 분산만을 식별하며, 다른 분산 소스를 무시합니다.
저자들은 일부 인기 있는 연구가 광고 테스트에 최적화되지 않았으며, 카메라 배치와 캘리브레이션이 일반적으로 고정되어 있는 도메인(드라이빙 또는 교육)과 달리, 미캘리브레이션 설정에서 작동하며, 데스크톱과 모바일 장치의 제한된 시선 범위에서 작동합니다.
따라서 저자들은 두 가지 상업용 툴킷(AFFDEX 2.0과 SmartEye SDK)을 활용하여 광고 중 시청자 주의를 탐지하는 아키텍처를 설계했습니다.

AFFDEX 2.0의 얼굴 분석 예입니다. 출처: https://arxiv.org/pdf/2202.12059
이전 연구는 얼굴 표현, 머리 자세, 시선 방향과 같은 저수준 시각적 특징을 추출합니다. 이러한 특징은 시선 위치, 하품, 말하기와 같은 고수준 지표로 처리됩니다.
시스템은 네 가지 유형의 분산을 식별합니다: 화면 밖 시선, 졸음, 말하기, 미처리된 화면. 또한 시스템은 데스크톱과 모바일 장치에서 시선 분석을 조정합니다.
데이터셋: 시선
저자들은 주의 탐지 시스템을 구동하고 평가하기 위해 네 가지 데이터셋을 사용했습니다. 세 가지 데이터셋은 시선 행동, 말하기, 하품을 각각 중점으로 하며, 네 번째 데이터셋은 실제 광고 테스트 세션에서 다양한 분산 유형의 혼합을 포함합니다.
작업의 특정 요구 사항으로 인해, 각 범주에 대한 사용자 정의 데이터셋이 생성되었습니다. 모든 데이터셋은 수백만 개의 기록된 세션이 포함된 사유 저장소에서 수집되었으며, 참가자들은 웹 기반 설정에서 광고를 시청하고, 동의를 얻었습니다.
시선 데이터셋을 구성하기 위해, 참가자들은 화면의 여러 지점을 따라 이동하는 점을 따르도록 요청받았으며, 그 후에 위, 아래, 왼쪽, 오른쪽 네 방향으로 화면에서 시선을 돌리도록 요청받았습니다. 이러한 방식으로, 캡처와 커버리지 간의 관계가 설정되었습니다.

데스크톱과 모바일 장치에서 시선 비디오 자극의 스크린샷입니다.
이동하는 점 세그먼트는 주의를 기울이는 것으로 레이블이 지정되었으며, 화면 밖 세그먼트는 주의를 기울이지 않는 것으로 레이블이 지정되었습니다. 이를 통해 양성과 음성 예제가 모두 레이블이 지정된 데이터셋이 생성되었습니다.
각 비디오는 약 160초 동안 지속되며, 데스크톱과 모바일 플랫폼을 위한 별도의 버전이 생성되었습니다. 데스크톱과 모바일 녹화의 해상도는 각각 1920×1080과 608×1080입니다.
총 609개의 비디오가 수집되었으며, 322개의 데스크톱 녹화와 287개의 모바일 녹화가 포함되었습니다. 레이블은 비디오 콘텐츠를 기반으로 자동으로 적용되었으며, 데이터셋은 158개의 훈련 샘플과 451개의 테스트 샘플로 분할되었습니다.
데이터셋: 말하기
이 contexto에서, ‘주의不到’를 정의하는 기준 중 하나는 1초 이상 말하는 것입니다(일시적인 댓글이나 기침일 수 있습니다).
제어 환경에서는 오디오를 기록하거나 분석하지 않으므로, 말하기는 추정된 얼굴 랜드마크의 내부 이동을 관찰하여 추론됩니다. 따라서 저자들은 시각 입력만을 기반으로 한 데이터셋을 생성했습니다.
이 데이터셋은 두 부분으로 나뉩니다. 첫 번째 부분에는 약 5,500개의 비디오가 포함되어 있으며, 각 비디오는 세 명의 주석자가 말하는지 또는 말하지 않는지에 대해 레이블을 지정했습니다(이 중 4,400개는 훈련과 검증에 사용되었으며, 1,100개는 테스트에 사용되었습니다).
데이터셋: 하품
하품 데이터셋은 이미 존재하지만, 저자들은 이러한 데이터셋이 광고 테스트 시나리오에 적합하지 않다고 주장합니다. 이러한 데이터셋은 시뮬레이션된 하품을 특징으로 하거나, 두려움 또는 다른 비하품 행동과 혼동될 수 있는 얼굴 구부러짐을 포함합니다.
따라서 저자들은 735개의 비디오를 사용하여, 각 비디오에서 하품이 1초 이상 지속되는 세션을 선택했습니다. 각 비디오는 세 명의 주석자가 활성 하품 또는 비활성 하품으로 레이블을 지정했습니다. 활성 하품을 포함하는 프레임은 2.6%에 불과했습니다. 이를 통해 클래스 불균형이 발생했으며, 데이터셋은 670개의 훈련 비디오와 65개의 테스트 비디오로 분할되었습니다.
데이터셋: 분산
분산 데이터셋은 또한 저자의 광고 테스트 저장소에서 수집되었습니다. 여기서 참가자들은 실제 광고를 보았으며, 할당된 작업이 없었습니다. 총 520개의 세션이 무작위로 선택되었으며, 세 명의 주석자가 주의를 기울이는지 또는 주의를 기울이지 않는지에 대해 레이블을 지정했습니다.
주의不到한 행동에는 화면 밖 시선, 말하기, 졸음, 미처리된 화면이 포함되었습니다. 세션은 전 세계 다양한 지역에서 수집되었으며, 데스크톱 녹화가 더 흔했습니다.
주의 모델
제안된 주의 모델은 저수준 시각적 특징(얼굴 표현, 머리 자세, 시선 방향)을 처리합니다. 이러한 특징은 AFFDEX 2.0과 SmartEye SDK를 통해 추출됩니다.
이러한 특징은 고수준 지표로 변환되며, 각 분산 유형은 별도의 이진 분류器에 의해 처리됩니다.

제안된 모니터링 시스템의 스키마입니다.
시선 모델은 정규화된 시선 좌표를 사용하여 화면을看着 있는지 또는 화면 밖을看着 있는지 결정합니다. 데스크톱과 모바일 장치에 대한 별도의 캘리브레이션이 수행됩니다.
말하기를 감지하기 위해, 시스템은 입술 영역을 자르고, 3D-CNN을 사용하여 대화와 비대화 비디오 세그먼트를 훈련합니다. 레이블은 세션 유형을 기반으로 할당되며, 시간적 평활화는 입의 짧은 움직임으로 인한 거짓 양성 오류를 줄입니다.
하품은 전체 얼굴 이미지 크롭을 사용하여 더 넓은 얼굴 운동을 캡처하며, 3D-CNN을 사용하여 수동으로 레이블이 지정된 프레임을 훈련합니다.
미처리된 화면은 얼굴이나 극단적인 머리 자세의 부재로 식별되며, 예측은 결정 트리によって 수행됩니다.
최종 주의 상태는 고정된 규칙을 사용하여 결정됩니다: 만약 어떤 모듈でも 주의不到한 상태를 감지하면, 시청자는 주의不到한 것으로 표시됩니다.
테스트
테스트는 구성 요소를 제거하고 결과에 미치는 영향을 관찰하는 방식으로 수행됩니다.

연구에서 식별된 주의不到한 행동의 다양한 범주입니다.
시선 모델은 화면 밖 행동을 세 가지 주요 단계를 통해 식별합니다: 원시 시선 추정의 정규화, 출력의 세부 조정, 데스크톱 장치의 화면 크기 추정.
각 구성 요소의 중요성을 이해하기 위해, 저자들은 구성 요소를 개별적으로 제거하고, 두 데이터셋에서 226개의 데스크톱과 225개의 모바일 비디오에서 성능을 평가했습니다. 결과는 G-평균과 F1 점수를 사용하여 측정되며, 아래에 표시됩니다.

전체 시선 모델의 성능과 개별 처리 단계를 제거한 버전의 성능을 나타내는 결과입니다.
모든 경우에서, 구성 요소를 생략하면 성능이 저하됩니다. 데스크톱에서 정규화가 특히 유용합니다.
연구는 또한 시각적 특징이 모바일 카메라 방향을 예측하는 방법을 평가했습니다.
말하기 모델은 수직 唇 거리를 사용하여 수동으로 레이블이 지정된 테스트 세트에서 ROC-AUC 0.97을 달성했습니다.
하품 모델은 唇 비율만을 사용하여 96.6%의 ROC-AUC를 달성했습니다.
미처리된 화면 모델은 AFFDEX 2.0과 SmartEye가 1초 이상 동안 얼굴을 감지하지 못할 때 주의不到한 것으로 분류했습니다.
저자들은 다음과 같이 말합니다:
‘분산 신호를 모두 통합하면 주의 탐지 능력이 향상됩니다. 두 번째로, 주의 탐지의 개선은 데스크톱과 모바일 장치 모두에서 일관되게 유지됩니다. 세 번째로, 모바일 세션에서는 화면을 멀리看到 하는 경우에 큰 머리 움직임이 발생하여, 데스크톱보다 모바일 장치에서 성능이 더 높습니다. 네 번째로, 졸음 신호를 추가하면 다른 신호에 비해 상대적으로 약간의 개선만 제공합니다. 마지막으로, 미처리된 화면 신호는 모바일 장치에서 더 큰 개선을 제공합니다.’
저자들은 또한 AFFDEX 1.0과 비교했으며, 현재 모델의 머리 기반 시선 탐지가 데스크톱과 모바일 장치 모두에서 AFFDEX 1.0을 능가했습니다.
결론
결과는 이전 연구에 비해 측정된 진보를 나타냅니다. 그러나 연구의 더 깊은 가치는 시청자의 내부 상태에 접근하기 위한 지속적인 노력을 제공하는 것입니다.
이러한 연구는 광고주의 청중에서 ‘부엉이’와 ‘도마뱀’을 찾는 데 사용될 수 있으며, 이러한 기술은 구조화된 시장 연구 설정을 넘어 확장될 수 있습니다. 이러한 결론은 이 특정 연구 분야의 폐쇄적이고 제한적인 특성으로 인해 더욱 강화됩니다.
* 저자의 인용문을 하이퍼링크로 변환했습니다.
最初에 2025년 4월 9일에 게시되었습니다.












