Andersonの視点

広告主の視聴者層に『フクロウとトカゲ』を見つける

mm
Unite.AI を Google の優先ソースに追加
Images from the paper 'Monitoring Viewer Attention During Online Ads' (https://arxiv.org/pdf/2504.06237)

オンライン広告市場は、2023年に740.3億ドルを費やしたと推定されており、広告会社がこの特定のコンピュータビジョン研究分野に多大なリソースを投入しているのは、理解できることである。

この業界は、閉鎖的で保護的であるが、時折、より高度な独自の顔認識や視線追跡に関する研究を公開している。これらの研究には、年齢認識が含まれており、人口統計分析の統計に重要である。

広告の文脈では、特定の年齢層を対象とする広告主にとって、年齢の推定は重要である。この実験的な自動顔年齢推定の例では、ボブ・ディランの年齢が追跡されている。出典: https://arxiv.org/pdf/1906.03625

広告の文脈では、特定の年齢層を対象とする広告主にとって、年齢の推定は重要である。この実験的な自動顔年齢推定の例では、ボブ・ディランの年齢が追跡されている。出典: https://arxiv.org/pdf/1906.03625

これらの研究は、Arxivなどの公開リポジトリにほとんど登場しないが、AI駆動の分析を使用して、視聴者が広告とどのように関わっているかを判断するために、正当に募集された参加者を使用している。

Dlibの方向グラフィック(Histogram of Oriented Gradients)は、顔推定システムでよく使用される。出典: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

Dlibの方向グラフィック(Histogram of Oriented Gradients)は、顔推定システムでよく使用される。出典: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

動物本能

この点では、広告業界は、分析システムが視聴者の行動を誤って解釈する「偽陽性」を決定し、視聴者がコンテンツに完全に関与していない場合の明確な基準を確立することに興味がある。

画面ベースの広告については、研究は、2つの環境(デスクトップとモバイル)と2つの問題(「フクロウの行動」と「トカゲの行動」)に焦点を当てている。視聴者が広告に完全に注意を払っていない傾向を表すこれらの行動は、広告主にとって重要である。

広告研究プロジェクトの被験者の「フクロウの行動」と「トカゲの行動」の例。出典: https://arxiv.org/pdf/1508.04028

広告研究プロジェクトの被験者の「フクロウの行動」と「トカゲの行動」の例。出典: https://arxiv.org/pdf/1508.04028

あなたが広告から「見て」いる場合、これは「フクロウの行動」です。頭のポーズは静止しているが、目が画面から「さまよっている」場合、これは「トカゲの行動」です。広告のテストと分析の観点から、これらはシステムが捉える必要のある重要なアクションです。

SmartEyeのAffectivaの新しい論文は、これらの問題に対処し、すべての必要な条件と可能な反応をカバーする統合された特徴セットを提供するアーキテクチャを提案している。

デスクトップとモバイルデバイスのさまざまな妨害信号に対する新しい注意システムの真陽性と偽陽性の例。出典: https://arxiv.org/pdf/2504.06237

デスクトップとモバイルデバイスのさまざまな妨害信号に対する新しい注意システムの真陽性と偽陽性の例。出典: https://arxiv.org/pdf/2504.06237

著者は次のように述べている。

‘オンライン広告中の注意を監視する研究は限られている。視線の方向を推定して視線の逸れを特定することに焦点を当てているが、デバイスの種類(デスクトップまたはモバイル)、カメラの配置、画面サイズなどの重要なパラメータを無視している。’

‘この論文では、さまざまな妨害(フクロウの行動、トカゲの行動、だるさ、話し、画面の放棄)を検出するためのアーキテクチャを提案する。デバイス固有の特徴(デバイスの種類、カメラの配置、画面サイズ)と生の視線推定を統合して、注意検出の精度を高める。’

方法とデータ

この研究は、通常のコンピュータビジョン文献の形式に従っていないため、著者らのアプローチを直接比較するのではなく、削除実験として提示する。

著者らは、オンライン広告の文脈での注意検出を扱う研究は限られていると強調している。AFFDEX SDKでは、注意は頭のポーズのみから推測され、参加者は頭の角度が定義されたしきい値を超えた場合、注意が散漫であるとラベル付けされる。

AFFDEX SDKの例。頭のポーズを注意の指標として使用するAffectivaシステム。出典: https://www.youtube.com/watch?v=c2CWb5jHmbY

AFFDEX SDKの例。頭のポーズを注意の指標として使用するAffectivaシステム。出典: https://www.youtube.com/watch?v=c2CWb5jHmbY

2019年の共同研究では、約28,000人の参加者からなるデータセットが、さまざまな注意が散漫な行動(視線を外に逸らす、目を閉じる、無関係な活動に従事する)に注釈付けられ、CNN-LSTMモデルが顔の外見から注意を検出するために訓練された。

2019年の論文からの例。画面の視聴者に対する予測された注意状態を示す。出典: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

2019年の論文からの例。画面の視聴者に対する予測された注意状態を示す。出典: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

しかし、著者らは、これらの以前の努力は、デバイス固有の要因(デスクトップまたはモバイルの使用、画面サイズ、カメラの配置)を考慮していないと指摘する。また、AFFDEXシステムは視線の逸れのみを特定し、他の妨害源を省略しているのに対し、2019年の研究はより広範な行動を検出しようとしているが、その使用する単一の浅いCNNはこのタスクに不十分であると述べている。

著者らは、オンライン広告のテストには、ドライブや教育などの他のドメインとは異なるニーズがあり、カメラの配置と校正は通常事前に固定されているが、未校正の設定を使用し、デスクトップとモバイルデバイスの限定された視線範囲内で動作する必要があると述べている。

したがって、著者らは、AFFDEX 2.0とSmartEye SDKの2つの商用ツールキットを利用して、オンライン広告中の視聴者の注意を検出するためのアーキテクチャを提案している。

AFFDEX 2.0からの顔分析の例。出典: https://arxiv.org/pdf/2202.12059

AFFDEX 2.0からの顔分析の例。出典: https://arxiv.org/pdf/2202.12059

データセット:視線

著者らは、4つのデータセットを使用して注意検出システムを動作させ、評価した。3つは視線、話し、だるさに焦点を当てており、4つ目は実際の広告テストセッションからの混合妨害タイプのデータセットであった。

カスタムデータセットは、視線、話し、だるさの各カテゴリ用に作成された。参加者は、画面上のさまざまな点を追跡する移動ドットに従うように求められ、次に画面から4方向(上、下、左、右)に視線を外に逸らすシーケンスを3回繰り返した。

デスクトップとモバイルデバイスの視線ビデオ刺激のスクリーンショット。最初と3番目のフレームは移動ドットに従うための指示を表示し、2番目と4番目のフレームは画面から視線を外に逸らすためのプロンプトを表示する。

デスクトップとモバイルデバイスの視線ビデオ刺激のスクリーンショット。最初と3番目のフレームは移動ドットに従うための指示を表示し、2番目と4番目のフレームは画面から視線を外に逸らすためのプロンプトを表示する。

移動ドットのセグメントは「注意を払っている」とラベル付けされ、画面から外に視線を逸らすセグメントは「注意を散漫にしている」とラベル付けされた。視線のデータセットは、正と負の両方の例のラベル付けされたデータセットを生成した。

データセット:話し

話しデータセットは、視聴覚コンテンツを視聴中に話し声を検出するために作成された。1秒以上話し続けることは「注意を散漫にしている」とみなされる。

このデータセットは、内部リポジトリから視聴覚コンテンツを視聴中に話し声を検出するために作成された。約5,500のビデオクリップがあり、3人のアノテーターによって話し声と話し声以外にラベル付けされた。

データセット:だるさ

だるさデータセットは、実際の広告テストシナリオに適したものを作成するために作成された。既存のデータセットは、模擬のあくびや、恐怖やその他の非あくびの表情と混同される可能性のある顔のゆがみを含むことが多いため、不適切であると判断された。

著者らは、735のビデオクリップを使用し、1秒以上のあくびを含むセッションを選択した。各ビデオは3人のアノテーターによってあくびとあくび以外にラベル付けされた。

データセット:妨害

妨害データセットは、実際の広告テストセッションから作成された。520のセッション(モバイル193、デスクトップ327)がランダムに選択され、3人のアノテーターによって「注意を払っている」と「注意を散漫にしている」にラベル付けされた。

注意モデル

提案された注意モデルは、低レベルの視覚特徴(顔の表情、頭のポーズ、視線の方向)を処理して、高レベルの指標(視線の位置、だるさ、話し声)を生成する。

このシステムは、4つの妨害タイプ(画面外の視線、だるさ、話し声、画面の放棄)を識別し、デスクトップとモバイルデバイスの両方で視線分析を調整する。

テスト

テストは、削除法に従って実施され、コンポーネントを削除し、結果に与える影響を観察した。

視線モデルは、3つの重要なステップ(生の視線推定の正規化、出力の微調整、デスクトップデバイスの画面サイズの推定)を通じて、画面外の行動を識別した。

結果は、G-meanとF1スコアを使用して評価され、次の表に示すように、各コンポーネントの削除によってパフォーマンスが低下したことが示された。

フルな視線モデルと、個々の処理ステップを削除したバージョンのパフォーマンスの結果。

フルな視線モデルと、個々の処理ステップを削除したバージョンのパフォーマンスの結果。

著者らは、視聴覚コンテンツを視聴中に話し声を検出する話しモデルを評価し、ROC-AUCで0.97のスコアを達成した。

あくびモデルは、ROC-AUCで96.6%のスコアを達成し、AFFDEX 2.0からのアクションユニットの予測と組み合わせると、97.5%に改善された。

欠落していたモデル構成と評価結果

提案システムはAFFDEX 2.0とSmartEye SDKから顔表情、頭部姿勢、視線方向という低水準の特徴を抽出し、画面上の視線位置、あくび、発話などの高水準の指標へ変換する。各注意散漫要因は専用データセットで学習した独立の二値分類器が担当する。いずれかのモジュールが注意散漫を検出すると視聴者全体を「不注意」と判定する感度重視の規則を採用し、デスクトップとモバイルで別々に調整した。

視線モデルは正規化された視線座標を用い、デスクトップとモバイルで別々に較正する。空間・時間特徴を使う線形SVMとメモリーウィンドウによって急な視線変化を平滑化した。音声を使わない発話検出では口元の切り出し画像と3D-CNNを用い、短い口の動きによる誤検出を時間方向の平滑化で抑えた。あくび検出には顔全体の画像と3D-CNNを使い、顔が見つからない状態や極端な頭部姿勢は決定木によって画面放置として分類した。

アブレーション試験の詳細

視線モデルの評価には、2つのデータセットからデスクトップ226本、モバイル225本の動画を使用した。生の視線推定値の正規化、出力の微調整、デスクトップ画面サイズの推定を一つずつ除き、G-meanとF1スコアへの影響を測定したところ、どの処理を外しても性能が低下した。特にカメラ位置のばらつきが大きいデスクトップでは正規化が有効だった。

モバイルカメラの向きを予測する視覚特徴では、顔位置が0.75、頭部姿勢が0.74、視線が0.60だったのに対し、三つを組み合わせると0.91に達した。これは単一の手がかりより複数の特徴を統合する方が有効であることを示す。

発話モデルは手作業でラベル付けしたテストセットでROC-AUC 0.97、自動ラベルの大規模データセットで0.96を達成し、両方で一貫した性能を示した。あくびモデルは口の縦横比だけでROC-AUC 96.6%となり、AFFDEX 2.0のアクションユニット予測を加えると97.5%に改善した。

画面放置と複数の注意散漫信号

画面放置モデルはAFFDEX 2.0とSmartEyeの双方が1秒を超えて顔を検出できない場合に不注意と判定する。実際の注意散漫データセットで「顔なし」イベントを人手で調べると、利用者が物理的に画面を離れた例は27%だけだった。ただし残りにも、極端に画面外を見る、大きく動く、手や物で顔を隠すなど、注意散漫を示す原因が多く含まれていた。カメラ遮蔽や映像の歪みなど曖昧な事例は分析から除外された。

さらに、画面外の視線、眠気、発話、画面放置という信号を順に追加して全体性能を調べた。実際の注意散漫データセットと視線データセットのテスト部分の双方で、信号を増やすほどG-meanとF1が一貫して向上した。最も一般的な画面外視線が強い基準となり、眠気は発生頻度が低いため改善幅が比較的小さかった。画面放置信号は置き去りにしやすいモバイル端末でより大きな改善をもたらした。

従来の広告試験システムAFFDEX 1.0との比較では、新モデルの頭部ベースの視線検出だけでも両端末種別で旧システムを上回った。ヨーとピッチの両方向の頭部運動を取り込み、小さな姿勢変化を正規化したことが改善につながった。

限界と誤検出

著者らは、制御されていない環境でも複数の注意散漫要因を検出できる一方、画面を見たまま頭を大きく傾ける場合、口が一部隠れる場合、目の映像が極端にぼやける場合、顔が非常に暗い場合などには誤検出が起こり得ると説明している。また、データは同意を得た広告視聴セッションから収集されたが、契約上の制約により公開できず、競合手法との直接比較ではなく主にアブレーション試験で評価された点も解釈上の制約となる。

結論

この研究の結果は、以前の研究に対する測定された nhưng 意味のある進歩を表し、この研究の価値は、視聴者の内部状態へのアクセスを継続的に推進することにある。

この結論は、特にこの研究分野の閉鎖的で保護的な性質によって裏付けられる。

原文から復元した図

視聴者注意検出研究の図 10
英語原文から復元した研究図および評価結果
視聴者注意検出研究の図 11
英語原文から復元した研究図および評価結果
視聴者注意検出研究の図 12
英語原文から復元した研究図および評価結果
視聴者注意検出研究の図 13
英語原文から復元した研究図および評価結果
視聴者注意検出研究の図 14
英語原文から復元した研究図および評価結果

出典と参考リンク

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai