Andersonの視点

広告主の視聴者層に『フクロウとトカゲ』を見つける

mm
Unite.AI を Google の優先ソースに追加
Images from the paper 'Monitoring Viewer Attention During Online Ads' (https://arxiv.org/pdf/2504.06237)

オンライン広告市場は、2023年に740.3億ドルを費やしたと推定されており、広告会社がこの特定のコンピュータビジョン研究分野に多大なリソースを投入しているのは、理解できることである。

この業界は、閉鎖的で保護的であるが、時折、より高度な独自の顔認識や視線追跡に関する研究を公開している。これらの研究には、年齢認識が含まれており、人口統計分析の統計に重要である。

広告の文脈では、特定の年齢層を対象とする広告主にとって、年齢の推定は重要である。この実験的な自動顔年齢推定の例では、ボブ・ディランの年齢が追跡されている。出典: https://arxiv.org/pdf/1906.03625

広告の文脈では、特定の年齢層を対象とする広告主にとって、年齢の推定は重要である。この実験的な自動顔年齢推定の例では、ボブ・ディランの年齢が追跡されている。出典: https://arxiv.org/pdf/1906.03625

これらの研究は、Arxivなどの公開リポジトリにほとんど登場しないが、AI駆動の分析を使用して、視聴者が広告とどのように関わっているかを判断するために、正当に募集された参加者を使用している。

Dlibの方向グラフィック(Histogram of Oriented Gradients)は、顔推定システムでよく使用される。出典: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

Dlibの方向グラフィック(Histogram of Oriented Gradients)は、顔推定システムでよく使用される。出典: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

動物本能

この点では、広告業界は、分析システムが視聴者の行動を誤って解釈する「偽陽性」を決定し、視聴者がコンテンツに完全に関与していない場合の明確な基準を確立することに興味がある。

画面ベースの広告については、研究は、2つの環境(デスクトップとモバイル)と2つの問題(「フクロウの行動」と「トカゲの行動」)に焦点を当てている。視聴者が広告に完全に注意を払っていない傾向を表すこれらの行動は、広告主にとって重要である。

広告研究プロジェクトの被験者の「フクロウの行動」と「トカゲの行動」の例。出典: https://arxiv.org/pdf/1508.04028

広告研究プロジェクトの被験者の「フクロウの行動」と「トカゲの行動」の例。出典: https://arxiv.org/pdf/1508.04028

あなたが広告から「見て」いる場合、これは「フクロウの行動」です。頭のポーズは静止しているが、目が画面から「さまよっている」場合、これは「トカゲの行動」です。広告のテストと分析の観点から、これらはシステムが捉える必要のある重要なアクションです。

SmartEyeのAffectivaの新しい論文は、これらの問題に対処し、すべての必要な条件と可能な反応をカバーする統合された特徴セットを提供するアーキテクチャを提案している。

デスクトップとモバイルデバイスのさまざまな妨害信号に対する新しい注意システムの真陽性と偽陽性の例。出典: https://arxiv.org/pdf/2504.06237

デスクトップとモバイルデバイスのさまざまな妨害信号に対する新しい注意システムの真陽性と偽陽性の例。出典: https://arxiv.org/pdf/2504.06237

著者は次のように述べている。

‘オンライン広告中の注意を監視する研究は限られている。視線の方向を推定して視線の逸れを特定することに焦点を当てているが、デバイスの種類(デスクトップまたはモバイル)、カメラの配置、画面サイズなどの重要なパラメータを無視している。’

‘この論文では、さまざまな妨害(フクロウの行動、トカゲの行動、だるさ、話し、画面の放棄)を検出するためのアーキテクチャを提案する。デバイス固有の特徴(デバイスの種類、カメラの配置、画面サイズ)と生の視線推定を統合して、注意検出の精度を高める。’

方法とデータ

この研究は、通常のコンピュータビジョン文献の形式に従っていないため、著者らのアプローチを直接比較するのではなく、削除実験として提示する。

著者らは、オンライン広告の文脈での注意検出を扱う研究は限られていると強調している。AFFDEX SDKでは、注意は頭のポーズのみから推測され、参加者は頭の角度が定義されたしきい値を超えた場合、注意が散漫であるとラベル付けされる。

AFFDEX SDKの例。頭のポーズを注意の指標として使用するAffectivaシステム。出典: https://www.youtube.com/watch?v=c2CWb5jHmbY

AFFDEX SDKの例。頭のポーズを注意の指標として使用するAffectivaシステム。出典: https://www.youtube.com/watch?v=c2CWb5jHmbY

2019年の共同研究では、約28,000人の参加者からなるデータセットが、さまざまな注意が散漫な行動(視線を外に逸らす、目を閉じる、無関係な活動に従事する)に注釈付けられ、CNN-LSTMモデルが顔の外見から注意を検出するために訓練された。

2019年の論文からの例。画面の視聴者に対する予測された注意状態を示す。出典: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

2019年の論文からの例。画面の視聴者に対する予測された注意状態を示す。出典: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

しかし、著者らは、これらの以前の努力は、デバイス固有の要因(デスクトップまたはモバイルの使用、画面サイズ、カメラの配置)を考慮していないと指摘する。また、AFFDEXシステムは視線の逸れのみを特定し、他の妨害源を省略しているのに対し、2019年の研究はより広範な行動を検出しようとしているが、その使用する単一の浅いCNNはこのタスクに不十分であると述べている。

著者らは、オンライン広告のテストには、ドライブや教育などの他のドメインとは異なるニーズがあり、カメラの配置と校正は通常事前に固定されているが、未校正の設定を使用し、デスクトップとモバイルデバイスの限定された視線範囲内で動作する必要があると述べている。

したがって、著者らは、AFFDEX 2.0とSmartEye SDKの2つの商用ツールキットを利用して、オンライン広告中の視聴者の注意を検出するためのアーキテクチャを提案している。

AFFDEX 2.0からの顔分析の例。出典: https://arxiv.org/pdf/2202.12059

AFFDEX 2.0からの顔分析の例。出典: https://arxiv.org/pdf/2202.12059

データセット:視線

著者らは、4つのデータセットを使用して注意検出システムを動作させ、評価した。3つは視線、話し、だるさに焦点を当てており、4つ目は実際の広告テストセッションからの混合妨害タイプのデータセットであった。

カスタムデータセットは、視線、話し、だるさの各カテゴリ用に作成された。参加者は、画面上のさまざまな点を追跡する移動ドットに従うように求められ、次に画面から4方向(上、下、左、右)に視線を外に逸らすシーケンスを3回繰り返した。

デスクトップとモバイルデバイスの視線ビデオ刺激のスクリーンショット。最初と3番目のフレームは移動ドットに従うための指示を表示し、2番目と4番目のフレームは画面から視線を外に逸らすためのプロンプトを表示する。

デスクトップとモバイルデバイスの視線ビデオ刺激のスクリーンショット。最初と3番目のフレームは移動ドットに従うための指示を表示し、2番目と4番目のフレームは画面から視線を外に逸らすためのプロンプトを表示する。

移動ドットのセグメントは「注意を払っている」とラベル付けされ、画面から外に視線を逸らすセグメントは「注意を散漫にしている」とラベル付けされた。視線のデータセットは、正と負の両方の例のラベル付けされたデータセットを生成した。

データセット:話し

話しデータセットは、視聴覚コンテンツを視聴中に話し声を検出するために作成された。1秒以上話し続けることは「注意を散漫にしている」とみなされる。

このデータセットは、内部リポジトリから視聴覚コンテンツを視聴中に話し声を検出するために作成された。約5,500のビデオクリップがあり、3人のアノテーターによって話し声と話し声以外にラベル付けされた。

データセット:だるさ

だるさデータセットは、実際の広告テストシナリオに適したものを作成するために作成された。既存のデータセットは、模擬のあくびや、恐怖やその他の非あくびの表情と混同される可能性のある顔のゆがみを含むことが多いため、不適切であると判断された。

著者らは、735のビデオクリップを使用し、1秒以上のあくびを含むセッションを選択した。各ビデオは3人のアノテーターによってあくびとあくび以外にラベル付けされた。

データセット:妨害

妨害データセットは、実際の広告テストセッションから作成された。520のセッション(モバイル193、デスクトップ327)がランダムに選択され、3人のアノテーターによって「注意を払っている」と「注意を散漫にしている」にラベル付けされた。

注意モデル

提案された注意モデルは、低レベルの視覚特徴(顔の表情、頭のポーズ、視線の方向)を処理して、高レベルの指標(視線の位置、だるさ、話し声)を生成する。

このシステムは、4つの妨害タイプ(画面外の視線、だるさ、話し声、画面の放棄)を識別し、デスクトップとモバイルデバイスの両方で視線分析を調整する。

テスト

テストは、削除法に従って実施され、コンポーネントを削除し、結果に与える影響を観察した。

視線モデルは、3つの重要なステップ(生の視線推定の正規化、出力の微調整、デスクトップデバイスの画面サイズの推定)を通じて、画面外の行動を識別した。

結果は、G-meanとF1スコアを使用して評価され、次の表に示すように、各コンポーネントの削除によってパフォーマンスが低下したことが示された。

フルな視線モデルと、個々の処理ステップを削除したバージョンのパフォーマンスの結果。

フルな視線モデルと、個々の処理ステップを削除したバージョンのパフォーマンスの結果。

著者らは、視聴覚コンテンツを視聴中に話し声を検出する話しモデルを評価し、ROC-AUCで0.97のスコアを達成した。

あくびモデルは、ROC-AUCで96.6%のスコアを達成し、AFFDEX 2.0からのアクションユニットの予測と組み合わせると、97.5%に改善された。

結論

この研究の結果は、以前の研究に対する測定された nhưng 意味のある進歩を表し、この研究の価値は、視聴者の内部状態へのアクセスを継続的に推進することにある。

この結論は、特にこの研究分野の閉鎖的で保護的な性質によって裏付けられる。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai