زاوية Anderson
بحث عن “البيسون والوزغ” في جمهور المستخدمين في الإعلان

由于在线广告行业预计在2023年花费了740.3亿美元,因此可以理解为什么广告公司在这方面投入了大量资源,特别是在计算机视觉研究领域。
尽管行业相对封闭和保密,但偶尔会发表一些研究,暗示了更先进的专有工作,包括面部和眼球追踪技术,例如年龄识别,这是人口统计学分析统计的关键组成部分。

在广告中估计年龄是广告商的兴趣所在,他们可能会针对特定的年龄人群。在这个自动面部年龄估计的实验示例中,跟踪了演员鲍勃·迪伦多年来的年龄变化。 来源:https://arxiv.org/pdf/1906.03625
这些研究很少出现在公共存储库中,例如Arxiv,它们使用合法招募的参与者作为人工智能驱动分析的基础,以确定观众与广告的互动程度和方式。

Dlib的方向梯度直方图(HoG)通常用于面部估计系统。 来源:https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
动物本能
在这个方面,广告行业自然对确定虚假阳性(分析系统错误解释主体行为的事件)和确定当观众没有完全参与广告内容时的明确标准感兴趣。
就基于屏幕的广告而言,研究通常关注两个问题和两个环境。环境是“桌面”或“移动”,每个环境都有其特定的特征,需要定制的跟踪解决方案;问题是从广告商的角度来看,代表了“猫头鹰行为”和“蜥蜴行为”——观众没有完全注意到广告的倾向。

广告研究项目中“猫头鹰”和“蜥蜴”行为的示例。 来源:https://arxiv.org/pdf/1508.04028
如果你用整个头转离广告,这就是“猫头鹰”行为;如果你的头部姿势是静止的,但你的眼睛在屏幕上游移,这就是“蜥蜴”行为。在广告测试和分析的背景下,这些是系统必须能够捕捉的基本动作。
SmartEye的Affectiva收购发布了一篇新论文,解决了这些问题,提出了一种利用现有框架的架构,提供了一个结合和连接的特征集,用于所有必要的条件和可能的反应,并能够确定观众是否感到无聊、参与或以某种方式与广告内容脱节。

不同干扰信号的真阳性和假阳性检测示例,分别显示在桌面和移动设备上。 来源:https://arxiv.org/pdf/2504.06237
作者表示:
‘尽管有一些研究探讨了在线广告中的注意力监测,但这些研究主要集中在估计头部姿势或凝视方向以识别注意力分散的实例上,但它们忽略了设备类型(桌面或移动)、相机位置相对于屏幕以及屏幕大小等关键参数。这些因素显著影响注意力检测。 ‘
‘在本文中,我们提出了一种注意力检测架构,涵盖了检测各种干扰因素,包括“猫头鹰”和“蜥蜴”行为,即凝视屏幕外、打哈欠(通过打哈欠和长时间闭眼)、说话以及离开屏幕未关注。 ‘
‘与以前的方法不同,我们的方法将设备特定的特征(例如设备类型、相机位置、屏幕大小(用于桌面)和相机方向(用于移动设备))与原始凝视估计相结合,以提高注意力检测的准确性。 ‘
新论文题为在线广告中监测观众注意力,由Affectiva的四位研究人员撰写。
方法和数据
由于此类系统的保密性和封闭性,新论文没有直接将其方法与竞争对手进行比较,而是仅以消融研究的形式呈现其发现。
作者强调,仅有有限的研究专门针对在线广告的注意力检测。在Affectiva的AFFDEX SDK中,提供了实时多面识别,注意力仅从头部姿势推断,参与者被标记为不注意如果他们的头部角度超过某个阈值。

Affectiva的AFFDEX SDK示例,依赖头部姿势作为注意力的指标。 来源:https://www.youtube.com/watch?v=c2CWb5jHmbY
在2019年的合作研究使用深度学习自动测量视频内容的视觉注意力中,约有28,000名参与者被注释为各种不注意行为,包括凝视走神、闭眼或从事无关活动,并训练了一个CNN-LSTM模型来检测注意力从面部外观随时间的变化中。

2019年论文中预测注意力状态的示例,显示屏幕上的观看者。 来源:https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
然而,作者观察到,这些早期的工作没有考虑到设备特定的因素,例如参与者是否使用桌面或移动设备;也没有考虑到屏幕大小或相机位置。此外,AFFDEX系统仅关注凝视分散,而忽略了其他干扰源,而2019年的工作尝试检测更广泛的行为,但其使用单个浅层CNN可能不适合这一任务。
作者观察到,一些最流行的研究在这个领域并没有针对广告测试进行优化,这有不同的需求,与驾驶或教育等领域不同,相机位置和校准通常在事先固定,依赖于未校准的设置,并在桌面和移动设备的有限凝视范围内运行。
因此,他们设计了一种用于在线广告中检测观众注意力的架构,利用两个商业工具包:AFFDEX 2.0和SmartEye SDK。

AFFDEX 2.0的面部分析示例。 来源:https://arxiv.org/pdf/2202.12059
这些先前的工作提取了低级特征,例如面部表情、头部姿势和凝视方向。这些特征然后被处理以产生更高级的指标,包括凝视屏幕位置、打哈欠和说话。
系统识别了四种干扰类型:屏幕外凝视、瞌睡、说话和未关注屏幕。它还根据观众是否使用桌面或移动设备调整凝视分析。
数据集:凝视
作者使用了四个数据集来驱动和评估注意力检测系统:三个分别关注凝视行为、说话和打哈欠;以及一个从真实广告测试会话中提取的数据集,包含各种干扰类型的混合。
由于工作的具体要求,创建了自定义数据集,每个类别都有一个。所有数据集都是从一个包含数百万个记录会话的专有存储库中提取的,参与者在家中或工作场所观看广告,使用基于Web的设置,并获得了知情同意。
要构建凝视数据集,参与者被要求跟随屏幕上的移动点,包括屏幕边缘,然后将视线移开屏幕,四个方向(上、下、左、右)重复三次。这样就建立了捕获和覆盖之间的关系:

桌面和移动设备上的凝视视频刺激的屏幕截图。第一和第三帧显示跟随移动点的指令,第二和第四帧提示参与者将视线移开屏幕。
移动点段被标记为注意,屏幕外段被标记为不注意,产生了一个带有正负例的标记数据集。
每个视频大约持续160秒,分别为桌面和移动平台创建了单独的版本,分辨率分别为1920×1080和608×1080。
收集了总共609个视频,包括322个桌面和287个移动录制。标签是根据视频内容自动应用的,数据集被分成158个训练样本和451个测试样本。
数据集:说话
在这个背景下,定义“不注意”的一个标准是当一个人说话超过一秒钟(这可能是一次短暂的评论,甚至是一次咳嗽)。
由于受控环境不记录或分析音频,通过观察估计的面部标志物的内部运动来推断说话。因此,作者创建了一个基于视觉输入的数据集,来源于他们的内部存储库,并将其分成两部分:第一部分包含大约5,500个视频,每个视频由三个注释器手动标记为说话或不说话(其中4,400个用于训练和验证,1,100个用于测试)。
第二部分包含16,000个会话,根据会话类型自动标记:10,500个会话中,参与者默默地观看广告,5,500个会话中,参与者表达了对品牌的意见。
数据集:打哈欠
虽然有一些“打哈欠”数据集,例如YawDD和驾驶员疲劳,但作者认为这些数据集不适合广告测试场景,因为它们要么包含模拟的打哈欠,要么包含可能与恐惧或其他非打哈欠动作混淆的面部扭曲。
因此,作者使用了他们的内部集合中的735个视频,选择了可能包含下颌掉落的会话,持续时间超过一秒。每个视频都被三个注释器手动标记为主动或非主动打哈欠。只有2.6%的帧包含主动打哈欠,突出了类别不平衡,数据集被分成670个训练视频和65个测试视频。
数据集:干扰
干扰数据集也来自作者的广告测试存储库,参与者观看了实际广告,没有指定任务。从中随机选择了520个会话(193个移动,327个桌面),并由三个注释器手动标记为注意或不注意。
不注意行为包括屏幕外凝视、说话、瞌睡和未关注屏幕。会话涵盖了世界各地的多个地区,桌面录制更为常见,这是由于相机位置的灵活性。
注意力模型
提出的注意力模型处理低级视觉特征,包括面部表情、头部姿势和凝视方向,通过AFFDEX 2.0和SmartEye SDK提取。
这些特征然后被转换为更高级的指标,每个干扰因素由一个单独的二元分类器处理,训练和评估都在其自身数据集上进行。

监测系统的架构。
凝视模型使用归一化的凝视坐标确定观众是否正在看着或移开视线,具有针对桌面和移动设备的单独校准。一个线性支持向量机(SVM)在空间和时间特征上训练,融入了一个记忆窗口,以平滑快速的凝视转换。
为了在没有音频的情况下检测说话,系统使用了裁剪的嘴部区域和在对话和非对话视频段上训练的3D-CNN。标签基于会话类型,时间平滑减少了由于短暂的嘴部运动可能引起的假阳性。
打哈欠的检测使用了全面的面部图像裁剪,以捕捉更广泛的面部运动,使用在手动标记的帧上训练的3D-CNN(尽管由于打哈欠在自然观看中的低频率和与其他表情的相似性,这项任务具有挑战性)。
屏幕遗弃的识别是通过缺乏面部或极端的头部姿势来实现的,预测是通过决策树来完成的。
最终注意力状态是使用一个固定的规则确定的:如果任何模块检测到不注意,则观众被标记为不注意,这是一种优先考虑敏感性的方法,并且针对桌面和移动环境进行了单独的调整。
测试
如前所述,测试遵循一种消融方法,即移除组件并观察结果的影响。

研究中识别的不同类别的感知不注意力。
凝视模型通过三个关键步骤识别屏幕外行为:归一化原始凝视估计、细化输出和估计桌面设备的屏幕大小。
为了理解每个组件的重要性,作者单独移除了它们,并在从两个数据集中提取的226个桌面和225个移动视频上评估了性能。结果以G-mean和F1得分表示,如下所示:

完整凝视模型的性能,以及移除个别处理步骤后的版本。
在每种情况下,性能都会在移除步骤后下降。归一化在桌面上尤其有价值,因为相机位置的变化更大。
研究还评估了视觉特征如何预测移动相机的方向:面部位置、头部姿势和眼球凝视分别得分0.75、0.74和0.60,而它们的组合达到0.91,作者认为这突出了集成多个线索的优势。
说话模型在垂直嘴唇距离上训练,获得了0.97的ROC-AUC分数,在手动标记的测试集上,以及0.96的分数,在更大的自动标记数据集上,表明在两个数据集上都有稳定的性能。
打哈欠模型仅使用嘴部宽高比达到96.6%的ROC-AUC分数,这个分数在结合AFFDEX 2.0的动作单位预测时提高到97.5%。
未关注屏幕的模型将不注意时刻分类为当AFFDEX 2.0和SmartEye都无法检测到面部超过一秒钟时。为了评估这种方法的有效性,作者手动注释了真实干扰数据集中所有无面部事件的潜在原因,并排除了模糊的情况(例如相机阻塞或视频失真)。
如结果表所示,只有27%的“无面部”激活是由于用户实际离开屏幕造成的。

某些实例中无面部的各种原因。
论文指出:
‘尽管未关注的屏幕只占触发无面部信号的实例的27%,但它被激活以指示其他不注意的原因,例如参与者以极端角度凝视屏幕外、进行过度运动或用物体/手显著遮挡面部。 ‘
在最后一次定量测试中,作者评估了逐渐添加不同的干扰信号(屏幕外凝视、瞌睡、说话和未关注屏幕)如何影响他们的注意力模型的整体性能。
测试是在两个数据集上进行的:真实干扰数据集和凝视数据集的一个测试子集。使用G-mean和F1分数来衡量性能(尽管由于其在此背景下的有限相关性,瞌睡和说话被排除在凝视数据集分析之外)。
如图所示,注意力检测在添加更多干扰类型时始终提高,屏幕外凝视提供了最强的基线,作为最常见的干扰因素。

向架构添加各种干扰信号的影响。
关于这些结果,论文指出:
‘首先,我们可以得出结论,集成所有干扰信号有助于增强注意力检测。 ‘
‘其次,注意力检测的改进在桌面和移动设备上是一致的。第三,在真实数据集中的移动会话中,当凝视走神时,头部移动显著,这些移动容易被检测,从而使移动设备的性能优于桌面设备。第四,添加瞌睡信号与其他信号相比,改进相对较小,因为它通常很少发生。 ‘
‘最后,未关注屏幕的信号在移动设备上比桌面设备上有相对较大的改进,因为移动设备很容易被遗弃。 ‘
作者还将他们的模型与AFFDEX 1.0进行了比较,这是一种以前用于广告测试的系统,甚至他们当前模型的基于头部的凝视检测在两个设备类型上都优于AFFDEX 1.0:
‘这种改进是由于在两个方向(yaw和pitch)中纳入头部运动以及规范化头部姿势以考虑微小变化而实现的。真实移动数据集中的明显头部运动使我们的头部模型的性能与AFFDEX 1.0相似。 ‘
作者以一个(可能有些公式化的)定性测试回合结束了论文,如下所示。

不同干扰类型的真阳性和假阳性的示例输出,跨桌面和移动设备。
作者指出:
‘结果表明,我们的模型在无控制环境中有效地检测到各种干扰因素。然而,它可能会在某些边缘情况下产生假阳性,例如剧烈的头部倾斜同时保持屏幕凝视,一些嘴部遮挡,过度模糊的眼睛或极度黑暗的面部图像。 ‘
结论
虽然结果代表了对先前工作的有意义的进步,但该研究的更深层次的价值在于它提供了对获取观众内部状态的持续驱动力的洞察。尽管数据是以知情同意收集的,但该方法表明了可能超出结构化的市场研究环境的未来框架。
这种相当偏执的结论仅仅是由于该研究领域的封闭、受限和保护性质而得到加强。
* 我将作者的内联引用转换为超链接。
首次发表于2025年4月9日星期三。












