Anderson 视角
过度解读可能比过度拟合更大、更难以解决

如果你的好朋友爱丽丝喜欢穿黄色毛衣,你会看到更多黄色毛衣,而不是平均人看到的那么多。过一段时间,当你看到一个穿黄色毛衣的不同女人时,核心概念“爱丽丝”会浮现在你的脑海中。
如果你看到一个穿黄色毛衣的女人,她有点像爱丽丝,你可能会暂时把她误认为是你的朋友。
但那不是爱丽丝。最终,你会意识到“黄色毛衣”不是识别爱丽丝的有用钥匙,因为她从不在夏天穿它们,在冬天也不总是穿它们。友谊开始后,你会开始降低“黄色毛衣”作为可能的爱丽丝标识符,因为你的经验是令人不满意的,并且维护这个捷径的认知能量并不经常得到回报。
但是,如果你是一个基于计算机视觉的识别系统,那么你可能会在看到黄色毛衣的地方看到爱丽丝。
这不是你的错;你被要求以最少的信息来识别爱丽丝,并且没有足够的认知资源来维护这个简化的爱丽丝辅助工具。
令人毛骨悚然的辨别力
根据最近来自麻省理工学院计算机科学与人工智能实验室(CSAIL)和亚马逊网络服务的一篇论文,这种被称为过度解读的症状在计算机视觉(CV)研究领域中很常见;不能通过解决过度拟合来缓解(因为它不是过度拟合的直接附属);通常在使用两个最有影响力的图像识别和转换数据集、CIFAR-10 和 ImageNet 的研究中体现出来;并且没有简单的解决方法 – 绝对没有廉价的解决方法。
研究人员发现,当将输入训练图像减少到其连贯内容的5%时,一系列流行的框架继续正确地对图像进行分类,这些图像在大多数情况下,对于任何人类观察者来说,看起来像是视觉“胡言乱语”:

原始训练图像来自CIFAR-10,减少到原始像素内容的5%,但被一系列流行的计算机视觉框架正确分类,准确率在90-99%之间。来源:https://arxiv.org/pdf/2003.08907.pdf
在某些情况下,分类框架实际上发现这些简化的图像比原始训练数据中的完整帧更容易正确分类,作者观察到“卷积神经网络在这些像素子集上比在完整图像上更有信心”。
这表明计算机视觉系统使用基准数据集(如CIFAR-10和ImageNet)以及基准框架(如VGG16、ResNet20和ResNet18)时可能存在一种潜在的“作弊”行为。
过度解读对基于计算机视觉的自动驾驶车辆系统有着显著的影响,这些系统最近因特斯拉决定偏爱图像解释而不是LiDAR和其他基于射线的传感系统而受到关注。
虽然“捷径学习”是一个众所周知的挑战,也是计算机视觉领域的活跃研究领域,但这篇论文的作者评论说,2019年德国/加拿大研究将问题框定,并没有认识到“过度解读”的特征,即“伪造”的像素子集是“统计上有效的数据”,这可能需要通过架构和更高层次的方法来解决,而不是通过更谨慎地策划数据集。
这篇论文题为过度解读揭示图像分类模型的病理,由麻省理工学院计算机科学与人工智能实验室的布兰登·卡特、悉达塔·贾恩和大卫·吉福德,以及亚马逊网络服务的乔纳斯·穆勒合作完成。论文的代码可在https://github.com/gifford-lab/overinterpretation找到。
简化数据
研究人员使用的数据简化图像被称为足够输入子集(SIS)- 实际上,SIS图像包含最小的“外壳”,可以足够地确定图像,以允许计算机视觉系统识别图像的原始主题(即狗、船等)。

上面一行,我们看到完整的ImageNet验证图像;下面,SIS子集,由Inception V3模型以90%的置信度正确分类,显然是基于图像中剩余的内容- 背景上下文。自然,最后一列对自动驾驶车辆算法中的标志识别有着显著的影响。
关于上述图像的结果,研究人员评论说:
‘我们发现SIS像素集中在决定类标签的实际对象之外。例如,在“披萨”图像中,SIS集中在盘子和背景桌子的形状上,而不是披萨本身,表明模型可能会对桌子上的不同圆形物体进行糟糕的推广。在“大熊猫”图像中,SIS包含竹子,这可能出现在ImageNet照片中用于此类。 ‘
‘在“交通信号灯”和“街标志”图像中,SIS由天空中的像素组成,表明可能依赖于这些模型的自动驾驶车辆系统应该小心评估过度解读的病理。’
SIS图像不是随机剪裁的,而是通过批量梯度反向选择过程在Inception V3和ResNet50上通过PyTorch创建的。这些图像是通过一种考虑模型准确分类图像的能力与原始数据被迭代删除的区域之间的关系的消融过程得出的。
为了确认SIS的有效性,作者测试了一种随机像素删除的过程,并发现结果“远不那么有意义”,表明SIS图像确实代表了流行模型和数据集需要的最少数据。
看一下任何简化的图像就足以表明这些模型应该按照人类的视觉辨别力失败,这将导致中位数准确率低于20%。

SIS图像仅保留5%的原始像素,人类几乎无法达到“大于随机”的分类成功率,与论文中研究的流行数据集和框架的90-99%的成功率相比。
超越过度拟合
过度拟合发生在机器学习模型在训练数据集上训练过多时,它变得擅长对该特定数据进行预测,但在引入新数据时效果较差(或完全无效)。
研究人员指出,当前学术界和行业对解决过度拟合的兴趣并不能同时解决过度解读的问题,因为代表计算机识别图像的简化像素子集对于人类来说是没有意义的乱码,但实际上是“真正适用的数据”,而不是“痴迷”的集中在数据上或贫乏的数据上:
‘过度解读与过度拟合有关,但过度拟合可以通过降低测试准确率来诊断。过度解读可能来自底层数据集分布中的真正统计信号,这些信号可能是由于数据源的特定属性(例如,皮肤科医生的尺子)而产生的。 ‘
‘因此,过度解读可能更难诊断,因为它允许使用统计上有效的标准做出决定,并且使用此类标准的模型可以在基准测试中表现出色。’
可能的解决方案
作者建议,模型集成,其中多个架构为评估和训练过程做出贡献,可能有助于减轻过度解读。他们还发现,应用输入丢弃,最初设计用于阻止过度拟合,导致CIFAR-10测试准确率略微下降(这可能是理想的),但在未见过的数据上模型的准确率有了“显著”的(约6%)提高。然而,低数字表明,任何随后的解决过度拟合的方法不太可能完全解决过度解读的问题。
作者承认,可以使用显著性图来指示图像中哪些区域对于特征提取是相关的,但指出这会破坏自动图像解析的目标,并需要大量的人工注释,这在规模上是不可行的。他们还观察到,显著性图已经被证明是粗略估计器,在了解模型操作方面。
论文得出结论:
‘鉴于存在仅凭这些模式就足以正确分类的非显著像素子集,模型可能仅依赖于这些模式。在这种情况下,一个忠实地描述模型的可解释性方法应该输出这些无意义的理由,而偏向于人类先验的可解释性方法可能会产生误导用户以为模型按预期工作的结果。’
首次发表于2022年1月13日。












