Anderson 视角

人工智能研究中的“下载更多标签!”幻觉

mm
将 Unite.AI 添加到您在 Google 上的首选来源
ChatGPT-4o: 'A wall on which hundreds of photographs are stuck with thumb-tacks. Each photo depicts a different kind of subject, such as fruit or animals or bridges or buildings or people, etc. Each photo has 2-3 yellow post-it notes attached to it. We are too far away to read anything written on the post-it notes, but we can see that there are dozens and dozens of photos on the wall, and each with several post-it notes tacked on.'

当前机器学习研究中有一种观点,即机器学习本身可以用来提高人工智能数据集注释的质量,特别是用于视觉语言模型(VLMs)的图像字幕。这一思路是由人工注释的高成本和监督注释器性能的额外负担所驱动的。

可以说,这是人工智能领域的“下载更多RAM”迷因的等价物,这个迷因讽刺了通过软件解决硬件限制的想法。

这是一个被低估的问题;虽然新的人工智能模型在公众和商业领域引起了广泛的关注,但注释往往似乎是机器学习管道中一个微不足道的细节,被更广泛的框架所掩盖。

事实上,机器学习系统识别和复制模式的能力(几乎所有人工智能系统的核心用例)取决于现实世界注释的质量和一致性——这些注释由真实的人创建或审查,通常对个别数据点做出主观判断,在非理想的情况下。

不可避免地,试图观察和复制注释器行为的系统(并因此取代人类注释器和促进准确标记)不能指望在不包含人类观察者示例的数据上表现良好。没有什么是完全相同的,跨域等价性仍然是计算机视觉中一个有问题的追求。

“上游数据责任”最终必须停止在某个地方,在这种情况下,它恰恰是在那里停止——一个人类大脑做出某种主观区分,以便为人工系统编码数据。

RAG贸易

直到最近,数据集注释不准确所产生的不准确性可能被视为在获得不完美但仍然可行的生成人工智能系统结果的背景下可以接受的附带损害。

事实上,就在今年,新加坡的一项研究得出结论,人工智能系统的“幻觉”——即人工智能系统编造的东西会破坏我们的意图——是不可避免的,并且与此类系统的概念架构密不可分。

为了应对这一问题,基于检索的生成(RAG)代理——可以通过互联网搜索“验证”事实——正在研究和商业解决方案中变得流行。然而,它们增加了资源成本和查询延迟;此外,应用于训练模型的新信息无法与训练模型中的本地层次更复杂、更深入的联系相竞争。

因此,如果这些模型所依据的注释数据本身的缺陷较少,即使不能做到完美,也会更好(因为这种活动侵入了人类主观性领域)。

RePOPE

德国的一篇新论文强调了依赖旧的、广泛使用的数据集的弊端,特别关注图像字幕的准确性和可靠性。研究人员的发现表明,基准测试中的标签错误可能会掩盖或歪曲视觉语言模型中的幻觉。

来自新论文的例子,原始字幕未能正确识别MSCOCO图像数据集中的对象。研究人员对POPE基准测试数据集的修订解决了这些缺陷,证明了省略注释策划的代价。来源:https://arxiv.org/pdf/2504.15707

来自新论文的例子,原始字幕未能正确识别MSCOCO图像数据集中的对象。研究人员对POPE基准测试数据集的修订解决了这些缺陷,证明了省略注释策划的代价。来源:https://arxiv.org/pdf/2504.15707

想象一个模型被展示一幅街景图像,并被问及图像中是否有自行车。模型回答“是”。如果基准测试数据集说没有自行车,模型被标记为“错误”。但是,如果自行车在图像中“清晰可见”,但在注释过程中被遗漏,那么模型的答案是正确的,基准测试数据集失败了。这样的错误可以在整个数据集中积累,给出一个关于哪些模型是准确的、哪些模型容易产生幻觉的扭曲图景。

因此,当不正确或模糊的注释被视为真实时,模型可能看起来像是在产生幻觉,但实际上是正确的,或者看起来准确,但实际上不准确,这会扭曲幻觉的衡量和模型性能的排名,使得很难确定地诊断或解决问题。

新论文重新审视了一种名为“投票式对象探测评估”(POPE)的广泛使用的基准测试,它测试视觉语言模型是否能正确地说出图像中有什么或没有什么。

POPE基于微软COCO:上下文中的常见对象(MSCOCO)数据集的标签,这是一个长期被认为具有良好注释准确性的图像注释集合。

POPE通过将问题重构为二元分类任务来评估大型视觉语言模型中的对象幻觉。与解析生成的字幕相比,该系统向模型提出简单的“是/否”问题,询问图像中是否存在特定对象,使用诸如“图像中有<对象>吗?”这样的模板。

视觉语言模型中的对象幻觉示例。粗体标签表示原始注释中标记为存在的对象,而红色标签显示模型产生的幻觉。左侧示例反映了传统的基于指令的评估,而右侧三个示例来自不同的POPE基准测试变体。来源:https://aclanthology.org/2023.emnlp-main.20.pdf

视觉语言模型中的对象幻觉示例。粗体标签表示原始注释中标记为存在的对象,而红色标签显示模型产生的幻觉。左侧示例反映了传统的基于指令的评估,而右侧三个示例来自不同的POPE基准测试变体。来源:https://aclanthology.org/2023.emnlp-main.20.pdf

真实对象(答案:“是”)与随机采样的不存在对象(答案:“否”)配对,使用随机、频繁(“流行”)或共现(“对抗”)策略。这种设置允许对幻觉进行更稳定、不依赖提示的评估,而不依赖于复杂的基于规则的字幕分析。

新论文的作者——题为“RePOPE:注释错误对POPE基准测试的影响”——通过重新检查POPE基准测试的图像标签(即MSCOCO)挑战了POPE的准确性假设,并发现了大量错误或不明确的标签。

2014年MSCOCO数据集的示例。来源:https://arxiv.org/pdf/1405.0312

2014年MSCOCO数据集的示例。来源:https://arxiv.org/pdf/1405.0312

这些错误改变了模型的排名,一些最初表现良好的模型在更正标签后排名下降。

在测试中,作者评估了多个开源的视觉语言模型在原始POPE基准测试和修订的RePOPE版本上的性能。

根据论文,修订的注释导致模型排名发生了显著的变化,特别是在F1评分方面,一些模型在POPE上表现良好,但在RePOPE下排名下降。

作者认为,这种转变表明注释错误可能会掩盖模型的实际幻觉行为,并将RePOPE呈现为评估幻觉脆弱性的更可靠工具。

新论文中的另一个示例,显示原始POPE字幕未能识别图像中的微妙对象,例如电车旁边的座位或网球运动员后面的椅子。

新论文中的另一个示例,显示原始POPE字幕未能识别图像中的微妙对象,例如电车旁边的座位或网球运动员后面的椅子。

方法和测试

研究人员重新注释了原始MSCOCO数据集中的所有注释,每个数据实例都分配了两个人类标注者。在出现对原始标签质量的模糊性时(如下面的示例所示),这些结果被排除在测试轮之外。

模糊案例,POPE中的标签不一致反映了不明确的类别边界。例如,一个泰迪熊被标记为熊,一个摩托车被标记为自行车,或者机场车辆被标记为汽车。这些案例由于MSCOCO原始标签中的主观性和不一致性而被排除在RePOPE之外。

模糊案例,POPE中的标签不一致反映了不明确的类别边界。例如,一个泰迪熊被标记为熊,一个摩托车被标记为自行车,或者机场车辆被标记为汽车。这些案例由于MSCOCO原始标签中的主观性和不一致性而被排除在RePOPE之外。

论文指出:

‘原始注释者漏掉了背景中或玻璃后面的人物,网球运动员遮挡了背景中的“椅子”,而卷心菜沙拉只包含一小条可见的胡萝卜。’

‘对于某些对象,COCO注释非常不一致,可能是由于原始注释者使用的定义不同。将“泰迪熊”标记为“熊”,摩托车标记为带动力“自行车”,或者机场车辆标记为“汽车”,取决于特定的定义,导致POPE基准测试注释中的不一致性。因此,我们将相应的图像-问题对标记为“模糊”。’

重新注释的结果:所有三个POPE变体中共享的正面问题。POPE中标记为“是”的问题中,9.3%被发现是错误的,13.8%被归类为模糊。对于“否”问题,1.7%被错误标记,4.3%被归类为模糊。

重新注释的结果:所有三个POPE变体中共享的正面问题。POPE中标记为“是”的问题中,9.3%被发现是错误的,13.8%被归类为模糊。对于“否”问题,1.7%被错误标记,4.3%被归类为模糊。

作者评估了多个开源视觉语言模型在POPE和RePOPE上的性能,包括一些领先的OpenVLM排行榜模型:InternVL2.5(8B/26B/38B/78B和8B-MPO/26B-MPO);LLaVA-NeXT;Vicuna;Mistral 7b;Llama;LLaVA-OneVision;Ovis2(1B/2B/4B/8B);PaliGemma-3B;以及PaliGemma2(3B/10B)。

初始结果:原始正面标签中的高错误率导致所有模型的真实正例急剧下降。假正例在子集上有所不同,在随机子集上几乎增加了一倍,但在流行子集上基本保持不变,在对抗子集上略有下降。重新标注对F1评分排名产生了重大影响。像Ovis2-4B和Ovis2-8B这样的模型在POPE的流行和对抗子集上表现良好,在RePOPE的随机子集上也排名靠前。

初始结果:原始正面标签中的高错误率导致所有模型的真实正例急剧下降。假正例在子集上有所不同,在随机子集上几乎增加了一倍,但在流行子集上基本保持不变,在对抗子集上略有下降。重新标注对F1评分排名产生了重大影响。像Ovis2-4B和Ovis2-8B这样的模型在POPE的流行和对抗子集上表现良好,在RePOPE的随机子集上也排名靠前。

结果图表显示了在更正标签后真实正例和假正例的变化情况。

真实正例在所有模型中都下降了,表明它们经常被错误地认为是正确答案,而这些答案只在有缺陷的标签下才是正确的。假正例表现出更为多样的模式。

在POPE的“随机”版本中,假正例几乎在所有模型中都增加了一倍,表明大量被标记为幻觉的对象实际上存在于图像中,但在原始注释中被遗漏。在这种情况下,许多所谓的模型错误实际上是数据集标签错误。

对于POPE的“对抗”版本,假正例减少了,这可能反映了被遗漏的对象实际上存在于图像中但未被标记的可能性更高。

虽然这些变化影响了精度和召回率,但模型排名在两个指标上都相对稳定。

POPE的主要评估指标F1评分对标签更正更为敏感。在随机子集上,最初在原始标签下排名靠前的模型,如InternVL2.5-8B和-26B,在RePOPE下排名靠后。其他模型,如Ovis2-4B和-8B,排名靠前。

准确性评分中也出现了类似的模式,尽管作者指出这些评分现在可能存在偏差,因为更正的数据集包含不均匀的正面和负面示例。

作者认为,注释错误对基准测试结果的强烈影响凸显了高质量数据的必要性。为了支持对对象幻觉的更可靠评估,他们在GitHub上发布了更正的标签。

然而,他们指出,这次重新标注并没有完全解决基准测试的饱和问题,因为许多模型在真实正例和真实负例率方面仍然超过90%。他们建议,应该使用其他基准测试,如DASH-B,它使用更具挑战性的负面示例,与RePOPE一起使用。

结论

这个实验之所以可能,是因为所涉及的数据集规模很小。要在超大规模数据集上证明同样的假设,将需要在数据的非常有限的片段上工作;在高度多样化的大型数据集中,可能很难分离出统计上代表性和语义上连贯的组,这可能会扭曲结果。

即使这是可能的,在当前的技术状态下,什么样的解决方案会有?这个论点不可避免地回到对更好和更丰富的human注释的需求上。

在这个方面,“更好”和“更多”存在着各自的问题,因为可以通过类似亚马逊Mechanical Turk(AMT)这样的经济体系获得更大量的注释。显然,这种潜在的剥削性经济体系通常会导致较差的结果。

或者,可以将注释任务外包给在相同支出下可以获得更多注释的经济地区。然而,注释者与模型的预期使用案例之间的距离越远,模型的结果就越不可能与目标领域的需求或期望保持一致。

这仍然是机器学习开发经济学中最顽固和未解决的挑战之一。

首次发布于2025年4月23日星期三

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai