Anderson 视角
通过夸大来减少AI图像的幻觉

类似ChatGPT的视觉模型经常“幻觉”出不属于图像的元素。一个新方法通过展示模型其自身幻觉的夸大版本来减少这些错误,基于字幕——然后要求它再试一次。这种方法不需要重新训练或额外的数据,并且可以应用于各种模型和模型类型。
一篇来自中国的新论文对AI生成图像和视频中的“幻觉”问题(即图像中明显不应该存在的元素,基于用户的请求和输入)提供了一个有趣的见解。
本质上,该系统接受一个图像并让模型描述它,如通常所做的那样;然后,它使用文本到图像模型将该字幕转换为一个新图像 – 任何额外的对象或细节在此第二个图像中将是模型的初始幻觉的直接表示。然后,通过比较原始图像和生成的图像,该系统轻轻地引导模型远离这些错误,下次尝试时:

一个关于如何识别和减少图像字幕中的幻觉的新方法的插图。常规模型描述不存在于原始图像中的鸟,导致重建图像将它们添加进去。这些错误以红色标记。相比之下,提出的方法避免了这些虚构的细节,同时保持字幕的具体性和流畅性。 来源:https://arxiv.org/pdf/2509.21997
该方法首先让模型描述真实图像,包括一些描述中包含实际上不存在的对象或细节的描述。这些幻觉字幕然后被用来生成合成图像,使错误更容易被发现。通过比较真实和生成的图像,该系统学习模型内部哪些模式倾向于产生虚构内容。
一旦这些错误模式被识别出来,它们就可以被存储并稍后使用。当模型被给予一个新图像时,该系统将在字幕过程中调整其内部信号,轻轻地引导它远离已知的导致幻觉的模式。这种方法只需一次传递,不需要额外的数据、重新训练或测试时的新图像生成。
复杂的网络
在上面的示例中,从论文中可以看出,纠缠可能是将“鸟”添加到输入图像中的原因,即使第一幅图像似乎没有鸟。
纠缠发生在模型将某些概念与其他概念关联起来,只是因为这些概念(或多个概念)在模型训练的原始数据分布中经常一起出现。在这种情况下,模型可能已经看到了很多飞机+鸟的图片,导致了一个不适用于特定图片的关联,但仍然影响了推导出的字幕。
虽然纠缠可以通过早期停止训练来减轻(这通常使模型最大限度地灵活和适应性),但这也减少了所有训练概念的细节和分辨率,留下模型训练者面临着一个永恒的困境:创建一个非常灵活和解纠缠的模型;或者创建一个更强大的生成模型,但也更容易产生“关联”幻觉?
如果生成模型的原始数据的质量和字幕的细节更好比后勤通常允许的更好,那么所有源图像的字幕将详细描述每个图像中的每个对象,这样训练模型就可以为它们分配离散和解纠缠的条目在其潜在空间中。
事实上,SEO字幕的自我服务实践,结合ad hoc超大规模网络爬虫仍然是训练真正强大的生成模型的最佳来源,意味着图像字幕往往远远低于这个标准:

一个关于弱字幕如何限制LAION图像用于训练Stable Diffusion等模型的有用性的插图。许多文本标签是浅的、模糊的或针对SEO而不是准确描述,这使得模型更难学习细粒度的视觉概念,例如面部特征。 (原始来源是https://rom1504.github.io/,现在已停用)。
因此,由于基础解决方案不太可能在任何时候都实用,LLM/VLM幻觉的减少通过变通方法和妥协已经成为文献中一个强大的子流派。
本周揭晓的新中国技术,作者称,其方法是在各种架构和不同条件下进行了测试,并可能表明一种有用的方法来减少“幻觉污染”。
他们说:
‘在多个基准测试中进行了广泛的实验,表明我们的方法在对象、属性和关系级别上显著减少了幻觉,同时在很大程度上保留了召回和字幕的丰富性。’
该论文的标题为揭示幻觉以抑制它们:VLMs表示编辑与生成锚点,来自中国科学技术大学和南京大学的三位研究人员。
方法
作者设计了一个端到端的管道,如下所示,旨在揭示和抑制图像字幕中的幻觉:

完整管道的插图。视觉语言模型首先从输入图像生成字幕,该字幕可能包含幻觉内容。然后使用文本到图像模型从字幕中重新生成图像,使任何幻觉更加明显。原始图像和重建图像的嵌入被提取并用于指导解码器内部的调整,帮助模型抑制幻觉细节同时保持字幕质量。
从真实输入图像开始,视觉语言模型生成一个描述性字幕,该字幕可能包含虚构的对象或关系。然后,该字幕被输入到文本到图像生成器中,以创建一个重建图像,显示字幕描述的内容。比较这个重建图像与原始图像使得虚构的内容变得明显和可测量,从而将微妙的文本错误转化为可检测和纠正的清晰语义标记。
为了引导模型远离“虚构”细节,该系统比较同一图像的两个版本:原始图像和基于字幕的重建图像。每个图像被转换为一个紧凑的嵌入,该嵌入捕获其内容。
原始图像作为可靠的参考,而重建图像则突出了幻觉可能出现的地方。通过调整其内部表示以更接近原始图像并远离重建图像,模型学会了自动纠正自己。由于该过程不依赖于手动调整的规则或外部数据,因此它保持完全自监督。
该论文指出:
‘MLLM中的幻觉本质上很难检测,因为它们在语言上是合理的,通常在文本级别上与忠实的描述无法区分。这种差异不在于语言的可信度,而在于与视觉证据的不一致,而模型本身通常对此不敏感。 ‘
‘为了解决这个问题,我们引入了一个幻觉暴露机制,利用生成重建将隐式不一致性转换为显式和可观察的信号。’
给定一个输入图像及其字幕,该系统使用FLUX.1-dev文本到图像模型从字幕中重新生成一个图像。这个重新生成的图像倾向于夸大字幕的含义,使任何虚假细节更加明显。这些放大的错误然后作为有用的信号,帮助模型识别和纠正自己的错误。
为了测试他们的方法,作者将幻觉注入字幕中,并使用文本到图像模型生成重建图像。这些图像然后被LLaVA重新字幕化,并评估原始和幻觉字幕之间的语义相似性:

一个关于如何使微妙错误可见的幻觉放大机制的插图。每个点显示了一幅图像和其重建图像的字幕之间的相似性。橙色线代表直接在原始和幻觉字幕之间测量的相似性,保持高并掩盖小错误;蓝色线代表重建后相似性,急剧下降,表明该过程将隐藏的幻觉转化为可以检测和纠正的清晰语义标记。
相似性在重建后急剧下降,表明该过程使微妙的错误更加可检测。
数据和测试
验证新方法的有效性涉及使用三个相关基准:字幕幻觉评估与图像相关性(CHAIR);MLLM评估基准(MME);以及基于池化的对象探测评估(POPE)。

来自CHAIR发布论文的示例:两个领先的字幕系统TopDown和NBT生成的幻觉对象,其中每个模型在图像中虚构了视觉元素,例如笔记本电脑、水槽或冲浪板。 来源:https://arxiv.org/pdf/1809.02156
像幻觉率或召回率这样的标准指标可能具有误导性,因为模型可能通过产生简短或模糊的字幕来避免幻觉。为了考虑召回率和幻觉率之间的权衡,使用了一种称为幻觉和召回率(HAR@β)的综合指标,该指标根据准确性和完整性对字幕进行评分,并允许根据是否更重要的是避免错误或包含更多细节来调整平衡。
POPE用于评估上下文敏感的对象幻觉,而MME用于评估属性级别的幻觉,两者都被视为是或否判断任务。
实验是在多个代表性数据集上进行的,使用上述Flux模型和LLaVA-v1.5-7B变体。所使用的数据集是Microsoft COCO;A-OKVQA;和GQA。
潜在编辑是在模型的第二层进行的,按照先前的相关工作,而超参数和温度在所有模型中保持一致。
CHAIR上的初始结果如下所示:

在CHAIR基准测试中,使用多个指标评估幻觉缓解的性能。
关于这些结果,作者评论:
‘我们的方法在CHAIRS和CHAIRI上一致性地优于其他基准,表明其在抑制幻觉方面的优越有效性。同时,尽管几乎所有方法在抑制幻觉的同时不可避免地减少了召回率,反映了忠实度和信息量之间的权衡,我们的方法实现了最小的下降。 ‘
‘这表明我们的方法捕获了广泛的真实对象。使用HAR@β指标,我们的方法实现了最高的分数,突出了其减少幻觉的同时保持覆盖范围的能力。’
研究人员将这些强有力的结果归因于双重监督设置,其中原始图像的清晰语义得到了强化,同时重建图像的误导信号得到了抑制。由于调整仅针对与幻觉相关的方向,表示的其余部分保持完整,使系统能够纠正错误而不牺牲细节或信息量。

在POPE基准测试中,比较不同配置和数据集的性能。
关于POPE上的结果,论文断言:
‘可以观察到我们的方法在所有设置中一致地实现了最佳性能。值得注意的是,我们的方法可以在平均上实现最高+5.95%的准确率和+6.85%的F1分数,远远优于其他无需训练的方法。 ‘
‘因此,这些结果表明我们的方法提供了一个可靠且普遍适用的解决方案,适用于不同难度水平。’

来自第三轮测试的MME上的性能比较。
最后一个主要测试是在MME上进行的,结果如下所示。然而,在其他省略中,它提到了“OPERA”方法,但在论文或附录中没有定义。虽然作者声称在MME上表现出色,但由于方法没有得到充分的定义,我们应该在此结束结果部分。

来自MME基准测试的LLaVA-v1.5-7B的插图,显示基准模型产生了一个幻觉答案,而所提出方法给出了正确的响应,重建图像使幻觉更加明显。
结论
虽然这篇论文显然很仓促,并且由于过去12个月来在文献中日益明显的缺乏结构、焦点和清晰度而受到影响(这可能与学术研究中人工智能的使用增加有关),但其中提出的核心机制仍然很巧妙。
虽然这种端到端的方法不需要重新训练,并且似乎可以应用于各种架构,但看到更多的测试候选者将会很有见地;同时,也必须考虑到这种中间系统至少会引入延迟,并且会增加一定的额外的功耗——这并不是一个小问题,尤其是在大规模应用中。
* 不寻常的是,该论文的正文以标题呈现结果,这些标题仅在附录材料中解释,而不是在正文中——这是文献中越来越多的坏习惯,因为研究人员试图将中心论点限制在8-9页内,即使材料不允许这样做。无论如何,CHAIR基准测试,用于评估字幕中的对象幻觉,是基于之前工作中的500个MSCOCO子集。使用了两种形式:CHAIRs,衡量幻觉在任何给定的字幕中出现的频率;和CHAIRI,衡量字幕中提到的对象中有多少是幻觉的。HAR@β ,在正文中引入,是一种Fβ风格的幻觉抑制和对象召回的组合。
首次发表于2025年9月30日星期二
CHAIRs,测量字幕中出现的幻觉频率;和CHAIRI,测量字幕中提到的对象中有多少是幻觉的。HAR@β,引入在主论文中,是一种Fβ风格的组合,包括抑制幻觉和对象召回。首次发表于2025年9月30日星期二












