Anderson 视角

AI 视觉系统通常并不是真正的“看”

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image (GPT-2): a supermarket bin contains misshapen green apples beneath a sign showing a red apple and the words 'Red, glossy and round.' The image is surrounded by a yellow-and-black border labelled “AI fantasy inside” and “reality outside,” with inward-pointing arrows.

AI 视觉系统可能正在使用刻板印象来解释图像,而不是真正看到它们。移除标签后,它们所谓的视觉解释就会崩溃。

 

由于前沿的 AI 平台不断地 亏钱,以期达到 AI 事件地平线,少量的经济节约在其提供和服务中等于巨大的节省:例如,每当一个大型语言模型可以从其自己的训练矩阵中提供答案,而不是进行 RAG 基于的网络之旅来获取需要提取和精炼的 当前 信息时,它会更快地回答,并且为提供者节省资金。

当然,它更有可能 产生幻觉,而不需要额外的代币和能量来上下文化和检查其假设。

同样,即使一个大型语言模型确实访问了网络,它也经常引用模糊、不适当或甚至无关的 URL,因为它通过仅评估这些页面的元数据而不是实际阅读它们来节省能量。

同样,如果您将 PDF 上传到大型语言模型并希望讨论它,大型语言模型可能最终 从其内存中擦除 PDF 内容,并仅使用有关它的稀疏元数据来回答您的查询,而不说明您应该再次上传它 – 从而导致错误、错误的假设和更多的幻觉。

工业试验

这些是出于操作动机而施加在用户身上的务实的、如果不是完全诚实的经济。 在数据收集和模型训练的上游世界中,必须批量处理数百万张图像,不能由人类手动注释,在那里节省能量和时间的压力同样强烈。

一种这样的“捷径”是使用像 对比语言图像预训练(CLIP)这样的中间视觉语言模型,它将图像和文本映射到一个共享的语义空间,以便可以使用语言比较视觉概念,而不是使用明确的标签。

这意味着什么?好吧,想象一个孩子从数百万张带有字幕的图片中学习,直到他们对哪些图像和单词自然一起出现有了大致的了解。

问题是,字幕通常是由网站所有者和其他自私的实体撰写的,他们更感兴趣 好的 SEO 而不是好的标注,导致大量“噪音”或不准确的标注。

然而,在大型数据集中,概念和相关单词的重复通常意味着核心单词将与正确的图像相关联,因为较少的“无意义”标签通常会被迫进入 异常值 群体,并且不会通常与图像相关联。所以它基本上是有效的,大部分时间都是这样。

数据注释是以这种方式完成的,因为它很便宜,功能最小,而 不是因为它很好

非标签

在这个麻烦的场景中,卡内基梅隆大学的一篇新论文生动地表明,许多分配给图像的字幕——例如由 CLIP——只是基于图像的(基于文本的)标签的 刻板印象,而不是通过积极地查看图像本身。

在论文中的一个引人注目的例子中,CLIP 与从 ImageNet 类名 草莓 生成的描述符配对,然后在 ImageNet-Sketch 上进行测试,其中每个草莓都是黑白绘图——然而,描述符仍然坚持认为该水果是 ‘红色’‘成熟’

类名描述符在 ImageNet-Sketch 上失败:语言先验说是红色和成熟的,而图像基础属性与黑白绘图相匹配。来源 - https://www.unite.ai/wp-content/uploads/2026/07/figure-1-4.jpg

类名描述符在 ImageNet-Sketch 上失败:语言先验说是红色和成熟的,而图像基础属性与黑白绘图相匹配。 来源

在这里,CLIP 与仅从类名 草莓 生成的描述符配对,通过 GPT-3 或外部知识。这些描述符从不查看图像,因此它们默认为 规范 特征,例如 红色叶状。当应用于 ImageNet-Sketch 中的单色线条插图时,该过程失败。

相比之下,从图像本身推导出的属性选择了在转换下仍然正确的特征,例如 点状心形

因此,我们可以看到,被识别的对象不是因为它是什么,而是因为它的“声誉”;形容词“红色”和“叶状”对于子域 草莓 是准确的,但超过了所讨论的图像(实例)的范围。

该论文的作者——题为 属性应来自图像,而不是类名:为视觉语言模型选择分布条件属性——认为这是一个持续和普遍的问题,并建议直接从图像本身选择属性,以便它们反映在 分布转换 下实际可见的内容,而不是依赖类名 先验

作者们指出:

‘一种流行的零次分类的可解释方法是要求一个大型语言模型(LLM)描述每个类名,并使用生成的描述符提示 CLIP。我们展示了这些描述符带有很少的视觉证据:从提示中删除类名会将 ImageNet 准确率从 59.5% 降低到 15.5%。 ‘

‘诊断结果是,描述符是有条件的标签,而不是图像,所以它们描述了概念的一般情况,并在数据转换时误导;一个 LLM 坚持认为草莓是红色的,但 ImageNet-Sketch 中的每个草莓都是一个无色的线条图。 ‘

‘我们因此从目标图像集合中选择属性:我们将一个大型属性池评分与 CLIP 的联合嵌入空间中的图像进行比较,并在每个类别中保留最高评分的属性。’

他们提出的解决方案是,模型保持不变,但不是依赖类名描述,而是检查 候选属性池 与图像,并仅保留真正适合图像的属性。

这种方法的代价是可以接受的,因为它不建议重新调用导致问题的“作弊”方法的保存能量。相反,它在每个类别的候选属性上添加一个 评分通行,因此延迟略微增加 – 但远远小于重新训练或全面的 RAG 风格管道。在理论上,能量成本将是合理的,权衡在于对齐度的改进。

方法

由于作者的测试方法特别晦涩,我们将只考虑对他们的方法的简要概述。

这项工作将核心问题表述为 类名混淆:一种情况,其中性能似乎来自有意义的描述符,但实际上 依赖于类名本身,描述符添加很少 – 并且在支持被删除后立即失败

论文然后认为,这种失败是不可避免的,因为从类名生成的描述符只能描述事物 通常 的样子,而不是图像中实际存在的内容。只要数据偏离这些期望,描述符就会变得不仅无用,甚至具有误导性,有效地 反对正确答案

研究人员还考虑了 CLIP 是否可能只是在没有类标签帮助的情况下检测属性不佳,或者 GPT 生成的描述符太通用而无用。然而,他们随后的实验驳斥了这两种解释。

为了解决这个问题,使用了一个 冻结 的 CLIP 模型来比较图像与从 VAWLSA 和 GPT-3 输出中提取的大型候选描述符池进行比较,仅保留与图像最匹配的属性,而无需任何重新训练或额外的图像文本监督:

所提出的系统概述:一个冻结的 CLIP 模型编码图像和大量候选属性文本,使用余弦相似度来衡量每个描述符与视觉内容的匹配程度。然后根据每个类别保留最高评分的属性,生成一个可解释的提示集,同时在整个过程中保持图像和文本编码器不变。

所提出的系统概述:一个冻结的 CLIP 模型编码图像和大量候选属性文本,使用余弦相似度来衡量每个描述符与视觉内容的匹配程度。然后根据每个类别保留最高评分的属性,生成一个可解释的提示集,同时在整个过程中保持图像和文本编码器不变。

数据和测试

作者的实验使用了带有 ResNet-50 后端的 CLIP,并在 ImageNet 上评估性能,连同四个分布转换的变体:ImageNetV2;ImageNet-Sketch;ImageNet-A;和 ImageNet-R

仅使用原始 ImageNet 训练图像选择属性,使得转换后的数据集可以作为一个测试,用于检查图像派生的属性在视觉外观发生变化时是否仍然有用:

跨 ImageNet 和四个分布转换基准的 Top-1 分类准确率。结果表明,当类名包含在提示中时,性能基本相似,但当描述符被迫独立时会崩溃,表明它们的明显有效性来自于类标签本身。相比之下,直接从图像中选择的属性在所有测试数据集中都更具信息量。

跨 ImageNet 和四个分布转换基准的 Top-1 分类准确率。结果表明,当类名包含在提示中时,性能基本相似,但当描述符被迫独立时会崩溃,表明它们的明显有效性来自于类标签本身。相比之下,直接从图像中选择的属性在所有测试数据集中都更具信息量。

从同一个 GPT 生成的池中重新选择属性,但将其条件化为 ImageNet 图像,提高了无类名的准确率从 15.5% 到 19.4%。由于模型、属性池和评估协议保持不变,因此增益可以完全归因于图像条件选择。

结果还表明 CLIP 可以在没有类标签的情况下识别属性,并且 GPT 生成的池已经包含了有用的描述符。主要的失败似乎在于 标签条件生成,它经常无法揭示与图像本身最相关的属性。

虽然作者继续进行一系列广泛的额外实验,我们必须将读者转介到原始材料以获取这些实验的进一步细节,因为它们并没有扩大到目前为止概述的结果的范围,而只是确认了中心假设——即依赖标签可能会破坏现代计算机视觉应用中真实图像数据的潜力,廉价地依赖“声誉”概率可能会危及结果的准确性。

结论

考虑现代生成式 AI 所欠的债务是很有趣的,这笔债务来自于数百万张手工描述的图像,这些图像被摄取到巨大的数据集中,例如 Common Crawl,在超大规模时代的开始。

每当图像识别或自动标记系统尝试分类或重新标记一张旧图像或新图像时,知识的出处可以追溯到某个供应商在 2004 年某个 eBay 列表的 alt 标签中写了 ’70 年代热门杂志!’,或者类似的事件。

虽然许多人认为关键词堆砌的黄金时代已经被谷歌更先进的 PageRank 算法在近三十年前消除了,但 “文字墙,希望有什么东西能粘住” 的方法仍然存在:就在昨天,Qwen-Image-3.0 模型 的发布页面顶部是一个 过时的关键词堆砌狂热(它可能仍然存在!):

Qwen Image 3 的 HTML 代码是一个不完全安全的关键词文本墙,至少在撰写本文时是如此。来源 - https://qwen.ai/blog?id=qwen-image-3.0

Qwen Image 3 的 HTML 代码是一个不完全安全的关键词文本墙,至少在撰写本文时是如此。 来源

无论这大量的关键词是否系统地从目标列表中提取,还是由 SEO 专家手动编写,这都是现代生成式 AI 系统的原始起源的典型例子,意义通常带有大量的自利 payload,稍后需要以某种方式剥离或至少在某种程度上进行核算,当此类术语干扰或阻碍理性系统和应用程序时。

 

首次发布于 2026 年 7 月 22 日星期三

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:[email protected]