Anderson 视角

即使是最先进的语言模型也难以理解时间逻辑

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Variation on ChatGPT-4o prompt: ‘1792px x 1024px photorealistic HQ image of a robot looking at a computer screen. On the screen is a picture of a chicken and an egg. The image should not be cartoon-ish, or illustration-like, but should look like a still from a high-budget Hollywood movie’

预测未来状态是计算机视觉研究中的一个关键任务,尤其是在机器人领域,需要考虑现实世界的情况。因此,机器学习系统需要对物理世界有充分的理解。

然而,在某些情况下,语言模型对时间现实的了解可能是具有欺骗性的:一篇来自阿联酋的新论文发现,即使是最先进的多模态大型语言模型(MLLMs),包括行业领先的GPT-4o和Google Gemini,也难以解释图像中的时间顺序。

例如,顺序对(见下图),即使对人类来说很简单,即使顺序错误,也可能会难倒先进的MLLMs,特别是在意外的上下文或配置中(例如,第二张图片先显示,合并成单张图片,多张图片可能代表正确或错误的时间顺序等)。

研究人员编译的数据集样本,显示顺序事件。研究人员已将此数据发布在https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

研究人员编译的数据集样本,显示顺序事件,以“前后”图像的形式呈现。研究人员已将此数据发布在https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

研究人员要求模型完成基本的时间推理任务,例如确定事件顺序或估计时间间隔,并发现七个被测试的MLLMs的性能明显低于人类的准确率。

‘总体而言,结果表明所有当前的MLLMs,包括GPT-4o——我们评估中最先进的模型——都难以完成所提出的基准测试。尽管GPT-4o相对于其他模型具有更好的性能,但它仍然无法在不同设置中一致地展示准确的时间推理能力。’

‘所有模型的准确率都很低,表明它们在理解和解释时间序列方面存在重大局限性。即使提供多图像输入或优化提示,这些缺陷仍然存在,表明当前的架构和训练方法对于鲁棒的时间顺序理解是不够的。’

机器学习系统旨在优化最准确、最有效和最能取悦人的结果。由于它们没有明确显示其推理过程,因此很难判断它们是否在“作弊”或使用“捷径”。

在这种情况下,MLLM可能通过错误的方法得出正确答案。这种正确答案可能会让人对模型产生错误的信心,模型可能会使用相同的方法产生错误的结果。

更糟糕的是,如果人类被这种结果所吸引,并在试验和注释会话中提供积极的反馈,这种误导可能会更加深入地融入开发链中。

在这种情况下,MLLMs似乎是在“伪造”对时间和时间现象的真正理解,通过观察和锚定次要指标(例如时间戳、图像布局中的顺序等)。

这进一步表明MLLMs目前尚未满足对时间现象的真正概括定义——至少在人类可以做到的程度上。

新论文的标题是多模态MLLMs能否进行视觉时间理解和推理?答案是否!,由阿联酋人工智能大学和阿里巴巴国际数字商务的三位研究人员撰写。

数据和测试

作者指出,之前的基准测试和研究,例如MMMUTemporalBench,专注于单图像输入,或者提出MLLMs容易回答的问题,这可能无法揭示捷径行为的趋势。

因此,作者提供了两种更新的方法:时间顺序理解(TOU)和时间间隔估计(TLE)。TOU方法测试模型确定事件顺序的能力;TLE方法评估MLLM估计两张图像之间时间差异的能力,范围从几秒到几年。

论文中的两个主要任务:时间顺序理解和时间间隔估计。来源:https://arxiv.org/pdf/2501.10674

论文中的两个主要任务:时间顺序理解和时间间隔估计。来源:https://arxiv.org/pdf/2501.10674

研究人员为TOU基准测试收集了360对图像,使用来自Pixabay和Pexels的开源视频,以便能够通过GUI提供数据集。

视频涵盖了从日常活动的人到非人类内容(如动物和植物)的广泛主题。从这些视频中,选择了图像对来展示具有足够变化的事件序列,使得起始帧“显而易见”。

人类选择用于确保帧可以被明确定义。例如,一个策划的对显示了一张部分装满的茶杯和同一个杯子装满茶的下一帧,使得序列逻辑容易识别。

这两张图片的时间逻辑无法被忽视,因为茶不可能被吸回壶嘴。

这两张图片的时间逻辑无法被忽视,因为茶不可能被吸回壶嘴。

通过这种方式,获得了360对图像。

对于TLE方法,选择了来自Google和Flickr的版权免费图像,以及YouTube上版权免费视频的选定帧。这些视频的主题是场景或对象,其变化间隔从几秒到几天到几个季度不等——例如,水果成熟或景观中季节的变化。

因此,策划了125对图像用于TLE方法。

并非所有被测试的MLLMs都能处理多个图像;因此,测试因每个模型的能力而异。

生成了多个版本的策划数据集,其中一些图像对垂直连接,其他对水平连接。此外,一些对的真实和正确的时间顺序被交换。

开发了两种提示类型。第一种遵循以下模板:

左/上/第一张图像中的事件是否发生在右/下/第二张图像中的事件之前?用真或假回答,并给出理由。

第二种遵循以下模式:

这两张图像中,哪一张显示了最先发生的事件?用左或右/上或下/第一或第二回答,并给出理由。

对于TLE,问题是多选题,要求模型评估两张图像之间的时间间隔,选择的时间单位包括秒、分钟、小时、天、月和年。在这种配置中,最近的图像显示在右侧。

估计左(第一张)图像和右(第二张)图像之间的时间间隔。

选择以下选项之一:

    1. 少于15秒
      B. 2分钟至15分钟之间
      C. 1小时至12小时之间
      D. 2天至30天之间
      E. 4个月至12个月之间
      F. 超过3年

被测试的MLLM包括ChatGPT-4o;Gemini1.5-Pro;LlaVa-NeXTInternVLQwen-VLLlama-3-vision;和LLaVA-CoT

时间顺序理解:结果

不同模型和输入布局的时间顺序理解结果,显示准确率和一致性。

不同模型和输入布局的时间顺序理解结果,显示准确率和一致性。

关于上述结果,作者发现所有被测试的MLLMs,包括GPT-4o(表现最佳),都在时间顺序理解基准测试中遇到了困难——即使GPT-4o也无法在不同配置中一致地展示可靠的时间推理能力。

作者认为,MLLMs的准确率持续低下,突出了它们在解释和推理视觉数据中的时间序列方面的重大局限性。研究人员指出,这些挑战即使使用多图像输入和优化提示也仍然存在,表明当前的模型架构和训练方法存在根本性缺陷。

测试显示了不同提示策略的性能差异。虽然GPT-4o在使用优化提示时性能有所提高(在单图像设置中达到4%,在多图像设置中达到65.3%),但其性能仍然低于可接受的水平。

像LlaVA-NeXT和Qwen-VL这样的模型对提示更敏感,当使用替代提示时性能下降,表明提示工程无法克服MLLMs在时间推理方面的根本局限性。

测试还表明图像布局(即垂直与水平)对模型性能有显著影响。GPT-4o在垂直布局中的一致性有所提高,从39.2%提高到52.8%;然而,其他模型,包括LlaVA系列,表现出强烈的方向偏差,在一个方向上表现出色,但在另一个方向上表现不佳。

这篇论文表明,这些不一致性表明MLLMs依赖于空间线索,而不是真正的时间推理。它们似乎没有真正分析事件序列或理解时间的进展,而是依赖于图像布局相关的模式或视觉特征(例如图像的位置或对齐)来做出决定。

GPT-4o在面对不同输入顺序时的预测。正确分类用绿色标记,纯粹的错误分类用红色标记,幻觉推理用橙色标记,非逻辑或“无效”推理用棕色标记,显示了模型在不同输入配置中的不一致性。

GPT-4o在面对不同输入顺序时的预测。正确分类用绿色标记,纯粹的错误分类用红色标记,幻觉推理用橙色标记,非逻辑或“无效”推理用棕色标记,显示了模型在不同输入配置中的不一致性。

单图像输入和多图像输入之间的比较测试显示了有限的整体改进,GPT-4o在多图像输入上表现略好,从31.0%提高到43.6%(使用P1)和46.0%提高到65.3%(使用P2)。

其他模型,如InternVL,表现出稳定但低的准确率,而Qwen-VL则看到了一些小幅度的提高。作者得出结论,这些结果表明额外的视觉上下文并没有显著提高时间推理能力,因为模型难以有效地整合时间信息。

人类研究

在人类研究中,三次调查评估了最好性能的多模态MLLM(GPT-4o)与人类估计的接近程度。

人类实现了90.3%的准确率,超过GPT-4o的65.3% 25%。数据集被证明是可靠的,人类错误很少,正确答案的一致性很高。

第一轮测试的人类用户研究结果。

第一轮测试的人类用户研究结果。

时间间隔估计:结果

时间间隔估计结果:时间间隔估计评估模型在识别图像对之间时间间隔方面的准确率,跨越从秒到年的时间尺度。

时间间隔估计结果:时间间隔估计评估模型在识别图像对之间时间间隔方面的准确率,跨越从秒到年的时间尺度。

在这些测试中,MLLMs仅在时间间隔估计方面表现出中等水平的准确率:GPT-4o实现了70%的准确率,但其他模型的性能明显较差(见上表),并且性能在不同的时间尺度上也有显著差异。

作者评论道:

‘时间间隔估计任务评估MLLMs推断图像对之间时间间隔的能力。所有MLLMs,包括表现最佳的GPT-4o和Gemini1.5-Pro,都难以完成这一任务,仅达到60-70%的准确率。GPT-4o表现不一致,在秒和年方面表现出色,但在小时方面表现不佳。’

‘同样,LlaVA-CoT在秒和天的时间尺度上表现出色,但在其他时间间隔上表现不佳。’

人类研究

在TLE的人类研究中,平均人类表现比GPT-4o(也是这一类别中表现最佳的模型)提高了12.3%。

作者指出,一些挑战特别具有挑战性,在一个案例中,所有人类参与者都返回了错误答案,所有AI参与者也一样。

作者得出结论,GPT-4o表现出“相对稳健的推理能力”,尽管在图像顺序方面存在不一致性。

结论

如果MLLMs最终积累和吸收足够的“捷径”数据来应对最棘手的挑战,那么它们是否能够发展出类似人类的推理能力可能变得无关紧要。

我们也不知道我们如何获得自己的时间推理能力——我们是否也“作弊”直到学习经验的数量揭示出一种模式,这种模式在这种类型的测试中表现为“直觉”?

* 从模型被优化的损失函数中获得人类反馈,并通过人类试验和随后的分类来有效优化的角度来看。

首次发布于2025年1月27日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai