Anderson 视角
人工智能世界模型真的能理解物理定律吗?

视觉语言人工智能模型的最大希望是,它们有一天将变得更加自主和多才多艺,像我们通过早期经验发展出对物理定律的天然理解一样,融入物理定律的原理。
例如,儿童的球类游戏往往会发展出对运动学的理解,以及重量和表面质地对轨迹的影响。同样,通过与诸如浴缸、洒出的饮料、海洋、游泳池和其他多种液体体相互作用,我们会对液体在重力下的行为方式发展出多样化和可扩展的理解。
即使是对较少见现象的假设——例如燃烧、爆炸和建筑物在压力下的重量分布——也会通过观看电视节目和电影,或社交媒体视频在我们身上无意识地吸收。
当我们在学术水平上学习这些系统背后的原理时,我们只是在对这些系统的直觉(但不明智)的精神模型进行“改造”。
独树一帜
目前,大多数人工智能模型更为“专业化”,许多模型要么是在特定用例的图像或视频数据集上进行了微调,要么是从头开始训练的。这些模型不太可能发展出对支配物理定律的普遍理解。
其他模型可能表现出对物理定律的理解,但它们可能只是在复制训练数据中的样本,而不是真正理解运动物理学等领域的基础知识,以便能够产生真正新颖(并在科学上可信)的输出,以用户的提示为依据。
在人工智能系统的商品化和商业化的这个关键时刻,区分新型人工智能模型的精心制作的营销和它们的局限性的现实,就取决于我们和投资者的审查。
11月份最有趣的论文之一,由字节跳动研究团队领导,探讨了这种问题,研究了“万能”生成模型(如Sora)之间的明显和真正的能力差距。
这项工作得出结论,在当前的技术水平下,这类模型的生成输出更可能是复制训练数据,而不是真正展示对现实世界中运行的基本物理约束的理解。
论文指出:
‘这些模型可以很容易地被训练集中的“欺骗性”示例偏斜,导致它们在某些条件下以“基于案例”的方式泛化。这一现象,也被观察到在大型语言模型中,描述了模型在解决新任务时参考类似训练案例的趋势。 ‘
‘例如,考虑一个在数据上训练的视频模型,该数据显示一个高速球在统一线性运动中移动。如果通过水平翻转视频来执行数据增强,从而引入反向运动,模型可能会生成一个场景,其中一个低速球在初始帧之后反转方向,即使这种行为在物理上是不正确的。’
我们将更详细地研究这篇论文——题为《使用LLM进行决策的世界模型评估》——但首先,让我们看一下这些明显限制的背景。
记忆的回声
没有泛化能力,一个训练好的人工智能模型只不过是一个昂贵的对其训练数据的引用表:找到合适的搜索词,你就可以召唤出训练过程中看到的数据的一个实例。
在这种情况下,模型实际上是作为一个“神经搜索引擎”运行,因为它不能产生抽象或“创造性的”期望输出的解释,而是复制训练过程中看到的数据的某种微小变体。
这被称为记忆——一个有争议的问题,因为真正具有弹性和解释能力的AI模型往往缺乏细节,而真正详细的模型往往缺乏原创性和灵活性。
受记忆影响的模型能够复制训练数据的能力是一个潜在的法律障碍,因为模型的创建者可能没有使用该数据的无障碍权;并且可以通过越来越多的提取方法证明从该数据中获得的好处。
由于记忆,未经授权的数据的痕迹可以通过多个训练系统“菊花链”式地持续存在——就像一个不可磨灭的、无意的水印,即使机器学习从业者已经采取措施确保使用“安全”的数据。
世界模型
然而,记忆的主要使用问题是,它往往会产生“智能”的幻觉,或者表明人工智能模型已经概括了基本定律或领域,而实际上是大量记忆的数据提供了这种幻觉(即,模型有这么多潜在的数据示例可供选择,以至于很难让人类区分它是否在复制学习的内容还是真正理解所涉及的概念)。
这个问题对日益增长的对世界模型的兴趣有着重要的影响——即高度多样化和昂贵训练的人工智能系统的前景,它们包含多个已知的定律,并且可以被丰富地探索。
世界模型在生成图像和视频领域尤其感兴趣。2023年,RunwayML启动了一个关于这种模型的开发和可行性的研究计划;DeepMind最近聘请了著名的Sora生成视频的创造者之一来开发这种模型;像Higgsfield这样的初创公司正在大量投资图像和视频合成的世界模型。
硬组合
新一代生成视频人工智能系统的新发展承诺的是,它们可以学习基本的物理定律,例如运动、人类运动学(例如步态特征)、流体动力学以及其他在视觉上对人类来说很熟悉的物理现象。
如果生成人工智能能够实现这一里程碑,它就可以产生超现实的视觉效果,描绘爆炸、洪水和多个物体的可信碰撞事件。
但是,如果人工智能系统只是被训练在成千上万(或数十万)的视频上展示此类事件,那么它可能会在用户查询类似训练数据时令人信服地复制训练数据;但是,如果查询将太多概念组合在一起,这些概念在数据中没有以这种组合方式表示,那么它可能会失败。
这些限制不会立即显现出来,直到你用具有挑战性的概念组合来测试系统。
例如,一个相对常见且广泛传播的事件,例如“一栋建筑被拆除”,可能在训练模型的数据集中出现多次,因此模型可以在参数中对该概念进行概括,并产生真正新颖的输出;然而,如果你要求一个更奇怪或更虚构的例子,例如“埃菲尔铁塔被外星入侵者炸毁”,那么模型将需要组合多个领域,例如“金属特性”、“爆炸特征”、“重力”、“风阻”和“外星飞船”。
这是一个“超分布”(OOD)示例,它结合了如此多的交织概念,以至于该系统可能会生成不令人信服的示例,或者会默认为最接近的语义示例,即使该示例不符合用户的提示。
物理约束
新论文——字节跳动、清华大学和特拉维夫理工学院的合作——表明,像Sora这样的模型不仅没有真正地内化确定性的物理定律,而且似乎在大多数情况下,增加数据规模并没有带来真正的改进。
论文探讨了特定物理定律的外推极限,以及模型的组合泛化能力——即两个不同物理原理的表示被合并成一个单一的生成输出的实例。
[视频宽度=”1200″高度=”712″mp4=”https://www.unite.ai/wp-content/uploads/2024/11/physical_limitations_bytedance.mp4″][/视频]
新论文的视频摘要。 来源:https://x.com/bingyikang/status/1853635009611219019
研究人员选择了三个物理定律来进行研究:抛物线运动、统一线性运动和完全弹性碰撞。
如上所述的视频所示,发现表明像Sora这样的模型并没有真正地内化物理定律,而是倾向于复制训练数据。
此外,作者发现,颜色和形状等方面在推理时变得如此交织,以至于生成的球可能会变成一个正方形,显然是因为训练数据中的一个类似运动示例中有一个正方形,而不是一个球(见上面的嵌入视频中的示例)。
论文得出结论:
‘我们的研究表明,仅仅扩大规模不足以使视频生成模型发现基本的物理定律… ‘
‘… [发现] 表明,仅仅扩大规模并不能解决OOD问题,尽管它可以提高其他场景下的性能。 ‘
‘我们的深入分析表明,视频模型的泛化更依赖于引用类似的训练示例,而不是学习通用规则。我们观察到一种“基于案例”的行为,其优先顺序为颜色 > 尺寸 > 速度 > 形状。 ‘
‘[我们的] 研究表明,简单地扩大规模不足以使视频生成模型发现基本的物理定律。 ‘
被问及研究团队是否找到了解决这个问题的方法时,论文作者之一评论说:
‘不幸的是,我们没有。实际上,这可能是整个人工智能社区的使命。 ‘
方法和数据
研究人员使用了变分自编码器(VAE)和DiT架构来生成视频样本。在这种设置中,VAE产生的压缩潜在表示与DiT对去噪过程的建模一起工作。
视频是在Stable Diffusion V1.5-VAE上进行训练的。架构在基本上保持不变,只有末端过程的架构增强:
‘[我们保留]原始2D卷积、组归一化和空间维度上的注意力机制的大部分。 ‘
‘为了将此结构膨胀为空间-时间自编码器,我们将编码器和解码器的最后几个2D下采样块转换为3D块,并使用多个额外的1D层来增强时间建模。 ‘
为了使视频建模成为可能,修改后的VAE与HQ图像和视频数据一起进行了联合训练,2D生成对抗网络(GAN)组件本地于SD1.5架构进行了3D增强。
用于训练的图像数据集是Stable Diffusion的原始来源LAION-Aesthetics,经过过滤,以及DataComp。视频数据是从Vimeo-90K、Panda-70m和HDVG数据集中精心策划的子集。
数据经过一百万步训练,应用了随机resize裁剪和随机水平翻转作为数据增强过程。
翻转
如上所述,随机水平翻转数据增强过程可能是训练一个旨在产生真实运动的系统的负担。这是因为训练模型的输出可能会同时考虑对象的两个方向,并在尝试处理这些冲突数据时导致随机逆转(见上面的嵌入视频)。
另一方面,如果你关闭水平翻转,模型更有可能产生仅遵循从训练数据中学习的单一方向的输出。
因此,没有简单的解决方案,除了系统真正地吸收了运动的全部可能性——本地版本和翻转版本——一种儿童很容易发展的能力,但似乎对人工智能模型来说更具挑战性。
测试
对于第一组实验,研究人员制定了一个2D模拟器来生成遵循经典力学定律的对象运动和碰撞的视频,从而为模型的评估提供了大量受控的数据集,排除了真实世界视频的模糊性。
上述三个基本场景是测试的重点:统一线性运动、完全弹性碰撞和抛物线运动。
使用了不同大小(从30,000到300万个视频)的数据集来训练不同大小和复杂度(从DiT-S到DiT-L)的模型,每个视频的前三帧用于条件化。
模型被训练为一百万步,使用256×256的分辨率,视频帧数为32帧。
研究人员发现,同分布(ID)结果随着数据量的增加而良好扩展,而OOD生成没有改善,表明存在泛化方面的缺陷。
论文指出:
‘这些发现表明,仅仅扩大规模不足以使模型在OOD场景中进行推理。 ‘
接下来,研究人员测试和训练了旨在展示组合泛化能力的系统,其中两个不同的运动被合并以产生忠实于每个单独运动背后的物理定律的连贯运动。
对于这一测试阶段,作者使用了PHYRE模拟器,创建了一个2D环境,展示了多个和多样形状的物体在自由落体中相互碰撞,涉及各种复杂的相互作用。
评估指标为视频距离(FVD)、结构相似性指数(SSIM)、峰值信噪比(PSNR)、学习的感知相似性度量(LPIPS)和人工研究(在结果中表示为“异常”)。
创建了三个规模的训练数据集,分别为10万、60万和300-600万个视频。使用了DiT-B和DiT-XL模型,因为视频的复杂性增加了,条件使用的是第一帧。
模型被训练为一百万步,分辨率为256×256,帧率为每个视频32帧。
测试的结果表明,仅仅增加数据量是不够的:
论文指出:
‘这些结果表明,模型容量和组合空间的覆盖对于组合泛化至关重要。这种见解意味着视频生成的缩放定律应该专注于增加组合多样性,而不是仅仅扩大数据量。 ‘
最后,研究人员进行了进一步的测试,以尝试确定视频生成模型是否真正内化了物理定律,还是简单地在推理时记忆和复制训练数据。
他们检查了“基于案例”的泛化的概念,即模型在面对新情况时倾向于模仿特定的训练示例,以及检查统一运动的例子——特别是训练数据中的运动方向如何影响训练模型的预测。
为统一运动和碰撞分别策划了两个训练数据集,每个数据集由显示速度在2.5到4个单位之间的统一运动视频组成,使用前三个帧作为条件化。在训练后,测试是在已见和未见场景上进行的。
以下是统一运动生成测试的结果:
作者指出:
‘[有]一个大间隙的训练集,模型倾向于生成视频,其中速度要么很高,要么很低,以类似训练数据的方式,当初始帧显示中等速度。 ‘
对于碰撞测试,涉及的变量更多,模型需要学习一个二维非线性函数。
作者观察到,“欺骗性”示例的存在,例如反向运动(即一个球从表面弹回并改变其方向),会误导模型并导致其生成物理上不正确的预测。
结论
如果一个非人工智能算法(即“烘焙”、程序方法)包含对物理现象(如流体、重力下的物体或压力下的物体)行为的数学规则,则有一套可用于准确渲染的不变常数。
然而,新论文的发现表明,在训练生成模型时,并没有发展出对经典物理定律的等效关系或内在理解,而且增加数据量并没有解决这个问题,而是使其变得更加模糊——因为有更多的训练视频可供系统在推理时模仿。
* 我将作者的内联引用转换为超链接。
首次发布于2024年11月26日星期二












