AI 模型与平台
视觉自回归建模:通过下一尺度预测实现可扩展的图像生成
大型语言模型(如GPT)和其他自回归模型的出现,开启了机器学习和人工智能领域的新时代。这些模型通常表现出一般性智能和多样性,被认为是实现通用人工智能(AGI)的重要一步。然而,这些大型模型面临的一个令人困惑的问题是自监督学习策略,即模型通过预测序列中的下一个token来进行学习。这种策略简单却有效。最近的研究表明,这些大型自回归模型具有良好的可扩展性和普遍适用性。可扩展性是现有缩放法则的典型例子,允许研究人员根据小型模型的性能预测大型模型的性能,从而更好地分配资源。另一方面,普遍适用性通常通过零样本学习、一次样本学习和少样本学习等策略体现,突显了无监督但经过训练的模型适应多样化和未见任务的能力。总之,普遍适用性和可扩展性揭示了自回归模型从大量无标签数据中学习的潜力。
在此基础上,本文将讨论视觉自回归(VAR)框架,这是一种新型的图像生成模式,通过从粗糙到精细的“下一尺度预测”或“下一规模预测”来重新定义图像的自回归学习。这种方法简单却有效,允许自回归变换器更好地学习视觉分布,并增强其普遍适用性。此外,VAR模型使GPT风格的自回归模型首次在图像生成任务中超越扩散模型。实验结果表明,VAR框架显著改进了自回归基线,并在多个维度(包括数据效率、图像质量、可扩展性和推理速度)上优于扩散变换器(DiT)框架。进一步地,扩大VAR模型显示出与大型语言模型类似的幂律缩放法则,并在下游任务(包括编辑、内插和外插)中展示了零样本普遍适用性。
本文旨在深入探讨VAR框架,包括其机制、方法论、架构以及与现有最先进框架的比较。我们还将讨论VAR框架如何体现大型语言模型的两个重要特性:缩放法则和零样本普遍适用性。让我们开始吧。
视觉自回归建模:可扩展的图像生成
最近的大型语言模型中,一个常见的模式是实施自监督学习策略,即预测序列中的下一个token。这种方法简单却有效,导致自回归和大型语言模型表现出卓越的可扩展性和普遍适用性。这些特性揭示了自回归模型从大量无标签数据中学习的潜力。计算机视觉领域的研究人员也在努力开发大型自回归或世界模型,以匹配或超越这些模型的可扩展性和普遍适用性。这些模型通常实施视觉tokenizer,将连续图像表示为2D token网格,然后将其展平为1D序列进行自回归学习,模仿序列语言建模过程。

然而,研究人员尚未探索这些模型的缩放法则,而且这些模型的性能通常落后于扩散模型,正如以下图像所示。性能差距表明,与大型语言模型相比,自回归模型在计算机视觉领域的能力尚未被充分探索。

一方面,传统的自回归模型需要明确的数据顺序,而另一方面,VAR模型或VAR框架重新考虑如何对图像进行排序,这是VAR与现有自回归方法的区别。通常,人类以层次化的方式创建或感知图像,先捕捉全局结构,然后是局部细节,这是一种多尺度、从粗糙到精细的方法,自然地为图像定义了一个顺序。进一步地,VAR框架的灵感来自多尺度设计,将图像的自回归学习定义为下一尺度预测,而不是传统的下一个token预测方法。VAR框架的方法从将图像编码为多尺度token地图开始,然后从1×1 token地图开始,逐步扩展分辨率。在每一步中,变换器预测下一个更高分辨率的token地图,条件为所有以前的token地图,这是VAR框架所谓的VAR建模。
VAR框架尝试利用GPT-2的变换器架构进行视觉自回归学习,结果在ImageNet基准测试中显著改进了自回归基线,达到FID 1.80和IS 356,并且推理速度提高了20倍。更有趣的是,VAR框架在FID和IS评分、可扩展性、推理速度和数据效率方面超越了DiT或扩散变换器框架。此外,VAR模型表现出与大型语言模型类似的强大缩放法则。
总之,VAR框架的贡献包括:
- 提出了一种新的视觉生成框架,使用多尺度自回归方法进行下一尺度预测,而不是传统的下一个token预测,重新定义了计算机视觉任务的自回归算法。
- 尝试验证自回归模型的缩放法则和零样本普遍适用性潜力,模仿大型语言模型的吸引人特性。
- 在视觉自回归模型的性能方面取得了突破,使GPT风格的自回归框架首次在图像生成任务中超越现有的扩散模型。
此外,讨论现有的幂律缩放法则对于机器学习模型至关重要。这些法则描述了数据集大小、模型参数、性能改进和计算资源之间的关系。首先,这些法则使得可以通过扩大模型规模、计算成本和数据大小来预测更大模型的性能,从而节省不必要的成本并根据原则分配训练预算。其次,缩放法则已经证明了性能的持续和非饱和增加。根据神经语言模型的缩放法则原理,许多大型语言模型体现了增加模型规模往往会带来更好的性能结果的原理。零样本普遍适用性另一方面指的是模型(尤其是大型语言模型)执行未经显式训练的任务的能力。在计算机视觉领域,人们对构建零样本和上下文学习能力的基础模型感兴趣。
语言模型依赖于WordPiece算法或字节对编码方法进行文本标记化。基于语言模型的视觉生成模型也严重依赖于将2D图像编码为1D token序列。早期工作如VQVAE展示了将图像表示为离散token的能力,具有中等的重构质量。VQVAE的继任者VQGAN框架结合了感知和对抗损失来提高图像保真度,并采用了解码器仅变换器来以标准的光栅扫描方式生成图像token。扩散模型另一方面长期被认为是视觉合成任务的领导者,提供了多样性和更好的生成质量。扩散模型的进步集中在改进采样技术、架构增强和更快的采样。潜在扩散模型在潜在空间中应用扩散,提高了训练效率和推理。扩散变换器模型用变换器架构取代了传统的U-Net架构,并被部署在最近的图像或视频合成模型中,如SORA和稳定扩散。
视觉自回归:方法论和架构

VAR框架的核心有两个离散的训练阶段。在第一阶段,多尺度量化自编码器(VQVAE)将图像编码为token地图,并实施复合重构损失进行训练。在上图中,嵌入是指将离散token转换为连续嵌入向量。在第二阶段,VAR模型中的变换器通过最小化交叉熵损失或最大化似然函数使用下一尺度预测方法进行训练。训练好的VQVAE然后产生VAR框架的token地图真值。
通过下一个token预测的自回归建模
对于给定的离散token序列,每个token都是来自大小为V的词汇表的整数,下一个token的自回归模型假设当前token的概率仅依赖于其前缀。假设单向token依赖允许VAR框架将序列的概率分解为条件概率的乘积。训练自回归模型涉及在数据集上优化模型,这个优化过程被称为下一个token预测,并允许训练好的模型生成新序列。进一步地,图像是2D连续信号,应用自回归建模方法需要几个前提条件。首先,图像需要被标记化为离散token。通常,量化自编码器被用来将图像特征图转换为离散token。其次,需要为token定义1D顺序用于单向建模。
在2D网格中的图像token被排列成1D序列,不像自然语言句子那样具有内在的从左到右的顺序,图像token的顺序必须被显式定义用于单向自回归学习。以前的自回归方法使用行主扫描、Z曲线或螺旋顺序等方法将2D token网格展平为1D序列。一旦token被展平,自回归模型从数据集中提取了一组序列,然后训练一个自回归模型来最大化下一个token的条件概率的乘积,使用下一个token预测方法。
通过下一尺度预测的视觉自回归建模
VAR框架重新构想了图像上的自回归建模,通过从下一个token预测转变为下一尺度预测方法,这个过程中,自回归单元不是单个token,而是一个整个token地图。模型首先将特征图量化为多尺度token地图,每个地图的分辨率都高于前一个,并最终与原始特征图的分辨率相匹配。进一步地,VAR框架开发了一个新的多尺度量化编码器来编码图像为多尺度离散token地图,这对于VAR学习是必要的。VAR框架采用与VQGAN相同的架构,但具有修改的多尺度量化层,如下图所示。

视觉自回归:结果和实验
VAR框架使用带有K个额外卷积的vanilla VQVAE架构和多尺度量化方案,并使用所有尺度的共享代码簿和32维的潜在维度。主要焦点在于VAR算法,因此模型架构设计被保持简单但有效。框架采用了与GPT-2模型类似的标准解码器仅变换器架构,唯一的修改是用自适应归一化(AdaLN)替换了传统的层归一化。对于条件类别合成,VAR框架实现了类嵌入作为起始token,并且是自适应归一化层的条件。
最先进的图像生成结果
当与现有的生成框架(包括GAN、BERT风格的掩码预测模型、扩散模型和GPT风格的自回归模型)相比时,VAR框架显示出有希望的结果,总结在以下表格中。

如图所示,VAR框架不仅能够达到最好的FID和IS评分,而且还展示了卓越的图像生成速度,相当于最先进的模型。此外,VAR框架还保持了令人满意的精度和召回率,确认了其语义一致性。但真正令人惊讶的是VAR框架在传统的自回归能力任务中的卓越性能,使其成为第一个超越扩散变换器模型的自回归模型,如下表所示。

零样本任务普遍适用性结果
对于内插和外插任务,VAR框架强制执行了掩码外的真值token,并让模型仅生成掩码内的token,没有将类别标签信息注入模型中。结果如以下图所示,VAR模型在下游任务中实现了可接受的结果,而无需调整参数或修改网络架构,展示了VAR框架的普遍适用性。

最后的思考
在本文中,我们讨论了一种新的视觉生成框架——视觉自回归建模(VAR),它1)在理论上解决了一些标准图像自回归模型中的问题,并2)使语言模型基于的自回归模型首次在图像质量、多样性、数据效率和推理速度方面超越了强大的扩散模型。在一方面,传统的自回归模型需要明确的数据顺序,而另一方面,VAR模型或VAR框架重新考虑如何对图像进行排序,这是VAR与现有自回归方法的区别。当VAR扩大到20亿参数时,开发人员观察到测试性能和模型参数或训练计算之间明显的幂律关系,皮尔森系数接近−0.998,表明性能预测的强大框架。这些缩放法则和零样本任务普遍适用性的可能性,如大型语言模型的标志,已经在我们的VAR变换器模型中初步验证。












