AI 模型与平台
SHOW-O:一个统一的Transformer,整合多模态理解和生成
近年来,大型语言模型(LLM)取得了显著的进步,这也激发了多模态大型语言模型(MLLM)的发展。早期的MLLM努力,如LLaVA、MiniGPT-4和InstructBLIP,展示了显著的多模态理解能力。为了将LLM集成到多模态领域,这些研究探索了将预训练的模态特定编码器(如CLIP)的特征投影到LLM的输入空间中,从而实现多模态理解和推理在Transformer骨架中。尽管MLLM有各种设计选择,例如视觉编码器、特征对齐适配器和数据集,但大多数模型的训练都遵循自回归生成范式,这已被证明对文本生成有效。尽管这些模型具有强大的多模态理解能力,但它们主要专注于视觉感知,缺乏生成多模态输出的能力,超出文本范围。
Transformer模型在自回归建模中取得了巨大的成功。在自然语言处理中,这种进步的灵感促使前人的研究直接将相同的自回归建模应用于学习图像像素的依赖关系,以生成图像和视频。例如,VideoPoet采用解码器仅Transformer架构来合成高质量的视频,从多模态输入中。最近,LlamaGen表明,大型语言模型架构,如Llama,可以自回归地对图像令牌进行建模,实现了不错的类条件图像生成性能。
在本文中,我们将讨论Show-O,一个统一的Transformer,它整合了多模态理解和生成。与完全自回归模型不同,Show-O统一了自回归和离散扩散建模,以适应性地处理各种和混合模态的输入和输出。统一模型灵活地支持广泛的视觉语言任务,包括视觉问答、文本到图像生成、文本引导的填补/外推和混合模态生成。在各种基准测试中,Show-O展示了与现有个体模型相比具有可比性或更好的性能,具有相同或更大的参数数量,突出了其作为下一代基础模型的潜力。
在这个框架中,模型的任务是预测添加到连续潜在表示中的高斯噪声。相比之下,其他模型,如D3PM、Mask-predict、ARDM和MaskGIT,使用离散腐蚀过程作为高斯扩散的替代。具体来说,图像被表示为一系列离散令牌,使用图像令牌器,每个令牌都与一个分类标签相关联。令牌的分布被转换为均匀分布,通过一个随机采样过程。在训练过程中,这些令牌中的一个部分被随机掩蔽,模型被训练为预测掩蔽令牌的原始值。在这项工作中,Show-O采用离散扩散建模进行视觉生成。
SHOW-O:统一多模态理解和生成
过去几年中,多模态智能的两个关键支柱——理解和生成——取得了显著的进步。对于多模态理解,多模态大型语言模型(MLLM)如LLaVA,展示了在视觉问答(VQA)等视觉语言任务中具有显著的能力。对于视觉生成,去噪扩散概率模型(DDPM)革新了传统的生成范式,在文本到图像/视频生成中取得了前所未有的性能。考虑到这些成就,探索连接它们的潜力是自然的。最近的工作尝试将来自这两个不同领域的专家模型组装成一个统一的系统,以处理多模态理解和生成。然而,现有的尝试通常涉及单独的理解和生成模型。例如,NExT-GPT采用基础语言模型进行多模态理解,但需要额外的预训练扩散模型进行图像生成。这引发了一个问题:一个单一的Transformer是否可以处理多模态理解和生成?
最近,Chameleon证明了这是可能的。具体来说,Chameleon使得不同模态的融合成为可能,以生成文本和图像令牌,通过自回归建模。虽然以自回归方式建模文本令牌是有意义的,但不清楚是否以相同的方式建模图像块或像素是最优的。自回归预测图像的主要瓶颈是需要大量的采样步骤,特别是在处理更高分辨率图像时。连续扩散模型在视觉生成中比自回归模型表现更好。
这导致我们探索是否可以将自回归和扩散建模集成到一个单一的Transformer中。Show-O设想了一个新的范式,其中文本被表示为离散令牌,通过自回归建模,而连续图像像素则使用去噪扩散建模。然而,将这两种不同的技术集成到一个网络中并非易事,主要是由于离散文本令牌和连续图像表示之间的差异。另外,扩散模型通常依赖于两个不同的模型:文本编码器和去噪网络。
为了解决这个问题,Show-O引入了一种新的统一模型,能够处理多模态理解和生成任务,使用混合自回归和扩散建模。Show-O建立在预训练LLM的基础上,利用其自回归建模能力进行基于文本的推理。受其他工作的启发,Show-O采用离散去噪扩散来对图像令牌进行建模,而不是连续表示。此外,Show-O固有地编码文本条件信息,消除了对额外文本编码器的需求。通过使用文本和图像令牌器,Show-O可以处理多种输入数据和任务,提供对视觉语言任务的答案,并使用离散去噪扩散生成图像。
Show-O在多个基准测试中展示了与个体模型相比具有可比性或更好的性能,具有相同或更大的参数数量。与自回归图像生成相比,Show-O框架需要大约20倍较少的采样步骤,使其固有地更快。此外,Show-O框架支持下游应用,如文本引导的填补和外推,无需微调,如下图所示。

Show-O还具有混合模态生成的潜力,例如视频关键帧生成与文本描述交错,显示出对长视频生成的前景。此外,Show-O框架研究了离散和连续图像表示对多模态理解的影响,提供了对未来统一模型设计的见解。
以下图表展示了Show-O框架与现有方法在各个领域的模型特征比较。Show-O作为一个统一模型,整合了多模态理解和生成的先进技术。

总之,本文的主要贡献如下:
- Show-O是一个统一模型,整合多模态理解和生成,使用单一Transformer。
- Show-O统一了自回归和离散扩散建模,在一个Transformer中,有效地处理文本和图像。
- Show-O框架在多模态理解和生成基准测试中表现出色,与个体基线模型具有可比性或更好的性能,具有相同或更大的参数数量。
- Show-O支持下游应用,如文本引导的填补和外推,无需微调,并展示了混合模态生成的潜力。
- Show-O探索了不同类型的表示,提供了对多模态理解的改进见解。
近年来,越来越多的研究专注于能够同时进行理解和生成的统一多模态语言模型。一些努力使用连续表示与文本令牌交错的自回归建模来生成图像。SEED-X提出了一种统一和多功能的基础系统,能够处理多模态理解和生成任务。在这种方法中,CLIP ViT编码器的连续图像表示与文本令牌结合,输入到大型语言模型(LLM)中,进行下一个单词预测和图像表示回归。Chameleon引入了一系列基于令牌的混合模态模型,能够同时理解和生成图像。这种方法将所有模态表示为离散令牌,使用统一的Transformer架构,并从头开始以端到端的方式训练模型。相比之下,Show-O也采用离散令牌来表示所有模态,但使用离散扩散过程代替自回归建模进行视觉生成。
SHOW-O:方法和架构
Show-O框架的主要目标是开发一个统一模型,整合自回归和扩散建模,用于联合多模态理解和生成。开发这样的统一模型带来了显著的挑战,核心问题围绕着:i)定义模型的输入/输出空间;ii)统一来自不同模态的各种类型的输入数据;iii)将自回归和扩散建模集成到单一Transformer中;iv)有效地训练这样的统一模型。
Show-O通过以下解决方案解决这些挑战:
- Show-O通过对文本和图像数据进行令牌化,构建输入/输出空间。
- Show-O引入了默认架构和统一提示策略,以结构化输入数据和模态。
- Show-O展示了如何在单一Transformer中集成自回归和扩散建模。
- Show-O提出了一种三阶段训练流程,有效地训练统一模型。
令牌化
鉴于提出的Show-O建立在预训练LLM的基础上,因此在离散空间中进行统一学习是自然的。通过维持一个包含离散文本和图像令牌的统一词汇表,Show-O的任务是预测离散令牌。
文本令牌化
Show-O基于预训练LLM,对文本数据进行令牌化,没有任何修改。
图像令牌化
遵循MAGVIT-v2,Show-O使用大约35M图像数据训练一个无查找量化器。量化器维持一个大小为8,192的代码簿,并将256×256分辨率的图像编码为16×16离散令牌。MAGVIT-v2被选中,因为其易于微调,使其适合作为具有时间压缩能力的视频令牌器,这是Show-O计划在未来探索的方面。另一种方法是使用不同的令牌器进行理解和生成。受现有研究的启发,Show-O还从预训练的MAGVIT-v2和CLIP-ViT编码器中提取连续图像表示,以探索多模态理解能力的改进。在以下章节中,默认的Show-O采用离散图像令牌作为输入,用于多模态理解和生成。

架构
Show-O继承了现有LLM的架构,没有任何架构修改,除了在每个注意力层前添加一个QK-Norm操作。Show-O使用预训练LLM的权重初始化,并通过纳入8,192个新的可学习嵌入(用于离散图像令牌)来扩大嵌入层的大小。与最先进的扩散模型不同,后者需要额外的文本编码器,Show-O固有地编码文本条件信息,用于文本到图像生成。
统一提示
为了在多模态理解和生成上进行统一学习,Show-O利用统一提示策略来格式化各种输入数据。给定一个图像-文本对(x, y),它首先被图像和文本令牌器分解为M个图像令牌和N个文本令牌。然后,令牌被形成为一个输入序列,根据任务类型,如下图所示。

通过采用这种提示设计,Show-O可以有效地对多模态理解、文本到图像生成和混合模态生成的各种输入数据进行编码。这种设置使得统一学习可以在这些任务的序列上无缝地运行。一旦训练完成,Show-O可以被提示处理广泛的视觉语言任务,包括视觉问答和文本到图像生成。
全注意力机制
与现有工作不同,仅自回归地对序列进行建模,Show-O引入了全注意力机制,使其能够以不同的方式对各种类型的信号进行建模。这种全面的注意力机制可以根据输入序列的格式自适应地在因果注意力和全注意力之间切换。下图展示了不同输入序列的全注意力示例。

具体来说,Show-O通过因果注意力处理序列中的文本令牌,而图像令牌则使用全注意力处理,使得每个令牌都可以与所有其他令牌进行全面交互。在多模态理解中,文本令牌可以关注所有先前的图像令牌,而在文本到图像生成中,图像令牌可以与所有先前的文本令牌交互。全注意力机制保留了预训练LLM的文本推理知识,并通过减少采样步骤提高了图像生成的效率。此外,它支持各种下游应用,如填补和外推,无需微调。当仅给出文本令牌时,机制默认为因果注意力。
SHOW-O:实验和结果
以下表格展示了Show-O在公共基准测试中的多模态理解能力,例如图像字幕和视觉问答任务。

当前版本的Show-O建立在Phi-1.5的基础上,因此Show-O的理解仅对应物,LLaVA-v1.5-Phi-1.5,作为直接基线。Show-O在所有评估指标中表现出与LLaVA-v1.5-Phi-1.5相似的性能,后者专门用于多模态理解。这表明Show-O框架具有统一多模态理解和生成的巨大潜力。在与仅理解模型(如InstructBLIP、Qwen-VL-Chat和mPLUG-Owl2)进行比较时,Show-O尽管具有更小的模型大小,但在POPE、MME、Flickr30k和VQAv2基准测试中取得了可比性的性能,在GQA基准测试中表现更好。当与具有显著更多参数的统一模型(如NExT-GPT-13B和Chameleon-34B)进行比较时,Show-O也在Flickr30k基准测试中取得了强劲的性能,在VQAv2基准测试中表现更好。
考虑到这些有希望的结果,Show-O被视为潜在的下一代基础模型,以统一理解和生成。这些结果还表明了扩大Show-O以达到最先进性能的潜力。
定性比较
我们展示了与扩散模型(如SDv1.5、SDXL)和自回归模型(如LlamaGen)以及统一模型(如LWM和SEED-X)的定性比较,如下图所示。

Show-O展示了生成真实图像的能力,图像内容在短文本和长文本提示中保持一致。与SDv1.5和LlamaGen相比,Show-O表现出更好的视觉质量和更强的图像-文本对齐。例如,在第二列中,SDv1.5和LlamaGen都未能完全理解文本提示,缺少了“日落”和“蓝色圆顶”等属性。在与SDXL的比较中,Show-O提供了可比的视觉质量和对齐,如“拉力赛”和“令人惊叹的对比与鲜艳的日落”等例子所示。

文本引导的填补和外推
Show-O天然地支持文本引导的填补和外推,无需任何微调。以下图表展示了几个例子。

在图表的顶部,给定一个输入图像和一个填补掩码,Show-O可以将红色手推车转换为蓝色跑车,具有流线型曲线和色调窗户,基于用户提供的文本提示。Show-O还可以根据给定的文本提示水平或垂直地外推原始图像。例如,在第二行中,Show-O外推图像,添加新的对象,如“红色野花”。填补和外推区域中的像素保持与原始图像的一致性。这些例子清晰地展示了Show-O相对于自回归模型在下游应用中的固有优势。
最后的思考
在本文中,我们讨论了Show-O,一个统一的Transformer,整合了多模态理解和生成。与完全自回归模型不同,Show-O统一了自回归和离散扩散建模,以适应性地处理各种和混合模态的输入和输出。统一模型灵活地支持广泛的视觉语言任务,包括视觉问答、文本到图像生成、文本引导的填补/外推和混合模态生成。在各种基准测试中,Show-O展示了与现有个体模型相比具有可比性或更好的性能,具有相同或更大的参数数量,突出了其作为下一代基础模型的潜力。在这个框架中,模型的任务是预测添加到连续潜在表示中的高斯噪声。相比之下,其他模型,如D3PM、Mask-predict、ARDM和MaskGIT,使用离散腐蚀过程作为高斯扩散的替代。Show-O是第一个统一自回归和离散扩散建模的模型,能够以不同的方式处理不同的模态。广泛的实验结果表明,Show-O在广泛的视觉语言任务中表现出与个体专家模型相比具有可比性或更好的性能,突出了其作为下一代基础模型的潜力。












