AI 模型与平台
迷你双子星:加速多模态视觉语言模型的发展
大型语言模型的进步显著加速了自然语言处理(NLP)的发展。变换器框架的引入是一个里程碑,促进了新一代语言模型的发展,包括OPT和BERT,这些模型展现出深刻的语言理解。此外,GPT(生成式预训练变换器)模型的出现开启了新的范式,采用自回归建模,建立了强大的语言预测和生成方法。像GPT-4、ChatGPT、Mixtral、LLaMA等语言模型的出现进一步推动了快速的发展,每个模型都在复杂语言处理任务中表现出更好的性能。在现有的方法中,指令调优已成为一种关键技术,用于改进预训练的大型语言模型的输出,而这些模型与特定工具的集成也凸显了它们的适应性和未来应用的潜力,这些应用远远超出了传统的基于文本的LLM处理。
此外,自然语言处理和计算机视觉模型的融合导致了视觉语言模型(VLMs)的出现,这些模型结合语言和视觉模型来实现跨模式的理解和推理能力。视觉和语言模型的集成和出现在需要语言处理和视觉理解的任务中发挥了至关重要的作用。像CLIP这样的革命性模型的出现进一步弥合了视觉任务和语言模型之间的差距,证明了跨模式应用的可行性和实用性。最近的框架,如LLaMA和BLIP,利用定制的指令数据来制定高效的策略,展现了模型的强大能力。此外,最近的研究将重点放在将大型语言模型与图像输出相结合,利用图像检索方法来产生图像输出和交错文本。

尽管视觉语言模型在基本推理和视觉对话方面取得了快速进展,但高级模型(如GPT-4)和视觉语言模型之间仍然存在显著的性能差距。迷你双子星是尝试通过三个方面来缩小这一差距:VLM引导的生成、高质量数据和高分辨率视觉标记。为了增强视觉标记,迷你双子星框架提议使用额外的视觉编码器来进行高分辨率的细化,而不增加视觉标记的数量。迷你双子星框架还构建了高质量的数据集,以促进图像的精确理解和基于推理的生成。总体而言,迷你双子星框架旨在发掘视觉语言模型的潜力,并同时赋予现有的框架图像推理、理解和生成能力。这个文章旨在深入探讨迷你双子星框架,并探索其机制、方法、架构以及与最先进框架的比较。
迷你双子星:加速多模态视觉语言模型的发展
多年来,大型语言模型已经演变,并具有了显著的多模态能力,成为当前视觉语言模型的重要组成部分。然而,大型语言模型和视觉语言模型之间仍然存在差距,最近的研究正在寻找将视觉与大型语言模型结合的方法,使用图像和视频。对于视觉任务本身,图像分辨率是一个至关重要的元素,需要明确地表示周围环境,尽量减少视觉幻觉。为了弥合这一差距,研究人员正在开发模型来提高当前视觉语言模型的视觉理解,主要有两种方法:增加分辨率和增加视觉标记的数量。虽然增加视觉标记的数量和使用更高分辨率的图像可以提高视觉理解,但这种提高往往伴随着计算需求和相关成本的增加,特别是在处理多个图像时。另外,现有模型的能力、现有数据的质量和适用性仍然不足以支持加速的开发过程,这让研究人员面临着“如何以可接受的成本加速视觉语言模型的发展”的问题。
迷你双子星框架是尝试回答这个问题的,它试图从三个方面探索视觉语言模型的潜力:VLM引导的生成或扩展应用、高质量数据和高分辨率视觉标记。首先,迷你双子星框架实现了ConvNet架构来高效地生成更高分辨率的候选项,同时保持视觉细节和视觉标记的数量。迷你双子星框架将公开可用的高质量数据集整合在一起,尝试提高数据质量,并将这些增强与最先进的生成和大型语言模型相结合,试图提高VLM的性能并改善用户体验。迷你双子星框架采用的多方面策略使其能够探索视觉语言模型的隐藏能力,并在明显的资源约束下实现了显著的进步。

一般来说,迷你双子星框架采用了任何到任何的范式,因为它能够处理文本和图像作为输入和输出。在特定方面,迷你双子星框架引入了一个高效的管道来增强输入图像的视觉标记,并具有一个双编码器系统,包括两个编码器:第一个编码器用于高分辨率图像,第二个编码器用于低质量视觉嵌入。在推理过程中,编码器通过注意力机制工作,其中低分辨率编码器生成视觉查询,而高分辨率编码器提供关键和值作为参考。为了增强数据质量,迷你双子星框架收集和生成更多的数据,基于公共资源,包括任务导向的指令、生成相关数据和高分辨率响应,数据量的增加和质量的提高提高了模型的整体性能和能力。此外,迷你双子星框架支持同时进行文本和图像生成,这是由于视觉语言模型与先进的生成模型的集成。
迷你双子星:方法和架构
在其核心,迷你双子星框架概念上很简单,包括三个组件。
- 框架采用双视觉编码器来提供低分辨率视觉嵌入和高分辨率候选项。
- 框架提议实施patch信息挖掘,以在低分辨率视觉查询和高分辨率区域之间进行挖掘。
- 迷你双子星框架利用大型语言模型来结合文本和图像,用于同时进行生成和理解。
双视觉编码器
迷你双子星框架可以处理文本和图像输入,既可以单独处理,也可以同时处理。如以下图像所示,迷你双子星框架首先使用双线性插值来从高分辨率图像生成低分辨率图像。

然后,框架处理这些图像并将它们编码为多网格视觉嵌入,通过两个并行的图像流。更具体地说,迷你双子星框架保持传统的低分辨率流的管道,并采用CLIP预训练的视觉变换器来编码视觉嵌入,这使得模型能够保留视觉patch之间的长距离关系,以便在大型语言模型中进行后续的交互。对于高分辨率流,迷你双子星框架采用基于CNN的编码器来进行自适应和高效的高分辨率图像处理。
patch信息挖掘
双视觉编码器生成低分辨率嵌入和高分辨率特征后,迷你双子星框架提议实施patch信息挖掘,以扩展视觉语言模型的潜力,增强视觉标记。为了保持大型语言模型中的视觉标记的数量,迷你双子星框架将低分辨率视觉嵌入作为查询,并从高分辨率特征候选项中检索相关的视觉线索,框架将高分辨率特征映射作为关键和值。

如上图所示,公式概括了视觉线索的细化和合成过程,这导致了高级视觉标记的生成,用于后续的大型语言模型处理。该过程确保框架能够将每个查询的挖掘限制在高分辨率特征映射的相应子区域内,具有像素级的特征计数,从而提高效率。由于这种设计,迷你双子星框架能够在不增加视觉标记数量的情况下提取高分辨率特征细节,并在计算可行性和细节丰富性之间保持平衡。
文本和图像生成
迷你双子星框架将视觉标记和输入文本标记连接起来,作为输入到大型语言模型中,用于自回归生成。与传统的视觉语言模型不同,迷你双子星框架支持仅文本和文本-图像生成作为输入和输出,即任何到任何的推理。它是由于该框架出色的图像-文本理解和推理能力,迷你双子星能够生成高质量的图像。与最近的工作不同,最近的工作关注生成模型和大型语言模型之间的文本嵌入的域间差距,迷你双子星框架尝试优化语言提示的域间差距,通过将用户指令翻译成高质量的提示,以在潜在扩散模型中产生上下文相关的图像。此外,为了更好地理解指令微调和跨模式对齐,迷你双子星框架从公共可用的高质量数据集中收集样本,并使用GPT-4 Turbo框架进一步构建一个13K指令遵循数据集,以支持图像生成。

迷你双子星:实验和结果
为了评估其性能,迷你双子星框架使用预训练的ConvNext-L框架作为高分辨率视觉编码器,并使用CLIP预训练的视觉变换器作为低分辨率视觉编码器。为了确保训练效率,迷你双子星框架保持两个视觉编码器固定,并优化patch信息挖掘的投影器在所有阶段,并在指令调优阶段优化大型语言模型。

以下表格比较了迷你双子星框架与最先进模型在不同设置下的性能,并考虑了私有模型。如可以观察到的,迷你双子星框架在一系列LLM中始终优于现有的框架,在正常分辨率下表现出色,并在配置Gemma-2B时在高效模型类别中表现出更好的性能。此外,当使用更大的大型语言模型时,迷你双子星框架的可扩展性是显著的。

为了评估其在高分辨率和扩展视觉标记下的性能,实验使用低分辨率视觉编码器的输入大小为672,视觉编码器的输入大小为1536。如前所述,高分辨率视觉编码器的主要目的是提供高分辨率候选信息。如可以观察到的,迷你双子星框架在与最先进框架的比较中表现出更好的性能。

此外,为了评估迷你双子星框架在实际场景中的视觉理解能力,开发人员将模型应用于各种推理和理解任务,如以下图像所示。如可以观察到的,迷你双子星框架能够解决一系列复杂的任务,这得益于patch信息挖掘和高质量数据的实施。但更令人印象深刻的是,迷你双子星框架表现出对细节的敏锐感知,这超出了简单的识别能力,并描述了错综复杂的元素。


以下图像提供了迷你双子星框架的生成能力的全面评估。

与最近的模型(如ChatIllusion和AnyGPT)相比,迷你双子星框架表现出更强的多模态理解能力,使其能够生成更符合输入指令的文本到图像字幕,并产生具有更强概念相似性的图像到文本答案。更令人印象深刻的是,迷你双子星框架仅使用文本训练数据就能生成高质量的内容,展现了其强大的语义解释和图像-文本对齐能力。

总结
在这篇文章中,我们讨论了迷你双子星,这是一个强大且流线型的多模态视觉语言模型框架。迷你双子星框架的主要目标是利用高质量数据、战略性的框架设计和扩展的功能范围来发掘视觉语言模型的潜力。迷你双子星是尝试通过三个方面来缩小视觉语言模型和更先进模型之间的差距:VLM引导的生成、高质量数据和高分辨率视觉标记。为了增强视觉标记,迷你双子星框架提议使用额外的视觉编码器来进行高分辨率的细化,而不增加视觉标记的数量。迷你双子星框架还构建了高质量的数据集,以促进图像的精确理解和基于推理的生成。总体而言,迷你双子星框架旨在发掘视觉语言模型的潜力,并同时赋予现有的框架图像推理、理解和生成能力。












