AI 模型与平台
费雷特:在引用和接地任务中表现出色的性能
使视觉语言学习模型能够理解空间仍然是一个核心的研究挑战。这种理解支撑着两个至关重要的能力:接地和引用。引用使模型能够准确地解释特定区域的语义,而接地则涉及使用语义描述来定位这些区域。
开发人员引入了费雷特,一种多模态大型语言模型(MLLM),能够理解图像中任意粒度或形状的空间引用,并能够准确地接地开放词汇的描述。费雷特使用一种新型的混合表示法,将连续的特征与离散的坐标结合起来,以表示图像区域。其空间感知的视觉采样器可以处理不同形状的区域输入,如自由形状、边界框和点。
费雷特的方法使其能够在经典的接地和引用任务中表现出色,并在定位要求高的多模态通信中超越其他MLLM。这篇文章深入探讨了费雷特的架构和方法论,突出了其在各种多模态语言任务中的出色性能。让我们进一步探讨这一点。
费雷特:在引用和接地任务中表现出色的性能
在模型中,引用是一种能力,允许模型准确地理解给定区域的语义,而接地则使模型能够使用给定的语义描述来定位这些区域。虽然它们可能在各自的任务中有所不同,但引用和接地都有相同的基本概念:空间语义和信息的对齐。然而,尽管它们共享相同的概念,现有的模型分别学习接地和引用。虽然这种方法有效,但它在实现类似人类的能力方面存在障碍,因为人类可以从一个任务中学习,并将这些知识无缝地应用于其他任务,并且可以轻松地将接地/引用能力与推理和日常对话相结合。费雷特框架从现有的MLLM框架中汲取了这一差距的灵感,并研究了三个主要问题:
-
如何在框架中统一接地和引用能力,以及它们的联合如何相互受益?
-
人类使用什么样的区域类型,如盒子、点、涂鸦、自由形状来引用?如何表示这些多样化的区域?
-
如何使接地和引用指令遵循、强健和开放词汇,这对于它们的实际和实时应用至关重要?
费雷特框架是一种新型的引用和接地多模态大型语言模型,旨在解决这些问题。费雷特框架选择多模态大型语言模型作为其基础,因为它们具有出色的全球视野和语言理解能力。为了统一接地和引用能力,费雷特框架以自然语言数字形式表示区域的坐标。然而,在实践中,使用坐标来表示自由形状是低效的,并且会阻碍模型学习区域和坐标之间的相关性的能力。为了解决这个问题,费雷特框架采用了一种空间感知的视觉采样器,可以处理不同形状的区域输入,如自由形状、边界框和点。
费雷特:方法论和架构
混合区域表示
点、盒子和自由形状是语言模型在引用特定区域时使用的三种主要格式。另一方面,点和盒子格式可以通过坐标准确地表示,但映射自由形状更具挑战性。自由形状可以包括各种区域,包括掩码、多边形和涂鸦。使用坐标来描述自由形状是一项复杂的任务,它阻碍了模型学习区域和坐标之间的相关性的能力。此外,使用坐标来表示自由形状在计算上是昂贵的,并且不清楚。
为了解决这个问题并在所有三个格式中进行泛化,费雷特框架提出了一个混合区域表示法,将连续的视觉特征与离散的坐标相结合,以引用特定区域。对于连续的视觉特征,给定一个区域,费雷特框架首先构建一个二进制掩码,其大小与图像相同,并在目标区域内标记为1,在区域外标记为0。然后,模型将二进制掩码与提取的图像特征图一起发送到空间感知的视觉采样器。
架构
费雷特模型的架构由三个主要组件组成:
-
图像编码器以提取图像嵌入。
-
空间感知视觉采样器以提取区域的连续特征。
-
大型语言模型以联合建模文本、图像和区域特征。
图像首先被输入到预训练的视觉编码器中以提取图像嵌入。对于文本输入,框架首先使用预训练的LLM标记器对文本序列进行标记,然后将这些标记投影到文本嵌入中。对于引用的区域,费雷特在区域名称后追加一个特殊标记和坐标作为连续特征的占位符。如果区域的名称未知或由于包含多个对象而难以描述,框架只使用区域名称或面积。
GPT辅助视觉数据生成
多模态大型语言模型的对话指令调优数据至关重要,因为它们不仅有助于将现有数据集转换为模板,还有助于模型理解人类的意图并生成适当的响应。多数MLLM使用少次提示方法来获得视觉指令调优数据,其中模型提供图像中场景的文本描述以及人类注释的对话作为少次示例。然而,现有的指令调优方法主要关注描述整个图像,而没有明确指定空间相关信息。费雷特框架强调了基于区域的知识,以三种方式收集引用和接地指令调优数据:
-
除了使用全局标题和对象外,框架还提供符号场景描述,描述区域标题和对象之间的物理关系以及它们的坐标。
-
对于人类注释的对话,框架在输入或输出中在可接地对象或区域后添加坐标,或者两者都添加,重点关注特定区域的对话,帮助语言模型隐式地遵循类似的模式进行新对话生成。
-
可能由框架生成的对话不遵循示例和系统提示的规则和模式。为了解决这个问题,框架再次使用语言模型来改进模型最初生成的对话。
空间负采样
以前的研究已经证明,多模态大型语言模型在响应是或否问题时有很高的概率出现幻觉。为了确保费雷特模型在类似情况下不会出现幻觉,框架采用空间负采样方法,包括图像条件类别定位和语义条件类别定位。两种方法都要求模型定位特定的对象类别,以使模型能够识别图像中某些对象的缺失。
费雷特:结果和实验
为了分析其性能,费雷特框架在传统的接地和引用基准测试中进行了评估,然后在更复杂的多模态聊天任务中进行了评估,以测试其引用和接地能力。
模型的引用理解能力通过准确理解给定图像或问题中引用的区域的语义来评估。为了衡量模型的准确性,首先考虑对象,这是最基本的语义,因为它不仅是基本的,还很容易定义。为了模拟人类级别的多样性,框架用自由形状、盒子和点替换图像中对象的位置。对于自由形状,模型在接地真实对象内随机生成笔画以进行模拟。对于盒子,费雷特框架使用LVIS组件提供的接地真实边界框。最后,对于点,模型在接地真实对象内随机采样一个点,该点也接近接地真实对象的边界。三种类型的引用结果如以下图所示。
费雷特框架在引用对话任务中表现出色,为与不同视觉学习任务的集成(尤其是那些具有接地输出的任务)留下了空间。为了评估其接地能力,费雷特框架首先将自己置于具有生成范式的基准视觉接地任务中。然后,它评估其在接地字幕任务中的能力,以衡量区域和单词之间的对齐。
在视觉接地任务中,框架旨在将语言查询接地到图像的对齐区域中,如下图所示,费雷特框架在所有基准测试中表现出色,其性能与专用微调方法的性能相当。
对于接地字幕任务,模型需要生成字幕,然后将生成的名词短语接地到图像区域中。模型的最终预测由三个组件组成:视觉区域(盒子)、字幕和盒子与单词之间的接地对齐。结果如以下图所示,框架的性能与最先进的方法相当。
最后,多模态聊天是MLLM中最理想的能力之一,现有的MLLM主要评估详细描述、对话和复杂推理,并将语言模型作为评判者。然而,由于没有数据集评估具有强制引用或接地操作的多模态聊天,因此留下了一个空白。为了弥补这一空白,费雷特框架涵盖了三个基于区域的问题,以评估其在多模态聊天任务中的引用和接地能力。结果如以下图所示。
最后的思考
在这篇文章中,我们讨论了费雷特,一种多模态大型语言模型,展示了出色的接地和引用能力。费雷特框架可以引用图像区域,无论其形状如何,并且可以为模型预测的文本建立接地。费雷特采用空间感知的视觉采样器,能够处理不同形状显示的不同稀疏度,以提取多样化区域的连续特征。因此,费雷特框架可以输入多样化的区域输入,包括自由形状、边界框和点。












