AI 模型与平台
YOLO-World:实时开放词汇物体检测
物体检测一直是计算机视觉行业的基本挑战,应用于机器人、图像理解、自动驾驶和图像识别等领域。近年来,人工智能领域的突破性工作,特别是深度神经网络的发展,显著推进了物体检测的发展。然而,这些模型具有固定的词汇表,仅限于检测COCO数据集中的80个类别的物体。这一限制源于训练过程,物体检测器被训练为仅识别特定的类别,因此限制了它们的适用性。
为了克服这一限制,我们引入了YOLO-World,一种创新性的方法,旨在增强YOLO(You Only Look Once)框架的开放词汇检测能力。这种方法通过在大规模数据集上预训练框架,并实施视觉语言建模方法来实现。具体来说,YOLO-World采用了可重参数化的视觉语言路径聚合网络(RepVL-PAN)和区域文本对比损失来促进语言和视觉信息之间的交互。通过RepVL-PAN和区域文本对比损失,YOLO-World可以在零样本设置中准确检测广泛的物体,表现出卓越的开放词汇分割和物体检测任务性能。
本文旨在提供对YOLO-World技术基础、模型架构、训练过程和应用场景的全面理解。让我们深入探讨。
YOLO-World:实时开放词汇物体检测
YOLO或You Only Look Once是计算机视觉行业中最流行的物体检测方法之一。凭借其令人难以置信的速度和效率,YOLO机制的出现彻底改变了机器在图像和视频中实时检测特定物体的方式。传统的物体检测框架采用两步物体检测方法:在第一步中,框架提出可能包含物体的区域,在下一步中,框架对物体进行分类。YOLO框架则将这两个步骤整合到一个神经网络模型中,这种方法允许框架只需查看图像一次即可预测物体及其在图像中的位置,因此得名YOLO或You Only Look Once。
此外,YOLO框架将物体检测视为回归问题,并直接从完整图像中预测类别概率和边界框。这种方法的实施不仅增加了检测过程的速度,还增强了模型从复杂和多样化数据中泛化的能力,使其成为适合实时应用的选择,例如自动驾驶、速度检测或车牌识别。近年来,深度神经网络的显著发展也在物体检测框架的发展中发挥了重要作用,但物体检测框架的成功仍然受到限制,因为它们只能检测有限词汇表中的物体。这主要是因为一旦物体类别在数据集中被定义和标记,框架中的训练检测器只能识别这些特定的类别,因此限制了其适用性和在实时和开放场景中部署物体检测模型的能力。
最近开发的视觉语言模型采用语言编码器中的蒸馏词汇知识来解决开放词汇检测问题。虽然这些框架在开放词汇检测方面的性能优于传统的物体检测模型,但它们仍然受到词汇多样性有限的训练数据的限制。另外,一些框架在大规模训练开放词汇物体检测器,并将训练物体检测器分类为区域级视觉语言预训练。然而,这种方法仍然难以实时检测物体,主要是由于两个原因:边缘设备的复杂部署过程和重大的计算需求。然而,这些框架已经展示了使用大型检测器进行开放识别的积极结果。
YOLO-World框架旨在实现高效的开放词汇物体检测,并探索大规模预训练方法来提高传统YOLO检测器在开放词汇物体检测方面的效率。与之前的物体检测工作相比,YOLO-World框架表现出显著的效率,具有高推理速度,可以轻松部署在下游应用中。YOLO-World模型遵循传统的YOLO架构,并利用预训练的CLIP文本编码器来编码输入文本。此外,YOLO-World框架还包括可重参数化的视觉语言路径聚合网络(RepVL-PAN)组件,以连接图像和文本特征,增强视觉语义表示。在推理阶段,框架移除文本编码器,并将文本嵌入重新参数化为RepVL-PAN权重,实现高效部署。框架还包括区域文本对比学习,以研究传统YOLO模型的开放词汇预训练方法。区域文本对比学习方法将图像文本数据、接地数据和检测数据统一为区域文本对。基于此,YOLO-World框架在区域文本对上进行预训练,展示了卓越的开放大词汇检测能力。另外,YOLO-World框架还探索了一种提示-然后-检测范式,以增强实时和实世界场景中开放词汇物体检测的效率。
如以下图所示,传统的物体检测器专注于固定词汇表的检测,具有预定义的类别,而开放词汇检测器则通过编码用户提示来检测物体。相比之下,YOLO-World的提示-然后-检测方法首先通过编码用户提示来构建离线词汇表(根据需要变化的词汇表),允许检测器在实时中解释离线词汇表,而无需重新编码提示。

YOLO-World:方法和架构
区域文本对
传统的物体检测框架,包括YOLO家族的物体检测器,都是使用实例注释来训练的,实例注释包含类别标签和边界框。相比之下,YOLO-World框架将实例注释重新表述为区域文本对,其中文本可以是物体的描述、名词短语或类别名称。值得注意的是,YOLO-World框架同时采用文本和图像作为输入和输出,预测带有相应物体嵌入的边界框。
模型架构
在其核心,YOLO-World模型由文本编码器、YOLO检测器和可重参数化的视觉语言路径聚合网络(RepVL-PAN)组件组成,如下图所示。

对于输入文本,文本编码器组件将文本编码为文本嵌入,然后从输入图像中提取多尺度特征。YOLO检测器组件中的图像检测器然后利用这些特征来预测边界框和类别概率。可重参数化的视觉语言路径聚合网络(RepVL-PAN)组件然后利用文本和图像特征之间的跨模态融合来增强视觉语义表示。
YOLO检测器
YOLO-World模型建立在现有的YOLOv8框架之上,包含Darknet骨干组件作为其图像编码器,一个用于物体嵌入和边界框回归的头部,以及一个用于多尺度特征金字塔的路径聚合网络(PAN)组件。
文本编码器
对于给定的文本,YOLO-World模型通过采用预训练的CLIP Transformer文本编码器来提取相应的文本嵌入,具有特定的名词数量和嵌入维度。YOLO-World框架采用CLIP文本编码器的主要原因是它在连接文本和视觉对象方面提供了更好的视觉语义性能,显著优于传统的仅文本语言编码器。然而,如果输入文本是字幕或引用表达式,YOLO-World模型则采用更简单的n-gram算法来提取短语。这些短语然后被输入到文本编码器中。
文本对比头
早期的物体检测模型采用了解耦头部,YOLO-World框架也采用了具有双3×3卷积的解耦头部来回归物体嵌入和边界框。YOLO-World框架采用文本对比头部来获得物体文本相似度,使用L2归一化方法和文本嵌入。此外,YOLO-World模型还采用了仿射变换方法,具有偏移因子和可学习的缩放因子,L2归一化和仿射变换增强了模型在区域文本训练期间的稳定性。
在线词汇训练
在训练阶段,YOLO-World模型为每个马赛克样本构建在线词汇表,马赛克样本由4个图像组成。模型对马赛克图像中包含的所有正面名词进行采样,并从相应的数据集中随机采样一些负面名词。每个样本的词汇表最多包含n个名词,缺省值为80。
离线词汇推理
在推理阶段,YOLO-World模型采用提示-然后-检测策略,使用离线词汇表来进一步增强模型的效率。用户首先定义一系列自定义提示,可能包括类别或字幕。YOLO-World模型然后通过使用文本编码器来编码这些提示,获得离线词汇嵌入。因此,离线词汇表在推理中帮助模型避免了每次输入的计算,并允许模型根据需要灵活地调整词汇表。
可重参数化视觉语言路径聚合网络(RevVL-PAN)
以下图所示是提出的可重参数化视觉语言路径聚合网络的结构,遵循自上而下和自下而上的路径来建立多尺度特征金字塔。

为了增强文本和图像特征之间的交互,YOLO-World模型提出了图像池化注意力和文本引导的CSPLayer(跨阶段部分层),最终目标是提高视觉语义表示以实现开放词汇能力。在推理期间,YOLO-World模型将离线词汇嵌入重新参数化为线性或卷积层的权重,实现高效部署。
如上图所示,YOLO-World模型在自上而下或自下而上融合后使用CSPLayer,并将文本引导融入多尺度图像特征中,形成文本引导的CSPLayer,从而扩展CSPLayer。对于给定的图像特征和相应的文本嵌入,模型采用最后一个瓶颈块后的最大sigmoid注意力来聚合文本特征到图像特征中。更新的图像特征然后与跨阶段特征连接,作为输出。
继续,YOLO-World模型通过引入图像池化注意力层来聚合图像特征以更新文本嵌入,增强文本嵌入以图像感知信息。与直接在图像特征上使用跨注意力不同,模型利用多尺度特征上的最大池化来获得3×3区域,得到27个补丁令牌,模型在下一步更新文本嵌入。
预训练方案
YOLO-World模型遵循两种主要的预训练方案:从区域文本对比损失中学习和使用图像文本数据的伪标签。对于主要的预训练方案,模型输出物体预测以及相应的注释,给定文本和马赛克样本。YOLO-World框架通过遵循任务分配的标签分配来匹配预测与地面真实注释,并为每个正面预测分配一个文本索引,作为分类标签。另一方面,使用图像文本数据的伪标签预训练方案提出使用自动标签方法代替使用图像文本对来生成区域文本对。提出的标签方法包括三个步骤:提取名词短语、伪标签和过滤。第一步使用n-gram算法从输入文本中提取名词短语,第二步采用预训练的开放词汇检测器为给定的名词短语生成伪边界框,第三步和最后一步采用预训练的CLIP框架来评估区域文本对和文本图像对的相关性,之后模型过滤低相关性的伪图像和注释。
YOLO-World:结果
一旦YOLO-World模型被预训练,它就会直接在LVIS数据集上进行评估,在零样本设置中,LVIS数据集包含超过1200个类别,远远超过现有框架用于测试大词汇检测性能的预训练数据集。以下图所示是YOLO-World框架在LVIS数据集上零样本设置中的性能,与一些现有的最先进的物体检测框架相比。

如图所示,YOLO-World框架在推理速度和零样本性能方面优于大多数现有的框架,甚至优于像Grounding DINO、GLIP和GLIPv2这样的框架,这些框架包含更多的数据。总体而言,结果表明,小型物体检测模型,如YOLO-World-S,只有1300万个参数,可以用于视觉语言任务的预训练,具有卓越的开放词汇能力。
最后的思考
在本文中,我们讨论了YOLO-World,一种创新性的方法,旨在通过预训练框架在大规模数据集上,并实施视觉语言建模方法来增强YOLO或You Only Look Once框架的开放词汇检测能力。具体来说,YOLO-World框架提出实施可重参数化的视觉语言路径聚合网络(RepVL-PAN)和区域文本对比损失,以促进语言和视觉信息之间的交互。通过实施RepVL-PAN和区域文本对比损失,YOLO-World框架能够在零样本设置中准确高效地检测广泛的物体,表现出卓越的开放词汇分割和物体检测任务性能。












