Anderson 视角

在计算机视觉中分离“融合”的人

mm
将 Unite.AI 添加到您在 Google 上的首选来源

新加坡现代汽车集团创新中心的一篇新论文提出了一种方法,用于在计算机视觉中分离“融合”的人,即那些被物体识别框架识别为一个人,但实际上是两个或多个人的情况,例如“拥抱”或“站在后面”的姿势,这些情况下,系统无法区分两个人的身份,将他们混淆为一个人或实体。

两个人的融合,但这不是语义分割中的好事。这里我们看到论文的新系统在复杂和具有挑战性的图像中实现了最先进的结果,实现了人体的个体化。来源:https://arxiv.org/pdf/2210.03686.pdf

两个人的融合,但这不是语义分割中的好事。这里我们看到论文的新系统在复杂和具有挑战性的图像中实现了最先进的结果,实现了人体的个体化。 来源:https://arxiv.org/pdf/2210.03686.pdf

这是一个值得注意的问题,近年来在研究社区中引起了广泛关注。解决这个问题可以在不需要大量人工标注的情况下,改进文本到图像系统(如Stable Diffusion)中的人体个体化,这些系统经常将人“融合”在一起,特别是在提示姿势需要多个人时。

接受恐怖——文本到图像模型,如DALL-E 2和Stable Diffusion(均在上面),在表示人体时,特别是在人体靠近时,会遇到困难。

接受恐怖——文本到图像模型,如DALL-E 2和Stable Diffusion(均在上面),在表示人体时,特别是在人体靠近时,会遇到困难。

虽然像DALL-E 2和Stable Diffusion这样的生成模型(至少在DALL-E 2的情况下,目前尚不清楚)不使用语义分割或物体识别,但这些人体的怪异组合目前无法通过应用这些上游方法来解决,因为最先进的物体识别库和资源在区分人体方面并不比基于CLIP的潜在扩散模型的工作流更好。

为了解决这个问题,这篇新论文——题为《人类不需要标记更多的人:用于遮挡人实例分割的复制和粘贴》——改进和扩展了最近的“剪切和粘贴”方法,用于半合成数据,实现了新的最先进的结果,即使在最具挑战性的源材料中也是如此。

新的遮挡复制和粘贴方法当前领先于该领域,甚至超过了以前的框架和方法,这些方法以更复杂和更专门的方式解决了这个挑战,例如专门为遮挡建模。

新的遮挡复制和粘贴方法当前领先于该领域,甚至超过了以前的框架和方法,这些方法以更复杂和更专门的方式解决了这个挑战,例如专门为遮挡建模。

剪切掉它!

该修订方法——称为《遮挡复制和粘贴》——源自2021年由Google Research领导的《简单复制和粘贴》论文,该论文提出,将提取的物体和人在多样化的源训练图像中叠加,可以提高图像识别系统区分每个实例的能力。

来自2021年Google Research领导的论文“简单复制和粘贴是一种强大的实例分割数据增强方法”,我们看到一个照片中的元素“迁移到”其他照片中,目标是训练一个更好、更直观的图像识别模型。来源:https://arxiv.org/pdf/2012.07177.pdf

来自2021年Google Research领导的论文“简单复制和粘贴是一种强大的实例分割数据增强方法”,我们看到一个照片中的元素“迁移到”其他照片中,目标是训练一个更好、更直观的图像识别模型。 来源:https://arxiv.org/pdf/2012.07177.pdf

新方法在此基础上添加了限制和参数,类似于将图像放入一个“篮子”中,里面充满了可以“转移到”其他图像的候选项,基于几个关键因素。

OC&P的概念工作流程。

OC&P的概念工作流程。

控制元素

这些限制因素包括复制和粘贴发生的概率,确保该过程不会一直发生,这将产生一种“饱和”效果,会破坏数据增强;图像中的“篮子”中会有多少个图像,更多的“段”可能会提高实例的多样性,但会增加预处理时间;以及范围,决定了会将多少个图像粘贴到“宿主”图像中。

关于后者,该论文指出“我们需要足够的遮挡发生,但不能太多,因为它们可能会使图像过度拥挤,这可能会对学习有害。”

OC&P的其他两项创新是有针对性的粘贴和增强实例粘贴。

有针对性的粘贴确保粘贴的图像会落在目标图像中现有的实例附近。在之前的工作中,新元素仅被限制在图像的边界内,没有考虑上下文。

虽然这种“粘贴”,有针对性的粘贴,对于人类的眼睛来说是显而易见的,但OC&P和其前身都发现,增加视觉真实性不一定是重要的,甚至可能是一个负担(见下面的“现实的咬合”)。

虽然这种“粘贴”,有针对性的粘贴,对于人类的眼睛来说是显而易见的,但OC&P和其前身都发现,增加视觉真实性不一定是重要的,甚至可能是一个负担(见下面的“现实的咬合”)。

增强实例粘贴确保粘贴的实例不会表现出一种“独特的外观”,可能会被系统以某种方式分类,从而导致排除或“特殊处理”,这可能会阻碍泛化和适用性。增强粘贴调节视觉因素,如亮度、锐度、缩放、旋转和饱和度等。

来自新论文的补充材料:将OC&P添加到现有的识别框架中是相当简单的,并且会导致在非常接近的人体个体化中产生更好的结果。来源:https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

来自新论文的补充材料:将OC&P添加到现有的识别框架中是相当简单的,并且会导致在非常接近的人体个体化中产生更好的结果。 来源:https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

此外,OC&P规定了粘贴实例的最小尺寸。例如,从一幅人群图像中提取一个人,然后将其粘贴到另一幅图像中,但在这种情况下,涉及的像素数量可能不足以帮助识别。因此,系统根据目标图像的等化边长比应用最小尺寸。

进一步,OC&P采用了尺寸感知粘贴,除了寻找与粘贴对象类似的主题外,还考虑了目标图像中的边界框的大小。然而,这并不一定会产生人认为是合理或真实的复合图像,而是以有助于训练的方式组装语义上合适的元素。

现实的咬合

OC&P及其前身都将真实性或“照片真实性”置于次要地位。虽然最终组装不应完全陷入达达主义(否则部署的系统可能永远无法遇到它们被训练的场景),但两个项目都发现,增加“视觉可信度”不仅会增加预处理时间,而且这种“真实性增强”可能实际上是有害的。

来自新论文的补充材料:带有“随机混合”的增强图像。虽然这些场景可能看起来像幻觉,但它们仍然将类似的主题组合在一起;虽然遮挡对于人类的眼睛来说是幻想的,但遮挡的性质无法预先知道,也无法训练——因此,这种奇怪的“切断”形式足以迫使训练系统寻找和识别部分目标主题,而无需开发复杂的Photoshop风格的方法来使场景更合理。

来自新论文的补充材料:带有“随机混合”的增强图像。虽然这些场景可能看起来像幻觉,但它们仍然将类似的主题组合在一起;虽然遮挡对于人类的眼睛来说是幻想的,但遮挡的性质无法预先知道,也无法训练——因此,这种奇怪的“切断”形式足以迫使训练系统寻找和识别部分目标主题,而无需开发复杂的Photoshop风格的方法来使场景更合理。

数据和测试

在测试阶段,系统在MS COCO数据集的“人”类别上进行了训练,包含262,465个人类实例,分布在64,115张图像中。为了获得比MS COCO更好的掩码,图像还使用了LVIS掩码注释。

2019年发布的LVIS,是Facebook研究的一个大型词汇实例分割数据集。来源:https://arxiv.org/pdf/1908.03195.pdf

2019年发布的LVIS,是Facebook研究的一个大型词汇实例分割数据集。 来源:https://arxiv.org/pdf/1908.03195.pdf

为了评估增强系统在大量遮挡人体图像中的表现,研究人员将OC&P与OCHuman(遮挡人体)基准进行了比较。

来自OCHuman数据集的示例,该数据集是在2018年支持姿势分割检测项目而引入的。该项目旨在使用人体姿势作为语义分隔符来改进人体的语义分割。来源:https://github.com/liruilong940607/OCHumanApi

来自OCHuman数据集的示例,该数据集是在2018年支持姿势分割检测项目而引入的。该项目旨在使用人体姿势作为语义分隔符来改进人体的语义分割。 来源:https://github.com/liruilong940607/OCHumanApi

由于OCHuman基准没有详尽的注释,该论文的研究人员创建了一个仅包含完全标注的示例的子集,称为OCHumanFL。这减少了验证集中的“人”实例数量至2,240个,分布在1,113张图像中,测试集中的实例数量至1,923个,分布在951张图像中。两个原始和新创建的数据集都使用平均精度(mAP)作为核心指标进行了测试。

为了保持一致,架构由具有ResNet-50主干和特征金字塔网络的Mask R-CNN组成,后者在准确性和训练速度之间提供了一个可接受的折衷。

研究人员注意到,在类似情况下,上游ImageNet的影响可能是有害的,因此整个系统从头开始在4个NVIDIA V100 GPU上训练,共75个epoch,按照Facebook 2021年发布的Detectron 2的初始化参数。

结果

除了上述结果外,基准结果还表明OC&P在识别人体方面领先于MMDetection(及其三个相关模型)。

除了超越PoSeg和Pose2Seg之外,该论文最显著的成就是该系统可以被广泛应用于现有的框架,包括在试验中与其竞争的框架(见文章开头的第一个结果框中的比较)。

该论文得出结论:

“我们的方法的一个关键优势是它可以轻松地应用于任何模型或其他模型中心的改进。考虑到深度学习领域的发展速度,拥有高度互操作的方法对所有人都有益。我们将将其与模型中心的改进相结合,以有效地解决遮挡人实例分割问题,留作未来的工作。”

改进文本到图像合成的潜力

首席作者Evan Ling在给我们的电子邮件中指出,OC&P的主要优势在于它可以保留原始掩码标签,并在新的上下文中“免费”获得新的价值,即这些图像被粘贴到的图像。

虽然人体的语义分割似乎与Stable Diffusion等模型在个体化人体方面的困难有关,但语义标注文化可能对SD和DALL-E 2输出的噩梦般的人体渲染的影响是非常遥远的。

Stable Diffusion的生成能力所依赖的LAION 5B子集图像不包含对象级别的标签,例如边界框和实例掩码,即使CLIP架构可能在某个时候从实例化中受益;相反,LAION图像是“免费”标注的,因为它们的标签来自元数据和环境字幕等,当它们被从网络中抓取到数据集中时,这些标签与图像相关联。

“但除此之外,”Ling告诉我们,“类似于我们的OC&P的某种增强可以在文本到图像生成模型的训练期间使用。但是我认为增强训练图像的真实性可能会成为一个问题。”

“在我们的工作中,我们表明,对于有监督的实例分割来说,‘完美’的真实性通常是不必要的,但我不确定是否可以对文本到图像生成模型训练得出相同的结论(尤其是当其输出被期望为高度真实时)。在这种情况下,可能需要在‘完善’增强图像的真实性方面进行更多工作。”

CLIP已经被用作一种可能的多模态工具,用于语义分割,表明改进的人体识别和个体化系统,例如OC&P,可能最终可以开发成任意拒绝“融合”和畸形人体表示的过滤器或分类器,这是Stable Diffusion目前难以实现的,因为它缺乏理解自己错误的能力(如果它有这种能力,它可能就不会犯错了)。

只是OpenAI的CLIP框架(DALL-E 2和Stable Diffusion的核心)用于语义分割的众多项目之一。来源:https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

只是OpenAI的CLIP框架(DALL-E 2和Stable Diffusion的核心)用于语义分割的众多项目之一。 来源:https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

“另一个问题是,”Ling建议,“在训练期间简单地向生成模型提供遮挡人体的图像是否会起作用,而不需要补充的模型架构设计来缓解‘人体融合’的问题?这可能是一个很难立即回答的问题。它将会很有趣地看到我们如何在文本到图像生成模型的训练期间注入某种实例级别的指导(通过实例级别的标签,如实例掩码)。”

 

* 2022年10月10日

首次发布于2022年10月10日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai