Anderson 视角

用 AI 伪造‘更好’的身体

mm
将 Unite.AI 添加到您在 Google 上的首选来源

阿里巴巴 DAMO 学院的新研究提供了一种基于 AI 的工作流,用于自动化人体图像的重塑——这在目前主要关注基于人脸的操作(如深度伪造)和 GAN 基于的人脸编辑的计算机视觉领域是罕见的努力。

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

在“result”列中插入的生成注意力图,定义了需要修改的区域。 来源: https://arxiv.org/pdf/2203.04670.pdf

研究人员的架构使用骨骼姿态估计,以应对图像合成和编辑系统在概念化和参数化现有人体图像时面临的更大复杂性,至少达到能够实现有意义且可选择编辑的细粒度水平。

估计的骨骼图有助于识别并聚焦于可能需要修饰的身体部位,例如上臂区域。

该系统最终使用户能够设置参数,以改变人物全身或半身照片中的体重、肌肉质量或体重分布的外观,并且能够对穿衣或裸露的身体部位进行任意转换。

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

左侧为输入图像;中间为派生注意力区域的热图;右侧为转换后的图像。

该工作的动机是开发能够取代摄影师和制作图形艺术家在时尚、杂志等各类媒体中进行的繁重数字处理的自动化工作流,以及宣传材料。

总体而言,作者承认,这些转换通常使用 Photoshop 等传统位图编辑器中的“扭曲”技术进行,几乎仅用于女性图像。因此,为促进新流程而开发的定制数据集主要由女性主体的照片组成:

‘由于身体修饰主要受到女性的需求,我们的收藏大多数是女性照片,考虑到年龄、种族(非洲:亚洲:高加索 = 0.33:0.35:0.32)、姿势和服装的多样性。’

该论文题为Structure-Aware Flow Generation for Human Body Reshaping,作者来自阿里巴巴全球 DAMO 学院的五位研究者。

数据集开发

正如图像合成和编辑系统通常的情况一样,该项目的架构需要一个定制的训练数据集。作者委托了三位摄影师,对来自图库网站 Unsplash 的合适图像进行标准的 Photoshop 操作,生成了一个名为BR-5K* 的数据集,包含 5,000 张 2K 分辨率的高质量图像。

研究人员强调,在此数据集上进行训练的目标并非产生关于吸引力或理想外观指数的‘理想化’和通用特征,而是提取与专业人体图像处理相关的核心特征映射。

然而,他们承认这些处理最终反映了从‘真实’到预设的‘理想’概念的转变过程:

‘我们邀请了三位专业艺术家独立使用 Photoshop 对人体进行修饰,目标是实现符合大众审美的纤细身形,并将最佳作品选为真实标注(ground-truth)。’

由于该框架完全不处理面部,这些面部在纳入数据集之前已被模糊处理。

架构与核心概念

系统的工作流包括输入一张高分辨率肖像,将其下采样至可适配现有计算资源的低分辨率,并提取估计的骨骼姿态图(下图左起第二幅),以及在 2016 年由卡内基梅隆大学机器人研究所创新的部件亲和场(PAFs)(见下方嵌入的视频)。

部件亲和场有助于定义四肢的方向以及与更广泛骨骼框架的整体关联,为新项目提供了额外的注意力/定位工具。

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

来自 2016 年部件亲和场论文,预测的 PAF 将四肢方向编码为包含四肢整体位置的二维向量的一部分。 来源: https://arxiv.org/pdf/1611.08050.pdf

尽管它们表面上与体重外观无关,骨骼图在引导最终的转化过程至需要修改的身体部位(如上臂、臀部和大腿)时仍然十分有用。

之后,这些结果被送入位于流程核心瓶颈的结构亲和自注意力(SASA)模块(见下图)。

SASA 调节驱动该流程的流生成器的一致性,其结果随后传递给扭曲模块(上图右起第二个),该模块应用在数据集中手动修订的训练中学到的转换。

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

结构亲和自注意力(SASA)模块将注意力分配到相关的身体部位,帮助避免多余或不相关的转换。

随后,输出图像被上采样回原始的 2K 分辨率,使用的过程与标准的 2017 年风格深度伪造架构相似,后者衍生出了诸如 DeepFaceLab 等流行套件;上采样过程在 GAN 编辑框架中也很常见。

该模式的注意力网络基于Compositional De-Attention Networks(CODA),这是 2019 年美国/新加坡与亚马逊 (AMZN ) AI 和微软的学术合作。

测试

基于流的框架与之前的基于流的方法 FAL 和 Animating Through Warping(ATW),以及图像翻译架构 Pix2PixHD 和 GFLA 进行比较,评估指标使用 SSIM、PSNR 和 LPIPS。

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

初始测试结果(标题中的箭头方向指示数值是越低越好还是越高越好)。

基于这些采用的指标,作者的系统优于之前的架构。

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

精选结果。请参阅本文链接的原始 PDF 以获取更高分辨率的对比。

除了自动化指标外,研究人员还进行了一项用户研究(前文结果表的最后一列),让 40 名参与者分别看到从 100 题库中随机抽取的 30 题,这些题目与使用各种方法生成的图像相关。70% 的受访者认为新技术在视觉上更具吸引力。

挑战

这篇新论文是对基于 AI 的人体操控的罕见探索。当前图像合成领域更倾向于通过神经辐射场(NeRF)等方法生成可编辑的身体,或专注于探索 GAN 的潜在空间以及自动编码器在面部操控方面的潜力。

作者的工作目前仅限于改变感知体重,并且尚未实现任何修补技术来恢复在瘦身图片时不可避免显露的背景。

然而,他们提出,通过纹理推断进行肖像抠图和背景混合可以轻松解决恢复因人体‘缺陷’而在图像中被隐藏的世界部分的问题。

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

一种针对 AI 驱动的减肥导致显露的背景进行恢复的提议方案。

 

* 虽然预印本提及了提供更多数据集细节以及项目更多示例的补充材料,但该材料的获取位置并未在论文中提供,且通讯作者尚未回应我们的获取请求。

首次发布于 2022 年 3 月 10 日。

机器学习撰稿人,专注于人类图像合成的领域专家。曾任 Metaphysic.ai 的研究内容负责人,直至其并入 DNEG 的 Brahma.ai。
网站: martinanderson.ai
联系:martin@martinanderson.ai