Anderson 视角

一种可以让人脸更“美丽”的 AI 系统

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

中国的研究人员开发了一种新的基于 AI 的图像增强系统,能够让人脸更“美丽”,基于一种新的强化学习方法。

新方法使用一个“面部美丽预测网络”来迭代图像的变化,基于多个因素,其中“照明”和眼部姿势可能是关键因素。这里的原始来源(每列的左侧)来自 EigenGAN 系统,新结果在右侧。来源:https://arxiv.org/pdf/2208.04517.pdf

新方法使用一个“面部美丽预测网络”来迭代图像的变化,基于多个因素,其中“照明”和眼部姿势可能是关键因素。这里的原始来源(每列的左侧)来自 EigenGAN 系统,新结果在右侧。 来源:https://arxiv.org/pdf/2208.04517.pdf

该技术借鉴了 2021 年中国另一个项目 EigenGAN 生成器的创新成果,该项目在识别和控制生成对抗网络(GANs)潜在空间中的多样语义属性方面取得了显著进展。

2021 年的 EigenGAN 生成器能够在生成对抗网络的潜在空间中识别出高级概念,如“头发颜色”。新工作建立在这一创新基础上,提供了一个可以“美化”源图像的系统,但不会改变可识别的身份——这是以前方法的一个问题。来源:https://arxiv.org/pdf/2104.12476.pdf

2021 年的 EigenGAN 生成器能够在生成对抗网络的潜在空间中识别出高级概念,如“头发颜色”。新工作建立在这一创新基础上,提供了一个可以“美化”源图像的系统,但不会改变可识别的身份——这是以前方法的一个问题。 来源:https://arxiv.org/pdf/2104.12476.pdf

系统使用了一个从 SCUT-FBP5500(SCUT)中派生的“美学评分网络”,这是 2018 年南方科技大学的一个面部美丽预测基准数据集。

来自 2018 年的论文“SCUT-FBP5500:多范式面部美丽预测的多样基准数据集”,该论文提出了一种“面部美丽预测”(FBP)网络,能够根据感知到的吸引力对面部进行排名,但不能实际转换或“升级”面部。来源:https://arxiv.org/pdf/1801.06345.pdf

来自 2018 年的论文“SCUT-FBP5500:多范式面部美丽预测的多样基准数据集”,该论文提出了一种“面部美丽预测”(FBP)网络,能够根据感知到的吸引力对面部进行排名,但不能实际转换或“升级”面部。 来源:https://arxiv.org/pdf/1801.06345.pdf

与新工作不同,2018 年的项目不能实际执行转换,但包含了 5,500 张面部的算法价值判断,由 60 名混合性别标注者(50/50 分割)提供。这些已经被纳入新系统作为一个有效的判别器,以告知可能增强图像“吸引力”的转换。

有趣的是,新论文 的标题是 通过美学驱动的强化学习控制美丽的高加索人脸生成。由于 SCUT 数据集明显偏向亚洲来源(4000 个均匀分布的亚洲女性/男性,1500 个均匀分布的高加索女性/男性),使得该数据集中的“平均人”是棕发棕眼,因此为了适应至少一个种族内的色彩变化,需要排除原始数据中的亚洲组成部分,或者以很大的成本重新构建数据来开发可能不奏效的方法。另外,文化对美丽的感知变化 意味着这样的系统需要一定程度的地域配置,以确定什么构成“吸引力”。

相关属性

为了确定一张人脸照片的主要贡献因素,研究人员还测试了对图像的各种更改对算法感知“美丽”的影响。他们发现至少一个方面比好基因更重要:

除了照明,其他对美丽评分影响最大的是刘海(在男性中,通常相当于拥有全部头发),身体姿势和眼部姿势(与摄像机视点的互动是吸引力的助推器)。

(关于“口红颜色”,新系统可以有效地处理男性和女性的呈现,不区分性别外貌,而是依赖于新判别器系统作为“过滤器”)

方法

新系统中的强化学习机制的奖励函数是通过对 SCUT 数据的简单回归实现的,输出面部美丽预测。

训练系统迭代输入图像(下图左下)。最初,预训练的 ResNet18 模型(在 ImageNet 上训练)从五个相同的(“y”)图像中提取特征。然后,从一个全连接层(GRUCell,在图像中)中派生的潜在转换操作被应用,导致五个改变的图像被输入到美学评分网络中,根据其排名决定哪些变体将被开发和丢弃。

新系统工作流程的广义插图。

新系统工作流程的广义插图。

美学评分网络使用了一个高效的通道注意力(ECA)模块,而一个预训练的 EfficientNet-B4 实例被用来从每个图像中提取 1,792 个特征。

经过 ReLU 激活函数 的归一化,ECA 模块返回一个 4 维向量,然后在激活和 自适应平均池化 后被展平为一维向量。最后,结果被输入到 回归网络 中,得到一个美学评分。

系统输出的定性比较。在底行,我们看到所有被 EigenGAN 方法识别和增强的个别方面的总和。图像行左侧的平均 FID 得分更高(越高越好)。

系统输出的定性比较。在底行,我们看到所有被 EigenGAN 方法识别和增强的个别方面的总和。图像行左侧的平均 FID 得分更高(越高越好)。

测试和用户研究

对五个提出的方法进行了算法评估(见上图),并为系统处理的 1000 张图像分配了 Fréchet 启动距离(FID,在某些方面存在争议)得分。

研究人员指出,改善照明可以获得比其他更“明显”的可能更改(即对所描绘的人的实际外貌)更好的吸引力评分。

在某种程度上,以这种方式测试系统是有限的,因为 SCUT 数据集的怪癖,它没有很多“明亮的微笑”,而作者认为这可能会过度排名数据中的“神秘”外貌,与潜在目标用户(可能是西方市场)可能的偏好相比。

然而,既然整个系统依赖于仅 60 个人(在 EigenGAN 论文中)的平均意见,而所研究的质量远非经验性的,因此可以认为该过程比数据集更合理。

虽然在论文中只简要提到,但EigenGAN 和系统的五个变体的图像也在一个有限的用户研究(八名参与者)中被展示,参与者被要求选择“最佳图像”(避免使用“吸引力”一词)。

上图为小型研究组呈现的 GUI;下图为结果。

上图为小型研究组呈现的 GUI;下图为结果。

结果表明,新系统的输出在参与者中获得了最高的选择率(图中的“MAES”)。

追求美丽(无目标?)

尽管似乎有一个 显著 努力 焦点 中国 向这些目标努力,但该系统的实用性很难确定。新出版物中没有概述任何内容。

前一份 EigenGAN 论文建议*,美丽识别系统可以用于面部化妆合成推荐系统、美容手术、面部美化或基于内容的图像检索。

可以推测,类似的方法也可以用于交友网站,由用户用于“增强”自己的个人资料照片,作为使用过时照片或他人照片的替代方法。

同样,交友网站本身也可以“评分”客户以创建评级,甚至 限制访问等级,尽管这可能需要通过活体身份验证捕获,而不是提交的照片(如果这种方法变得流行,客户也可以“增强”自己的照片)。

在广告中,算法评估美丽的方法可以用于选择最有可能吸引目标受众的创意输出,同时最大化面部图像的美学影响的能力可以提高已经有效的图像的吸引力,而无需像深度伪造那样重写它们。

新工作得到了中国国家自然科学基金、国家复杂系统管理与控制重点实验室开放基金项目和中国教育部哲学社会科学研究项目等的支持。

* EigenGAN 论文中的许多建议都指向一本 2016 年的商业书籍《计算机面部美丽分析模型》,而不是学术资源。

首次发表于 2022 年 8 月 11 日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai