Anderson 视角

利用人类注意力可以提高AI生成图像的质量

mm
将 Unite.AI 添加到您在 Google 上的首选来源
An AI-generated image by ChatGPT. Prompt: ' a panoramic image representing salient object detection, featuring a person. The salient heat-map should be clear and obvious, and this illustration should be in the style of results from scientific papers about saliency maps'

中国的新研究提出了一个方法来提高由潜在扩散模型(LDMs)生成的图像质量,例如稳定扩散模型。

该方法专注于优化图像的显著区域,即最可能吸引人类注意力的区域。

新研究发现,显著性地图(从左数第四列)可以用作滤波器或“掩码”,用于引导去噪过程中的注意力焦点到人类最可能关注的图像区域。来源:https://arxiv.org/pdf/2410.10257

新研究发现,显著性地图(从左数第四列)可以用作滤波器或“掩码”,用于引导去噪过程中的注意力焦点到人类最可能关注的图像区域。来源:https://arxiv.org/pdf/2410.10257

传统方法优化整个图像的质量,而新的方法利用显著性检测器来识别和优先考虑更“重要”的区域,就像人类一样。

在定量和定性测试中,研究人员的方法能够比之前的扩散模型更好地生成图像,既提高了图像质量,也提高了对文本提示的忠实度。

新方法还在100名参与者的人类感知试验中获得了最佳成绩。

自然选择

显著性,即在现实世界和图像中优先处理信息的能力,是人类视觉的基本组成部分。

一个简单的例子是古典艺术中对重要区域的关注增加,例如肖像中的面部或海景中的船只;在这些例子中,艺术家的注意力集中在中心主题上,这意味着背景或远处的波浪被描绘得更粗略和更具代表性,而不是详细。

过去十年中,受人类研究启发的机器学习方法已经出现,可以复制或近似图像中的人类兴趣点。

对象分割(语义分割)可以帮助识别图像的各个方面并生成相应的显著性地图。来源:https://arxiv.org/pdf/1312.6034

对象分割(语义分割)可以帮助识别图像的各个方面并生成相应的显著性地图。来源:https://arxiv.org/pdf/1312.6034

在研究文献中,过去五年中最流行的显著性地图检测器是2016年的梯度加权类激活映射(Grad-CAM)计划,它后来演变成改进的Grad-CAM++系统,以及其他变体和改进。

Grad-CAM使用语义令牌(如“狗”或“猫”)的梯度激活来生成一个视觉地图,显示概念或注释可能在图像中的位置。

原始Grad-CAM论文中的示例。在第二列中,引导回传个性化所有贡献特征。在第三列中,绘制两个概念“狗”和“猫”的语义地图。第四列代表前两个推理的连接。第五个,相应的遮蔽(掩码)地图;最后,在第六列中,Grad-CAM可视化ResNet-18层。来源:https://arxiv.org/pdf/1610.02391

原始Grad-CAM论文中的示例。在第二列中,引导回传个性化所有贡献特征。在第三列中,绘制两个概念“狗”和“猫”的语义地图。第四列代表前两个推理的连接。第五个,相应的遮蔽(掩码)地图;最后,在第六列中,Grad-CAM可视化ResNet-18层。来源:https://arxiv.org/pdf/1610.02391

人类对这些方法的结果进行了调查,发现数学上识别图像中的关键兴趣点与人类注意力之间存在对应关系。

SGOOL

新论文考虑了显著性对文本到图像(以及潜在的文本到视频)系统(如稳定扩散和Flux)的影响。

当解释用户的文本提示时,潜在扩散模型会在其训练的潜在空间中搜索与使用的单词或短语相对应的视觉概念。然后,它们会将这些找到的数据点通过去噪过程解析,在去噪过程中,随机噪声会逐渐演变成对用户文本提示的创造性解释。

然而,在这一点上,模型会给图像的每个部分都赋予相同的注意力。自从2022年扩散模型的普及以来,用户发现“必不可少”的图像部分往往被低估。

考虑到在一个典型的人类描绘中,人的面部(对于观众来说是最重要的部分)可能只占整个图像的10-35%,这种民主的注意力分配方式既与人类的感知相反,也与艺术和摄影的历史相反。

当人的裤子上的按钮获得与他们的眼睛相同的计算资源时,可以说资源的分配是非最优的。

因此,作者提出的新方法,称为显著性引导的扩散潜在优化(SGOOL),使用显著性映射器来增加对图像被忽视区域的注意力,并将更少的资源分配给可能仍然处于观众注意力的边缘的部分。

方法

SGOOL管道包括图像生成、显著性映射和优化,整体图像和显著性精化图像被联合处理。

SGOOL概念图。

SGOOL概念图。

扩散模型的潜在嵌入直接使用微调来优化,消除了训练特定模型的需要。斯坦福大学的去噪扩散隐式模型(DDIM)采样方法被改编以纳入显著性地图提供的次要信息。

论文指出:

“我们首先使用显著性检测器来模拟人类视觉注意系统并标记显著区域。为了避免重新训练一个额外的模型,我们的方法直接优化扩散潜在变量。”

“此外,SGOOL利用可逆扩散过程,并赋予其恒定内存实现的优点。因此,我们的方法成为一个参数高效和即插即用的微调方法。我们进行了广泛的实验,使用了多个指标和人类评估。”

由于该方法需要对去噪过程进行多次迭代,作者采用了直接优化扩散潜在变量(DOODL)框架,该框架提供了可逆扩散过程。

为了定义人类感兴趣的区域,研究人员使用了邓迪大学2022年的TransalNet框架。

2022年TransalNet项目的显著性检测示例。来源:https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

2022年TransalNet项目的显著性检测示例。来源:https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

TransalNet处理的显著区域被裁剪以生成最可能对实际人感兴趣的最终显著性部分。

用户文本和图像之间的差异必须被考虑,以定义一个可以确定该过程是否有效的损失函数。为此,使用了OpenAI的对比语言-图像预训练(CLIP)版本,以及估计的语义距离之间的文本提示和全局(非显著性)图像输出。

作者断言:

“最终损失函数同时考虑了显著性部分和全局图像之间的关系,有助于在生成过程中平衡局部细节和全局一致性。”

“这种显著性感知损失函数用于优化图像潜在变量。梯度是在噪声潜在变量上计算的,并用于增强输入提示对生成图像的显著性和全局方面的条件作用。”

数据和测试

为了测试SGOOL,作者使用了一个“普通”的稳定扩散V1.4版本(在测试结果中表示为“SD”)和带有CLIP指导的稳定扩散(在结果中表示为“基线”)。

系统被评估在三个公共数据集上:CommonSyntacticProcesses(CSP)、DrawBench和DailyDallE*。

后者包含来自OpenAI博客文章中的一位艺术家的99个详细提示,而DrawBench提供了200个跨11个类别的提示。CSP由8个不同语法案例的52个提示组成。

对于SD、基线和SGOOL,在测试中,使用CLIP模型来生成图像和文本嵌入,而不是ViT/B-32。使用相同的提示和随机种子。输出大小为256×256,使用了TransalNet的默认权重和设置。

除了CLIP评分指标外,还使用了估计的人类偏好评分(HPS),以及一个包含100名参与者的真实世界研究。

与前几种配置相比的量化结果。

与前几种配置相比的量化结果。

关于上表中的量化结果,论文指出:

“我们的模型在所有数据集上都显著优于SD和基线,无论是CLIP评分还是HPS指标。我们的模型在CLIP评分和HPS上的平均结果分别比第二名高出3.05和0.0029。”

作者还估计了HPS和CLIP评分的盒线图,以比较以前的方法:

测试中获得的HPS和CLIP评分的盒线图。

测试中获得的HPS和CLIP评分的盒线图。

他们评论说:

“可以看出我们的模型优于其他模型,表明我们的模型更能生成与提示一致的图像。”

“然而,在盒线图中,由于该评估指标的大小为[0, 1],很难通过盒线图来可视化比较。因此,我们继续绘制相应的条形图。”

“可以看出SGOOL在所有数据集上都优于SD和基线,无论是CLIP评分还是HPS指标。量化结果表明我们的模型可以生成更语义一致和人类偏好的图像。”

研究人员指出,基线模型能够提高图像质量,但它没有考虑图像的显著区域。他们认为SGOOL通过在全局图像评估和显著图像评估之间取得折衷,获得了更好的图像。

在定性(自动化)比较中,SGOOL和DOODL的优化次数均设置为50。

测试的定性结果。请参考源论文以获得更好的定义。

测试的定性结果。请参考源论文以获得更好的定义。

测试的定性结果。请参考源论文以获得更好的定义。

在这里,作者观察到:

“在第一行中,提示的主题是‘一只唱歌的猫’和‘一个理发店四重奏’。SD生成的图像中有四只猫,图像的内容与提示不符。”

“基线生成的图像中忽略了猫,并且在面部和图像的细节描绘中缺乏细节。DOODL尝试生成一个与提示一致的图像。”

“然而,由于DOODL直接优化全局图像,图像中的人物被优化为与猫一致。”

他们进一步指出,SGOOL相比之下,生成的图像更符合原始提示。

在人类感知测试中,100名志愿者评估测试图像的质量和语义一致性(即,它们与源文本提示的吻合程度)。参与者有无限的时间来做出选择。

人类感知测试的结果。

人类感知测试的结果。

正如论文所指出的,作者的方法被明显优于以前的方法。

结论

就在这篇论文解决的缺点在本地稳定扩散安装中变得明显之后,不久各种定制方法(如After Detailer)就出现了,这些方法强制系统将额外的注意力集中在更能引起人类兴趣的区域。

然而,这种方法需要扩散系统首先经过正常的将注意力均匀分配给图像的每个部分的过程,然后再进行额外的工作作为一个额外的阶段。

SGOOL的证据表明,应用基本的人类心理学来优先处理图像部分,可以在没有后处理步骤的情况下大大提高初始推理。

 

* 该论文为此提供了与CommonSyntacticProcesses相同的链接。

首次发表于2024年10月16日星期三。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai