Anderson 视角
图像合成领域采用了有缺陷的指标,研究人员称

2021年是图像合成领域取得了前所未有的进步和创新的一年,提供了新的创新和改进,能够通过神经渲染、深度伪造和一系列新方法复制人类个性。
然而,德国研究人员现在声称,用于自动判断合成图像真实性的标准是有缺陷的;并且,世界各地的成千上万的研究人员依赖于它来降低昂贵的人类评估结果的成本,可能正在走入歧途。
为了证明标准弗雷切特入世距离(FID)不能达到人类评估图像的标准,研究人员部署了自己的GAN,优化为FID(现在是一个常见的指标)。他们发现FID正在遵循自己的偏见,基于具有不同目的的底层代码,并且它经常无法达到“人类”的辨别标准:
除了断言FID不适合其预期任务外,该论文还进一步表明“明显”的解决方案,例如用其他引擎替换其内部引擎,只会用一套偏见换另一套偏见。作者建议,现在需要新的研究计划来开发更好的指标来评估合成图像的“真实性”。
该论文题为弗雷切特入世距离中的内在偏见,由马克斯·普朗克信息学研究所的斯蒂芬·容和西根大学视觉计算教授玛格丽特·凯珀共同撰写。
寻找图像合成评分系统
正如新研究指出的,图像合成框架(如GAN和编码器/解码器架构)的进展已经超过了评估这些系统结果的方法。除了昂贵且难以扩展外,人类评估这些系统的输出也没有提供一种经验和可重复的评估方法。
因此,出现了多种指标框架,包括入世评分(IS),该评分出现在2016年的论文改进GAN训练技术中,由GAN发明者伊恩·古德费洛共同撰写。
2018年对IS评分作为多个GAN网络的广泛适用指标的可信度受到质疑,导致FID在GAN图像合成社区得到广泛采用。然而,像入世评分一样,FID也是基于谷歌的入世v3图像分类网络(IV3)。
论文作者认为,弗雷切特入世距离继承了IV3中的有害偏见,导致图像质量分类不可靠。
由于FID可以作为判别器(嵌入的“法官”,决定GAN是否做得好,或者应该“再试一次”)被纳入机器学习框架,因此它需要准确代表人类在评估图像时应用的标准。
弗雷切特入世距离
FID比较训练数据集和GAN(或类似功能)模型的结果中特征的分布。
因此,如果GAN框架在10,000张名人图像上进行训练,FID将原始(真实)图像与GAN生成的假图像进行比较。FID评分越低,GAN生成的图像就越接近“照片级”图像,按照FID的标准。

来自论文的结果,GAN在FFHQ64上进行训练,FFHQ64是NVIDIA流行的FFHQ数据集的一个子集。这里,尽管FID评分很低(5.38),但结果并不令人满意或令人信服。
问题,作者认为,在于入世v3的假设支撑着弗雷切特入世距离,并不关注当前任务的正确位置——至少在考虑当前任务时是如此。
入世V3是在ImageNet对象识别挑战上进行训练的,这是一项与近年来图像合成目标演变所背离的任务。IV3通过执行数据增强来挑战模型的鲁棒性:它随机翻转图像,随机裁剪到8-100%的比例,改变宽高比(在3/4到4/3的范围内),并随机注入与亮度、饱和度和对比度相关的颜色失真。
德国研究人员发现,IV3倾向于提取边缘和纹理,而不是颜色和强度信息,这将是合成图像真实性的更有意义的指标;并且其原始目的(对象检测)已经被不恰当地用于不合适的任务。作者指出*:
‘[入世v3]倾向于提取基于边缘和纹理的特征,而不是颜色和强度信息。这与其数据增强管道一致,该管道引入颜色失真,但保持高频信息完整(与例如使用高斯模糊的数据增强相反)。 ‘
‘因此,FID继承了这种偏见。 当用作排名指标时,能够很好复制纹理的生成模型可能比能够很好复制颜色分布的模型更受青睐。 ‘
数据和方法
为了测试他们的假设,作者训练了两个GAN架构,DCGAN和SNGAN,在NVIDIA的FFHQ人脸数据集上,下采样到642图像分辨率,得到的数据集称为FFHQ64。
进行了三种GAN训练程序:GAN G+D,一个标准的判别器;GAN FID|G+D,其中FID作为附加判别器;以及GAN FID|G,其中GAN完全由滚动FID评分驱动。
从技术上讲,作者指出,FID损失应该稳定训练,并可能甚至能够完全替代判别器(如#3,GAN FID|G所示),同时输出人类喜欢的结果。
实际上,结果却大不相同,作者假设FID辅助模型“过拟合”到错误的指标上。研究人员指出:
‘我们假设生成器学习产生不合适的特征来匹配训练数据分布。这一观察结果在[GAN FID|G]的情况下变得更加严重。这里,我们注意到缺失的判别器导致空间上不连贯的特征分布。例如[SNGAN FID|G]主要添加单个眼睛,并以一种令人生畏的方式对齐面部特征。 ‘
作者得出结论*:
‘虽然人类注释者可能更喜欢SNGAN D+G生成的图像而不是SNGAN FID|G(在数据保真度优先于艺术的情况下),但我们看到这并没有被FID反映出来。 因此,FID与人类感知不一致。 ‘
‘我们认为,图像分类网络提供的判别特征不足以成为有意义的指标的基础。 ‘
没有简单的替代方案
作者还发现,替换入世V3为类似的引擎并不能解决问题。在用“广泛选择的不同分类网络”替换IV3时,测试了这些网络与ImageNet-C(一个子集,用于基准图像合成框架中常见的腐败和扰动),研究人员无法显著改善结果:
‘[偏见]存在于入世v3中,也广泛存在于其他分类网络中。另外,我们看到不同的网络会产生不同的排名,位于腐败类型之间。 ‘
作者在论文结尾表达了希望,正在进行的研究将开发出“与人类一致且无偏见的指标”,能够为图像生成器架构提供更公平的排名。
* 作者强调。
最初发布于2021年12月20日,格林尼治标准时间下午1点。














