Anderson 视角

生成对抗网络的潜在空间的意外益处

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在试图提高AI生成图像的质量和保真度时,来自中国和澳大利亚的研究人员无意中发现了一种方法,可以交互式地控制生成对抗网络(GAN)的潜在空间——图像合成技术背后的神秘计算矩阵,这项技术即将在电影、游戏、社交媒体和娱乐及研究领域的许多其他领域中革新现状。

他们的发现是项目中心目标的副产品,允许用户使用鼠标任意和交互式地探索GAN的潜在空间,就像擦拭视频或翻阅书籍一样。

研究人员附件视频的摘录(见文章末的嵌入)。注意用户正在使用“抓取”光标(左上)操纵变换。来源:https://www.youtube.com/watch?v=k7sG4XY5rIc

研究人员附件视频的摘录(见文章末的嵌入)。注意用户正在使用“抓取”光标(左上)操纵变换。来源:https://www.youtube.com/watch?v=k7sG4XY5rIc

该方法使用“热图”来指示GAN运行相同数据集数千次(或数十万次)时,图像的哪些区域需要改进。热图旨在通过告诉GAN哪里出了错来提高图像质量,以便其下一次尝试会更好;但是,碰巧,这也提供了一个可以通过移动鼠标来浏览的潜在空间“地图”。

通过GradCAM强调的空间视觉注意力,通过施加明亮的颜色来指示需要关注的区域。这些样本是在研究人员的项目中使用StyleGan2的默认实现生成的。来源:https://arxiv.org/pdf/2112.00718.pdf

通过GradCAM强调的空间视觉注意力,通过施加明亮的颜色来指示需要关注的区域。来源:https://arxiv.org/pdf/2112.00718.pdf

论文称为《通过提高空间意识来改进GAN平衡》,来自中国香港大学和澳大利亚国立大学的研究人员。除了论文外,视频和其他材料可以在项目页面找到。

该工作还处于初期阶段,目前仅限于低分辨率图像(256×256),但这是一个证明了概念的方法,承诺可以打开GAN潜在空间的“黑盒子”,并且是在多个研究项目在图像合成控制方面取得重大突破之时。

虽然这些图像很吸引人(您可以在文章末的视频中看到更多图像,以更高的分辨率显示),但更重要的是,该项目已经找到了一种方法,可以通过告诉GAN在训练过程中哪里出了错来提高图像质量,并可能更快地实现这一点。

但是,正如《对抗》所示,GAN并不是一个单一的实体,而是一个不平等的冲突——权威与苦役之间的冲突。为了了解研究人员在这方面取得了什么改进,让我们来看看这场战争是如何被描述的。

生成器的可怜困境

如果您曾经被这样一个想法困扰,即您购买的某件新衣服是在一个被剥削的国家的血汗工厂生产的,或者您有一个老板或客户不断告诉您“再做一次!”却从不告诉您上一次尝试有什么问题,那么请为GAN中的生成器部分感到一点同情。

生成器是工作马,它在过去五年或更长时间内帮助GAN创建了令人惊叹的图像,例如帮助创建不存在的人的照片,将旧视频游戏升级到4K分辨率,以及将百年前的视频转换为全彩色HD输出,帧率为60fps,以及其他令人惊叹的AI新奇事物。

从创建不存在的人的照片到恢复古老的视频和重新激活存档的视频游戏,GAN在过去几年中一直很忙。

从创建不存在的人的照片到恢复古老的视频和重新激活存档的视频游戏,GAN在过去几年中一直很忙。来源:https://www.unite.ai

生成器一次又一次地运行所有训练数据,花费数天或数周时间,直到它能够创建令人信服的图像,就像它学习的真实照片一样。

那么,生成器如何知道它在每次尝试创建更好的图像时是否取得了任何进展呢?

生成器有一个来自地狱的老板。

判别器的无情不透明性

判别器的工作是告诉生成器它没有足够好地创建一个真实的图像,并且要“再做一次”。判别器不会告诉生成器它上一次尝试中出了什么问题;它只是私下查看,比较生成的图像与源图像(也私下进行),并为图像分配一个分数。

分数永远不会足够好。判别器不会停止说“再做一次”,直到研究人员关闭它(当他们判断额外的训练不会改善输出时)。

在这种情况下,生成器在没有任何建设性的批评的情况下,仅凭借一个分数(其度量标准是一个谜),必须随机猜测图像的哪些部分或方面导致了更高的分数。这将导致它走向更多不满意的道路,直到它以积极的方式改变某些东西,从而获得更高的分数。

判别器作为导师和导师

新研究的创新之处在于,判别器现在指示生成器哪些图像部分不满意,因此生成器可以在下一次迭代中关注这些区域,而不是丢弃评分较高的部分。这种关系的性质已经从对抗转变为合作。

为了解决判别器和生成器之间的洞察力差异,研究人员使用GradCAM作为一种机制,可以将判别器的洞察力转化为生成器下一次尝试的视觉反馈辅助工具。

新的“平衡”训练方法称为EqGAN。为了最大限度地提高可复现性,研究人员在默认设置下纳入了现有的技术和方法,包括使用StyleGan2架构。

EqGAN的架构。生成器的空间编码与判别器的空间意识对齐,空间热图的随机样本(见前面的图像)通过空间编码层(SEL)编码回生成器。GradCAM是判别器的注意力图可供生成器使用的机制。

EqGAN的架构。生成器的空间编码与判别器的空间意识对齐,空间热图的随机样本(见前面的图像)通过空间编码层(SEL)编码回生成器。GradCAM是判别器的注意力图可供生成器使用的机制。

GradCAM生成热图(见上图),反映了判别器对最新迭代的批评,并使其可供生成器使用。

训练模型后,映射将作为这种合作过程的副产品保留下来,但也可以用来以研究人员项目视频中演示的交互方式探索最终的潜在代码。

EqGAN

该项目使用了多个流行的数据集,包括LSUN猫和教堂数据集,以及FFHQ数据集。下面的视频还展示了使用EqGAN进行面部和猫脸操纵的示例。

所有图像在训练EqGAN之前都已调整为256×256像素,使用StyleGAN2的官方实现,并在8个GPU上以64的批大小训练,直到判别器接触到超过2500万张图像。

使用Frechet Inception Distance(FID)测试系统的结果,作者建立了一个称为失衡指标(DI)的度量标准——判别器保留的知识优势与生成器的差距,以缩小该差距为目标。

在三个训练数据集上,新的度量标准显示出有用的下降,空间意识编码到生成器后,FID和DI都显示出改进的平衡。

研究人员得出结论:

‘我们希望这项工作能够激发更多的研究来重新审视GAN平衡,并开发更新的方法来通过操纵GAN平衡来提高图像合成质量。我们还将在未来的工作中对这一问题进行更多的理论研究。’

并继续:

‘定性结果表明,我们的方法成功地迫使生成器集中于特定的区域。实验结果在各种数据集上验证,我们的方法减轻了GAN训练中的失衡,并大大提高了整体图像合成质量。具有空间意识的生成模型还能够交互式地操纵输出图像。’

请查看下面的视频,以了解更多关于该项目的详细信息,以及GAN潜在空间中动态和交互式探索的更多示例。

 

 

11:12am 4th Dec 2021 – Corrected URL for GradCAM and tidied up surrounding reference.

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai