Anderson 视角
使用谷歌的Imagic和Runway的“擦除和替换”进行AI辅助对象编辑

本周,两个新的AI驱动的图形算法提供了对照片中对象进行高级和有效的更改的新方法。
首先是谷歌研究院的Imagic,它与以色列理工学院和魏茨曼科学研究所合作,提供基于文本的、细粒度的对象编辑,通过对扩散模型进行微调。
任何曾经尝试在稳定扩散中重新渲染时只改变一个元素的人都知道,对于每一个成功的编辑,系统都会改变五件你喜欢的东西。这种缺陷目前使得许多最有才华的稳定扩散爱好者不断在稳定扩散和Photoshop之间切换,以修复这种“附带损害”。从这个角度来看,Imagic的成就似乎很显著。
截至目前,Imagic还没有宣传视频,而且考虑到谷歌在发布无限制的图像合成工具方面的谨慎态度,尚不确定我们是否会有机会测试这个系统。
第二个产品是Runway ML的更易用的“擦除和替换”功能,它是该公司在线机器学习视觉效果工具套件中的一个新功能。
让我们先看看Runway的产品。
擦除和替换
与Imagic一样,擦除和替换只处理静态图像,尽管Runway已经预览了相同的功能在一个尚未发布的文本到视频编辑解决方案中:
Runway ML没有发布关于擦除和替换背后的技术细节,但根据将一个房地产植物替换为一座罗纳德·里根半身像的速度来看,似乎使用了一个扩散模型,例如稳定扩散(或不太可能的是DALL-E 2)来重建所选对象。
该系统有一些类似DALL-E 2的限制——图像或文本触发擦除和替换过滤器将触发警告,如果进一步违反将导致账户暂停——这基本上是OpenAI的DALL-E 2政策的翻版。
许多结果缺乏稳定扩散的典型粗糙边缘。Runway ML是稳定扩散的投资者和研究合作伙伴,因此他们可能已经训练了一个优于我们目前使用的开源1.4检查点权重的专有模型。
系统似乎不太擅长处理空白区域的擦除和替换;如果你试图将一个咖啡桌替换为一个外星人,系统可能会简单地将桌子删除,而不是生成一个新的外星人对象。
擦除和替换似乎是一个有效的对象替换系统,具有出色的插画能力。然而,它不能编辑现有的感知对象,只能替换它们。实际上改变现有图像内容而不损害周围材料是一个更难的任务,涉及计算机视觉研究领域的去耦合问题。
Imagic解决了这个问题。新论文提供了许多编辑示例,成功地修改了照片的各个方面,同时保持图像的其余部分不变。
该系统采用三阶段过程:文本嵌入优化、模型微调和生成修改后的图像。
Imagic使用谷歌的Imagen文本到视频架构,尽管研究人员表示,该系统的原理可以广泛应用于潜在扩散模型。
Imagen使用三层架构,而不是公司最近的七层文本到视频迭代。三个不同的模块包括一个在64x64px分辨率下运行的生成扩散模型;一个超分辨率模型将输出上采样到256x256px;以及另一个超分辨率模型将输出上采样到1024×1024分辨率。
Imagic在最早的阶段介入,优化请求的文本嵌入在64px阶段,使用Adam优化器和0.0001的静态学习率。
微调然后在Imagen的基础模型上进行,条件为每个输入图像的修订嵌入,进行1500步。同时,条件图像上的次要64px > 256px层被并行优化。研究人员指出,对最终256px > 1024px层的类似优化“几乎没有影响”,因此没有实施这一点。
该论文指出,优化过程大约需要八分钟的时间,对于每个图像使用双TPUV4芯片。最终渲染在核心Imagen下使用DDIM采样方案进行。
与谷歌的DreamBooth类似,所得嵌入可以用来实现风格化以及包含来自更广泛的基础数据库的信息的逼真编辑(因为,如下所示,源图像没有必要的内容来实现这些转换)。
研究人员将Imagic与之前的工作进行了比较,包括2021年斯坦福大学和卡内基梅隆大学的GAN-based方法SDEdit,以及2022年魏茨曼科学研究所和NVIDIA的Text2Live。
很明显,之前的方法正在苦苦挣扎,但在底部行中,涉及对源材料进行大量更改,现有方法完全失败,而Imagic则取得了显著的成功。
Imagic的资源需求和每张图像的训练时间,虽然比其他类似任务短,但使其不太可能被包含在个人电脑上的本地图像编辑应用程序中——目前尚不清楚微调过程是否可以降低到消费者水平。
就目前而言,Imagic是一个令人印象深刻的产品,更适合API——谷歌研究可能更愿意在这种环境中工作,考虑到他们在促进深度伪造方面的谨慎态度。
在这个范围内,擦除和替换过程可以被缩小到消费者水平的程度尚不清楚。就目前而言,Imagic是一个适合API的令人印象深刻的产品——这是谷歌研究可能更愿意在其中工作的环境,考虑到他们在促进深度伪造方面的谨慎态度。首次发布于2022年10月18日。












