Anderson 视角

较小的Deepfakes可能是更大的威胁

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Public domain images + Flux.1 Kontext Pro and Adobe Firefly

对话式AI工具,如ChatGPT和Google Gemini,现被用于创建不交换面孔的Deepfakes,而是以更微妙的方式重写图像中的整个故事。通过改变手势、道具和背景,这些编辑欺骗了AI检测器和人类,提高了在线识别真实内容的赌注。

 

在当前的气候中,特别是在像《TAKE IT DOWN》法案这样的重要立法之后,许多人将Deepfakes和AI驱动的身份合成与非自愿的AI色情和政治操纵联系在一起,一般来说,就是对真相的严重歪曲。

这使我们习惯于期待AI操纵的图像总是针对高风险内容,在那里,渲染的质量和上下文的操纵可能会在短期内取得信誉的胜利。

然而,历史上更微妙的修改往往具有更险恶和更持久的影响,例如最先进的摄影技巧,它允许斯大林从摄影记录中删除那些失宠的人,如乔治·奥威尔的小说《1984》中所讽刺的那样,主人公温斯顿·史密斯每天都在改写历史并创建、销毁和“修改”照片。

在下面的例子中,第二张图片的问题在于我们“不知道我们不知道什么”——斯大林的秘密警察头目尼古拉·耶若夫曾经占据着现在只有安全屏障的地方:

现在你看到他,现在他……消失了。斯大林时代的摄影操纵从历史中删除了一名失宠的党员。来源:公共领域,通过https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

现在你看到他,现在他……消失了。斯大林时代的摄影操纵从历史中删除了一名失宠的党员。来源:公共领域,通过https://www.unite.ai/wp-content/uploads/2025/06/stalin-photo-trickery.jpg

这种趋势以各种方式持续存在;不仅在文化上,而且在计算机视觉中,计算机视觉从训练数据集中统计上占主导地位的主题和模式中推导出趋势。例如,智能手机降低了进入门槛,大大降低了摄影的成本,这意味着它们的图标学已经与许多抽象概念不可避免地联系在一起,即使这并不合适。

如果传统的Deepfakes可以被视为一种“攻击”的行为,那么音频和视频媒体中那些恶意的、持续的微小修改更像是“精神控制”。此外,这种Deepfakes的难以被察觉使得它们很难被目前的Deepfakes检测系统识别,这些系统正在寻找明显的变化。这种方法更像是水长期对岩石的侵蚀,而不是向头部投掷石头。

MultiFakeVerse

来自澳大利亚的研究人员试图通过策划一个大量的新数据集来解决对“微妙”Deepfakes缺乏关注的问题,该数据集包含针对人、情境、背景的图像操纵,这些操纵改变了情境、情感和叙事而不改变主体的核心身份:

从新集合中采样,真/假对,某些修改比其他修改更微妙。请注意,例如,右下角的亚洲女性失去了权威,因为她的听诊器被AI删除,同时医生的板子被替换为剪贴板,没有明显的语义角度。来源:https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html[/caption]

从新集合中采样,真/假对,某些修改比其他修改更微妙。请注意,例如,右下角的亚洲女性失去了权威,因为她的听诊器被AI删除,同时医生的板子被替换为剪贴板,没有明显的语义角度。来源:https://www.unite.ai/how-to-stop-ai-depicting-iphones-in-bygone-eras/

该集合名为《MultiFakeVerse》,它由通过视觉语言模型(VLMs)生成的845,826张图像组成,这些图像可以在网上访问和下载,需要许可

作者表示:

‘这种VLM驱动的方法使我们能够进行语义、上下文感知的修改,例如修改动作、场景和人与物体的交互,而不是进行合成或低级别的身份交换和区域编辑,这些是现有数据集中常见的。’

‘我们的实验表明,当前最先进的Deepfakes检测模型和人类观察者难以检测这些微妙但有意义的修改。’

研究人员测试了人类和领先的Deepfakes检测系统在新数据集上的表现,以查看这些微妙的修改如何被识别。人类参与者难以正确分类图像为真或假,只有大约62%的时间正确分类。

现有的Deepfakes检测器,主要是在更明显的面部交换或修复数据集上训练的,表现也不佳,经常无法检测到任何修改。即使在MultiFakeVerse上微调后,检测率仍然很低,暴露了当前系统在处理这些微妙、基于叙事的编辑时的局限性。

该论文题为《Multiverse Through Deepfakes:MultiFakeVerse数据集中的基于人、视觉和概念的操纵》,由五位来自墨尔本莫纳什大学和珀斯柯廷大学的研究人员撰写。代码和相关数据已在GitHub上发布,除了之前提到的Hugging Face托管

方法

MultiFakeVerse数据集是从四个真实世界图像集构建的,展示了人们在不同情况下的图像:EMOTICPISCPIPA,和PIC 2.0。从86,952张原始图像开始,研究人员生成了758,041张修改后的图像。

Gemini-2.0-FlashChatGPT-4o框架被用来为每张图像提议六个最小的编辑,旨在微妙地改变图像中最突出的人的感知方式。

模型被指示生成修改,使主体看起来天真自豪后悔缺乏经验,或无动于衷,或调整场景中的某个事实元素。除了每个编辑之外,模型还生成了一个引用表达式,以清晰地识别修改的目标,确保后续编辑过程可以将更改应用于图像中的正确人或对象。

作者解释道:

‘请注意,引用表达式是一个被广泛探索的领域,它指的是一个可以消除图像中的歧义的短语。例如,对于一张两名男子坐在桌子上的图像,其中一人正在打电话,另一人正在查看文件,后者的合适引用表达式将是“左边拿着纸张的男子”。’

一旦编辑被定义,图像的实际操纵就是通过提示视觉语言模型应用指定的更改而不改变场景的其余部分来完成的。研究人员测试了三个系统来完成这项任务:GPT-Image-1Gemini-2.0-Flash-Image-Generation;和ICEdit

在生成了22,000张样本图像后,Gemini-2.0-Flash出现为最一致的方法,生成的编辑自然地融入场景中,没有引入可见的伪影;ICEdit经常产生更明显的伪造品,在修改的区域中有明显的缺陷;GPT-Image-1有时会影响图像的意外部分,部分是由于其遵循固定输出纵横比。

图像分析

每张修改后的图像都与其原始图像进行比较,以确定图像有多少被改变。两个版本之间的像素级差异被计算出来,小的随机噪声被过滤掉,以关注有意义的编辑。在某些图像中,只有很小的区域受到影响;在其他图像中,高达80%的场景被修改。

为了评估这些修改如何改变图像的含义,使用ShareGPT-4V视觉语言模型为原始和修改后的图像生成了字幕。

这些字幕然后使用Long-CLIP转换为嵌入,这使得可以比较内容在版本之间有多大程度的偏离。最强的语义变化出现在对象或直接涉及图像中最突出的人的修改中,因为这些小的调整可以显著改变图像的解释。

Gemini-2.0-Flash然后被用来根据编辑的位置和方式将图像的修改分为三类:人级编辑涉及主体的面部表情、姿势、凝视、服装或其他个人特征的更改;物体级编辑影响与人相关的物体,如他们所持或与前景中交互的物体;场景级编辑涉及背景元素或不直接涉及人的更广泛的设置方面。

MultiFakeVerse数据集生成管道从真实图像开始,视觉语言模型提出针对人、物体或场景的叙事编辑。然后,图像编辑模型应用这些指令。右侧面板显示数据集中人级、物体级和场景级操纵的比例。来源:https://platform.openai.com/docs/models/gpt-image-1

MultiFakeVerse数据集生成管道从真实图像开始,视觉语言模型提出针对人、物体或场景的叙事编辑。然后,图像编辑模型应用这些指令。右侧面板显示数据集中人级、物体级和场景级操纵的比例。来源:https://developers.googleblog.com/en/experiment-with-gemini-20-flash-native-image-generation/

由于个别图像可以同时包含多种类型的编辑,数据集中的这些类别的分布被绘制出来。编辑大约有三分之一针对仅个人,约五分之一影响仅场景,约六分之一仅限于物体。

评估感知影响

Gemini-2.0-Flash被用来评估这些修改如何在六个领域改变观众的感知:情感个人身份权力动态场景叙事操纵意图,和伦理问题

对于情感,编辑经常被描述为快乐吸引人友好,表明主体的情感框架发生了转变;在叙事方面,专业不同等词语表明了对故事或环境的改变:

Gemini-2.0-Flash被提示评估每次操纵如何影响六个方面的观众感知。左:示例提示结构指导模型的评估。右:总结数据集中情感、身份、场景叙事、意图、权力动态和伦理问题变化的词云。

Gemini-2.0-Flash被提示评估每次操纵如何影响六个方面的观众感知。左:示例提示结构指导模型的评估。右:总结数据集中情感、身份、场景叙事、意图、权力动态和伦理问题变化的词云。

身份变化的描述包括年轻活泼脆弱,展示了微小的变化如何影响个人的感知。许多编辑的意图被标记为说服欺骗美学。虽然大多数编辑被认为只会引起轻微的伦理问题,但有一小部分被认为具有中度或重大的伦理影响。

来自MultiFakeVerse的示例,展示了小的编辑如何改变观众的感知。黄色框突出了修改的区域,并附有对情感、身份、叙事和伦理问题变化的分析。

来自MultiFakeVerse的示例,展示了小的编辑如何改变观众的感知。黄色框突出了修改的区域,并附有对情感、身份、叙事和伦理问题变化的分析。

指标

MultiFakeVerse集合的视觉质量使用三个标准指标进行了评估:峰值信噪比(PSNR)结构相似性指数(SSIM);和Fréchet Inception Distance(FID)

使用PSNR、SSIM和FID衡量的MultiFakeVerse图像质量得分。

使用PSNR、SSIM和FID衡量的MultiFakeVerse图像质量得分。

SSIM评分为0.5774,表明图像之间的相似度中等,符合保留大部分图像同时应用有针对性的编辑的目标;FID评分为3.30,表明生成的图像质量高,多样性好;PSNR值为66.30分贝,表明图像在编辑后保留了良好的视觉保真度。

用户研究

进行了一项用户研究,以查看人们如何识别MultiFakeVerse中的微妙假图像。十八名参与者被展示了五十张图像,均匀地分为真实和修改后的图像,涵盖了各种编辑类型。每个人都被要求将图像分类为真实或假的,如果是假的,还要确定应用了什么类型的修改。

真假图像的整体准确率为61.67%,这意味着参与者超过三分之一的时间将图像误分类。

作者指出:

‘分析人类对假图像的操纵级别的预测,预测和实际操纵级别之间的平均交并比为24.96%。 ‘

‘这表明人类观察者很难识别我们数据集中的操纵区域。 ‘

构建MultiFakeVerse数据集需要大量的计算资源:为生成编辑指令,向Gemini和GPT模型发出超过845,000次API调用,这些提示任务花费了大约1,000美元;使用Gemini生成图像的成本约为2,867美元;使用GPT-Image-1生成图像的成本约为200美元。ICEdit图像是在NVIDIA A6000 GPU上本地创建的,大约需要24小时才能完成任务。

测试

在测试之前,数据集被分割成训练、验证和测试集,首先选择70%的真实图像用于训练;10%用于验证;20%用于测试。从每个真实图像生成的修改图像被分配到与其对应的原始图像相同的集。

数据集的其他示例,真实(左)和修改(右)内容。

数据集的其他示例,真实(左)和修改(右)内容。

检测假图像的性能使用图像级准确率(系统是否正确将整个图像分类为真实或假)和F1评分进行了评估。对于定位修改区域,评估使用了曲线下面积(AUC),F1评分和交并比(IoU)

MultiFakeVerse数据集被用来评估领先的Deepfakes检测系统在整个测试集上的表现,竞争框架包括CnnSpotAntifakePromptTruFor;和基于视觉语言的SIDA。每个模型首先在零次模式下进行了评估,使用其原始预训练权重,没有进一步的调整。

两个模型,CnnSpot和SIDA,被微调在MultiFakeVerse的训练数据上,以评估在数据集上重新训练是否能提高性能。

在零次和微调条件下,MultiFakeVerse上的Deepfakes检测结果。括号中的数字显示微调后的变化。

在零次和微调条件下,MultiFakeVerse上的Deepfakes检测结果。括号中的数字显示微调后的变化。

关于这些结果,作者指出:

‘[这些]模型是在更早的基于修复的假图像上训练的,难以识别我们的基于VLM编辑的伪造品,特别是CNNSpot倾向于将几乎所有图像分类为真实。AntifakePrompt具有最佳的零次性能,平均类别准确率为66.87%,F1评分为55.55%。 ‘

‘在我们的训练集上微调后,我们观察到CNNSpot和SIDA-13B的性能都有所提高,CNNSpot在平均类别准确率(提高1.92%)和F1评分(提高1.97%)方面都超过了SIDA-13B。’

SIDA-13B被评估在MultiFakeVerse上定位修改区域的精度,以测量它在每个图像中找到修改区域的准确程度。该模型既以零次模式运行,也以在数据集上微调后的模式运行。

在其原始状态下,它达到13.10的交并比,19.92的F1评分和14.06的AUC,反映出定位性能较弱。

微调后,评分提高到24.74的交并比,39.40的F1评分和37.53的AUC。然而,即使经过额外的训练,模型仍然难以找到编辑的确切位置,突出了检测这些微小、有针对性的修改的挑战。

结论

这项新研究揭示了人类和机器感知中的一个盲点:虽然围绕Deepfakes的公共辩论主要集中在面部交换上,但这些更为微妙的“叙事编辑”更难以被检测,并可能在长期内更加有害。

随着ChatGPT和Gemini等系统在生成此类内容方面发挥着越来越重要的作用,我们自己也越来越多地参与修改自己照片流的现实,依靠检测粗糙操纵的系统可能会提供不充分的防御。MultiFakeVerse所展示的并不是检测失败,而是问题的至少一部分可能正在转变为更困难、行动迟缓的形式:小的视觉谎言在未被察觉的情况下积累。

 

首次发布于2025年6月5日,星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai