Anderson 视角

“深度伪造”的模糊定义

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Based on: https://unsplash.com/photos/man-sitting-on-chair-E9PFbdhZmus

一项来自德国的有趣研究批评了欧盟人工智能法案(EU AI Act)中“深度伪造”(deepfake)的定义过于模糊,特别是在数字图像操纵的背景下。作者认为,法案强调内容类似真实人物或事件,但可能看起来是假的,这个定义缺乏清晰度。

他们还指出,法案中关于“标准编辑”(即假设的轻微AI辅助图像修改)的例外没有考虑到AI在消费者应用中的普遍影响和艺术惯例的主观性,这些惯例在AI出现之前就已经存在。

这些问题引发了两个主要风险:一种是“寒蝉效应”,法律的宽泛解释范围会扼杀创新和新系统的采用;另一种是“违法效应”,法律被视为过度或不相关,从而被忽视。

在任何情况下,模糊的法律实际上将建立实际法律定义的责任转移到未来的法院判决——这是一种谨慎和规避风险的立法方法。

基于AI的图像操纵技术显然领先于立法解决它们的能力。例如,论文中观察到的一种值得注意的例子是,最近三星相机中的“场景优化器”(Scene Optimizer)功能,可以用AI驱动的“精细”图像替换用户拍摄的月亮图像(这是一个具有挑战性的主题):

左上角,论文中一个真实用户拍摄的月亮图像,与三星增强版自动创建的图像相比;右侧,三星官方关于此过程的插图;左下角,Reddit用户u/ibreakphotos的例子,显示(左)一个故意模糊的月亮图像和(右)三星重新想象的图像——尽管源照片是监视器的图像,而不是真正的月亮。来源(从左上角开始):https://arxiv.org/pdf/2412.09961;https://www.samsung.com/uk/support/mobile-devices/how-galaxy-cameras-combine-super-resolution-technologies-with-ai-to-produce-high-quality-images-of-the-moon/;https://reddit.com/r/Android/comments/11nzrb0/samsung_space_zoom_moon_shots_are_fake_and_here/

左上角,论文中一个真实用户拍摄的月亮图像,与三星增强版自动创建的图像相比;右侧,三星官方关于此过程的插图;左下角,Reddit用户u/ibreakphotos的例子,显示(左)一个故意模糊的月亮图像和(右)三星重新想象的图像——尽管源照片是监视器的图像,而不是真正的月亮。 来源(从左上角开始):https://arxiv.org/pdf/2412.09961;https://www.samsung.com/uk/support/mobile-devices/how-galaxy-cameras-combine-super-resolution-technologies-with-ai-to-produce-high-quality-images-of-the-moon/;https://reddit.com/r/Android/comments/11nzrb0/samsung_space_zoom_moon_shots_are_fake_and_here/

在上面的图像左下角,我们看到两个月亮图像。左边的是一个Reddit用户拍摄的图像,这个图像已经被用户故意模糊和降低分辨率。

右边的是同一个降质图像,但使用三星相机拍摄,启用了AI驱动的后处理。相机自动“增强”了识别出的“月亮”对象,即使源图像不是真正的月亮。

论文批评谷歌最近智能手机中集成的“最佳拍摄”(Best Take)功能——一种有争议的AI功能,它编辑组照中的“最佳”部分,扫描多秒的摄影序列,以便微笑可以在时间上向前或向后移动,如有必要——而没有人被显示在眨眼的中间:

“在典型的组照场景中,平均观众可能仍然认为生成的照片是真实的。微笑已经存在于几秒钟的剩余照片中。

“另一方面,最佳拍摄功能的10秒时间框架足以改变情绪。一个人可能已经停止微笑,而其他人正在笑关于一个笑话,而这个笑话是针对他们的。

“因此,我们假设这种组照可能构成一个深度伪造。”

这篇题为《什么构成了深度伪造?EU AI法案下合法处理和操纵之间的模糊界限》的新论文来自图宾根大学和萨尔兰大学的两位研究人员。

旧把戏

在消费级AI出现之前,摄影中的时间操纵就已经存在。论文的作者指出,存在更古老的技术,可以被认为是“不真实的”,例如将多个顺序图像连接成一个高动态范围(HDR)照片或一个“拼接”的全景照片。

事实上,一些最古老、最有趣的摄影伪造都是由学校孩子们创造的,他们在学校团体照中从一端跑到另一端,跑在特殊的全景相机的拍摄轨迹前面——使得学生可以在同一图像中出现两次:

学生们在全景相机拍摄时故意跑到另一端,以便在学校照片中“克隆”自己。来源:https://petapixel.com/2012/12/13/double-exposure-a-clever-photo-prank-from-half-a-century-ago/

学生们在全景相机拍摄时故意跑到另一端,以便在学校照片中“克隆”自己。 来源:https://petapixel.com/2012/12/13/double-exposure-a-clever-photo-prank-from-half-a-century-ago/

除非你以RAW模式拍摄,否则你的数字照片可能不是完全真实的。相机系统通常会应用“改进”算法,例如图像锐化和白平衡,默认情况下会这样做——而且自消费级数字摄影的起源以来就一直如此。

论文的作者认为,即使这些更古老的数字照片增强技术也不代表“现实”,因为这些方法的设计目的是使照片更令人愉悦,而不是更“真实”。

研究人员建议,欧盟人工智能法案,即使有后来的修正案,例如第123-127条,仍将所有摄影输出置于一个不适合当前摄影背景的证据框架中,而不是(名义上客观的)安全摄像头或法医摄影的性质。欧盟人工智能法案中解决的大多数图像更有可能源自制造商和在线平台积极推广创意照片解读的背景,包括使用人工智能。

研究人员指出,照片“从来都不是对现实的客观描述”。诸如相机位置、所选的景深和照明选择等因素都会使照片变得非常主观。

论文观察到,常规的“清理”任务——例如从一个整体上拍摄的场景中删除传感器灰尘或不需要的电线——在人工智能出现之前只被半自动化:用户必须手动选择一个区域或启动一个过程来实现他们的期望结果。

今天,这些操作通常由用户的文本提示触发,特别是在Photoshop等工具中。在消费级别上,这些功能越来越多地在没有用户输入的情况下自动执行——这似乎被制造商和平台视为“显然理想”的结果。

“深度伪造”的模糊含义

围绕人工智能修改和生成图像的立法的核心挑战是“深度伪造”一词的模糊性。在过去两年中,这个词的含义已经显著扩展。

最初,这些术语只适用于来自像DeepFaceLab和FaceSwap这样的基于自动编码器的系统的视频输出,这些系统源自2017年底在Reddit上发布的匿名代码。

从2022年开始,潜在扩散模型(LDM)的出现,例如稳定扩散和Flux,以及文本到视频系统,例如Sora,使得身份交换和定制成为可能,具有改进的分辨率、多样性和保真度。现在,可以创建扩散模型来描绘名人和政客。由于“深度伪造”这个词已经成为媒体制作者的头条宝藏,所以它被扩展来涵盖这些系统。

后来,在媒体和研究文献中,这个词也包括基于文本的模仿。到这一点,“深度伪造”的原始含义已经基本丢失,而其扩展含义不断演变和日益模糊。

但由于这个词如此具有煽动性和凝聚力,并且已经成为一个强大的政治和媒体焦点,所以放弃它是很困难的。它吸引了读者到网站,吸引了研究人员的资金,并吸引了政客的关注。这种词汇模糊性是这项新研究的主要焦点。

正如作者观察到的,欧盟人工智能法案第3条第60款概述了定义“深度伪造”的四个条件。

1:真月

首先,内容必须是生成或操纵的,即使用人工智能从头创建或从现有数据修改。论文强调了区分“可接受”的图像编辑结果和操纵性深度伪造的困难,考虑到数字照片在任何情况下都不是现实的真实表现。

论文认为,三星生成的月亮图像可以被认为是真实的,因为月亮不太可能改变外观,而且人工智能生成的内容经过真实月亮图像的训练,因此可能是准确的。

然而,作者还指出,既然三星系统已经被证明能够在源图像不是月亮本身的情况下生成“增强”的月亮图像,那么这将被认为是一个“深度伪造”。

不切实际地列出围绕这种特定功能的各种用例。因此,定义的负担似乎再次转移到法院。

2:文本伪造

第二,内容必须是图像、音频或视频的形式。文本内容虽然受其他透明度义务的约束,但在人工智能法案下不被视为深度伪造。这在新研究中没有详细介绍,但它可以对视觉深度伪造的有效性产生重大影响(见下文)。

3:现实世界问题

第三,内容必须类似现实中的人、物、地点、实体或事件。这个条件建立了与现实世界的联系,这意味着纯粹虚构的图像,即使是照片般逼真,也不符合深度伪造的定义。欧盟人工智能法案第134条强调了“类似”的方面,通过添加“显著”一词(这似乎是对后续法律判断的让步)。

作者引用了早期工作,考虑到人工智能生成的面部是否需要属于真实的人,还是只需要与真实的人足够相似,以满足这一定义。

例如,如何确定一系列逼真的图像是否描绘政治家唐纳德·特朗普,如果图像(或附加文本)没有具体提到他?面部识别?用户调查?法官对“常识”的定义?

回到“文本伪造”问题(见上文),文字通常构成了视觉深度伪造行为的重要部分。例如,可以取一个(未修改)的图像或视频,内容是“人A”,然后在字幕或社交媒体帖子中说,这个图像是“人B”(假设这两个人相似)。

在这种情况下,不需要人工智能,结果可能非常有效——但这种低科技方法是否也构成“深度伪造”?

4:修饰,重塑

最后,内容必须看起来真实或对人来说是真实的。这一条件强调了人类观众的感知。仅被算法识别为代表真实的人或对象的内容不被视为深度伪造。

在3(60)的所有条件中,这一个最明显地推迟到后来的法院判决,因为它不允许通过技术或机械手段进行任何解释。

很明显,达成对这一主观规定的共识存在一些固有的困难。作者指出,例如,不同的人和不同类型的人(例如儿童和成年人)可能以不同的方式倾向于相信特定的深度伪造。

作者进一步指出,像Photoshop这样的工具的先进人工智能功能挑战了传统的“深度伪造”定义。虽然这些系统可能包括基本的安全措施来防止有争议或禁止的内容,但它们极大地扩展了“修饰”的概念。用户现在可以以非常令人信服和照片般逼真的方式添加或删除图像中的对象,从而实现专业级别的真实性,这重新定义了图像操纵的界限。

作者指出:

“我们认为,人工智能法案中当前的深度伪造定义和相应的义务还不够明确,以应对深度伪造带来的挑战。通过分析数字照片从相机传感器到数字编辑功能的生命周期,我们发现:

“(1) 人工智能法案中的深度伪造定义不明确。定义留下了太多关于什么是深度伪造的空间。

“(2) 不清楚如何将Google的‘最佳拍摄’等编辑功能视为透明度义务的例外。

“(3) 对内容进行大量编辑的例外引发了关于什么构成内容的重大编辑以及这种编辑是否必须被自然人察觉到的问题。”

例外

欧盟人工智能法案包含例外,作者认为这些例外可以非常宽松。第50(2)条,作者指出,规定了在原始源图像大部分未被修改的情况下提供例外。作者指出:

“在数字音频、图像和视频的例子中,什么可以被视为第50(2)条中的内容?例如,在图像的情况下,我们是否需要考虑像素空间或人类可以感知的可见空间?像素空间中的实质性操纵可能不会改变人类的感知,反之,小的像素空间的扰动可以显著改变感知。”

研究人员提供了添加手枪到指向某人的人的照片中的例子。通过添加手枪,改变的内容可能只有5%,但是改变部分的语义意义是显著的。因此,似乎这个例外没有考虑到任何“常识”理解小细节对图像整体意义的影响。

第50(2)节还允许对“标准编辑”的辅助功能进行例外。由于该法案没有定义“标准编辑”的含义,因此即使像谷歌的最佳拍摄这样的后处理功能似乎也受到这个例外的保护,作者指出。

结论

这项新工作的明确意图是鼓励围绕深度伪造监管的跨学科研究,并作为与计算机科学家和法律学者之间的新对话的起点。

然而,这篇论文本身在几个点上屈服于循环论证:它经常使用“深度伪造”这个术语,好像它的含义是自明的,同时批评欧盟人工智能法案未能定义什么构成了深度伪造。

 

首次发表于2024年12月16日星期一

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai