Anderson 视角

通过简单的JPEG压缩实现自认证图像

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Source: https://www.pexels.com/photo/woman-in-gray-tank-top-showing-distress-3812745/

关于篡改图像的风险的担忧在过去几年中一直在研究中出现,特别是在新的基于人工智能的图像编辑框架的浪潮中,这些框架能够修改现有的图像,而不是直接创建它们。

大多数针对此类内容的提出的检测系统都属于两大类:第一类是水印法——一种后备方法,现已被Coalition for Content Provenance and Authenticity(C2PA)推广的图像真实性框架所采用。

C2PA水印法是图像内容与其原始和持续的清单分离时的后备方法。来源:https://www.imatag.com/blog/enhancing-content-integrity-c2pa-invisible-watermarking

C2PA水印法是图像内容与其原始和持续的清单分离时的后备方法。 来源:https://www.imatag.com/blog/enhancing-content-integrity-c2pa-invisible-watermarking

这些“秘密信号”必须随后能够抵抗图像通过社交网络和门户传输时经常发生的自动重新编码/优化过程——但它们通常不能抵抗通过JPEG 压缩(尽管有竞争对手,如 webp,但JPEG格式仍然被用于所有网站图像的约 74.5%)应用的那种有损重新编码。

第二种方法是使图像变得篡改明显,如 2013 年论文最初提出的《基于固定点理论的图像完整性认证方案》中最初提出的那样。这种方法不依赖于水印或数字签名,而是使用了一种称为高斯卷积和反卷积(GCD)的数学变换来将图像推向一个稳定的状态,如果修改图像,这个状态就会被破坏。

使用固定点图像的篡改定位结果,PSNR为59.7802 dB。白色矩形表示受到攻击的区域。面板A(左)显示应用的修改,包括局部噪声、滤波和基于复制的攻击。面板B(右)显示相应的检测输出,突出显示认证过程中识别的篡改区域。来源:https://arxiv.org/pdf/1308.0679

来自论文“基于固定点理论的图像完整性认证方案”:使用固定点图像的篡改定位结果,PSNR为59.7802 dB。白色矩形表示受到攻击的区域。面板A(左)显示应用的修改,包括局部噪声、滤波和基于复制的攻击。面板B(右)显示相应的检测输出,突出显示认证过程中识别的篡改区域。 来源:https://arxiv.org/pdf/1308.0679

这个概念可以通过修复精致的蕾丝布来理解:无论使用多么精细的工艺来修补花边,修复的部分最终都会被识别出来。

这种变换,当反复应用于灰度图像时,会逐渐将其推向一个状态,在这种状态下,再次应用变换不会产生任何进一步的变化。

这种稳定的图像版本称为固定点。固定点很少见,并且对变化非常敏感——对固定点图像进行任何小的修改几乎肯定会破坏其固定状态,使得检测篡改变得容易。

与此类方法通常遇到的情况一样,JPEG压缩的伪影会威胁该方案的完整性:

在左边,我们看到水印被应用于标志性的“Lenna”(Lena)图像的脸部,在正常压缩下很清楚。在右边,90%的JPEG压缩,我们可以看到感知到的水印和JPEG噪声的增长之间的区别正在降低。经过多次重新保存,或在最高压缩设置下,大多数水印方案都面临JPEG压缩伪影的问题。来源:https://arxiv.org/pdf/2106.14150

在左边,我们看到水印被应用于标志性的“Lenna”(Lena)图像的脸部,在正常压缩下很清楚。在右边,90%的JPEG压缩,我们可以看到感知到的水印和JPEG噪声的增长之间的区别正在降低。经过多次重新保存,或在最高压缩设置下,大多数水印方案都面临JPEG压缩伪影的问题。 来源:https://arxiv.org/pdf/2106.14150

那么,JPEG压缩伪影可以被用作获得固定点的中心手段吗?在这种情况下,不需要额外的外部系统,因为通常引起麻烦的机制将成为篡改检测框架的基础。

JPEG压缩作为安全基线

这种系统在纽约州立大学布法罗分校的两位研究人员的一篇新论文中被提出。该论文题为《使用JPEG固定点的篡改明显图像》,在2013年的工作基础上,正式阐述了其核心原理,并巧妙地利用JPEG压缩本身作为可能产生“自认证”图像的方法。

作者解释说:

“研究表明,图像在经过多轮JPEG压缩和解压缩过程后变得不变。”

“换句话说,如果单个JPEG压缩和解压缩循环被认为是图像的变换,称为JPEG变换,则该变换具有固定点的性质,即图像在应用JPEG变换时保持不变。”

来自新论文的JPEG固定点收敛的示例。在顶行中,我们看到一个图像经过重复的JPEG压缩,每次迭代显示变化的像素数量和位置;在底行中,绘制了不同压缩质量设置下的连续迭代之间的像素级<a href=

L2 距离。讽刺的是,这个图像没有更高的分辨率。来源:https://arxiv.org/pdf/2504.17594″ width=”754″ height=”483″ /> 来自新论文的JPEG固定点收敛的示例。在顶行中,我们看到一个图像经过重复的JPEG压缩,每次迭代显示变化的像素数量和位置;在底行中,绘制了不同压缩质量设置下的连续迭代之间的像素级L2距离。讽刺的是,这个图像没有更高的分辨率。 来源:https://arxiv.org/pdf/2504.17594

与引入外部变换或水印不同,该论文将JPEG过程本身定义为一个动态系统。在这种模型中,每个压缩和解压缩循环都会将图像推向一个固定点。作者证明,经过有限的迭代次数后,任何图像都会达到或接近一个状态,在这种状态下,进一步的压缩不会产生任何变化。

研究人员指出:

“任何对图像的修改都会导致偏离JPEG固定点,可以通过检测JPEG块在单次JPEG压缩和解压缩后发生的变化来检测。”

“基于JPEG固定点的提出的篡改明显图像具有两个优势。首先,篡改明显图像消除了存储可验证特征的需要,如图像指纹方案所需的那样,或像图像水印法中那样嵌入隐藏痕迹。图像本身作为其真实性的证明,使得该方案本质上是自我证明的。”

“其次,由于JPEG是一种广泛使用的格式,通常是图像处理管道的最后一步,该方法对JPEG操作具有弹性。这与原始方法不同,可能由于JPEG而丢失完整性痕迹。”

该论文的关键见解是JPEG收敛不仅是其设计的副产品,也是其操作的数学必然结果。离散余弦变换、量化、四舍五入和截断共同形成一个变换(在正确的条件下),会导致一个可预测的固定点集。

新工作中JPEG压缩/解压缩过程的模式。

新工作中JPEG压缩/解压缩过程的模式。

与水印法不同,该方法不需要嵌入信号。唯一的参考是图像在进一步压缩下的自身一致性。如果重新压缩不会产生任何变化,则图像被认为是真实的。如果产生了变化,则表明篡改。

测试

作者使用一百万个随机生成的8×8像素的8位灰度图像数据来验证这种行为。通过对这些合成块应用重复的JPEG压缩和解压缩,他们观察到收敛到固定点的发生在有限的步骤数内。这个过程是通过测量连续迭代之间的像素级L2距离来监控的,差异会减小,直到块稳定下来。

在不同JPEG压缩质量下,一百万个8x8块之间的L2差异。每个过程从单个JPEG压缩块开始,跟踪重复压缩过程中差异的减少。

在不同JPEG压缩质量下,一百万个8×8块之间的L2差异。每个过程从单个JPEG压缩块开始,跟踪重复压缩过程中差异的减少。

为了评估篡改检测,作者构造了基于JPEG固定点的篡改明显图像,并应用了四种类型的攻击:盐和胡椒噪声;复制-移动操作;从外部来源拼接;以及使用不同量化表的双重JPEG压缩。

固定点RGB图像的检测和定位篡改示例,包括作者使用的四种破坏方法。在底行中,我们可以看到每种扰动风格都相对于生成的固定点图像而言是显现的。

固定点RGB图像的检测和定位篡改示例,包括作者使用的四种破坏方法。在底行中,我们可以看到每种扰动风格都相对于生成的固定点图像而言是显现的。

在篡改后,图像使用原始量化矩阵重新压缩。通过识别JPEG块在重新压缩后发生非零差异来检测偏离固定点,实现了篡改区域的检测和定位。

由于该方法完全基于标准JPEG操作,固定点图像可以与常规JPEG查看器和编辑器正常工作;但是,作者指出,如果图像以不同的质量级别重新压缩,它可能会失去其固定点状态,这可能会破坏认证,并需要在实际使用中谨慎处理。

虽然这不仅仅是一个用于分析JPEG输出的工具,但它也不会添加太多复杂性。原则上,它可以以最小的成本或干扰插入现有的工作流程中。

该论文承认,一个复杂的对手可能会尝试制作能够保留固定点状态的对抗性修改;但是,研究人员认为,这样的努力可能会引入可见的伪影,从而破坏攻击。

虽然作者并不声称固定点JPEG可以取代更广泛的来源系统,如C2PA,但他们建议固定点方法可以通过提供额外的篡改证据来补充外部元数据框架,这种证据即使元数据被剥离或丢失也会持续存在。

结论

JPEG固定点方法提供了一个简单而自成体系的替代方案,用于传统的认证系统,不需要嵌入的元数据、水印或外部参考文件,而是直接从压缩过程的可预测行为中推导出真实性。

通过这种方式,该方法重新利用JPEG压缩——一种频繁的数据降级来源——作为完整性验证的机制。在这方面,该论文是过去几年中我遇到的最具创新性和发明性的方法之一,用于解决这个问题。

这项新工作指向了一种从分层添加的安全方法转向利用媒体本身的内置特性的方法。随着篡改方法变得更加复杂,测试图像自身内部结构的技术可能会变得更加重要。

此外,为了解决这个问题而提出的许多替代系统会引入显著的摩擦,需要对长期以来可靠运行的成熟图像处理工作流进行修改——这些工作流需要更强有力的理由来重新工具化。

 

* 我将作者的内联引用转换为超链接。

首次发表于2025年4月25日

机器学习撰稿人,专注于人类图像合成的领域专家。曾任 Metaphysic.ai 的研究内容负责人,直至其并入 DNEG 的 Brahma.ai。
网站: martinanderson.ai
联系:martin@martinanderson.ai