Anderson 视角

JPEG AI 模糊了真实和合成图像之间的界限

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Created with ChatGPT-4o and Adobe Firefly

今年二月,JPEG AI 国际标准发布,这是经过几年的研究后使用机器学习技术生产出一种更小、更容易传输和存储的图像编码,而不损失感知质量。

从 JPEG AI 官方发布流中比较峰值信噪比(PSNR)和 JPEG AI 的机器学习增强方法。来源:https://jpeg.org/jpegai/documentation.html

从 JPEG AI 官方发布流中比较峰值信噪比(PSNR)和 JPEG AI 的机器学习增强方法。 来源:https://jpeg.org/jpegai/documentation.html

这可能是因为核心 PDF 文件不通过免费访问门户如 Arxiv 发布。然而,Arxiv 已经发表了多项研究,研究了 JPEG AI 在多个方面的意义,包括其不寻常的 压缩伪影 和其 对法医的意义

一项研究比较了压缩伪影,包括 JPEG AI 早期草稿的伪影,发现新方法倾向于模糊文本——在可能为证据链做出贡献的案例中,这不是一个小问题。来源:https://arxiv.org/pdf/2411.06810

一项研究比较了压缩伪影,包括 JPEG AI 早期草稿的伪影,发现新方法倾向于模糊文本——在可能为证据链做出贡献的案例中,这不是一个小问题。 来源:https://arxiv.org/pdf/2411.06810

因为 JPEG AI 以模拟合成图像生成器伪影的方式改变图像,所以现有的法医工具 难以区分 真实和虚假图像:

JPEG AI 压缩后,最新算法无法可靠地将真实内容与操纵区域区分开来,根据最近的一篇论文(2025 年 3 月)。左侧的源示例是操纵/虚假图像,其中篡改区域在标准法医技术下清晰可见(中间图像)。然而,JPEG AI 压缩使虚假图像具有可信度(最右侧的图像)。来源:https://arxiv.org/pdf/2412.03261

JPEG AI 压缩后,最新算法无法可靠地将真实内容与操纵区域区分开来,根据最近的一篇论文(2025 年 3 月)。左侧的源示例是操纵/虚假图像,其中篡改区域在标准法医技术下清晰可见(中间图像)。然而,JPEG AI 压缩使虚假图像具有可信度(最右侧的图像)。 来源:https://arxiv.org/pdf/2412.03261

一个原因是 JPEG AI 使用与法医工具旨在检测的生成系统类似的模型架构:

新论文展示了 AI 驱动的图像压缩和实际 AI 生成图像的方法之间的相似性。来源:https://arxiv.org/pdf/2504.03191

新论文展示了 AI 驱动的图像压缩和实际 AI 生成图像的方法之间的相似性。 来源:https://arxiv.org/pdf/2504.03191

因此,两种模型可能会产生一些相似的潜在视觉特征,从法医的角度来看。

量化

这种交叉点是因为 量化,这两种架构都使用了量化,并且在机器学习中既用于将连续数据转换为离散数据点,也用于作为可以显著减小训练模型文件大小的 优化技术 (对图像合成的爱好者来说,量化是指在官方模型发布和社区发布可在本地硬件上运行的量化版本之间的等待时间)。

在这种情况下,量化是指将图像的 潜在表示 中的连续值转换为固定、离散步骤的过程。JPEG AI 使用此过程来 减少 存储或传输图像所需的数据量,通过简化内部数值表示。

虽然量化使编码更加高效,但也会引入结构规则,这些规则可能类似于生成模型留下的伪影——足够微妙以避免被察觉,但会破坏法医工具。

作为回应,一篇新论文 提出了一种名为 三种 JPEG AI 图像法医线索 的可解释、非神经网络技术,用于检测 JPEG AI 压缩;确定图像是否被重压缩;并区分压缩的真实图像和完全由 AI 生成的图像。

方法

色彩相关性

该论文提出了三个针对 JPEG AI 图像的“法医线索”:色彩通道相关性,在 JPEG AI 的预处理步骤中引入;可测量的图像质量失真,在重复压缩中会显示出重压缩事件;以及 潜在空间量化模式,有助于区分 JPEG AI 压缩图像和 AI 模型生成的图像。

关于基于色彩相关性的方法,JPEG AI 的预处理管道在图像的色彩通道之间引入了统计依赖性,创建了一个可以用作法医线索的签名。

JPEG AI 将 RGB 图像转换为 YUV 色彩空间,并执行 4:2:0 色度子采样,这涉及在压缩之前对 色度通道 进行下采样。这个过程会导致红、绿、蓝通道之间的高频残差出现微妙的相关性——这些相关性在未压缩图像中不存在,并且其强度与传统 JPEG 压缩或合成图像生成器产生的相关性不同。

JPEG AI 压缩如何改变图像中的色彩相关性,使用红色通道作为示例。面板(a)比较未压缩图像和 JPEG AI 压缩图像,显示压缩显著增加了通道间的相关性。面板(b)分离了 JPEG AI 的预处理效果——仅仅是色彩转换和子采样——表明即使这一步也会明显增加相关性。面板(c)显示传统 JPEG 压缩也会稍微增加相关性,但不如 JPEG AI 那样显著。面板(d)检查合成图像,Midjourney-V5 和 Firefly 显示出中等程度的相关性增加,而其他图像的相关性更接近未压缩图像的水平。

JPEG AI 压缩如何改变图像中的色彩相关性,使用红色通道作为示例。

上图来自论文,展示了 JPEG AI 压缩如何改变图像中的色彩相关性,使用红色通道作为示例。

面板 A 比较未压缩图像和 JPEG AI 压缩图像,显示压缩显著增加了通道间的相关性;面板 B 分离了 JPEG AI 的预处理效果——仅仅是色彩转换和子采样——表明即使这一步也会明显增加相关性;面板 C 显示传统 JPEG 压缩也会稍微增加相关性,但不如 JPEG AI 那样显著;面板 D 检查合成图像,Midjourney-V5 和 Firefly 显示出中等程度的相关性增加,而其他图像的相关性更接近未压缩图像的水平。

速率失真

速率失真线索通过跟踪图像质量如何在多次压缩中以可预测的模式下降来识别 JPEG AI 重压缩,图像质量由 峰值信噪比(PSNR) 测量。

研究表明,反复压缩图像使用 JPEG AI 会导致图像质量逐渐但可测量地下降,按照 PSNR 计算,并且这种逐渐下降形成了检测图像是否被重压缩的法医线索的基础。

与传统 JPEG 不同,传统 JPEG 跟踪特定图像块的变化,JPEG AI 需要不同的方法,因为其神经压缩架构;因此,作者建议监测比特率和 PSNR 如何在连续压缩中演变。每轮压缩都会改变图像,但比前一轮压缩的改变要小,这种减少的改变(当与比特率绘制时)可以显示图像是否经过多个压缩阶段:

重复压缩如何影响不同编解码器的图像质量。JPEG AI 和在 https://arxiv.org/pdf/1802.01436 开发的神经编解码器都表现出随着每次额外压缩而稳定下降的 PSNR,即使在较低的比特率下也是如此。相比之下,传统 JPEG 压缩在多次压缩中保持相对稳定的质量,除非比特率很高。这种模式作为重压缩留下的可测量痕迹,提供了潜在的法医信号。

重复压缩如何影响不同编解码器的图像质量,展示了 JPEG AI 和在 https://arxiv.org/pdf/1802.01436 开发的神经编解码器的结果;两者在每次额外压缩时都表现出稳定的 PSNR 下降,即使在较低的比特率下也是如此。相比之下,传统 JPEG 压缩在多次压缩中保持相对稳定的质量,除非比特率很高。

上图显示了 JPEG AI、另一个基于 AI 的编解码器和传统 JPEG 的速率失真曲线,发现 JPEG AI 和神经编解码器在所有比特率下都表现出一致的 PSNR 下降,而传统 JPEG 只在高比特率下显示出明显的劣化。这种行为提供了一个可量化的信号,可以用来标记重压缩的 JPEG AI 图像。

通过提取比特率和图像质量在多次压缩轮中如何演变,作者同样构建了一个签名,有助于标记图像是否被重压缩,提供了潜在的实际法医线索。

量化

正如我们之前所见,JPEG AI 提出的一个更具挑战性的法医问题是其与由扩散模型生成的合成图像的视觉相似性。两种系统都使用编码器-解码器架构来处理压缩的潜在空间,并且经常留下微妙的上采样伪影。

这些共享特征 可以混淆检测器,甚至那些在 JPEG AI 图像上重新训练的检测器。然而,一个关键的结构差异仍然存在:JPEG AI 应用量化,这是一步将潜在值四舍五入为离散级别以实现高效压缩的过程,而生成模型通常不这样做。

这篇新论文利用这种差异来设计一个间接测试量化存在的法医线索。该方法分析图像的潜在表示如何对四舍五入做出反应,假设如果图像已经被量化,其潜在结构将表现出与四舍五入值的可测量的对齐模式。

这些模式虽然对眼睛不可见,但会产生统计差异,有助于区分压缩的真实图像和完全由 AI 生成的图像。

平均傅里叶谱显示,JPEG AI 压缩图像和由扩散模型(如 Midjourney-V5 和 Stable Diffusion XL)生成的图像在频率域中都表现出规则的网格状模式——通常与上采样相关的伪影。相比之下,真实图像缺乏这些模式。这种光谱结构的重叠有助于解释为什么法医工具经常将压缩的真实图像与合成图像混淆。

平均傅里叶谱显示,JPEG AI 压缩图像和由扩散模型(如 Midjourney-V5 和 Stable Diffusion XL)生成的图像在频率域中都表现出规则的网格状模式——通常与上采样相关的伪影。相比之下,真实图像缺乏这些模式。

重要的是,作者表明这种线索在不同生成模型中都有效,即使压缩足够强烈以使潜在空间的整个部分归零。相比之下,合成图像对此四舍五入测试的反应要弱得多,提供了一种区分两者的实用方法。

结果被设计为一种轻量级且可解释的工具,针对压缩和生成之间的核心差异,而不是依赖于脆弱的表面伪影。

数据和测试

压缩

为了评估他们的色彩相关性线索是否可以可靠地检测到 JPEG AI 压缩(即从未压缩源的第一次传递),作者在 RAISE 数据集 中的高质量未压缩图像上进行了测试,这些图像使用 JPEG AI 参考实现以各种比特率进行压缩。

他们在色彩通道相关性的统计模式上训练了一个简单的 随机森林,并将其与在图像像素上直接训练的 ResNet50 神经网络进行比较。

使用色彩相关性特征检测 JPEG AI 压缩的准确性,跨多个比特率进行比较。该方法在较低的比特率下最为有效,在那里压缩伪影更强,并且在未见过的压缩级别上表现出比基线 ResNet50 模型更好的泛化能力。

使用色彩相关性特征检测 JPEG AI 压缩的准确性,跨多个比特率进行比较。该方法在较低的比特率下最为有效,在那里压缩伪影更强,并且在未见过的压缩级别上表现出比基线 ResNet50 模型更好的泛化能力。

虽然 ResNet50 在测试数据与其训练条件接近时实现了更高的准确率,但它难以 泛化 到不同的压缩级别。基于相关性的方法虽然更简单,但在比特率上表现出更好的一致性,特别是在 JPEG AI 的预处理影响更强的较低压缩率下。

这些结果表明,即使不使用深度学习,也可以使用统计线索来检测 JPEG AI 压缩,这些线索在解释和稳健性方面是可靠的。

重压缩

为了评估 JPEG AI 压缩是否可以被可靠地检测,研究人员测试了速率失真线索在不同比特率下压缩的图像集上——其中一些只压缩了一次,其他的使用 JPEG AI 再次压缩。

该方法涉及提取一个 17 维特征向量来跟踪图像的比特率和 PSNR 在三个压缩传递中如何演变。该特征集捕获了每一步损失了多少质量,以及潜在和 超先验 率如何表现——这些指标传统的基于像素的方法无法轻松访问。

研究人员在这些特征上训练了一个随机森林,并将其性能与在图像块上训练的 ResNet50 进行比较:

使用速率失真特征训练的随机森林检测 JPEG AI 图像是否被重压缩的分类准确性结果。该方法在初始压缩强(即比特率较低)时表现最佳,并且在第二次压缩比第一次压缩更温和的案例中始终优于基于像素的 ResNet50。

使用速率失真特征训练的随机森林检测 JPEG AI 图像是否被重压缩的分类准确性结果。该方法在初始压缩强(即比特率较低)时表现最佳,并且在第二次压缩比第一次压缩更温和的案例中始终优于基于像素的 ResNet50。

随机森林在初始压缩强(即比特率较低)时证明是非常有效的,揭示了单压缩和双压缩图像之间的明显差异。与之前的线索一样,ResNet50 难以泛化,特别是在训练期间未见过的压缩级别上。

速率失真特征相比之下保持了一致的性能。在不同场景中都有效,表明该方法可以推广到 JPEG AI 之外的其他 AI 基础编解码器。

JPEG AI 和合成图像

在最后一轮测试中,作者测试了他们的量化特征是否可以区分 JPEG AI 压缩图像和由模型(如 Midjourney、Stable DiffusionDALL-E 2Glide 和 Adobe Firefly)生成的完全合成图像。

为此,研究人员使用了 Synthbuster 数据集的一个子集,该子集混合了 RAISE 数据库中的真实照片和来自各种扩散和 GAN 基础模型的生成图像。

Synthbuster 中的合成图像示例,使用受 RAISE-1k 数据集中自然照片启发的文本提示生成。图像使用各种扩散模型创建,提示旨在产生逼真内容和纹理,而不是风格化或艺术化渲染,反映了该数据集专注于测试区分真实和生成图像的方法。

Synthbuster 中的合成图像示例,使用受 RAISE-1k 数据集中自然照片启发的文本提示生成。 来源:https://ieeexplore.ieee.org/document/10334046

真实图像使用 JPEG AI 在多个比特率下压缩,分类被提出为一个两类任务:要么是 JPEG AI 与特定生成器的比较,要么是特定比特率与 Stable Diffusion XL 的比较。

从固定 256×256 区域计算出的量化特征(从潜在表示中提取的相关性)被输入到一个随机森林分类器中。作为基线,一个 ResNet50 被训练在相同数据的图像块上。

使用量化特征将 JPEG AI 压缩图像与合成图像区分开来的随机森林的分类准确性。

使用量化特征将 JPEG AI 压缩图像与合成图像区分开来的随机森林的分类准确性。

在大多数条件下,基于量化的方法优于 ResNet50 基线,特别是在比特率较低、压缩伪影更明显的地方。

作者指出:

‘基线 ResNet50 对于 Glide 图像的准确率最高,达到 66.1%,但在其他情况下,其泛化能力不如量化特征。量化特征在压缩强度和生成器类型方面表现出良好的泛化能力。

‘被量化为零的系数的重要性在截断特征的性能中得到了体现,这些特征在许多情况下与 ResNet50 分类器的性能相当。

‘然而,使用未截断的完整整数向量的量化特征仍然表现出显著的改善。这些结果证实,量化后为零的数量是一个重要的线索,用于区分 AI 压缩和 AI 生成的图像。

‘然而,它也表明其他因素也有贡献。JPEG AI 的检测准确率在所有比特率下均超过 91.0%,更强的压缩会带来更高的准确率。’

使用 UMAP 对特征空间的投影显示了 JPEG AI 和合成图像之间的明显分离,较低的比特率会增加类之间的距离。测试的生成器中,Glide 是一个一致的异常值,其图像以不同的方式聚类,并且检测准确率是所有测试生成器中最低的。

基于量化特征的 JPEG AI 压缩图像和合成图像的二维 UMAP 可视化。左图显示,较低的 JPEG AI 比特率会使合成图像之间的距离增加;右图显示,来自不同生成器的图像在特征空间中以不同的方式聚类。

基于量化特征的 JPEG AI 压缩图像和合成图像的二维 UMAP 可视化。左图显示,较低的 JPEG AI 比特率会使合成图像之间的距离增加;右图显示,来自不同生成器的图像在特征空间中以不同的方式聚类。

最后,作者评估了特征在典型后处理(如 JPEG 重压缩或下采样)下的表现。虽然性能会随着处理的加重而下降,但这种下降是渐进的,表明该方法即使在降级条件下也保持了一定的稳健性。

量化特征在后处理(包括 JPEG 重压缩(JPG)和图像重采样(RS))下的稳健性评估。

量化特征在后处理(包括 JPEG 重压缩(JPG)和图像重采样(RS))下的稳健性评估。

结论

JPEG AI 不一定会被广泛采用。有足够的基础设施债务来阻碍 任何 新编解码器的采用;即使是一个具有良好血统和广泛共识的“传统”编解码器,例如 AV1,也很难 取代 长期建立的方法。

关于系统与 AI 生成器的潜在冲突,当前一代 AI 图像检测器可能受到的特征量化伪影可能会被后续系统中不同类型的痕迹所取代(假设 AI 生成器总是会留下法医残留,这并不是确定的)。

这意味着 JPEG AI 自身的量化特征,可能与新论文中确定的其他线索一起,可能不会与最有效的新一代生成式 AI 系统的法医痕迹发生冲突。

如果 JPEG AI 继续作为事实上的“AI 洗涤”运行,显著地模糊了真实和生成图像之间的区别,那么为其采用提出令人信服的理由将会很困难。

 

首次发布于 2025 年 4 月 8 日,星期二

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai