Anderson 视角
相机捕捉的原始图像如何在AI改变之前恢复

如何在相机内部保护原始照片的完整性,防止AI干预?新的研究试图使用AI恢复相机传感器捕捉的原始图像。
过去一年中,AI图像的真实性增加了,导致许多团体和个人 反对 相关的信任危机。
在同一时期,内容来源和真实性联盟(C2PA)试图推广一种半加密标准,用于将元数据证明信息附加到图像上,从图像被相机或设备捕捉的那一刻开始,希望揭露图像在捕捉后是否使用了生成式AI。

C2PA系统的元数据证明模式,允许在图像捕捉时添加元数据,记录图像的变化,例如亮度和对比度的调整。 来源
然而,这个标准的采用并没有像预期的那样广泛,目前只有 14 台相机支持在相机内部嵌入真实性信息。
有趣的是,C2PA的想法是在图像产生时就给它一个“护照”,但到那时,相机制造商已经将AI处理嵌入到图像的创建过程中。

2024年论文“倡导相机捕捉图像的像素级认证”的图示,展示了现代相机管道如何在捕捉时引入虚构内容,以及像素级认证元数据如何揭示它。 来源
事实上,相机的图像信号处理器(ISP)中可能存在的AI“干预”可能最终成为图像处理的主要过程。
这种后处理与当前的照片编辑趋势不同,后者允许用户在照片下载之前重新编辑照片。
相反,处理发生在相机的“黑盒”中,通常在一个不公开或不可用的专有运行时中。
因此,当你看到照片时,它可能已经经过了AI辅助的增强,例如 低光照增强、 月亮替换 等。
在许多情况下,这可能导致不准确的重构,例如文本的重构,这可能会使图像无法用于证据,因为原始的“原始”图像将不可用。

新论文中的一个RAW传感器图像被GenAI启用的ISP处理,产生一个看起来更清晰但可能包含虚构细节的最终sRGB输出。 来源
上述例子来自一篇新论文,提出了一种方法来恢复“真实”的图像,使用替代的AI过程从处理后的图像中重构估计的原始和未经篡改的图像。
作者表示:
‘当AI模型使用生成或感知损失训练时,它们容易产生虚构内容,可能改变图像的含义。其含义是,直接从相机输出的图像可能包含“虚假”的内容,特别是在智能手机相机中,AI-ISP模块正在被越来越多地采用。’
‘在相机中使用GenAI标志着我们对相机图像的看法发生了范式转变,并挑战了传统的对相机捕捉图像的信任观念。’
新工作使用了一个非常轻量的编码器和 MLP 解码器,可以在图像中嵌入,权重惩罚仅为180kb。目标是开发能够在实时中提取原始图像的编码系统。

新论文中,GenAI基于的超分辨率在相机ISP中可以微妙地改变面部特征,改变外观或感知到的身份,通过改变凝视和嘴形。低光照增强可以类似地修改图像内容,影响解释,尽管提高了视觉质量。在QR码示例中,增强使图像更具吸引力,但使其无法扫描。该方法可以恢复原始图像,在这些虚构之前。
或者,相机制造商可以让用户访问真正未经处理的传感器数据;然而,这似乎只会限制在高端设备上。在移动和消费者领域,访问非处理图像可能被认为是一种“小众”或边缘追求。
虽然消费者相机一直应用某种程度的后处理,但在边缘AI之前,使用的算法是最小的“解释性”的,不太可能以与当前AI方法相同的方式改变照片的内容。
值得注意的是,三星的“月亮替换”政策曾经受到公众的批评,三星的AI中心是新工作的参与者之一,这项工作由多伦多大学的五位研究人员领导。
方法
作者使用了迄今为止唯一直接解决摄像头干预问题的项目:2024年的论文 倡导相机捕捉图像的像素级认证,该论文提出了一个“二进制认证掩码”,用于分隔摄像头AI处理改变的区域:

2024年论文的“真实性掩码”显示了相机中的AI“平滑”过程影响的区域。
然而,该系统没有提供一种方法来恢复“真实”的图像,而新工作解决了这个问题,同时承认了对早期工作的债务。
新工作的目标是使用户能够恢复一个尽可能接近相机传感器在处理之前捕捉的原始图像。

所提出方法的概述。在(A)中,在捕获时,ISP输出图像包含虚构内容,通过一个预训练的编码器,并将其潜在特征与空间坐标结合,输入一个MLP,预测非虚构图像,训练由真实图像的损失引导。然后将编码器和MLP的权重保存为图像的元数据。在(B)中,在推理时,从元数据中检索这些权重,并使用编码器和MLP来重构非虚构图像。
在捕获时,新方法将处理后的图像通过一个 冻结 编码器,转换为紧凑的 潜在表示。然后,将相关的空间坐标与这些特征结合,输入一个轻量的MLP,按像素操作,预测原始图像内容,有效地学习通过 重构损失 对抗虚构元素,针对真实目标。
编码器和解码器是在 成对的 真实和虚构图像上预训练的,然后快速 微调 每个捕获的图像,其 权重 作为元数据保存在图像本身中,仅增加了一个小的大小开销。
在查看时,存储的权重被提取和重用,运行相同的编码器和MLP,允许恢复一个尽可能接近相机传感器最初捕捉的图像,而不引入新的合成内容。
数据和测试
作者使用了两个最常见的ISP后处理任务进行测试:超分辨率(SR)和低光照摄影。
对于自然图像SR测试,包含许多文本的例子被纳入数据,因为ISP SR例程已知会改变文本(例如车牌号码,但请参见文章前面的示例)。由于文本失真是一个独立的问题,因此它被视为SR测试的一个子集,并具有专用数据。
提到的编码器针对每个测试的两个模式进行了训练,并根据在捕获时可能参与的AI ISP模块选择(例如,在黑暗条件下,一个“低光照”模块)。
作者使用了 DIV2K 数据集进行超分辨率训练,使用了流行的 RealESRGAN 网络。在2024年关于ISP干预的工作中,研究人员生成了成对的数据,包含未受影响和虚构的内容。
对于文本SR部分,作者使用了2023年的 MARCONet 文本SR模型:

2023年MARCONet论文中的低分辨率和等效的上采样文本示例。 来源
为了创建成对的数据,研究人员将非虚构的图像运行通过MARCONet。从项目的原始代码中生成了2000张图像,其中200张用于验证,另外200张用于测试。
对于低光照测试,采用了2018年一篇中国论文的 LOw-Light(LOL)数据集:

2018年LOL数据集中的同一张图片在不同曝光度和亮度下。 来源
对手框架
为了评估该方法,作者将其与三个特定的基线进行了比较,这些基线是在匹配的条件下训练的。首先,SIREN 和 NeRF 在成对的真实和虚构图像上预训练,然后在捕获时与所提出方法相同的时间内进行了微调,提供了与NeRF的直接比较。
第二,使用 Instant-NGP 中的 hashgrid 方法,学习了一个编码,并将哈希表条目和MLP 联合优化。
第三,实现了一个使用 NAFNet 的64MB模型的盲图像到图像翻译基线,作为一个像素到像素的 回归 系统,训练时没有使用元数据。
在训练中,使用了 Adam 优化器,基于 PyTorch,用于预训练和微调。编码器和MLP在50,000个 epoch 中训练,批量大小为32,针对每个任务(例如SR、文本SR、低光照)训练了特定模式的编码器。
微调发生在大约 三秒 内,在具有32GB VRAM的NVIDIA V100 GPU上。作者注意到,虽然在设备上优化是目标环境和场景,但对于所有框架来说,这并不是现实的,因此所有测试都在桌面环境中进行。

与使用元数据的MLP基线(包括SIREN、NeRF和哈希网格方法)以及使用NAFNet的盲恢复的性能比较。结果以分贝为单位的PSNR报告,跨三个任务:DIV2K上的自然图像超分辨率;MARCONet上的文本超分辨率;以及LOL上的低光照增强,所提出方法在每种情况下都获得了最高分数。
对于MLP方法,性能严重依赖于输入表示,其中仅使用空间坐标的模型在预训练期间挣扎,并且在有限的微调阶段无法改善。添加颜色信息会带来更好的结果。
使用NAFNet的盲恢复在DIV2K上表现良好,在那里从降级图像到清晰图像的映射相对稳定,但在MARCONet和LOL上失败了,在那里存在多个合理的重构,并且模型缺乏解决这种歧义所需的信息。
这种效果在低光照增强中最为明显,因为原始场景的亮度无法从处理后的图像中可靠地推断出来。
作者表示:
‘在合成MARCONet数据中,具有不同模糊强度的图像映射到相同的虚构图像。可以从结果中看出,我们提出的方法在所有数据集上都优于竞争对手。’

在上面的比较中,我们可以看到不同方法在给定时间内的性能如何。从头开始训练一个模型可以产生强大的结果,如SIREN、NeRF和哈希网格所示,但这需要太长时间,无法在相机内部实现。
相反,作者的方法在捕获时进行了大部分工作,并进行了快速调整,使其能够在紧密的时间限制内(3、5或10秒)提供更好的结果。

与使用元数据的MLP基线(包括SIREN、NeRF和哈希网格方法)以及使用NAFNet的盲恢复的性能比较。结果以分贝为单位的PSNR报告,跨三个任务:DIV2K上的自然图像超分辨率;MARCONet上的文本超分辨率;以及LOL上的低光照增强,所提出方法在每种情况下都获得了最高分数。请参阅源论文以获取稍好的分辨率。
上面显示了DIV2K上的定性结果,其中增强方法引入了可见的虚构内容。一个基于GAN的超分辨率模型改变了眼睛的颜色,而盲恢复难以重构原始图像。NeRF和哈希网格在结构化区域(如窗户和文本)中产生了伪影,而所提出方法更接近真实图像。

最后,在上面的图中,我们看到LOL数据集的结果,亮度已调整以便于可视化。
盲恢复无法解析未知的亮度尺度,而所提出方法更好地重构了纹理,并恢复了改变的字符,例如将“1”改回“i”,而不会添加伪影。
结论
很可能,“相机永远不会撒谎”这一说法从来都不是可辩护的。拍摄和呈现照片的每个决定都是一个政治或社会决定。
即使是最古老的后处理方法,例如 曝光补偿和烧制(早已转移到Photoshop工具中),都是高度主观的艺术决定和偏好表现。
然而,这并不是放弃“客观”图像捕捉目标的理由;似乎合理的是,平均消费者应该被允许,即使有一些困难,也能访问他们拍摄的照片的“未经处理”的原始传感器数据;或者至少,他们应该被允许将ISP后处理限制为非AI算法,如他们所期望的。
首次发布于2026年4月24日,星期五












