Anderson 视角
使用JPEG压缩提高神经网络训练

加拿大的一篇新研究论文提出了一个故意将JPEG压缩引入神经网络训练方案的框架,并取得了更好的结果——以及对对抗性攻击的更好抵抗力。
这是一个相当激进的想法,因为当前的普遍智慧是,JPEG伪影,优化为人类视觉,而不是机器学习,通常对训练在JPEG数据上的神经网络有不利影响。

不同损失值下JPEG图像的清晰度差异示例(更高的损失允许更小的文件大小,但会损害色彩渐变和其他类型的伪影)。来源:https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937
2022年,马里兰大学和Facebook AI的一份报告断言,JPEG压缩在神经网络训练中“会带来显著的性能损失”,尽管之前的工作声称神经网络对图像压缩伪影具有相对的鲁棒性。
在此之前,一年,文献中出现了一种新的思路:JPEG压缩实际上可以被利用来提高模型训练的结果。
然而,尽管这篇论文的作者能够在JPEG图像的不同质量水平上获得更好的结果,但他们提出的模型太复杂和繁琐,因此不可行。此外,该系统使用默认的JPEG优化设置(量化)证明是训练有效性的障碍。
后来的一个项目(2023年的《JPEG兼容压缩用于DNN视觉》)尝试使用一个系统,该系统使用冻结的深度神经网络(DNN)模型获得了略好的结果,但冻结模型的部分在训练过程中会降低模型的通用性和对新数据的鲁棒性。
JPEG-DL
相反,新的工作《JPEG启发的深度学习》提供了一个更简单的架构,可以甚至被应用于现有的模型。
研究人员,来自滑铁卢大学,指出:
‘结果表明,JPEG-DL在各种DNN架构上显著且一致地优于标准DL,增加了128个可训练参数到DL管道。另外,JPEG-DL的优势在于提高了对抗性鲁棒性和减少了输入图像的文件大小。’
特别地,JPEG-DL在某些细粒度分类数据集上提高了分类准确率最高20.9%,同时仅增加了128个可训练参数到DL管道。 ‘
作者认为,JPEG压缩的最佳质量水平可以帮助神经网络区分图像的中心主题。在下面的例子中,我们看到基线结果(左)将鸟融入背景,而JPEG-DL(右)成功地区分和勾勒出图像的主题。

JPEG-DL的基线方法测试。 来源:https://arxiv.org/pdf/2410.07081
‘这种现象,’ 他们解释说, ‘被称为“压缩帮助”在[2021]的论文中,是因为压缩可以去除噪声和干扰背景特征,从而突出图像的主要对象,这有助于DNNs做出更好的预测。’
方法
JPEG-DL引入了一个可微分的软量化器,取代了标准JPEG优化过程中的不可微分的量化操作。
这允许对图像进行基于梯度的优化。这在传统的JPEG编码中是不可能的,因为它使用一个统一的量化器和一个近似最近系数的舍入操作。
JPEG-DL的可微分性允许对训练模型的参数和JPEG量化(压缩级别)进行联合优化。联合优化意味着模型和训练数据都被适应到彼此,在端到端的过程中,不需要冻结任何层。
本质上,该系统根据一般化过程的逻辑定制原始数据集的JPEG压缩。

JPEG-DL的概念架构。
有人可能会认为,原始数据是理想的训练食物;毕竟,图像在运行批处理时完全解压缩到适当的全长色空间;那么,原始格式有什么区别呢?
好吧,由于JPEG压缩是针对人类视觉进行优化的,因此它会以符合这一目标的方式抛弃细节或颜色的区域。给定一张湖泊在蓝天下的图片,会对天空应用更高的压缩级别,因为它不包含“必要”的细节。
另一方面,神经网络缺乏使我们能够专注于中心主题的奇特过滤器。相反,它可能会将天空中的带状伪影视为有效的数据来吸收到其潜在空间中。

虽然人类会忽略重压缩图像(左)中的天空带状,但神经网络不知道该内容应该被丢弃,需要更高质量的图像(右)。来源:https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/
因此,一个JPEG压缩级别不太可能适用于整个训练数据集,除非它代表一个非常具体的领域。例如,人群的图片需要比狭焦距的鸟的图片少得多的压缩。
作者观察到,对于那些不熟悉量化挑战但熟悉变压器架构基础的人,可以将这些过程视为“注意力操作”,广义上讲。
数据和测试
JPEG-DL被评估为基于变压器的架构和卷积神经网络(CNNs)。使用的架构包括EfficientFormer-L1;ResNet;VGG;MobileNet;和ShuffleNet。
ResNet版本用于CIFAR数据集:ResNet32,ResNet56和ResNet110。VGG8和VGG13被用于VGG基于的测试。
对于CNN,训练方法来自2020年的工作《对比性表示蒸馏》。对于EfficientFormer-L1(基于变压器),使用了2023年的工作《用更大的模型初始化模型》的训练方法。
对于精细任务,四个数据集被使用:斯坦福狗;牛津大学的花;CUB-200-2011(加州理工学院鸟类);和宠物(“猫和狗”——牛津大学和印度海得拉巴的合作)。
对于CNN上的精细任务,作者使用了PreAct ResNet-18和DenseNet-BC。对于EfficientFormer-L1,使用了上述《用更大的模型初始化模型》的方法。
在CIFAR-100和精细任务中,JPEG压缩方法的不同大小的离散余弦变换(DCT)频率被Adam优化器处理,以适应JPEG层的学习率。
在ImageNet-1K测试中,作者使用了PyTorch,使用了SqueezeNet、ResNet-18和ResNet-34作为核心模型。
对于JPEG层优化评估,研究人员使用了随机梯度下降(SGD)而不是Adam,为了更稳定的性能。然而,对于ImageNet-1K测试,使用了2019年论文《学习步长量化》的方法。

上图为CIFAR-100上基线与JPEG-DL的top-1验证准确率,平均三个运行的标准和平均偏差。下图为多种模型架构上的多种细粒度图像分类任务的top-1验证准确率,同样平均三个运行。
作者评论说:
‘在所有七个测试模型中,JPEG-DL一致地提供了改进,最高在CIFAR-100上top-1准确率提高了1.53%。在细粒度任务中,JPEG-DL提供了显著的性能提高,最高在所有数据集上提高了20.90%。 ‘
ImageNet-1K测试的结果如下:

ImageNet上多种框架的top-1验证准确率结果。
这里,论文指出:
‘通过增加128个参数,JPEG-DL相对于使用单轮量化操作的基线,SqueezeNetV1.1的top-1准确率提高了0.31%。 ‘
‘通过增加量化轮数到五,我们观察到额外的0.20%的改进,导致总共比基线提高0.51%。 ‘
研究人员还测试了系统,使用了对抗性攻击方法,包括Fast Gradient Signed Method(FGSM)和Projected Gradient Descent(PGD)。
攻击是在CIFAR-100上进行的,使用了两个模型:

JPEG-DL对两种标准对抗性攻击框架的测试结果。
作者指出:
‘JPEG-DL模型显著提高了对抗性鲁棒性,与标准DNN模型相比,最高提高了15%(FGSM)和6%(PGD)。 ‘
此外,如前所述,作者还进行了使用GradCAM++的特征图比较——一个可以以视觉方式突出提取特征的框架。

基线和JPEG-DL图像分类的GradCAM++示例,突出显示提取的特征。
论文指出,JPEG-DL产生了更好的结果,并且在某些情况下,甚至能够分类基线模型无法识别的图像。关于前面提到的图像,作者指出:
‘很明显,JPEG-DL模型的特征图比基线模型的特征图更好地显示了前景信息(鸟)和背景之间的对比。 ‘
‘特别地,JPEG-DL特征图中的前景对象被一个清晰的轮廓所包围,使其与背景区别开来。 ‘
‘相比之下,基线模型的特征图显示出更为模糊的结构,其中前景包含更高的低频能量,导致其更平滑地融入背景中。 ‘
结论
JPEG-DL旨在用于原始数据可用的情况——但最有趣的是,看看是否可以将一些本项目中的原理应用于传统的数据集训练,其中内容可能质量较低(如互联网上爬取的大规模数据集)。
就目前而言,这仍然主要是一个注释问题,尽管它已在基于交通的图像识别等领域得到解决。
首次发表于2024年10月10日,星期四












