Anderson 视角
解决计算机视觉数据集中的JPEG伪影问题

马里兰大学和Facebook AI的一项新研究发现,深度学习系统使用高度压缩的JPEG图像会导致“显著的性能损失”,并提出了一些新的方法来减轻这种影响。
该报告,题为《分析和减轻深度学习中JPEG压缩缺陷》,声称比以前的研究更全面,研究了JPEG伪影对计算机视觉数据集的影响。该论文发现,“重度至中度JPEG压缩会对标准指标造成显著的性能损失”,并且神经网络可能不像以前的工作所建议的那样对此类扰动具有弹性。

2018年MobileNetV2数据集中的狗照片。在质量10(左)时,分类系统无法识别正确的品种“彭布罗克威尔士柯基犬”,而是猜测“诺维奇梗犬”(系统已经知道这是狗的照片,但不知道品种);从左数第二,经过JPEG伪影纠正的图像仍然无法识别正确的品种;从右数第二,目标伪影纠正恢复了正确的分类;右侧为原始照片,正确分类。来源:https://arxiv.org/pdf/2011.08932.pdf
压缩伪影作为“数据”
极端的JPEG压缩可能会在图像的8×8块中创建可见或半可见的边界,这些块组成图像的像素网格。一旦这些块状或“环形”伪影出现,它们可能会被机器学习系统误解为图像的真实世界元素,除非为此进行一些补偿。

上图,计算机视觉机器学习系统从高质量图片中提取“干净”的梯度图像。下图,低质量保存的图像中的“块状”伪影遮挡了图像的特征,并可能最终“感染”图像集中的特征,特别是在图像集中同时包含高质量和低质量图像的情况下,例如仅应用了通用数据清理的网络抓取集合。来源:http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
如上图所示,这种伪影会影响图像分类任务,并且对文本识别算法也有影响,后者可能无法正确识别受伪影影响的字符。
在图像合成训练系统(如深度伪造软件或基于GAN的图像生成系统)中,数据集中一个“流氓”块的低质量、高度压缩图像可能会降低复制的中位数质量,或者被数据集中更高质量的特征所淹没和覆盖。在这两种情况下,都是需要更好的数据——或者至少是需要一致的数据。
JPEG——通常“足够好”
JPEG压缩是一种不可逆的有损编码,可以应用于各种图像格式,尽管它主要应用于JFIF图像文件包装器。尽管如此,JPEG(.jpg)格式是以其相关的压缩方法命名的,而不是JFIF包装器。
近年来,出现了许多包含JPEG风格伪影缓解的机器学习架构,并且基于AI的压缩伪影去除已经被纳入多个商业产品中,例如Topaz图像/视频套件和Adobe Photoshop的神经特征。
由于1986年JPEG方案目前在常用中被锁定在1990年代初期,所以不可能在图像中添加元数据来指示JPEG图像的质量级别(1-100)——至少,不可能在不修改超过30年来消费者、专业和学术软件系统的前提下添加元数据。
因此,通常会根据JPEG图像数据的评估或已知质量来定制机器学习训练例程。没有“质量”元数据条目,通常需要知道图像的压缩细节(即从无损源压缩),或者通过感知算法或手动分类来估计质量。
经济上的妥协
JPEG并不是唯一一种会影响机器学习数据集质量的有损压缩方法;PDF文件中的压缩设置也可以丢弃信息,并且可以设置为非常低的质量级别,以便在本地或网络存档中节省磁盘空间。
这可以通过对archive.org上的各种PDF进行采样来证明,其中一些PDF被压缩得如此严重,以至于成为图像或文本识别系统的一大挑战。在许多情况下,例如受版权保护的书籍,这种强烈的压缩似乎是作为一种廉价的数字版权管理(DRM)手段应用的,类似于版权持有者可能会降低用户上传到YouTube上的视频的分辨率,以促进“全分辨率”购买,而不是删除它们。
在许多其他情况下,分辨率或图像质量较低只是因为数据非常旧,来自当地和网络存储更昂贵、网络速度有限、优先考虑高度优化和便携的图像而不是高质量的图像复制的时代。
有人认为JPEG虽然不是现在最好的解决方案,但已经成为不可移除的遗留基础设施,基本上与互联网的基础设施交织在一起。
遗留负担
尽管后来的创新,如JPEG 2000、PNG和(最近的).webp格式提供了更好的质量,但重新采样旧的、非常流行的机器学习数据集将会“重置”学术界中计算机视觉挑战的连续性和历史——这也将适用于重新保存PNG数据集图像以更高质量设置的情况。这可以被认为是一种技术债务。
虽然像ImageMagick这样的老牌服务器驱动图像处理库支持更好的格式,包括.webp,但图像转换要求通常发生在不支持除JPG或PNG(提供无损压缩,但以延迟和磁盘空间为代价)以外任何格式的遗留系统中。甚至WordPress,几乎40%的网站都使用的内容管理系统,仅在三个月前才添加了.webp支持。
PNG是在1990年代后期作为对1995年Unisys和CompuServe关于LZW压缩格式(用于GIF文件)的声明的回应而出现的开源解决方案,尽管GIF文件在2010年代初期因其能够提供低带宽、快速的动画内容而复兴(讽刺的是,动画PNG从未获得流行或广泛支持,甚至在2019年被Twitter禁止)。
尽管JPEG压缩有其缺点,但它压缩速度快、空间效率高,并且深深植根于所有类型的系统中——因此,它不太可能在近期从机器学习场景中完全消失。
使AI和JPEG共存
机器学习社区已经在一定程度上适应了JPEG压缩的怪癖:2011年,欧洲放射学会(ESR)发表了一项关于“不可逆图像压缩在放射学成像中的可用性”的研究,提供了“可接受”的损失指南;当著名的MNIST文本识别数据集(其图像数据最初以二进制格式提供)被移植到“正常”的图像格式时,选择了JPEG,而不是PNG;2020年,新论文的作者提出了一个“新颖的架构”,用于校准机器学习系统以适应JPEG图像质量的缺陷,而无需在每个JPEG质量设置上训练模型——这是新工作中使用的功能。
研究JPEG质量可变数据的实用性是机器学习中一个相对繁荣的领域。2016年,马里兰大学自动化研究中心的一个无关项目实际上集中在DCT域(JPEG伪影在低质量设置下发生),作为深度特征提取的一种途径;2019年,另一个项目专注于JPEG数据的字节级读取,而无需耗时的解压缩图像(即,在自动工作流程中打开图像);2019年,法国的一项研究积极利用JPEG压缩来服务对象识别例程。
测试和结论
回到马里兰大学和Facebook的最新研究,研究人员旨在测试JPEG图像在10-90的压缩质量下的可理解性和实用性(低于该值,图像会变得扭曲,高于该值,图像等同于无损压缩)。用于测试的图像在目标质量范围内的每个值都进行了预压缩,涉及至少八次训练会话。
模型使用四种方法在随机梯度下降法上进行训练:基线,无额外缓解措施;有监督的微调,训练集具有预训练权重和标记数据的优势(尽管研究人员承认,这在消费级应用中很难复制);伪影纠正,压缩图像在训练前进行增强/改进;以及任务目标伪影纠正,其中伪影纠正网络在返回的错误上进行微调。
训练发生在各种数据集上,包括多个ResNet变体、FastRCNN、MobileNetV2、MaskRCNN和Keras的InceptionV3。
任务目标伪影纠正后的样本损失结果如下图所示(越低越好)。

由于研究人员的发现分散在评估JPEG伪影和提出新的缓解方法之间,因此无法深入研究该研究中获得的结果。基本上,该新报告将自己定位为一个全面参考,解决多个问题。
尽管如此,该论文得出结论,JPEG压缩对重度至中度压缩设置具有“陡峭的惩罚”;其新颖的无标签缓解策略在同类方法中取得了更好的结果;对于复杂任务,其有监督方法也优于同行,尽管没有接触到真实标签;以及这些新方法允许模型重用,因为获得的权重可以在任务之间转移。
在分类任务方面,该论文明确指出“JPEG降低了梯度质量并引入了定位错误”。
作者希望将未来的研究扩展到其他压缩方法,例如基本上被忽视的JPEG 2000,以及WebP、HEIF和BPG。他们还建议,他们的方法可以应用于类似的视频压缩算法研究。
由于任务目标伪影纠正方法在研究中取得了如此成功的结果,作者还表示他们有意向发布在该项目中训练的权重,预计“[许多]应用将从使用我们的TTAC权重中受益,而无需任何修改。”
n.b. 文章的源图像来自thispersondoesnotexist.com












