Anderson 视角

通过基于CNN的图像重采样提高机器学习性能

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Google Research提出了一个新的方法,通过改进图像预处理阶段的图像缩放方式,提高图像基于计算机视觉训练工作流的效率和准确性。

在论文《学习图像重采样用于计算机视觉任务》中,研究人员Hossein Talebi和Peyman Milanfar使用CNN创建了一个新的混合图像重采样架构,该架构在四个流行的计算机视觉数据集上获得了显著的识别结果改进。

所提出的识别和重采样联合框架。来源:https://arxiv.org/pdf/2103.09950.pdf

所提出的识别和重采样联合框架。来源:https://arxiv.org/pdf/2103.09950.pdf

论文指出,目前在自动机器学习管道中使用的重采样/缩放方法已经过时,通常只使用基本的双线性、双三次和最近邻居重采样——这些方法对所有像素进行无差别处理。

相比之下,所提出的方法通过CNN增强图像数据,并将输入合并到最终通过模型架构的重采样图像中。

AI训练中的图像约束

为了训练处理图像的模型,机器学习框架将包括一个预处理阶段,在这个阶段,各种大小、色彩空间和分辨率的图像(这些图像将贡献到训练数据集中)将被系统地裁剪和重采样到一致的尺寸和稳定的单一格式。

通常,这将涉及一些基于PNG格式的折衷,需要在处理时间/资源、文件大小和图像质量之间进行权衡。

在大多数情况下,处理后的图像的最终尺寸非常小。下面我们看到一个早期的深度伪造数据集的例子,该数据集是在80×80分辨率下生成的:

这是早期深度伪造数据集生成时使用的80x80分辨率。

由于面部(和其他可能的主题)很少能完美地适应所需的正方形比例,可能需要添加黑色条形(或允许浪费空间)以使图像同质化,从而进一步减少实际可用的图像数据:

这里面部已从较大图像区域中提取出来,尽可能经济地裁剪以包含整个面部区域。然而,如左图所示,剩余区域的大部分将不会在训练中使用,这增加了重采样数据的图像质量的重要性。

这里面部已从较大图像区域中提取出来,尽可能经济地裁剪以包含整个面部区域。然而,如右图所示,剩余区域的大部分将不会在训练中使用,这增加了重采样数据的图像质量的重要性。

随着近年来GPU能力的提高,新一代NVIDIA卡配备了越来越多的视频RAM(VRAM),平均贡献图像大小开始增加,尽管224×224像素仍然是相当标准的(例如,这是ResNet-50数据集的大小)。

一个未重采样的224x244像素图像。

一个未重采样的224×244像素图像。

将批次装入VRAM

图像必须全部为相同大小的原因是,梯度下降,即模型随时间改进的方法,需要统一的训练数据。

图像必须如此小的原因是它们必须在训练过程中以小批量(通常为6-24张图像)完全解压缩地加载到VRAM中。批次图像太少,无法很好地泛化,并且会延长训练时间;批次图像太多,模型可能无法获得必要的特征和细节(见下文)。

训练架构中的“实时加载”部分称为潜在空间。这是特征从相同数据(即相同图像)中反复提取,直到模型收敛到一个状态,即它具有足够的泛化知识来执行后续未见数据的转换。

此过程通常需要几天时间,但也可能需要一个月或更长时间的高容量24/7计算来实现有用的泛化。VRAM大小的增加只在一定程度上有帮助,因为图像分辨率的微小增加可能会对处理能力产生数量级的影响,并可能对准确性产生不利影响。

使用更大的VRAM容量来容纳更大的批次大小也是一个混合的祝福,因为通过这种方式获得的更快的训练速度可能会被不太精确的结果所抵消。

因此,由于训练架构受到如此多的限制,任何能够在现有管道限制内改进的方法都是一个显著的成就。

高级缩小如何帮助

训练数据集中的图像质量已经被证明对训练结果有改进作用,特别是在物体识别任务中。2018年,来自马克斯·普朗克智能系统研究所的研究人员认为,重采样方法的选择会显著影响训练性能和结果。

此外,谷歌之前的工作(由新论文的作者共同撰写)发现,通过控制数据集图像中的压缩伪影,可以提高分类准确率。

谷歌研究提出的下采样算法的CNN架构。

谷歌研究提出的下采样算法的CNN架构。

新提出的重采样器中的CNN模型将双线性重采样与“跳过连接”功能相结合,可以将训练网络的输出合并到重采样图像中。

与典型的编码器/解码器架构不同,新提议可以不仅作为前馈瓶颈,还可以作为任何目标大小和/或宽高比的逆瓶颈。另外,标准的重采样方法可以被任何其他合适的传统方法所取代,例如Lanczos。

高频细节

新方法生成的图像似乎将关键特征(最终将被训练过程识别)直接“烘焙”到源图像中。在美学上,结果是非传统的:

新方法应用于四个网络——Inception V2;DenseNet-121;ResNet-50;和MobileNet-V2。谷歌研究图像下采样/重采样方法的结果产生了明显的像素聚集,预测了训练过程中将被识别的关键特征。

新方法应用于四个网络——Inception V2;DenseNet-121;ResNet-50;和MobileNet-V2。谷歌研究图像下采样/重采样方法的结果产生了明显的像素聚集,预测了训练过程中将被识别的关键特征。

研究人员指出,这些初始实验仅针对图像识别任务进行了优化,并且他们的基于CNN的“学习重采样器”在这些任务中能够实现更好的错误率。研究人员计划在未来将该方法应用于其他类型的基于图像的计算机视觉应用。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai