Anderson의 관점

JPEG 압축을 사용하여 신경망 훈련 개선

mm
Unite.AI를 Google의 선호 소스에 추가
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

캐나다의 새로운 연구 논문은 신경망의 훈련 방식에 의도적으로 JPEG 압축을 도입하는 프레임워크를 제안했으며, 더 나은 결과와 적대적 공격에 대한 더 나은 저항을 얻을 수 있었다.

이것은相当한 혁신적인 아이디어이다. 현재 일반적인 지혜는 JPEG 아티팩트가 인간의 시각을 위해 최적화되어 있기 때문에 기계 학습을 위해 최적화되지 않았기 때문에 JPEG 데이터로 훈련된 신경망에 일반적으로 해로운 영향을 미친다는 것이다.

다른 손실 값으로 압축된 JPEG 이미지의 차이 예시(더 높은 손실은 더 작은 파일 크기를 허용하지만 색상 그라데이션의 선명도와 밴딩 등 기타 아티팩트를 희생한다). 출처: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

다른 손실 값으로 압축된 JPEG 이미지의 차이 예시(더 높은 손실은 더 작은 파일 크기를 허용하지만 색상 그라데이션의 선명도와 밴딩 등 기타 아티팩트를 희생한다). 출처: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

2022년 메릴랜드 대학교와 페이스북 AI의 보고서에 따르면, JPEG 압축은 신경망의 훈련에서 상당한 성능 패널티를 초래한다. 이는 이전 연구에서 신경망이 이미지 압축 아티팩트에 상대적으로 강한 것으로 나타난 것과는 다르다.

그 이전에, 새로운 연구 방향이 나타났다. 즉, JPEG 압축을 모델 훈련에서 개선된 결과를 얻기 위해 활용할 수 있다는 것이다.

그러나, 해당 논문의 저자들은 JPEG 이미지의 다양한 품질 수준에서 개선된 결과를 얻을 수 있었지만, 제안된 모델은 너무 복잡하고 부담스러웠기 때문에 실제로 사용할 수 없었다. 또한, 시스템의 기본 JPEG 최적화 설정(양자화)은 훈련 효율성의 장벽으로 작용했다.

稍後의 프로젝트(2023년의 JPEG Compliant Compression for DNN Vision)는 JPEG 압축된 훈련 이미지에서 더 나은 결과를 얻기 위해 고정된 깊은 신경망(DNN) 모델을 사용했다. 그러나, 모델의 일부를 훈련 중에 고정시키는 것은 모델의 유연성과 더广泛한 새로운 데이터에 대한 저항성을 감소시킨다.

JPEG-DL

대신, 새로운 연구(JPEG Inspired Deep Learning)는 훨씬 더 간단한 아키텍처를 제공하며, 기존 모델에 적용할 수도 있다.

연구자들은 다음과 같이 말한다:

‘결과는 JPEG-DL이 다양한 DNN 아키텍처에서 표준 DL보다 일관되게 더 나은 성능을 보여준다. 특히, JPEG-DL은 일부 세분화된 분류 데이터셋에서 최대 20.9%의 분류 정확도를 개선한다. 또한, JPEG-DL은 학습된 모델의 적대적 강건성을 향상시키고 입력 이미지의 파일 크기를 줄인다.’

저자들은 최적의 JPEG 압축 품질 수준이 신경망이 이미지의 중심 주제를 구분하는 데 도움이 될 수 있다고 주장한다. 예를 들어, 아래의 이미지에서 기준선 결과(왼쪽)가 JPEG-DL(오른쪽)과 비교했을 때 пти이를 배경과 구분하는 데 성공한다.

JPEG-DL에 대한 기준선 방법 테스트. 출처: https://arxiv.org/pdf/2410.07081

JPEG-DL에 대한 기준선 방법 테스트. 출처: https://arxiv.org/pdf/2410.07081

Method

JPEG-DL은 차별 가능한 소프트 양자화기를 도입하여 표준 JPEG 최적화 루틴의 비차별적인 양자화 연산을 대체한다.

이것은 그래디언트 기반 최적화를 가능하게 한다. 이것은 기존 JPEG 인코딩에서 사용되는 유니폼 양자화기와 반올림 연산으로 근사되는 가장 가까운 계수를 사용하기 때문에 불가능하다.

JPEG-DL의 스키마의 차별 가능성은 훈련 모델의 매개변수와 JPEG 양자화(압축 수준)의 공동 최적화를 허용한다. 공동 최적화는 모델과 훈련 데이터가 서로에 대해 적응되어 있음을 의미하며, 계층의 동결이 필요하지 않다.

본질적으로, 시스템은 일반화 과정의 논리에 맞게 원시 데이터 세트의 JPEG 압축을 사용자 지정한다.

JPEG-DL 스키마.

JPEG-DL 스키마.

누군가는 원시 데이터가 훈련에 이상적인 먹이가 될 것이라고 가정할 수 있다. 그러나 JPEG 압축은 인간의 시각을 위해 최적화되어 있으며, 세부 또는 색상의 영역을 인간의 시각을 위해 최적화된 방식으로 버린다.

반면에, 신경망은 중앙 주제를 집중적으로 볼 수 있는 비정상적인 필터가 없다. 대신, 밴딩 아티팩트를 유효한 데이터로 간주하여 자신의 잠재 공간에 통합한다.

인간은 하늘의 밴딩을 무시하지만, 신경망은 이 내용을 버릴 수 없으며, 더 높은 품질의 이미지를 필요로 한다. 출처: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

인간은 하늘의 밴딩을 무시하지만, 신경망은 이 내용을 버릴 수 없으며, 더 높은 품질의 이미지를 필요로 한다. 출처: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

따라서, 훈련 데이터 세트의 전체 내용에 적합한 JPEG 압축 수준은 하나만 존재하지 않는다. 사람들의 사진은 더 적은 압축이 필요하지만, пти이의 사진은 더 많은 압축이 필요하다.

Data and Tests

JPEG-DL은 트랜스포머 기반 아키텍처와 컨볼루셔널 신경망(CNN)을 사용하여 평가되었다. 사용된 아키텍처는 EfficientFormer-L1, ResNet, VGG, MobileNet, ShuffleNet이었다.

ResNet 버전은 CIFAR 데이터 세트에 특화된 버전이었다: ResNet32, ResNet56, ResNet110. VGG8과 VGG13은 VGG 기반 테스트에 사용되었다.

CNN의 훈련 방법은 2020年的 연구에서 유래된 Contrastive Representation Distillation이었다. EfficientFormer-L1(트랜스포머 기반)의 경우, 2023年の 연구에서 유래된 훈련 방법을 사용했다.

세분화된 작업을 위한 테스트에서는 4개의 데이터 세트가 사용되었다: 스탠퍼드 도그스, 옥스포드 대학의 플라워스, CUB-200-2011(칼테크 버드), 펫스(캣과 도그, 옥스포드 대학과 인도 하이데라바드의 협력).

세분화된 작업을 위한 CNN의 경우, PreAct ResNet-18과 DenseNet-BC를 사용했다. EfficientFormer-L1의 경우, 앞서 언급한 Initializing Models With Larger Ones의 방법을 사용했다.

CIFAR-100과 세분화된 작업을 통해, 다양한 DCT 주파수에 대한 Adam 옵티마이저를 사용하여 JPEG 압축 접근법의 다양한 크기를 다루었다.

ImageNet-1K 테스트에서는 PyTorch를 사용했으며, SqueezeNet, ResNet-18, ResNet-34를 핵심 모델로 사용했다.

JPEG 레이어 최적화 평가에서는 SGD를 사용했으며, ImageNet-1K 테스트에서는 2019年の 논문에서 제안된 방법을 사용했다.

CIFAR-100에서 기준선과 JPEG-DL의 최상위 1개 유효성 정확도. 아래는 다양한 모델 아키텍처에서 다양한 세분화된 이미지 분류 작업의 최상위 1개 유효성 정확도이다.

CIFAR-100에서 기준선과 JPEG-DL의 최상위 1개 유효성 정확도. 아래는 다양한 모델 아키텍처에서 다양한 세분화된 이미지 분류 작업의 최상위 1개 유효성 정확도이다.

저자들은 다음과 같이 말한다:

‘모든 7개의 테스트 모델에서, JPEG-DL은 일관되게 개선된 결과를 보여주며, 최대 1.53%의 최상위 1개 정확도 향상을 보여준다. 세분화된 작업에서, JPEG-DL은 최대 20.90%의 성능 향상을 보여준다.’

ImageNet-1K 테스트 결과는 아래에 표시되어 있다.

다양한 프레임워크에서 ImageNet의 최상위 1개 유효성 정확도 결과.

다양한 프레임워크에서 ImageNet의 최상위 1개 유효성 정확도 결과.

논문에서는 다음과 같이 말한다:

‘SqueezeNetV1.1의 경우, JPEG-DL은 기준선보다 0.31%의 최상위 1개 정확도 향상을 보여준다. 양자화 연산을 5회 반복하면 추가로 0.20%의 향상을 보여주며, 기준선보다 총 0.51%의 향상을 보여준다.’

연구자들은 또한 Fast Gradient Signed Method(FGSM)와 Projected Gradient Descent(PGD)와 같은 적대적 공격 접근 방식을 사용하여 시스템을 테스트했다.

공격은 CIFAR-100에서 두 개의 모델에 대해 수행되었다.

두 개의 표준 적대적 공격 프레임워크에 대한 JPEG-DL 테스트 결과.

두 개의 표준 적대적 공격 프레임워크에 대한 JPEG-DL 테스트 결과.

저자들은 다음과 같이 말한다:

‘JPEG-DL 모델은 기준선 모델보다 적대적 강건성을 크게 향상시킨다. FGSM의 경우 최대 15%, PGD의 경우 최대 6%의 향상을 보여준다.’

추가로, 저자들은 GradCAM++를 사용하여 특징 맵을 추출하여 시각적으로 강조했다.

기준선과 JPEG-DL 이미지 분류를 위한 GradCAM++ 일러스트레이션.

기준선과 JPEG-DL 이미지 분류를 위한 GradCAM++ 일러스트레이션.

논문에서는 다음과 같이 말한다:

‘JPEG-DL은 기준선 모델보다 더 나은 결과를 보여준다. 또한, 기준선 모델이 실패한 이미지를 분류하는 데 성공했다.’

Conclusion

JPEG-DL은 원시 데이터가 있는 상황에서 사용하기 위한 것이다. 그러나, 이 프로젝트에서 나타난 일부 원칙이 일반적인 데이터 세트 훈련에 적용될 수 있는지 확인하는 것이 흥미로울 것이다.

현재로서는, 이는 주로 주석 문제이며, 트래픽 기반 이미지 인식과 다른 곳에서 해결되었다.

2024년 10월 10일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai