Anderson의 관점
JPEG 아티팩트 문제를 컴퓨터 비전 데이터셋에서 해결하기

메릴랜드 대학교와 페이스북 AI의 새로운 연구에 따르면, 깊이 학습 시스템에서 데이터셋에 높은 압축률의 JPEG 이미지를 사용하면 성능이 크게 저하된다고 밝혔으며, 이러한 효과를 완화하는 새로운 방법을 제시했습니다.
연구 보고서인 《JPEG 압축 결함 분석 및 완화》는 이전 연구보다 훨씬 더 포괄적인 JPEG 아티팩트의 영향을 분석했다고 주장합니다. 이 보고서는 “[중간]에서 높은 JPEG 압축은 표준 지표에서 상당한 성능 페널티를 초래한다”고 밝혔으며, 이전 연구에서 제안한 바와 달리 신경망이 이러한 섭동에 대해 강건하지 않을 수 있다고 밝혔습니다.

2018년 MobileNetV2 데이터셋의 개 사진. 품질 10(왼쪽)에서는 분류 시스템이 올바른 품종 ‘펨브록 웨일스 코기’를 식별하지 못하고 ‘노리치 테리어’를 추측합니다(시스템은 이미 사진이 개라는 것을 알고 있지만 品종은不知道). 두 번째 왼쪽에는 JPEG 아티팩트를 교정한 버전이 있습니다. 두 번째 오른쪽에는 타겟 아티팩트 교정이 올바른 분류를 복원합니다. 오른쪽에는 원본 사진이 올바르게 분류됩니다. 출처: https://arxiv.org/pdf/2011.08932.pdf
압축 아티팩트를 ‘데이터’로 간주
극단적인 JPEG 압축은 JPEG를 픽셀 그리드로 조립하는 8×8 블록 주변에 가시적 또는 반가시적 경계를 생성할 가능성이 있습니다. 이러한 블록킹 또는 ‘링킹’ 아티팩트가 나타나면, 이러한 아티팩트를 실제 세계의 요소로 잘못 해석할 수 있습니다.

위쪽에는 컴퓨터 비전 머신 러닝 시스템이 좋은 품질의 사진에서 ‘깨끗한’ 그라데이션 이미지를 추출합니다. 아래쪽에는 낮은 품질의 저장에서 블록킹 아티팩트가 주제의 특징을 가립니다. 이러한 아티팩트는 특히 일반적인 데이터 정리만 적용된 웹 스크래핑 컬렉션과 같은 높은 품질과 낮은 품질의 이미지가 데이터셋에 있는 경우에 이미지 세트에서 파생된 특징을 ‘감염’시킬 수 있습니다. 출처: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
위의 첫 번째 이미지에서 볼 수 있듯이, 이러한 아티팩트는 이미지 분류 작업에 영향을 미칠 수 있으며, 텍스트 인식 알고리즘에도 영향을 미칠 수 있습니다.
이미지 합성 훈련 시스템(예: 딥페이크 소프트웨어 또는 GAN 기반 이미지 생성 시스템)의 경우, 데이터셋의 낮은 품질의 블록은 중간 품질의 복제를 끌어내거나 더 높은 품질의 특징으로 대체될 수 있습니다. 어느 경우에나, 더 나은 데이터가 바람직합니다.
JPEG – 일반적으로 ‘충분함’
JPEG 압축은 다양한 이미지 형식에 적용할 수 있는 비가역적이고 손실이 있는 코덱입니다. JPEG(.jpg) 형식은 JPEG 압축 방법의 이름을 따왔으며, JFIF 이미지 파일 래퍼의 이름을 따온 것이 아닙니다.
최근 몇 년 동안 JPEG 스타일 아티팩트 완화를 포함하는 기계 학습 아키텍처가 등장했습니다. AI 기반의 압축 아티팩트 제거 기능은 Topaz 이미지/비디오 스위트와 Adobe Photoshop의 최근 버전의 신경망 기능을 포함한 여러 상업용 제품에 통합되었습니다.
1986년 현재 사용 중인 JPEG 스키마는 1990년대 초에 거의 잠금 상태였으므로, JPEG 이미지를 저장한 품질 수준(1-100)을 나타내는 메타데이터를 추가하는 것은 불가능합니다.
따라서 JPEG 이미지 데이터의 평가된 또는 알려진 품질에 맞게 기계 학습 훈련 루틴을 맞추는 것이 일반적입니다. 품질 메타데이터 항목이 없는 경우, 이미지의 압축 방법을 알아야 하거나 감각적 알고리즘 또는 수동 분류를 통해 품질을 추정해야 합니다.
경제적 妥協
JPEG는 기계 학습 데이터셋의 품질에 영향을 미치는 유일한 손실 압축 방법은 아닙니다. PDF 파일의 압축 설정도 정보를 폐기할 수 있으며, 로컬 또는 네트워크 아카이브를 위해 매우 낮은 품질 수준으로 설정할 수 있습니다.
이것은 다양한 아카이브를 샘플링하여 확인할 수 있습니다. 일부 아카이브는 이미지 또는 텍스트 인식 시스템에 상당한 도전을 제공할 정도로 강하게 압축되었습니다. 많은 경우에, 이러한 강한 압축은 저렴한 DRM 형태로 적용된 것으로 보이며, 저작권 보유자는 저해상도 사용자 업로드 유튜브 비디오를 삭제하는 대신 ‘블록’ 비디오를 프로모션 토큰으로 남겨두었습니다.
다른 많은 경우에, 해상도 또는 이미지 품질은 낮은 이유는 데이터가 매우 오래된 것으로, 로컬 및 네트워크 저장소가 더 비싸고, 네트워크 속도가 제한적이었기 때문입니다.
JPEG는 현재 최고의 해결책은 아니지만, 인터넷의 기초와 밀접하게 얽혀있는 레거시 인프라로 남아 있습니다.
레거시 부담
나중에 등장한 JPEG 2000, PNG 및 최근.webp 형식은 더 나은 품질을 제공하지만, 오래된 인기 있는 기계 학습 데이터셋을 다시 샘플링하는 것은 학술 커뮤니티의 연간 컴퓨터 비전 도전의 연속성과 역사에 대한 장애물이 될 수 있습니다. 이는 PNG 형식의 이미지 데이터셋을 더 높은 품질 설정으로 다시 저장하는 경우에도 적용됩니다.
오래된 시스템에서 이미지 처리 라이브러리는 더 나은 형식을 지원하지만, 이미지 변환 요구 사항은 종종 JPG 또는 PNG(무손실 압축을 제공하지만 대기 시간과 디스크 공간을 희생하여)만 설정된 레거시 시스템에서 발생합니다. 심지어 워드프레스도.webp 지원을 최근에 추가했습니다.
PNG는 1990년대 후반에 GIF 파일에서 사용된 LZW 압축 형식에 대한 로열티가 지급된다는 선언에 대한 대응으로 등장한 오픈 소스 솔루션입니다. 그러나 PNG는 애니메이션 PNG가 널리 지원되지 않았으며, 2019년 트위터에서 애니메이션 PNG를 금지했습니다.
JPEG 압축은 빠르며, 공간 효율적이며, 모든 유형의 시스템에 깊이埋め込まれて 있습니다. 따라서 기계 학습 현장에서 곧 완전히 사라지지 않을 것입니다.
AI/JPEG 妥協의 최선
기계 학습 커뮤니티는 JPEG 압축의 특성에 적응했습니다. 2011년 유럽 방사선학회(ESR)는 ‘방사선 영상에서의 비가역적 이미지 압축의 사용성’에 대한 연구를 발표했습니다. MNIST 텍스트 인식 데이터셋은 JPEG 형식으로 포팅되었습니다. 이전의 협력에서 새로운 보고서의 저자들은 JPEG 이미지 품질의 단점을 보완하는 새로운 아키텍처를 제안했습니다.
질량-변형 JPEG 데이터의 유용성에 대한 연구는 기계 학습 분야에서 활발하게 진행 중입니다. 2016년 메릴랜드 대학교의 한 프로젝트는 DCT 도메인에서 깊은 특징 추출에 대한 연구를 수행했습니다. 2019년의 또 다른 프로젝트는 JPEG 데이터의 바이트 수준 읽기를 연구했습니다.
테스트 및 결론
최근의 연구에서 연구자들은 JPEG의 이해력과 유용성을 테스트하기 위해 10-90 사이에서 압축된 이미지를 사용했습니다. 테스트에 사용된 이미지는 각 품질 값에서 사전 압축되었습니다.
모델은 4가지 방법으로 훈련되었습니다: 기준선, 지도 미세 조정, 아티팩트 교정, 및 작업 대상 아티팩트 교정. 훈련은 다양한 데이터셋에서 수행되었습니다.
샘플 손실 결과는 아래에 시각화되어 있습니다(더 낮을수록 좋음).

연구의 결과는 JPEG 압축이 중간에서 높은 압축 설정에서 상당한 페널티를 초래한다고 결론지었습니다. 또한 새로운 무라벨 완화 전략이 다른 접근 방식보다 우수한 결과를 달성한다고 주장했습니다.
분류 작업의 경우, 보고서는 JPEG가 그라데이션 품질을 저하시키고 위치 오류를 유발한다고 명시적으로 밝혔습니다.
저자들은 JPEG 2000, WebP, HEIF 및 BPG와 같은 다른 압축 방법을 다루는 연구를 확장하고자 합니다. 또한 비디오 압축 알고리즘에 대한 유사한 연구를 제안했습니다.
작업 대상 아티팩트 교정 방법이 연구에서 성공을 거두었으므로, 저자들은 프로젝트 중에 훈련된 가중치를 공개할意向을 밝혔습니다. ‘[많은] 응용 프로그램이 수정 없이 우리의 TTAC 가중치를 사용하여 이익을 얻을 수 있을 것’이라고 예상했습니다.
참고: 본 기사의 소스 이미지는 thispersondoesnotexist.com에서 가져왔습니다.












