Anderson의 관점

디즈니 연구소, 향상된 AI 기반 이미지 압축 방법 제공 – 그러나 세부 사항이 환각 될 수 있음

mm
Unite.AI를 Google의 선호 소스에 추가
Detail for the supplementary Disney paper – source: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Supplementary-1.pdf

디즈니 연구소는 새로운 이미지 압축 방법을 제공하고 있으며, 오픈 소스 Stable Diffusion V1.2 모델을 사용하여 다른 방법보다 더 현실적인 이미지를 낮은 비트레이트로 생성할 수 있습니다.

디즈니 압축 방법과 이전 접근 방식의 비교. 저자는 세부 사항의 개선된 회복과 수백만 달러의 훈련 비용이 필요하지 않으며 가장 가까운竞争 방법보다 빠르게 작동하는 모델을 제공한다고 주장합니다. 출처: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

디즈니 압축 방법과 이전 접근 방식의 비교. 저자는 세부 사항의 개선된 회복과 수백만 달러의 훈련 비용이 필요하지 않으며 가장 가까운競争 방법보다 빠르게 작동하는 모델을 제공한다고 주장합니다. 출처: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

새로운 접근 방식(전통적인 코덱보다 복잡하지만 ‘코덱’으로 정의됨)은 임의의 Latent Diffusion Model(LDM)에서 작동할 수 있습니다. 양적 테스트에서 이전 방법보다 정확도와 세부 사항에서 우수하며 훈련과 컴퓨팅 비용이 훨씬 적습니다.

새로운 연구의 핵심은 양자화 오차(모든 이미지 압축에서 중심 과정임)이 노이즈(확산 모델에서 중심 과정임)와 유사하다는 것입니다.

따라서 ‘전통적인’ 양자화된 이미지는 원본 이미지의 노이즈 버전으로 처리될 수 있으며, 임의의 노이즈 대신 확산 모델의 노이즈 제거 과정에서 사용될 수 있습니다.

새로운 디즈니 방법(초록색으로 강조됨)과 라이벌 접근 방식의 비교.

새로운 디즈니 방법(초록색으로 강조됨)과 라이벌 접근 방식의 비교.

저자는 주장합니다:

‘우리는 양자화 오차를 제거하는 것을 노이즈 제거 작업으로 공식화하고, 확산을 사용하여 전송된 이미지 잠재에서 손실된 정보를 회복합니다. 우리의 접근 방식은 전체 확산 생성 과정의 10% 미만을 수행하고, 기초 모델을 강력한 사전 지식으로 사용할 수 있으며, 추가적인 백본 모델의 세부 튜닝이 필요하지 않습니다.’

‘우리의 제안된 코덱은 이전 방법보다 양적 현실 메트릭에서 우수하며, 우리는 우리의 재구성이 사용자에 의해 양적으로 선호되는 것을 확인했습니다. 다른 방법은 두 배의 비트레이트를 사용하더라도.’

그러나 다른 확산 모델을 사용하는 프로젝트와 마찬가지로, 출력은 세부 사항을 환각시킬 수 있습니다. 대조적으로, JPEG와 같은 손실 압축 방법은 명확하게歪曲되거나 과도하게 매끄러운 세부 사항 영역을 생성할 것입니다.

방법

새로운 방법은 VAE를 사용하여 이미지를 압축된 잠재 표현으로 인코딩합니다. 이 단계에서 입력 이미지는 파생된 특징으로 구성됩니다. 잠재 임베딩은 양자화된 비트스트림으로 다시 양자화되고, 픽셀 공간으로 되돌아옵니다.

이 양자화된 이미지는 확산 기반 이미지의 노이즈 시드 템플릿으로 사용됩니다. 여기서 노이즈 제거 단계의 수는 노이즈 제거 단계가 증가할수록 정확도가提高되고, 대기 시간이 줄어듭니다.

새로운 디즈니 압축 방법의 스키마.

새로운 디즈니 압축 방법의 스키마.

양자화 매개변수와 노이즈 제거 단계의 총 수는 새로운 시스템에서 제어될 수 있으며, 관련 변수를 예측하는 신경망을 훈련함으로써 이루어집니다. 이过程는 적응적 양자화라고 하며, 디즈니 시스템은 엔트로포머 프레임워크를 엔트로피 모델로 사용합니다.

저자는 다음과 같이 말합니다:

‘直観적으로, 우리의 방법은 양자화를 통해 제거할 수 있는 정보를 학습하고, 확산 과정 동안 합성할 수 있습니다. 양자화 오차는 노이즈와 유사하며, 확산 모델은 기능적으로 노이즈 제거 모델이므로, 양자화 중에 도입된 노이즈를 제거하는 데 사용할 수 있습니다.’

Stable Diffusion V2.1은 시스템의 확산 백본입니다. 코드와 가중치가 공개적으로 사용할 수 있기 때문에 선택되었습니다. 그러나 저자는 그들의 스키마가 더 많은 모델에 적용될 수 있다고 강조합니다.

과정의 경제학에서 핵심은 타임스텝 예측입니다. 이는 노이즈 제거 단계의 최적 수를 평가하는 것입니다. 효율성과 성능 사이의 균형입니다.

타임스텝 예측, 최적의 노이즈 제거 단계가 빨간색 테두리로 표시됨. 정확한 해상도를 위해 소스 PDF를 참조하십시오.

타임스텝 예측, 최적의 노이즈 제거 단계가 빨간색 테두리로 표시됨. 정확한 해상도를 위해 소스 PDF를 참조하십시오.

잠재 임베딩의 노이즈 양을 고려하여 노이즈 제거 단계의 최적 수를 예측해야 합니다.

데이터 및 테스트

모델은 Vimeo-90k 데이터셋으로 훈련되었습니다. 이미지들은 각 에포크(즉, 모델 훈련 아키텍처에 의해 데이터셋의 완전한 摂取)마다 256x256px로 무작위로 자르졌습니다.

모델은 300,000 단계에서 1e-4의 학습률로 최적화되었습니다. 이는 컴퓨터 비전 프로젝트에서 가장 일반적이며, 또한 가장 낮고 일반적으로 실용적인 값입니다. 이는 데이터셋의 개념과 특성의 широк은 일반화와 세부 사항의 재생산 능력 사이의妥協입니다.

저자는 다음과 같이 말합니다:

‘훈련 중에 확산 모델을 여러 번 통과하는 것을 통해 그라디언트를 역전파하는 것은 금전적으로 매우 비용이 많이 듭니다. 따라서 우리는 DDIM 샘플링 반복을 한 번만 수행하고, 이를 완전히 노이즈 제거된 데이터로 직접 사용합니다.’

시스템을 테스트하기 위해 사용된 데이터셋은 Kodak, CLIC2022, COCO 30k입니다. 데이터셋은 2023년 Google의 다중 현실 이미지 압축에서 설명된 방법에 따라 사전 처리되었습니다.

사용된 메트릭은 피크 신호 대 노이즈 비율(PSNR), 학습된 감각 유사성 메트릭(LPIPS), 다중 스케일 구조 유사성 지수(MS-SSIM), 프레첼 인셉션 거리(FID)입니다.

테스트된 이전 프레임워크는 GAN을 사용하는 이전 시스템과 확산 모델을 기반으로 하는 최근 프레임워크로 나뉩니다. 테스트된 GAN 시스템은 High-Fidelity Generative Image Compression(HiFiC)와 ILLM입니다.

확산 기반 시스템은 Lossy Image Compression with Conditional Diffusion Models(CDC)와 High-Fidelity Image Compression with Score-based Generative Models(HFD)입니다.

다양한 데이터셋에 대한 양적 결과.

다양한 데이터셋에 대한 양적 결과.

양적 결과(위에서 시각화됨)에서 연구자들은 다음과 같이 말합니다:

‘우리의 방법은 재구성된 이미지의 현실성에서 새로운 최적의 성능을 달성하며, 모든 기준선에서 우수합니다. 일부 왜곡 메트릭(특히 LPIPS 및 MS-SSIM)에서 우리는 모든 확산 기반 코덱을 능가하며,最高 성능의 생성 코덱과 경쟁합니다. ‘

‘예상대로, 우리의 방법과 다른 생성 방법은 PSNR에서苦労합니다. 우리는 감각적으로 만족스러운 재구성을 선호하기 때문입니다. 세부 사항의 정확한 복제보다.’

사용자 연구에서 2AFC 방법을 사용하여 512x512px 이미지를 비교했습니다. 이 연구는 Elo 등급 시스템을 사용했습니다.

따라서 참가자는 다양한 생성 방법에 대한 512x512px 이미지를 비교하고, 최고의 이미지를 선택했습니다. 추가 실험에서는 동일한 사용자의 모든 이미지 비교를 평가했습니다. 10,000번의 몬테 카를로 시뮬레이션을 통해 중간 점수를 표시했습니다.

사용자 연구의 추정 Elo 등급.

사용자 연구의 추정 Elo 등급.

여기서 저자는 다음과 같이 말합니다:

‘Elo 점수를 볼 수 있듯이, 우리의 방법은 다른 모든 방법을 크게 능가합니다. 이는 우리의 방법이 평균적으로 두 배의 비트레이트를 사용하는 CDC와 비교할 때도 마찬가지입니다. 이는 사용된 Elo 토너먼트 전략과 상관없이如此입니다.’

원래 논문과 보충 PDF에서 저자는 추가적인 시각적 비교를 제공합니다. 그러나 이러한 샘플의 차이가 미세하여, 독자는 원본 PDF에서 결과를 평가할 수 있도록 합니다.

결론

ETH/디즈니 연구자들은 논문의 결론에서 시스템이 거짓 세부 사항을 생성할 수 있는 잠재력을 명확히합니다. 그러나 제공된 샘플은 이 문제에 집중하지 않습니다.

공정하게 말하면, 이 문제는 새로운 디즈니 접근 방식에만 국한되지 않습니다. 이는 확산 모델을 사용하여 이미지 압축을 수행할 때 필연적인 부수적 효과입니다.

흥미롭게도, 5일 전 ETH 취리히의 두 연구자들은 이미지 압축을 위한 조건부 환각이라는 제목의 논문을 발표했습니다. 이는 AI 기반 압축 시스템에서 ‘환각’의 최적 수준에 대한 가능성을 조사합니다.

저자는 다음과 같이 말합니다:

‘텍스처와 같은 콘텐츠(예: 잔디,雀斑, 돌 벽)의 경우, 주어진 텍스처와 일치하는 픽셀을 생성하는 것이 더 중요하며, 정확한 세부 사항을 재구성하는 것보다 텍스처의 분포에서 샘플을 생성하는 것입니다.’

따라서 두 번째 논문은 일반적이고 ‘해로운’ 도메인에서 압축이 최적으로 ‘창의적’이고 대표적이어야 한다는 주장을 제기합니다.

이미지 저장은 전 세계적인 도전이며, 데이터 저장, 스트리밍, 전력 소비 등 다양한 문제와 관련이 있습니다. 따라서 AI 기반 압축은 정확성과 물류 사이에서 유혹적인 트레이드오프를 제공할 수 있습니다. 역사적으로 최고의 코덱이 항상 가장 넓은 사용자 기반을 얻는 것은 아닙니다. 라이센싱과 시장 점유율이 채택에 영향을 미치는 요인입니다.

디즈니는 오랫동안 기계 학습을 압축 방법으로 실험해 왔습니다. 2020년에 새로운 논문의 한 연구자는 VAE 기반 프로젝트에 참여했습니다.

새로운 디즈니 논문은 10월 초에 업데이트되었습니다. 오늘 회사에서는 동반하는 유튜브 비디오를 발표했습니다. 프로젝트는 Foundation Diffusion Models을 사용한 Lossy Image Compression으로 제목이 붙여졌으며, 디즈니 연구소와 ETH 취리히의 4명의 연구자로부터 나왔습니다. 연구자들은 또한 보충 논문을 제공합니다.

*저자의 인라인 인용을 하이퍼링크로 변환했습니다.

2024년 10월 30일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai