Anderson’un Açısı

Disney Araştırması Geliştirilmiş AI Tabanlı Resim Sıkıştırma Sunuyor – Ancak Ayrıntıları Hayal Edebilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Detail for the supplementary Disney paper – source: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Supplementary-1.pdf

Disney’in Araştırma kolunun yeni bir resim sıkıştırma yöntemi sunuyor, açık kaynaklı Stable Diffusion V1.2 modelini kullanarak daha gerçekçi resimler üretiyor ve rakip yöntemlere kıyasla daha düşük bit oranlarında çalışıyor.

Disney sıkıştırma yönteminin önceki yaklaşımlarla karşılaştırılması. Yazarlar, ayrıntı geri kazanımında iyileşme olduğunu iddia ediyor ve yüz binlerce dolarlık eğitim gerektirmeyen, aynı zamanda en yakın rakip yönteme kıyasla daha hızlı çalışan bir model sunuyor. Kaynak: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

Disney sıkıştırma yönteminin önceki yaklaşımlarla karşılaştırılması. Yazarlar, ayrıntı geri kazanımında iyileşme olduğunu iddia ediyor ve yüz binlerce dolarlık eğitim gerektirmeyen, aynı zamanda en yakın rakip yönteme kıyasla daha hızlı çalışan bir model sunuyor. Kaynak: https://studios.disneyresearch.com/app/uploads/2024/09/Lossy-Image-Compression-with-Foundation-Diffusion-Models-Paper.pdf

Yeni yaklaşım (geleneksel kodçlardan daha karmaşık olmasına rağmen ‘kodlayıcı’ olarak tanımlanıyor) herhangi bir Latent Diffusion Model (LDM) üzerinde çalışabilir. Nicel testlerde, yazarlar önceki yöntemleri doğruluk ve ayrıntı açısından geride bıraktığını ve önemli ölçüde daha az eğitim ve hesaplama maliyeti gerektiğini belirtiyorlar.

Yeni çalışmanın ana fikri, kantasyon hatası (tüm resim sıkıştırma işlemlerinde merkezi bir işlem) ve gürültü (difüzyon modellerinde merkezi bir işlem) arasındaki benzerlik.

Bu nedenle, geleneksel olarak kantasyonlu bir resim, orijinal resmin gürültülü bir versiyonu olarak ele alınabilir ve hedef bit oranında resmin yeniden inşa edilmesi için LDM’nin gürültü giderme işlemine yerine của rastgele gürültü olarak kullanılabilir.

Yeni Disney yönteminin (yeşil renkle vurgulanmış) rakip yaklaşımlarla karşılaştırılması.

Yeni Disney yönteminin (yeşil renkle vurgulanmış) rakip yaklaşımlarla karşılaştırılması.

Yazarlar iddia ediyor ki:

‘Kantasyon hatasının giderilmesini bir gürültü giderme görevi olarak formüle ediyoruz, difüzyon kullanarak iletilen resim latentindeki kaybolan bilgileri geri kazanıyoruz. Yaklaşımımız, tam difüzyon oluşturma işleminden menosından %10’unu gerçekleştirmemizi sağlıyor ve difüzyon modeline hiçbir mimari değişiklik gerektirmiyor, böylece temel modelleri güçlü bir öncül olarak ek fine-tuning olmadan kullanmamızı sağlıyor.’

‘Önerdiğimiz kodlayıcı, nicel gerçeklik metriklerinde önceki yöntemleri geride bırakıyor ve kullanıcıların bizim yeniden yapılandırmalarımızı, diğer yöntemlerin iki katı bit oranı kullanmasına rağmen, kalitatif olarak tercih ettiğini doğruluyoruz.’

Ancak, difüzyon modellerinin sıkıştırma yeteneklerini kullanmaya çalışan diğer projelerle ortak olarak, çıktı hayal edebiliyor. Karşılaştırıldığında, kayıp yöntemler gibi JPEG,明显 olarak bozulmuş veya aşırı pürüzsüzleştirilmiş ayrıntı alanları üretecek, bu da casual bir izleyici tarafından sıkıştırma sınırlamaları olarak tanınabilir.

Bunun yerine, Disney’in kodlayıcısı, orijinal resimde olmayan bağlamdan ayrıntı değiştirebilir, bu da tipik olarak hiperscale verilerle eğitilen modellerde kullanılan Variational Autoencoder (VAE)’in kaba doğası nedeniyle oluşur.

‘Diğer generatif yaklaşımlar gibi, bizim yöntemimiz de belirli resim özelliklerini atabilirken, alıcı tarafta benzer bilgileri sentezleyebilir. Özel durumlarda, bu, yanlış yeniden yapılandırmaya neden olabilir, Örneğin, düz çizgileri bükme veya küçük nesnelerin sınırını bozma.’

‘Bu, bizim inşa ettiğimiz temel modelin iyi bilinen sorunlarıdır ve bunların VAE’nin nispeten düşük özellikli boyutuna atfedilebileceği söylenebilir.’

Bu, sanatsal betimlemeler ve casual fotoğrafların gerçekçiliği için bazı etkileri olabilir, ancak mahkeme davaları için kanıtlar, yüz tanıma için veriler, Optik Karakter Tanıma (OCR) için taramalar ve birçok olası kullanım durumu gibi küçük ayrıntıların önemli bilgi oluşturduğu durumlarda daha kritik bir etkiye sahip olabilir.

AI tabanlı resim sıkıştırmanın ilerlemesinin bu nasırlaşmış aşamasında, tüm bu olası senaryolar uzak gelecekte kalıyor. Ancak, resim depolama, bir dizi konuda global bir zorluk teşkil ediyor, veri depolama, akış ve elektrik tüketimi gibi konuları içeriyor. Bu nedenle, AI tabanlı sıkıştırma, doğruluk ve lojistik arasında cezbedici bir ticaret olabilir. Tarih, en iyi kodlayıcıların her zaman en geniş kullanıcı tabanını kazandığını göstermiyor, özellikle lisanslama ve pazarın özel formatlar tarafından ele geçirilmesi gibi faktörler benimseme konusunda önemli rol oynuyor.

Disney, uzun süredir makine öğrenimi tabanlı bir sıkıştırma yöntemi olarak deneyimler yapıyor. 2020’de, yeni makaledeki bir araştırmacı, VAE tabanlı bir proje için geliştirilmiş video sıkıştırma üzerinde çalışıyordu.

Yeni Disney makalesi, Ekim ayının başlarında güncellendi. Bugün şirket, bir YouTube videosu yayınladı. Proje, Lossy Image Compression with Foundation Diffusion Models olarak adlandırıldı ve Disney Araştırması ve ETH Zürih’ten dört araştırmacı tarafından geldi. Araştırmacılar ayrıca bir ek makale sunuyor.

Yöntem

Yeni yöntem, bir resimi sıkıştırılmış laten temsiline kodlamak için bir VAE kullanıyor. Bu aşamada, giriş resmi türetilen özelliklere dayanmaktadır – düşük seviyeli vektör tabanlı temsil. Latent gömme daha sonra kantasyonlu bir bit akışına ve piksel uzayına geri dönüştürülür.

Bu kantasyonlu resim, genellikle bir difüzyon tabanlı resmin gürültü kaynağı olarak kullanılan şablon olarak kullanılır, difüzyon adımlarının değişken bir sayısı ile (genellikle difüzyon adımlarının artması ve doğruluğun artması arasında bir ticaret vardır).

Yeni Disney sıkıştırma yönteminin şeması.

Yeni Disney sıkıştırma yönteminin şeması.

Hem kantasyon parametreleri hem de toplam difüzyon adımları, eğitimli bir sinir ağı aracılığıyla kontrol edilebilir, bu sinir ağı, kodlama ile ilgili ilgili değişkenleri öngörür. Bu işlem, uyarlanabilir kantasyon olarak adlandırılır ve Disney sistemi, bu işlemin arkasındaki entropi modeli olarak Entroformer çerçevesini kullanır.

Yazarlar diyor ki:

‘İntüitive olarak, bizim yöntemimiz, difüzyon süreci sırasında sentezlenebilecek bilgileri (kantasyon dönüşümü aracılığıyla) atmaya öğrenir. Kantasyon sırasında yapılan hatalar gürültüye benzer ve difüzyon modelleri işlevsel olarak gürültü giderme modelleri olduğu için, kantasyon sırasında yapılan gürültüyü gidermek için kullanılabilirler.’

Stable Diffusion V2.1, sistemin difüzyon omurgası, tüm kod ve temel ağırlıkların kamu malı olması nedeniyle seçildi. Ancak yazarlar, şemalarının daha geniş bir model yelpazesine uygulanabilir olduğunu vurguluyorlar.

İşlemin ekonomisinde kritik bir nokta, zaman adımları öngörüsü, optimal difüzyon adımlarının sayısını değerlendirir – verimlilik ve performans arasında bir denge.

Zaman adımları öngörüsü, optimal difüzyon adımlarının sayısı kırmızı çerçeve ile gösteriliyor. Lütfen doğru çözünürlük için kaynak PDF'ye başvurun.

Zaman adımları öngörüsü, optimal difüzyon adımlarının sayısı kırmızı çerçeve ile gösteriliyor. Lütfen doğru çözünürlük için kaynak PDF’ye başvurun.

Latent gömmedeki gürültü miktarı, optimal difüzyon adımlarının sayısını öngörürken dikkate alınmalıdır.

Veri ve Testler

Model, Vimeo-90k veri seti üzerinde eğitildi. Resimler, her dönem için 256x256px’ye rastgele kırpıldı (yani, model eğitim mimarisinin veri setinin her bir tam alımı).

Model, 300.000 adımda 1e-4 öğrenme hızında optimize edildi. Bu, bilgisayar görüşü projeleri arasında en yaygın olanıdır ve aynı zamanda en düşük ve genellikle uygulanabilir değerdir, veri setinin kavramları ve özelliklerinin geniş genellemesi ile ince ayrıntı yeniden üretimi arasında bir uzlaşma olarak.

Yazarlar bazı lojistik dikkate değerlerden bahsediyor:

‘Eğitim sırasında, difüzyon modelinin birden fazla geçişini geri yayarak işlemek, DDIM örnekleme sırasında çalışırken çok pahalı. Bu nedenle, yalnızca bir DDIM örnekleme iterasyonu gerçekleştiriyoruz ve bunu doğrudan tam olarak gürültü giderilmiş veri olarak kullanıyoruz.’

Sistemi test etmek için kullanılan veri setleri Kodak; CLIC2022; ve COCO 30k idi. Veri seti, 2023 Google çalışması Multi-Realism Image Compression with a Conditional Generator tarafından belirtilen metodolojiye göre ön işleme tabi tutuldu.

Kullanılan metrikler Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); Multiscale Structural Similarity Index (MS-SSIM); ve Fréchet Inception Distance (FID) idi.

Rakip önceki çerçeveler, Generative Adversarial Networks (GANs) kullanan eski sistemler ve difüzyon modelleri etrafında daha recente teklifler arasında bölündü. Test edilen GAN sistemleri High-Fidelity Generative Image Compression (HiFiC) ve ILLM (HiFiC’de bazı iyileştirmeler sunan) idi.

Difüzyon tabanlı sistemler, Lossy Image Compression with Conditional Diffusion Models (CDC) ve High-Fidelity Image Compression with Score-based Generative Models (HFD) idi.

Çeşitli veri setleri üzerinde önceki çerçevelere karşı nicel sonuçlar.

Çeşitli veri setleri üzerinde önceki çerçevelere karşı nicel sonuçlar.

Nicel sonuçlar (yukarıda görselleştirilmiş) için araştırmacılar diyor ki:

‘Yöntemimiz, yeniden yapılandırılmış resimlerin gerçekçiliğinde yeni bir devlet-sanat düzeyini belirliyor, tüm temel değerleri FID-bit hızı eğrilerinde geride bırakıyor. Bazı bozulma metriklerinde (özellikle LPIPS ve MS-SSIM), difüzyon tabanlı tüm kodçlardan daha iyi performans gösteriyoruz, aynı zamanda en yüksek performanslı generatif kodçularla rekabet halindeyiz.

‘Beklendiği gibi, bizim yöntemimiz ve diğer generatif yöntemler, PSNR’de medida edildiğinde acı çekiyor, çünkü algısal olarak hoş yeniden yapılandırmaları, ayrıntı geri kazanımının kesin kopyasından daha fazla tercih ediyoruz.’

Kullanıcı çalışması için, bir iki-alternatif-zorunlu-tercih (2AFC) yöntemi kullanıldı, bir turnuva bağlamında favori resimler daha sonraki turlara geçecekti. Çalışma, aslen satranç turnuvaları için geliştirilen Elo puanlama sistemini kullandı.

Katılımcılar, çeşitli generatif yöntemler için sunulan 512x512px resimlerin en iyisini seçecekti. Ek bir deney, aynı kullanıcıdan tüm resim karşılaştırmalarının Monte Carlo simülasyonu ile 10.000 iterasyon üzerinden değerlendirilmesini içeriyordu, ortanca puan sonuçlarda sunuldu.

Kullanıcı çalışması için tahmin edilen Elo puanları, her karşılaştırma için Elo turnuvaları (sol) ve her katılımcı için, daha yüksek değerlerin daha iyi olduğu şekilde.

Kullanıcı çalışması için tahmin edilen Elo puanları, her karşılaştırma için Elo turnuvaları (sol) ve her katılımcı için, daha yüksek değerlerin daha iyi olduğu şekilde.

Burada yazarlar diyor ki:

‘Gördüğünüz gibi, Elo puanlarında bizim yöntemimiz tüm diğerlerini önemli ölçüde geride bırakıyor, hatta CDC’ye kıyasla, bizim yöntemimiz ortalama olarak iki katı bit kullanıyor. Bu, kullanılan Elo turnuva stratejisinin bağımsız olarak kalıyor.’

Orijinal makalede ve ek PDF‘de, yazarlar daha fazla görsel karşılaştırma sunuyor, bunlardan biri bu makalede daha önce gösterildi. Ancak, örneklerin arasındaki farkın inceliği nedeniyle, bu sonuçları adil bir şekilde değerlendirebilmeleri için okuyucuyu kaynak PDF’ye yönlendiriyoruz.

Makale, önerilen yöntemin CDC’ye (3.49 vs 6.87 saniye) kıyasla iki kat daha hızlı çalıştığını belirterek son buluyor. Ayrıca, ILLM’nin bir resimi 0.27 saniyede işleyebileceğini, ancak bu sistemin ağır eğitim gerektirdiğini gözlemliyor.

Sonuç

ETH/Disney araştırmacıları, makalenin sonunda, sistemlerinin yanlış ayrıntı üretme potansiyelinden açıkça bahsediyorlar. Ancak, sunulan örneklerin hiçbiri bu konuya odaklanmıyor.

Adaletten yana, bu sorun yalnızca yeni Disney yaklaşımıyla sınırlı değil, difüzyon modellerinin yorumlayıcı mimarilerini kullanarak görüntü sıkıştırma işleminin bir sonucu.

İlginç bir şekilde, sadece beş gün önce ETH Zurich’ten iki başka araştırmacı, bir makale yayınladı, Conditional Hallucinations for Image Compression başlıklı, AI tabanlı sıkıştırma sistemlerinde ‘optimal düzeyde hayal gücü’ olasılığını inceliyor.

Yazarlar orada diyor ki:

‘Tekstür benzeri içerik için, örneğin çimen, benekler ve taş duvarlar, verilen bir tekstürden gerçekçi bir şekilde eşleşen pikseller oluşturmak, precisa piksel değerlerini yeniden oluşturmaktan daha önemlidir; bir tekstürün dağılımından herhangi bir örnek oluşturmak genellikle yeterlidir.’

Bu nedenle, bu ikinci makale, sıkıştırmanın optimal olarak ‘yaratıcı’ ve temsilci olması gerektiğini, orijinal sıkıştırılmamış resmin temel özelliklerini ve çizgilerini mümkün olduğunca doğru bir şekilde yeniden oluşturmak yerine, iddia ediyor.

One wonders what the photographic and creative community would make of this fairly radical redefinition of ‘compression’.

 

*Yazarların satır içi alıntılarını hyperlinklere dönüştürme işleminin bana ait olduğunu unutmayın.

İlk olarak 30 Ekim 2024 Çarşamba günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai