Anderson’un Açısı
JPEG Sıkıştırmasını Kullanarak Sinir Ağı Eğitiminin İyileştirilmesi

Kanada’dan yeni bir araştırma makalesi, sinir ağı eğitimi şemasına kasıtlı olarak JPEG sıkıştırmasını tanıtan bir çerçeve önerdi ve daha iyi sonuçlar elde etti – ve advers saldırılarına karşı daha iyi bir dirence sahip oldu.
Bu, oldukça radikal bir fikir, çünkü mevcut genel bilgelik, JPEG artifacts’ın, insan görme için optimize edilmiş, makine öğrenimi için değil, genellikle JPEG verilerine dayalı olarak eğitilen sinir ağları üzerinde zararlı bir etkiye sahip olduğu yönündedir.

Farklı kayıp değerlerinde sıkıştırılmış JPEG görüntülerinin netliği arasındaki farkın bir örneği (daha yüksek kayıp, daha küçük bir dosya boyutuna izin verir, ancak renk gradyanları boyunca delineasyon ve bantlama gibi diğer türdeki artefaktların maliyeti ile birlikte). Kaynak: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937
2022’de Maryland Üniversitesi ve Facebook AI’den bir rapor, JPEG sıkıştırmasının sinir ağlarının eğitimi sırasında “önemli bir performans cezası” olduğunu iddia etti, önceki çalışmanın sinir ağlarının görüntü sıkıştırma artefaktlarına karşı tương đối dayanıklı olduğunu iddia etmesine rağmen.
Bunun bir yıl öncesinde, literatürde yeni bir düşünce ortaya çıktı: JPEG sıkıştırmasının aslında model eğitimi için iyileştirilmiş sonuçlar elde edilebileceği.
Ancak, bu makalenin yazarları, JPEG görüntülerinin çeşitli kalite seviyelerinde iyileştirilmiş sonuçlar elde edebildiler, ancak önerdikleri model o kadar karmaşıktı ve zahmetliydi ki uygulanamazdı. Ayrıca, sistemin varsayılan JPEG optimizasyon ayarları (quantization) eğitimin etkinliğine bir engel oluşturdu.
Daha sonraki bir proje (2023’ün JPEG Compliant Compression for DNN Vision) bir sistemle deneysel olarak, dondurulmuş bir derin sinir ağı (DNN) modeli kullanarak JPEG sıkıştırılmış eğitim görüntülerinden biraz daha iyi sonuçlar elde etti. Ancak, modelin bazı kısımlarını eğitirken dondurmak, modelin esnekliğini ve daha geniş anlamda yeni verilere karşı direncini azaltma eğilimindedir.
JPEG-DL
Bunun yerine, yeni çalışma, JPEG Inspired Deep Learning adlı, çok daha basit bir mimari sunuyor ve hatta mevcut modellere uygulanabilir.
Araştırmacılar, Waterloo Üniversitesi’nden, şöyle diyor:
‘Sonuçlar, JPEG-DL’nin standart DL’ye göre çeşitli DNN mimarilerinde tutarlı ve önemli bir şekilde üstün olduğunu gösteriyor, model karmaşıklığında ihmal edilebilir bir artışla birlikte.’
‘Özellikle, JPEG-DL, bazı ince ayrıntılı sınıflandırma veri setlerinde sınıflandırma doğruluğunu %20,9’a kadar artırıyor ve DL pipeline’a yalnızca 128 eğitim parametresi ekliyor. Ayrıca, JPEG-DL’nin standart DL’ye göre üstünlüğü, öğrenilen modellerin artan advers saldırıya karşı direnci ve girdi görüntülerinin azaltılmış dosya boyutları ile daha da gösteriliyor.’
Yazarlar, optimal bir JPEG sıkıştırma kalitesi seviyesinin, bir sinir ağı için bir görüntünün merkezi konularını ayırt etmesine yardımcı olabileceğini iddia ediyor. Aşağıdaki örnekte, temel sonuçları (solda) görüyoruz, sinir ağı tarafından elde edilen özelliklerin, arka planla birleştiğini gösteriyor. Karşılaştırıldığında, JPEG-DL (sağda) görüntünün konusunu ayırt etmeyi ve çizmektedir.

JPEG-DL için temel yöntemlere karşı testler. Kaynak: https://arxiv.org/pdf/2410.07081
‘Bu olgu,’ açıkladılar, ‘[2021] makalesinde “sıkıştırma yardımcı” olarak adlandırılan, sıkıştırmanın gürültüyü ve rahatsız edici arka plan özelliklerini kaldırarak, ana nesneyi vurgulayarak, DNN’lerin daha iyi tahminler yapmasına yardımcı olduğu gerçeği ile haklıdır.’
Yöntem
JPEG-DL, standard bir JPEG optimizasyon rutininin farklılaşmayan nicel işlemini değiştirerek, farklılaşan bir yumuşak nicelleyici tanıtıyor.
Bu, gradyan tabanlı optimizasyonuna izin veriyor. Bu, geleneksel JPEG kodlamasında mümkün değildir, çünkü bir uniform nicelleyici ile bir yuvarlama işlemi kullanılır, bu da en yakın katsayıyı yaklaşık olarak gösterir.
JPEG-DL’nin şemasının farklılaşabilirliği, hem eğitim modelinin parametrelerinin hem de JPEG nicellemenin (sıkıştırma seviyesinin) ortak optimizasyonuna izin veriyor. Ortak optimizasyon, modelin ve eğitim verilerinin birbirlerine göre uyarlandığı anlamına gelir ve katmanların dondurulmasına gerek yoktur.
Aslında, sistem, (ham) veri setinin sıkıştırmasını, genellemenin mantığına uydurur.

Conceptual şema için JPEG-DL.
Kimse, ham verilerin ideal eğitim materyali olacağını varsayabilir; çünkü görüntüler, toplu olarak çalıştırıldığında, uygun bir tam uzunluklu renk uzayına tamamen dekompresyon geçirirler; bu nedenle orijinal formatın ne farkı vardır?
İyi, JPEG sıkıştırması insan görme için optimize edildiğinden, detay veya renk alanlarını, bu amaca uygun bir şekilde atar. Bir gölge altında mavi bir gökyüzü resmi verildiğinde, artan sıkıştırma seviyeleri gökyüzüne uygulanacaktır, çünkü “önemli” detay içermez.
Öte yandan, bir sinir ağı, merkezi konulara odaklanmamızı sağlayan tuhaf filtrelerden yoksundur. Bunun yerine, gökyüzündeki bantlama artefaktlarını, asimile edilecek geçerli veri olarak dikkate alması muhtemeldir.

İnsan, ağır sıkıştırılmış bir görüntüdeki (solda) gökyüzündeki bantlamayı reddeder, ancak bir sinir ağı, bu içeriğin atılması gerektiği konusunda hiçbir fikri yoktur ve daha yüksek kaliteli bir görüntüye (sağda) ihtiyaç duyar. Kaynak: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/
Bu nedenle, bir JPEG sıkıştırma seviyesi, çok özel bir domaine temsil etmediği sürece, tüm eğitim veri setinin içeriğine uymaz. Kalabalık resimleri, bir kuşa odaklanan dar bir resme göre çok daha az sıkıştırma gerektirir.
Yazarlar, nicellemenin zorluklarıyla aşina olmayanlar, ancak transformer mimarisi temelindeki süreçleri dikkate alabilirler.
Veri ve Testler
JPEG-DL, transformer tabanlı mimariler ve convolutional sinir ağları (CNN’ler) ile karşılaştırıldı. Kullanılan mimariler EfficientFormer-L1; ResNet; VGG; MobileNet; ve ShuffleNet idi.
ResNet sürümleri, CIFAR veri seti için özgüldü: ResNet32, ResNet56 ve ResNet110. VGG tabanlı testler için VGG8 ve VGG13 seçildi.
CNN için eğitim metodolojisi, 2020 çalışmasından Contrastive Representation Distillation (CRD) idi. EfficientFormer-L1 (transformer tabanlı) için, 2023 çalışmasından Initializing Models with Larger Ones metodolojisi kullanıldı.
İnce ayrıntılı görevler için dört veri seti kullanıldı: Stanford Dogs; Oxford Üniversitesi’nin Flowers; CUB-200-2011 (CalTech Birds); ve Pets (‘Kediler ve Köpekler’, Hindistan’daki Hyderabad ile Oxford Üniversitesi arasındaki bir işbirliği).
CNN’ler için ince ayrıntılı görevler için, yazarlar PreAct ResNet-18 ve DenseNet-BC kullandı. EfficientFormer-L1 için, yukarıda bahsedilen Initializing Models With Larger Ones metodolojisi kullanıldı.
CIFAR-100 ve ince ayrıntılı görevler boyunca, JPEG sıkıştırma yaklaşımındaki çeşitli büyüklükteki Dik Kosinüs Dönüşümü (DCT) frekanslarını, Adam optimizatörü ile ele alındı, böylece test edilen modeller için JPEG katmanının öğrenme oranını uyarlayabildiler.
ImageNet-1K testlerinde, tüm deneylerde, yazarlar PyTorch’u, SqueezeNet, ResNet-18 ve ResNet-34 ile birlikte kullandı.
JPEG katmanının optimizasyon değerlendirmesi için, araştırmacılar, daha稳il bir performans için Stochastic Gradient Descent (SGD) yerine Adam’ı kullandı. Ancak, ImageNet-1K testleri için, 2019 makalesinden Learned Step Size Quantization metodolojisi kullanıldı.

Üstte, CIFAR-100’de temel ve JPEG-DL için en üst düzey doğruluk, üç çalışmanın ortalaması ve standart sapması. Altta, çeşitli model mimarilerinde çeşitli ince ayrıntılı görüntü sınıflandırma görevleri için en üst düzey doğruluk, yine üç geçişin ortalaması.
Yazarlar, yukarıda gösterilen ilk tur sonuçlarına ilişkin olarak şunları söylüyor:
‘Tüm yedi test edilen model için CIFAR-100’de, JPEG-DL tutarlı bir şekilde geliştirmeler sağlıyor, en üst düzey doğrulukta %1,53’e kadar kazançlar elde ediyor. İnce ayrıntılı görevlerde, JPEG-DL önemli bir performans artışı sunuyor, tüm veri setlerinde iki farklı model kullanarak %20,90’a kadar geliştirmeler sağlıyor.’
ImageNet-1K testleri için sonuçlar aşağıda gösteriliyor:

Çeşitli çerçevelerde ImageNet için en üst düzey doğruluk sonuçları.
Burada makale şunları söylüyor:
‘SqueezeNetV1.1 için, JPEG-DL, tek bir nicelleme işlemi kullanarak temel modele göre %0,31’lik bir en üst düzey doğruluk kazanımı elde ediyor, yalnızca 128 parametre eklenerek.
‘Nicelleme işlemlerinin sayısını beşe çıkararak, %0,20’lik ek bir gelişme gözlemliyoruz, temel modele göre toplam %0,51’lik bir kazanç elde ediliyor.’
Araştırmacılar, sistemi ayrıca advers saldırı yaklaşımları Fast Gradient Signed Method (FGSM) ve Projected Gradient Descent (PGD) ile test etti.
Saldırılar, CIFAR-100’de iki model üzerinde gerçekleştirildi:

JPEG-DL için iki standart advers saldırı çerçevesi ile test sonuçları.
Yazarlar şunları söylüyor:
‘JPEG-DL modelleri, standart DNN modellerine göre advers saldırıya karşı direnci önemli ölçüde geliştiriyor, FGSM için %15’e kadar ve PGD için %6’ya kadar geliştirmeler sağlıyor.’
Ayrıca, makalede daha önce gösterilen gibi, yazarlar GradCAM++ kullanarak çıkarılan özellik haritalarının bir karşılaştırmasını gerçekleştirdi – bu, çıkarılan özellikleri görsel olarak vurgulayabilen bir çerçeve.

Temel ve JPEG-DL görüntü sınıflandırması için GradCAM++ illüstrasyonu, çıkarılan özelliklerle vurgulanmış.
Makale, JPEG-DL’nin daha iyi bir sonuç ürettiğini ve bir örnekte temel modelin başarısız olduğu bir görüntüyü sınıflandırabildiğini belirtiyor. Daha önce gösterilen, bir kuğu içeren görüntüye ilişkin olarak yazarlar şunları söylüyor:
‘JPEG-DL modelinin özellik haritalarının, arka planla karşılaştırıldığında (kuş) ön plan bilgisi arasında önemli ölçüde daha iyi bir kontrast gösterdiği açık.’
‘Özellikle, JPEG-DL özellik haritalarındaki ön plan nesnesi, iyi tanımlanmış bir kontur içinde kapatılmış, arka planından görsel olarak ayırt edilebilir.’
‘Karşılaştırıldığında, temel modelin özellik haritaları daha fazla birleştirilmiş bir yapıya sahip, ön planın düşük frekanslarda daha yüksek enerjiye sahip olduğu, bu nedenle arka planla daha sorunsuz bir şekilde birleştiği görülüyor.’
Sonuç
JPEG-DL, ham verilerin mevcut olduğu durumlar için tasarlanmıştır – ancak bu projede yer alan bazı ilkelerin geleneksel veri seti eğitimi için uygulanıp uygulanamayacağını görmek çok ilginç olacaktır, özellikle de içerik daha düşük kaliteli olduğunda (bu, internetten kazınan hiperskale veri setlerinde sıkça görüldüğü gibi).
Bu, büyük ölçüde bir açıklama problemi olarak kalıyor, ancak trafik tabanlı görüntü tanımı ve başka yerlerde ele alındı.
İlk olarak 10 Ekim 2024 Perşembe günü yayımlandı.












