Andersonův úhel

Použití komprese JPEG pro zlepšení trénování neuronových sítí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

Nová výzkumná práce z Kanady navrhla rámec, který záměrně zavádí kompresi JPEG do trénovacího schématu neuronové sítě a dosahuje lepších výsledků – a lepší odolnosti vůči adversářským útokům.

Toto je poměrně radikální myšlenka, protože současná obecná moudrost je taková, že artefakty JPEG, které jsou optimalizovány pro lidské vidění a ne pro strojové učení, obecně mají negativní vliv na neuronové sítě trénované na datech JPEG.

Příklad rozdílu v jasnosti mezi obrázky JPEG komprimovanými na různých úrovních ztráty (vyšší ztráta umožňuje menší velikost souboru, na úkor rozlišení a pásování přes barevné přechody, mezi jinými typy artefaktů). Source: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Příklad rozdílu v jasnosti mezi obrázky JPEG komprimovanými na různých úrovních ztráty (vyšší ztráta umožňuje menší velikost souboru, na úkor rozlišení a pásování přes barevné přechody, mezi jinými typy artefaktů). Source: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Zpráva z roku 2022 z University of Maryland a Facebook AI tvrdila, že komprese JPEG “způsobuje významnou penalizaci výkonu” při trénování neuronových sítí, navzdory předchozím pracím, které tvrdily, že neuronové sítě jsou relativně odolné vůči artefaktům komprese obrázků.

O rok dříve se v literatuře objevila nová myšlenka: že komprese JPEG by mohla skutečně být využita pro zlepšení výsledků modelového trénování.

Však, ačkoli autoři této práce byli schopni dosáhnout lepších výsledků při trénování obrázků JPEG různé kvality, model, který navrhli, byl tak složitý a náročný, že nebyl prakticky využitelný. Kromě toho, systémův použití výchozích nastavení optimalizace JPEG (quantizace) se ukázalo jako bariéra pro efektivní trénování.

Pozdější projekt (2023 JPEG Compliant Compression for DNN Vision) experimentoval se systémem, který získal mírně lepší výsledky z obrázků JPEG komprimovaných s použitím zmrazeného hlubokého neuronového modelu (DNN). Avšak, zmrazování částí modelu během trénování snižuje jeho univerzálnost a širší odolnost vůči novým datům.

JPEG-DL

Místo toho, nová práce, nazvaná JPEG Inspired Deep Learning, nabízí mnohem jednodušší architekturu, která může být dokonce aplikována na stávající modely.

Výzkumníci z University of Waterloo prohlašují:

‘Výsledky ukazují, že JPEG-DL významně a konzistentně překonává standardní DL napříč různými architekturami DNN, s nevýznamným nárůstem modelové složitosti.

Konkrétně, JPEG-DL zlepšuje přesnost klasifikace až o 20,9 % na některých jemných klasifikačních datech, zatímco přidává pouze 128 trénovatelných parametrů do DL potrubí. Kromě toho, nadřazenost JPEG-DL nad standardním DL je dále demonstrována zvýšenou odolností vůči adversářským útokům a snížením velikosti vstupních obrázků.’

Autorům se podařilo prokázat, že optimální úroveň kvality komprese JPEG může pomoci neuronové síti rozlišit centrální předmět/předměty obrázku. V následujícím příkladu vidíme výsledek základního modelu (vlevo) rozmazání ptáka do pozadí, když jsou získány funkce neuronovou sítí. Naopak, JPEG-DL (vpravo) se podařilo rozlišit a vykreslit předmět fotografie.

Testy proti základním metodám pro JPEG-DL. Source: https://arxiv.org/pdf/2410.07081

Testy proti základním metodám pro JPEG-DL. Source: https://arxiv.org/pdf/2410.07081

‘Tento jev,’ vysvětlují, ‘nazývaný “komprese pomáhá” v [2021] článku, je odůvodněn tím, že komprese může odstranit šum a rušivé pozadí, čímž zvýrazňuje hlavní objekt v obrázku, což pomáhá DNN dělat lepší předpověď.’

Metoda

JPEG-DL zavádí diferencovatelný měkký kvantizátor, který nahrazuje nediferencovatelnou kvantizační operaci ve standardním JPEG optimalizačním režimu.

Toto umožňuje gradientní optimalizaci obrázků. To není možné v konvenčním JPEG kódování, které používá uniformní kvantizátor s operací zaokrouhlování, která aproximuje nejbližší koeficient.

Diferencovatelnost schématu JPEG-DL umožňuje společnou optimalizaci obou modelových parametrů a JPEG kvantizace (komprese). Společná optimalizace znamená, že model i trénovací data jsou přizpůsobeny navzájem v koncovém procesu, a není třeba žádné zmrazování vrstev.

V podstatě, systém přizpůsobuje kompresi JPEG surového datasetu, aby se přizpůsobil logice generalizačního procesu.

Schéma pro JPEG-DL.

Konceptuální schéma pro JPEG-DL.

Jedna by mohla předpokládat, že surová data by byla ideálním materiálem pro trénování; nakonec, obrázky jsou zcela dekomprimovány do vhodného plného barevného prostoru, když jsou spuštěny v dávkách; tak co dělá rozdíl původní formát?

Nu, protože komprese JPEG je optimalizována pro lidské vidění, odhodí oblasti detailů nebo barev způsobem, který je v souladu s tímto cílem. Daný obrázek jezera pod modrou oblohou, zvýšené úrovně komprese budou aplikovány na oblohu, protože neobsahuje žádné “základní” detaily.

Na druhou stranu, neuronová síť postrádá excentrické filtry, které nám umožňují soustředit se na centrální předměty. Místo toho, je pravděpodobné, že bude považovat za platná data k asimilaci do svého latentního prostoru.

Ačkoli člověk odmítne pásování na obloze, v silně komprimovaném obrázku (vlevo), neuronová síť nemá žádné povědomí o tom, že tento obsah by měl být odhozen, a bude potřebovat vyšší kvalitu obrázku (vpravo). Source: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Ačkoli člověk odmítne pásování na obloze, v silně komprimovaném obrázku (vlevo), neuronová síť nemá žádné povědomí o tom, že tento obsah by měl být odhozen, a bude potřebovat vyšší kvalitu obrázku (vpravo). Source: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Tudíž, jedna úroveň komprese JPEG je nepravděpodobně vhodná pro celý obsah trénovacího datasetu, pokud nepředstavuje velmi specifickou doménu. Obrázky davů budou vyžadovat mnohem méně komprese než úzká fotografie ptáka, například.

Autorům se podařilo prokázat, že ti, kteří nejsou seznámeni s výzvami kvantizace, ale kteří jsou seznámeni se základy transformerové architektury, mohou považovat tyto procesy za operaci “pozornosti”, obecně.

Data a testy

JPEG-DL byl vyhodnocen proti transformerovým architekturám a konvolučním neuronovým sítím (CNN). Architektury, které byly použity, byly EfficientFormer-L1; ResNet; VGG; MobileNet; a ShuffleNet.

Verze ResNet, které byly použity, byly specifické pro CIFAR dataset: ResNet32, ResNet56 a ResNet110. VGG8 a VGG13 byly vybrány pro testy založené na VGG.

Pro CNN, trénovací metodika byla odvozena z práce z roku 2020 Contrastive Representation Distillation (CRD). Pro EfficientFormer-L1 (transformer-based), trénovací metoda z roku 2023 Initializing Models with Larger Ones byla použita.

Pro jemné úkoly, které byly součástí testů, byly použity čtyři datasety: Stanford Dogs; University of Oxford’s Flowers; CUB-200-2011 (CalTech Birds); a Pets (‘Cats and Dogs’, spolupráce mezi University of Oxford a Hyderabad v Indii).

Pro jemné úkoly na CNN, autoři použili PreAct ResNet-18 a DenseNet-BC. Pro EfficientFormer-L1, metodika popsána v Initializing Models With Larger Ones byla použita.

Příliš testů na ImageNet-1K, autoři použili PyTorch, se SqueezeNet, ResNet-18 a ResNet-34 jako jádrové modely.

Pro hodnocení optimalizace JPEG vrstvy, výzkumníci použili Stochastic Gradient Descent (SGD) místo Adam, pro stabilnější výkon. Avšak, pro testy ImageNet-1K, metoda z roku 2019 Learned Step Size Quantization byla použita.

Nahoře, top-1 validace přesnosti pro základní a JPEG-DL na CIFAR-100, se standardními a průměrnými odchylkami průměrovány přes tři běhy. Dole, top-1 validace přesnosti na různých jemných klasifikačních úkolech, napříč různými modelovými architekturami, opět, průměrovány z tří běhů.

Nahoře, top-1 validace přesnosti pro základní a JPEG-DL na CIFAR-100, se standardními a průměrnými odchylkami průměrovány přes tři běhy. Dole, top-1 validace přesnosti na různých jemných klasifikačních úkolech, napříč různými modelovými architekturami, opět, průměrovány z tří běhů.

Komentář k počátečnímu kola výsledků zobrazených výše, autoři prohlašují:

‘Napříč všemi sedmi testovanými modely pro CIFAR-100, JPEG-DL konzistentně poskytuje zlepšení, se zisky až 1,53 % v top-1 přesnosti. V jemných úkolech, JPEG-DL nabízí podstatné zlepšení výkonu, se zisky až 20,90 % napříč všemi datasety, používajícími dva různé modely.’

Výsledky pro testy ImageNet-1K jsou zobrazeny níže:

Top-1 validace přesnosti výsledků na ImageNet, napříč různými rámci.

Top-1 validace přesnosti výsledků na ImageNet, napříč různými rámci.

Článek zde uvádí:

‘S nevýznamným nárůstem složitosti (přidáním 128 parametrů), JPEG-DL dosahuje zisku 0,31 % v top-1 přesnosti pro SqueezeNetV1.1 ve srovnání se základním modelem, používajícím jednu rundu [kvantizační] operace.

‘Zvýšením počtu kvantizačních rund na pět, pozorujeme další zlepšení o 0,20 %, vedoucí k celkovému zisku 0,51 % oproti základnímu modelu.’

Výzkumníci také testovali systém pomocí dat kompromitovaných adversářskými útoky Fast Gradient Signed Method (FGSM) a Projected Gradient Descent (PGD).

Útoky byly provedeny na CIFAR-100, napříč dvěma modely:

Testovací výsledky pro JPEG-DL, proti dvěma standardním adversářským útokům.

Testovací výsledky pro JPEG-DL, proti dvěma standardním adversářským útokům.

Autorům se podařilo prokázat:

‘[JPEG-DL] modely významně zlepšují odolnost vůči adversářským útokům, ve srovnání se standardními DNN modely, se zisky až 15 % pro FGSM a 6 % pro PGD.’

<p Navíc, jak je ukázáno dříve v článku, autoři provedli srovnání extrahovaných funkcí pomocí GradCAM++ – rámce, který může zvýraznit extrahované funkce vizuálně.

GradCAM++ ilustrace pro základní a JPEG-DL image klasifikaci, se zvýrazněnými funkcemi.

GradCAM++ ilustrace pro základní a JPEG-DL image klasifikaci, se zvýrazněnými funkcemi.

Článek uvádí, že JPEG-DL produkuje lepší výsledek, a že v jednom případě byl dokonce schopen klasifikovat obrázek, který základní model nedokázal identifikovat. Ohledně dříve zobrazeného obrázku s ptákem, autoři prohlašují:

‘[Je] zřejmé, že funkce mapy z JPEG-DL modelu ukazují podstatně lepší kontrast mezi předním objektem (ptákem) a pozadím, ve srovnání s funkcemi mapy generovanými základním modelem.

‘Konkrétně, přední objekt v JPEG-DL funkcích map je uzavřen v dobře definovaném obrysu, což jej činí vizuálně rozlišitelným od pozadí.

‘Naopak, funkce mapy základního modelu ukazují více smíšenkovou strukturu, kde přední objekt obsahuje vyšší energii v nízkých frekvencích, což způsobuje, že se více prolíná s pozadím.’

Závěr

JPEG-DL je určen pro použití v situacích, kde jsou k dispozici surová data – ale bylo by zajímavé vidět, zda některé principy z tohoto projektu mohly být aplikovány na konvenční trénování datasetu, kde je obsah nižší kvality (jako je často případ u hyperscale datasetů, které jsou získány z internetu).

Jak stojí, to většinou zůstává problém annotace, ačkoli to bylo řešeno v založené na dopravě rozpoznávání obrazu, a jinde.

Poprvé zveřejněno, čtvrtek, 10. října 2024

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai