Andersons vinkel

Brug af JPEG-komprimering til at forbedre neuralt netværkstræning

mm
Føj Unite.AI til dine foretrukne kilder på Google
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

En ny forskningsartikel fra Canada har foreslået en ramme, der bevidst introducerer JPEG-komprimering i træningsskemaet for et neuralt netværk, og opnår bedre resultater – og bedre modstand over for fjendtlige angreb.

Dette er en ret radikal idé, da den nuværende almindelige visdom er, at JPEG-artefakter, der er optimeret til menneskelig visning, og ikke til maskinel læring, generelt har en skadelig virkning på neurale netværk, der trænes på JPEG-data.

Et eksempel på forskellen i klarhed mellem JPEG-billeder komprimeret med forskellige tabsværdier (højere tab tillader en mindre filstørrelse, på bekostning af kontur og båndning over farvegradienter, blandt andre typer af artefakter). Kilde: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Et eksempel på forskellen i klarhed mellem JPEG-billeder komprimeret med forskellige tabsværdier (højere tab tillader en mindre filstørrelse, på bekostning af kontur og båndning over farvegradienter, blandt andre typer af artefakter). Kilde: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

En rapport fra 2022 fra University of Maryland og Facebook AI hævdede, at JPEG-komprimering “medfører en betydelig ydelsesstraf” i træningen af neurale netværk, på trods af tidligere arbejde, der påstod, at neurale netværk er relativt robuste over for billedkompressionsartefakter.

Et år før dette var en ny tankegang dukket op i litteraturen: at JPEG-komprimering kunne faktisk udnyttes til forbedrede resultater i modeltræning.

Men selvom forfatterne af denne artikel kunne opnå forbedrede resultater i træningen af JPEG-billeder af varierende kvalitet, var modellen de foreslog så kompleks og byrdefuld, at den ikke var praktisk. Derudover viste systemets brug af standard JPEG-optimeringsindstillinger (kvantificering) sig at være en barriere for træningseffektiviteten.

En senere projekt (2023’s JPEG Compliant Compression for DNN Vision) eksperimenterede med et system, der opnåede lidt bedre resultater fra JPEG-komprimerede træningsbilleder med brug af en frosset dybt neuralt netværk (DNN)-model. Men frysning af lag i en model under træning tenderer til at reducere modellens fleksibilitet samt dens bredere robusthed over for ny data.

JPEG-DL

I stedet tilbyder det nye arbejde, titlen JPEG Inspired Deep Learning, en langt enklere arkitektur, der kan påføres eksisterende modeller.

Forskerne fra University of Waterloo fastslår:

‘Resultaterne viser, at JPEG-DL betydeligt og konsekvent overgår standard-DL på tværs af forskellige DNN-arkitekturer, med en næsten ubetydelig øgning i modelkompleksitet.

Specifikt forbedrer JPEG-DL klassificeringsnøjagtigheden med op til 20,9% på visse fine-grainede klassificeringsdataset, samtidig med at det kun tilføjer 128 trænbarer parametre til DL-pipeline. Desuden viser JPEG-DL’s overlegenhet over standard-DL sig yderligere gennem den forbedrede modstandsdygtighed af de lærte modeller og reducerede filstørrelser af inputbillederne.’

Forfatterne påstår, at en optimal JPEG-komprimeringskvalitetsniveau kan hjælpe et neuralt netværk med at skelne mellem centrale emner/objekter i et billede. I eksemplet nedenfor ser vi baseline-resultater (venstre), der blander fuglen ind i baggrunden, når funktioner erhverves af det neurale netværk. I modsætning hertil lykkes JPEG-DL (højre) med at skelne og afgrænse motivet i billedet.

Tests mod baseline-metoder for JPEG-DL. Kilde: https://arxiv.org/pdf/2410.07081

Tests mod baseline-metoder for JPEG-DL. Kilde: https://arxiv.org/pdf/2410.07081

‘Dette fænomen,’ forklarer de, ‘kaldes “komprimering hjælper” i [2021]-artiklen, og det berettiges af, at komprimering kan fjerne støj og forstyrrende baggrundsfunktioner, og dermed fremhæve hovedobjektet i et billede, hvilket hjælper DNN’er med at give bedre prædiktioner.’

Metode

JPEG-DL introducerer en differentierbar soft kvantificator, der erstatter den ikke-differentiable kvantificeringsoperation i en standard JPEG-optimeringsrutine.

Dette tillader gradient-baseret optimering af billederne. Dette er ikke muligt i konventionel JPEG-kodning, der bruger en uniform kvantificator med en afrundingsoperation, der approksimerer den nærmeste koefficient.

Den differentiable af JPEG-DL’s skema tillader joint optimering af både træningsmodellens parametre og JPEG-kvantificeringen (komprimeringsniveau). Joint optimering betyder, at både modellen og træningsdataene tilpasses hinanden i end-to-end-processen, og ingen frysning af lag er nødvendig.

Essentiel set customiserer systemet JPEG-komprimeringen af en (rå) dataset til at passe logikken i generaliseringsprocessen.

Skema for JPEG-DL.

Konceptuelt skema for JPEG-DL.

Man kunne antage, at rå data ville være det ideelle materiale til træning; efter alt, billeder er fuldstændigt dekomprimeret til en passende fuldlængde farverum, når de køres i batch; så hvad forskel gør den oprindelige format?

Vel, da JPEG-komprimering er optimeret til menneskelig visning, kaster den områder af detaljer eller farve væk på en måde, der er i overensstemmelse med dette mål. Givet et billede af en sø under en blå himmel, vil øgede niveauer af komprimering blive anvendt på himlen, fordi den indeholder ingen “essentielle” detaljer.

På den anden side mangler et neuralt netværk de ekscentriske filtre, der tillader os at fokusere på centrale emner. I stedet er det sandsynligt, at det vil betragte enhver båndningsartefakt i himlen som gyldig data, der skal assimileres i dets latente rum.

Selvom et menneske vil afvise båndningen i himlen i et tungt komprimeret billede (venstre), har et neuralt netværk ingen idé om, at dette indhold skal kasseres, og vil have brug for et højere kvalitetsbillede (højre). Kilde: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Selvom et menneske vil afvise båndningen i himlen i et tungt komprimeret billede (venstre), har et neuralt netværk ingen idé om, at dette indhold skal kasseres, og vil have brug for et højere kvalitetsbillede (højre). Kilde: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Derfor er det usandsynligt, at ét niveau af JPEG-komprimering vil være tilstrækkeligt til hele indholdet af en træningsdataset, medmindre det repræsenterer et meget specifikt domæne. Billeder af menneskemængder vil kræve langt mindre komprimering end et snævert fokuseret billede af en fugl, for eksempel.

Forfatterne observerer, at de, der ikke er bekendt med udfordringerne ved kvantificering, men som er bekendt med grundlæggende principper for transformatorer, kan betragte disse processer som en opmærksomhedsoperation, bredt.

Data og tests

JPEG-DL blev evaluueret mod transformer-baserede arkitekturer og konvolutionsneurale netværk (CNN’er). Arkitekturerne, der blev brugt, var EfficientFormer-L1; ResNet; VGG; MobileNet; og ShuffleNet.

ResNet-versionerne, der blev brugt, var specifikke for CIFAR-datasettet: ResNet32, ResNet56 og ResNet110. VGG8 og VGG13 blev valgt til VGG-baserede tests.

For CNN blev træningsmetoden afledt fra 2020-arbejdet Contrastive Representation Distillation (CRD). For EfficientFormer-L1 (transformator-baseret) blev træningsmetoden fra 2023-udgaven Initializing Models with Larger Ones brugt.

For fine-grained opgaver, der blev præsenteret i testene, blev fire dataset brugt: Stanford Dogs; University of Oxford’s Flowers; CUB-200-2011 (CalTech Birds); og Pets (‘Katte og hunde’, et samarbejde mellem University of Oxford og Hyderabad i Indien).

For fine-grained opgaver på CNN’er blev PreAct ResNet-18 og DenseNet-BC brugt. For EfficientFormer-L1 blev metoden, der blev beskrevet i ovennævnte Initializing Models With Larger Ones, brugt.

Over CIFAR-100 og fine-grained opgaver blev de varierende størrelser af Discrete Cosine Transform (DCT)-frekvenser i JPEG-komprimerings tilgangen behandlet med Adam-optimeren, for at tilpasse læringshastigheden for JPEG-laget over modellerne, der blev testet.

I tests på ImageNet-1K blev PyTorch brugt med SqueezeNet, ResNet-18 og ResNet-34 som kerne-modeller.

For JPEG-lag optimeringsevalueringen blev Stochastic Gradient Descent (SGD) brugt i stedet for Adam, for mere stabil præstation. Men for ImageNet-1K-testene blev metoden fra 2019-papiret Learned Step Size Quantization anvendt.

Ovenfor den top-1 valideringsnøjagtighed for baseline vs. JPEG-DL på CIFAR-100, med standard- og middelafvigelse gennemsnitligt over tre kørsler. Under, den top-1 valideringsnøjagtighed på forskellige fine-grained billedklassificeringsopgaver, over forskellige modelarkitekturer, igen gennemsnitligt over tre kørsler.

Ovenfor den top-1 valideringsnøjagtighed for baseline vs. JPEG-DL på CIFAR-100, med standard- og middelafvigelse gennemsnitligt over tre kørsler. Under, den top-1 valideringsnøjagtighed på forskellige fine-grained billedklassificeringsopgaver, over forskellige modelarkitekturer, igen gennemsnitligt over tre kørsler.

Kommentarer til den første runde af resultater, der vises ovenfor, fastslår forfatterne:

‘Over alle syv testede modeller for CIFAR-100 giver JPEG-DL konsekvent forbedringer, med gevinster på op til 1,53% i top-1-nøjagtighed. I fine-grained opgaver giver JPEG-DL en betydelig ydelsesforbedring, med forbedringer på op til 20,90% over alle dataset, ved hjælp af to forskellige modeller.’

Resultaterne for ImageNet-1K-testene vises nedenfor:

Top-1 valideringsnøjagtighed resultater på ImageNet over forskellige rammer.

Top-1 valideringsnøjagtighed resultater på ImageNet over forskellige rammer.

Her fastslår artiklen:

‘Med en ubetydelig øgning i kompleksitet (tilføjer 128 parametre), opnår JPEG-DL en forbedring på 0,31% i top-1-nøjagtighed for SqueezeNetV1.1 i forhold til baseline, ved hjælp af en enkelt runde af [kvantificerings]operation.

‘Ved at øge antallet af kvantificeringsrunder til fem, observerer vi en yderligere forbedring på 0,20%, hvilket resulterer i en total forbedring på 0,51% i forhold til baseline.’

Forskerne testede også systemet ved hjælp af data, der var kompromitteret af fjendtlige angreb-metoder Fast Gradient Signed Method (FGSM) og Projected Gradient Descent (PGD).

Angrebene blev udført på CIFAR-100 over to af modellerne:

Testresultater for JPEG-DL, mod to standard fjendtlige angrebsrammer.

Testresultater for JPEG-DL, mod to standard fjendtlige angrebsrammer.

Forfatterne fastslår:

‘[JPEG-DL]-modellerne forbedrer betydeligt den fjendtlige robusthed i forhold til standard DNN-modeller, med forbedringer på op til 15% for FGSM og 6% for PGD.’

Derudover, som vist tidligere i artiklen, udførte forfatterne en sammenligning af udtrukne funktioner ved hjælp af GradCAM++ – en ramme, der kan fremhæve udtrukne funktioner på en visuel måde.

En GradCAM++-illustration for baseline og JPEG-DL-billedklassificering, med udtrukne funktioner fremhævet.

En GradCAM++-illustration for baseline og JPEG-DL-billedklassificering, med udtrukne funktioner fremhævet.

Artiklen fastslår, at JPEG-DL producerer et forbedret resultat, og at det i ét tilfælde endda kunne klassificere et billede, som baseline ikke kunne identificere. Med hensyn til det tidligere viste billede med fugle, fastslår forfatterne:

‘[Det] er tydeligt, at funktionerne fra JPEG-DL-modellen viser en betydelig bedre kontrast mellem forgrundsoplysningerne (fuglen) og baggrunden i forhold til funktionerne, der er genereret af baseline-modellen.

‘Specifikt er forgrundsobjektet i JPEG-DL-funktionerne indesluttet i en veldefineret kontur, hvilket gør det visuelt skelnebart fra baggrunden.

‘I modsætning hertil viser baseline-modellens funktioner en mere blandet struktur, hvor forgrunden indeholder højere energi i lavfrekvenser, hvilket får den til at blande sig mere jævnt med baggrunden.’

Konklusion

JPEG-DL er beregnet til brug i situationer, hvor rå data er tilgængelige – men det ville være mest interessant at se, om nogle af principperne i dette projekt kunne anvendes på konventionel datasettræning, hvor indholdet kan være af lavere kvalitet (som ofte er tilfældet med hyperskale-dataset, der er skrabet fra internettet).

Det står, som det er, at dette i høj grad er et annotationsproblem, selvom det er blevet adresseret i trafik-baseret billedgenkendelse og andre steder.

 

Offentliggjort første gang torsdag, 10. oktober 2024

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]