Andersons vinkel
Løsning av JPEG-artefaktproblemet i datamengder for datamaskinsyn

En ny studie fra University of Maryland og Facebook AI har funnet en ‘betydelig ytelsesstraff’ for dyplæringssystemer som bruker sterkt komprimerte JPEG-bilder i deres datamengder, og tilbyr noen nye metoder for å mildne effektene av dette.
Rapporten, med tittelen Analyzing and Mitigating JPEG Compression Defects in Deep Learning, hevder å være ‘mye mer omfattende’ enn tidligere studier om effektene av artefakter i trening av datamaskinsyn-datamengder. Papiret finner at ‘[tung] til moderat JPEG-komprimering medfører en betydelig ytelsesstraff på standardmetrikker’, og at neurale nettverk kanskje ikke er like robuste mot slike forstyrrelser som tidligere arbeid antyder.

Et bilde av en hund fra 2018 MobileNetV2-datamengden. Ved kvalitet 10 (venstre), feiler en klassifiseringsystem å identifisere den riktige rasen ‘Pembroke Welsh Corgi’, og gjetter i stedet ‘Norwich terrier’ (systemet vet allerede at dette er et bilde av en hund, men ikke rasen); andre fra venstre, en ferdig JPEG-artefakt-korrektur av bildet feiler også å identifisere den riktige rasen; andre fra høyre, målrettet artefakt-korreksjon gjenopprettar den riktige klassifiseringen; og høyre, det originale bildet, korrekt klassifisert. Kilde: https://arxiv.org/pdf/2011.08932.pdf
Komprimeringsartefakter som ‘data’
Ekstrem JPEG-komprimering er sannsynlig å skape synlige eller semi-synlige kanter rundt 8×8-blokkene som en JPEG består av. Når disse blokkering- eller ‘ringing’-artefaktene dukker opp, er de sannsynlig å bli misforstått av maskinlæringsystemer som virkelige verdens-elementer i bildets emne, med mindre noen kompensasjon gjøres for dette.

Ovenfor, vil et datamaskinsyn-maskinlæringsystem trekke ut en ‘ren’ gradient-bilde fra et bilde av god kvalitet. Under, ‘blokkering’-artefakter i en lavkvalitets-lagring av bildet skjuler bildets egenskaper, og kan ende opp med å ‘infisere’ egenskapene som er avledet fra et bilde-sett, særlig i tilfeller der høy- og lavkvalitets-bilder forekommer i datamengden, slik som i web-skrapede samlinger hvor bare generisk data-rengjøring har blitt brukt. Kilde: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
Som vist i det første bildet ovenfor, kan slike artefakter påvirke bilde-klassifiseringsoppgaver, med implikasjoner også for tekst-gjenkjenningsalgoritmer, som kan feile å korrekt identifisere artefakt-påvirkede tegn.
I tilfelle av bilde-syntese-treningssystemer (slik som deepfake-programvare eller GAN-basert bilde-genereringssystemer), kan en ‘rogue’-blokk av lavkvalitets-, sterkt komprimerte bilder i en datamengde enten dra median-kvaliteten på reproduksjonen ned, eller bli undertrykt og erstattet av en større mengde høykvalitets-egenskaper som er avledet fra bedre bilder i settet. I begge tilfeller er bedre data ønskelig – eller, i det minste, konsistente data.
JPEG – Vanligvis ‘godt nok’
JPEG-komprimering er en irreversibel, tap-fyldig kodek som kan brukes på ulike bilde-formater, selv om den primært brukes på JFIF-bilde-fil wrapperen. Til tross for dette, ble JPEG (.jpg)-formatet navngitt etter komprimeringsmetoden, og ikke JFIF-wrapperen for bilde-data.
Hele maskinlærings-arkitekturer har oppstått i de senere årene som inkluderer JPEG-stil artefakt-mildring som en del av AI-drevne oppskalering/gjenoppretting-rutiner, og AI-basert komprimeringsartefakt-fjerning er nå inkorporert i flere kommersielle produkter, som Topaz-bilde/video suite, og neurale funksjoner i nyere versjoner av Adobe Photoshop.
Siden 1986 JPEG-skjema som for tiden er i vanlig bruk, ble låst ned i begynnelsen av 1990-årene, er det ikke mulig å legge til metadata til et bilde som skulle indikere hvilken kvalitetsnivå (1-100) et JPEG-bilde ble lagret på – i det minste, ikke uten å modifisere over tretti år med legacy-konsument-, profesjonell- og akademisk programvare-systemer som ikke forventet at slik metadata skulle være tilgjengelig.
Derfor er det ikke uvanlig å tilpasse maskinlærings-trening-rutiner til den evaluerte eller kjente kvaliteten på JPEG-bilde-data, som forskerne har gjort for den nye rapporten (se under). I fravær av en ‘kvalitet’-metadata-innlegg, er det for tiden nødvendig å enten kjenne detaljene om hvordan bildet ble komprimert (dvs. komprimert fra en tap-fri kilde), eller estimere kvaliteten gjennom perseptuelle algoritmer eller manuell klassifisering.
En økonomisk kompromiss
JPEG er ikke den eneste tap-fylte komprimeringsmetoden som kan påvirke kvaliteten på maskinlærings-datamengder; komprimeringsinnstillinger i PDF-filer kan også kaste informasjon på denne måten, og kan settes til svært lave kvalitetsnivåer for å spare disk-plass for lokal eller nett-arkivering.
Dette kan sees ved å prøve ulike PDF-filer på archive.org, noen av dem har blitt komprimert så sterkt at de er en betydelig utfordring for bilde- eller tekst-gjenkjennings-systemer. I mange tilfeller, som for eksempel opphavsrettslige bøker, synes denne intense komprimeringen å ha blitt brukt som en form for billig DRM, på samme måte som opphavsretts-innehavere kan velge å senke oppløsningen på bruker- lastede YouTube-videoer som de har opphavsretten til, og etterlater ‘blokkede’ videoer som promoteringstokene for å inspirere ‘fullt oppløsning’-kjøp, i stedet for å slette dem.
I mange andre tilfeller er oppløsningen eller bildekvaliteten lav bare fordi dataene er svært gamle, og stammer fra en tid da lokal og nett-lagring var mer kostbart, og da begrensede nett-hastigheter favoriserte høyt optimerte og portable bilder over høy kvalitets-reproduksjon.
Det har blitt hevdet at JPEG, selv om det ikke er den beste løsningen nå, har blitt ‘innskrevet’ som en uflyttbar legacy-infrastruktur som er essensielt sammenvevd med internettets grunnleggende strukturer.
Arven fra fortiden
Til tross for at senere innovasjoner som JPEG 2000, PNG og (mest nylig).webp-formatet tilbyr bedre kvalitet, ville gjen-innspilling av eldre, høyt populære maskinlærings-datamengder sannsynligvis ’tilbake-sette’ kontinuiteten og historien til år-for-år datamaskinsyn-utfordringer i den akademiske samfunnet – en hindring som ville gjelde også i tilfelle av om-lagring av PNG-datamengde-bilder på høyere kvalitetsinnstillinger. Dette kunne betraktes som en type teknisk gjeld.
Mens venerable server-drevne bilde-behandlings-biblioteker som ImageMagick støtter bedre formater, inkludert.webp, oppstår ofte bilde-transformasjons-krav i legacy-systemer som ikke er satt opp for annet enn JPG eller PNG (som tilbyr tap-fri komprimering, men på bekostning av latency og disk-plass). Selv WordPress, CMS-en som driver nærmere 40% av alle nettsteder, la bare til.webp-støtte for tre måneder siden.
PNG var en sen (kanskje for sen) inngang i bilde-format-sektoren, oppstått som en åpen kilde-løsning i slutten av 1990-årene som en reaksjon på en 1995-erklæring fra Unisys og CompuServe om at royalties skulle betales på LZW-komprimeringsformatet brukt i GIF-filer, som ofte ble brukt på den tiden for logoer og flate-fargede elementer, selv om formatets gjenfødsel i begynnelsen av 2010-årene sentrerte seg rundt dets evne til å tilby lav-båndbredde, snappy animert innhold (ironisk nok, animerte PNG-er fikk aldri popularitet eller bred støtte, og ble sogar forbudt fra Twitter i 2019).
Til tross for sine mangler, er JPEG-komprimering rask, plass-efektiv og dypt inntrent i systemer av alle typer – og derfor ikke sannsynlig å forsvinne fullstendig fra maskinlærings-scenen i nær fremtid.
Å gjøre det beste av AI/JPEG-våpenhvilen
I en viss grad har maskinlærings-samfunnet tilpasset seg JPEG-komprimeringens svakheter: i 2011 publiserte den europeiske radiologiske samfunnet (ESR) en studie om ‘Brukbarheten av irreversibel bilde-komprimering i radiologisk bilde-behandling’, og ga retningslinjer for ‘akseptabel’ tap; når den venerable MNIST tekst-gjenkjennings-datamengden (hvis bilde-data opprinnelig ble levert i en ny binær format) ble portet til et ‘vanlig’ bilde-format, JPEG, ikke PNG, ble valgt; og en tidligere (2020) samarbeid fra den nye rapportens forfattere tilbød ‘en ny arkitektur’ for å kalibrere maskinlærings-systemer til JPEG-bilde-kvalitetens mangler, uten at modellene måtte bli trent på hver JPEG-kvalitetsinnstilling – en funksjon som ble brukt i den nye studien.
I virkeligheten er forskning på nytten av kvalitets-variant JPEG-data en relativt blomstrende felt i maskinlærings-forskning. Et (uavhengig) 2016-prosjekt fra Center for Automation Research ved University of Maryland, sentrerer faktisk på DCT-domænet (hvor JPEG-artefakter oppstår ved lave kvalitetsinnstillinger) som en rute til dypt funksjons-uttrekk; et annet prosjekt fra 2019 konsentrerer seg om byte-nivå-lesing av JPEG-data uten den tidskrevende nødvendigheten av å faktisk dekomprimere bildene (dvs. åpne dem på et eller annet tidspunkt i en automatisert arbeidsflyt); og en studie fra Frankrike i 2019 aktivt utnytter JPEG-komprimering i tjeneste av objekt-gjenkjennings-rutiner.
Testing og konklusjoner
For å returnere til den siste studien fra UoM og Facebook, søkte forskerne å teste JPEG-forståelse og nytte på bilder komprimert mellom 10-90 (under hvilken, bildet er umulig forstyrret, og over hvilken det er likt med tap-fri komprimering). Bildene som ble brukt i testene ble for-komprimert på hver verdi innenfor mål-kvalitetsområdet, og medførte minst åtte trenings-sesjoner.
Modellene ble trent på stokastisk gradient-decsent over fire metoder: baseline, hvor ingen ekstra mildninger ble lagt til; supervised fine-tuning, hvor treningssettet har fordelen av forhånds-trente vekter og merket data (selv om forskerne innrømmer at dette er vanskelig å replikere i forbruker-nivå-applikasjoner); artefakt-korreksjon, hvor augmentasjon/forbedring utføres på de komprimerte bildene før trening; og mål-rettet artefakt-korreksjon, hvor artefakt-korrekt-nettverket blir fin-justert på returnerte feil.
Trening skjedde på en rekke ulike apte datamengder, inkludert flere varianter av ResNet, FastRCNN, MobileNetV2, MaskRCNN og Keras’ InceptionV3.
Eksempel på tap-resultater etter mål-rettet artefakt-korreksjon vises nedenfor (lavere = bedre).

Det er ikke mulig å dykke dypt inn i detaljene av resultatene som ble oppnådd i studien, fordi forskernes funn er delt mellom målet om å evaluere JPEG-artefakter og nye metoder for å lettelse av dette; treningen ble iterert per-kvalitet over så mange datamengder; og oppgavene inkluderte flere mål som objekt-deteksjon, segmentering og klassifisering. I virkeligheten stiller den nye rapporten seg som en omfattende referanse-arbeid som behandler flere problemer.
Likevel konkluderer papiret bredt med at ‘JPEG-komprimering har en bratt straff over hele linjen for tung til moderat komprimering’. Det hevder også at deres nye, umerkede mildnings-strategier oppnår bedre resultater enn andre lignende tilnærminger; at, for komplekse oppgaver, forskernes supervised-metode også overgår sine likeverdige, til tross for å ikke ha tilgang til grunn-sannhets-merker; og at disse nye metodene tillater modell-gjenbruk, siden vektene som er oppnådd er overførbar mellom oppgaver.
I klassifisering-oppgaver, sier papiret uttrykkelig at ‘JPEG forringrer gradient-kvaliteten samt induserer lokaliserings-feil’.
Forskerne håper å utvide fremtidige studier for å dekke andre komprimerings-metoder som JPEG 2000, samt WebP, HEIF og BPG. De foreslår også at deres metode kunne bli brukt i lignende forskning på video-komprimerings-algoritmer.
Siden mål-rettet artefakt-korreksjons-metoden har vist seg å være så suksessfull i studien, signaliserer forfatterne også sin intensjon om å slippe vektene som ble trent under prosjektet, og forventer at ‘[mange] applikasjoner vil dra nytte av å bruke våre TTAC-vektene uten noen modifikasjon.’
n.b. Kilde-bilde for artikkelen kommer fra thispersondoesnotexist.com












