Angolo di Anderson
Risoluzione del problema degli artifact JPEG nei set di dati di visione artificiale

Uno studio recente dellâUniversità del Maryland e di Facebook AI ha scoperto una âpenalità di prestazioni significativaâ per i sistemi di apprendimento profondo che utilizzano immagini JPEG altamente compresse nei loro set di dati e offre alcuni nuovi metodi per mitigare gli effetti di questo.
Il rapporto, intitolato Analisi e mitigazione dei difetti di compressione JPEG nellâapprendimento profondo, afferma di essere âsignificativamente piÃđ completoâ rispetto a studi precedenti sugli effetti degli artifact in set di dati di visione artificiale. Il paper conclude che â[la compressione JPEG pesante] incide in modo significativo sulle prestazioni su metriche standardâ e che le reti neurali potrebbero non essere cosÃŽ resilienti a tali perturbazioni come suggerito in precedenti lavori suggests.

Una foto di un cane dal set di dati MobileNetV2 del 2018. A qualità 10 (a sinistra), un sistema di classificazione non riesce a identificare la razza corretta âPembroke Welsh Corgiâ, invece indovina âNorwich terrierâ (il sistema già sa che si tratta di una foto di un cane, ma non della razza); seconda da sinistra, una versione corretta degli artifact JPEG non riesce a identificare la razza corretta; seconda da destra, la correzione degli artifact mirata ripristina la classificazione corretta; e a destra, la foto originale, classificata correttamente. Source: https://arxiv.org/pdf/2011.08932.pdf
Artifact di compressione come âdatiâ
La compressione JPEG estrema ÃĻ probabile che crei bordi visibili o semivisibili intorno ai blocchi 8Ã8 dai quali unâimmagine JPEG ÃĻ assemblata in una griglia di pixel. Una volta che questi artifact di blocco o âringingâ appaiono, ÃĻ probabile che vengano fraintesi dai sistemi di apprendimento automatico come elementi reali del soggetto dellâimmagine, a meno che non venga fatta alcuna compensazione per questo.

Sopra, un sistema di apprendimento automatico di visione artificiale estrae unâimmagine di gradiente âpulitaâ da una foto di buona qualità . Sotto, gli artifact di blocco in una versione di qualità inferiore dellâimmagine oscurano le caratteristiche del soggetto e possono finire per âinfectareâ le caratteristiche derivate da un set di immagini, particolarmente nei casi in cui immagini di alta e bassa qualità si verificano nel set di dati, come in raccolte web-scraped a cui ÃĻ stata applicata solo una pulizia dei dati generica. Source: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
Come si vede nella prima immagine sopra, tali artifact possono influire sui compiti di classificazione delle immagini, con implicazioni anche per gli algoritmi di riconoscimento del testo, che potrebbero non riuscire a identificare correttamente i caratteri influenzati dagli artifact.
Nel caso dei sistemi di addestramento di sintesi di immagini (come il software di deepfake o i sistemi di generazione di immagini basati su GAN), un blocco ârogueâ di immagini di bassa qualità e altamente compresse in un set di dati potrebbe trascinare verso il basso la qualità mediana della riproduzione o essere assorbito e sostanzialmente annullato da un numero maggiore di caratteristiche di alta qualità estratte da immagini migliori nel set. In entrambi i casi, dati migliori sono desiderabili â o, almeno, dati coerenti.
JPEG â Di solito âabbastanza buonoâ
La compressione JPEG ÃĻ un codec irreversibilmente lossy che puÃē essere applicato a vari formati di immagine, sebbene sia principalmente applicato al wrapper di file di immagine JFIF wrapper. Nonostante ciÃē, il formato JPEG (.jpg) ÃĻ stato nominato dopo il suo metodo di compressione associato e non il wrapper JFIF per i dati dellâimmagine.
Interi architetture di apprendimento automatico sono sorte negli ultimi anni che includono la mitigazione degli artifact JPEG come parte delle routine di upscaling/ripristino guidate dallâAI, e la rimozione degli artifact di compressione basata sullâAI ÃĻ ora incorporata in una serie di prodotti commerciali, come la suite di immagini/video Topaz e le funzionalità neurali delle versioni recenti di Adobe Photoshop.
Dal momento che lo schema JPEG del 1986 attualmente in uso comune ÃĻ stato sostanzialmente bloccato allâinizio degli anni â90, non ÃĻ possibile aggiungere metadati a unâimmagine che indichino quale livello di qualità (1-100) unâimmagine JPEG ÃĻ stata salvata â almeno, non senza modificare oltre trentâanni di sistemi software legacy consumer, professionali e accademici che non si aspettavano che tali metadati fossero disponibili.
Di conseguenza, non ÃĻ insolito adattare le routine di addestramento dellâapprendimento automatico alla qualità valutata o nota dei dati di immagine JPEG, come hanno fatto i ricercatori per il nuovo paper (vedi sotto). In assenza di un entry di metadati âqualità â, ÃĻ attualmente necessario conoscere i dettagli di come lâimmagine ÃĻ stata compressa (ad esempio, compressa da una fonte lossless) o stimare la qualità attraverso algoritmi percettivi o classificazione manuale.
Un compromesso economico
JPEG non ÃĻ lâunico metodo di compressione lossy che puÃē influire sulla qualità dei set di dati di apprendimento automatico; le impostazioni di compressione nei file PDF possono anche scartare informazioni in questo modo e possono essere impostate su livelli di qualità molto bassi per risparmiare spazio su disco per archiviazione locale o di rete.
Questo puÃē essere visto campionando vari PDF su archive.org, alcuni dei quali sono stati compressi cosÃŽ tanto da essere una sfida notevole per i sistemi di riconoscimento di immagini o testo. In molti casi, come libri protetti da copyright, questa compressione intensa sembra essere stata applicata come una forma di DRM a buon mercato, allo stesso modo in cui i titolari del copyright possono scegliere di abbassare la risoluzione dei video caricati dagli utenti su YouTube su cui detengono la proprietà intellettuale, lasciando i video âblockyâ come token promozionali per ispirare acquisti âfull resâ, piuttosto che eliminarli.
In molti altri casi, la risoluzione o la qualità dellâimmagine ÃĻ bassa semplicemente perchÃĐ i dati sono molto vecchi e risalgono a unâepoca in cui lâarchiviazione locale e di rete era piÃđ costosa e quando le velocità di rete limitate favorivano immagini altamente ottimizzate e portatili rispetto alla riproduzione di alta qualità .
à stato sostenuto che JPEG, sebbene non sia la migliore soluzione ora, ÃĻ stato âconsacratoâ come infrastruttura legacy irremovibile che ÃĻ essenzialmente intrecciata con le fondamenta di Internet.
Onere legacy
Sebbene innovazioni successive come JPEG 2000, PNG e (piÃđ di recente) il formato.webp offrano una qualità superiore, ri-campionare set di dati di apprendimento automatico piÃđ vecchi e molto popolari sarebbe argomentato âresetâ la continuità e la storia degli sfidi di visione artificiale anno dopo anno nella comunità accademica â un ostacolo che si applicherebbe anche nel caso di ri-salvare immagini del set di dati PNG a impostazioni di qualità piÃđ elevate. CiÃē potrebbe essere considerato come una sorta di debito tecnico.
While librerie di elaborazione di immagini server-driven come ImageMagick supportano formati migliori, tra cui.webp, le esigenze di trasformazione delle immagini si verificano frequentemente in sistemi legacy che non sono configurati per nulla altro che JPG o PNG (che offre compressione lossless, ma al costo della latenza e dello spazio su disco). Anche WordPress, il CMS che alimenta quasi il 40% di tutti i siti web, ha aggiunto il supporto per.webp solo tre mesi fa.
PNG ÃĻ stata unâentrata tardiva (arguably troppo tardiva) nel settore dei formati di immagine, emersa come soluzione open source nella seconda metà degli anni â90 in risposta a una dichiarazione del 1995 di Unisys e CompuServe che i diritti dâautore sarebbero stati pagabili sul formato di compressione LZW utilizzato nei file GIF, che erano comunemente utilizzati allâepoca per loghi ed elementi a colori piatti, anche se la sua resurrezione allâinizio degli anni 2010 si ÃĻ concentrata sulla sua capacità di fornire contenuti animati a bassa larghezza di banda e veloci (ironicamente, le PNG animate non hanno mai guadagnato popolarità o ampio supporto e sono state addirittura vietate su Twitter nel 2019).
Nonostante le sue carenze, la compressione JPEG ÃĻ rapida, efficiente in termini di spazio e profondamente radicata in sistemi di tutti i tipi â e quindi non ÃĻ probabile che scompaia completamente dalla scena dellâapprendimento automatico nel prossimo futuro.
Fare il meglio della tregua AI/JPEG
In una certa misura, la comunità dellâapprendimento automatico si ÃĻ adattata alle peculiarità della compressione JPEG: nel 2011 la Società europea di radiologia (ESR) ha pubblicato uno studio sull'âutilità della compressione di immagine irreversibile nella diagnostica per immaginiâ, fornendo linee guida per âperdita accettabileâ; quando il venerabile set di dati di riconoscimento del testo MNIST (il cui dati di immagine originale era fornito in un formato binario innovativo) ÃĻ stato portato a un formato di immagine âregolareâ, JPEG, non PNG, ÃĻ stato scelto; e una collaborazione precedente (2020) degli autori del nuovo paper ha offerto âunâarchitettura innovativaâ per calibrare i sistemi di apprendimento automatico alle carenze della qualità di immagine JPEG variabile, senza la necessità che i modelli siano addestrati in ogni impostazione di qualità JPEG â una funzionalità utilizzata nel nuovo lavoro.
In effetti, la ricerca sullâutilità dei dati di immagine JPEG a variabile qualità ÃĻ un campo relativamente fiorente nellâapprendimento automatico. Un progetto del 2016 del Center for Automation Research dellâUniversità del Maryland si concentra sul dominio DCT (dove si verificano gli artifact JPEG a impostazioni di qualità bassa) come una via per lâestrazione di caratteristiche profonde; un altro progetto del 2019 si concentra sulla lettura a livello di byte dei dati JPEG senza la necessità di decomprimere effettivamente le immagini (ad esempio, aprirle in qualche punto di un flusso di lavoro automatizzato); e uno studio della Francia nel 2019 sfrutta attivamente la compressione JPEG al servizio delle routine di riconoscimento di oggetti.
Test e conclusioni
Per tornare allo studio piÃđ recente dellâUniversità del Maryland e di Facebook, i ricercatori hanno cercato di testare la comprensibilità e lâutilità di JPEG su immagini compresse tra 10-90 (al di sotto del quale lâimmagine ÃĻ impossibilmente perturbata e al di sopra del quale ÃĻ equivalente alla compressione lossless). Le immagini utilizzate nei test sono state pre-compressed ad ogni valore allâinterno dellâintervallo di qualità target, comportando almeno otto sessioni di addestramento.
I modelli sono stati addestrati su discesa del gradiente stocastico attraverso quattro metodi: baseline, dove non sono state aggiunte ulteriori mitigazioni; supervised fine-tuning, dove il set di addestramento ha il vantaggio di pesi pre-addestrati e dati etichettati (sebbene i ricercatori ammettano che ciÃē ÃĻ difficile da replicare in applicazioni a livello di consumatore); correzione degli artifact, dove lâaugmentazione/miglioramento viene eseguita sulle immagini compresse prima dellâaddestramento; e correzione degli artifact mirata, dove la rete di correzione degli artifact viene adattata agli errori restituiti.
Lâaddestramento ÃĻ avvenuto su una vasta gamma di set di dati appropriati, tra cui piÃđ varianti di ResNet, FastRCNN, MobileNetV2, MaskRCNN e Kerasâ InceptionV3.
I risultati di perdita di campione dopo la correzione degli artifact mirata sono visualizzati di seguito (piÃđ basso = meglio).

Non ÃĻ possibile addentrarsi nei dettagli dei risultati ottenuti nello studio, perchÃĐ i risultati dei ricercatori sono divisi tra lâobiettivo di valutare gli artifact JPEG e nuovi metodi per alleviare questo; lâaddestramento ÃĻ stato iterato per qualità su cosÃŽ tanti set di dati; e i compiti includevano piÃđ obiettivi come rilevamento di oggetti, segmentazione e classificazione. Essenzialmente, il nuovo rapporto si posiziona come unâopera di riferimento completa che affronta piÃđ problemi.
Tuttavia, il paper conclude in generale che âla compressione JPEG ha una penalità significativa in tutta la gamma per impostazioni di compressione pesante e moderataâ. Afferma anche che le sue strategie di mitigazione non etichettate innovative raggiungono risultati superiori rispetto ad approcci simili; che, per compiti complessi, il metodo supervisionato dei ricercatori supera anche i suoi pari, nonostante non abbia accesso a etichette di verità di base; e che queste metodologie innovative consentono il riutilizzo del modello, poichÃĐ i pesi ottenuti sono trasferibili tra compiti.
In termini di compiti di classificazione, il paper afferma esplicitamente che âJPEG degrada la qualità del gradiente e induce errori di localizzazioneâ.
Gli autori sperano di estendere future ricerche per coprire altri metodi di compressione come il largamente trascurato JPEG 2000, nonchÃĐ WebP, HEIF e BPG. Suggeriscono inoltre che la loro metodologia potrebbe essere applicata a ricerche analoghe sugli algoritmi di compressione video.
Dal momento che il metodo di correzione degli artifact mirata ha dimostrato di essere cosÃŽ efficace nello studio, gli autori segnalano anche la loro intenzione di rilasciare i pesi addestrati durante il progetto, anticipando che â[molte] applicazioni beneficeranno dellâuso dei nostri pesi TTAC senza modifiche.â
Â
n.b. Lâimmagine di origine dellâarticolo proviene da thispersondoesnotexist.com












