Andersons Blickwinkel
Lösung des JPEG-Artifact-Problems in Computer-Vision-Datensätzen

Eine neue Studie der University of Maryland und Facebook AI hat festgestellt, dass tiefere Lernsysteme, die hoch komprimierte JPEG-Bilder in ihren Datensätzen verwenden, einen “signifikanten Leistungsverlust” erleiden, und bietet einige neue Methoden an, um die Auswirkungen davon zu mildern.
Der Bericht, betitelt Analyse und Milderung von JPEG-Kompressionsfehlern in Deep Learning, behauptet, “signifikant umfassender” zu sein als vorherige Studien über die Auswirkungen von Artefakten in Computer-Vision-Datensätzen. Die Studie findet heraus, dass “[schwere] bis moderate JPEG-Kompression einen signifikanten Leistungsverlust auf Standardmetriken verursacht” und dass neuronale Netze vielleicht nicht so widerstandsfähig gegenüber solchen Störungen sind, wie vorherige Arbeiten vermuten.

Ein Foto eines Hundes aus dem 2018 MobileNetV2-Datensatz. Bei Qualität 10 (links) kann ein Klassifizierungssystem den korrekten Hundezüchter ‘Pembroke Welsh Corgi’ nicht identifizieren und vermutet stattdessen ‘Norwich Terrier’ (das System weiß bereits, dass es sich um ein Foto eines Hundes handelt, aber nicht um die Rasse); zweite von links, eine Standard-JPEG-Artefakt-korrigierte Version des Bildes kann den korrekten Züchter ebenfalls nicht identifizieren; zweite von rechts, gezielte Artefakt-Korrektur stellt die korrekte Klassifizierung wieder her; und rechts, das Originalfoto, korrekt klassifiziert. Quelle: https://arxiv.org/pdf/2011.08932.pdf
Kompressionsartefakte als ‘Daten’
Extreme JPEG-Kompression kann sichtbare oder halb-sichtbare Ränder um die 8×8-Blöcke erzeugen, aus denen ein JPEG-Bild zusammengesetzt wird. Sobald diese Block- oder ‘Ring’-Artefakte auftreten, können sie von maschinellen Lernsystemen als reale Welt-Elemente des Bildes missinterpretiert werden, es sei denn, eine Kompensation dafür wird vorgenommen.

Oben, ein Computer-Vision-Maschinen-Lern-System extrahiert ein ‘sauberes’ Gradienten-Bild aus einem hochwertigen Bild. Unten, ‘Block’-Artefakte in einem niedrigeren Qualitäts-Bild verdecken die Merkmale des Objekts und können die Merkmale, die aus einem Bild-Set abgeleitet werden, ‘infizieren’, insbesondere in Fällen, in denen hoch- und niedrigwertige Bilder im Datensatz vorkommen, wie in web-gesammelten Sammlungen, auf die nur generische Datenreinigung angewendet wurde. Quelle: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
Wie im ersten Bild oben zu sehen, können solche Artefakte Bild-Klassifizierungsaufgaben beeinflussen, mit Auswirkungen auch auf Text-Erkennungsalgorithmen, die möglicherweise nicht in der Lage sind, artefakt-behaftete Zeichen korrekt zu identifizieren.
Im Falle von Bild-Synthese-Trainings-Systemen (wie Deepfake-Software oder GAN-basierten Bild-Generierungs-Systemen) kann ein ‘schurkischer’ Block von niedrigwertigen, hoch komprimierten Bildern in einem Datensatz entweder die mittlere Qualität der Reproduktion herabsetzen oder von einer größeren Anzahl von höherwertigen Merkmalen, die aus besseren Bildern im Set extrahiert werden, überlagert werden. In beiden Fällen ist bessere Datenqualität wünschenswert – oder zumindest konsistente Daten.
JPEG – In der Regel ‘Gut genug’
JPEG-Kompression ist ein irreversibler, verlustbehafteter Codec, der auf verschiedene Bildformate angewendet werden kann, obwohl er hauptsächlich auf das JFIF-Bild-Datei-Wrapper angewendet wird. Trotzdem wurde das JPEG-Format (.jpg) nach seinem zugehörigen Komprimierungsverfahren benannt und nicht nach dem JFIF-Wrapper für die Bild-Daten.
Ganze maschinelle Lern-Architekturen sind in den letzten Jahren entstanden, die JPEG-ähnliche Artefakt-Milderung als Teil von AI-gesteuerten Upscaling-/Wiederherstellungs-Routinen beinhalten, und AI-basierte Kompressions-Artefakt-Entfernung ist nun in eine Reihe von kommerziellen Produkten integriert, wie z.B. die Topaz-Bild-/Video-Suite und die neuralen Funktionen neuerer Versionen von Adobe Photoshop.
Da das 1986 JPEG-Schema, das derzeit in allgemeinem Gebrauch ist, mehr oder weniger in den frühen 1990er Jahren festgelegt wurde, ist es nicht möglich, Metadaten zu einem Bild hinzuzufügen, die den Qualitätslevel (1-100) angeben, bei dem ein JPEG-Bild gespeichert wurde – zumindest nicht ohne die Modifizierung von über dreißig Jahren Legacy-Consumer-, professioneller und akademischer Software-Systeme, die solche Metadaten nicht erwarteten.
Folglich ist es nicht ungewöhnlich, maschinelle Lern-Trainings-Routinen auf die bewertete oder bekannte Qualität von JPEG-Bild-Daten zuzuschneiden, wie die Forscher für die neue Studie getan haben (siehe unten). In Abwesenheit einer ‘Qualität’-Metadaten-Eintrag, ist es derzeit notwendig, entweder die Details der Bild-Komprimierung zu kennen (d.h. komprimiert aus einer verlustfreien Quelle) oder die Qualität durch perzeptuelle Algorithmen oder manuelle Klassifizierung zu schätzen.
Ein wirtschaftlicher Kompromiss
JPEG ist nicht die einzige verlustbehaftete Komprimierungsmethode, die die Qualität von maschinellen Lern-Datensätzen beeinflussen kann; Komprimierungseinstellungen in PDF-Dateien können auch Informationen auf diese Weise verwerfen und auf sehr niedrige Qualitätsstufen gesetzt werden, um Speicherplatz für lokale oder Netzwerk-Archivierungszwecke zu sparen.
Dies kann durch die Untersuchung verschiedener PDFs auf archive.org beobachtet werden, von denen einige so stark komprimiert wurden, dass sie eine bemerkenswerte Herausforderung für Bild- oder Text-Erkennungssysteme darstellen. In vielen Fällen, wie z.B. urheberrechtlich geschützten Büchern, scheint diese intensive Komprimierung als eine Form von billiger DRM angewendet worden zu sein, ähnlich wie Urheberrechtsinhaber die Auflösung von Benutzer-Uploads auf YouTube, auf denen sie das geistige Eigentum besitzen, senken können, um ‘vollständige Auflösung’-Käufe zu inspirieren, anstatt sie zu löschen.
In vielen anderen Fällen ist die Auflösung oder Bildqualität niedrig, einfach weil die Daten sehr alt sind und aus einer Zeit stammen, in der lokaler und Netzwerk-Speicher teurer waren und begrenzte Netzwerk-Geschwindigkeiten hoch optimierte und portable Bilder gegenüber hochwertiger Reproduktion bevorzugten.
Es wurde argumentiert, dass JPEG, obwohl es nicht die beste Lösung jetzt ist, “verewigt” wurde als unentfernbares Legacy-Infrastruktur, das im Wesentlichen mit den Grundlagen des Internets verflochten ist.
Legacy-Last
Obwohl spätere Innovationen wie JPEG 2000, PNG und (zuletzt) das.webp-Format eine bessere Qualität bieten, würde die Neuerfassung älterer, hoch beliebter maschineller Lern-Datensätze die Kontinuität und Geschichte von Jahr-zu-Jahr-Computer-Vision-Herausforderungen in der akademischen Gemeinschaft “zurücksetzen” – ein Hindernis, das auch im Falle des Neuspeicherns von PNG-Datensatz-Bildern in höheren Qualitätsstufen gelten würde. Dies könnte als eine Art technische Schulden angesehen werden.
Während server-seitige Bild-Verarbeitungsbibliotheken wie ImageMagick bessere Formate unterstützen, einschließlich.webp, treten Bild-Transformation-Anforderungen häufig in Legacy-Systemen auf, die nicht auf etwas anderes als JPG oder PNG (das eine verlustfreie Komprimierung bietet, aber auf Kosten von Latenz und Speicherplatz) eingerichtet sind. Sogar WordPress, das Content-Management-System, das fast 40% aller Websites antreibt, hat erst vor drei Monaten.webp-Unterstützung hinzugefügt.
PNG war ein spätes (arguably zu spätes) Eintritt in den Bild-Format-Sektor, das als Open-Source-Lösung in der zweiten Hälfte der 1990er Jahre als Reaktion auf eine 1995-Erklärung von Unisys und CompuServe entstand, dass Lizenzgebühren für das LZW-Komprimierungsformat, das in GIF-Dateien verwendet wird, zu zahlen seien, die damals häufig für Logos und Flächen-Elemente verwendet wurden, obwohl die Wiederbelebung von GIFs in den frühen 2010er Jahren auf ihre Fähigkeit zur Bereitstellung von niedrigbandigen, schnellen animierten Inhalten zentriert war (ironischerweise haben animierte PNGs nie Popularität oder breite Unterstützung erlangt und wurden sogar von Twitter im Jahr 2019 verboten).
Trotz seiner Mängel ist JPEG-Kompression schnell, platzsparend und tief in Systemen aller Art verankert – und daher nicht wahrscheinlich, dass es in naher Zukunft vollständig aus dem maschinellen Lern-Szenario verschwindet.
Das Beste aus dem AI/JPEG-Waffenstillstand machen
In gewissem Maße hat sich die maschinelle Lern-Gemeinschaft an die Eigenheiten der JPEG-Kompression angepasst: Im Jahr 2011 veröffentlichte die European Society of Radiology (ESR) eine Studie über die “Verwendbarkeit von irreversibler Bild-Komprimierung in radiologischer Bildgebung”, die Richtlinien für “akzeptable” Verluste bereitstellt; als das renommierte MNIST-Text-Erkennungs-Datensatz (dessen Bild-Daten ursprünglich in einem neuartigen binären Format bereitgestellt wurden) in ein “reguläres” Bild-Format portiert wurde, wurde JPEG und nicht PNG gewählt; und eine frühere (2020) Zusammenarbeit von den Autoren der neuen Studie bot “eine neue Architektur” für die Kalibrierung von maschinellen Lern-Systemen auf die Mängel von variierender JPEG-Bild-Qualität, ohne dass Modelle bei jedem JPEG-Qualitäts-Setting trainiert werden müssen – eine Funktion, die in der neuen Arbeit verwendet wird.
Tatsächlich ist die Forschung in die Nützlichkeit von qualitätsvarianten JPEG-Daten ein relativ blühendes Feld in maschinellen Lernen. Ein (unabhängiges) 2016-Projekt des Center for Automation Research an der University of Maryland konzentriert sich auf den DCT-Bereich (wo JPEG-Artefakte bei niedriger Qualität auftreten), als Weg zur tiefen Merkmalsextraktion; ein weiteres Projekt von 2019 konzentriert sich auf Byte-lesbare JPEG-Daten ohne die zeitaufwändige Notwendigkeit, die Bilder tatsächlich zu dekomprimieren (d.h. sie irgendwann in einer automatisierten Arbeitsabfolge zu öffnen); und eine Studie aus Frankreich im Jahr 2019 nutzt aktiv JPEG-Komprimierung im Dienste von Objekterkennungsroutinen.
Testen und Schlussfolgerungen
Um zur neuesten Studie von UoM und Facebook zurückzukehren, versuchten die Forscher, die JPEG-Verständlichkeit und Nützlichkeit auf Bildern zu testen, die zwischen 10-90 komprimiert wurden (unterhalb dessen das Bild unmöglich gestört ist und oberhalb dessen es der verlustfreien Komprimierung entspricht). Die in den Tests verwendeten Bilder wurden bei jedem Wert innerhalb des Ziel-Qualitäts-Bereichs vor-komprimiert, was mindestens acht Trainings-Sitzungen erforderte.
Modelle wurden auf stochastischem Gradienten-Abstieg über vier Methoden trainiert: Baseline, wo keine zusätzlichen Milderungen hinzugefügt wurden; überwachtes Fein-Tuning, wo das Trainings-Set den Vorteil von vorab trainierten Gewichten und markierten Daten hat (obwohl die Forscher zugeben, dass dies in Consumer-Anwendungen schwer zu replizieren ist); Artefakt-Korrektur, wo Augmentation/Verbesserung auf den komprimierten Bildern vor dem Training durchgeführt wird; und aufgaben-orientierte Artefakt-Korrektur, wo das Artefakt-Korrekt-Netz auf zurückgegebene Fehler feinjustiert wird.
Das Training erfolgte auf einer Vielzahl von geeigneten Datensätzen, einschließlich mehrerer Varianten von ResNet, FastRCNN, MobileNetV2, MaskRCNN und Keras’ InceptionV3.
Beispiel-Verlust-Ergebnisse nach aufgaben-orientierter Artefakt-Korrektur werden unten visualisiert (niedriger = besser).

Es ist nicht möglich, tief in die Details der in der Studie erzielten Ergebnisse einzutauchen, da die Forschungsergebnisse zwischen dem Ziel, JPEG-Artefakte zu bewerten und neue Methoden zu entwickeln, um diese zu mildern, aufgeteilt sind; das Training wurde pro Qualitätsstufe über so viele Datensätze iteriert; und die Aufgaben umfassten mehrere Ziele wie Objekterkennung, Segmentierung und Klassifizierung. Im Wesentlichen positioniert sich die neue Studie als umfassendes Referenzwerk, das mehrere Probleme anspricht.
Trotzdem kommt die Studie zu dem Schluss, dass “JPEG-Komprimierung überall einen steilen Verlust bei schwerer bis moderater Komprimierung verursacht”. Sie behauptet auch, dass ihre neuen unlizenzierten Milderungs-Strategien bessere Ergebnisse als andere ähnliche Ansätze erzielen; dass für komplexe Aufgaben die Forschungsmethode auch die Leistung ihrer Peers übertrifft, obwohl sie keinen Zugang zu Ground-Truth-Marken hat; und dass diese neuen Methoden Modell-Wiederverwendung ermöglichen, da die erzielten Gewichte zwischen Aufgaben übertragbar sind.
Im Hinblick auf Klassifizierungsaufgaben stellt die Studie explizit fest, dass “JPEG die Gradienten-Qualität verschlechtert und auch Lokalisierungsfehler verursacht”.
Die Autoren hoffen, zukünftige Studien auf andere Komprimierungsmethoden wie JPEG 2000, WebP, HEIF und BPG auszudehnen. Sie schlagen auch vor, dass ihre Methodik auf analoge Forschung in Video-Komprimierungsalgorithmen angewendet werden könnte.
Da die aufgaben-orientierte Artefakt-Korrektur-Methode in der Studie so erfolgreich war, signalisieren die Autoren ihre Absicht, die während des Projekts trainierten Gewichte zu veröffentlichen, in der Erwartung, dass “[viele] Anwendungen von der Verwendung unserer TTAC-Gewichte ohne Modifizierung profitieren werden”.
n.b. Quellbild für den Artikel stammt von thispersondoesnotexist.com












