KÄ t Andersona
RozwiÄ zanie problemu artefaktÃģw JPEG w zbiorach danych komputerowego widzenia

Nowe badanie przeprowadzone przez Uniwersytet w Maryland i Facebook AI wykazaÅo âznaczÄ cÄ karÄ wydajnoÅciâ dla systemÃģw gÅÄbokiego uczenia, ktÃģre wykorzystujÄ silnie skompresowane obrazy JPEG w swoich zbiorach danych, oraz przedstawiÅo nowe metody Åagodzenia skutkÃģw tego.
Raport, zatytuÅowany Analiza i Åagodzenie wad kompresji JPEG w gÅÄbokim uczeniu, twierdzi, Åže jest âznacznie bardziej kompleksowyâ niÅž poprzednie badania nad wpÅywem artefaktÃģw w zbiorach danych komputerowego widzenia. ArtykuÅ stwierdza, Åže â[ciÄÅžka] do umiarkowanej kompresja JPEG powoduje znaczÄ cÄ karÄ wydajnoÅci na standardowych miarachâ, oraz Åže sieci neuronowe mogÄ nie byÄ tak odporne na takie perturbacje, jak sugerujÄ poprzednie prace badania.

ZdjÄcie psa z zestawu danych MobileNetV2 z 2018 roku. Przy jakoÅci 10 (po lewej), system klasyfikacji nie jest w stanie rozpoznaÄ prawidÅowej rasy âPembroke Welsh Corgiâ, zamiast tego zgadujÄ c âNorwich terrierâ (system juÅž wie, Åže jest to zdjÄcie psa, ale nie rasy); po lewej, wersja zdjÄcia poprawiona za pomocÄ korekcji artefaktÃģw JPEG rÃģwnieÅž nie jest w stanie rozpoznaÄ prawidÅowej rasy; po prawej, korekcja artefaktÃģw celowych przywraca prawidÅowÄ klasyfikacjÄ; i po prawej, oryginalne zdjÄcie, prawidÅowo sklasyfikowane. ÅđrÃģdÅo: https://arxiv.org/pdf/2011.08932.pdf
Artefakty kompresji jako âdaneâ
Ekstremalna kompresja JPEG moÅže powodowaÄ widoczne lub pÃģÅwidoczne granice wokÃģÅ blokÃģw 8Ã8, z ktÃģrych skÅada siÄ siatka pikseli JPEG. Gdy te artefakty pojawiajÄ siÄ, mogÄ byÄ bÅÄdnie interpretowane przez systemy uczenia maszynowego jako elementy Åwiata rzeczywistego, chyba Åže zostanÄ podjÄte pewne Årodki zaradcze.

Powierzchnia, z ktÃģrej system komputerowego widzenia wyodrÄbnia âczystyâ obraz gradientu z dobrej jakoÅci zdjÄcia. PoniÅžej, artefakty âblokowaniaâ w niÅžszej jakoÅci zdjÄciu zakrywajÄ cechy obiektu i mogÄ skutkowaÄ âzakaÅženiemâ cech wyprowadzonych z zestawu obrazÃģw, szczegÃģlnie w przypadku, gdy w zestawie danych wystÄpujÄ obrazy o wysokiej i niskiej jakoÅci, takich jak kolekcje zebrane z sieci, ktÃģrym zastosowano tylko ogÃģlne czyszczenie danych. ÅđrÃģdÅo: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
Jak widaÄ na pierwszym zdjÄciu powyÅžej, takie artefakty mogÄ wpÅywaÄ na zadania klasyfikacji obrazÃģw, z implikacjami rÃģwnieÅž dla algorytmÃģw rozpoznawania tekstu, ktÃģre mogÄ nie byÄ w stanie poprawnie rozpoznaÄ znaki dotkniÄte artefaktami.
W przypadku systemÃģw szkoleniowych do syntezy obrazÃģw (takich jak oprogramowanie do tworzenia deepfake lub systemy generowania obrazÃģw opartych na GAN), ârogatyâ blok niskiej jakoÅci, silnie skompresowanych obrazÃģw w zestawie danych moÅže albo obniÅžyÄ medianÄ jakoÅci reprodukcji, albo zostaÄ podsumowany i w zasadzie zastÄ piony przez wiÄkszÄ liczbÄ cech o wyÅžszej jakoÅci wyprowadzonych z lepszych obrazÃģw w zestawie. W kaÅždym przypadku lepsze dane sÄ poÅžÄ dane â lub przynajmniej spÃģjne dane.
JPEG â Zwykle âwystarczajÄ co dobryâ
Kompresja JPEG jest nieodwracalnym kodekiem stratnym, ktÃģry moÅže byÄ stosowany do rÃģÅžnych formatÃģw obrazÃģw, choÄ jest gÅÃģwnie stosowany do formatu pliku JFIF wrapper. Pomimo tego, format JPEG (.jpg) zostaÅ nazwany od swojej metody kompresji, a nie wrappera JFIF dla danych obrazu.
CaÅe architektury systemÃģw uczenia maszynowego powstaÅy w ostatnich latach, ktÃģre obejmujÄ Åagodzenie artefaktÃģw JPEG jako czÄÅÄ rutyn AI-danych / przywracania, a usuwanie artefaktÃģw kompresji oparte na AI jest teraz wbudowane w wiele produktÃģw komercyjnych, takich jak pakiet obrazu / wideo Topaz, oraz funkcje neuronowe najnowszych wersji Adobe Photoshop.
Od czasu 1986 schematu JPEG obecnie w powszechnym uÅžyciu, ktÃģry zostaÅ praktycznie zablokowany na poczÄ tku lat 90., nie jest moÅžliwe dodanie metadanych do obrazu, ktÃģre wskazywaÅyby, jaki poziom jakoÅci (1-100) zostaÅ uÅžyty do zapisu obrazu JPEG â przynajmniej nie bez modyfikacji ponad trzydziestu lat starszych systemÃģw oprogramowania konsumenckiego, profesjonalnego i akademickiego, ktÃģre nie oczekiwaÅy takich metadanych.
W zwiÄ zku z tym nie jest rzadkoÅciÄ , gdy procedury szkoleniowe sÄ dostosowane do ocenianej lub znanej jakoÅci danych obrazu JPEG, jak to zrobili badacze w nowym artykule (patrz poniÅžej). W przypadku braku wpisu metadanych âjakoÅÄâ konieczne jest albo znalezienie szczegÃģÅÃģw, w jaki sposÃģb obraz zostaÅ skompresowany (tj. skompresowany z ÅšrÃģdÅa bezstratnego), albo oszacowanie jakoÅci za pomocÄ algorytmÃģw percepcyjnych lub klasyfikacji rÄcznej.
Kompromis ekonomiczny
JPEG nie jest jedynÄ metodÄ kompresji stratnej, ktÃģra moÅže wpÅywaÄ na jakoÅÄ zbiorÃģw danych systemÃģw uczenia maszynowego; ustawienia kompresji w plikach PDF mogÄ rÃģwnieÅž powodowaÄ utratÄ informacji w ten sposÃģb i mogÄ byÄ ustawione na bardzo niski poziom jakoÅci w celu zaoszczÄdzenia miejsca na dysku do archiwizacji lokalnej lub sieciowej.
MoÅžna to zaobserwowaÄ, prÃģbujÄ c wybraÄ rÃģÅžne pliki PDF z archive.org, z ktÃģrych niektÃģre zostaÅy skompresowane tak bardzo, Åže stanowiÄ znaczÄ ce wyzwanie dla systemÃģw rozpoznawania obrazÃģw lub tekstu. W wielu przypadkach, takich jak ksiÄ Åžki objÄte prawem autorskim, taka intensywna kompresja wydaje siÄ byÄ zastosowana jako forma taniego DRM, podobnie jak posiadacze praw autorskich mogÄ zdecydowaÄ siÄ obniÅžyÄ rozdzielczoÅÄ filmÃģw wideo przesÅanych przez uÅžytkownikÃģw, na ktÃģre posiadajÄ prawa autorskie, pozostawiajÄ c âblokoweâ filmy jako tokeny promocyjne, aby zachÄciÄ do zakupu âpeÅnej rozdzielczoÅciâ, zamiast ich usunÄ Ä.
W wielu innych przypadkach rozdzielczoÅÄ lub jakoÅÄ obrazu jest niska po prostu dlatego, Åže dane sÄ bardzo stare i pochodzÄ z ery, kiedy lokalne i sieciowe przechowywanie byÅo droÅžsze, a ograniczone prÄdkoÅci sieci faworyzowaÅy obrazowanie o wysokiej wydajnoÅci i przenoÅnoÅci zamiast wysokiej jakoÅci reprodukcji.
UwaÅža siÄ, Åže JPEG, chociaÅž nie jest najlepszym rozwiÄ zaniem teraz, zostaÅ âuwiecznionyâ jako nieusuwalna infrastruktura dziedzictwa, ktÃģra jest praktycznie spleciona z fundamentami internetu.
Dziedzictwo
ChociaÅž pÃģÅšniejsze innowacje, takie jak JPEG 2000, PNG i (najnowszy) format.webp, oferujÄ lepszÄ jakoÅÄ, ponowne prÃģbkowanie starszych, bardzo popularnych zbiorÃģw danych systemÃģw uczenia maszynowego mogÅoby âzresetowaÄâ ciÄ gÅoÅÄ i historiÄ rocznych wyzwaÅ komputerowego widzenia w Årodowisku akademickim â przeszkodÄ, ktÃģra dotyczyÅaby rÃģwnieÅž przypadku zapisania obrazÃģw w zbiorze danych PNG w ustawieniach wyÅžszej jakoÅci. MoÅžna by to uznaÄ za rodzaj dÅugu technicznego.
Pomimo Åže starsze biblioteki przetwarzania obrazÃģw serwerowych, takie jak ImageMagick, obsÅugujÄ lepsze formaty, w tym.webp, wymagania dotyczÄ ce transformacji obrazÃģw czÄsto wystÄpujÄ w systemach dziedzictwa, ktÃģre nie sÄ przygotowane do obsÅugi niczego poza formatem JPG lub PNG (ktÃģry oferuje kompresjÄ bezstratnÄ , ale za cenÄ opÃģÅšnienia i miejsca na dysku). Nawet WordPress, system zarzÄ dzania treÅciÄ , ktÃģry napÄdza prawie 40% wszystkich stron internetowych, dodaÅ obsÅugÄ.webp trzy miesiÄ ce temu.
Format PNG byÅ pÃģÅšnym (moÅžna powiedzieÄ, zbyt pÃģÅšnym) wejÅciem na rynek formatÃģw obrazÃģw, powstaÅ jako otwarte rozwiÄ zanie w drugiej poÅowie lat 90. w odpowiedzi na deklaracjÄ z 1995 roku firmy Unisys i CompuServe, Åže opÅaty licencyjne bÄdÄ pobierane za format kompresji LZW uÅžywany w plikach GIF, ktÃģre byÅy powszechnie uÅžywane wÃģwczas do logo i elementÃģw pÅaskich, nawet jeÅli oÅžywienie formatu GIF w poczÄ tku lat 2010. skupiÅo siÄ na jego zdolnoÅci do zapewnienia niskopasmowych, Åžywych treÅci animowanych (ironicznie, animowane pliki PNG nigdy nie zdobyÅy popularnoÅci ani szerokiego wsparcia i zostaÅy nawet zabronione na Twitterze w 2019 roku).
Pomimo swoich niedostatkÃģw, kompresja JPEG jest szybka, wydajna i gÅÄboko osadzona w systemach wszystkich typÃģw â i dlatego nie jest prawdopodobne, Åže zniknie caÅkowicie ze sceny systemÃģw uczenia maszynowego w najbliÅžszej przyszÅoÅci.
Wydobywanie najlepszego z detente AI/JPEG
W pewnym stopniu spoÅecznoÅÄ systemÃģw uczenia maszynowego zaadaptowaÅa siÄ do wad kompresji JPEG: w 2011 roku Europejskie Towarzystwo Radiologiczne (ESR) opublikowaÅo badanie na temat âuÅžytecznoÅci nieodwracalnej kompresji obrazu w obrazowaniu radiologicznymâ, dostarczajÄ c wytyczne dotyczÄ ce âakceptowalnejâ straty; gdy sÅynny zestaw danych MNIST do rozpoznawania tekstu (ktÃģrego dane obrazowe zostaÅy pierwotnie dostarczone w nowym formacie binarnym) zostaÅ przeniesiony do âzwykÅegoâ formatu obrazu, JPEG, a nie PNG, zostaÅ wybrany; a wczeÅniejsza (2020) wspÃģÅpraca od autorÃģw nowego artykuÅu zaproponowaÅa nowÄ architekturÄ do kalibrowania systemÃģw uczenia maszynowego do wad rÃģÅžnej jakoÅci obrazÃģw JPEG, bez potrzeby szkolenia modeli w kaÅždym ustawieniu jakoÅci JPEG â funkcja wykorzystywana w nowej pracy.
W istocie badania nad uÅžytecznoÅciÄ danych JPEG o rÃģÅžnej jakoÅci sÄ doÅÄ Åžywym polem w systemach uczenia maszynowego. Jeden (niezwiÄ zany) projekt z 2016 roku z Centrum BadaÅ Automatyki na Uniwersytecie w Maryland koncentruje siÄ na obszarze DCT (gdzie artefakty JPEG pojawiajÄ siÄ przy niskich ustawieniach jakoÅci) jako drodze do gÅÄbokiej ekstrakcji cech; inny projekt z 2019 roku koncentruje siÄ na odczytywaniu bajtowym danych JPEG bez koniecznoÅci rozpakowywania obrazÃģw (tj. otwierania ich w ktÃģrymÅ momencie automatycznego przepÅywu pracy); a badanie z Francji w 2019 roku aktywnie wykorzystuje kompresjÄ JPEG w celu rozpoznawania obiektÃģw.
Testowanie i wnioski
WrÃģÄmy do najnowszego badania z UoM i Facebook. Badacze starali siÄ przetestowaÄ zrozumiaÅoÅÄ i uÅžytecznoÅÄ JPEG na obrazach skompresowanych miÄdzy 10-90 (poniÅžej ktÃģrego obraz jest niemoÅžliwie zaburzony, a powyÅžej ktÃģrego jest rÃģwny kompresji bezstratnej). Obrazy uÅžyte w testach zostaÅy wstÄpnie skompresowane na kaÅždej wartoÅci w zakresie jakoÅci docelowej, co wymagaÅo co najmniej oÅmiu sesji szkoleniowych.
Modele zostaÅy przeszkolone przy uÅžyciu stochastycznego spadku gradientu w czterech metodach: podstawowa, gdzie nie dodano Åžadnych dodatkowych ÅrodkÃģw zaradczych; doksztaÅcanie nadzorowane, gdzie zestaw szkoleniowy ma zaletÄ wstÄpnie wytrenowanych wag i oznaczonych danych (chociaÅž badacze przyznajÄ , Åže jest to trudne do odtworzenia w aplikacjach na poziomie konsumenckim); korekcja artefaktÃģw, gdzie augmentacja / poprawa jest wykonywana na skompresowanych obrazach przed szkoleniem; i korekcja artefaktÃģw ukierunkowana na zadanie, gdzie sieÄ korekcji artefaktÃģw jest dostosowywana do bÅÄdÃģw zwrÃģconych.
Szkolenie odbywaÅo siÄ na szerokiej gamie odpowiednich zestawÃģw danych, w tym wielu wariantÃģw ResNet, FastRCNN, MobileNetV2, MaskRCNN i Kerasâ InceptionV3.
PrzykÅadowe wyniki straty po korekcji artefaktÃģw ukierunkowanej na zadanie sÄ wizualizowane poniÅžej (niÅžsze = lepsze).

Nie jest moÅžliwe, aby gÅÄboko siÄgaÄ w szczegÃģÅy wynikÃģw uzyskanych w badaniu, poniewaÅž odkrycia badaczy sÄ podzielone miÄdzy celem oceny artefaktÃģw JPEG i nowych metod Åagodzenia tego; szkolenie byÅo iterowane per-jakoÅÄ na tak wiele zestawÃģw danych; i zadania obejmowaÅy wiele celÃģw, takich jak wykrywanie obiektÃģw, segmentacja i klasyfikacja. Podstawowo nowy raport pozycjonuje siÄ jako kompleksowe dzieÅo referencyjne, ktÃģre rozwiÄ zuje wiele problemÃģw.
Niemniej, artykuÅ stwierdza w ogÃģle, Åže âkompresja JPEG ma ostrÄ karÄ we wszystkich przypadkach dla ciÄÅžkiej do umiarkowanej kompresjiâ. Twierdzi rÃģwnieÅž, Åže jego nowe strategie Åagodzenia nieoznaczonego osiÄ gajÄ lepsze wyniki wÅrÃģd innych podobnych podejÅÄ; Åže, dla zÅoÅžonych zadaÅ, metoda nadzorowana badaczy rÃģwnieÅž przewyÅžsza swoich rÃģwieÅnikÃģw, pomimo braku dostÄpu do etykiet ground truth; i Åže te nowe metody umoÅžliwiajÄ ponowne wykorzystanie modeli, poniewaÅž uzyskane wagi sÄ przenoszone miÄdzy zadaniami.
Co siÄ tyczy zadaÅ klasyfikacji, artykuÅ stwierdza wyraÅšnie, Åže âJPEG pogarsza jakoÅÄ gradientu, a takÅže powoduje bÅÄdy lokalizacjiâ.
Autorzy majÄ nadziejÄ, Åže przyszÅe badania bÄdÄ siÄ koncentrowaÄ na innych metodach kompresji, takich jak w duÅžej mierze zaniedbany JPEG 2000, a takÅže WebP, HEIF i BPG. Sugestywnie proponujÄ , Åže ich metody mogÄ byÄ stosowane w analogicznych badaniach nad algorytmami kompresji wideo.
PoniewaÅž metoda korekcji artefaktÃģw ukierunkowana na zadanie okazaÅa siÄ tak skuteczna w badaniu, autorzy sygnalizujÄ rÃģwnieÅž zamiar udostÄpnienia wag wytrenowanych podczas projektu, przewidujÄ c, Åže â[wiele] aplikacji skorzysta na uÅžyciu naszych wag TTAC bez modyfikacji.â
Â
n.b. ÅđrÃģdÅowe zdjÄcie do artykuÅu pochodzi z thispersondoesnotexist.com












