Kąt Andersona

Rozwiązanie problemu artefaktÃģw JPEG w zbiorach danych komputerowego widzenia

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Nowe badanie przeprowadzone przez Uniwersytet w Maryland i Facebook AI wykazało “znaczącą karę wydajności” dla systemÃģw głębokiego uczenia, ktÃģre wykorzystują silnie skompresowane obrazy JPEG w swoich zbiorach danych, oraz przedstawiło nowe metody łagodzenia skutkÃģw tego.

Raport, zatytułowany Analiza i łagodzenie wad kompresji JPEG w głębokim uczeniu, twierdzi, Åže jest “znacznie bardziej kompleksowy” niÅž poprzednie badania nad wpływem artefaktÃģw w zbiorach danych komputerowego widzenia. Artykuł stwierdza, Åže “[cięŞka] do umiarkowanej kompresja JPEG powoduje znaczącą karę wydajności na standardowych miarach”, oraz Åže sieci neuronowe mogą nie być tak odporne na takie perturbacje, jak sugerują poprzednie prace badania.

Zdjęcie psa z zestawu danych MobileNetV2 z 2018 roku. Przy jakości 10 (po lewej), system klasyfikacji nie jest w stanie rozpoznać prawidłowej rasy 'Pembroke Welsh Corgi', zamiast tego zgadując 'Norwich terrier' (system juÅž wie, Åže jest to zdjęcie psa, ale nie rasy); po lewej, wersja zdjęcia poprawiona za pomocą korekcji artefaktÃģw JPEG rÃģwnieÅž nie jest w stanie rozpoznać prawidłowej rasy; po prawej, korekcja artefaktÃģw celowych przywraca prawidłową klasyfikację; i po prawej, oryginalne zdjęcie, prawidłowo sklasyfikowane. ÅđrÃģdło: https://arxiv.org/pdf/2011.08932.pdf

Zdjęcie psa z zestawu danych MobileNetV2 z 2018 roku. Przy jakości 10 (po lewej), system klasyfikacji nie jest w stanie rozpoznać prawidłowej rasy ‘Pembroke Welsh Corgi’, zamiast tego zgadując ‘Norwich terrier’ (system juÅž wie, Åže jest to zdjęcie psa, ale nie rasy); po lewej, wersja zdjęcia poprawiona za pomocą korekcji artefaktÃģw JPEG rÃģwnieÅž nie jest w stanie rozpoznać prawidłowej rasy; po prawej, korekcja artefaktÃģw celowych przywraca prawidłową klasyfikację; i po prawej, oryginalne zdjęcie, prawidłowo sklasyfikowane. ÅđrÃģdło: https://arxiv.org/pdf/2011.08932.pdf

Artefakty kompresji jako “dane”

Ekstremalna kompresja JPEG moÅže powodować widoczne lub pÃģłwidoczne granice wokÃģł blokÃģw 8×8, z ktÃģrych składa się siatka pikseli JPEG. Gdy te artefakty pojawiają się, mogą być błędnie interpretowane przez systemy uczenia maszynowego jako elementy świata rzeczywistego, chyba Åže zostaną podjęte pewne środki zaradcze.

Powierzchnia, z ktÃģrej system komputerowego widzenia wyodrębnia

Powierzchnia, z ktÃģrej system komputerowego widzenia wyodrębnia “czysty” obraz gradientu z dobrej jakości zdjęcia. PoniÅžej, artefakty “blokowania” w niÅžszej jakości zdjęciu zakrywają cechy obiektu i mogą skutkować “zakaÅženiem” cech wyprowadzonych z zestawu obrazÃģw, szczegÃģlnie w przypadku, gdy w zestawie danych występują obrazy o wysokiej i niskiej jakości, takich jak kolekcje zebrane z sieci, ktÃģrym zastosowano tylko ogÃģlne czyszczenie danych. ÅđrÃģdło: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

Jak widać na pierwszym zdjęciu powyÅžej, takie artefakty mogą wpływać na zadania klasyfikacji obrazÃģw, z implikacjami rÃģwnieÅž dla algorytmÃģw rozpoznawania tekstu, ktÃģre mogą nie być w stanie poprawnie rozpoznać znaki dotknięte artefaktami.

W przypadku systemÃģw szkoleniowych do syntezy obrazÃģw (takich jak oprogramowanie do tworzenia deepfake lub systemy generowania obrazÃģw opartych na GAN), “rogaty” blok niskiej jakości, silnie skompresowanych obrazÃģw w zestawie danych moÅže albo obniÅžyć medianę jakości reprodukcji, albo zostać podsumowany i w zasadzie zastąpiony przez większą liczbę cech o wyÅžszej jakości wyprowadzonych z lepszych obrazÃģw w zestawie. W kaÅždym przypadku lepsze dane są poŞądane – lub przynajmniej spÃģjne dane.

JPEG – Zwykle “wystarczająco dobry”

Kompresja JPEG jest nieodwracalnym kodekiem stratnym, ktÃģry moÅže być stosowany do rÃģÅžnych formatÃģw obrazÃģw, choć jest głÃģwnie stosowany do formatu pliku JFIF wrapper. Pomimo tego, format JPEG (.jpg) został nazwany od swojej metody kompresji, a nie wrappera JFIF dla danych obrazu.

Całe architektury systemÃģw uczenia maszynowego powstały w ostatnich latach, ktÃģre obejmują łagodzenie artefaktÃģw JPEG jako część rutyn AI-danych / przywracania, a usuwanie artefaktÃģw kompresji oparte na AI jest teraz wbudowane w wiele produktÃģw komercyjnych, takich jak pakiet obrazu / wideo Topaz, oraz funkcje neuronowe najnowszych wersji Adobe Photoshop.

Od czasu 1986 schematu JPEG obecnie w powszechnym uÅžyciu, ktÃģry został praktycznie zablokowany na początku lat 90., nie jest moÅžliwe dodanie metadanych do obrazu, ktÃģre wskazywałyby, jaki poziom jakości (1-100) został uÅžyty do zapisu obrazu JPEG – przynajmniej nie bez modyfikacji ponad trzydziestu lat starszych systemÃģw oprogramowania konsumenckiego, profesjonalnego i akademickiego, ktÃģre nie oczekiwały takich metadanych.

W związku z tym nie jest rzadkością, gdy procedury szkoleniowe są dostosowane do ocenianej lub znanej jakości danych obrazu JPEG, jak to zrobili badacze w nowym artykule (patrz poniÅžej). W przypadku braku wpisu metadanych “jakość” konieczne jest albo znalezienie szczegÃģłÃģw, w jaki sposÃģb obraz został skompresowany (tj. skompresowany z ÅšrÃģdła bezstratnego), albo oszacowanie jakości za pomocą algorytmÃģw percepcyjnych lub klasyfikacji ręcznej.

Kompromis ekonomiczny

JPEG nie jest jedyną metodą kompresji stratnej, ktÃģra moÅže wpływać na jakość zbiorÃģw danych systemÃģw uczenia maszynowego; ustawienia kompresji w plikach PDF mogą rÃģwnieÅž powodować utratę informacji w ten sposÃģb i mogą być ustawione na bardzo niski poziom jakości w celu zaoszczędzenia miejsca na dysku do archiwizacji lokalnej lub sieciowej.

MoÅžna to zaobserwować, prÃģbując wybrać rÃģÅžne pliki PDF z archive.org, z ktÃģrych niektÃģre zostały skompresowane tak bardzo, Åže stanowią znaczące wyzwanie dla systemÃģw rozpoznawania obrazÃģw lub tekstu. W wielu przypadkach, takich jak ksiÄ…Åžki objęte prawem autorskim, taka intensywna kompresja wydaje się być zastosowana jako forma taniego DRM, podobnie jak posiadacze praw autorskich mogą zdecydować się obniÅžyć rozdzielczość filmÃģw wideo przesłanych przez uÅžytkownikÃģw, na ktÃģre posiadają prawa autorskie, pozostawiając “blokowe” filmy jako tokeny promocyjne, aby zachęcić do zakupu “pełnej rozdzielczości”, zamiast ich usunąć.

W wielu innych przypadkach rozdzielczość lub jakość obrazu jest niska po prostu dlatego, Åže dane są bardzo stare i pochodzą z ery, kiedy lokalne i sieciowe przechowywanie było droÅžsze, a ograniczone prędkości sieci faworyzowały obrazowanie o wysokiej wydajności i przenośności zamiast wysokiej jakości reprodukcji.

UwaÅža się, Åže JPEG, chociaÅž nie jest najlepszym rozwiązaniem teraz, został “uwieczniony” jako nieusuwalna infrastruktura dziedzictwa, ktÃģra jest praktycznie spleciona z fundamentami internetu.

Dziedzictwo

ChociaÅž pÃģÅšniejsze innowacje, takie jak JPEG 2000, PNG i (najnowszy) format.webp, oferują lepszą jakość, ponowne prÃģbkowanie starszych, bardzo popularnych zbiorÃģw danych systemÃģw uczenia maszynowego mogłoby “zresetować” ciągłość i historię rocznych wyzwań komputerowego widzenia w środowisku akademickim – przeszkodę, ktÃģra dotyczyłaby rÃģwnieÅž przypadku zapisania obrazÃģw w zbiorze danych PNG w ustawieniach wyÅžszej jakości. MoÅžna by to uznać za rodzaj długu technicznego.

Pomimo Åže starsze biblioteki przetwarzania obrazÃģw serwerowych, takie jak ImageMagick, obsługują lepsze formaty, w tym.webp, wymagania dotyczące transformacji obrazÃģw często występują w systemach dziedzictwa, ktÃģre nie są przygotowane do obsługi niczego poza formatem JPG lub PNG (ktÃģry oferuje kompresję bezstratną, ale za cenę opÃģÅšnienia i miejsca na dysku). Nawet WordPress, system zarządzania treścią, ktÃģry napędza prawie 40% wszystkich stron internetowych, dodał obsługę.webp trzy miesiące temu.

Format PNG był pÃģÅšnym (moÅžna powiedzieć, zbyt pÃģÅšnym) wejściem na rynek formatÃģw obrazÃģw, powstał jako otwarte rozwiązanie w drugiej połowie lat 90. w odpowiedzi na deklarację z 1995 roku firmy Unisys i CompuServe, Åže opłaty licencyjne będą pobierane za format kompresji LZW uÅžywany w plikach GIF, ktÃģre były powszechnie uÅžywane wÃģwczas do logo i elementÃģw płaskich, nawet jeśli oÅžywienie formatu GIF w początku lat 2010. skupiło się na jego zdolności do zapewnienia niskopasmowych, Åžywych treści animowanych (ironicznie, animowane pliki PNG nigdy nie zdobyły popularności ani szerokiego wsparcia i zostały nawet zabronione na Twitterze w 2019 roku).

Pomimo swoich niedostatkÃģw, kompresja JPEG jest szybka, wydajna i głęboko osadzona w systemach wszystkich typÃģw – i dlatego nie jest prawdopodobne, Åže zniknie całkowicie ze sceny systemÃģw uczenia maszynowego w najbliÅžszej przyszłości.

Wydobywanie najlepszego z detente AI/JPEG

W pewnym stopniu społeczność systemÃģw uczenia maszynowego zaadaptowała się do wad kompresji JPEG: w 2011 roku Europejskie Towarzystwo Radiologiczne (ESR) opublikowało badanie na temat “uÅžyteczności nieodwracalnej kompresji obrazu w obrazowaniu radiologicznym”, dostarczając wytyczne dotyczące “akceptowalnej” straty; gdy słynny zestaw danych MNIST do rozpoznawania tekstu (ktÃģrego dane obrazowe zostały pierwotnie dostarczone w nowym formacie binarnym) został przeniesiony do “zwykłego” formatu obrazu, JPEG, a nie PNG, został wybrany; a wcześniejsza (2020) wspÃģłpraca od autorÃģw nowego artykułu zaproponowała nową architekturę do kalibrowania systemÃģw uczenia maszynowego do wad rÃģÅžnej jakości obrazÃģw JPEG, bez potrzeby szkolenia modeli w kaÅždym ustawieniu jakości JPEG – funkcja wykorzystywana w nowej pracy.

W istocie badania nad uÅžytecznością danych JPEG o rÃģÅžnej jakości są dość Åžywym polem w systemach uczenia maszynowego. Jeden (niezwiązany) projekt z 2016 roku z Centrum Badań Automatyki na Uniwersytecie w Maryland koncentruje się na obszarze DCT (gdzie artefakty JPEG pojawiają się przy niskich ustawieniach jakości) jako drodze do głębokiej ekstrakcji cech; inny projekt z 2019 roku koncentruje się na odczytywaniu bajtowym danych JPEG bez konieczności rozpakowywania obrazÃģw (tj. otwierania ich w ktÃģrymś momencie automatycznego przepływu pracy); a badanie z Francji w 2019 roku aktywnie wykorzystuje kompresję JPEG w celu rozpoznawania obiektÃģw.

Testowanie i wnioski

WrÃģćmy do najnowszego badania z UoM i Facebook. Badacze starali się przetestować zrozumiałość i uÅžyteczność JPEG na obrazach skompresowanych między 10-90 (poniÅžej ktÃģrego obraz jest niemoÅžliwie zaburzony, a powyÅžej ktÃģrego jest rÃģwny kompresji bezstratnej). Obrazy uÅžyte w testach zostały wstępnie skompresowane na kaÅždej wartości w zakresie jakości docelowej, co wymagało co najmniej ośmiu sesji szkoleniowych.

Modele zostały przeszkolone przy uÅžyciu stochastycznego spadku gradientu w czterech metodach: podstawowa, gdzie nie dodano Åžadnych dodatkowych środkÃģw zaradczych; dokształcanie nadzorowane, gdzie zestaw szkoleniowy ma zaletę wstępnie wytrenowanych wag i oznaczonych danych (chociaÅž badacze przyznają, Åže jest to trudne do odtworzenia w aplikacjach na poziomie konsumenckim); korekcja artefaktÃģw, gdzie augmentacja / poprawa jest wykonywana na skompresowanych obrazach przed szkoleniem; i korekcja artefaktÃģw ukierunkowana na zadanie, gdzie sieć korekcji artefaktÃģw jest dostosowywana do błędÃģw zwrÃģconych.

Szkolenie odbywało się na szerokiej gamie odpowiednich zestawÃģw danych, w tym wielu wariantÃģw ResNet, FastRCNN, MobileNetV2, MaskRCNN i Keras’ InceptionV3.

Przykładowe wyniki straty po korekcji artefaktÃģw ukierunkowanej na zadanie są wizualizowane poniÅžej (niÅžsze = lepsze).

Nie jest moÅžliwe, aby głęboko sięgać w szczegÃģły wynikÃģw uzyskanych w badaniu, poniewaÅž odkrycia badaczy są podzielone między celem oceny artefaktÃģw JPEG i nowych metod łagodzenia tego; szkolenie było iterowane per-jakość na tak wiele zestawÃģw danych; i zadania obejmowały wiele celÃģw, takich jak wykrywanie obiektÃģw, segmentacja i klasyfikacja. Podstawowo nowy raport pozycjonuje się jako kompleksowe dzieło referencyjne, ktÃģre rozwiązuje wiele problemÃģw.

Niemniej, artykuł stwierdza w ogÃģle, Åže “kompresja JPEG ma ostrą karę we wszystkich przypadkach dla cięŞkiej do umiarkowanej kompresji”. Twierdzi rÃģwnieÅž, Åže jego nowe strategie łagodzenia nieoznaczonego osiągają lepsze wyniki wśrÃģd innych podobnych podejść; Åže, dla złoÅžonych zadań, metoda nadzorowana badaczy rÃģwnieÅž przewyÅžsza swoich rÃģwieśnikÃģw, pomimo braku dostępu do etykiet ground truth; i Åže te nowe metody umoÅžliwiają ponowne wykorzystanie modeli, poniewaÅž uzyskane wagi są przenoszone między zadaniami.

Co się tyczy zadań klasyfikacji, artykuł stwierdza wyraÅšnie, Åže “JPEG pogarsza jakość gradientu, a takÅže powoduje błędy lokalizacji”.

Autorzy mają nadzieję, Åže przyszłe badania będą się koncentrować na innych metodach kompresji, takich jak w duÅžej mierze zaniedbany JPEG 2000, a takÅže WebP, HEIF i BPG. Sugestywnie proponują, Åže ich metody mogą być stosowane w analogicznych badaniach nad algorytmami kompresji wideo.

PoniewaÅž metoda korekcji artefaktÃģw ukierunkowana na zadanie okazała się tak skuteczna w badaniu, autorzy sygnalizują rÃģwnieÅž zamiar udostępnienia wag wytrenowanych podczas projektu, przewidując, Åže “[wiele] aplikacji skorzysta na uÅžyciu naszych wag TTAC bez modyfikacji.”

 

n.b. ÅđrÃģdłowe zdjęcie do artykułu pochodzi z thispersondoesnotexist.com

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]