Kąt Andersona
Kompresja JPEG zwiększa współczynnik błędów rozpoznawania twarzy u osób niebiałych, wynika z badań

Nowe badanie przeprowadzone w Wielkiej Brytanii wykazało, że techniki kompresji stratnej w obrazach JPEG mogą mieć niekorzystny wpływ na skuteczność systemów rozpoznawania twarzy, powodując, że takie systemy są bardziej skłonne do błędnego rozpoznania osoby niebiałej.
W pracy naukowej stwierdza się:
‘Przy użyciu obszernego zestawu eksperymentalnego, wykazujemy, że powszechne podejścia do kompresji obrazu mają bardziej wyraźny negatywny wpływ na wydajność systemów rozpoznawania twarzy dla określonych kategorii fenotypu rasowego, takich jak ciemniejsze odcienie skóry (do 34,55%).’
Wyniki również wskazują, że chroma subsampling, który redukuje informacje kolorystyczne (zamiast jasności) w sekcjach obrazu twarzy, zwiększa współczynnik błędnych dopasowań (FMR) w zakresie testowanych zbiorów danych, w tym standardowych repozytoriów dla widzenia komputerowego.

Operacje chroma subsampling na obrazie źródłowym, przy różnych stopniach, mają wyraźny wpływ na stopień, w jakim zachowany jest detal, i stopień, w jakim odcienie podstawowe po prostu ‘łączą’ się ze sobą, poświęcając detal i określając cechy. Proszę zauważyć, że ten obraz sam w sobie może być poddany kompresji, i odnosić się do oryginalnego artykułu dla dokładnego rozdzielczości. Źródło: https://arxiv.org/pdf/2208.07613.pdf
Chroma subsampling jest stosowany jako dodatkowa miara ekonomiczna w kompresji JPEG, ponieważ ludzie są mniej zdolni do postrzegania redukcji złożoności i zakresu pasm kolorystycznych niż systemy widzenia komputerowego, które traktują te ‘agregacje’ bardziej dosłownie niż my.
Naukowcy z nowego badania odkryli, że usunięcie chroma subsampling z procesu kompresji zmniejsza ten negatywny efekt o maksymalnie 15,95%, choć nie całkowicie go usuwa.
Badanie również stwierdza, że szkolenie na niekompresowanych (lub mniej skompresowanych) danych nie nie rozwiązuje problemu, jeśli obraz jest skompresowany w czasie inferencji. Skutecznie, oznacza to, że szkolenie modelu rozpoznawania twarzy na mniej skompresowanych obrazach nie rozwiązuje problemu, jeśli ostateczny model produkcyjny jest karmiony obrazami, które mają te problemy z kompresją.
Autorzy raportują*:
‘[Użycie] stratnej kompresji obrazu w czasie inferencji niekorzystnie wpływa na wydajność współczesnych podejść do rozpoznawania twarzy na podzbiór grupowania fenotypu rasowego (tj. ciemniejsze odcienie skóry, kształt oka monolid) i że jego wpływ jest obecny niezależnie od tego, czy skompresowane obrazy są używane do szkolenia modelu.’
Praca podkreśla konsekwencje kompresji obrazu w sektorze badań widzenia komputerowego, które zostały wyjaśnione w badaniu z 2021 roku z Uniwersytetu w Maryland i Facebook AI.
Jest to trudny problem do rozwiązania; nawet jeśli problemy z przechowywaniem i przepustowością, które czynią kompresję konieczną, zostałyby wyeliminowane za jedną noc, i nawet jeśli wszystkie niskiej jakości obrazy, które zaludniają ponad dwadzieścia lat zbiorów danych w sektorze, zostałyby ponownie skompresowane w lepszej jakości z wysokiej jakości źródeł, stanowiłoby to ‘reset’ ciągłości narzędzi benchmarkingowych w ciągu kilku ostatnich dekad. Społeczność CV, w istocie, przyzwyczaiła się do problemu, do punktu, w którym reprezentuje on znaczny dług techniczny.
Rasowy bias w rozpoznawaniu twarzy (FR) stał się gorącym tematem medialnym w ostatnich latach, wywołując zorganizowane wysiłki w społeczności badawczej, aby wyeliminować go z dotkniętych systemów. Jednak zależność od globalnego ciała badawczego od nadmiernie ograniczonej liczby ‘złotych standardowych’ zbiorów danych, wiele z nich albo nie jest rasowo zrównoważonych lub słabo oznaczonych w tym zakresie, utrudnia wyzwanie.
Naukowcy nowej pracy zauważają również dysonans między standardami pozyskiwania obrazów a standardami ustawionymi przez ogólny zestaw benchmarków rozpoznawania twarzy, stwierdzając*:
‘[Istniejące] standardy pozyskiwania obrazów dla systemów rozpoznawania twarzy, takie jak ISO/IEC 19794-5 i ICAO 9303 proponują zarówno standardy jakości opartych na obrazie (tj. oświetlenie, okluzja) jak i standardy opartych na podmiocie (tj. poza, wyrażenie, akcesoria), aby zapewnić jakość obrazu twarzy. ‘
‘Zgodnie z tym, obrazy twarzy powinny być również przechowywane przy użyciu standardów kompresji stratnej, takich jak JPEG lub JPEG2000; i możliwe do identyfikacji dla płci, koloru oczu, koloru włosów, wyrażenia, właściwości (tj. okulary), kątów pochylenia (yaw, pitch, roll) i pozycji punktów orientacyjnych. ‘
‘Jednak powszechne benchmarki rozpoznawania twarzy nie są zgodne ze standardami ISO/IEC 19794-5 i ICAO 9303. Co więcej, w dzikich próbkach często uzyskuje się w różnych warunkach kamery i środowiskowych, aby wyzwolić proponowane rozwiązania. ‘
‘Niemniej jednak, większość próbek obrazów twarzy w takich zbiorach danych jest skompresowana za pomocą stratnej kompresji JPEG.’
Autorzy nowej pracy stwierdzają, że ich przyszłe wysiłki będą badać wpływ stratnej kwantyzacji obrazu na różne ramy rozpoznawania twarzy i oferować możliwe metody poprawy uczciwości tych systemów.
Nowa praca nosi tytuł Czy stratna kompresja obrazu wpływa na rasowy bias w rozpoznawaniu twarzy? i pochodzi od trzech naukowców z Imperial College London, wraz z jednym z biblioteki InsightFace do analizy twarzy głębokiej.
Dane i Metoda
Do swoich eksperymentów naukowcy użyli ImageMagick i libjpeg bibliotek open source, aby utworzyć wersje obrazów danych źródłowych w różnych stopniach kompresji.
Dla początkowego przeglądu efektów kompresji, autorzy badali wpływ stosunku sygnału do szumu (PSNR) na czterech różnych poziomach kompresji JPEG na zestawie danych Racial Faces in-the-Wild (RFW).

Wyniki PSNR dla zestawu danych Racial Faces-in-the-Wild, pokazujące stopień, w jakim kompresja może wpłynąć na możliwości rozpoznawania dla skompresowanych obrazów.
Wśród innych testów, przeprowadzili badania na zestawie danych rasowo niezrównoważonym i innym, który był rasowo zrównoważony. Dla rasowo zrównoważonego zestawu, użyli funkcji Additive Angular Margin Loss (ArcFace) z ResNet101v2, na oryginalnym VGGFace2 zestawie danych benchmarkowych, który zawiera 3,3 miliona obrazów z 8631 rasowo niezrównoważonymi podmiotami.
Dla testowania, naukowcy użyli zestawu danych RFW. System został przeszkolony czterokrotnie, na czterech różnych poziomach kompresji, w wyniku czego powstały cztery modele ArcFace.
Dla rasowo zrównoważonego zestawu, te same ramy były początkowo zastosowane w oryginalnym wyrównanym BUPT-Balanced zestawie danych benchmarkowych, który zawiera 28 000 twarzy zrównoważonych w czterech grupach Afrykańskiej, azjatyckiej, indyjskiej i białej, z każdej rasy reprezentowanej przez 7000 obrazów. Jak w przypadku rasowo niezrównoważonego zestawu, cztery modele ArcFace zostały uzyskane w ten sposób.
Ponadto naukowcy odtworzyli efekty skompresowanego i niekompresowanego szkolenia, usuwając chroma subsampling, aby zmierzyć jego wpływ na wydajność.
Wyniki
Współczynnik błędnych dopasowań (FMR) w tych wygenerowanych zestawach danych został następnie zbadany. Kryteria, które naukowcy szukali, to predefiniowane fenotypy dotyczące cech rasowych Typ skóry (1, 2, 3, 4, 5 lub 6), Typ powieki (monolid/inny), Kształt nosa (szeroki/wąski), Kształt warg (pełny/mały), Typ włosów (proste/faliste/kędzierzawe/łysy) i Kolor włosów – metryki wyprowadzone z pracy z 2019 roku Pomiar ukrytego biasu w rozpoznawaniu twarzy za pomocą fenotypów rasowych.
Praca stwierdza:
‘Obserwujemy, że dla wszystkich wybranych poziomów kompresji q = {5, 10, 15, 95}, FMR wzrasta, gdy dodatkowa stratna kompresja jest stosowana, demonstrując, że poziom kompresji 5 (najwyższy współczynnik kompresji) powoduje najbardziej znaczący spadek wydajności FMR, podczas gdy poziom kompresji 95 (najniższy współczynnik kompresji) nie powoduje żadnych zauważalnych różnic w wydajności FMR.’

Przykład z obszernych wykresów wyników, które są zbyt duże i liczne, aby je tutaj odtworzyć – proszę zobaczyć oryginalną pracę dla lepszej rozdzielczości i pełnych wyników. Tutaj widzimy gamę wyników FMR dla coraz bardziej zdegradowanych/ skompresowanych obrazów twarzy dla VGGFace2, w zakresie, który obejmuje niekompresowaną lub słabo skompresowaną jakość.
Praca kończy się następująco:
‘Ogólnie, nasza ocena wykazuje, że używanie skompresowanych próbek obrazów twarzy w czasie inferencji zmniejsza wydajność bardziej znacząco dla określonych fenotypów, w tym ciemniejszych odcieni skóry, szerokich nosów, kręconych włosów i monolidowych oczu we wszystkich innych cechach fenotypowych. ‘
‘Jednakże, użycie skompresowanych obrazów w czasie szkolenia sprawia, że wynikowe modele są bardziej odporne i ograniczają degradację wydajności; niższa wydajność wśród określonych podgrup rasowo zorientowanych pozostaje. Ponadto, usunięcie chroma subsampling poprawia FMR dla określonych kategorii fenotypu, które są bardziej dotknięte stratną kompresją.’
* Moja konwersja cytatów wstawianych przez autorów na łącza.
Pierwotnie opublikowane 22 sierpnia 2022.












