Andersonův úhel

Komprese JPEG zvyšuje chybovost rozpoznávání obličeje u neevropských tváří, zjistila studie

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Main image: DALL-E 2.

Nová studie z Velké Británie dospěla k závěru, že ztrátová komprese v obrazech JPEG může mít negativní vliv na účinnost systémů rozpoznávání obličeje, což vede k vyšší pravděpodobnosti nesprávné identifikace osoby s neevropským původem.

Studie uvádí:

‘Prostřednictvím rozsáhlého experimentálního nastavení prokázujeme, že běžné ztrátové přístupy ke kompresi obrazu mají výraznější negativní dopad na výkon systémů rozpoznávání obličeje pro konkrétní rasové fenotypové kategorie, jako jsou tmavší tóny kůže (až o 34,55%).’

Výsledky také naznačují, že chroma subsampling, který snižuje barevnou informaci (nikoli však jasovou informaci) v částech obrazu obličeje, zvyšuje míru falešného rozpoznání (FMR) napříč řadou testovaných datových sad, z nichž mnohé jsou standardními repozitáři pro počítačové vidění.

Operace chroma subsampling na zdrojovém obraze, při různých rychlostech, mají zjevný vliv na rozsah, v jakém je zachována detailnost, a na rozsah, v jakém subtóny prostě 'sloučí' do sebe, obětujíce detailnost a určující rysy. Všimněte si, že tento obraz sám o sobě může být podroben kompresi, a odkázaný zdroj pro přesné rozlišení. Zdroj: https://arxiv.org/pdf/2208.07613.pdf

Operace chroma subsampling na zdrojovém obraze, při různých rychlostech, mají zjevný vliv na rozsah, v jakém je zachována detailnost, a na rozsah, v jakém subtóny prostě ‘sloučí’ do sebe, obětujíce detailnost a určující rysy. Všimněte si, že tento obraz sám o sobě může být podroben kompresi, a odkázaný zdroj pro přesné rozlišení. Zdroj: https://arxiv.org/pdf/2208.07613.pdf

Chroma subsampling se používá jako další ekonomická opatření v kompresi JPEG, protože lidé jsou méně schopni vnímat snížení složitosti a rozsahu barevných pásem než systémy počítačového vidění, které tyto ‘agregace’ berou daleko doslovněji, než my.

Vědci z nové studie zjistili, že odstranění chroma subsampling z procesu komprese snižuje tento negativní efekt až o 15,95%, i když problém zcela neodstraní.

Studie také tvrdí, že školení na nekompromitovaných (nebo méně komprimovaných) datech ne vyřeší problém, pokud jsou inference-time obrazy komprimovány. To znamená, že školení modelu rozpoznávání obličeje na méně komprimovaných obrazech nevyřeší.bias, pokud je konečný produkční model krmen komprimovanými obrázky.

Autoři uvádějí*:

‘[Použití] ztrátové komprese obrazu během inference nepříznivě ovlivňuje výkon moderních přístupů k rozpoznávání obličeje na podmnožině rasově podmíněných skupin obličeje (tj. tmavší tóny kůže, monolidní tvar očí) a že jeho účinek je přítomný bez ohledu na to, zda se komprimované obrázky používají pro školení modelu.’

Studie zdůrazňuje důsledky komprese obrazu na výzkumné odvětví počítačového vidění, které byly popsány v některé detaily v studii z roku 2021 z Univerzity v Marylandu a Facebook AI.

Jde o obtížnou otázku, kterou řešit; i kdyby byly problémy s úložištěm a šířkou pásma, které činí kompresi nezbytnou, okamžitě odstraněny, a kdyby všechny nízkokvalitní obrázky, které osídlily dvacet nebo více let datových sad v odvětví, byly najednou rekompromitovány při lepší rychlosti z vysokokvalitních zdrojů, představovalo by to ‘reset’ kontinuity akademických benchmarkingových nástrojů za posledních několik desetiletí. Komunita CV se fakticky zvykla na problém, až do té míry, že představuje významný technický dluh.

Rasový bias v rozpoznávání obličeje (FR) se stal horkou mediální tématem v posledních letech, což vedlo k soustředěnému úsilí ve výzkumné komunitě, aby se ho zbavila z postižených systémů. Nicméně, závislost globálního výzkumného tělesa na příliš omezeném počtu ‘zlatých standardních’ datových sad, z nichž mnohé jsou buď nerasově vyvážené nebo špatně označené v tomto ohledu, zvyšuje obtížnost.

Vědci nové studie také poznamenávají nesoulad mezi standardy získávání obrazu a standardy stanovenými obecným během benchmarků rozpoznávání obličeje, uvádějí*:

‘[Existující] standardy získávání obrazu pro systémy rozpoznávání obličeje, jako je ISO/IEC 19794-5 a ICAO 9303, navrhují jak obrazové (tj. osvětlení, zakrytí), tak subjektové (tj. póza, výraz, příslušenství) standardy kvality, aby zajistily kvalitu obrazu obličeje.

‘V souladu s tím by měly být obrazy obličeje také uloženy pomocí ztrátových standardů komprese obrazu, jako je JPEG nebo JPEG2000; a měly by být identifikovatelné pro pohlaví, barvu očí, barvu vlasů, výraz, vlastnosti (tj. brýle), úhly póz (yaw, pitch, roll) a polohy orientačních bodů.

‘Nicméně, běžné benchmarky rozpoznávání obličeje se neřídí standardy ISO/IEC 19794-5 a ICAO 9303. Navíc, vzorky z volného prostředí jsou často získány za různých podmínek kamery a prostředí, aby se vyzvaly navrhované řešení.

‘Přestože jsou většina vzorků obličeje v těchto datových sadách komprimována pomocí ztrátové komprese JPEG.’

Autoři nové práce uvádějí, že jejich budoucí úsilí bude zkoumat dopad ztrátové kvantizace obrazu na rozmanité rámce rozpoznávání obličeje a nabízet možné metody pro zlepšení spravedlivosti těchto systémů.

Nová studie se jmenuje Ovlivňuje ztrátová komprese obrazu rasový bias v rozpoznávání obličeje? a pochází od tří výzkumníků z Imperial College London, spolu s jedním z InsightFace deep face analysis knihovny.

Data a metoda

Pro své experimenty použili výzkumníci otevřené knihovny ImageMagick a libjpeg, aby vytvořili verze zdrojových datových obrazů při různých úrovních komprese.

Pro počáteční přehled účinků komprese studovali autoři účinky poměru signálu k šumu (PSNR) na čtyři různé úrovně komprese JPEG na datové sadě Racial Faces in-the-Wild (RFW).

Hodnoty PSNR pro datovou sadu Racial Faces-in-the-Wild, demonstrující rozsah, v jakém může komprese ovlivnit rozpoznávací schopnosti pro komprimované obrazy.

Hodnoty PSNR pro datovou sadu Racial Faces-in-the-Wild, demonstrující rozsah, v jakém může komprese ovlivnit rozpoznávací schopnosti pro komprimované obrazy.

Mezi jinými testy provedli výzkum na rasově nevyvážené datové sadě a další, která byla rasově vyvážená. Pro rasově vyváženou sadu použili funkci Additive Angular Margin Loss (ArcFace) s ResNet101v2, na původní VGGFace2 benchmark datové sadě, která obsahuje 3,3 milionu obrazů s 8631 rasově nevyváženými subjekty.

Pro testování použili datovou sadu RFW. Systém byl školen čtyřikrát, při čtyřech různých úrovních komprese, což vedlo k čtyřem modelům ArcFace.

Pro rasově vyváženou sadu byly použity stejné rámce na původní vyvážené BUPT-Balanced benchmark datové sadě, která obsahuje 28 000 tváří vyvážených napříč čtyřmi skupinami Afričan, Asijský, Indický a Kavkazský, každá rasa reprezentovaná 7000 obrázky. Stejně jako u rasově nevyvážené datové sady byly získány čtyři modely ArcFace.

Kromě toho výzkumníci reprodukovali účinky komprimovaných a nekompromitovaných školení odstraněním chroma subsampling, aby změřili jeho účinek na výkon.

Výsledky

Míra falešného rozpoznání (FMR) napříč těmito generovanými datovými sadami byla poté studována. Kritéria, která výzkumníci hledali, byla předem definovaná fenotypy související s rasovými charakteristikami Typ kůže (1, 2, 3, 4, 5 nebo 6), Typ víček (Monolid/Other), Tvar nosu (Široký/Úzký), Tvar rtů (Plný/Malý), Typ vlasů (Rovný/Vlnitý/Kudrnatý/Holý) a Barva vlasů – metriky odvozené z studie z roku 2019 Měření skrytého biasu v rozpoznávání obličeje pomocí rasových fenotypů.

Studie uvádí:

‘Zjistili jsme, že pro všechny vybrané úrovně komprese q = {5, 10, 15, 95}, se FMR zvyšuje, když se aplikuje další ztrátová komprese, což demonstruje, že úroveň komprese 5 (nejvyšší rychlost komprese) vede k největšímu poklesu ve výkonu FMR, zatímco úroveň komprese 95 (nejnižší rychlost komprese) nevede k žádným zjevným rozdílům ve výkonu FMR.’

Vzorek z rozsáhlých výsledkových grafů, které jsou příliš velké a četné, aby je zde reprodukovali – prosím, podívejte se na zdroj pro lepší rozlišení a kompletní výsledky. Zde vidíme rozsah výkonu FMR napříč postupně degradovanými/komprimovanými obrazy obličeje pro VGGFace2, v rozsahu, který zahrnuje nekompromitované nebo málo komprimované kvality.

Vzorek z rozsáhlých výsledkových grafů, které jsou příliš velké a četné, aby je zde reprodukovali – prosím, podívejte se na zdroj pro lepší rozlišení a kompletní výsledky. Zde vidíme rozsah výkonu FMR napříč postupně degradovanými/komprimovanými obrazy obličeje pro VGGFace2, v rozsahu, který zahrnuje nekompromitované nebo málo komprimované kvality.

Studie заключuje:

‘Celkově naše hodnocení ukazuje, že použití ztrátově komprimovaných vzorků obrazu obličeje v době inference snižuje výkon více významně pro konkrétní fenotypy, včetně tmavších tónů kůže, širokého nosu, kudrnatých vlasů a monolidních očí napříč všemi ostatními fenotypovými rysy.

‘Nicméně, použití komprimovaných obrazů během školení činí výsledné modely více odolnými a omezuje degradaci výkonu: nižší výkon mezi konkrétními rasově orientovanými subskupinami zůstává. Kromě toho, odstranění chroma subsampling zlepšuje FMR pro konkrétní fenotypové kategorie, které jsou více ovlivněny ztrátovou kompresí.’

 

* Mé převody inline citací autorů na hypertextové odkazy.

Poprvé publikováno 22. srpna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai