Andersons vinkel
JPEG-komprimering ökar felet i ansiktsigenkänning för icke-kaukasiska ansikten, enligt en studie

En ny studie från Storbritannien har kommit fram till att förlustrika komprimeringstekniker i JPEG-bilder kan ha en negativ inverkan på effektiviteten hos ansiktsigenkningssystem, vilket gör det mer sannolikt att systemen felaktigt identifierar en person med icke-kaukasiskt ursprung.
Studien konstaterar:
‘Genom en omfattande experimentell uppsättning demonstrerar vi att vanliga förlustrika bildkomprimeringsmetoder har en mer uttalad negativ inverkan på ansiktsigenkningens prestanda för specifika rasrelaterade ansiktsfenotyper, såsom mörkare hudtoner (upp till 34,55%).’
Resultaten visar också att kromsubsampling, som reducerar färginformationen (i stället för ljusstyrkan) över sektioner av en ansiktsbild, ökar den falska matchningsfrekvensen (FMR) över ett antal testade datamängder, varav många är standardarkiv för datorseende.

Kromsubsamplingsoperationer på en källbild, i varierande hastigheter, har en tydlig effekt på den utsträckning i vilken detaljer bevaras och den utsträckning i vilken subtoner enbart ‘blandar sig’ med varandra, offrar detaljer och bestämmer funktioner. Observera att denna bild i sig kan vara föremål för komprimering och hänvisa till den ursprungliga studien för korrekt upplösning. Källa: https://arxiv.org/pdf/2208.07613.pdf
Kromsubsampling tillämpas som en ytterligare ekonomisk åtgärd i JPEG-komprimering eftersom människor är mindre benägna att uppfatta minskningar i komplexiteten och omfattningen av färgband än datorseendesystem, som tar dessa ‘aggregeringar’ mer bokstavligt än vi gör.
Forskarna för den nya studien har funnit att borttagning av kromsubsampling från komprimeringsprocessen minskar denna negativa effekt med upp till 15,95%, men det tar inte bort problemet helt.
Studien hävdar också att utbildning på okomprimerade (eller mindre komprimerade) data inte kommer att lösa problemet om inferensbilderna är komprimerade. I praktiken innebär detta att utbildning av en ansiktsigenkningsmodell på mindre komprimerad bild inte kommer att lösa partiskheten om den slutliga produktionsmodellen matas med bilder som har de angivna kompressionsproblemen.
Författarna rapporterar*:
‘[Användning av] förlustrik bildkomprimering under inferens påverkar negativt prestandan hos samtida ansiktsigenkningsmetoder på en undergrupp av rasrelaterade ansiktsfenotyper (dvs. mörkare hudtoner, monolid ögonform) och att dess effekt är närvarande oavsett om komprimerad bild används för modellutbildning.’
Studien understryker konsekvenserna av bildkomprimering på datorseende-forskningssektorn, som beskrevs i detalj i en 2021-studie från University of Maryland och Facebook AI.
Det är ett svårt problem att lösa; även om lagrings- och bandbreddsproblemen som gör komprimering nödvändig skulle elimineras över en natt, och även om alla lågkvalitetsbilder som befolkade tjugo eller fler år av datamängder i sektorn skulle plötsligt rekompileras i en bättre takt från högkvalitetskällor, skulle det representera en ‘återställning’ av kontinuiteten i akademiska benchmark-verktyg under de senaste decennierna. CV-samhället har, i själva verket, blivit van vid problemet, till den grad att det representerar en betydande teknisk skuld.
Rasrelaterad partiskhet i ansiktsigenkänning (FR) har blivit en hett medieämne under de senaste åren, vilket har lett till en koncerterad insats i forskarsamhället för att eliminera den från påverkade system. Men beroendet av den globala forskningskroppen på ett alltför begränsat antal ‘guldstandard’-datamängder, varav många antingen inte är rasligt balanserade eller dåligt märkta i detta avseende, förvärrar utmaningen.
Forskarna för den nya studien noterar också en diskrepans mellan bildacquireringsstandarder och standarder som fastställs av den allmänna ansiktsigenkningsbenchmark, och hävdar*:
‘[Existerande] bildacquireringsstandarder för ansiktsigenkningssystem, såsom ISO/IEC 19794-5 och ICAO 9303, föreslår både bildbaserade (dvs. belysning, occlusion) och subjektbaserade (dvs. pose, uttryck, tillbehör) kvalitetsstandarder för att säkerställa ansiktsbildkvalitet.
‘Enligt detta bör ansiktsbilder också lagras med hjälp av förlustrik bildkomprimering, såsom JPEG eller JPEG2000; och vara identifierbara för kön, ögonfärg, hårfärg, uttryck, egenskaper (dvs. glasögon), posvinklar (yaw, pitch och roll) och landmärkespositioner.
‘Men vanliga ansiktsigenkningsbenchmark inte följer ISO/IEC 19794-5 och ICAO 9303 standarder. Dessutom erhålls prover i vilt tillstånd ofta under varierande kamerabetingelser och miljöförhållanden för att utmana de föreslagna lösningarna.
‘Likväl är de flesta ansiktsbilder inom sådana datamängder komprimerade med hjälp av förlustrik JPEG-komprimering.’
Författarna till den nya studien hävdar att deras framtida ansträngningar kommer att undersöka effekten av förlustrik bildkvantifiering på olika ansiktsigenkningssystem och erbjuda möjliga metoder för att förbättra rättvisan i dessa system.
Den nya studien heter Har förlustrik bildkomprimering en inverkan på rasrelaterad partiskhet inom ansiktsigenkänning? och kommer från tre forskare vid Imperial College London, tillsammans med en från InsightFace deep face analysis bibliotek.
Data och Metod
För sina experiment använde forskarna ImageMagick och libjpeg öppen källkods bibliotek för att skapa versioner av källdata bilderna i olika komprimeringsnivåer.
För en första översikt av kompressionseffekterna studerade författarna effekterna av Peak signal-to-noise ratio (PSNR) på fyra olika nivåer av JPEG-komprimering på Racial Faces in-the-Wild (RFW) datamängden.

PSNR-poäng för Racial Faces-in-the-Wild datamängden, som visar den utsträckning i vilken komprimering kan påverka igenkänningsförmåga för komprimerade bilder.
Bland andra tester genomförde de forskning på en rasligt obalanserad datamängd och en som var rasligt balanserad. För den rasligt balanserade datamängden använde de Additive Angular Margin Loss (ArcFace) funktionen med ResNet101v2, på den ursprungliga VGGFace2 benchmark datamängden, som innehåller 3,3 miljoner bilder med 8631 rasligt obalanserade ämnen.
För testning använde de RFW datamängden. Systemet tränades fyra gånger, vid fyra olika komprimeringsnivåer, vilket resulterade i fyra ArcFace-modeller.
För den rasligt balanserade datamängden användes samma ramverk initialt på den ursprungliga justerade BUPT-Balanced benchmark datamängden, som innehåller 28 000 ansikten balanserade över de fyra grupperna Afrikan, Asiat, Indisk och Kaukasisk, var och en representerad av 7000 bilder. Liksom den rasligt obalanserade datamängden erhölls fyra ArcFace-modeller på detta sätt.
Dessutom reproducerade forskarna effekterna av komprimerad och okomprimerad utbildning genom att ta bort kromsubsampling, för att mäta dess effekt på prestanda.
Resultat
Den falska matchningsfrekvensen (FMR) över dessa genererade datamängder studerades sedan. Kriterierna som forskarna letade efter var fördefinierade fenotyper relaterade till rasrelaterade egenskaper Hudtyp (1, 2, 3, 4, 5 eller 6), Ögonlockstyp (Monolid/Andra), Näsaform (Bred/Smal), Läppform (Full/Smal), Hårtyp (Rakt/Krulligt/Rakt/Kal), och Hårfärg – mått som hämtats från 2019 års artikel Att mäta dold partiskhet inom ansiktsigenkänning via rasrelaterade fenotyper.
Studien konstaterar:
‘Vi observerar att för alla nedvalda komprimeringsnivåer q = {5, 10, 15, 95}, FMR ökar när ytterligare förlustrik komprimering tillämpas, vilket visar att komprimeringsnivå 5 (den högsta komprimeringshastigheten) resulterar i den mest signifikanta minskningen av FMR-prestanda, medan komprimeringsnivå 95 (den lägsta komprimeringshastigheten) inte resulterar i några märkbara FMR-prestandaskillnader.’

Ett urval från studiens omfattande resultattabeller, som är för stora och många för att återges här – se den ursprungliga studien för bättre upplösning och fullständiga resultat. Här ser vi FMR-prestanda över alltmer degraderade/komprimerade ansiktsbilder för VGGFace2, i ett område som inkluderar okomprimerad eller lite komprimerad kvalitet.
Studien slutsats:
‘Sammanfattningsvis finner vår utvärdering att användning av förlustrik komprimerad ansiktsbild vid inferenstid minskar prestandan mer signifikant för specifika fenotyper, inklusive mörk hudton, bred näsa, krulligt hår och monolid ögon över alla andra fenotypiska funktioner.
‘Men användning av komprimerad bild under utbildning gör att de resulterande modellerna blir mer resistenta och begränsar prestandaförsämringen som uppkommer: lägre prestanda bland specifika rasrelaterade undergrupper kvarstår. Dessutom förbättrar borttagning av kromsubsampling FMR för specifika fenotyper som påverkas mer av förlustrik komprimering.’
* Min omvandling av författarnas inline-citater till hyperlänkar.
Publicerad första gången den 22 augusti 2022.












