Andersonin kulma

JPEG-pakkaus lisää kasvojen tunnistusvirheen määrää ei-kaukasialaisten kasvojen kohdalla, tutkimus osoittaa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Main image: DALL-E 2.

Uusi tutkimus Isosta-Britanniasta on johtanut siihen, että JPEG-kuvien häviölliset pakkaustekniikat voivat vaikuttaa haitallisesti kasvojen tunnistusjärjestelmien tehokkuuteen, mikä tekee tällaisista järjestelmistä todennäköisemmin väärin tunnistavan ei-kaukasialaisen henkilön.

Tutkimusraportti toteaa:

‘Laajamittaisen kokeellisen asetelman kautta osoitamme, että yleiset häviölliset kuvapakkausmenetelmät vaikuttavat negatiivisesti kasvojen tunnistusjärjestelmien suorituskykyyn tiettyjen rotuun liittyvien kasvofenotyyppien kohdalla, kuten tummien ihonvärien (jopa 34,55 %) kohdalla.’

Tulokset osoittavat myös, että kromasampelaus, joka vähentää väritietoa (eikä kirkkaustietoa) kasvokuvan osittain, lisää virheellisen tunnistamisen määrää (FMR) useissa testatut tietokannoissa, joista monet ovat tietokoneen näön standardirepositoriot.

Kromasampelaustoiminnot alkuperäisessä kuvassa, eri nopeuksilla, vaikuttavat selvästi yksityiskohtien säilyttämiseen ja sävyjen yhdistymiseen, uhraamalla yksityiskohtia ja määrittelemällä piirteitä. Huomaa, että tämä kuva itsessään voi olla altis pakkaamiselle, ja viittaa alkuperäiseen tutkimusraporttiin tarkkaa resoluutiota varten. Lähde: https://arxiv.org/pdf/2208.07613.pdf

Kromasampelaustoiminnot alkuperäisessä kuvassa, eri nopeuksilla, vaikuttavat selvästi yksityiskohtien säilyttämiseen ja sävyjen yhdistymiseen, uhraamalla yksityiskohtia ja määrittelemällä piirteitä. Huomaa, että tämä kuva itsessään voi olla altis pakkaamiselle, ja viittaa alkuperäiseen tutkimusraporttiin tarkkaa resoluutiota varten. Lähde: https://arxiv.org/pdf/2208.07613.pdf

Kromasampelausta sovelletaan taloudellisena toimenpiteenä JPEG-pakkaamisessa, koska ihmiset eivät pysty havaitsemaan vähennyksiä värialueiden monimuotoisuudessa ja laajuudessa yhtä hyvin kuin tietokoneen näköjärjestelmät, jotka ottavat nämä “kokoomat” paljon kirjaimellisemmin kuin me.

Tutkijat ovat havainneet, että kromasampelauksen poistaminen pakkausprosessista vähentää tätä negatiivista vaikutusta jopa 15,95 %, vaikka se ei poista ongelmaa täysin.

Tutkimus osoittaa myös, että koulutus pakkaamattomilla (tai vähemmän pakkaamilla) tiedoilla ei ratkaise ongelmaa, jos inference-ajan kuvat ovat pakattuja. Tämä tarkoittaa, että kasvojen tunnistusmallin koulutus vähemmän pakkaamilla kuvilla ei poista harhaa, jos lopullinen tuotantomalli syötetään pakattuihin kuviiin.

Tutkimusraportti toteaa:

‘[Häviöllisen] kuvapakkauksen käyttö inference-ajassa heikentää nykyisten kasvojen tunnistusmenetelmien suorituskykyä tietyn rotuun liittyvien kasvofenotyyppien alaryhmälle (ts. tummien ihonvärien, monolid-silmänmuodon) ja että sen vaikutus on läsnä riippumatta siitä, käytetäänkö pakattuja kuvia mallin koulutukseen vai ei.’

Tutkimus korostaa kuvapakkaamisen vaikutuksia tietokoneen näön tutkimusalaan, jotka olivat selitetty yksityiskohtaisesti vuoden 2021 tutkimuksessa Marylandin yliopistosta ja Facebook AI:sta.

On vaikea ongelma; vaikka tallennus- ja kaistanleveysongelmat, jotka tekevät pakkaamisesta välttämätöntä, poistettaisiin yhdessä yössä, ja vaikka kaikki matalanlaatuiset kuvat, jotka ovat olleet osana tietokantoja useita kymmeniä vuosia, pakattaisiin uudelleen korkealaatuisista lähteistä, se edustaisi “resetin” akateemisten benchmark-työkalujen jatkuvuutta viimeisten useiden vuosikymmenien ajan. CV-yhteisö on käytännössä tottunut ongelmaan, josta se on merkittävä tekninen velka.

Rotuun perustuva harha kasvojen tunnistuksessa (FR) on muodostunut kuumaksi medialaitokseksi viime vuosina, mikä on johtanut tutkimusyhteisön yhteiseen pyrkimykseen poistaa se vaikuttuneista järjestelmistä. Tutkijat ovat kuitenkin huomanneet, että globaalin tutkimusyhteisön riippuvuus liian rajoitettujen “kultainen standardi” -tietokantojen käytöstä, joista monet eivät ole rotuun tasapainottuneita tai huonosti merkittyjä tältä osin, vaikeuttaa haastetta.

Tutkijat toteavat myös:

‘[Olemassa olevat] kuvan hankintastandardeja kasvojen tunnistusjärjestelmille, kuten ISO/IEC 19794-5 ja ICAO 9303, ehdottavat sekä kuvapohjaisia (ts. valaistus, peittäminen) että kohteen perusteisia (ts. asento, ilme, lisävarusteet) laadun standardeja kasvojen kuvan laadun varmistamiseksi.

‘Kasvojen kuvat tulisi myös tallentaa häviöllisen kuvapakkausstandardin mukaisesti, kuten JPEG tai JPEG2000; ja ne tulisi olla tunnistettavissa sukupuolen, silmänvärin, hiusten värin, ilmeen, ominaisuuksien (ts. silmälasit), asentokulman (yaw, pitch, roll) ja merkittävien paikkojen perusteella.

‘Kuitenkin yleiset kasvojen tunnistusbenchmarkit eivät noudata ISO/IEC 19794-5 ja ICAO 9303 -standardeja. Lisäksi luonnonvalaisissa näytteissä käytetään usein eri kameran ja ympäristön olosuhteita haastamaan ehdotettuja ratkaisuja.

‘Kuitenkin useimmat kasvokuvat näissä tietokannoissa on pakattu häviöllisellä JPEG-pakkaamisella.’

Tutkijat toteavat, että heidän tulevat ponnistelunsa tarkastelevat häviöllisen kuvakvantifioinnin vaikutusta moniin kasvojen tunnistuskehyksiin ja tarjoavat mahdollisia keinoja parantaa näiden järjestelmien reiluutta.

Uusi tutkimusraportti on nimeltään Vaikuttaako häviöllinen kuvapakkaus rotuun perustuvaan harhaan kasvojen tunnistuksessa?, ja se on tehty kolmen tutkijan toimesta Imperial College Londonista yhdessä yhden tutkijan kanssa InsightFace- syvän kasvoanalyysin kirjastosta.

Data ja menetelmä

Tutkijat käyttivät ImageMagick ja libjpeg avoimen lähdekoodin kirjastoja luomaan alkuperäisten kuvien eri pakkausasteita.

Alkuvaiheessa tutkijat tutkivat pakkaamisen vaikutusta neljällä eri tasolla JPEG-pakkaamista Racial Faces in-the-Wild (RFW) -tietokannassa.

PSNR-arvot Racial Faces-in-the-Wild -tietokannassa, osoittaen, miten pakkaaminen voi vaikuttaa tunnistuskykyyn pakattuihin kuviihin.

PSNR-arvot Racial Faces-in-the-Wild -tietokannassa, osoittaen, miten pakkaaminen voi vaikuttaa tunnistuskykyyn pakattuihin kuviihin.

Muiden testien joukossa he suorittivat tutkimuksen rotuun epätasapainottuneella tietokannalla ja toisella, joka oli rotuun tasapainottunut. Rotuun tasapainotetussa tietokannassa he käyttivät Additive Angular Margin Loss (ArcFace) -funktiota ArcFace -funktiolla yhdessä ResNet101v2:n kanssa alkuperäisellä VGGFace2 -benchmark-tietokannalla, joka sisältää 3,3 miljoonaa kuvaa 8631 rotuun epätasapainottuneella aiheella.

Tutkijat käyttivät RFW-tietokantaa testaamiseen. Järjestelmä koulutettiin neljä kertaa neljällä eri pakkausasteella, mikä johti neljään ArcFace-malliin.

Rotuun tasapainotetussa tietokannassa tutkijat käyttivät samaa kehystä alkuperäisellä BUPT-Balanced -benchmark-tietokannalla, joka sisältää 28 000 kasvoa, jotka on tasapainottu neljässä ryhmässä: Afrikan, Aasian, Intian ja Kaukasian, kustakin ryhmästä 7000 kuvaa. Kuten rotuun epätasapainottuneessa tietokannassa, neljä ArcFace-mallia saatiin tällä tavoin.

Lisäksi tutkijat toistivat pakattujen ja pakkaamattomien koulutusvaikutuksia poistamalla kromasampelauksen, jotta voitiin mitata sen vaikutus suorituskykyyn.

Tulokset

Virheellisen tunnistamisen määrä (FMR) näissä generoiduissa tietokannoissa tutkittiin. Tutkijat etsivät ennalta määriteltyjä fenotyyppejä rotuun liittyvien ominaisuuksien suhteen, kuten Ihon tyyppi (1, 2, 3, 4, 5 tai 6), Silmänmuoto (Monolid/Muu), Nenän muoto (Leveä/Kapea), Huulten muoto (Täysi/Pieni), Hiusten tyyppi (Suora/Aaltoileva/Kihara/Kalju) ja Hiusten väri – mittaukset, jotka perustuvat vuoden 2019 tutkimukseen Kasvojen tunnistuksessa oleva piilevä harha rotuun perustuvien fenotyyppien kautta.

Tutkimusraportti toteaa:

‘Havaitsemme, että kaikilla valituilla pakkausasteilla q = {5, 10, 15, 95}, FMR kasvaa, kun häviöllistä pakkaamista sovelletaan, osoittaen, että pakkausaste 5 (korkein pakkausaste) johtaa merkittävimpään laskuun FMR-suorituskyvyssä, kun taas pakkausaste 95 (alhaisin pakkausaste) ei aiheuta havaittavissa olevaa FMR-suorituskyvyn eroa.’

Tutkimuksen laajan tuloksien näyte, jota ei voida tässä toistaa - katso alkuperäinen tutkimusraportti paremman resoluution ja kattavampien tuloksien vuoksi. Tässä nähdään FMR-suorituskyvyn kirjo kasvavan pakkaamisen määrän mukaan VGGFace2:ssa, mukaan lukien pakkaamattomat tai vähän pakatut laadut.

Tutkimuksen laajan tuloksien näyte, jota ei voida tässä toistaa – katso alkuperäinen tutkimusraportti paremman resoluution ja kattavampien tuloksien vuoksi. Tässä nähdään FMR-suorituskyvyn kirjo kasvavan pakkaamisen määrän mukaan VGGFace2:ssa, mukaan lukien pakkaamattomat tai vähän pakatut laadut.

Tutkimusraportti johtaa siihen, että:

‘Kokonaisuudessaan arviomme osoittaa, että häviöllisesti pakatut kasvokuvat inference-ajassa heikentävät suorituskykyä merkittävästi tiettyjen fenotyyppien kohdalla, mukaan lukien tumma iho, leveä nenä, kihara hiukset ja monolid-silmä kaikkien muiden fenotyyppien yhteydessä.

‘Kuitenkin häviöllisen kuvapakkaamisen käyttö koulutuksessa tekee tuloksena olevista malleista kestävämmät ja rajoittaa suorituskyvyn heikentymistä: alempi suorituskyky tiettyjen rotuun liittyvien alaryhmien kohdalla pysyy. Lisäksi kromasampelauksen poistaminen parantaa FMR:ää tiettyjen fenotyyppien kohdalla, jotka ovat enemmän vaikutuksen alaisia häviöllisestä pakkaamisesta.’

 

* Minun muunnokseni alkuperäisistä viittauksista hyperlinkkeihin.

Julkaistu ensimmäisen kerran 22. elokuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai