Andersonin kulma

‘Heikentyneet’ Synteettiset Kasvot Voivat Parantaa Kasvojen Tunnistamista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Michiganin osavaltion yliopistosta ovat kehittäneet menetelmän, jolla synteettiset kasvot voivat ottaa tauon deepfake-kokemuksesta ja tehdä hyvää maailmassa – auttamalla kuvantunnistusjärjestelmiä tulkitsemaan kuvia tarkemmin.

Heidän kehittämänsä uusi kontrolloitu kasvojen synteesimoduuli (CFSM) on kykeneväinen uudelleenluomaan kasvoja oikean maailman videonvalvontakuvauksen tyylissä, sen sijaan, että se riippuisi yhdenmukaisesti korkealaatuisemmista kuvista, joita käytetään suosituissa avoimissa lähdekoodin tietokannoissa julkkiksista, jotka eivät heijasta kaikkia virheitä ja puutteita aitoja CCTV-järjestelmiä, kuten kasvojen sumeen, matalan resoluution ja anturin melun – tekijöitä, jotka voivat vaikuttaa tunnistusvirheisiin.

Käsitteellinen arkkitehtuuri Kontrolloitu Kasvojen Synteesimoduuli (CFSM). Lähde: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf

Käsitteellinen arkkitehtuuri Kontrolloitu Kasvojen Synteesimoduuli (CFSM). Lähde: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf

CFSM ei ole tarkoitettu erityisesti jäljittelemään pään asentoja, ilmeitä tai muita yleisiä piirteitä, jotka ovat deepfake-järjestelmien tavoitteita, vaan sen sijaan se tuottaa joukon vaihtoehtoisia näkymiä kohdetunnistusjärjestelmän tyylissä, käyttäen tyylin siirtämistä.

Järjestelmä on suunniteltu jäljittelemään kohdejärjestelmän tyylialueen ja sovittamaan ulostulonsa sen resoluution ja “ominaisuuksien” mukaan. Käyttötapaus sisältää vanhoja järjestelmiä, jotka eivät todennäköisesti päivitetä kustannussyistä, mutta jotka voivat nykyään tuottaa vain vähän uudelle sukupolvelle kasvojen tunnistusteknologioita, heikkojen tulostuslaatujen vuoksi, jotka saattavat aiemmin olla olleet johtavassa asemassa.

Järjestelmän testaaminen osoitti, että se teki merkittäviä parannuksia kuvantunnistusjärjestelmissä, jotka joutuvat käsittelemään tällaista meluisaa ja matalalaatuista dataa.

Kouluttamassa kasvojen tunnistusmalleja sopeutumaan kohdejärjestelmien rajoituksiin. Lähde: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf

Kouluttamassa kasvojen tunnistusmalleja sopeutumaan kohdejärjestelmien rajoituksiin. Lähde: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf

He löysivät myös hyödyllisen sivutuotteen prosessista – että kohdetietokannat voivat nyt karakterisoida ja verrata toisiinsa, mikä tekee vertailun, benchmarkkaamisen ja räätälöityjen tietokantojen luomisen erilaisille CCTV-järjestelmille helpommaksi tulevaisuudessa.

Lisäksi menetelmä voidaan soveltaa olemassa oleviin tietokantoihin, suorittamalla de facto domain sopeutumista ja tekemällä niistä sovellettavampia kasvojen tunnistusjärjestelmille.

Uusi artikkeli on nimeltään Kontrolloitu ja Ohjattu Kasvojen Synteesi Rajoittamattomalle Kasvojen Tunnettamiselle, ja se on tuettu osittain Yhdysvaltain kansallisen tiedustelun johtajan toimistosta (ODNI, IARPA), ja se tulee neljältä tutkijalta MSU:n tietojenkäsittely- ja insinööritieteiden osastolta.

Esitelty Sisältö

Matalan laadun kasvojen tunnistaminen (LQFR) on tullut huomattavaksi tutkimusalueeksi viime vuosina. Koska kunnalliset viranomaiset rakensivat videonvalvontajärjestelmiä kestäviksi ja pitkäaikaisiksi (ei halunnut uudelleenmäärittää resursseja ongelmaan jaksollisesti), monet “perintö” -valvontaverkot ovat joutuneet teknisen velan uhreiksi, sovellettavuutensa suhteen tietokoneopon data-lähteiksi.

Eri kasvojen resoluutioita eri historiallisissa ja uudemmissa videonvalvontajärjestelmissä. Lähde: https://arxiv.org/pdf/1805.11519.pdf

Eri kasvojen resoluutioita eri historiallisissa ja uudemmissa videonvalvontajärjestelmissä. Lähde: https://arxiv.org/pdf/1805.11519.pdf

Onneksi tämä on tehtävä, johon diffuusiomallit ja muut meluun perustuvat mallit ovat poikkeuksellisen hyvin soveltuvia ratkaisemaan. Monet viime vuosien suosituimmista ja tehokkaimmista kuvansynteesijärjestelmistä suorittavat ylosovitusta matalaresoluutioisista kuvista osana prosessiaan, kun taas tämä on myös ehdottoman välttämätöntä neurorajapinnan pakkaustekniikoille (menetelmät tallentaa kuvia ja videoita neurorajapinna-dataksi bitmap-dataa vastaan).

Kasvojen tunnistamisen osana on saada mahdollisimman suuri tarkkuus vähimmäisestä määrästä piirteitä, jotka voidaan erottaa pienimmistä ja vähäisimmistä matalaresoluutioisista kuvista. Tämä rajoitus on olemassa, koska on hyödyllistä pystyä tunnistamaan (tai luomaan) kasvoja matalassa resoluutiossa, mutta myös teknisten rajoitusten vuoksi kuvien koosta, jotka voivat kulkea koulutusmallin latenttiavaruuden kautta, joka on saatavilla paikallisella GPU:lla.

Tässä mielessä termi “piirteet” on hämäävä, koska tällaiset piirteet voidaan myös saada tietokannasta puistonpenkeistä. Tietokoneen näköalalla “piirteet” viittaavat erottaviin ominaisuuksiin saatavista kuvista – mihin tahansa kuvista, olivatpa ne kirkon piirteitä, vuoren asentoa tai kasvojen piirteitä kasvotietokannassa.

Koska tietokoneen näköalgoritmit ovat nyt taitavia kuvien ylös skaalauksessa ja videomateriaalissa, on ehdotettu useita menetelmiä “parantamaan” matalaresoluutioisia tai muuten heikentyneitä perintövalvontamateriaaleja, jotta ne voisivat olla käytettävissä oikeudellisissa tarkoituksissa, kuten asettaa tietty henkilö rikospaikalle.

Lisäksi mahdollisuus väärään tunnistamiseen, joka on joskus kerännyt otsikkoja, ei pitäisi teoriassa olla välttämätöntä hyper-resoluutioon tai muuhun muodonmuutokseen, jotta voidaan tehdä positiivinen tunnistaminen yksilöstä, koska kasvojen tunnistusjärjestelmä, joka keskittyy matalatasoiseen piirteisiin, ei tarvitse sitä resoluutiota ja selkeyttä. Lisäksi tällaiset muodonmuutokset ovat kalliita käytännössä ja herättävät lisäksi toistuvia kysymyksiä niiden mahdollisen validiteetin ja laillisuuden suhteen.

Tarve Lisää ‘Riisuttuja’ Julkkiksia

Olisi hyödyllisempää, jos kasvojen tunnistusjärjestelmä voisi johtaa piirteitä (ts. koneoppimisen piirteitä ihmisten piirteistä) perintöjärjestelmien tulosteista sellaisenaan, ymmärtämällä paremmin suhdetta “korkean resoluution” identiteetin ja heikentyneiden kuvien välillä, jotka ovat saatavilla muuttumattomissa (usein korvaamattomissa) olemassa olevissa videonvalvontakehyksissä.

Ongelmana on standardit: yleiset web-kerätyt tietokannat, kuten MS-Celeb-1M ja WebFace260M (muiden joukossa), ovat kiinnittyneet tutkimusyhteisöön, koska ne tarjoavat yhdenmukaiset vertailukohteet, joihin tutkijat voivat verrata edistymistään nykyisen tilan kanssa.

Esimerkkejä Microsoftin suositusta MS-Celeb1m-tietokannasta. Lähde: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/

Esimerkkejä Microsoftin suositusta MS-Celeb1m-tietokannasta. Lähde: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/

Kuitenkin kirjoittajat väittävät, että kasvojen tunnistus (FR) -algoritmit, jotka on koulutettu näillä tietokannoilla, eivät sovellu visuaalisiin “alueisiin” monien vanhempien valvontajärjestelmien tulosteista.

Artikkeli toteaa*:

‘[Tilannekuva] (SoTA) FR-mallit eivät toimi hyvin todellisissa valvontakuvissa (rajoittamattomassa) johtuen alueen siirtymisongelmasta, eli suuret koulutusdatat (puolirauniot) saadaan verkkohakuun perustuvista julkkiskuvista, jotka puuttuvat luonnonvaraisista muunnelmista, kuten sisäänrakennetusta anturin melusta, matalasta resoluutiosta, liikemelusta, pyörteistä, jne.

‘Esimerkiksi 1:1 vahvistusvirhe, jota yksi SoTA-malleista ilmoittaa rajoittamattomassa IJB-S -tietokannassa, on noin 30% alempi kuin puoliraunioisessa LFW-tietokannassa.

‘Mahdollinen ratkaisu tähän suorituskykyeroon on koota suuri määrä rajoittamattomia kasvotietokantoja. Kuitenkin tällaisen koulutusdatan rakentaminen, jossa on kymmeniä tuhansia aiheita, on esteettä vaikeaa korkean manuaalisen merkintäkustannuksen vuoksi.’

Artikkeli kertoo useista aiemmista menetelmistä, jotka ovat yrittäneet “sovittaa” erilaisia historiallisten tai matalalaatuisten valvontajärjestelmien tulosteita, mutta ne ovat käsitelleet “sokeita” parannuksia. Sen sijaan CFSM saa suoran palautteen kohdejärjestelmän todellisesta tulosteesta koulutuksen aikana ja sopeuttaa itsensä tyylin siirtämisen kautta jäljittelemään kyseistä aluetta.

Näyttelijä Natalie Portman, joka ei ole vieras joukossa tietokantoja, jotka hallitsevat tietokoneen näköalayhteisöä, on mukana esimerkissä CFSM:stä, joka suorittaa tyylin mukaisen sopeutumisen kohdejärjestelmän palautteen perusteella.

Näyttelijä Natalie Portman, joka ei ole vieras joukossa tietokantoja, jotka hallitsevat tietokoneen näköalayhteisöä, on mukana esimerkissä CFSM:stä, joka suorittaa tyylin mukaisen sopeutumisen kohdejärjestelmän palautteen perusteella.

Arkkitehtuuri, jonka kirjoittajat ovat suunnitelleet, käyttää nopeaa gradientin merkintämenetelmää (FGSM) erottamaan ja “tuomaan” saadut tyylit ja ominaisuudet kohdejärjestelmän todellisesta tulosteesta. Kuvausosuus, joka on osa putkistoa, paranee ja tulee uskottavammaksi kohdejärjestelmälle koulutuksen aikana. Tämä palaute kohdejärjestelmän matalan dimensionaalisesta tyylin avaruudesta on alkuperäistä luonnetta ja vastaa laajimmin johdettuja visuaalisia kuvaajia.

Kirjoittajat toteavat:

‘Kohdejärjestelmän palautteen ansiosta syntetisoidut kuvat ovat hyödyllisempiä kasvojen tunnistukselle, mikä johtaa merkittäviin parannuksiin kasvojen tunnistusmallien yleistymiskyvyssä, jotka on koulutettu niiden avulla.’

Testit

Tutkijat käyttivät MSU:n aiempaa tutkimusta mallina testaamiseen. Perustuen samoihin kokeellisiin protokolleihin, he käyttivät MS-Celeb-1m:tä, joka koostuu pelkästään verkkohakuun perustuvista julkkiskuvista, merkityksi koulutusdataksi. Reiluuden vuoksi he sisällyttivät myös MS1M-V2:n, joka sisältää 3,9 miljoonaa kuvaa, joissa on 85 700 luokkaa.

Kohdeaineisto oli WiderFace -tietokanta Kiinan yliopistosta. Tämä on erittäin monipuolinen joukko kuvia, jotka on suunniteltu haastavien tilanteiden kasvojen havaitsemistehtäviin. 70 000 kuvaa tästä joukosta käytettiin.

Arviointia varten järjestelmä testattiin neljää kasvojen tunnistusvertailukohdetta vastaan: IJB-B, IJB-C, IJB-S ja TinyFace.

CFSM koulutettiin noin 10%:lla koulutusdatasta MS-Celeb-1m:stä, noin 0,4 miljoonalla kuvalla, 125 000 iteraatiolla 32 paketin kokoisella Adam-optimoinnilla (erittäin alhaisella) 1e-4 oppimissuhteella.

Kohdekasvojen tunnistusmalli käytti muunnelmaa ResNet-50:stä rungona, ArcFace-häviöfunktiolla koulutuksen aikana. Lisäksi malli koulutettiin CFSM:llä ablaatio- ja vertailukokeena (merkitty “ArcFace” tuloksissa alla).

CFSM:n ensisijaiset testitulokset. Suuremmat luvut ovat parempia.

CFSM:n ensisijaiset testitulokset. Suuremmat luvut ovat parempia.

Kirjoittajat toteavat ensisijaisista tuloksista:

‘ArcFace-malli ylittää kaikki vertailukohdetutkimukset sekä kasvojen tunnistamis- ja vahvistustehtävissä ja saavuttaa uuden tilannekuvan suorituskyvyn.’

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai