AI-mallit ja alustat

DeepFace edistyneelle kasvojentunnistamiselle

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa

Kasvojentunnistus on ollut trendikÃĪs aihe tekoÃĪlyssÃĪ ja koneoppimisessa useita vuosia, ja sen laajat kulttuuriset ja sosiaaliset vaikutukset ovat kauaskantoisia. On kuitenkin olemassa suorituskykyero ihmisen visuaalijÃĪrjestelmien ja koneiden vÃĪlillÃĪ, joka rajoittaa kasvojentunnistuksen sovelluksia.

YlittÃĪÃĪkseen suorituskykyeron ja saavuttaakseen ihmisen tason tarkkuuden, Meta esitteli DeepFace-kasvojentunnistuskehyksen. DeepFace-malli on koulutettu suurella kasvokuvadataliberialla, joka poikkeaa merkittÃĪvÃĪsti arviointibenchmarkkeja kÃĪyttÃĪvistÃĪ datalibreista, ja sillÃĪ on potentiaali ylittÃĪÃĪ olemassa olevat kehykset vÃĪhÃĪisillÃĪ sopeutuksilla. LisÃĪksi DeepFace-kehyksen tuottamat tiiviit kasvojen edustukset ovat verrattavissa muihin jÃĪrjestelmiin, jotka tuottavat tuhansia kasvojen ulkonÃĪÃķn piirteitÃĪ.

Ehdotettu DeepFace-kehyksen kÃĪyttÃĪÃĪ syvÃĪÃĪ oppimista kouluttaakseen suurella datalibrealla, joka sisÃĪltÃĪÃĪ erilaisia tietomuotoja, kuten kuvia, videoita ja grafiikkaa. DeepFace-verkkomalli olettaa, ettÃĪ kun suunnittelu on valmis, jokaisen kasvojen alueen sijainti on kiinnitetty pikselitasolla. TÃĪmÃĪn vuoksi on mahdollista kÃĪyttÃĪÃĪ raakapikselien RGB-arvoja ilman useiden konvoluutiokerrosten kÃĪyttÃĪmistÃĪ kuten muissa kehyksissÃĪ.

Perinteinen modernien kasvojentunnistuskehysten putki koostuu neljÃĪstÃĪ vaiheesta: havainnosta, suunnittelusta, edustuksesta ja luokittelusta. DeepFace-kehyksen kÃĪyttÃĪÃĪ eksplisiittistÃĪ 3D-kasvojen mallinnusta soveltamaan paloittaisen muodonmuutoksen ja kÃĪyttÃĪÃĪ yhdeksÃĪnkerroksista syvÃĪÃĪ neuroverkkoa johdattaakseen kasvojen edustuksen. DeepFace-kehyksen pyrkii tekemÃĪÃĪn seuraavat panokset

  1. KehittÃĪÃĪ tehokas DNN eli syvÃĪ neuroverkkoarkkitehtuuri, joka voi hyÃķdyntÃĪÃĪ suurta dataliberaalia luodakseen kasvojen edustuksen, joka voidaan yleistÃĪÃĪ muihin datalibrealeihin.
  2. KÃĪyttÃĪÃĪ eksplisiittistÃĪ 3D-mallinnusta kehittÃĪÃĪkseen tehokkaan kasvojen suunnittelu jÃĪrjestelmÃĪn.

DeepFace-mallin toiminnan ymmÃĪrtÃĪminen

Kasvojen suunnittelu

Kasvojen suunnittelu on tekniikka, joka kiertÃĪÃĪ henkilÃķn kuvaa silmien kulman mukaan. Kasvojen suunnittelu on suosittu kÃĪytÃĪntÃķ, jota kÃĪytetÃĪÃĪn esikÃĪsittelyyn kasvojentunnistukselle, ja kasvojen suunnitellut dataliberale auttavat parantamaan tunnistusalgoritmien tarkkuutta antamalla normalisoidun syÃķtteen. Kuitenkin kasvojen suunnittelu epÃĪrajoitettuun tapaan voi olla haasteellinen tehtÃĪvÃĪ useiden tekijÃķiden vuoksi, kuten joustavien ilmeiden, kehon asentojen ja muun. Useat kehittyneet suunnittelu menetelmÃĪt, kuten analyyttinen 3D-malli kasvoista tai fidusiaalipisteiden etsintÃĪ ulkoisesta dataliberialista, voivat mahdollistaa kehittÃĪjien voittaa haasteet.

Vaikka suunnittelu on suosituin menetelmÃĪ epÃĪrajoitetun kasvojen vahvistamiseen ja tunnistamiseen, ei ole tÃĪydellistÃĪ ratkaisua tÃĪllÃĪ hetkellÃĪ. 3D-malleja kÃĪytetÃĪÃĪn myÃķs, mutta niiden suosio on laskenut merkittÃĪvÃĪsti viimeisten vuosien aikana, erityisesti epÃĪrajoitetussa ympÃĪristÃķssÃĪ. Kuitenkin, koska ihmisen kasvot ovat 3D-olioita, se voi olla oikea lÃĪhestymistapa, jos sitÃĪ kÃĪytetÃĪÃĪn oikein. DeepFace-malli kÃĪyttÃĪÃĪ jÃĪrjestelmÃĪÃĪ, joka kÃĪyttÃĪÃĪ fidusiaalipisteitÃĪ luodakseen analyyttisen 3D-mallin kasvoista. TÃĪmÃĪ 3D-malli sitten kÃĪytetÃĪÃĪn kasvojen rypistÃĪmiseen 3D-etumaiseen muotoon.

LisÃĪksi, kuten useimmat suunnittelu kÃĪytÃĪnnÃķt, DeepFace-suunnittelu kÃĪyttÃĪÃĪ myÃķs fidusiaalipisteen etsintÃĪlaitteita suunnitteluprosessin ohjaamiseen. Vaikka DeepFace-malli kÃĪyttÃĪÃĪ yksinkertaista pisteen etsintÃĪÃĪ, se soveltaa sitÃĪ useissa iteraatioissa tuloksen hienontamiseksi. Tukeutumissuoritin tai SVR, joka on koulutettu ennustamaan pistekohtaisia konfiguraatioita, etsii fidusiaalipisteitÃĪ kuvauksesta kussakin iteraatiossa. DeepFace-kuvaukseen perustuu LBP-histogrammeja, vaikka se ottaa huomioon myÃķs muita ominaisuuksia.

2D-suunnittelu

DeepFace-malli aloittaa suunnitteluprosessin havainnoimalla kuusi fidusiaalipistettÃĪ havaintoalueella, joka on keskittynyt silmien keskivertoon, suun sijaintiin ja nenÃĪn kÃĪrkeen. Ne kÃĪytetÃĪÃĪn kiertÃĪmÃĪÃĪn, skaalaamaan ja kÃĪÃĪntÃĪmÃĪÃĪn kuvaa kuuteen ankkuripaikkaan, ja iteroida warpattua kuvaa, kunnes siinÃĪ ei ole nÃĪkyvÃĪÃĪ muutosta. Yhdistetty muodonmuutos sitten luo 2D-suunnitellun rypisteen. SuunnittelumenetelmÃĪ on hyvin samankaltainen kuin LFW-a:ssa kÃĪytetty menetelmÃĪ, ja sitÃĪ on kÃĪytetty useiden vuosien ajan mallin tarkkuuden parantamiseen.

3D-suunnittelu

Kasvojen suunnitteluun, joilla on tasolla olevia rotaatioita, DeepFace-kehyksen kÃĪyttÃĪÃĪ yleistÃĪ 3D-muotoa, ja rekisterÃķi 3D-kameran, jota voidaan kÃĪyttÃĪÃĪ 2D-suunnitellun rypisteen kÃĪÃĪntÃĪmiseen 3D-muotoon sen kuvapinnassa. Tuloksena malli luo 3D-suunnitellun version rypisteen, ja se saavutetaan lokalisoimalla 67 fidusiaalipistettÃĪ 2D-suunnitellussa rypisteessÃĪ toisen SVR:n avulla.

Malli sitten asettaa 67 ankkuripistettÃĪ 3D-muotoon manuaalisesti ja pystyy saavuttamaan tÃĪydellisen vastaavuuden 3D-viittauksien ja niiden vastaavien fidusiaalipisteiden vÃĪlillÃĪ. Seuraavassa vaiheessa 3D-2D-affiini kamera lisÃĪtÃĪÃĪn yleistettyyn lineaariseen jÃĪrjestelmÃĪÃĪn, jolla on tunnettu kovarianssimatriisi, joka minimoi tiettyjÃĪ hÃĪviÃĪ.

Etumaisen suunnittelu

Koska joustavat muodonmuutokset ja tÃĪydelliset perspektiiviprojektioita eivÃĪt ole mallinnettu, sovitettu 3D-2D-kamera palvelee vain approksimaationa. PyrkimyksenÃĪÃĪn vÃĪhentÃĪÃĪ tÃĪrkeiden identiteetin mukana olevien tekijÃķiden korruptiota lopulliseen warpattuun, DeepFace-malli lisÃĪÃĪ vastaavat jÃĪÃĪnnÃķkset kunkin viittaavan fidusiaalipisteen x-y-komponentteihin. TÃĪllainen rentoutus warpattua kuvaa vÃĪhemmÃĪn vÃĪÃĪristyneellÃĪ identiteetillÃĪ on perusteltava, ja ilman sitÃĪ kasvot olisivat vÃĪÃĪristyneet saman muodon 3D:ssa, menettÃĪen tÃĪrkeitÃĪ diskriminointitekijÃķitÃĪ prosessissa.

Lopulta malli saavuttaa etumaisen suunnittelun kÃĪyttÃĪmÃĪllÃĪ paloittaisen affiinimuodonmuutosta, jota ohjataan Delaunay-triangulaatiosta, joka on johdettu 67 fidusiaalipisteestÃĪ.

  1. Havaittu kasvo kuudella fidusiaalipisteellÃĪ.
  2. Indusoitu 2D-suunniteltu rypiste.
  3. 67 fidusiaalipistettÃĪ 2D-suunnitellussa rypisteessÃĪ.
  4. Viittaava 3D-muoto, joka on muunnettu 2D-suunnitellun rypisteen kuvamuotoon.
  5. Kolmioiden nÃĪkyvyys suhteessa 3D-2D-kameraan.
  6. 67 fidusiaalipistettÃĪ, jotka on indusoitu 3D-mallista.
  7. 3D-suunniteltu versio lopullisesta rypisteestÃĪ.
  8. Uusi nÃĪkymÃĪ, joka on generoitu 3D-mallista.

Edustus

Kun koulutusdatan mÃĪÃĪrÃĪ kasvaa, oppimismenetelmÃĪt ovat osoittautuneet tehokkaammiksi ja tarkemmiksi verrattuna konfiguroituihin ominaisuuksiin, koska oppimismenetelmÃĪt voivat lÃķytÃĪÃĪ ja optimoida ominaisuuksia tiettyyn tehtÃĪvÃĪÃĪn.

DNN-arkkitehtuuri ja koulutus

DeepFace-DNN on koulutettu moniluokkaisella kasvojentunnistustehtÃĪvÃĪllÃĪ, joka luokittelee kasvojen identiteetin.

YllÃĪ oleva kuva edustaa DeepFace-mallin yleistÃĪ arkkitehtuuria. Malli sisÃĪltÃĪÃĪ konvoluutio kerroksen (C1) 32 suodattimella, joiden koko on 11x11x3, jota syÃķtetÃĪÃĪn 3D-suunniteltuun 3-kanavainen RGB-kuva, jossa on 152×152 pikseliÃĪ, ja se johtaa 32 ominaisuuskarttaan. NÃĪmÃĪ ominaisuuskartat syÃķtetÃĪÃĪn sitten M2-maksimipoolauskerrokseen, joka ottaa maksimin 3×3 spatiaalisten naapureiden yli, ja jolla on askel 2, erikseen kullekin kanavalle. Seuraavaksi on toinen konvoluutio kerros (C3), joka koostuu 16 suodattimista, joista jokainen on 9x9x16. NÃĪiden kerrosten pÃĪÃĪasiallinen tarkoitus on lÃķytÃĪÃĪ matalatason ominaisuudet, kuten tekstuurit ja yksinkertaiset reunat. Maksimipoolauskerrosten etu on, ettÃĪ se tekee konvoluutio kerrosten tuottamasta tuloksesta robustimmaksi paikallisten kÃĪÃĪnnÃķsten suhteen, ja kun sitÃĪ sovelletaan suunniteltuihin kasvojen kuvauksiin, se tekee verkon paljon robustimmaksi rekisterÃķintivirheille pienessÃĪ mittakaavassa.

Useiden poolauskerrosten kÃĪyttÃĪminen tekee verkon robustimmaksi tietyissÃĪ tilanteissa, mutta se myÃķs aiheuttaa verkon menettÃĪmisen tarkkaa tietoa mikrotekstuurien ja yksityiskohtaisten kasvojen rakenteiden sijainnista. VÃĪlttÃĪÃĪkseen verkon menettÃĪmisen tietoa, DeepFace-malli kÃĪyttÃĪÃĪ maksimipoolauskerrosta vain ensimmÃĪisellÃĪ konvoluutio kerroksella. NÃĪmÃĪ kerrokset tulkitaan mallissa eturintamana sopeutuvana esikÃĪsittelyvaiheena. Vaikka ne tekevÃĪt suurimman osan laskelmista, niillÃĪ on rajoitettu mÃĪÃĪrÃĪ parametreja itsessÃĪÃĪn, ja ne laajentavat vain syÃķtteen joukkoon paikallisia ominaisuuksia.

Seuraavat kerrokset L4, L5 ja L6 ovat paikallisesti yhdistettyjÃĪ, ja niiden toimintaperiaate on samanlainen kuin konvoluutio kerroksella, jossa jokainen ominaisuuskartan sijainti oppii yksilÃķllisen suodattimien joukon. Koska eri alueet suunnitellussa kuvassa ovat erilaisia paikallisia tilastojen suhteen, se ei voi pitÃĪÃĪ paikallista stationaarisuuden oletusta. Esimerkiksi alue vÃĪlien vÃĪlillÃĪ ja silmien vÃĪlillÃĪ on suurempi diskriminoivuuskyky verrattuna alueeseen suun ja nenÃĪn vÃĪlillÃĪ. Paikallisesti yhdistettyjen kerrosten kÃĪyttÃĪminen vaikuttaa parametreja, jotka ovat alttiina koulutukselle, mutta se ei vaikuta laskelmien rasitteeseen ominaisuuksien hakemisen aikana.

DeepFace-malli kÃĪyttÃĪÃĪ kolmea kerrosta aluksi vain, koska sillÃĪ on suuri mÃĪÃĪrÃĪ hyvin merkittyjÃĪ koulutusdataa. Paikallisesti yhdistettyjen kerrosten kÃĪyttÃĪminen voidaan perustella myÃķs sillÃĪ, ettÃĪ kunkin paikallisesti yhdistetyn kerroksen tulostusyksikkÃķ voidaan vaikuttaa suurella osalla syÃķtedataa.

Lopulta ylin kerros on tÃĪysin yhdistetty, ja jokainen tulostusyksikkÃķ on yhdistetty kaikkiin syÃķteyksikÃķihin. Kaksi kerrosta voi siepata korrelaatiot ominaisuuksien vÃĪlillÃĪ, jotka on havaittu eri osissa kasvojen kuvia, kuten suun ja silmien sijainti ja muoto. EnsimmÃĪisen tÃĪysin yhdistetyn kerroksen (F7) tulostusta kÃĪytetÃĪÃĪn verkon raakana kasvojen edustusominaisuusvektorina. Malli syÃķttÃĪÃĪ sitten viimeisen tÃĪysin yhdistetyn kerroksen (F8) tulostuksen K-tie-softmaxiin, joka tuottaa jakautumisen luokka-etuliitteiden yli.

Dataliberaalit

DeepFace-malli kÃĪyttÃĪÃĪ yhdistelmÃĪÃĪ datalibrealeja, joista Social Face Classification eli SFC-dataliberaali on ensisijainen. LisÃĪksi DeepFace-malli kÃĪyttÃĪÃĪ myÃķs LFW-dataliberaalia ja YTF-dataliberaalia.

SFC-dataliberaali

SFC-dataliberaali on opittu Facebookin kuva kokoelmasta, ja se koostuu 4,4 miljoonasta merkitystÃĪ kuvasta 4030 henkilÃķltÃĪ, joista jokaisella on 800-1200 kasvoa. Viimeiset 5% SFC-dataliberaalin kasvojen kuvista kullekin identiteetille on jÃĪtetty testaamista varten.

LFW-dataliberaali

LFW-dataliberaali koostuu 13 323 valokuvasta yli 5000 julkkiksesta, jotka on jaettu 6000 kasvojen pariin 10 jakoon.

YTF-dataliberaali

YTF-dataliberaali koostuu 3425 videosta 1595 aiheesta, ja se on osa LFW-dataliberaalissa olevista julkkiksista.

Tulokset

Ilman etumaisen suunnittelua ja kÃĪyttÃĪen vain 2D-suunnittelua malli saavuttaa tarkkuusarvon vain noin 94,3%. Kun malli kÃĪyttÃĪÃĪ kasvojen keskiosaa, se ei kÃĪytÃĪ suunnittelua, ja tÃĪssÃĪ tapauksessa malli palauttaa tarkkuusarvon 87,9%, koska osa kasvojen alueesta saattaa olla keskiosan ulkopuolella. Arvioidakseen kasvojen edustuksen diskriminointikykyÃĪ erillÃĪÃĪn, malli seuraa epÃĪsupervoidun oppimisen asetelmaa vertaamaan normalisoiden ominaisuuksien sisÃĪistÃĪ tuotetta. Se lisÃĪÃĪ mallin keskimÃĪÃĪrÃĪisen tarkkuuden 95,92%:iin.

YllÃĪ oleva malli vertaa DeepFace-mallin suorituskykyÃĪ muihin valtavirtaisten kasvojentunnistusmallien kanssa.

YllÃĪ oleva kuva esittÃĪÃĪ ROC-kÃĪyrÃĪt dataliberaalissa.

JohtopÃĪÃĪtÃķs

Ihanteellisesti, kasvojentunnistin pystyisi tunnistamaan kasvot ihmisen tarkkuudella ja palauttamaan korkean tarkkuuden riippumatta kuvan laadusta, asennosta, ilmeestÃĪ tai valaistuksesta. LisÃĪksi ihanteellinen kasvojentunnistuskehyksen voisi soveltaa moniin sovelluksiin vÃĪhÃĪisillÃĪ muutoksilla. Vaikka DeepFace on yksi edistyneimmistÃĪ ja tehokkaimmista kasvojentunnistuskehyksistÃĪ tÃĪllÃĪ hetkellÃĪ, se ei ole tÃĪydellinen, ja se ei vÃĪlttÃĪmÃĪttÃĪ pysty toimittamaan tarkkoja tuloksia tietyissÃĪ tilanteissa. Kuitenkin DeepFace-kehyksen on merkittÃĪvÃĪ vÃĪlietappi kasvojentunnistusalan kehityksessÃĪ, ja se sulkee suorituskykyeron kÃĪyttÃĪmÃĪllÃĪ voimakasta mittausoppimismenetelmÃĪÃĪ, ja se tulee parantamaan tehokkuuttaan ajan myÃķtÃĪ.

Ammattina insinÃķÃķri, sydÃĪmen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvÃĪ rakkaus ja ymmÃĪrrys AI: sta ja ML: stÃĪ, omistautunut yksinkertaistamaan monimutkaisia kÃĪsitteitÃĪ nÃĪissÃĪ aloissa hÃĪnen viihdyttÃĪvÃĪn ja informatiivisen dokumentaationsa kautta.