AI-modeller och plattformar
DeepFace fÃķr avancerad ansiktsigenkÃĪnning

AnsiktsigenkÃĪnning har varit ett trendande omrÃĨde inom AI och ML under flera ÃĨr nu, och de omfattande kulturella och sociala implikationerna av ansiktsigenkÃĪnning ÃĪr lÃĨngtgÃĨende. Det finns dock ett prestandagap mellan mÃĪnskliga visuella system och maskiner som fÃķr nÃĪrvarande begrÃĪnsar ansÃķkningsomrÃĨdena fÃķr ansiktsigenkÃĪnning.
FÃķr att Ãķvervinna bufferten som skapats av prestandagapet och leverera mÃĪnsklig nivÃĨs noggrannhet, introducerade Meta DeepFace, ett ramverk fÃķr ansiktsigenkÃĪnning. DeepFace-modellen ÃĪr trÃĪnad pÃĨ en stor ansiktsdataset som skiljer sig avsevÃĪrt frÃĨn de dataset som anvÃĪnds fÃķr att konstruera utvÃĪrderingsbenchmarkerna, och den har potentialen att ÃķvertrÃĪffa befintliga ramverk med minimala anpassningar. Dessutom producerar DeepFace-ramverket kompakta ansiktsrepresentationer nÃĪr jÃĪmfÃķrt med andra system som producerar tusentals ansiktsutseendefunktioner.
Det fÃķreslagna DeepFace-ramverket anvÃĪnder Deep Learning fÃķr att trÃĪna pÃĨ en stor dataset som bestÃĨr av olika former av data, inklusive bilder, videor och grafik. DeepFace-nÃĪtverksarkitekturen antar att nÃĪr justeringen ÃĪr klar, ÃĪr platsen fÃķr varje ansiktsregion fast pÃĨ pixelnivÃĨ. DÃĪrfÃķr ÃĪr det mÃķjligt att anvÃĪnda de rÃĨa pixel-RGB-vÃĪrdena utan att anvÃĪnda flera konvolutionslager som gÃķrs i andra ramverk.
Den konventionella pipeline fÃķr moderna ansiktsigenkÃĪnning ramverk bestÃĨr av fyra stadier: Detektering, Justering, Representation och Klassificering. DeepFace-ramverket anvÃĪnder explicit 3D-ansiktsmodellering fÃķr att applicera en styckvis transformation, och anvÃĪnder ett nio-lagers djupt neuronnÃĪt fÃķr att hÃĪrleda en ansiktsrepresentation. DeepFace-ramverket fÃķrsÃķker att gÃķra fÃķljande bidrag
- Utveckla en effektiv DNN eller djup neuronnÃĪtarkitektur som kan utnyttja en stor dataset fÃķr att skapa en ansiktsrepresentation som kan generaliseras till andra dataset.
- AnvÃĪnda explicit 3D-modellering fÃķr att utveckla ett effektivt ansiktsjusteringssystem.
FÃķrstÃĨ hur DeepFace-modellen fungerar
Ansiktsjustering
Ansiktsjustering ÃĪr en teknik som roterar bilden av en person enligt Ãķgonens vinkel. Ansiktsjustering ÃĪr en vanlig praxis som anvÃĪnds fÃķr att fÃķrbehandla data fÃķr ansiktsigenkÃĪnning, och ansiktsjusterade dataset hjÃĪlper till att fÃķrbÃĪttra noggrannheten hos igenkÃĪnningsalgoritmer genom att ge en normaliserad indata. Men att justera ansikten pÃĨ ett obehindrat sÃĪtt kan vara en utmanande uppgift pÃĨ grund av de mÃĨnga faktorer som ÃĪr inblandade, som icke-rigida uttryck, kroppsstÃĪllningar och mer. Flera sofistikerade justeringstekniker, som att anvÃĪnda en analytisk 3D-modell av ansiktet eller sÃķka efter fiducialpunkter frÃĨn externa dataset, kan tillÃĨta utvecklare att Ãķvervinna utmaningarna.
Ãven om justering ÃĪr den mest populÃĪra metoden fÃķr att hantera obehindrad ansiktsverifiering och igenkÃĪnning, finns det ingen perfekt lÃķsning just nu. 3D-modeller anvÃĪnds ocksÃĨ, men deras popularitet har minskat avsevÃĪrt under de senaste ÃĨren, sÃĪrskilt nÃĪr de anvÃĪnds i en obehindrad miljÃķ. Men eftersom mÃĪnskliga ansikten ÃĪr 3D-objekt, kan det vara rÃĪtt tillvÃĪgagÃĨngssÃĪtt om det anvÃĪnds korrekt. DeepFace-modellen anvÃĪnder ett system som anvÃĪnder fiducialpunkter fÃķr att skapa en analytisk 3D-modellering av ansiktet. Denna 3D-modellering anvÃĪnds sedan fÃķr att vrida en ansiktsgrupp till en 3D-framÃĨtriktad modell.
Dessutom, precis som de flesta justeringsmetoder, anvÃĪnder DeepFace-justeringen ocksÃĨ fiducialpunktsdetektorer fÃķr att styra justeringsprocessen. Ãven om DeepFace-modellen anvÃĪnder en enkel punktdetektor, tillÃĪmpar den den i flera iterationer fÃķr att fÃķrbÃĪttra utdata. En Support Vector Regressor eller SVR som trÃĪnats fÃķr att fÃķrutse punktkonfigurationer extraherar fiducialpunkterna frÃĨn en bildbeskrivning vid varje iteration. DeepFace-bildbeskrivningen baseras pÃĨ LBP-histogram, men den ÃķvervÃĪger ocksÃĨ andra funktioner.
2D-justering
DeepFace-modellen initierar justeringsprocessen genom att upptÃĪcka sex fiducialpunkter inom detekteringsgruppen, centrerad i mitten av Ãķgonen, munnsplatser och nÃĪstippen. De anvÃĪnds fÃķr att rotera, skalera och ÃķversÃĪtta bilden till sex ankarpunkter och iterera pÃĨ den vridda bilden tills det inte finns nÃĨgon synlig fÃķrÃĪndring. Den ackumulerade transformationen genererar sedan en 2D-justerad kropp. Justeringsmetoden ÃĪr ganska lik den som anvÃĪnds i LFW-a, och den har anvÃĪnts under ÃĨren i ett fÃķrsÃķk att fÃķrbÃĪttra modellens noggrannhet.
3D-justering
FÃķr att justera ansikten med ut-ur-planet-rotationer, anvÃĪnder DeepFace-ramverket en generisk 3D-formmodell och registrerar en 3D-kamera som kan anvÃĪndas fÃķr att vrida den 2D-justerade kroppen till den 3D-formen i dess bildplan. Som ett resultat genererar modellen den 3D-justerade versionen av kroppen, och den uppnÃĨs genom att lokalisera ytterligare 67 fiducialpunkter i den 2D-justerade kroppen med hjÃĪlp av en andra SVR eller Support Vector Regressor.
Modellen placerar sedan manuellt de 67 ankarpunkterna pÃĨ den 3D-formen och kan dÃĪrmed uppnÃĨ full korrespondens mellan 3D-referenser och deras motsvarande fiducialpunkter. I nÃĪsta steg lÃĪggs en 3D-till-2D-affinkamera till med hjÃĪlp av en genererad minsta-kvadrat-lÃķsning till de linjÃĪra systemen med en kÃĪnd kovariansmatris som minimerar vissa fÃķrluster.
Frontalisering
Eftersom icke-rigida deformationer och fulla perspektivprojektioner inte modelleras, fungerar den passade 3D-till-2D-kameran endast som en approximation. I ett fÃķrsÃķk att minska korruptionen av viktiga identitetsbÃĪrande faktorer till den slutliga vridda bilden, lÃĪgger DeepFace-modellen till de motsvarande resterna till x-y-komponenterna av varje referensfiducialpunkt. En sÃĨdan avslappning fÃķr syftet med att vrida den 2D-bilden med mindre distorsioner till identiteten ÃĪr plausibel, och utan den skulle ansiktena ha vrits till samma form i 3D och fÃķrlorat viktiga diskriminerande faktorer under processen.
Till slut uppnÃĨr modellen frontalisering genom att anvÃĪnda en styckvis affintransformation som styrs av Delaunay-trianguleringen som hÃĪrrÃķr frÃĨn 67 fiducialpunkter.

- UpptÃĪckt ansikte med 6 fiducialpunkter.
- Inducerad 2D-justerad kropp.
- 67 fiducialpunkter pÃĨ den 2D-justerade kroppen.
- Referens 3D-form transformerad till 2D-justerad kroppsbild.
- Triangel synlighet i fÃķrhÃĨllande till 3D-2D-kameran.
- 67 fiducialpunkter inducerade av 3D-modellen.
- 3D-justerad version av den slutliga kroppen.
- Ny vy genererad av 3D-modellen.
Representation
Med en Ãķkning av mÃĪngden trÃĪningsdata, har lÃĪrandebaserade metoder visat sig vara mer effektiva och precisa jÃĪmfÃķrt med designade funktioner, frÃĪmst fÃķr att lÃĪrandebaserade metoder kan upptÃĪcka och optimera funktioner fÃķr en specifik uppgift.
DNN-arkitektur och trÃĪning
DeepFace DNN ÃĪr trÃĪnad pÃĨ en multi-klass ansiktsigenkÃĪnning uppgift som klassificerar identiteten av en ansiktsbild.
OvanstÃĨende figur representerar den Ãķvergripande arkitekturen fÃķr DeepFace-modellen. Modellen har ett konvolutionslager (C1) med 32 filter av storlek 11x11x3 som matas med en 3D-justerad 3-kanals RGB-bild av storlek 152Ã152 pixlar, och det resulterar i 32 funktionella kartor. Dessa funktionella kartor matas sedan till ett Max Pooling-lager eller M2 som tar maximum Ãķver 3Ã3 spatiala grannskap, och har ett steg pÃĨ 2, separat fÃķr varje kanal. FÃķljande ÃĪr ett annat konvolutionslager (C3) som bestÃĨr av 16 filter, var och en av storlek 9x9x16. Det primÃĪra syftet med dessa lager ÃĪr att extrahera lÃĨgnivÃĨfunktioner som textur och enkla kanter. FÃķrdelen med att anvÃĪnda Max Pooling-lager ÃĪr att det gÃķr utdata genererad av konvolutionslagren mer robust mot lokala ÃķversÃĪttningar, och nÃĪr det appliceras pÃĨ justerade ansiktsbilder, gÃķr det nÃĪtverket mer robust mot registreringsfel pÃĨ en liten skala.
Flera nivÃĨer av poolning gÃķr nÃĪtverket mer robust mot vissa situationer, men det orsakar ocksÃĨ att nÃĪtverket fÃķrlorar information om den exakta positionen av mikrotexturer och detaljerade ansiktsstrukturer. FÃķr att undvika att nÃĪtverket fÃķrlorar informationen, anvÃĪnder DeepFace-modellen ett maxpoolningslager endast med det fÃķrsta konvolutionslagret. Dessa lager tolkas av modellen som ett front-end adaptivt fÃķrbehandlingssteg. Ãven om de gÃķr mest av berÃĪkningen, har de begrÃĪnsade parametrar pÃĨ egen hand, och de utÃķkar endast indata till en uppsÃĪttning lokala funktioner.
FÃķljande lager L4, L5 och L6 ÃĪr lokalt anslutna, och precis som ett konvolutionslager, tillÃĪmpar de en filterbank dÃĪr varje plats i funktionella kartan lÃĪr sig en unik uppsÃĪttning filter. Eftersom olika regioner i en justerad bild har olika lokala statistik, kan det inte upprÃĪtthÃĨlla den spatiala stationÃĪritetsantagandet. Till exempel har omrÃĨdet mellan Ãķgonbrynen och Ãķgonen en hÃķgre diskrimineringsfÃķrmÃĨga jÃĪmfÃķrt med omrÃĨdet mellan munnen och nÃĪsan. AnvÃĪndningen av lojala lager pÃĨverkar antalet parametrar som ÃĪr fÃķremÃĨl fÃķr trÃĪning, men det pÃĨverkar inte den berÃĪkningsmÃĪssiga bÃķrdan under funktionsextraheringen.
DeepFace-modellen anvÃĪnder tre lager i fÃķrsta hand endast fÃķr att den har en stor mÃĪngd vÃĪl-etiketterad trÃĪningsdata. AnvÃĪndningen av lokalt anslutna lager kan motiveras ytterligare eftersom varje utgÃĨngsenhet av ett lokalt anslutet lager kan pÃĨverkas av en stor patch av indata.
Till slut ÃĪr de Ãķversta lagren fullstÃĪndigt anslutna, med varje utgÃĨngsenhet som ÃĪr ansluten till alla indata. De tvÃĨ lagren kan fÃĨnga korrelationerna mellan funktioner som fÃĨngats i olika delar av ansiktsbilderna, som position och form av mun och position och form av Ãķgonen. Utdata frÃĨn det fÃķrsta fullstÃĪndigt anslutna lagret (F7) kommer att anvÃĪndas av nÃĪtverket som dess rÃĨa ansiktsrepresentationfunktion. Modellen kommer sedan att mata utdata frÃĨn det sista fullstÃĪndigt anslutna lagret (F8) till en K-vÃĪgs softmax som producerar en fÃķrdelning Ãķver klassetiketter.
Dataset
DeepFace-modellen anvÃĪnder en kombination av dataset med Social Face Classification eller SFC-datasetet som det primÃĪra. Dessutom anvÃĪnder DeepFace-modellen ocksÃĨ LFW-datasetet och YTF-datasetet.
SFC-dataset
SFC-datasetet lÃĪrdes frÃĨn en samling bilder frÃĨn Facebook (META ), och det bestÃĨr av 4,4 miljoner etiketterade bilder av 4 030 personer med vardera 800 till 1 200 ansikten. De senaste 5% av SFC-datasetets ansiktsbilder fÃķr varje identitet lÃĪmnas utanfÃķr fÃķr testÃĪndamÃĨl.
LFW-dataset
LFW-datasetet bestÃĨr av 13 323 foton av Ãķver 5 000 kÃĪndisar som sedan delas in i 6 000 ansiktspar Ãķver 10 delningar.
YTF-dataset
YTF-datasetet bestÃĨr av 3 425 videor av 1 595 ÃĪmnen, och det ÃĪr en undermÃĪngd av kÃĪndisarna i LFW-datasetet.
Resultat
Utan frontalisering och nÃĪr endast 2D-justering anvÃĪnds, uppnÃĨr modellen en noggrannhet pÃĨ endast cirka 94,3%. NÃĪr modellen anvÃĪnder centrumkroppen av ansiktsdetektering, anvÃĪnder den inte nÃĨgon justering, och i detta fall returnerar modellen en noggrannhet pÃĨ 87,9% eftersom vissa delar av ansiktsomrÃĨdet kan falla utanfÃķr centrumkroppen. FÃķr att utvÃĪrdera den diskriminerande fÃķrmÃĨgan av ansiktsrepresentation i isolering, fÃķljer modellen den oÃķvervakade inlÃĪrningssÃĪttet fÃķr att jÃĪmfÃķra den inre produkten av normaliserade funktioner. Det Ãķkar den genomsnittliga noggrannheten hos modellen till 95,92%

OvanstÃĨende modell jÃĪmfÃķr prestandan hos DeepFace-modellen jÃĪmfÃķrt med andra state-of-the-art-ansiktsigenkÃĪnningmodeller.

OvanstÃĨende bild visar ROC-kurvor pÃĨ datasetet.
Slutsats
Idealt sett kommer en ansiktsklassificerare att kunna kÃĪnna igen ansikten med samma noggrannhet som en mÃĪnniska, och den kommer att kunna returnera hÃķg noggrannhet oavsett bildkvalitet, pose, uttryck eller belysning. Dessutom kommer ett idealt ansiktsigenkÃĪnningssystem att kunna appliceras pÃĨ en mÃĪngd olika tillÃĪmpningar med liten eller ingen modifiering. Ãven om DeepFace ÃĪr ett av de mest avancerade och effektiva ansiktsigenkÃĪnningssystemen fÃķr nÃĪrvarande, ÃĪr det inte perfekt, och det kan inte leverera exakta resultat i vissa situationer. Men DeepFace-ramverket ÃĪr en betydande milstolpe inom ansiktsigenkÃĪnning, och det stÃĪnger prestandagapet genom att anvÃĪnda en kraftfull metric-inlÃĪrningsteknik, och det kommer att fortsÃĪtta att bli mer effektivt Ãķver tiden.












