Andersonův úhel

Nová metoda Deepfake řeší problém “Face Host”

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Několik let od začátku médií o potenciálu deepfake obrázků podkopat naši dlouho drženou víru v autenticitu videozáznamů, všechny目前 populární metody spoléhají na nalezení “face hostů”, které jsou široce podobné cílové tváři.

Kde původní záběry obsahují širokou tvář, ale cílový předmět má úzkou tvář, výsledky byly vždy problematické, protože takový přenos zahrnuje odstranění části původní tváře a rekonstrukci nově odhaleného pozadí. Současné balíčky, jako je DeepFaceLab a FaceSwap, jsou schopny produkovat omezené výsledky, když je konfigurace obrácena (úzká > široká), ale nemají žádnou funkci, která by přesvědčivě řešila tento scénář.

Nyní, spolupráce mezi Tencentem a Čínskou Xiamenskou univerzitou vyvinula nový přístup, nazvaný HifiFace, který je navržen tak, aby řešil tento nedostatek.

Dvě HifiFace deepfakes, první z Anne Hathaway, kde je získán dobrý vzhled navzdory neslučitelnému tvaru hostitelské tváře. HifiFace také funguje dobře na cílech s brýlemi, tradičně problematickém místě pro deepfakes. Zdroj: https://arxiv.org/pdf/2106.09965.pdf

Dvě HifiFace deepfakes, první z Anne Hathaway, kde je získán dobrý vzhled navzdory neslučitelnému tvaru hostitelské tváře. HifiFace také funguje dobře na cílech s brýlemi, tradičně problematickém místě pro deepfakes. Zdroj: https://arxiv.org/pdf/2106.09965.pdf

Přestavba deepfake tváře

Předchozí přístupy, jako je Subject Agnostic Face Swapping and Reenactment (FSGAN), závisely na 3DMM fitting (3D Morphable Models) nebo jiných metodách založených na rozpoznávání tváří nebo transformaci, kde tvárné linie tváře, která má být “přepsána”, téměř určují hranice výměny:

Zdroj: https://github.com/Yinghao-Li/3DMM-fitting

Rozpoznávání tvárných linií 3DMM. Zdroj: https://github.com/Yinghao-Li/3DMM-fitting

Ačkoli soutěžící metody využívají funkce odvozené z face recognition sítí, tyto jsou primárně zaměřeny na rekonstrukci textury spíše než struktury a podobně produkují “maskový” efekt v případech, kdy hostitelská tvář není zcela kompatibilní (tj. hranice a tvar vlasové linie, čelisti a lícních kostí).

Čínští výzkumníci, kteří pracovali v laboratoři Media Analytics and Computing na katedře Umělé inteligence, vyvinuli koncový model, který regresuje koeficienty cílové a zdrojové tváře pomocí 3D rekonstrukčního modelu, který je poté re-kombinován jako tvarová informace a spojena s identifikační vektorovou informací z face recognition sítě.

Tato geometrická data jsou poté zavedena do encoder-decoder modelu jako strukturální informace, které se mísí s výrazem a dispozicí cílové tváře, které se využívají jako pomocné zdroje pro přesný přenos.

Sémantická fúze tváří

Navíc, HifiFace zahrnuje komponent Sémantické fúze tváří (SFF), který využívá nízkouhlíkovou funkci v encoderu k zachování prostorové a texturové informace, aniž by obětoval identitu cílového obrazu. Funkce z encoderu a decoderu jsou integrovány do naučené adaptivní masky a pozadí je smícháno s výstupem pomocí naučené tvární masky.

HifiFace v akci. Zdroj: https://johann.wang/HifiFace/

HifiFace v akci. Zdroj: https://johann.wang/HifiFace/

Tímto způsobem HifiFace odchází od použití původních materiálů tvárních hranic jako pevné hranice, pomocí dilatované tvární sémantické segmentace, kde model může lépe adaptivně slučovat hranice tváří.

Dvě předchozí přístupy (nahoře a dole vlevo) a nová architektura HifiFace, která se skládá z encoderu, decoderu, 3D tvarově-aware identifikátoru a SFF modulu.

Dvě předchozí přístupy (nahoře a dole vlevo) a nová architektura HifiFace, která se skládá z encoderu, decoderu, 3D tvarově-aware identifikátoru a SFF modulu.

Při srovnání s předchozími metodami FSGAN, SimSwap a FaceShifter, HifiFace prokazuje lepší rekonstrukci tvaru tváře, protože neapproximuje “ghost” prvky, kde tvárné hranice zpochybňují identitu > identitu mapování, ale definitivně je rekonstruuje.

Testování

Výzkumníci implementovali systém pomocí VGGFace2 a DeepGlint Asian-Celeb dat. Tváře byly zarovnány pomocí 5 vnějších linií a znovu oříznuty na 256×256 pixelů. Portrétní vylepšovací síť byla také použita k vygenerování 512×512 pixelů verze, pro další vyšší rozlišení modelu. Model byl trénován pomocí Adam.

Ačkoli FaceShifter zachovává identitu dobře, nemůže řešit problémy, jako je výraz, barva a zakrytí, tak účinně jako HifiFace, a má složitější síťovou strukturu. FSGAN má problémy s přenosem osvětlení ze zdroje na cíl.

Výzkumníci používají FaceForensics++ pro kvantitativní srovnání, vzorkování deseti snímků v každé konvertované videosekvenci napříč soutěžícími metodami, a zjistili, že HifiFace dosáhl lepšího skóre ID vyhledávání. Při testování řady dalších faktorů, jako je kvalita obrazu, výzkumníci také zjistili, že jejich metoda překonala rivalitní metodologie.

Benedict Cumberbatchova tvárná linie je reprodukována věrně.

Benedict Cumberbatchova tvárná linie je reprodukována věrně.

Práce představuje další krok směrem k abstrakci zdrojového materiálu, aby byl pouze hrubým šablonou, do které lze přenést přesné identity. Některé z aktuálních FOSS balíčků, včetně DeepFaceLab, mají začínající funkčnost pro úplnou náhradu hlavy, ale, stejně jako HifiFace, tyto nezohledňují vlasy a jsou více efektivní při “budování” tváře než při jejím vyřezávání, aby odpovídala požadovanému cílovému zdroji.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai