Andersonův úhel
Přestavování obličejů ve videích pomocí strojového učení

Výzkumná spolupráce mezi Čínou a Spojeným královstvím vyvinula novou metodu pro přestavování obličejů ve videu. Tato technika umožňuje přesvědčivé rozšíření a zúžení obličejové struktury, s vysokou konzistencí a absencí artefaktů.

Z YouTube videa, které bylo použito jako zdroj materiálu výzkumníky, herečka Jennifer Lawrence vypadá jako více hubená osobnost (vpravo). Viz doprovodné video vložené na konci článku pro více příkladů v lepší rozlišení. Zdroj: https://www.youtube.com/watch?v=tA2BxvrKvjE
Tento typ transformace je obvykle možný pouze pomocí tradičních CGI metod, které by musely zcela přestavovat obličej pomocí detailních a nákladných procedur motion-capping, rigging a texturing.
Místo toho je CGI v této technice integrována do neuronového pipeline jako parametrická 3D obličejová informace, která je následně použita jako základ pro workflow strojového učení.

Tradiční parametrické obličeje jsou stále více používány jako směrnice pro transformační procesy, které používají AI místo CGI. Zdroj: https://arxiv.org/pdf/2205.02538.pdf
Autoři uvádějí:
‘Naším cílem je vygenerovat vysoce kvalitní portrétní video přestavování [výsledků] úpravou celkové tvaru portrétních obličejů podle přirozené deformace obličeje ve skutečném světě. To lze použít pro aplikace, jako je generování tvarů obličejů pro krášlení a přehánění obličejů pro vizuální efekty.’
Ačkoli 2D tváření a deformace obličeje jsou k dispozici spotřebitelům od vzniku Photoshopu (a vedly k podivným a často nepřijatelným subkulturám tváření a deformace obličeje a těla), je obtížné dosáhnout toho ve videu bez použití CGI.

Mark Zuckerbergova obličejová dimenze rozšířena a zúžena novou čínsko-britskou technikou.
Přestavování těla je目前 field of intenzivního zájmu v počítačovém vidění,主要 kvůli jeho potenciálu v módním e-commerce, ačkoli udělat někoho vyššího nebo kostnatěji rozmanitého je目前 značná výzva.
Podobně, změna tvaru hlavy ve videu ve konzistentní a přesvědčivé podobě byla předmětem předchozích prací od výzkumníků, kteří představili novou práci, ačkoli tato implementace trpěla artefakty a dalšími omezeními. Nová nabídka rozšiřuje schopnost této předchozí práce z statického na video výstup.
Nový systém byl trénován na desktopovém počítači s procesorem AMD Ryzen 9 3950X a 32 GB paměti, a používá optický tokový algoritmus z OpenCV pro motion mapy, vyhlazené rámcem StructureFlow; síť pro zarovnání obličeje (FAN) pro odhadování landmarků, které se také používá v populárních balíčcích deepfakes; a Ceres Solver pro řešení optimalizačních problémů.

Extrémní příklad tváření obličeje s novým systémem.
Článek je nazvaný Parametrické přestavování portrétů ve videích a pochází od tří výzkumníků z Univerzity Če-ťiang a jednoho z Univerzity v Bathu.
O obličeji
Pod novým systémem je video extrahováno do sekvence obrázků a nejprve je odhadnuta rigidní pozice pro každý obličej. Poté je reprezentativní počet následujících snímků společně odhadnut pro konstrukci konzistentních identifikačních parametrů po celou dobu běhu obrázků (tj. snímků videa).

Architektonický tok tváření obličeje.
Po tomto kroku je vyhodnocen výraz, což vede k parametru přestavování, který je implementován lineární regresí. Poté je novým podepsaným vzdálenostním funkcím (SDF) konstruována hustá 2D mapa obličejových linií před a po přestavování.
Nakonec je provedena optimalizace tváření obsahu na výstupním videu.
Parametrické obličeje
Proces využívá 3D tvarovatelného modelu obličeje (3DMM), který je stále populárnější doplněk k neuronovým a GAN-založeným systémům syntézy obličeje, a také použitelný pro systémy detekce deepfakes.

Není z nového článku, ale příklad 3D tvarovatelného modelu obličeje (3DMM) – parametrického prototypu obličeje použitelného v novém projektu. Horní levá, aplikace landmarků na 3DMM obličeji. Horní pravá, 3D mesh vertexy isomapu. Dolní levá ukazuje zarovnání landmarků; dolní prostřední, isomap extrahované obličejové textury; a dolní pravá, výsledné zarovnání a tvar. Zdroj: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Průtok nové soustavy musí zohledňovat případy zakrytí, jako je případ, kdy se subjekt odvrací. To je jedna z největších výzev v softwaru deepfakes, protože landmarky FAN mají malou kapacitu pro tyto případy a tendenci erodovat v kvalitě, jak se obličej odvrací nebo je zakryt.
Nový systém je schopen se vyhnout této pasti definováním konturové energie, která je schopna odpovídat hranici mezi 3D obličejem (3DMM) a 2D obličejem (definovaným landmarky FAN).
Optimalizace
Užitečná implementace takové soustavy by byla provedena v reálném čase, například ve filtrech videohovorů. Současný rámec tuto funkci nepodporuje a výpočetní zdroje by vyžadovaly “živou” deformaci, což by byla značná výzva.
Podle článku a předpokladu cíle 24fps videa, operace na snímcích v pipeline představují prodlevu 16,344 sekund pro každou sekundu filmu, s dalšími jednorázovými údery pro odhad identity a 3D deformaci obličeje (321 ms a 160 ms, resp.).
Tudíž optimalizace je klíčem k pokroku směrem ke snížení prodlevy. Protože společná optimalizace přes všechny snímky by přidala značné zatížení procesu a init-styl optimalizace (předpokládající konzistentní následnou identitu mluvčího z prvního snímku) by mohla vést k anomáliím, autoři přijali řídký schéma pro výpočet koeficientů snímků vzorkovaných na praktických intervalech.
Společná optimalizace je pak provedena na tomto podmnožině snímků, což vede k štíhlejšímu procesu rekonstrukce.
Twáření obličeje
Technika tváření obličeje použitá v projektu je adaptací práce autorů z roku 2020 Deep Shapely Portraits (DSP).

Deep Shapely Portraits, příspěvek z roku 2020 do ACM Multimedia. Článek je veden výzkumníky z laboratoře ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Zdroj: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Autoři uvádějí ‘Rozšiřujeme tuto metodu z přestavování jednoho monokulárního obrazu na přestavování celé sekvence obrazů.’
Testy
Článek uvádí, že neexistoval žádný srovnatelný předchozí materiál, proti kterému by se mohla nová metoda vyhodnotit. Proto autoři porovnali snímky svého zkresleného video výstupu proti statickému výstupu DSP.

Testování nového systému proti statickým obrazům z Deep Shapely Portraits.
Autoři uvádějí, že artefakty vznikají z metody DSP, kvůli jejímu použití řídkého mapování – problém, který nový rámec řeší hustým mapováním. Kromě toho video vyrobené DSP, článek uvádí, demonstruje nedostatek plynulosti a vizuální koherence.
Autoři uvádějí:
‘Výsledky ukazují, že náš přístup může robustně produkovat koherentní přestavená portrétní videa, zatímco metoda založená na obrazech může snadno vést k nápadným třesavým artefaktům.’
Viz doprovodné video níže pro více příkladů:
Poprvé zveřejněno 9. května 2022. Opraveno 18:00 EET, nahrazeno ‘pole’ funkcí pro SDF.












