Andersonův úhel

Proč deepfakes nemohou目前 přenášet jemnost emocí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
The Book of Boba Fett - Disney

Včerejší debut 6. epizody spin-offu Star Wars The Book of Boba Fett zřejmě rozdělil názory fanoušků. Obecně schvalované, existuje široký předpoklad napříč sociálními sítěmi, že mnohem lepší rekreace de-aged Marka Hamilla (ve srovnání s jeho předchozím výskytem v sezóně 2 finále The Mandalorian v roce 2020) je přímým výsledkem toho, že Industrial Light and Magic najal amatérského deepfakes praktika Shamooka (který výrazně zlepšil svou práci s open source softwarem); a že renderinky postavy musí být kombinací deepfake technologie, možná vyčištěné pomocí CGI.

Existuje omezené potvrzení toho, ačkoli Shamook od té doby řekl málo světu, od kdy smlouva ILM NDA sestoupila. Přesto je práce mimořádným zlepšením oproti CGI z roku 2020; vykazuje některé z “lesku” spojených s deepfake modely odvozenými z archivních prací; a obecně se shoduje s nejlepšími současnými vizuálními standardy pro deepfakes.

Jiný proud názorů fanoušků je, že nový pokus o “Young Luke” má sadu různých chyb než ten předchozí. Možná nejvýrazněji, nedostatek expresivnosti a jemných, vhodných emocí ve velmi dlouhých sekvencích s novou rekreací Skywalkera jsou více typické pro deepfakes než CGI; The Verge popsal simulaci Boba Fetta v termínech “nepříjemné, prázdné tváře Marka Hamilla z roku 1983”.

Nezávisle na technologiích za novou rekreací ILM, deepfake transformace mají základní problém s jemností emocí, který je obtížné řešit buď změnami v architektuře nebo zlepšením zdrojového tréninkového materiálu, a který je obvykle vyhýbán pečlivými výběry, které virální deepfakers dělají, když vybírají cílové video.

Omezení tvárného zarovnání

Dvě nejčastěji používané deepfake FOSS repozitáře jsou DeepFaceLab (DFL) a FaceSwap, oba odvozené z anonymního a kontroverzního zdrojového kódu z roku 2017, s DFL, který má ohromující náskok ve VFX průmyslu, navzdory jeho omezenému instrumentáři.

Každý z těchto balíčků je úkolem, počínaje tím, že extrahuje tvárné orientační body z tváří, které dokáže identifikovat ze zdrojového materiálu (tj. rámců videa a / nebo statických obrazů).

Adrian Bulat's Facial Alignment Network (FAN) v akci, z oficiálního repozitáře. Zdroj: https://github.com/1adrianb/face-alignment

Facial Alignment Network (FAN) v akci, z oficiálního repozitáře. Zdroj: https://github.com/1adrianb/face-alignment

Oba DFL a FaceSwap používají Facial Alignment Network (FAN) knihovnu. FAN může vytvářet 2D a 3D (viz obrázek výše) orientační body pro extrahované tváře. 3D orientační body mohou brát rozsáhlý účet z vnímané orientace obličeje, až po extrémní profily a relativně akutní úhly.

Jedná se o velmi základní směrnice pro shromažďování a hodnocení pixelů:

Z fóra FaceSwap, hrubý ukazatel dostupných orientačních bodů pro tvárné linie.

Z fóra FaceSwap, hrubý ukazatel dostupných orientačních bodů pro tvárné linie. Zdroj: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

Nejběžnější linie obličeje jsou povoleny: oči se mohou rozšiřovat a zavírat, stejně jako čelist, zatímco základní konfigurace úst (jako úsměv, mrzutost atd.) mohou být stopovány a adaptovány. Obličej se může otáčet v libovolném směru až kolem 200 stupňů od pohledu kamery.

Mimo to jsou tyto poměrně hrubé ploty pro to, jak pixely budou se chovat uvnitř těchto hranic, a představují jediné skutečně matematické a přesné tvárné směrnice v celém deepfake procesu. Tréninkový proces sám o sobě jednoduše porovnává, jak jsou pixely rozloženy uvnitř nebo poblíž těchto hranic.

Trénink v DeepFaceLab. Zdroj: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Trénink v DeepFaceLab. Zdroj: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Pоскольку neexistuje žádná ustanovení pro topologii subčástí obličeje (konvexita a konkavita líček, detaily stárnutí, důlky atd.), není ani možné pokusit se shodnout s takovými “jemnými” sub-funkcemi mezi zdrojovou (‘obličej, který chcete přepsat’) a cílovou (‘obličej, který chcete vložit’) identitou.

Vypořádání se s omezenými daty

Získání odpovídajících dat mezi dvěma identitami pro účely tréninku deepfakes není snadné. Čím neobvyklejší je úhel, který potřebujete shodit, tím více budete muset kompromitovat, zda ten (vzácný) úhlový shod mezi identitami A a B skutečně obsahuje stejný výraz.

Blízko, ale ne přesně shoda.

Blízko, ale ne přesně shoda.

V příkladu výše jsou dvě identity poměrně podobné v dispozici, ale toto je tak blízko, jak může tento dataset dostat k přesnému shodu.

Zřejmé rozdíly zůstávají: úhel a čočka se přesně neshodují, a ani osvětlení; subjekt A nemá své oči úplně zavřené, na rozdíl od subjektu B; kvalita obrazu a komprese je horší u subjektu A; a nějakým způsobem subjekt B vypadá mnohem šťastnější než subjekt A.

Ale, víte, je to všechno, co máme, takže budeme muset trénovat na něm stejně.

Pokud je tento A < > B shod tak mnoha neobvyklými prvky, můžete být jisti, že existuje málo, pokud vůbec nějaké, podobných párů v sadě. Proto bude trénink buď podhodnotit nebo přehodnotit.

Podhodnocení: Pokud je tento shod skutečnou menšinou (tj. rodičovský dataset je bastante velký a neobsahuje často charakteristiky těchto dvou fotografií), nebude mít mnoho času na trénink ve srovnání s více “populárními” (tj. snadnými / neutrálními) páry. V důsledku toho tento úhel / výraz nebude dobře reprezentován v deepfake vytvořeném s trénovaným modelem.

Přehodnocení: V zoufalství nad vzácnými datovými shody pro tak vzácné A < > B páry, deepfakers někdy duplikují pár mnohokrát v datasetu, aby dostal lepší šanci stát se funkcí v konečném modelu. To povede k přehodnocení, kde deepfake videa vytvořená s modelem budou pravděpodobně pedanticky opakovat nesrovnalosti, které jsou evidentní mezi dvěma fotografiemi, jako je lišící se rozsah, v jakém jsou oči zavřené.

Na obrázku níže vidíme Vladimira Putina, který je trénován v DeepFaceLab, aby provedl swap do Kevina Spaceyho. Zde je trénink relativně pokročilý na 160 000 iterací.

Zdroj: https://i.imgur.com/OdXHLhU.jpg (původně z webu, na který nemohu odkázat zde).

Zdroj: https://i.imgur.com/OdXHLhU.jpg

Laický pozorovatel by mohl tvrdit, že Putin vypadá trochu, no, prostorový než Spacey v těchto testovacích swapech. Podívejme se, co online program rozpoznávání emocí dělá s nesrovnalostí ve výrazech:

Zdroj: https://www.noldus.com/facereader/measure-your-emotions

Zdroj: https://www.noldus.com/facereader/measure-your-emotions

Podle tohoto konkrétního orákula, které analyzuje mnohem podrobnější topografii obličeje než DFL a Faceswap, je Spacey méně rozzlobený, ohyzdný a pohrdlivý než výsledný Putin deepfake v tomto páru.

Nesrovnalosti ve výrazech přicházejí jako součást spleteného balíčku, protože populární deepfakes aplikace nemají žádnou kapacitu registrovat nebo shodovat výrazy nebo emoce, kromě tacitně, jako surový pixel > pixel mapping.

Pro nás jsou rozdíly obrovské. Učíme se číst tvárné výrazy jako základní techniku přežití z našich nejranějších let, a nadále se spoléháme na tuto dovednost v dospělosti pro účely sociální integrace a pokroku, párování a jako pokračující rámec pro hodnocení hrozeb. Protože jsme tak citliví na mikro-výrazy, deepfake technologie bude nakonec muset zohlednit to.

Proti zrnu

Ačkoli deepfake revoluce přinesla slib vkládání “klasických” filmových hvězd do moderních filmů a TV, AI nemůže jít zpět v čase a natáčet jejich klasické práce na kompatibilnější definici a kvalitu, což je zásadní pro tento případ použití.

Předpokladem (a pro naše účely to nezáleží, zda je to špatné), že rekonstrukce Hamilla v Boba Fettu byla z velké části prací trénovaného deepfake modelu, dataset pro model by musel využít footage z období blízkého časové ose show (tj. Hamill jako raný třicátník kolem času produkce Return of the Jedi, 1981-83).

Film byl natočen na Eastman Color Negative 250T 5293/7293 stock, 250ASA emulzi, která byla považována za střední až jemnou zrnitost v té době, ale byla překonána v jasnosti, barevném rozsahu a věrnosti již koncem 80. let. Je to akciový stock jeho času, a operatický rozsah Jediho umožnil málo close-upů, dokonce i pro jeho hlavní herce, což dělá problémy se zrnitostí ještě kritičtějšími, protože zdrojové tváře zabírají pouze část rámečku.

Škála scén Hamilla v Return of the Jedi (1983).

Škála scén Hamilla v Return of the Jedi (1983).

<p Navíc, mnoho VFX-naložených záběrů s Hamillem by prošlo optickým tiskárnou, což zvýšilo filmový zrnitost. Nicméně, přístup k archivům Lucasfilmu – které se pravděpodobně dobře starají o master negativy a mohly by nabídnout hodiny dalšího nepoužitého surového materiálu – by mohlo tento problém překonat.

Občas je možné pokrýt řadu let herecké kariéry, aby se zvýšila a diverzifikovala deepfakes dataset. V případě Hamilla jsou deepfakers omezováni jeho změnou vzhledu po autonehodě v roce 1977 a skutečností, že okamžitě začal svou druhou kariéru jako uznávaný dabér po Jedi, což dělá zdrojový materiál relativně vzácným.

Omezený rozsah emocí?

Pokud potřebujete, aby váš deepfaked herec žvýkal scénář, budete potřebovat zdrojový materiál, který obsahuje neobvykle široký rozsah tvárných výrazů. Může se stát, že jediný věkově vhodný materiál, který je k dispozici, neobsahuje mnoho z těchto výrazů.

Například, do doby, kdy se příběhová linie Return of the Jedi dostala, Hamillův charakter již z velké části ovládl své emoce, vývoj, který je absolutně centrální pro původní franchisovou mýtus. Proto, pokud vytvoříte Hamill deepfake model z Jedi dat, budete muset pracovat s více omezeným rozsahem emocí a neobvyklou tvárnou kompozicí, kterou Hamillův roli vyžadoval v té době, ve srovnání s jeho předchozími vstupy do franchisy.

Even if you consider that there are moments in Return of the Jedi where the Skywalker character is under stress, and could provide material for a greater range of expressions, face material in these scenes is nonetheless fleeting and subject to the motion blur and fast editing typical of action scenes; so the data is pretty unbalanced.

Generalizace: Sloučení emocí

Pokud je Skywalker rekreace v Boba Fettu skutečně deepfake, nedostatek expresivního rozsahu, který byl proti němu vznesen z některých stran, by nebyl zcela způsoben omezeným zdrojovým materiálem. Encoder-decoder tréninkový proces deepfakes je zaměřen na generalizovaný model, který úspěšně destiluje centrální funkce z tisíců obrazů, a může alespoň pokusit se deepfake úhlu, který chyběl nebo byl vzácný v datasetu.

If not for this flexibility, a deepfake architecture would simply be copying and pasting base morphs on a per-frame basis, without considering either temporal adaptation or context.

However, the painful trade-off for this versatility is that expression fidelity is likely to be a casualty of the process, and any expressions which are ‘subtle’ may not be the right ones. We all play our faces like 100-piece orchestras, and are well-equipped to do so, whereas deepfake software is arguably missing at least the string section.

Disparita afektu ve výrazech

Tvární pohyby a jejich účinky na nás nejsou uniformním jazykem napříč všemi tvářemi; zvednutý obočí, které vypadá bezstarostně na Rogera Moorea, by mohlo vypadat méně sofistikovaně na Setha Rogana, zatímco svůdná přitažlivost Marilyn Monroe by se mohla přeložit do negativnější emoce, pokud by byla deepfaked na osobu, jejíž nejvíce dostupná role je “rozzlobená” nebo “dezafektovaná” (jako postava Aubrey Plaza v sedmi sezónách Parks and Recreation).

Therefore pixel><pixel equivalence across A/B face-sets is not necessarily helpful in this respect; but it’s all that is on offer in state-of-the-art deepfake FOSS software.

What is arguably needed is a deepfake framework that not only can recognize expressions and infer emotions, but has the ability to embody high-level concepts such as angry, seductive, bored, tired, etc., and to categorize those emotions and their related expressions in each of the two face-set identities, rather than examining and replicating the disposition of a mouth or an eyelid.

First published 3rd únor 2022. Aktualizováno 7:47pm EET, incorrect name attribution.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai