Andersonův úhel
Rozdělování je další hlubokou falzifikací revolucí

CGI datové obohacování se používá v novém projektu, aby získal větší kontrolu nad hlubokou falzifikací obrazu. Ačkoli stále nelze efektivně použít CGI hlavy k vyplnění chybějících mezer v hlubokých falzifikacích obličeje, nová vlna výzkumu do rozdělování identity z kontextu znamená, že brzy možná nebude třeba.
Vytvořitelé některých nejúspěšnějších virálních hlubokých falzifikací posledních let pečlivě vybírají své zdrojové videa, vyhýbají se udržení profilových záběrů (tj. druhu bočních portrétů, které se staly populární díky policejním postupům), akutním úhlům a neobvyklým nebo přehnaným výrazům. Častěji jsou demonstrační videa vyrobená virálními hlubokými falzifikátory editované kompilace, které vybírají “nejlehčí” úhly a výrazy pro hlubokou falzifikaci.
Ve skutečnosti je nejvhodnějším cílovým videem pro vložení hluboké falzifikace video, ve kterém původní osoba (jejíž identita bude vymazána hlubokou falzifikací) hledí přímo do kamery, s minimálním rozsahem výrazů.

Většina populárních hlubokých falzifikací posledních let ukazovala subjekty přímo tváří v tvář kameře a buď pouze s populárními výrazy (jako úsměv), které lze snadno extrahovat z výstupu red-carpet paparazzi, nebo (jako v případě falešné Sylvester Stallone jako Terminátor, zobrazené vlevo), ideálně bez výrazu, protože neutrální výrazy jsou velmi časté, což je činí snadno začlenitelnými do modelů hluboké falzifikace.
Protože technologie hluboké falzifikace, jako je DeepFaceLab a FaceSwap, tyto jednoduché záměny provádějí velmi dobře, jsme dostatečně ohromeni tím, co dokážou, a nevnímáme, co nejsou schopni, a – často – se ani nepokoušejí:

Snímky z uznávaného videa hluboké falzifikace, ve kterém je Arnold Schwarzenegger transformován na Sylvester Stallone – pokud jsou úhly příliš trikové. Profily zůstávají trvalým problémem současných přístupů hluboké falzifikace, částečně proto, že open source software používaný k definování obličejových póz v rámcích hluboké falzifikace není optimalizován pro boční pohledy, ale hlavně proto, že chybí vhodné zdrojové materiály v jednom nebo obou nezbytných sadách dat. Zdroj: https://www.youtube.com/watch?v=AQvCmQFScMA
Nový výzkum z Izraele navrhuje novou metodu použití syntetických dat, jako jsou CGI hlavy, k tomu, aby hluboká falzifikace vstoupila do roku 2020, skutečně oddělující obličejové identity (tj. základní obličejové charakteristiky “Toma Cruise”) od jejich kontextu (tj. hledění nahoru, hledění stranou, mrkání, mrkání v temnotě, čelení obočí, zavření očí, atd.).

Nový systém odděluje úhel a kontext (tj. mrknutí okem) od kódování identity, pomocí nesouvisejících syntetických obličejových dat (zobrazených vlevo). V horní řadě vidíme “mrknutí” přenesené na identitu Baracka Obamy, iniciované naučenou nelineární cestou latentního prostoru GAN, reprezentovaného CGI obrazem vlevo. V řadě níže vidíme přenesenou rohovou část úst na bývalého prezidenta. V pravém dolním rohu vidíme obě charakteristiky aplikované současně. Zdroj: https://arxiv.org/pdf/2111.08419.pdf
To není pouhé hluboké falzifikační loutkářství, technika vhodnější pro avatary a částečné synchronizaci rtů, a která má omezený potenciál pro plnohodnotné transformace videa hluboké falzifikace.
Rather, toto představuje cestu vpřed pro fundamentální oddělení instrumentality (jako ‘změnit úhel hlavy’, ‘vytvořit mrknutí’) od identity, nabízející cestu k vysoké úrovni, spíše než “odvozené” image syntézy založené na hluboké falzifikaci.
Nová práce je nazvána Delta-GAN-Encoder: Encoding Semantic Changes for Explicit Image Editing, using Few Synthetic Samples, a pochází od výzkumníků z Technion – Izraelského technologického institutu.
Abychom pochopili, co tato práce znamená, podívejme se, jak jsou hluboké falzifikace目前 produkovány všude od webů hluboké falzifikace až po Industrial Light and Magic (od té doby, co je repozitář DeepFaceLab aktuálně dominantní v amatérské i profesionální hluboké falzifikaci).
Co brání současné technologii hluboké falzifikace?
Hluboké falzifikace jsou目前 vytvořeny trénováním modelu strojového učení encoder/decoder na dvou složkách obličejových obrazů – osobu, kterou chcete “přemalovat” (v předchozím příkladu to je Arnie), a osobu, kterou chcete superimponovat do záběru (Sly).

Příklady různých póz a osvětlení v dvou různých sadách obličejů. Všimněte si charakteristického výrazu na konci třetí řady ve sloupci A, který je nepravděpodobné, že by měl blízký ekvivalent v jiné sadě dat.
Systém encoder/decoder pak porovnává každý jednotlivý obraz v každé složce s každým jiným, udržuje, zlepšuje a opakuje tuto operaci po stovky tisíc iterací (často po dobu až týdne), dokud dostatečně dobře nerozumí základním charakteristikám obou identit, aby je mohl libovolně měnit.
Pro každou ze dvou osob, které se mění v procesu, co hluboká falzifikační architektura naučí o identitě, je spjato s kontextem. Nemůže se naučit a aplikovat principy o obecné póze “jednou pro vždy”, ale potřebuje hojné příklady v trénovací sadě dat, pro každou identitu, která se bude účastnit výměny obličejů.
Tudíž, pokud chcete vyměnit dvě identity, které dělají něco neobvyklého než jen úsměv nebo pohled přímo do kamery, budete potřebovat mnoho instancí téže pózy/identity v obou sadách obličejů:

Protože obličejová identita a pózové charakteristiky jsou目前 tak úzce spjaty, je zapotřebí široká shoda výrazů, póz hlavy a (do menší míry) osvětlení v obou obličejových sadách dat, aby se vytvořil efektivní model hluboké falzifikace na systémech jako DeepFaceLab. Čím méně je konkrétní konfigurace (jako “boční pohled/úsměv/osvětlený sluncem”) obsažena v obou sadách obličejů, tím méně přesně bude vykreslena v hluboké falzifikaci videa, pokud je zapotřebí.
Pokud má sada A neobvyklou pózu, ale sada B ji postrádá, jste prakticky bez šance; bez ohledu na to, jak dlouho trénujete model, nikdy se nenaučí reprodukovat tu pózu dobře mezi identitami, protože neměl dostatečné informace, když byl trénován.
I když máte shodné obrazy, nemusí to být dostatečné: pokud má sada A shodnou pózu, ale s ostrým bočním osvětlením, ve srovnání s rovným osvětlením v jiné sadě obličejů, kvalita výměny nebude tak dobrá, jako kdyby měly obě sady shodné osvětlení.
Proč jsou data vzácná
Pokud se často nedostanete do vězení, pravděpodobně nemáte mnoho bočních portrétů sami sebe. Jakékoli, které jste měli, jste pravděpodobně vyhodili. Protože agentury dělají totéž, jsou boční portréty obtížně dostupné.
Hluboké falzifikátory často zahrnují více kopií omezených bočních profilových dat, která mají pro identitu v sadě obličejů, jen aby se tato póza dostala alespoň trochu pozornosti a času během trénování, místo aby byla diskontována jako outlier.

Ale existuje mnoho více typů bočních portrétů, než je pravděpodobné, že by byly k dispozici pro zařazení do sady dat – úsměv, mrknutí, křik, pláč, temné osvětlení, pohrdání, nenápadnost, veselost, bleskové osvětlení, hledění nahoru, hledění dolů, otevřené oči, zavřené oči… a tak dále. Jakékoli z těchto póz, v mnoha kombinacích, by mohly být zapotřebí v cílovém videu hluboké falzifikace.
A to je jen profily. Kolik snímků sami sebe máte, které ukazují, jak se díváte rovně nahoru? Máte dostatek, aby obecně reprezentovaly 10 000 možných výrazů, které byste mohli nosit, zatímco držíte přesně tutéž pózu z přesně té same kamery, pokrývající alespoň některé z jednoho milionu možných osvětlovacích prostředí?
Šance jsou, že nemáte žádný snímek sami sebe, který by ukazoval, jak se díváte nahoru. A to je jen dva úhly z více než sta, které by byly zapotřebí pro úplné pokrytí.
I kdyby bylo možné vygenerovat úplné pokrytí obličeje ze všech úhlů za různých osvětlovacích podmínek, výsledná sada dat by byla příliš velká na trénování, v řádu stovek tisíc obrazů; a i kdyby mohla být trénována, povaha trénovacího procesu pro současné rámce hluboké falzifikace by většinu této extra data zahodila ve prospěch omezeného počtu odvozených funkcí, protože současné rámce jsou redukcionistické a nejsou příliš škálovatelné.
Syntetická substituce
Od začátku hluboké falzifikace experimentovali hlubokí falzifikátory s použitím CGI stylu obrazů, hlav vytvořených v 3D aplikacích, jako je Cinema4D a Maya, k vygenerování “chybějících” póz.

Žádný AI není nutný; herečka je rekonstruována v tradičním CGI programu, Cinema 4D, pomocí mřížek a bitmapových textur – technologie, která sahá až do 60. let, i když se rozšířila až od 90. let. Teoreticky by tento model obličeje mohl být použit k vygenerování zdrojových dat hluboké falzifikace pro neobvyklé pózy, osvětlení a výrazy. Ve skutečnosti však byl omezený nebo žádný pro hlubokou falzifikaci, protože “falešnost” renderů se často projeví ve výměně videa. Zdroj: Tento obrázek autora na https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Tato metoda je obecně opuštěna brzy novými hlubokými falzifikátory, protože i když může poskytnout pózy a výrazy, které jsou jinak nedostupné, syntetický vzhled CGI obličejů se obvykle projeví ve výměně videa kvůli spjatosti ID a kontextuálních/semantických informací.
To může vést k náhlému projevu “uncanny valley” obličejů v jinak přesvědčivém videu hluboké falzifikace, protože algoritmus začne využívat jediné dostupné údaje pro neobvyklou pózu nebo výraz – zjevně falešné obličeje.

Mezi nejpopulárnějšími subjekty pro hluboké falzifikátory, 3D algoritmus hluboké falzifikace pro australskou herečku Margot Robbie je součástí výchozí instalace DeepFaceLive, verze DeepFaceLab, která může provádět hlubokou falzifikaci v přímém přenosu, jako je relace webové kamery. CGI verze, jak je zobrazeno výše, by mohla být použita k získání neobvyklých “chybějících” úhlů v sadách dat hluboké falzifikace. Zdroj: https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace
CGI obličeje jako oddělené, konceptuální směrnice
Místo toho je nová metoda Delta-GAN Encoder (DGE) od izraelských výzkumníků účinnější, protože pózové a kontextové informace z CGI obrazů byly zcela odděleny od “identifikačních” informací cíle.
Můžeme vidět tuto zásadu v akci na obrázku níže, kde byly získány různé orientace hlavy pomocí CGI obrazů jako směrnice. Protože identifikační funkce jsou nesouvisející s kontextovými funkcemi, není žádný “prostor” pro falešný vzhled CGI obličeje, ani pro identitu zobrazenou v něm:

S novou metodou nemusíte najít tři samostatné reálné zdrojové obrázky, aby jste provedli hlubokou falzifikaci z více úhlů – můžete prostě otočit CGI hlavu, jejíž abstraktní funkce jsou uloženy na identitu bez úniku jakýchkoli informací o ID.

Delta-GAN-Encoder. Horní levá skupina: úhel zdrojového obrazu lze změnit za sekundu a vykreslit nový zdrojový obraz, který se projeví ve výstupu; horní pravá skupina: osvětlení je také odděleno od identity, což umožňuje superimpozici stylů osvětlení; spodní levá skupina: několik obličejových detailů je změněno, aby se vytvořil “smutný” výraz; spodní pravá skupina: jeden jediný obličejový detail je změněn, aby se oči zúžily.
Toto oddělení identity a kontextu je dosaženo ve fázi trénování. Řízení nové architektury hluboké falzifikace hledá latentní vektor v předem trénovaném Generative Adversarial Network (GAN), který odpovídá obrazu, který má být transformován – Sim2Real metodika, která navazuje na projekt z roku 2018 z výzkumného oddělení IBM.
Výzkumníci uvádějí:
‘S pouhými několika vzorky, které se liší specifickým atributem, lze naučit rozdělovací chování předem trénovaného spjatého generativního modelu. Není třeba přesně reálných vzorků, aby se dosáhlo tohoto cíle, který nemusí být nutně proveditelný.
‘Používáním nereálných datových vzorků lze dosáhnout stejného cíle, díky využití sémantiky zakódovaných latentních vektorů. Aplikace požadovaných změn na existující datové vzorky lze provést bez explicitního prozkoumání chování latentního prostoru.’
Výzkumníci předpokládají, že základní principy rozdělování prozkoumané v projektu by mohly být přeneseny do jiných oblastí, jako je simulace interiérových architektur, a že Sim2Real metoda přijatá pro Delta-GAN-Encoder by mohla nakonec umožnit instrumentality hluboké falzifikace založené na pouhých náčrtcích, spíše než na CGI vstupu.
Lze tvrdit, že rozsah, v jakém by nový izraelský systém mohl nebo nemusel syntetizovat hluboké falzifikační videa, je mnohem méně významný než pokrok, kterého výzkum dosáhl v rozdělování kontextu z identity, a tím získal větší kontrolu nad latentním prostorem GAN.
Rozdělování je aktivní oblastí výzkumu v oblasti syntézy obrazu; v lednu 2021 demonstroval výzkum vedený Amazonem podobnou kontrolu pózy a rozdělování, a v roce 2018 výzkum z Shenzhen Institutes of Advanced Technology na Čínské akademii věd dosáhl pokroku ve generování libovolných pohledů v GAN.













