Andersonův úhel

RigNeRF: Nová metoda deepfakes, která využívá neuronové radiance fields

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum vyvinutý v Adobe nabízí první životaschopnou a efektivní metodu deepfakes založenou na Neuronových radiance fields (NeRF) – možná první skutečnou inovaci v architektuře nebo přístupu za pět let od vzniku deepfakes v roce 2017.

Metoda, nazvaná RigNeRF, využívá 3D morfabilní modely obličeje (3DMMs) jako mezilehlou vrstvu instrumentality mezi požadovaným vstupem (tj. identitou, která má být vložena do NeRF renderu) a neuronovým prostorem, metodu, která byla široce přijata v posledních letech generativními adversními sítěmi (GAN) pro syntézu obličeje, žádné z nich však dosud nevytvořily funkční a užitečné rámce pro nahrazování obličeje ve videu.

Z dodatkového materiálu nové práce je vidět 3D morfabilní model obličeje (3DMM) jako rozhraní mezi 70 sekundami reálného footage pořízeného ze smartphonu, které tvoří trénovací dataset, a obvykle statickými parametry Neuronového radiance field vizualizace. Pro vysokorozlišenou verzi tohoto klipu, spolu s mnoha dalšími, navštivte projektovou stránku nebo vložené videa na konci tohoto článku. Zdroj: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

Naproti tomu tradiční deepfake videa, absolutně žádný pohybující se obsah zobrazený zde není ‘reálný’, ale spíše je prozkoumatelný neuronový prostor, který byl trénován na krátkém footage. Na pravé straně vidíme 3D morfabilní model obličeje (3DMM) jako rozhraní mezi požadovanými manipulacemi (‘úsměv’, ‘dívej se doleva’, ‘dívej se nahoru’ atd.) a obvykle nesnesitelnými parametry Neuronového radiance field vizualizace. Pro vysokorozlišenou verzi tohoto klipu, spolu s dalšími příklady, navštivte projektovou stránku, nebo vložené videa na konci tohoto článku. Zdroj: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

3DMMs jsou efektivní CGI modely obličeje, jejichž parametry lze přizpůsobit více abstraktním systémům obrazové syntézy, jako je NeRF a GAN, které jsou jinak obtížně ovladatelné.

Co vidíte na obrázku výše (střední obrázek, muž v modré košili), stejně jako na obrázku přímo níže (levý obrázek, muž v modré košili), není ‘reálné’ video, do kterého byl vložen malý patch ‘falešného’ obličeje, ale zcela syntetizovaná scéna, která existuje pouze jako volumetrická neuronová renderace – včetně těla a pozadí:

V příkladu přímo výše je reálné video na pravé straně (žena v červeném šatu) použito k ‘loutkování’ zachycené identity (muž v modré košili) na levé straně pomocí RigNeRF, který (autoři tvrdí) je první NeRF-založený systém, který dosáhl oddělení postoje a výrazu a současně může provádět novou syntézu pohledů.

Mužská postava vlevo na obrázku výše byla ‘zachycena’ z 70sekundového smartphonového videa, a vstupní data (včetně celé scény) byly následně trénovány na 4 V100 GPU, aby se získala scéna.

Pokud jsou 3DMM-style parametrické proxy dostupné jako celé tělo parametrické CGI proxy (a not only obličejové proxy), RigNeRF potenciálně otevírá možnost plných deepfakes, kde skutečný lidský pohyb, textura a výraz jsou předány do CGI-založené parametrické vrstvy, která by poté přeložila akci a výraz do renderovaných NeRF prostředí a videí.

Co se týče RigNeRF – kvalifikuje se jako metoda deepfakes ve smyslu, jak jej chápou aktuální titulky? Nebo je to jen další polo-hybný také-ran k DeepFaceLab a jiným laboriosním, z roku 2017, autoencoder deepfake systémům?

Noví výzkumníci jsou neambivalentní v tomto bodě:

‘Jedná se o metodu, která je schopna reanimovat obličeje, RigNeRF je náchylná k zneužití špatnými aktéry pro generování deep-fakes.’

Nová práce je nazvaná RigNeRF: Fully Controllable Neural 3D Portraits, a pochází od ShahRukh Athara z Univerzity Stonybrook, stážisty v Adobe během vývoje RigNeRF, a čtyř dalších autorů z Adobe Research.

Mimo autoencoder-založené deepfakes

Většina virálních deepfakes, které získaly pozornost v posledních letech, je produkována autoencoder-založenými systémy, odvozenými z kódu, který byl zveřejněn na zakázáném subredditu r/deepfakes v roce 2017 – ačkoli ne dříve, než byl zkopírován do GitHubu, kde byl目前 forkován více než tisíc krát, nejméně do populární (ačkoli kontroverzní) DeepFaceLab distribuce, a také FaceSwap projekt.

Kromě GAN a NeRF autoencoderové rámce také experimentovaly s 3DMMs jako ‘průvodci’ pro vylepšené syntézy obličeje. Příkladem je HifiFace projekt z července 2021. Nicméně, žádné použitelné nebo populární iniciativy se zdají být vyvinuty z tohoto přístupu do současnosti.

Data pro scény RigNeRF jsou získány zachycením krátkých smartphonových videí. Pro projekt výzkumníci RigNeRF použili iPhone XR nebo iPhone 12 pro všechny experimenty. Pro první polovinu zachycení je subjekt požádán, aby provedl širokou škálu obličejových výrazů a řeči, zatímco drží hlavu stále, jako kamera se pohybuje kolem nich.

Pro druhou polovinu zachycení kamera udržuje pevnou pozici, zatímco subjekt musí pohybovat hlavou kolem, zatímco projevuje širokou škálu výrazů. Výsledné 40-70 sekund footage (přibližně 1200-2100 snímků) představuje celý dataset, který bude použit pro trénování modelu.

Snižování množství dat

Naopak, autoencoderové systémy, jako je DeepFaceLab, vyžadují relativně pracné shromažďování a kurátorství tisíců rozmanitých fotografií, často pořízených z YouTube videí a dalších sociálních médií, jakož i z filmů (v případě deepfakes celebrit).

Výsledné trénované autoencoderové modely jsou často určeny k použití v různých situacích. Nicméně, nejpečlivější ‘celebrity’ deepfakers mohou trénovat celé modely od začátku pro jeden video, navzdory skutečnosti, že trénování může trvat týden nebo déle.

Navzdory varovnému poznámce z nové práce výzkumníků, ‘patchwork’ a široce shromážděné datasety, které pohánějí AI porn a populární YouTube/TikTok ‘deepfake recastings’, se zdají nepravděpodobné, že by produkovaly přijatelné a konzistentní výsledky v deepfake systému, jako je RigNeRF, který má scénář-specifickou metodologii. Vzhledem k omezením na zachycení dat uvedeným v nové práci, to může prokázat, do jisté míry, další pojistku proti neoprávněnému zneužití identity špatnými deepfakers.

Přizpůsobení NeRF pro deepfake video

NeRF je fotogrammetrická metoda, ve které je malý počet zdrojových obrázků pořízených z různých úhlů sestaven do prozkoumatelného 3D neuronového prostoru. Tento přístup získal na popularitě na začátku tohoto roku, kdy NVIDIA představila svůj Instant NeRF systém, schopný snížit enormní trénovací časy pro NeRF na minuty, nebo dokonce sekundy:

Instant NeRF. Zdroj: https://www.youtube.com/watch?v=DJ2hcC1orc4

Výsledná Neuronová radiance field scéna je esenciálně statické prostředí, které lze prozkoumat, ale které je obtížné editovat. Výzkumníci poznamenávají, že dvě předchozí NeRF-založené iniciativy – HyperNeRF + E/P a NerFACE – se pokusily o syntézu obličeje ve videu, a (zdá se pro úplnost a pilnost) nastavily RigNeRF proti těmto dvěma rámcům v testovacím kole:

Instant NeRF. Zdroj: https://www.youtube.com/watch?v=DJ2hcC1orc4

Kvalitativní srovnání mezi RigNeRF, HyperNeRF a NerFACE. Pro vyšší kvalitu verzí navštivte odkazy na zdrojová videa a PDF. Statický zdroj obrázku: https://arxiv.org/pdf/2012.03065.pdf

Kvalitativní srovnání mezi RigNeRF, HyperNeRF a NerFACE. Pro vyšší kvalitu verzí navštivte odkazy na zdrojová videa a PDF. Statický zdroj obrázku: https://arxiv.org/pdf/2012.03065.pdf

Nicméně, v tomto případě výsledky, které favorizují RigNeRF, jsou poměrně anomální, z dvou důvodů: poprvé, autoři poznamenávají, že ‘neexistuje žádný stávající práce pro apple-to-apple srovnání’; za druhé, to vyžadovalo omezení schopností RigNeRF, aby alespoň částečně odpovídaly více omezené funkčnosti předchozích systémů.

Jelikož výsledky nejsou.incrementálním zlepšením předchozích prací, ale spíše ‘průlomem’ v editovatelnosti a užitnosti NeRF, ponecháme testovací kolo stranou, a místo toho se podíváme, co RigNeRF dělá jinak než jeho předchůdci.

Kombinované síly

Primární omezení NerFACE, které může vytvářet kontrolu postoje a výrazu v NeRF prostředí, spočívá v tom, že předpokládá, že zdrojový footage bude zachycen statickou kamerou. To efektivní znamená, že nemůže produkovat nové pohledy, které překračují jeho zachycení omezení. To produkuje systém, který může vytvářet ‘pohyblivé portréty’, ale který je nevhodný pro deepfake-styl video.

HyperNeRF, na druhé straně, zatímco schopný generovat nové a hyper-reálné pohledy, nemá žádný instrument, který by umožňoval změnit hlavu postoje nebo obličejové výrazy, což opět nevede k žádnému konkurentovi pro autoencoder-založené deepfakes.

RigNeRF je schopný kombinovat tyto dvě izolované funkcionality vytvořením ‘kanonického prostoru’, výchozího bodu, od kterého lze provádět odchylky a deformace pomocí vstupu z 3DMM modulu.

Vytvoření 'kanonického prostoru' (žádný postoj, žádný výraz), na kterém lze provádět deformace (tj. postoje a výrazy) vytvořené pomocí 3DMM.

Vytvoření ‘kanonického prostoru’ (žádný postoj, žádný výraz), na kterém lze provádět deformace (tj. postoje a výrazy) vytvořené pomocí 3DMM.

Pokud 3DMM systém nebude přesně odpovídat zachycenému subjektu, je důležité kompenzovat to v procesu. RigNeRF dosahuje tohoto pomocí deformace pole předem vypočteného z Multilayer Perceptron (MLP) odvozeného ze zdrojového footage.

Kamerové parametry nezbytné pro výpočet deformací jsou získány pomocí COLMAP, zatímco parametry výrazu a tvaru pro každou snímku jsou získány z DECA.

Pozice je dále optimalizována pomocí landmark fitting a COLMAP kamerových parametrů, a, z důvodu omezení výpočetních zdrojů, výstup videa je downsamplován na 256×256 rozlišení pro trénování (hardware-omezený proces, který také postihuje autoencoder deepfaking scénu).

Po tomto je deformace sítě trénována na čtyřech V100s – formidabilním hardwaru, který není pravděpodobně dostupný pro běžné nadšence (nicméně, kde je machine learning trénování dotčeno, je často možné obchodovat heft za čas, a prostě přijmout, že model trénování bude záležitostí dnů nebo dokonce týdnů).

Závěrem, výzkumníci uvádějí:

‘Na rozdíl od ostatních metod, RigNeRF, díky použití 3DMM-váděného deformního modulu, je schopen modelovat hlavu-postoj, obličejové výrazy a celý 3D portrét scény s vysokou věrností, a tak poskytuje lepší rekonstrukce s ostrými detaily.’

Viz vložená videa níže pro další podrobnosti a výsledky footage.

 

 

První publikace 15. června 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai