Andersonův úhel

Konsistentní editace videa s umělou inteligencí s textově vedeným vstupem

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Zatímco profesionální komunita VFX je fascinována – a občas se cítí trochu ohrožena – novými inovacemi v oblasti syntézy obrazu a videa, nedostatek temporální kontinuity ve většině projektů video editace založených na umělém inteligenci je odsuzuje do sféry “psychedelických” efektů, s lesknoucími se a rychle se měnícími texturami a strukturami, nekonzistentními efekty a hrubou technologickou manipulací, která připomíná photochemickou éru vizuálních efektů.

Pokud chcete změnit něco velmi specifického ve videu, co nespadá do kategorie deepfake (tj. vnucení nové identity na existující záběr osoby), většina současných řešení funguje pod quite přísnými omezeními, pokud jde o přesnost vyžadovanou pro produkční kvalitu vizuálních efektů.

Jednou z výjimek je pokračující práce volného sdružení akademiků z Weizmannova institutu věd. V roce 2021 tři z jeho výzkumníků, ve spolupráci s Adobe, oznámili novou metodu pro rozložení videa a aplikaci konzistentní vnitřní mapy – vrstevnatý neuronový atlas – do komponovaného výstupu, včetně alfa kanálů a temporálně soudržného výstupu.

Z publikace z roku 2021: odhad úplného průjezdu silnice ve zdrojovém klipu je editován pomocí neuronové sítě způsobem, který by tradičně vyžadoval rozsáhlé rotoskopování a match-moving. Díky tomu, že jsou pozadí a popředí zpracovávána samostatnými sítěmi, jsou masky skutečně 'automatické'.

Z publikace z roku 2021: odhad úplného průjezdu silnice ve zdrojovém klipu je editován pomocí neuronové sítě způsobem, který by tradičně vyžadoval rozsáhlé rotoskopování a match-moving. Díky tomu, že jsou pozadí a popředí zpracovávána samostatnými sítěmi, jsou masky skutečně ‘automatické’. Source: https://layered-neural-atlases.github.io/

Ačkoli se tato metoda částečně překrývá s optickým tokem ve VFX pipeline, vrstevnatý atlas nemá přímý ekvivalent v tradičních CGI postupech, protože se jedná o “temporální texturovou mapu”, která může být produkována a editována pomocí tradičních softwarových metod. Ve druhé obrazové ukázce výše je pozadí silnice reprezentováno (figurativně) po celou dobu běhu videa. Změna této základní obrazovky (třetí obraz zleva) produkuje konzistentní změnu v pozadí.

Obrazy “rozvinutého” atlasu výše reprezentují pouze jednotlivé interpretované snímky; konzistentní změny v jakémkoli cílovém snímku jsou mapovány zpět na původní snímek, přičemž jsou zachovány všechny nutné zakrytí a další požadované efekty scény, jako jsou stíny nebo odrazy.

Jádro architektury používá Multilayer Perceptron (MLP) pro reprezentaci rozvinutých atlasů, alfa kanálů a map, které jsou všechny optimalizovány současně a zcela ve 2D prostoru, čímž se eliminuje potřeba předchozí znalosti 3D geometrie, hloubkových map a podobných CGI-style atributů.

Referenční atlas jednotlivých objektů lze také spolehlivě změnit:

Konzistentní změna pohyblivého objektu v rámci rámce z roku 2021.

Konzistentní změna pohyblivého objektu v rámci rámce z roku 2021. Source: https://www.youtube.com/watch?v=aQhakPFC4oQ

V podstatě systém z roku 2021 kombinuje geometrické zarovnání, match-moving, mapování, re-texturizaci a rotoskopování do diskrétního neuronového procesu.

Text2Live

Tři původní autoři publikace z roku 2021, společně s NVIDIA Research, jsou mezi přispěvateli nové inovace techniky, která kombinuje sílu vrstevnatých atlasů s textově vedenou CLIP technologií, která se opět stala populární touto týden s vydáním DALL-E 2 frameworku.

Nová architektura, nazvaná Text2Live, umožňuje koncovému uživateli vytvářet lokalizované úpravy skutečného videoobsahu na základě textových vstupů:

Dva příklady editace popředí. Pro lepší rozlišení a definici se podívejte na původní videa na https://text2live.github.io/sm/pages/video_results_atlases.html

Dva příklady editace popředí. Pro lepší rozlišení a definici se podívejte na původní videa na https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live nabízí sémantickou a vysoce lokalizovanou editaci bez použití předem trénovaného generátoru, a to díky využití interní databáze specifické pro video klip, který je ovlivněn.

Transformace pozadí a popředí (objektu) v Text2Live. Source: https://text2live.github.io/sm/pages/video_results_atlases.html

Transformace pozadí a popředí (objektu) v Text2Live. Source: https://text2live.github.io/sm/pages/video_results_atlases.html

Technika nevyžaduje uživatelsky poskytované masky, jako je typické rotoskopování nebo green-screen workflow, ale spíše odhaduje relevancy mapy pomocí bootstrap techniky založené na výzkumu z roku 2021 ze Školy počítačových věd na Telavivské univerzitě a Facebook AI Research (FAIR).

Výstupní mapy generované pomocí transformer-based generic attention modelu.

Výstupní mapy generované pomocí transformer-based generic attention modelu.

Nová publikace je nazvaná Text2LIVE: Text-Driven Layered Image and Video Editing. Původní tým z roku 2021 je doplněn Omerem Bar-Talem z Weizmannova institutu a Yoni Kastenem z NVIDIA Research.

Architektura

Text2Live se skládá z generátoru trénovaného na jediném vstupním obraze a cílových textových vstupů. Model CLIP (Contrastive Language-Image Pretraining) předtrénovaný na 400 milionech textových a obrazových párů poskytuje související vizuální materiál, ze kterého lze interpretovat uživatelské transformace.

Generátor přijímá vstupní obraz (snímek) a produkuje cílovou RGBA vrstvu obsahující barevnou a průhlednostní informaci. Tato vrstva je poté komponována do původního footage s dalšími augmentacemi.

Alfa kanál v generované RGBA vrstvě poskytuje interní kompozitní funkci bez nutnosti tradičních pipeline, které zahrnují pixel-based software, jako je After Effects.

Alfa kanál v generované RGBA vrstvě poskytuje interní kompozitní funkci bez nutnosti tradičních pipeline, které zahrnují pixel-based software, jako je After Effects.

Příslušná trénink na interních obrazech relevantních pro cílové video nebo obraz umožňuje Text2Live vyhnout se požadavku na inverzi vstupního obrazu do latentního prostoru Generative Adversarial Network (GAN), což je postup, který je v současné době daleko od dostatečně přesného pro požadavky produkční video editace, nebo použití modelu difuze, který je přesnější a konfigurovatelnější, ale nelze udržet věrnost cílovému videu.

Různé transformace založené na vstupních proměnných z Text2Live.

Různé transformace založené na vstupních proměnných z Text2Live.

Předchozí přístupy používaly buď propagační metody nebo optický tok. Tyto techniky jsou zčásti založeny na snímcích a nejsou schopny vytvořit konzistentní temporální vzhled změn ve výstupním videu. Neuronový vrstevnatý atlas poskytuje jediný prostor, ve kterém lze řešit změny, které mohou zůstat věrné provedené změně, jakmile video postupuje.

Žádné 'sizzling' nebo náhodné halucinace: Text2Live získá interpretaci textového vstupu 'rusty jeep' a aplikuje ji jednou na neuronový vrstevnatý atlas auta ve videu, místo aby restartoval transformaci pro každý interpretovaný snímek.

Žádné ‘sizzling’ nebo náhodné halucinace: Text2Live získá interpretaci textového vstupu ‘rusty jeep’ a aplikuje ji jednou na neuronový vrstevnatý atlas auta ve videu, místo aby restartoval transformaci pro každý interpretovaný snímek.

Pracovní postup Text2Live pro konzistentní transformaci Jeepu na rezavý relikt.

Pracovní postup Text2Live pro konzistentní transformaci Jeepu na rezavý relikt.

Text2Live je blíže k průlomu v AI-založené kompozici než v úrodném prostoru text-to-image, který získal tolik pozornosti touto týden s vydáním druhé generace frameworku DALL-E (který může zahrnovat cílové obrázky jako součást transformačního procesu, ale zůstává omezený ve své schopnosti přímo zasahovat do fotografie, kromě cenzury zdrojových trénovacích dat a uvalení filtrů, navržených k prevenci zneužití uživatelů).

Rather, Text2Live umožňuje koncovému uživateli extrahovat atlas a poté jej upravit v jednom kroku v prostředí s vysokou kontrolou, jako je Photoshop (a možná ještě abstraktnější rámce pro syntézu obrazu, jako je NeRF), a poté jej vrátit do správně orientovaného prostředí, které však nezávisí na 3D odhadu nebo zpětném CGI-založeném přístupu.

Navíc, Text2Live, podle tvrzení autorů, je první srovnatelný rámec, který dosáhl maskování a kompozice zcela automaticky.

 

Poprvé publikováno 7. dubna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai