Andersonův úhel
Přidání dialogu do skutečného videa pomocí AI

Nový framework AI může přepisovat, odstraňovat nebo přidávat slova osoby ve videu bez opětovného natáčení, v jednom koncovém systému.
Před třemi lety by internet byl šokován jakýmkoli jedním z 20-30 frameworků AI pro úpravu videa, které se publikují na akademických portálech týdně; jak tomu je, tento populární směr výzkumu se stal tak prolific, že téměř tvoří další větev “AI Slop” a pokrývám méně takových vydání než před dvěma nebo třemi lety.
Jedno současné vydání v tomto směru upoutalo mou pozornost: integrovaný systém, který může zasahovat do skutečných videoklipů a vkládat nové řeči do existujícího videa (na rozdíl od vytváření celého generativního klipu z obličeje nebo rámečku, což je mnohem častější).
V následujících příkladech, které jsem sestavil z množství vzorkových videí dostupných na webové stránce projektu, vidíme nejprve skutečný zdrojový klip a poté, pod ním, vloženou řeč AI uprostřed klipu, včetně syntézy hlasu a synchronizace rtů:
Kliknutím se přehraje. Místní úprava se šitím – jedna ze tří modalit nabízených FacEDiT. Prosím, odkážete se na zdroj webové stránky pro lepší rozlišení. Zdroj – https://facedit.github.io/
Tento přístup je jednou ze tří vyvinutých pro novou metodu, nazvanou “místní úprava se šitím”, a je to ta, která nejvíce zajímá autory (stejně jako mě). V podstatě je klip prodloužen pomocí jedné z prostředních rámců jako startovacího bodu pro novou interpretaci AI a jeho následující (skutečné) rámce jako cíle, ke kterému by generovaný vložený klip měl směřovat. V klipech výše uvedených jsou tyto “semenné” a “cílové” rámce reprezentovány tím, že horní video se zastaví, zatímco upravené video níže poskytuje generativní infill.
Autoři rámcují tento přístup k syntéze obličeje a hlasu jako první plně integrovanou metodu pro úpravy videa AI tohoto druhu, přičemž pozorují potenciál plně vyvinutého frameworku tohoto druhu pro produkci TV a filmů:
‘Filmaři a producenti médií často potřebují revidovat specifické části zaznamenaných videí – možná bylo vysloveno špatné slovo nebo scénář se změnil po natáčení. Například v ikonické scéně z Titanicu (1997), kde Rose říká, “I’ll never let go, Jack,” režisér by později mohl rozhodnout, že by to mělo být “I’ll never forget you, Jack”.
‘Tradičně vyžadují takové změny opětovné natáčení celé scény, což je nákladné a časově náročné. Syntéza mluvené tváře nabízí praktickou alternativu automatickým úpravám obličejového pohybu pro shodu s revidovaným projevem, eliminuje potřebu opětovného natáčení.’
Ačkoli úpravy AI tohoto druhu mohou čelit kulturní nebo odvětvové odpor, mohou také tvořit nový typ funkcionality v systémech a nástrojích VFX vedených člověkem. V každém případě, prozatím, jsou výzvy striktně technické.
Kromě prodloužení klipu pomocí dalšího dialogu AI může nový systém také měnit existující řeč:
Kliknutím se přehraje. Příklad změny existujícího dialogu místo vkládání dalšího dialogu. Prosím, odkážete se na zdroj webové stránky pro lepší rozlišení.
Stav umění
V současné době neexistují žádné koncové systémy, které by nabízely tuto syntetickou schopnost; ačkoli rostoucí počet generativních platforem AI, jako je řada Veo, může generovat audio a různé další frameworky mohou vytvářet deepfaked audio, jeden目前 musí vytvořit bastante pipeline různých architektur a triků, aby mohl zasahovat do skutečných záběrů způsobem, jakým může nový systém – nazvaný FacEDiT – dosáhnout.
Systém používá Diffusion Transformers (DiT) v kombinaci s Flow Matching pro vytváření obličejových pohybů podmíněných okolními (kontextovými) pohyby a obsahem řeči. Systém využívá existující populární balíčky, které se zabývají rekonstrukcí obličeje, včetně LivePortrait (nedávno převzatého Klingem).
Kromě této metody, vzhledem k tomu, že jejich přístup je prvním, který integruje tyto výzvy do jediného řešení, autoři vytvořili novou benchmark nazvanou FacEDiTBench, spolu s několika zcela novými vyhodnocovacími metrikami, které jsou vhodné pro tuto velmi specifickou úlohu.
Nová práce se nazývá FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling a pochází od čtyř výzkumníků z Korejské univerzity vědy a technologie (POSTECH), Korejského institutu pokročilých studií (KAIST) a Texaské univerzity v Austinu.
Metoda
FacEDiT je trénován k rekonstrukci obličejového pohybu tím, že se učí, jak vyplnit chybějící části původního výkonu herce, na základě okolního pohybu a řečového audio. Jak je znázorněno v následujícím schématu, tento proces umožňuje modelu fungovat jako gap-filler během trénování, předpovídající obličejové pohyby, které odpovídají hlasu, zatímco zůstává konzistentní s původním videem:

Přehled systému FacEDiT, ukazující, jak je obličejový pohyb naučen prostřednictvím samo-supervizovaného vyplňování během trénování, řízeného editovaným projevem při inferenci a nakonec vykresleného zpět do videa pomocí opětovného použití vzhledu původního záběru, zatímco se nahrazí pouze cílený pohyb. Zdroj
Během inferenční doby podporuje stejná architektura dva různé výstupy v závislosti na tom, kolik videa je maskováno: částečné úpravy, kde se mění pouze věta a zbytek zůstává nedotčen; nebo plná generace věty, kde se zcela syntetizuje nový pohyb.
Model je trénován prostřednictvím flow matching, který považuje úpravy videa za druh cesty mezi dvěma verzemi obličejového pohybu.
Místo toho, aby se model učil hádat, jak by měl vypadat upravený obličej ze scratch, flow matching se učí plynule a hladce pohybovat mezi šumivým placeholderem a správným pohybem. K tomu systém reprezentuje obličejový pohyb jako kompaktní sadu čísel extrahovaných z každého snímku pomocí verze výše uvedeného systému LivePortrait (viz schéma výše).
Tyto pohybové vektory jsou navrženy tak, aby popisovaly výrazy a polohu hlavy bez zamotání identity, aby změny řeči mohly být lokalizovány bez ovlivnění celkového vzhledu osoby.
FacEDiT Trénování
K trénování FacEDiT byl každý videoklip rozdělen na řadu snímků obličejového pohybu a každý snímek spárován s odpovídající částí audio. Náhodné části pohybových dat byly poté skryty a model byl požádán, aby uhádl, jak by měly vypadat tyto chybějící pohyby, pomocí řeči a okolního nezarazeného pohybu pro kontext.
Protože skryté rozpětí a jejich pozice se liší od jednoho tréninkového příkladu k druhému, model postupně učí, jak zvládat malé vnitřní úpravy a delší mezery pro plnou generaci sekvence, v závislosti na tom, kolik informací má k dispozici.
Systémův výše uvedený Diffusion Transformer se učí obnovit maskovaný pohyb tím, že refaktoruje šumivé vstupy v čase. Místo toho, aby se řeč a pohyb vkládaly do modelu najednou, audio se vlákne do každého zpracovatelského bloku prostřednictvím cross-attention, což pomáhá systému lépe sladit pohyby rtů s audio řeči.
K zachování realismu přes úpravy je pozornost omezena na sousední snímky spíše než na celý časový rámec, což nutí model soustředit se na lokální kontinuitu a brání výskytu záblesků nebo skoků pohybu na hranicích upravených oblastí. Položené vložení (které informuje model o tom, kde se každý snímek nachází v sekvenci) dále pomáhá modelu zachovat přirozený temporální tok a kontext.
Během trénování se systém učí předpovídat chybějící obličejový pohyb rekonstrukcí maskovaných rozpětí na základě řeči a okolního nezarazeného pohybu. Během inferenční doby se stejná sada znovu používá, ale s maskami nyní řízenými úpravami v řeči.
Když je vloženo, odstraněno nebo změněno slovo nebo věta, systém lokalizuje postiženou oblast, maskuje ji a regeneruje pohyb, který odpovídá nové audio. Plná generace sekvence je považována za speciální případ, kde je celý region maskován a syntetizován ze scratch.
Data a testy
Základem systému je 22 vrstev pro Diffusion Transformer, každá s 16 pozornostními hlavami a feedforward dimenzemi 1024 a 2024px. Pohybové a vzhledové funkce jsou extrahovány pomocí zmrazených komponent LivePortrait a řeč je zakódována pomocí WavLM a upravena pomocí VoiceCraft.
Vyhrazená projekční vrstva mapuje 786-rozměrné funkce řeči do latentního prostoru DiT, přičemž pouze DiT a projekční moduly jsou trénovány od scratch.
Trénování bylo provedeno pomocí optimalizátoru AdamW s cílovou rychlostí učení 1e-4, po dobu milionu kroků, na dvou GPU A6000 (každá s 48GB VRAM), při celkovém velikosti batche osm.
FacEDiTBench
Datová sada FacEDiTBench obsahuje 250 příkladů, každý s videoklipem původní a upravené řeči a transkripty pro obě. Videoklipy pocházejí ze tří zdrojů, se 100 klipy z HDTF, 100 z Hallo3 a 50 z CelebV-Dub. Každý byl ručně zkontrolován, aby se potvrdilo, že obě audio a video jsou dostatečně jasné pro vyhodnocení.
GPT-4o byl použit k revizi každého transkriptu, aby se vytvořily gramaticky platné úpravy. Tyto revidované transkripty, spolu s původní řečí, byly předány do VoiceCraft, aby se vyrobilo nové audio; a v každém stádiu byly obě transkripty a vygenerované řeči ručně přezkoumány na kvalitu.
Každý vzorek byl označen typem úpravy, časem změny a délkou upraveného rozpětí, a úpravy byly klasifikovány jako vložení, odstranění nebo nahrazení. Počet slov, která se měnila, se pohyboval od krátkých úprav 1-3 slov, středních úprav 4-6 slov a delších úprav 7-10 slov.
Byly definovány tři vlastní metriky pro vyhodnocení kvality úprav. Fotometrická kontinuita, která měří, jak dobře se osvětlují a barvy upraveného segmentu sladí s okolním videem, porovnáním rozdílů na pixelové úrovni na hranicích; pohybová kontinuita, která hodnotí konzistenci obličejového pohybu, měřením změn optického toku přes upravené a neupravené snímky; a zachování identity, která odhaduje, zda vzhled subjektu zůstává konzistentní po úpravě, porovnáním obličejových vložení z původní a generované sekvence pomocí ArcFace modelu rozpoznávání obličeje.
Testy
Testovací model byl trénován na materiálu z výše uvedených tří datových sad, celkem asi 200 hodin videoobsahu, včetně vlogů a filmů, stejně jako vysokorozlišitelných videí z YouTube.
K vyhodnocení úpravy obličeje byla použita datová sada FacEDiTBench, kromě testovacího rozdělení HDTF, které se stalo standardem pro tuto sadu úkolů.
Pokud nebyly přímo srovnatelné systémy, které by mohly zahrnout tuto funkcionality, autoři zvolili řadu frameworků, které reprodukovaly alespoň část cílové funkcionality, a mohly sloužit jako baseline; konkrétně KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; a SadTalker.
Byly použity také several zavedené metriky pro vyhodnocení kvality generování a úpravy, s lip-sync přesností hodnocenou pomocí SyncNet, která hlásí absolutní chybu mezi pohyby rtů a audio (LSE-D) a skóre spolehlivosti (LSE-C); Fréchet Video Distance (FVD) kvantifikující, jak realistické video vypadá celkově; a Learned Perceptual Similarity Metrics (LPIPS), měřící percepční podobnost mezi generovanými a původními snímky.
Pro úpravu byly všechny metriky kromě LPIPS aplikovány pouze na upravený segment; pro generování byla vyhodnocena celá videa, s výjimkou hranic.
Každý model byl požádán, aby syntetizoval odpovídající video segment, který byl poté vložen do původního klipu (výzkumníci poznamenali, že tato metoda často introdukovala viditelné diskontinuity, kde se upravená sekce setkala s okolním záběrem). Byl také otestován druhý přístup, při kterém bylo celé video znovu vygenerováno z upraveného audio – ale tento přístup nevyhnutelně přepsal neupravené oblasti a nezachoval původní výkon:

Srovnání výkonu úpravy napříč systémy původně navržené pro generování obličeje, s FacEDiT, který překonává všechny baseline systémy napříč všemi metrikami, dosahující nižší chyby lip-sync (LSE-D), vyšší spolehlivosti synchronizace (LSE-C), silnějšího zachování identity (IDSIM), větší percepční realismu (FVD) a hladších přechodů přes editační hranice (Pcontinuity, Mcontinuity). Šedě zašuměné sloupce zvýrazňují klíčová kritéria pro hodnocení kvality hranic; tučné a podtržené hodnoty označují nejlepší a druhý nejlepší výsledek, resp.
Pokud jde o tyto výsledky, autoři komentují:
‘[Náš] model významně překonává stávající metody v úkolu úpravy. Dosahuje silné kontinuity hranic a vysoké zachování identity, demonstruje svou schopnost udržet časovou a vizuální konzistenci během úpravy. Kromě toho jeho lepší přesnost lip-sync a nižší FVD odrážejí realističnost syntetizovaného videa.’
Kliknutím se přehraje. Výsledky, sestavené tímto autorem z publikovaných videí na podpůrné webové stránce. Prosím, odkážete se na zdroj webové stránky pro lepší rozlišení.
Dále byl proveden lidský výzkum, aby se vyhodnotila vnímaná kvalita napříč úpravami a generováním.
Pro každou komparaci účastníci viděli šest videí a ohodnotili je podle celkové kvality, zohledňující přesnost lip-sync, přirozenost a realističnost pohybu hlavy:

Průměrné hodnocení přidělené lidskými hodnotiteli, kde nižší znamená lepší. V obou úpravách a generování účastníci hodnotili, jak přirozeně a dobře sladěné vypadalo každé video. Pro úpravu také ohodnotili, jak hladce přecházely upravené a neupravené sekce.
V rámci studie byl FacEDiT konzistentně hodnocen jako nejlepší účastníky s výrazným náskokem, jak pro kvalitu úpravy, tak pro plynulost přechodů, a také obdržel silné skóre v nastavení generování, naznačující, že jeho měřené výhody se překlápějí do percepčně preferovaných výstupů.
Z důvodu omezeného prostoru odkazujeme čtenáře na zdroj článku pro další podrobnosti o studiích a dalších testech, které byly provedeny a hlášeny v nové práci. Ve skutečnosti, prototypové výzkumné nabídky tohoto druhu bojují s generováním smysluplných výsledků testů, protože jádrové nabídky samo o sobě je potenciálně baseline pro pozdější práci.
Závěr
I pro inferenci mohou systémy tohoto druhu vyžadovat významné výpočetní zdroje, což může být pro downstream uživatele – zde zřejmě VFX obchody – problematické, aby udrželi práci na svých místech. Proto budou vždy preferovány přístupy, které lze přizpůsobit realistickým místním zdrojům, které jsou poskytovány poskytovateli, kteří jsou pod legislativní povinností chránit klientovu stopu a obecný IP.
To ale neznamená kritiku nové nabídky, která může fungovat dokonale pod kvantizovanými váhami nebo jinými optimalizacemi, a která je první nabídkou tohoto druhu, která mě přitáhla zpět k této oblasti výzkumu po poměrně dlouhé době.
Poprvé publikováno ve středu, 17. prosince 202. Upraveno 20.10 EET, stejný den, pro extra prostor v prvním těle odstavce.












