Modely a platformy AI
CameraCtrl: Řízení kamery pro generaci videa z textu
Nedávné rámce, které se pokoušejí o generaci videa z textu nebo T2V, využívají modely difuze k přidání stability do svého tréninkového procesu, a Video Diffusion Model, jeden z průkopníků v rámci generace videa z textu, rozšiřuje architekturu difuze 2D obrazu v pokusu o přizpůsobení video dat, a trénuje model na video a obraz společně od začátku. Na základě toho a za účelem implementace silného předtrénovaného generátoru obrazů, jako je Stable Diffusion, nedávné práce inflují svou 2D architekturu tím, že vkládají časové vrstvy mezi předtrénované 2D vrstvy, a doladí nový model na neviditelná velká data. Navzdory jejich přístupu, modely difuze videa z textu čelí významné výzvě, jelikož nejednoznačnost použitého textu k generování vzorku videa často vede k tomu, že model T2V má slabší kontrolu nad generací. Aby se tato omezení překonala, některé modely poskytují lepší vedení, zatímco jiné pracují s přesnými signály pro kontrolu scény nebo pohybů člověka ve syntetizovaných videích přesně. Na druhé straně existuje několik rámců generace videa z textu, které přijímají obrázky jako signál řízení pro generátor videa, což vede k přesnému modelování temporálních vztahů nebo vysoké kvalitě videa.
Bylo by bezpečné říci, že ovladatelnost hraje zásadní roli v úkolech generace obrazů a videa, jelikož umožňuje uživatelům vytvářet obsah, který si přejí. Nicméně, existující rámce často přehlížejí přesnou kontrolu polohy kamery, která slouží jako filmový jazyk pro vyjádření hlubších narativních nuancí modelu lépe. Aby se tato omezení ovladatelnosti překonala, v tomto článku budeme mluvit o CameraCtrl, novém nápadu, který se pokouší umožnit přesnou kontrolu polohy kamery pro modely T2V. Po parametrizaci trajektorie kamery přesně, model trénuje modul kamery, který lze vložit do modelu T2V, a ponechává ostatní komponenty nedotčené. Kromě toho, model CameraCtrl také provádí komplexní studii o účinku různých dat, a navrhuje, že videa se podobnými vzhledy a různorodým rozložením kamery mohou zlepšit celkovou ovladatelnost a generalizaci modelu. Experimenty provedené k analýze výkonu modelu CameraCtrl na reálných úkolech ukazují účinnost rámce při dosahování přesné a doménově adaptivní kontroly kamery, vytvářející cestu pro sledování přizpůsobené a dynamické generace videa z polohy kamery a textových vstupů.
Tento článek si klade za cíl pokrýt rámec CameraCtrl do hloubky, a prozkoumáme mechanismus, metodologii, architekturu rámce spolu s jeho srovnáním se stávajícími rámcemi. Takže pojďme začít.
CameraCtrl: Řízení kamery pro generaci videa z textu
Nedávný vývoj a pokrok modelů difuze významně pokročily v generaci videa z textu v posledních letech, a revolucionalizovaly pracovní postupy návrhu obsahu. Ovladatelnost hraje významnou roli v praktických aplikacích generace videa, jelikož umožňuje uživatelům přizpůsobit generované výsledky podle svých potřeb a požadavků. S vysokou ovladatelností, model je schopen zlepšit realističnost, kvalitu a použitelnost generovaných videí, a zatímco textové a obrazové vstupy jsou běžně používány modely pro zlepšení celkové ovladatelnosti, často postrádají přesnou kontrolu nad pohybem a obsahem. Aby se toto omezení překonalo, některé rámce navrhly využití řídicích signálů, jako je kosterní pozice, optický tok a další multimodální signály, pro umožnění přesnější kontroly pro vedení generace videa. Další omezení stávajících rámců spočívá v tom, že postrádají přesnou kontrolu nad stimulací nebo úpravou bodů kamery v generaci videa, jelikož schopnost kontroly kamery je zásadní, jelikož nejen zlepšuje realističnost generovaných videí, ale také umožňuje přizpůsobené výhledy, což je funkce, která je essenciální v herním vývoji, rozšířené realitě a virtuální realitě. Kromě toho, řízení pohybů kamery umožňuje tvůrcům zdůraznit vztahy mezi postavami, zdůraznit emoce a vést pozornost cílového publika, což je něco velmi důležitého ve filmovém a reklamním průmyslu.
Aby se tato omezení překonala, rámec CameraCtrl, učitelný a přesný modul kamery, který lze vložit do stávajícího modelu T2V, a umožňuje kontrolu výhledů kamery pro generaci videa. Nicméně, integrace přizpůsobené kamery do stávajícího modelu T2V není jednoduchým úkolem, a rámec CameraCtrl musí najít způsoby, jak reprezentovat a vložit kameru do architektury modelu účinně. V tomto smyslu, rámec CameraCtrl přijímá pluckerovy vložky jako primární formu parametrů kamery, a důvodem pro výběr pluckerových vložek je jejich schopnost kódovat geometrické popisy informací o poloze kamery. Kromě toho, aby se zajistila obecná použitelnost a aplikovatelnost modelu CameraCtrl po tréninku, model zavádí model kontroly kamery, který přijímá pouze pluckerovy vložky jako vstup. Aby se zajistilo, že model kontroly kamery je trénován účinně, rámec a jeho vývojáři provádějí komplexní studii, aby prozkoumali, jak různé tréninkové data ovlivňují rámec od syntetických až po realistická data. Experimentální výsledky ukazují, že implementace dat s různorodým rozložením polohy kamery a podobným vzhledem k původnímu základnímu modelu dosahuje nejlepšího kompromisu mezi ovladatelností a generalizací. Vývojáři rámce CameraCtrl implementovali model na základě rámce AnimateDiff, a tím umožnili přesnou kontrolu v generaci videa napříč různými personalizovanými kontexty, demonstrujíce jeho všestrannost a užitečnost v širokém spektru kontextů tvorby videa.

Rámec AnimateDiff přijímá efektivní přístup jemného doladění LoRA, aby získal váhy modelu pro různé typy záběrů. Rámec Direct-a-video navrhuje implementovat vložku kamery pro kontrolu polohy kamery během procesu generace videa, ale podmíněně pouze na tři parametry kamery, omezující schopnost kontroly kamery na základní typy. Na druhé straně, rámce, jako je MotionCtrl, navrhuje návrh kontroléru pohybu, který přijímá více než tři vstupní parametry a je schopen produkovat videa s komplexnějšími polohami kamery. Nicméně, potřeba jemného doladění částí generovaných videí brání obecné použitelnosti modelu. Kromě toho, některé rámce inkorporují další strukturální signály řízení, jako jsou hloubkové mapy, do procesu, aby zlepšily ovladatelnost pro generaci obrazů a textu. Typicky, model krmí tyto signály řízení do dalšího kódéru a poté vkládá signály do generátoru pomocí různých operací.
CameraCtrl: Architektura modelu
Než budeme moci prozkoumat architekturu a tréninkový paradigm pro kódér kamery, je důležité pro nás pochopit různé reprezentace kamery. Typicky, poloha kamery odkazuje na vnitřní a vnější parametry, a jednou z přímých voleb, aby video generátor podmíněně přijal polohu kamery, je krmit surové hodnoty týkající se parametrů kamery do generátoru. Nicméně, implementace takového přístupu nemusí zlepšit přesnou kontrolu kamery z několika důvodů. Za prvé, zatímco rotační matice je omezena ortogonality, translace vektoru je typicky neomezená v velikosti, a vede k nesouladu v procesu učení, který může ovlivnit konzistenci kontroly. Za druhé, použití surových parametrů kamery přímo může udělat obtížné pro model, aby koreloval tyto hodnoty s pixely obrazu, vedoucí k snížení kontroly nad vizuálními detaily. Aby se tato omezení překonala, rámec CameraCtrl zvolil pluckerovy vložky jako reprezentaci polohy kamery, jelikož pluckerovy vložky mají geometrické reprezentace každé pixelové informace videa, a mohou poskytnout podrobnější popis informací o poloze kamery.
Ovladatelnost kamery ve generátorech videa
Jakmile model parametrizuje trajektorii kamery do sekvence pluckerových vložek, tj. prostorových map, model má možnost použít kódér pro extrakci funkcí kamery, a poté sloučit funkce kamery do generátoru videa. Podobně jako text-to-image adaptér, model CameraCtrl zavádí kódér kamery speciálně navrženého pro videa. Kódér kamery zahrnuje temporální pozornostní model po každém konvolučním bloku, umožňující mu zachytit temporální vztahy poloh kamery během celého video klipu. Jak je demonstrováno v následujícím obrázku, kódér kamery přijímá pouze vstup pluckerových vložek a dodává multi-škálové funkce. Po získání multi-škálových funkcí kamery, model CameraCtrl se snaží integrovat tyto funkce do architektury U-Net modelu T2V bezproblémově, a určuje vrstvy, které by měly být použity pro efektivní integraci informací kamery. Kromě toho, jelikož většina stávajících rámců přijímá architekturu podobnou U-Net, která obsahuje jak temporální, tak prostorové pozornostní vrstvy, model CameraCtrl vkládá reprezentace kamery do temporální pozornostní vrstvy, rozhodnutí, které je podporováno schopností temporální pozornostní vrstvy zachytit temporální vztahy, které se shodují s vnitřní kauzální a sekvenční povahou trajektorie kamery se prostorovými pozornostními vrstvami, které zobrazují jednotlivé snímky.

Učení distribucí kamery
Trénink komponenty kódéru kamery v rámci rámce CameraCtrl na generátoru videa vyžaduje velké množství dobře označených a anotovaných videí, s modelem, který je schopen získat trajektorii kamery pomocí přístupu Structure from Motion nebo SfM. Rámec CameraCtrl se snaží vybrat data s vzhledy, které se shodují s tréninkovými daty základního modelu T2V, a mít rozložení polohy kamery co nejširší. Vzorky v datech generované pomocí virtuálních motorů vykazují různorodé rozložení kamery, jelikož vývojáři mají flexibilitu kontrolovat parametry kamery během fáze renderingu, ačkoli trpí rozdílem v rozložení ve srovnání s daty obsahujícími reálné vzorky. Při práci s daty obsahujícími reálné vzorky, rozložení kamery je obvykle úzké, a v takových případech, rámec potřebuje najít rovnováhu mezi rozmanitostí různých trajektorií kamery a složitostí jednotlivých trajektorií kamery. Složitost jednotlivých trajektorií kamery zajišťuje, že model učí kontrolu komplexních trajektorií během tréninkového procesu, zatímco rozmanitost různých trajektorií kamery zajišťuje, že model se nezapouští do určitých pevných vzorců. Kromě toho, aby se monitoroval tréninkový proces kódéru kamery, rámec CameraCtrl navrhuje metriku zarovnání kamery, aby měřil kvalitu kontroly kamery, kvantifikující chybu mezi trajektorií kamery generovaných vzorků a vstupními podmínkami kamery.
CameraCtrl: Experimenty a výsledky
Rámec CameraCtrl implementuje model AnimateDiff jako svůj základní model T2V, a hlavní důvod pro toto je, že tréninková strategie modelu AnimateDiff umožňuje jeho motion modulu integrovat se s modelem text-to-image nebo text-to-image LoRAs, aby umožnil generaci videa napříč různými žánry a doménami. Model používá optimalizátor Adam pro trénink modelu s konstantní rychlostí učení 1e-4. Kromě toho, aby se zajistilo, že model neovlivní negativně generaci videa původního modelu T2V, rámec CameraCtrl využívá metriku FID nebo Frechet Inception Distance, aby zhodnotil kvalitu vzhledu videa, a porovná kvalitu generovaného videa před a po zahrnutí modulu kamery.
Aby se zhodnotila jeho výkonnost, rámec CameraCtrl je porovnán se dvěma stávajícími rámci kontroly kamery: MotionCtrl a AnimateDiff. Nicméně, jelikož rámec AnimateDiff podporuje pouze osm základních trajektorií kamery, porovnání mezi CameraCtrl a AnimateDiff je omezeno na tři základní trajektorie. Na druhé straně, pro porovnání s MotionCtrl, rámec vybírá více než tisíc náhodných trajektorií kamery z existujícího datasetu, kromě základních trajektorií kamery, generuje videa pomocí těchto trajektorií a hodnotí je pomocí metrik TransErr a RotErr.

Jak je patrné, rámec CameraCtrl překonává rámec AnimateDiff v základní trajektorii, a dodává lepší výsledky ve srovnání s rámcem MotionCtrl na metriku komplexní trajektorie.
Kromě toho, následující obrázek demonstruje efekt architektury kódéru kamery na celkovou kvalitu generovaných vzorků. Řádek a až řádek d reprezentují výsledky generované s kódérem kamery implementovaným v architektuře: ControlNet, ControlNet s temporální pozorností, T2I Adaptor a T2I adaptér s temporální pozorností.

V následujícím obrázku, první dva snímky zobrazují video generované pomocí kombinace RGB kódéru rámce SparseCtrl a metody použitelné v rámci CameraCtrl.

Závěrečné myšlenky
V tomto článku, jsme mluvili o CameraCtrl, novém nápadu, který se pokouší umožnit přesnou kontrolu polohy kamery pro modely T2V. Po parametrizaci trajektorie kamery přesně, model trénuje modul kamery, který lze vložit do modelu T2V, a ponechává ostatní komponenty nedotčené. Kromě toho, model CameraCtrl také provádí komplexní studii o účinku různých dat, a navrhuje, že videa se podobnými vzhledy a různorodým rozložením kamery mohou zlepšit celkovou ovladatelnost a generalizaci modelu. Experimenty provedené k analýze výkonu modelu CameraCtrl na reálných úkolech ukazují účinnost rámce při dosahování přesné a doménově adaptivní kontroly kamery, vytvářející cestu pro sledování přizpůsobené a dynamické generace videa z polohy kamery a textových vstupů.












