Andersonův úhel

Proč umělá inteligence pro videa někdy funguje opačně

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Pokud rok 2022 byl rokem, kdy generativní umělá inteligence zaujala širší veřejnost, rok 2025 je rokem, kdy nová generace generativních videí z Číny se zdá být připravena udělat totéž.

Tencentova Hunyuan Video udělala velký dopad na komunitu hobbyistů AI s otevřeným vydáním plnohodnotného modelu video difuze, který uživatelé mohou přizpůsobit podle svých potřeb.

Na její paty jde Alibaba s nedávným vydáním Wan 2.1, jedním z nejvýkonnějších image-to-video FOSS řešení této periody – nyní podporujícím přizpůsobení prostřednictvím Wan LoRAs.

Kromě dostupnosti nedávného lidského centrického základního modelu SkyReels, v době psaní tohoto článku také čekáme na vydání Alibaba komplexního video editoru VACE:

Kliknutím se spustí. Příští vydání Alibaba multi-funkční AI-editační sady VACE vzrušilo uživatelskou komunitu. Source: https://ali-vilab.github.io/VACE-Page/

Náhle dopadu

Scéna generativního videa AI výzkumu sama o sobě není o nic méně explozivní; je stále první polovina března a úterý předchozích odesláních do sekce Computer Vision na Arxiv (centrum pro generativní AI články) přišlo na téměř 350 položek – číslo, které je více spojeno s vrcholem konferenční sezóny.

Dva roky od spuštění Stable Diffusion v létě 2022 (a následného vývoje Dreambooth a LoRA metody přizpůsobení) byly charakterizovány nedostatkem dalších významných vývojů, až do posledních několika týdnů, kdy nové vydání a inovace postupují takovým tempem, že je téměř nemožné zůstat informován, natož pokrýt vše.

Video difuzní modely, jako je Hunyuan a Wan 2.1, vyřešily, konečně, a po letech neúspěšných pokusů z hundreds výzkumných iniciativ, problém temporální konzistence v souvislosti s generováním lidí a do značné míry také prostředí a objektů.

Existuje málo pochyb o tom, že VFX studia目前 aplikují personál a zdroje na přizpůsobení nových čínských video modelů pro řešení okamžitých problémů, jako je face-swapping, navzdory současné absenci ControlNet-style pomocných mechanismů pro tyto systémy.

Je to taková úleva, že jeden takový významný problém byl potenciálně překonán, byť ne cestami, které se očekávaly.

Mezi problémy, které zůstávají, tento jeden není zanedbatelný:

Kliknutím se spustí. Založeno na promptu ‘Malý kámen se kutálí po strmém, skalnatém svahu, vytlačuje půdu a malé kameny ‘, Wan 2.1, který dosáhl nejvyšších skóre v novém článku, udělal jednu jednoduchou chybu. Source: https://videophy2.github.io/

Vzhůru po kopci

Všechny text-to-video a image-to-video systémy目前 dostupné, včetně komerčních uzavřených modelů, mají tendenci produkovat fyzické chyby, jako je ten výše, kde video ukazuje kámen, který se kutálí vzhůru, založeno na promptu ‘Malý kámen se kutálí po strmém, skalnatém svahu, vytlačuje půdu a malé kameny ‘.

Jedna teorie, proč se to děje, nedávno navržená v akademické spolupráci mezi Alibaba a UAE, je, že modely se vždy učí na samostatných obrazech, v jistém smyslu, i když se učí na videích (která se zapisují do samostatných sekvencí pro účely trénování); a nemusí nutně naučit správný temporální řád ‘před’ a ‘po’ obrázků.

Však nejpravděpodobnější řešení je, že modely v otázce použily data augmentation rutiny, které zahrnují vystavení zdrojového tréninkového klipu modelu jak dopředu a dozadu, efektivní zdvojnásobení tréninkových dat.

Je známo, že by se to nemělo dělat libovolně, protože některé pohyby fungují v opačném směru, ale mnohé ne. Studie z roku 2019 z britské Univerzity v Bristolu se snažila vyvinout metodu, která by mohla rozlišit ekvivalentní, invariantní a nevratné zdrojové video klipy, které existují v jednom datasetu (viz obrázek níže), s myšlenkou, že nevhodné zdrojové klipy by mohly být filtrovány z datových augmentačních rutin.

Příklady tří typů pohybů, z nichž pouze jeden je volně reverzibilní a zachovává fyzicky důvěryhodnou dynamiku. Source: https://arxiv.org/abs/1909.09422

Příklady tří typů pohybů, z nichž pouze jeden je volně reverzibilní a zachovává fyzicky důvěryhodnou dynamiku. Source: https://arxiv.org/abs/1909.09422

Autoři této práce jasně formulují problém:

‘Zjistili jsme, že realističnost reverzních videí je zrazena reverzními artefakty, aspekty scény, které by nebyly možné v přirozeném světě. Některé artefakty jsou jemné, zatímco jiné jsou snadno rozpoznatelné, jako reverzní ‘házení’ akce, kde házený objekt spontánně vystoupí z podlahy.

‘Pozorujeme dva typy reverzních artefaktů, fyzické, které vykazují porušení zákonů přírody, a nepravděpodobné, které zobrazují možnou, ale nepravděpodobnou scénu. Tyto nejsou vzájemně se vylučující, a mnohé reverzní akce trpí oběma typy artefaktů, jako když se rozbalí kus papíru.

‘Příklady fyzických artefaktů zahrnují: invertovanou gravitaci (například ‘pád’), spontánní impulzy na objekty (například ‘otáčení pera’), a nevratné změny stavu (například ‘spalování svíčky’). Příkladem nepravděpodobného artefaktu je: vzít talíř z skříně, osušit ho a umístit ho na sušičku.

‘Tento typ opětovného použití dat je velmi častý v tréninku, a může být prospěšný – například, aby se zajistilo, že model se nenaučí pouze jeden pohled na obrázek nebo objekt, který lze otočit nebo otočit bez ztráty centrální koherence a logiky.

‘To funguje pouze pro objekty, které jsou skutečně symetrické, samozřejmě; a učení fyziky z ‘reverzního’ videa funguje pouze tehdy, pokud reverzní verze má stejně smysl jako verze dopředu.’

Dočasné reverze

Nemáme žádné důkazy o tom, že systémy, jako je Hunyuan Video a Wan 2.1, umožnily libovolné ‘reverzní’ klipy být vystaveny modelu během trénování (ani jeden z výzkumníků nebyl specifický ohledně datových augmentačních rutin).

Však jedinou rozumnou alternativní možností by bylo, že hyperscale datasety, které pohánějí tyto modely, mohou obsahovat klipy, které skutečně zobrazují pohyby, které se dějí v opačném směru.

Kámen v příkladu videa výše byl vygenerován pomocí Wan 2.1 a je součástí nové studie, která zkoumá, jak dobře video difuzní modely zvládají fyziku.

V testech pro tento projekt Wan 2.1 dosáhl skóre pouze 22% v souvislosti se svou schopností konzistentně dodržovat fyzikální zákony.

Však to je nejlepší skóre jakéhokoli systému testovaného v rámci této práce, což naznačuje, že jsme možná našli další překážku pro video AI:

Skóre získané předními otevřenými a uzavřeným modely, s výstupem frameworků hodnocenými lidskými anotátory. Source: https://arxiv.org/pdf/2503.06800

Skóre získané předními otevřenými a uzavřeným modely, s výstupem frameworků hodnocenými lidskými anotátory. Source: https://arxiv.org/pdf/2503.06800

Autoři této nové práce vyvinuli benchmarking systém, nyní ve druhé iteraci, nazvaný VideoPhy, s kódem dostupným na GitHubu.

I když rozsah této práce je za hranicemi toho, co můžeme zde komplexně pokrýt, pojďme se podívat na jeho metodologii a jeho potenciál pro stanovení metriky, která by mohla pomoci směrovat budoucí model-tréninkové sezení pryč od těchto bizarních případů reverze.

Studie, provedená šesti výzkumníky z UCLA a Google Research, se nazývá VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation. Crowded doprovodný projektový web je také k dispozici, spolu s kódem a datovými sadami na GitHubu, a dataset viewer na Hugging Face.

Kliknutím se spustí. Zde OpenAI Sora model selhává při pochopení interakcí mezi vesly a odrazy, a není schopen poskytnout logický fyzický tok pro osobu ve člunu nebo pro způsob, jakým člun interaguje s ní.

Metoda

Autoři popisují nejnovější verzi své práce, VideoPhy-2, jako ‘náročnou hodnocení datasetu pro reálné akce.’ Sbírka zahrnuje 197 akcí napříč různými fyzickými aktivitami, jako je hula-hoop, gymnastika a tenis, stejně jako interakce s objekty, jako je ohýbání objektu, dokud se nezlomí.

Velký jazykový model (LLM) se používá k vygenerování 3840 promptů z těchto akcí, a promptů se poté používají k syntéze videí prostřednictvím různých frameworků, které jsou testovány.

Během procesu autoři vyvinuli seznam ‘kandidátských’ fyzických pravidel a zákonů, které by AI vygenerovaná videa měla splňovat, pomocí vizuálních jazykových modelů pro hodnocení.

Autoři uvádějí:

‘Například ve videu sportovce hrajícího tenis by fyzické pravidlo bylo, že tenisový míč by měl následovat parabolickou trajektorii pod gravitací. Pro zlaté standardní soudy žádáme lidské anotátory, aby ohodnotili každé video na základě celkové sémantické shody a fyzické smysluplnosti, a aby označili jeho soulad s různými fyzickými pravidly.’

Nahoře: Textový prompt je vygenerován z akce pomocí LLM a používá se k vytvoření videa s text-to-video generátorem. Vizuální jazykový model tituluje video, identifikuje možné fyzické pravidla, která se uplatňují. Dole: Lidské anotátory hodnotí realističnost videa, potvrzují porušení pravidel, přidávají chybějící pravidla a kontrolují, zda video odpovídá původnímu promptu.

Nahoře: Textový prompt je vygenerován z akce pomocí LLM a používá se k vytvoření videa s text-to-video generátorem. Vizuální jazykový model tituluje video, identifikuje možné fyzické pravidla, která se uplatňují. Dole: Lidské anotátory hodnotí realističnost videa, potvrzují porušení pravidel, přidávají chybějící pravidla a kontrolují, zda video odpovídá původnímu promptu.

Původně výzkumníci kuratovali sadu akcí pro hodnocení fyzické smysluplnosti v AI vygenerovaných videích. Začali s více než 600 akcemi ze sad Kinetics, UCF-101 a SSv2, se zaměřením na činnosti, které zahrnují sporty, interakce s objekty a reálnou fyziku.

Dvě nezávislé skupiny STEM-vzdělaných studentů-anotátorů (s minimálním vysokoškolským vzděláním) přezkoumaly a filtrovaly seznam, vybraly akce, které testují principy, jako je gravitace, hybnost a pružnost, zatímco odstraňovaly úkoly s nízkou aktivitou, jako je psaní, krmení kočky nebo žvýkání.

Po dalším zdokonalení pomocí Gemini-2.0-Flash-Exp k odstranění duplikátů, konečná dataset zahrnovala 197 akcí, s 54 zahrnujícími interakce s objekty a 143 zaměřené na fyzické a sportovní aktivity:

Vzorky z destilovaných akcí.

Vzorky z destilovaných akcí.

V druhé fázi výzkumníci použili Gemini-2.0-Flash-Exp k vygenerování 20 promptů pro každou akci v datasetu, což vedlo k celkovému počtu 3 940 promptů. Generovací proces se zaměřil na viditelné fyzické interakce, které by mohly být jasně reprezentovány v generovaném videu. To vyloučilo neviditelné prvky, jako jsou emoce, smyslové detaily a abstraktní jazyk, ale zahrnovalo různé postavy a objekty.

Příklad: místo jednoduchého promptu ‘Lučištník uvolní šíp’, model byl veden k vygenerování podrobnější verze, jako ‘Lučištník táhne tětivu zpět do plné napětí, poté uvolní šíp, který letí rovně a zasáhne terč na papíru‘.

Pokud moderní video modely mohou interpretovat delší popisy, výzkumníci dále zdokonalili tituly pomocí Mistral-NeMo-12B-Instruct prompt upsampléru, aby přidali vizuální detaily bez změny původního významu.

Vzorky promptů z VideoPhy-2, kategorizované podle fyzických aktivit nebo interakcí s objekty. Každý prompt je spárován se svou příslušnou akcí a relevantním fyzickým principem, který testuje.

Vzorky promptů z VideoPhy-2, kategorizované podle fyzických aktivit nebo interakcí s objekty. Každý prompt je spárován se svou příslušnou akcí a relevantním fyzickým principem, který testuje.

Pro třetí fázi fyzická pravidla nebyla odvozena z textových promptů, ale z generovaných videí, protože generativní modely mohou mít potíže s dodržováním podmíněných textových promptů.

Videa byla nejprve vytvořena pomocí VideoPhy-2 promptů, poté ‘up-captioned’ s Gemini-2.0-Flash-Exp, aby se extrahovaly klíčové detaily. Model navrhoval tři očekávaná fyzická pravidla pro každé video, která lidské anotátory přezkoumali a rozšířili identifikací dalších potenciálních porušení.

Příklady z upsampled titulků.

Příklady z upsampled titulků.

Dále, aby identifikovali nejobtížnější akce, výzkumníci vygenerovali videa pomocí CogVideoX-5B s promptami z VideoPhy-2 datasetu. Poté vybrali 60 akcí z 197, kde model konzistentně selhal při dodržování promptů a základních fyzických smysluplností.

Tyto akce zahrnovaly fyzicky bohaté interakce, jako je přenos hybnosti při házení disku, změny stavu, jako je ohýbání objektu, dokud se nezlomí, vyvažovací úkoly, jako je chůze po laně, a komplexní pohyby, které zahrnovaly salta, skoky o tyči a házení pizzy, mezi jinými. Celkem bylo vybráno 1 200 promptů, aby se zvýšila obtížnost sub-datasetu.

Výsledný dataset zahrnoval 3 940 promptů – 5,72krát více než předchozí verze VideoPhy. Průměrná délka původních promptů je 16 tokenů, zatímco upsampled promptů dosahuje 138 tokenů – 1,88krát a 16,2krát delší, resp.

Dataset také zahrnuje 102 000 lidských anotací, které pokrývají sémantickou shodu, fyzickou smysluplnost a porušení pravidel napříč několika modely generování videa.

Hodnocení

Výzkumníci poté definovali jasná kritéria pro hodnocení videí. Hlavním cílem bylo posoudit, jak dobře každé video odpovídá vstupnímu promptu a dodržuje základní fyzické principy.

Místo toho, aby videa jednoduše ohodnotili podle preference, použili hodnocení založená na ohodnocení, aby zachytili konkrétní úspěchy a neúspěchy. Lidské anotátory ohodnotily videa na pětibodové škále, což umožnilo podrobnější soudy, zatímco hodnocení také zkontrolovalo, zda videa dodržují různá fyzická pravidla a zákony.

Pro lidské hodnocení byla vybrána skupina 12 anotátorů z testů na Amazon Mechanical Turk (AMT), kteří obdrželi podrobné vzdálené instrukce. Pro spravedlivost sémantická shoda a fyzická smysluplnost byly hodnoceny samostatně (v původní VideoPhy studii byly hodnoceny společně).

Anotátoři nejprve ohodnotili, jak dobře videa odpovídají vstupním promptům, poté samostatně ohodnotili fyzickou pravděpodobnost, ohodnotili porušení pravidel a celkovou realističnost na pětibodové škále. Zobrazily se pouze původní prompty, aby se udržela spravedlivá srovnání napříč modely.

Rozhraní prezentované anotátorům AMT.

Rozhraní prezentované anotátorům AMT.

Přestože lidské soudy zůstávají zlatým standardem, jsou drahé a mají řadu omezení. Proto je automatizované hodnocení nezbytné pro rychlejší a širší hodnocení modelů.

Autoři článku otestovali několik video-jazykových modelů, včetně Gemini-2.0-Flash-Exp a VideoScore, na jejich schopnost ohodnotit videa pro sémantickou přesnost a ‘fyzickou smysluplnost’.

Modely opět ohodnotily každé video na pětibodové škále, zatímco samostatná klasifikační úloha určila, zda fyzická pravidla byla dodržena, porušena nebo nejasná.

Experimenty ukázaly, že stávající video-jazykové modely měly potíže s odpovídáním lidským soudům, především kvůli slabé fyzické argumentaci a komplexitě promptů. Pro zlepšení automatizovaného hodnocení výzkumníci vyvinuli VideoPhy-2-Autoeval, 7B-parametrický model navržen pro poskytování přesnějších předpovědí napříč třemi kategoriemi: sémantická shoda; fyzická smysluplnost; a dodržování pravidel, jemně naladěný na VideoCon-Physics modelu pomocí 50 000 lidských anotací*.

Data a testy

S těmito nástroji na místě autoři otestovali řadu generativních video systémů, jak prostřednictvím místních instalací, tak prostřednictvím komerčních API: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; a Luma Ray.

Modely byly spuštěny s upsampled promptami, kde to bylo možné, kromě toho, že Hunyuan Video a VideoCrafter2 operují pod 77-token CLIP omezeními a nemohou přijímat prompty nad určitou délku.

Generovaná videa byla omezena na méně než 6 sekund, protože kratší výstup je snazší hodnotit.

Řídící data pocházela z VideoPhy-2 datasetu, který byl rozdělen na benchmark a tréninkovou sadu. 590 videí bylo vygenerováno pro každý model, kromě Sora a Ray2; z důvodu nákladového faktoru (ekvivalentní nižší počet videí byl vygenerován pro tyto).

(Prosím, odkážete se na zdroj článku pro další podrobnosti o hodnocení, které jsou tam vyčerpávajícím způsobem popsány)

Původní hodnocení se týkalo fyzických aktivit/sportů (PA) a interakcí s objekty (OI), a testovalo jak obecný dataset, tak výše zmíněnou ‘těžší’ sub-sadu:

Výsledky z počáteční kola.

Výsledky z počáteční kola.

Zde autoři komentují:

‘I když je nejlepší model, Wan2.1-14B, dosáhl pouze 32,6% a 21,9% na plném a těžkém rozdělení našeho datasetu, resp. Jeho relativně silný výkon ve srovnání s ostatními modely lze připsat na účet rozmanitosti jeho multimodálních tréninkových dat, spolu s robustním filtrem pohybu, který zachovává vysoce kvalitní videa napříč širokou škálou akcí.

‘Kromě toho jsme pozorovali, že uzavřené modely, jako je Ray2, fungují hůře než otevřené modely, jako je Wan2.1-14B a CogVideoX-5B. To naznačuje, že uzavřené modely nejsou nutně lepší než otevřené modely při zachycení fyzické smysluplnosti.

‘Zejména Cosmos-Diffusion-7B dosáhl druhého nejlepšího skóre na těžkém rozdělení, dokonce předčil mnohem větší HunyuanVideo-13B model. To může být způsobeno vysokým zastoupením lidských akcí v jeho tréninkových datech, spolu se synteticky renderovanými simulacemi.’

Výsledky ukázaly, že video modely měly větší potíže s fyzickými aktivitami, jako jsou sporty, než s jednoduššími interakcemi s objekty. To naznačuje, že zlepšení AI vygenerovaných videí v této oblasti bude vyžadovat lepší datasety – zejména vysoce kvalitní záběry sportů, jako je tenis, disk, baseball a kriket.

Studie také prozkoumala, zda fyzická pravděpodobnost modelu koreluje s jinými video kvalitativními metrikami, jako je estetika a plynulost pohybu. Zjištění odhalila, že není silná korelace, což znamená, že model nemůže zlepšit své výkony na VideoPhy-2 pouze generováním vizuálně atraktivních nebo plynulých pohybů – potřebuje hlubší pochopení fyzické smysluplnosti.

Přestože článek poskytuje řadu kvalitativních příkladů, několik statických příkladů poskytnutých v PDF se zdá být málo souvisejících s rozsáhlými video příklady, které autoři poskytují na projektovém webu. Proto se podíváme na malou selekci statických příkladů a poté na některé skutečné projektové videa.

Horní řada ukazuje videa vygenerovaná Wan2.1. (a) V Ray2, jet-ski na levé straně zaostává, než se pohybuje dozadu. (b) V Hunyuan-13B, sledgehammer se deformuje uprostřed pohybu, a rozbitá dřevěná deska se objeví neočekávaně. (c) V Cosmos-7B, oštěp vyhodí písek, než se dotkne země.

Horní řada ukazuje videa vygenerovaná Wan2.1. (a) V Ray2, jet-ski na levé straně zaostává, než se pohybuje dozadu. (b) V Hunyuan-13B, sledgehammer se deformuje uprostřed pohybu, a rozbitá dřevěná deska se objeví neočekávaně. (c) V Cosmos-7B, oštěp vyhodí písek, než se dotkne země.

Ohledně výše uvedeného kvalitativního testu autoři komentují:

‘[My] pozorujeme porušení fyzické smysluplnosti, jako je jet-ski, které se pohybují neobyčejně dozadu, a deformace pevného sledgehammeru, který porušuje zákony elasticity. Avšak i Wan trpí nedostatkem fyzické smysluplnosti, jak je vidět v [klipu vloženém na začátku tohoto článku].

‘V tomto případě zdůrazňujeme, že kámen začíná kutálet a zrychlovat vzhůru, porušuje fyzický zákon gravitace.’

Další příklady z projektového webu:

Kliknutím se spustí. Zde byl prompt ‘Osoba energicky kroutí mokrý ručník, voda stříká ven v zřetelném oblouku’ – ale výsledný zdroj vody je mnohem více jako hadice než ručník.

Kliknutím se spustí.Zde byl prompt ‘Chemik lijí čirou kapalinu z baňky do zkumavky, pečlivě se vyhýbaje rozlití’, ale můžeme vidět, že objem vody, který se přidává do baňky, není konzistentní s množstvím, které vychází z kance.

Jako jsem zmínil na začátku, objem materiálu spojeného s tímto projektem daleko přesahuje to, co lze zde pokrýt. Proto, prosím, odkážete se na zdroj článku, projektový web a související weby zmíněné dříve, pro vyčerpávající přehled autorů procedur a mnohem více testovacích příkladů a procedurálních detailů.

 

* Ohledně původu anotací, článek pouze uvádí ‘získané pro tyto úkoly’ – zdá se, že je to hodně, aby to bylo vygenerováno 12 pracovníky AMT.

První zveřejnění: čtvrtek, 13. března 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai