Andersons vinkel

Bedre Generativ AI-Video ved at Shuffle Rammer under Træning

mm
Føj Unite.AI til dine foretrukne kilder på Google
Adobe Firefly, various prompts and edits.

En ny artikel, der er offentliggjort på Arxiv denne uge, beskæftiger sig med et problem, som enhver, der har anvendt Hunyuan Video eller Wan 2.1 AI-video-genereringssystemer, er stødt på: temporale afvigelser, hvor genereringsprocessen har tendens til pludselig at accelerere, sammentælle, udelade eller på anden måde ødelægge vigtige øjeblikke i en genereret video:

Klik for at afspille. Nogle af de temporale fejl, der er blevet almindelige for brugere af de nye generative video-systemer, fremhævet i den nye artikel. Til højre, den forbedrede effekt af den nye FluxFlow-metode.  Kilde: https://haroldchen19.github.io/FluxFlow/

Videoen ovenfor indeholder uddrag fra eksempel-testvideoer på (advarsel: ret kaotisk) projektets hjemmeside for artiklen. Vi kan se flere stadig mere velkendte problemer, der afhjælpes af forfatternes metode (afbildet til højre i videoen), som i virkeligheden er en dataset-forbearbejdningsteknik, der kan anvendes på enhver generativ video-arkitektur.

I det første eksempel, der viser ‘to børn, der leger med en bold’, genereret af CogVideoX, kan vi se (til venstre i kompilationsvideoen ovenfor og i det specifikke eksempel nedenfor), at den native generering hurtigt springer over flere væsentlige mikro-bevægelser, og accelererer børnenes aktivitet op til en ‘tegneserie’-niveau. I modsætning hertil giver den samme dataset og metode bedre resultater med den nye forbehandlingsteknik, der er døbt FluxFlow (til højre for billedet i videoen nedenfor):

Klik for at afspille.

I det andet eksempel (med NOVA-0.6B) kan vi se, at en central bevægelse, der involverer en kat, på en eller anden måde er blevet korrumperet eller under-udsamplet under træningsfasen, så genererings-systemet bliver ‘låst’ og ikke kan få subjektet til at bevæge sig:

Klik for at afspille.

Dette syndrom, hvor bevægelsen eller subjektet bliver ‘fast’, er et af de mest hyppigt rapporterede problemer i HV og Wan i de forskellige billed- og video-syntesegrupper.

Nogle af disse problemer er relaterede til video-underskriftsproblemer i kilde-datasættet, som vi så på denne uge; men forfatterne af den nye artikel fokuserer deres indsats på de temporale kvaliteter af træningsdataene i stedet og fremfører en overbevisende argumentation for, at løsning af udfordringerne fra denne synsvinkel kan give nyttige resultater.

Som nævnt i den tidligere artikel om video-underskrift, er visse sports særligt svære at destillere til nøgle-øjeblikke, hvilket betyder, at kritiske begivenheder (såsom en slam-dunk) ikke får den opmærksomhed, de behøver under træningstiden:

Klik for at afspille.

I ovenstående eksempel kan genererings-systemet ikke finde ud af, hvordan den skal komme til næste stadium af bevægelse, og går illogisk over fra en pose til en anden, og ændrer holdningen og geometrien af spilleren undervejs.

Disse er store bevægelser, der er gået tabt under træning – men lige så sårbare er langt mindre, men afgørende bevægelser, såsom flimren af en sommerfugls vinger:

Klik for at afspille.  

Ulig slam-dunken er flimren af vingerne ikke en ‘sjælden’ men snarere en vedvarende og monoton begivenhed. Imidlertid går dens konsistens tabt i sampningsprocessen, da bevægelsen er så hurtig, at det er meget svært at fastlægge den temporalt.

Disse er ikke særligt nye problemer, men de får mere opmærksomhed nu, da kraftfulde generative video-modeller er tilgængelige for entusiaster til lokal installation og fri generering.

Samfundene på Reddit og Discord har initialt behandlet disse problemer som ‘bruger-relaterede’. Dette er en forståelig antagelse, da systemerne i spørgsmål er meget nye og minimalt dokumenterede. Derfor har diverse eksperter foreslået forskellige (og ikke altid effektive) løsninger for nogle af fejlene, der er dokumenteret her, såsom ændring af indstillingerne i diverse komponenter af forskellige typer ComfyUI-workflows for Hunyuan Video (HV) og Wan 2.1.

I nogle tilfælde producerer både HV og Wan i stedet for hurtig bevægelse langsom bevægelse. Forslag fra Reddit og ChatGPT (der hovedsagelig udnytter Reddit) inkluderer ændring af antallet af rammer i den anmodede generering eller radikalt at sænke ramme-raten*.

Dette er alt desperate ting; den opdykkende sandhed er, at vi endnu ikke kender den præcise årsag eller den præcise løsning på disse problemer; det er tydeligt, at at plage genererings-indstillingerne for at arbejde rundt om dem (især når dette degraderer output-kvaliteten, for eksempel med en for lav fps-rate) kun er en midlertidig løsning, og det er godt at se, at forskningsscenen beskæftiger sig med disse opdykkende problemer så hurtigt.

Så, ud over denne uges kig på, hvordan undertekstning påvirker træning, lad os tage et kig på den nye artikel om temporal regulering og hvilke forbedringer den måske kan tilbyde den nuværende generative video-scene.

Den centrale idé er ret simpel og let, og ingen ringere for det; alligevel er artiklen lidt opblæst for at nå de foreskrevne otte sider, og vi vil springe over denne opblæsning, hvis det er nødvendigt.

Fisken i den native generering af VideoCrafter-rammen er statisk, mens FluxFlow-ændrede version fanger de nødvendige ændringer. Kilde: https://arxiv.org/pdf/2503.15417

Fisken i den native generering af VideoCrafter-rammen er statisk, mens FluxFlow-ændrede version fanger de nødvendige ændringer. Kilde: https://arxiv.org/pdf/2503.15417

Den nye artikel hedder Temporal Regularization Makes Your Video Generator Stronger og kommer fra otte forskere på Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) og The University of Hong Kong (HKU).

(på tidspunktet for skrivning, er der nogle problemer med artiklens tilhørende projekt-side)

FluxFlow

Den centrale idé bag FluxFlow, forfatternes nye for-træningsskema, er at overvinde de udbredte problemer flickering og temporal inkonsistens ved at shuffle blokke og grupper af blokke i de temporale ramme-ordrer, mens kilde-dataene bliver eksponeret for træningsprocessen:

Den centrale idé bag FluxFlow er at flytte blokke og grupper af blokke til uventede og ikke-temporale positioner, som en form for data-forstærkning.

Den centrale idé bag FluxFlow er at flytte blokke og grupper af blokke til uventede og ikke-temporale positioner, som en form for data-forstærkning.

Artiklen forklarer:

‘[Artefakter] stammer fra en grundlæggende begrænsning: på trods af at udnytte store datasæt, afhænger nuværende modeller ofte af simplificerede temporale mønstre i træningsdataene (f.eks. faste gå-rettninger eller gentagne ramme-overgange) i stedet for at lære diverse og plausibele temporale dynamikker.

‘Dette problem er yderligere forværret af manglen på eksplisit temporal forstærkning under træning, hvilket gør modellerne sårbare over for at overfitte til spurious temporale korrelationer (f.eks. “ramme #5 skal følge #4”) i stedet for at generalisere over diverse bevægelsesscenarier.’

De fleste video-genererings-modeller, forklarer forfatterne, låner stadig for meget fra billede-syntese, fokuserer på rumlig trofasthed, mens de stort set ignorerer den temporale akse. Selvom teknikker som beskæring, flipning og farve-jittering har hjulpet med at forbedre statisk billedkvalitet, er de ikke tilstrækkelige løsninger, når de anvendes på videoer, hvor illusionen af bevægelse afhænger af konsistente overgange mellem rammer.

De resulterende problemer inkluderer flickerende teksturer, chokerende klip mellem rammer og gentagne eller for simple bevægelsesmønstre.

Klik for at afspille.

Artiklen argumenterer for, at selvom nogle modeller – herunder Stable Video Diffusion og LlamaGen – kompenserer med stadig mere komplekse arkitekturer eller konstruerede begrænsninger, kommer disse på bekostning af beregning og fleksibilitet.

Da temporal data-forstærkning allerede har vist sig nyttig i video forståelse-opgaver (i rammer som FineCliper, SeFAR og SVFormer) er det overraskende, at forfatterne påstår, at denne taktik sjældent anvendes i en generativ kontekst.

Disruptiv Adfærd

Forskerne påstår, at simple, strukturerede disruptioner i temporal orden under træning hjælper modellerne med at generalisere bedre til realistiske, diverse bevægelser:

‘Ved at træne på uordnede sekvenser, lærer generatoren at genskabe plausibele trajektorier, og effektivt regulariserer temporal entropi. FLUXFLOW bropper gapet mellem diskriminativ og generativ temporal forstærkning og tilbyder en plug-and-play-forbedring til temporalt plausibel video-generering, mens den forbedrer den samlede [kvalitet].

‘I modsætning til eksisterende metoder, der introducerer arkitektoniske ændringer eller afhænger af efterbehandling, opererer FLUXFLOW direkte på data-niveauet og introducerer kontrollerede temporale perturbationer under træning.’

Klik for at afspille.

Ramme-niveau-perturbationer introducerer, ifølge forfatterne, fine-grained disruptioner inden for en sekvens. Denne type disruption er ikke ulig masking-forstærkning, hvor dele af dataene tilfældigt blokeres, for at forhindre, at systemet overfitte på data-punkter, og opmuntrer til bedre generalisering.

Tests

Selvom den centrale idé her ikke løber til en fuld artikel, på grund af sin enkelhed, er der alligevel en test-sektion, som vi kan tage et kig på.

Forskerne testede for fire forespørgsler i forhold til forbedret temporal kvalitet, mens de opretholdt rumlig trofasthed; evnen til at lære bevægelse/optisk fluks-dynamik; opretholdelse af temporal kvalitet i ekstraterm-generering; og følsomhed over for nøgle-hyperparametre.

Forskerne anvendte FluxFlow på tre generative arkitekturer: U-Net-baseret, i form af VideoCrafter2; DiT-baseret, i form af CogVideoX-2B; og AR-baseret, i form af NOVA-0.6B.

Til en fair sammenligning fine-tunede de arkitektonernes grund-modeller med FluxFlow som en ekstra træningsfase, i én epoch, på OpenVidHD-0.4M-datasættet.

Modellerne blev evaluaret mod to populære benchmarks: UCF-101; og VBench.

For UCF blev Fréchet Video Distance (FVD) og Inception Score (IS) metrikkerne brugt. For VBench koncentrerede forskerne sig om temporal kvalitet, ramme-vis kvalitet og samlet kvalitet.

Kvantitativ initial evaluering af FluxFlow-Frame.

Kvantitativ initial evaluering af FluxFlow-Frame. “+ Original” indikerer træning uden FLUXFLOW, mens “+ Num × 1” viser forskellige FluxFlow-Frame-konfigurationer. Bedste resultater er skygget; anden-bedst er underlinet for hver model.

Kommentarer til disse resultater, siger forfatterne:

‘Både FLUXFLOW-FRAME og FLUXFLOW-BLOCK forbedrer betydeligt den temporale kvalitet, som bevises af metrikkerne i Tab. 1, 2 (dvs. FVD, Subject, Flicker, Motion og Dynamic) og kvalitative resultater i [billedet nedenfor].

‘For eksempel bliver bevægelsen af den drømmende bil i VC2, katten, der jagter sin hale i NOVA, og surfere, der rider en bølge i CVX, mærkbart mere flydende med FLUXFLOW. Vigtigt er, at disse temporale forbedringer opnås uden at ofre rumlig trofasthed, som bevises af de skarpe detaljer af vand-splashes, røg-stråler og bølge-teksturer, samt rumlig og samlet trofasthed-metrikker.’

Nedenfor ser vi udvalg fra de kvalitative resultater, som forfatterne henviser til (se den originale artikel for fulde resultater og bedre opløsning):

Udvalg fra de kvalitative resultater.

Udvalg fra de kvalitative resultater.

Artiklen foreslår, at selvom både ramme-niveau- og blok-niveau-perturbationer forbedrer den temporale kvalitet, tenderer ramme-niveau-metoder til at performe bedre. Dette tilskrives deres finere granularitet, som tillader mere præcise temporale justeringer. Blok-niveau-perturbationer kan derimod introducere støj på grund af tæt sammenkædede rumlige og temporale mønstre inden for blokke, hvilket reducerer deres effektivitet.

Konklusion

Denne artikel, sammen med Bytedance-Tsinghua captioning-samarbejde, der er offentliggjort denne uge, har gjort det klart for mig, at de åbenlyse mangler i den nye generation af generative video-modeller måske ikke skyldes bruger-fejl, institutionelle fejltrin eller begrænsninger i finansiering, men snarere en forsknings-fokus, der har prioriteret mere presserende udfordringer, såsom temporal kohærens og konsistens, over disse mindre bekymringer.

Indtil for nylig var resultaterne fra frit tilgængelige og downloadbare generative video-systemer så kompromitterede, at ingen større indsats opstod fra entusiast-samfundet for at løse disse problemer (især fordi problemerne var fundamentale og ikke trivialt løselige).

Nu, hvor vi er så meget tættere på den forudsagte æra af ren AI-genereret fotorealistisk video-output, er det tydeligt, at både forsknings- og fritids-samfundene tager en dybere og mere produktiv interesse i at løse de resterende problemer; med lidt held er disse ikke uovervindelige hindringer.

 

* Wans native ramme-rate er en ringe 16fps, og som svar på mine egne problemer, bemærker jeg, at fora har foreslået at sænke ramme-raten så lavt som 12fps, og derefter bruge FlowFrames eller andre AI-baserede re-flow-systemer til at interpolere hullerne mellem sådan en sparsom mængde rammer.

Offentliggjort første gang fredag, 21. marts 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai