Andersons vinkel

Bedre Generativ AI-Video ved at Shuffle Rammer under TrÃĶning

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google
Adobe Firefly, various prompts and edits.

En ny artikel, der er offentliggjort pÃĨ Arxiv denne uge, beskÃĶftiger sig med et problem, som enhver, der har anvendt Hunyuan Video eller Wan 2.1 AI-video-genereringssystemer, er stÃļdt pÃĨ: temporale afvigelser, hvor genereringsprocessen har tendens til pludselig at accelerere, sammentÃĶlle, udelade eller pÃĨ anden mÃĨde ÃļdelÃĶgge vigtige Ãļjeblikke i en genereret video:

Klik for at afspille. Nogle af de temporale fejl, der er blevet almindelige for brugere af de nye generative video-systemer, fremhÃĶvet i den nye artikel. Til hÃļjre, den forbedrede effekt af den nye FluxFlow-metode.  Kilde: https://haroldchen19.github.io/FluxFlow/

Videoen ovenfor indeholder uddrag fra eksempel-testvideoer pÃĨ (advarsel: ret kaotisk) projektets hjemmeside for artiklen. Vi kan se flere stadig mere velkendte problemer, der afhjÃĶlpes af forfatternes metode (afbildet til hÃļjre i videoen), som i virkeligheden er en dataset-forbearbejdningsteknik, der kan anvendes pÃĨ enhver generativ video-arkitektur.

I det fÃļrste eksempel, der viser ‘to bÃļrn, der leger med en bold’, genereret af CogVideoX, kan vi se (til venstre i kompilationsvideoen ovenfor og i det specifikke eksempel nedenfor), at den native generering hurtigt springer over flere vÃĶsentlige mikro-bevÃĶgelser, og accelererer bÃļrnenes aktivitet op til en ‘tegneserie’-niveau. I modsÃĶtning hertil giver den samme dataset og metode bedre resultater med den nye forbehandlingsteknik, der er dÃļbt FluxFlow (til hÃļjre for billedet i videoen nedenfor):

Klik for at afspille.

I det andet eksempel (med NOVA-0.6B) kan vi se, at en central bevÃĶgelse, der involverer en kat, pÃĨ en eller anden mÃĨde er blevet korrumperet eller under-udsamplet under trÃĶningsfasen, sÃĨ genererings-systemet bliver ‘lÃĨst’ og ikke kan fÃĨ subjektet til at bevÃĶge sig:

Klik for at afspille.

Dette syndrom, hvor bevÃĶgelsen eller subjektet bliver ‘fast’, er et af de mest hyppigt rapporterede problemer i HV og Wan i de forskellige billed- og video-syntesegrupper.

Nogle af disse problemer er relaterede til video-underskriftsproblemer i kilde-datasÃĶttet, som vi sÃĨ pÃĨ denne uge; men forfatterne af den nye artikel fokuserer deres indsats pÃĨ de temporale kvaliteter af trÃĶningsdataene i stedet og fremfÃļrer en overbevisende argumentation for, at lÃļsning af udfordringerne fra denne synsvinkel kan give nyttige resultater.

Som nÃĶvnt i den tidligere artikel om video-underskrift, er visse sports sÃĶrligt svÃĶre at destillere til nÃļgle-Ãļjeblikke, hvilket betyder, at kritiske begivenheder (sÃĨsom en slam-dunk) ikke fÃĨr den opmÃĶrksomhed, de behÃļver under trÃĶningstiden:

Klik for at afspille.

I ovenstÃĨende eksempel kan genererings-systemet ikke finde ud af, hvordan den skal komme til nÃĶste stadium af bevÃĶgelse, og gÃĨr illogisk over fra en pose til en anden, og ÃĶndrer holdningen og geometrien af spilleren undervejs.

Disse er store bevÃĶgelser, der er gÃĨet tabt under trÃĶning – men lige sÃĨ sÃĨrbare er langt mindre, men afgÃļrende bevÃĶgelser, sÃĨsom flimren af en sommerfugls vinger:

Klik for at afspille.  

Ulig slam-dunken er flimren af vingerne ikke en ‘sjÃĶlden’ men snarere en vedvarende og monoton begivenhed. Imidlertid gÃĨr dens konsistens tabt i sampningsprocessen, da bevÃĶgelsen er sÃĨ hurtig, at det er meget svÃĶrt at fastlÃĶgge den temporalt.

Disse er ikke sÃĶrligt nye problemer, men de fÃĨr mere opmÃĶrksomhed nu, da kraftfulde generative video-modeller er tilgÃĶngelige for entusiaster til lokal installation og fri generering.

Samfundene pÃĨ Reddit og Discord har initialt behandlet disse problemer som ‘bruger-relaterede’. Dette er en forstÃĨelig antagelse, da systemerne i spÃļrgsmÃĨl er meget nye og minimalt dokumenterede. Derfor har diverse eksperter foreslÃĨet forskellige (og ikke altid effektive) lÃļsninger for nogle af fejlene, der er dokumenteret her, sÃĨsom ÃĶndring af indstillingerne i diverse komponenter af forskellige typer ComfyUI-workflows for Hunyuan Video (HV) og Wan 2.1.

I nogle tilfÃĶlde producerer bÃĨde HV og Wan i stedet for hurtig bevÃĶgelse langsom bevÃĶgelse. Forslag fra Reddit og ChatGPT (der hovedsagelig udnytter Reddit) inkluderer ÃĶndring af antallet af rammer i den anmodede generering eller radikalt at sÃĶnke ramme-raten*.

Dette er alt desperate ting; den opdykkende sandhed er, at vi endnu ikke kender den prÃĶcise ÃĨrsag eller den prÃĶcise lÃļsning pÃĨ disse problemer; det er tydeligt, at at plage genererings-indstillingerne for at arbejde rundt om dem (isÃĶr nÃĨr dette degraderer output-kvaliteten, for eksempel med en for lav fps-rate) kun er en midlertidig lÃļsning, og det er godt at se, at forskningsscenen beskÃĶftiger sig med disse opdykkende problemer sÃĨ hurtigt.

SÃĨ, ud over denne uges kig pÃĨ, hvordan undertekstning pÃĨvirker trÃĶning, lad os tage et kig pÃĨ den nye artikel om temporal regulering og hvilke forbedringer den mÃĨske kan tilbyde den nuvÃĶrende generative video-scene.

Den centrale idÃĐ er ret simpel og let, og ingen ringere for det; alligevel er artiklen lidt opblÃĶst for at nÃĨ de foreskrevne otte sider, og vi vil springe over denne opblÃĶsning, hvis det er nÃļdvendigt.

Fisken i den native generering af VideoCrafter-rammen er statisk, mens FluxFlow-ÃĶndrede version fanger de nÃļdvendige ÃĶndringer. Kilde: https://arxiv.org/pdf/2503.15417

Fisken i den native generering af VideoCrafter-rammen er statisk, mens FluxFlow-ÃĶndrede version fanger de nÃļdvendige ÃĶndringer. Kilde: https://arxiv.org/pdf/2503.15417

Den nye artikel hedder Temporal Regularization Makes Your Video Generator Stronger og kommer fra otte forskere pÃĨ Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) og The University of Hong Kong (HKU).

(pÃĨ tidspunktet for skrivning, er der nogle problemer med artiklens tilhÃļrende projekt-side)

FluxFlow

Den centrale idÃĐ bag FluxFlow, forfatternes nye for-trÃĶningsskema, er at overvinde de udbredte problemer flickering og temporal inkonsistens ved at shuffle blokke og grupper af blokke i de temporale ramme-ordrer, mens kilde-dataene bliver eksponeret for trÃĶningsprocessen:

Den centrale idÃĐ bag FluxFlow er at flytte blokke og grupper af blokke til uventede og ikke-temporale positioner, som en form for data-forstÃĶrkning.

Den centrale idÃĐ bag FluxFlow er at flytte blokke og grupper af blokke til uventede og ikke-temporale positioner, som en form for data-forstÃĶrkning.

Artiklen forklarer:

‘[Artefakter] stammer fra en grundlÃĶggende begrÃĶnsning: pÃĨ trods af at udnytte store datasÃĶt, afhÃĶnger nuvÃĶrende modeller ofte af simplificerede temporale mÃļnstre i trÃĶningsdataene (f.eks. faste gÃĨ-rettninger eller gentagne ramme-overgange) i stedet for at lÃĶre diverse og plausibele temporale dynamikker.

‘Dette problem er yderligere forvÃĶrret af manglen pÃĨ eksplisit temporal forstÃĶrkning under trÃĶning, hvilket gÃļr modellerne sÃĨrbare over for at overfitte til spurious temporale korrelationer (f.eks. “ramme #5 skal fÃļlge #4”) i stedet for at generalisere over diverse bevÃĶgelsesscenarier.’

De fleste video-genererings-modeller, forklarer forfatterne, lÃĨner stadig for meget fra billede-syntese, fokuserer pÃĨ rumlig trofasthed, mens de stort set ignorerer den temporale akse. Selvom teknikker som beskÃĶring, flipning og farve-jittering har hjulpet med at forbedre statisk billedkvalitet, er de ikke tilstrÃĶkkelige lÃļsninger, nÃĨr de anvendes pÃĨ videoer, hvor illusionen af bevÃĶgelse afhÃĶnger af konsistente overgange mellem rammer.

De resulterende problemer inkluderer flickerende teksturer, chokerende klip mellem rammer og gentagne eller for simple bevÃĶgelsesmÃļnstre.

Klik for at afspille.

Artiklen argumenterer for, at selvom nogle modeller – herunder Stable Video Diffusion og LlamaGen – kompenserer med stadig mere komplekse arkitekturer eller konstruerede begrÃĶnsninger, kommer disse pÃĨ bekostning af beregning og fleksibilitet.

Da temporal data-forstÃĶrkning allerede har vist sig nyttig i video forstÃĨelse-opgaver (i rammer som FineCliper, SeFAR og SVFormer) er det overraskende, at forfatterne pÃĨstÃĨr, at denne taktik sjÃĶldent anvendes i en generativ kontekst.

Disruptiv AdfÃĶrd

Forskerne pÃĨstÃĨr, at simple, strukturerede disruptioner i temporal orden under trÃĶning hjÃĶlper modellerne med at generalisere bedre til realistiske, diverse bevÃĶgelser:

‘Ved at trÃĶne pÃĨ uordnede sekvenser, lÃĶrer generatoren at genskabe plausibele trajektorier, og effektivt regulariserer temporal entropi. FLUXFLOW bropper gapet mellem diskriminativ og generativ temporal forstÃĶrkning og tilbyder en plug-and-play-forbedring til temporalt plausibel video-generering, mens den forbedrer den samlede [kvalitet].

‘I modsÃĶtning til eksisterende metoder, der introducerer arkitektoniske ÃĶndringer eller afhÃĶnger af efterbehandling, opererer FLUXFLOW direkte pÃĨ data-niveauet og introducerer kontrollerede temporale perturbationer under trÃĶning.’

Klik for at afspille.

Ramme-niveau-perturbationer introducerer, ifÃļlge forfatterne, fine-grained disruptioner inden for en sekvens. Denne type disruption er ikke ulig masking-forstÃĶrkning, hvor dele af dataene tilfÃĶldigt blokeres, for at forhindre, at systemet overfitte pÃĨ data-punkter, og opmuntrer til bedre generalisering.

Tests

Selvom den centrale idÃĐ her ikke lÃļber til en fuld artikel, pÃĨ grund af sin enkelhed, er der alligevel en test-sektion, som vi kan tage et kig pÃĨ.

Forskerne testede for fire forespÃļrgsler i forhold til forbedret temporal kvalitet, mens de opretholdt rumlig trofasthed; evnen til at lÃĶre bevÃĶgelse/optisk fluks-dynamik; opretholdelse af temporal kvalitet i ekstraterm-generering; og fÃļlsomhed over for nÃļgle-hyperparametre.

Forskerne anvendte FluxFlow pÃĨ tre generative arkitekturer: U-Net-baseret, i form af VideoCrafter2; DiT-baseret, i form af CogVideoX-2B; og AR-baseret, i form af NOVA-0.6B.

Til en fair sammenligning fine-tunede de arkitektonernes grund-modeller med FluxFlow som en ekstra trÃĶningsfase, i ÃĐn epoch, pÃĨ OpenVidHD-0.4M-datasÃĶttet.

Modellerne blev evaluaret mod to populÃĶre benchmarks: UCF-101; og VBench.

For UCF blev FrÃĐchet Video Distance (FVD) og Inception Score (IS) metrikkerne brugt. For VBench koncentrerede forskerne sig om temporal kvalitet, ramme-vis kvalitet og samlet kvalitet.

Kvantitativ initial evaluering af FluxFlow-Frame.

Kvantitativ initial evaluering af FluxFlow-Frame. “+ Original” indikerer trÃĶning uden FLUXFLOW, mens “+ Num × 1” viser forskellige FluxFlow-Frame-konfigurationer. Bedste resultater er skygget; anden-bedst er underlinet for hver model.

Kommentarer til disse resultater, siger forfatterne:

‘BÃĨde FLUXFLOW-FRAME og FLUXFLOW-BLOCK forbedrer betydeligt den temporale kvalitet, som bevises af metrikkerne i Tab. 1, 2 (dvs. FVD, Subject, Flicker, Motion og Dynamic) og kvalitative resultater i [billedet nedenfor].

‘For eksempel bliver bevÃĶgelsen af den drÃļmmende bil i VC2, katten, der jagter sin hale i NOVA, og surfere, der rider en bÃļlge i CVX, mÃĶrkbart mere flydende med FLUXFLOW. Vigtigt er, at disse temporale forbedringer opnÃĨs uden at ofre rumlig trofasthed, som bevises af de skarpe detaljer af vand-splashes, rÃļg-strÃĨler og bÃļlge-teksturer, samt rumlig og samlet trofasthed-metrikker.’

Nedenfor ser vi udvalg fra de kvalitative resultater, som forfatterne henviser til (se den originale artikel for fulde resultater og bedre oplÃļsning):

Udvalg fra de kvalitative resultater.

Udvalg fra de kvalitative resultater.

Artiklen foreslÃĨr, at selvom bÃĨde ramme-niveau- og blok-niveau-perturbationer forbedrer den temporale kvalitet, tenderer ramme-niveau-metoder til at performe bedre. Dette tilskrives deres finere granularitet, som tillader mere prÃĶcise temporale justeringer. Blok-niveau-perturbationer kan derimod introducere stÃļj pÃĨ grund af tÃĶt sammenkÃĶdede rumlige og temporale mÃļnstre inden for blokke, hvilket reducerer deres effektivitet.

Konklusion

Denne artikel, sammen med Bytedance-Tsinghua captioning-samarbejde, der er offentliggjort denne uge, har gjort det klart for mig, at de ÃĨbenlyse mangler i den nye generation af generative video-modeller mÃĨske ikke skyldes bruger-fejl, institutionelle fejltrin eller begrÃĶnsninger i finansiering, men snarere en forsknings-fokus, der har prioriteret mere presserende udfordringer, sÃĨsom temporal kohÃĶrens og konsistens, over disse mindre bekymringer.

Indtil for nylig var resultaterne fra frit tilgÃĶngelige og downloadbare generative video-systemer sÃĨ kompromitterede, at ingen stÃļrre indsats opstod fra entusiast-samfundet for at lÃļse disse problemer (isÃĶr fordi problemerne var fundamentale og ikke trivialt lÃļselige).

Nu, hvor vi er sÃĨ meget tÃĶttere pÃĨ den forudsagte ÃĶra af ren AI-genereret fotorealistisk video-output, er det tydeligt, at bÃĨde forsknings- og fritids-samfundene tager en dybere og mere produktiv interesse i at lÃļse de resterende problemer; med lidt held er disse ikke uovervindelige hindringer.

 

* Wans native ramme-rate er en ringe 16fps, og som svar pÃĨ mine egne problemer, bemÃĶrker jeg, at fora har foreslÃĨet at sÃĶnke ramme-raten sÃĨ lavt som 12fps, og derefter bruge FlowFrames eller andre AI-baserede re-flow-systemer til at interpolere hullerne mellem sÃĨdan en sparsom mÃĶngde rammer.

Offentliggjort fÃļrste gang fredag, 21. marts 2025

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]