Andersons vinkel
Bedre generativt AI-video ved å blande rammer under trening

En ny artikkel som ble publisert denne uken på Arxiv, tar for seg et problem som alle som har brukt Hunyuan Video eller Wan 2.1 AI-video-generering, har møtt på: temporale feil, der genereringsprosessen tenderer til å plutselig øke, sammenflette, utelate eller på andre måter forstyrre kritiske øyeblikk i en generert video:
Trykk på å spille. Noen av de temporale feilene som blir mer og mer kjent for brukerne av de nye generative videosystemene, fremhevet i den nye artikkelen. Til høyre, den forbedrede effekten av den nye FluxFlow-metoden. Kilde: https://haroldchen19.github.io/FluxFlow/
Videoen ovenfor inneholder utdrag fra eksempel-testvideoer på (advarsel: ganske kaotisk) prosjektsiden for artikkelen. Vi kan se flere stadig mer kjente problemer som blir løst av forfatternes metode (avbildet til høyre i videoen), som i realiteten er en datasett-forbearbeidningsteknikk som kan brukes på noen generative video-arkitekturer.
I det første eksemplet, med “to barn som leker med en ball”, generert av CogVideoX, ser vi (til venstre i kompilasjonsvideoen ovenfor og i det spesifikke eksemplet nedenfor) at den native genereringen raskt hopper over flere essensielle mikro-bevegelser, og øker barnas aktivitet til en “tegnfilm”-nivå. I motsetning til dette gir samme datasett og metode bedre resultater med den nye forbehandlingsmetoden, som kalles FluxFlow (til høyre for bildet i videoen nedenfor):
Trykk på å spille.
I det andre eksemplet (med NOVA-0.6B) ser vi at en sentral bevegelse som involverer en katt på noen måte er korrumpert eller under-utnyttet på treningstidspunktet, slik at genereringssystemet blir “låst” og ikke kan få subjektet til å bevege seg:
Trykk på å spille.
Dette syndromet, der bevegelsen eller subjektet blir “låst”, er ett av de mest rapporterte feilene i HV og Wan, i de ulike bilde- og videosyntesegruppene.
Noen av disse problemene er relatert til video-underskriftsproblemer i kilde-datasettet, som vi så på denne uken; men forfatterne av den nye artikkelen fokuserer sine anstrengelser på de temporale kvalitetene i treningdataene, og presenterer en overbevisende argumentasjon for at å løse utfordringene fra dette perspektivet kan gi nyttige resultater.
Som nevnt i den tidligere artikkelen om video-underskrift, er visse sporter spesielt vanskelige å destillere til nøkkeløyeblikk, slik at kritiske hendelser (som en slam dunk) ikke får den oppmerksomheten de trenger på treningstidspunktet:
Trykk på å spille.
I eksemplet ovenfor ser vi at genereringsystemet ikke vet hvordan den skal gå videre til neste bevegelsesstadium, og går illogisk over fra en pose til en annen, og endrer holdningen og geometrien til spilleren i prosessen.
Disse er store bevegelser som ble tapt i trening – men like sårbare er mye mindre, men avgjørende bevegelser, som flappingen av en sommerfugls vinger:
Trykk på å spille.
I motsetning til slam dunk-en, er flappingen av vingene ikke en “sjelden” men en varig og monoton hendelse. Likevel blir konsistensen tapt i sampingsprosessen, siden bevegelsen er så rask at det er svært å etablere temporalt.
Disse er ikke spesielt nye problemer, men de får nå mer oppmerksomhet nå som kraftige generative video-modeller er tilgjengelige for entusiaster for lokal installasjon og gratis generering.
Samfunnene på Reddit og Discord har initialt behandlet disse problemene som “bruker-relatert”. Dette er en forståelig antagelse, siden systemene i spørsmål er svært nye og minimalt dokumenterte. Derfor har diverse eksperter foreslått ulike (og ikke alltid effektive) løsninger for noen av feilene dokumentert her, som å endre innstillingene i diverse komponenter av ulike typer ComfyUI-arbeidsflyter for Hunyuan Video (HV) og Wan 2.1.
I noen tilfeller, i stedet for å produsere rask bevegelse, vil både HV og Wan produsere langsom bevegelse. Forslag fra Reddit og ChatGPT (som hovedsakelig utnytter Reddit) inkluderer å endre antall rammeverk i den ønskede genereringen, eller radikalt senke rammehastigheten*.
Dette er alt desperate ting; den fremvoksende sannheten er at vi ennå ikke vet den eksakte årsaken eller den eksakte løsningen for disse problemene; det er klart at å plage genereringsinnstillingene for å arbeide rundt dem (spesielt når dette degraderer utgangskvaliteten, for eksempel med en for lav fps-hastighet) bare er en midlertidig løsning, og det er bra å se at forskningsscenen tar for seg disse fremvoksende problemene så raskt.
Så, foruten denne uken sin titt på hvordan underteksting påvirker trening, la oss se på den nye artikkelen om temporalt regulering, og hva forbedringer den kan tilby den nåværende generative video-scenen.
Den sentrale ideen er ganske enkel og beskjeden, og ikke dårligere for det; likevel er artikkelen noe oppblåst for å nå de foreskrevne åtte sidene, og vi vil hoppe over denne oppblåsingene når det er nødvendig.

Fisken i den native genereringen av VideoCrafter-rammeverket er statisk, mens FluxFlow-utgaven fanger de nødvendige endringene. Kilde: https://arxiv.org/pdf/2503.15417
Den nye artikkelen heter Temporalt regulering gjør din video-generering sterkere, og kommer fra åtte forskere på Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) og The University of Hong Kong (HKU).
(på tidspunktet for skriving, er det noen problemer med artikkelenes tilhørende prosjektside)
FluxFlow
Den sentrale ideen bak FluxFlow, forfatternes nye forbehandlings-skjema, er å overvinne de utbredte problemene flimmer og temporalt inkonsistens ved å blande blokker og grupper av blokker i de temporale ramme-ordrer mens kildedaten eksponeres for treningprosessen:

Den sentrale ideen bak FluxFlow er å flytte blokker og grupper av blokker til uventede og ikke-temporale posisjoner, som en form for data-forsterkning.
Artikkelen forklarer:
‘[Feil] stammer fra en grunnleggende begrensning: til tross for å bruke store datasett, avhenger nåværende modeller ofte av forenklede temporale mønster i treningdataene (f.eks. faste gå-rettninger eller repetitive ramme-overganger) i stedet for å lære diverse og plausibelt temporale dynamikker.
‘Dette problemet er ytterligere forverret av mangelen på eksplisitt temporalt forsterkning under trening, og etterlater modellene å være utsatt for å overfittes til spuriøse temporale korrelasjoner (f.eks. “ramme #5 må følge #4”) i stedet for å generalisere over diverse bevegelsesscenarier.’
De fleste video-genereringsmodellene, forklarer forfatterne, låner fortsatt for mye fra bilde-syntese, og fokuserer på romlig trofasthet mens de stort sett ignorerer den temporale akse. Til tross for at teknikkene som beskjæring, flipping og farge-jittering har hjulpet til å forbedre den statiske bildekvaliteten, er de ikke tilstrekkelige løsninger når de brukes på videoer, der illusjonen av bevegelse avhenger av konsistente overganger mellom rammene.
De resulterende problemene inkluderer flimmer-teksturer, jarringe klipp mellom rammene og repetitive eller for enkle bevegelsesmønster.
Trykk på å spille.
Artikkelen argumenterer for at til tross for at noen modeller – inkludert Stable Video Diffusion og LlamaGen – kompenserer med stadig mer komplekse arkitekturer eller konstruerte begrensninger, kommer disse på en kostnad i form av beregning og fleksibilitet.
Ettersom temporalt data-forsterkning allerede har vist seg å være nyttig i video forståelse-oppgaver (i rammeverk som FineCliper, SeFAR og SVFormer) er det overraskende, hevder forfatterne, at denne taktikken sjelden brukes i en generativ kontekst.
Disruptivt atferd
Forskerne hevder at enkle, strukturerte forstyrrelser i temporale rekkefølge under trening hjelper modellene å generalisere bedre til realistiske, diverse bevegelser:
‘Ved å trene på forstyrrede sekvenser, lærer generatoren å gjenopprette plausibelt trajektorier, og regulariserer effektivt temporalt entropi. FLUXFLOW broer gapet mellom diskriminativ og generativ temporalt forsterkning, og tilbyr en plug-and-play-forbedringsløsning for temporalt plausibel video-generering, samtidig som den forbedrer den totale kvaliteten.
‘I motsetning til eksisterende metoder som introduserer arkitektoniske endringer eller avhenger av post-prosessering, opererer FLUXFLOW direkte på datanivået, og introduserer kontrollerte temporale forstyrrelser under trening.’
Trykk på å spille.
Ramme-nivå-forstyrrelser, forklarer forfatterne, introduserer fine-grained forstyrrelser innenfor en sekvens. Denne type forstyrrelse er ikke ulik maskering-forsterkning, hvor seksjoner av data er tilfeldig blokkert, for å forhindre at systemet overfittes på datapunkter, og oppmuntre bedre generalisering.
Tester
Til tross for at den sentrale ideen her ikke løper til en fullstendig artikkel, på grunn av sin enkelhet, er det likevel en test-seksjon som vi kan se på.
Forskerne testet for fire spørsmål relatert til forbedret temporalt kvalitet samtidig som de opprettholdt romlig trofasthet; evnen til å lære bevegelse/optisk flyt-dynamikk; opprettholde temporalt kvalitet i eksternt generering; og sensitivitet til nøkkel-hyperparametere.
Forskerne anvendte FluxFlow på tre generative arkitekturer: U-Net-basert, i form av VideoCrafter2; DiT-basert, i form av CogVideoX-2B; og AR-basert, i form av NOVA-0.6B.
For en rettferdig sammenligning, finjusterte de arkitekturenes basis-modeller med FluxFlow som en ekstra trening-fase, for en epoch, på OpenVidHD-0.4M-datasettet.
Modellene ble evaluert mot to populære benchmark: UCF-101; og VBench.
For UCF, ble Fréchet Video Distance (FVD) og Inception Score (IS) metrikker brukt. For VBench, konsentrerte forskerne seg om temporalt kvalitet, rammevis kvalitet og total kvalitet.

Kvantitativ initial evaluering av FluxFlow-Frame. “+ Original” indikerer trening uten FLUXFLOW, mens “+ Num × 1” viser forskjellige FluxFlow-Frame-konfigurasjoner. Beste resultater er skygget; nest beste er understreket for hver modell.
Kommentarer til disse resultater, forklarer forfatterne:
‘Både FLUXFLOW-FRAME og FLUXFLOW-BLOCK forbedrer temporalt kvalitet, som bevist av metrikker i Tab. 1, 2 (dvs. FVD, Subject, Flicker, Motion og Dynamic) og kvalitative resultater i [bilde nedenfor]. ‘
‘For eksempel blir bevegelsen til den drømmende bilen i VC2, katten som jakter på halen i NOVA, og surferen som kjører en bølge i CVX, mer flytende med FLUXFLOW. Viktigst er at disse temporale forbedringene oppnås uten å ofre romlig trofasthet, som bevist av skarpe detaljer i vann-splashing, røyk-spor og bølge-teksturer, samt romlig og total trofasthet-metrikker.’
Nedenfor ser vi utvalg fra de kvalitative resultater forfatterne refererer til (se den originale artikkelen for fullstendige resultater og bedre oppløsning):

Utvalg fra de kvalitative resultater.
Artikkelen foreslår at til tross for at både ramme-nivå- og blokk-nivå-forstyrrelser forbedrer temporalt kvalitet, tenderer ramme-nivå-metoder å fungere bedre. Dette tilskrives deres finere granularitet, som muliggjør mer presise temporale justeringer. Blokk-nivå-forstyrrelser, på den andre siden, kan introdusere støy på grunn av tett sammenkoblede romlige og temporale mønster innen blokker, og redusere deres effektivitet.
Konklusjon
Denne artikkelen, sammen med Bytedance-Tsinghua sammarbeidet om underteksting som ble publisert denne uken, har gjort det klart for meg at de åpenbare manglene i den nye generasjonen av generative video-modeller kanskje ikke skyldes brukerfeil, institusjonelle feil eller begrensninger i finansiering, men heller en forskningsfokus som har prioritet temporalt samhold og konsistens over disse mindre bekymringene.
Inntil nylig var resultater fra fritt tilgjengelige og nedlastbare generative video-systemer så kompromittert at ingen stor innsats oppstod fra entusiast-samfunnet for å rette opp disse problemene (ikke minst fordi problemene var grunnleggende og ikke trivielt løsbare).
Nå som vi er så mye nærmere den lenge forutsagte tiden med rent AI-generert fotorealistisk video-utgang, er det klart at både forsknings- og casual-samfunnene tar en dypere og mer produktiv interesse i å løse de gjenværende problemene; med litt hell er disse ikke uovervinnelige hindringer.
* Wans native ramme-hastighet er en beskjeden 16fps, og som respons på mine egne problemer, noterer jeg at forumene har foreslått å senke ramme-hastigheten så lavt som 12fps, og deretter bruke FlowFrames eller andre AI-baserte om-flytningssystemer til å interpolere mellomrommene mellom så et sparsomt antall rammeverk.
Først publisert fredag, 21. mars 2025












