Andersons vinkel
Bättre generativ AI-video genom att blanda ramarna under träning

En ny artikel som publicerades i veckan på Arxiv tar upp ett problem som alla som har antagit Hunyuan Video eller Wan 2.1 AI-videogenererare har stött på: temporala avvikelser, där den generativa processen tenderar att plötsligt öka hastigheten, sammanfoga, utelämna eller på annat sätt förstöra viktiga ögonblick i en genererad video:
Klicka för att spela upp. Några av de temporala glitchen som blir alltmer bekanta för användare av den nya vågen av generativa videosystem, som framhävs i den nya artikeln. Till höger, den lindrande effekten av den nya FluxFlow-metoden. Källa: https://haroldchen19.github.io/FluxFlow/
Videon ovan innehåller utdrag från exempeltestvideos på (varningar: ganska kaotisk) projektwebbplatsen för artikeln. Vi kan se flera alltmer bekanta problem som åtgärdas av författarnas metod (avbildad till höger i videon), som i princip är en datasetförbehandlingsteknik som kan tillämpas på vilken generativ videarkitektur som helst.
I det första exemplet, som visar “två barn som leker med en boll”, genererad av CogVideoX, ser vi (till vänster i samlingsvideon ovan och i det specifika exemplet nedan) att den naturliga generationen snabbt hoppar över flera viktiga mikrorörelser, och ökar barnens aktivitet till en “tecknad” nivå. I kontrast ger samma dataset och metod bättre resultat med den nya förbehandlingsmetoden, som kallas FluxFlow (till höger om bilden i videon nedan):
Klicka för att spela upp
I det andra exemplet (med NOVA-0.6B) ser vi att en central rörelse som involverar en katt på något sätt har korrumperats eller undersamples vid träningsstadiet, till den grad att den generativa systemet blir “förlamat” och inte kan få föremålet att röra sig:
Klicka för att spela upp
Denna syndrom, där rörelsen eller föremålet blir “fast”, är ett av de vanligaste problemen som rapporteras i HV och Wan, i olika bild- och videosyntesgrupper.
Några av dessa problem är relaterade till videokapitelproblemen i källdatan, som vi tittade på den här veckan; men författarna till det nya arbetet fokuserar sina ansträngningar på de temporala egenskaperna hos träningsdatan istället, och presenterar ett övertygande argument för att hantering av utmaningarna från den synvinkeln kan ge användbara resultat.
Som nämndes i den tidigare artikeln om videokapitel, är vissa sporter särskilt svåra att destillera till nyckelmoment, vilket innebär att kritiska händelser (såsom en dunk) inte får den uppmärksamhet de behöver under träningsfasen:
Klicka för att spela upp
I exemplet ovan vet den generativa systemet inte hur den ska gå vidare till nästa rörelsefas, och övergår illogiskt från en pose till en annan, och ändrar spelarens attityd och geometri under processen.
Detta är stora rörelser som gick förlorade under träningsfasen – men lika sårbara är mycket mindre men avgörande rörelser, såsom flaxandet av en fjärils vingar:
Klicka för att spela upp.
Till skillnad från dunkningen är flaxandet av vingarna inte en “sällsynt” utan snarare en ihållande och monoton händelse. Men dess konsekvens går förlorad i urvalsprocessen, eftersom rörelsen är så snabb att den är mycket svår att etablera temporalt.
Detta är inte särskilt nya problem, men de får nu större uppmärksamhet eftersom kraftfulla generativa videomodeller är tillgängliga för entusiaster för lokal installation och fri generation.
Samhällena på Reddit och Discord har initialt behandlat dessa problem som “användarrelaterade”. Detta är en förståelig antagande, eftersom systemen i fråga är mycket nya och minimalt dokumenterade. Därför har olika experter föreslagit olika (och inte alltid effektiva) lösningar för några av de buggar som dokumenteras här, såsom att ändra inställningarna i olika komponenter av olika typer av ComfyUI-arbetsflöden för Hunyuan Video (HV) och Wan 2.1.
I vissa fall producerar både HV och Wan inte snabb rörelse, utan långsam rörelse. Förslag från Reddit och ChatGPT (som i huvudsak använder Reddit) inkluderar att ändra antalet ramar i den begärda generationen, eller radikalt sänka bildfrekvensen*.
Detta är allt desperat; den framväxande sanningen är att vi ännu inte känner till den exakta orsaken eller den exakta lösningen för dessa problem; det är uppenbart att att plåga generationsinställningarna för att komma runt dem (särskilt när detta försämrar utdatakvaliteten, till exempel med en för låg fps-takt) är bara en tillfällig lösning, och det är bra att se att forskningsscenen hanterar dessa framväxande problem så snabbt.
Så, förutom den här veckans titt på hur kapitel påverkar träningsfasen, låt oss titta på den nya artikeln om temporal reglering, och vilka förbättringar den kan erbjuda den nuvarande generativa videoscenen.
Den centrala idén är ganska enkel och subtil, och inte sämre för det; trots att artikeln är något uppblåst för att nå de åtta föreskrivna sidorna, så kommer vi att hoppa över denna uppblåsthet när det är nödvändigt.

Fisken i den naturliga generationen av VideoCrafter-ramverket är statisk, medan FluxFlow-ändrade versionen fångar de erforderliga förändringarna. Källa: https://arxiv.org/pdf/2503.15417
Det nya arbetet heter Temporal Regularization Makes Your Video Generator Stronger, och kommer från åtta forskare på Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) och The University of Hong Kong (HKU).
(vid tidpunkten för skrivande, finns det vissa problem med artikeln som medföljer projektwebbplatsen)
FluxFlow
Den centrala idén bakom FluxFlow, författarnas nya förträningschema, är att övervinna de allmänna problemen flickering och temporalt ofullständighet genom att blanda block och grupper av block i den temporala ramordningen när källdatan exponeras för träningsprocessen:

Den centrala idén bakom FluxFlow är att flytta block och grupper av block till oväntade och icke-temporala positioner, som en form av dataförstärkning.
Artikeln förklarar:
‘[Artefakter] härrör från en grundläggande begränsning: trots att de använder storskaliga dataset, förlitar sig nuvarande modeller ofta på förenklade temporala mönster i träningsdatat (t.ex. fast gångriktning eller upprepade ramövergångar) snarare än att lära sig olika och trovärdiga temporala dynamik.
‘Detta problem förvärras ytterligare av bristen på explicit temporalt förstärkning under träningsfasen, vilket gör att modellerna är benägna att överanpassa sig till tillfälliga temporala korrelationer (t.ex. “ram #5 måste följa #4”) snarare än att generalisera över olika rörelsescenarier.’
De flesta videogenereringsmodeller, förklarar författarna, lånar fortfarande för mycket från bildsyntes, med fokus på rumslig trohet medan de i huvudsak ignorerar den temporala axeln. Även om tekniker som beskärning, vändning och färgjitter har hjälpt till att förbättra den statiska bildkvaliteten, är de inte tillräckliga lösningar när de tillämpas på videor, där rörelseillusionen beror på konsekventa övergångar mellan ramar.
De resulterande problemen inkluderar flimrande texturer, stötande klipp mellan ramar och upprepade eller alltför enkla rörelsemönster.
Klicka för att spela upp.
Artikeln hävdar att även om vissa modeller – inklusive Stable Video Diffusion och LlamaGen – kompenserar med alltmer komplexa arkitekturer eller konstruerade begränsningar, kommer dessa på bekostnad av beräknings- och flexibilitetskostnader.
Eftersom temporalt dataförstärkning redan har visat sig vara användbar i video förståelseuppgifter (i ramverk som FineCliper, SeFAR och SVFormer) är det förvånande, hävdar författarna, att denna taktik sällan tillämpas i en generativ kontext.
Störande beteende
Forskarna hävdar att enkla, strukturerade störningar i temporal ordning under träningsfasen hjälper modellerna att generalisera bättre till realistiska, varierande rörelser:
‘Genom att träna på oordnade sekvenser lär sig generatoren att återställa trovärdiga banor, och reglerar effektivt den temporala entropin. FLUXFLOW brottas över klyftan mellan diskriminativ och generativ temporalt förstärkning, och erbjuder en plug-and-play-förbättringslösning för temporalt trovärdig videogenerering, samtidigt som den förbättrar den övergripande kvaliteten.
‘Till skillnad från befintliga metoder som introducerar arkitekturförändringar eller förlitar sig på efterbearbetning, fungerar FLUXFLOW direkt på datanivån, och introducerar kontrollerade temporala störningar under träningsfasen.’
Klicka för att spela upp.
Ramnivåstörningar, förklarar författarna, introducerar fina störningar inom en sekvens. Denna typ av störning är inte så olika maskering av förstärkning, där delar av data slumpmässigt blockeras, för att förhindra att systemet överanpassar sig till datapunkter, och uppmuntrar bättre generalisering.
Tester
Även om den centrala idén här inte räcker till en fullständig artikel, på grund av dess enkelhet, finns det ändå ett testavsnitt som vi kan titta på.
Författarna testade för fyra frågor relaterade till förbättrad temporalt kvalitet samtidigt som de upprätthöll rumslig trohet; förmåga att lära sig rörelse/optisk flödesdynamik; upprätthållande av temporalt kvalitet i extraterm generation; och känslighet för viktiga hyperparametrar.
Forskarna tillämpade FluxFlow på tre generativa arkitekturer: U-Net-baserad, i form av VideoCrafter2; DiT-baserad, i form av CogVideoX-2B; och AR-baserad, i form av NOVA-0.6B.
För en rättvis jämförelse, finjusterade de arkitekturernas basmodeller med FluxFlow som en extra träningsfas, under en epoch, på OpenVidHD-0.4M-datat.
Modellerna utvärderades mot två populära benchmark: UCF-101; och VBench.
För UCF användes Fréchet Video Distance (FVD) och Inception Score (IS) metriker. För VBench fokuserade forskarna på temporalt kvalitet, ramvis kvalitet och övergripande kvalitet.

Kvantitativ initial utvärdering av FluxFlow-Frame. “+ Original” indikerar träningsfas utan FLUXFLOW, medan “+ Num × 1” visar olika FluxFlow-Frame-konfigurationer. Bästa resultat är skuggade; andra bästa är understrukna för varje modell.
När de kommenterar dessa resultat, hävdar författarna:
‘Både FLUXFLOW-FRAME och FLUXFLOW-BLOCK förbättrar temporalt kvalitet, som bevisas av metricerna i tabellerna 1, 2 (dvs. FVD, Subject, Flicker, Motion och Dynamic) och kvalitativa resultat i [bild nedan].
‘Till exempel blir rörelsen av den driva bilen i VC2, katten som jagar sin svans i NOVA och surfaren som åker en våg i CVX märkbart mer flytande med FLUXFLOW. Det är viktigt att dessa temporala förbättringar uppnås utan att offra rumslig trohet, som bevisas av de skarpa detaljerna i vattensprut, rökstrimmor och vågtexturer, tillsammans med rumslig och övergripande trohet.
Nedan ser vi urval från de kvalitativa resultaten som författarna hänvisar till (se den ursprungliga artikeln för fullständiga resultat och bättre upplösning):

Urval från de kvalitativa resultaten.
Artikeln föreslår att även om både ramnivå- och blocknivåstörningar förbättrar temporalt kvalitet, tenderar ramnivåmetoder att fungera bättre. Detta tillskrivs deras finare granularitet, som möjliggör mer precisa temporala justeringar. Blocknivåstörningar, å andra sidan, kan introducera brus på grund av tätt sammankopplade rumsliga och temporala mönster inom block, vilket minskar deras effektivitet.
Slutsats
Denna artikel, tillsammans med Bytedance-Tsinghua samarbete om kapitel som släpptes den här veckan, har gjort det klart för mig att de uppenbara bristerna i den nya generationen av generativa videomodeller inte nödvändigtvis beror på användarfel, institutionella misstag eller begränsningar i finansiering, utan snarare på en forskningsfokus som har prioriterat mer brådskande utmaningar, såsom temporalt sammanhang och konsekvens, över dessa mindre problem.
Fram till nyligen var resultaten från fritt tillgängliga och nedladdningsbara generativa videosystem så komprometterade att ingen stor ansträngning från entusiastgemenskapen att åtgärda problemen uppstod (inte minst för att problemen var grundläggande och inte trivialt lösbara).
Nu när vi är så mycket närmare den långvarigt förutsagda eran av renodlat AI-genererade fotorealistiska videooutput, är det uppenbart att både forsknings- och entusiastgemenskaperna tar ett djupare och mer produktivt intresse för att lösa de återstående problemen; med lite tur är dessa inte oövervinnliga hinder.
* Wans naturliga bildfrekvens är en blyg 16fps, och som svar på mina egna problem, noterar jag att forum har föreslagit att sänka bildfrekvensen så lågt som 12fps, och sedan använda FlowFrames eller andra AI-baserade omflödesystem för att interpolera gapen mellan sådana glesa antal ramar.
Publicerad första gången fredagen den 21 mars 2025












