Andersons vinkel

BÃĪttre generativ AI-video genom att blanda ramarna under trÃĪning

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
Adobe Firefly, various prompts and edits.

En ny artikel som publicerades i veckan pÃĨ Arxiv tar upp ett problem som alla som har antagit Hunyuan Video eller Wan 2.1 AI-videogenererare har stÃķtt pÃĨ: temporala avvikelser, dÃĪr den generativa processen tenderar att plÃķtsligt Ãķka hastigheten, sammanfoga, utelÃĪmna eller pÃĨ annat sÃĪtt fÃķrstÃķra viktiga Ãķgonblick i en genererad video:

Klicka fÃķr att spela upp. NÃĨgra av de temporala glitchen som blir alltmer bekanta fÃķr anvÃĪndare av den nya vÃĨgen av generativa videosystem, som framhÃĪvs i den nya artikeln. Till hÃķger, den lindrande effekten av den nya FluxFlow-metoden. KÃĪlla: https://haroldchen19.github.io/FluxFlow/

Videon ovan innehÃĨller utdrag frÃĨn exempeltestvideos pÃĨ (varningar: ganska kaotisk) projektwebbplatsen fÃķr artikeln. Vi kan se flera alltmer bekanta problem som ÃĨtgÃĪrdas av fÃķrfattarnas metod (avbildad till hÃķger i videon), som i princip ÃĪr en datasetfÃķrbehandlingsteknik som kan tillÃĪmpas pÃĨ vilken generativ videarkitektur som helst.

I det fÃķrsta exemplet, som visar “tvÃĨ barn som leker med en boll”, genererad av CogVideoX, ser vi (till vÃĪnster i samlingsvideon ovan och i det specifika exemplet nedan) att den naturliga generationen snabbt hoppar Ãķver flera viktiga mikrorÃķrelser, och Ãķkar barnens aktivitet till en “tecknad” nivÃĨ. I kontrast ger samma dataset och metod bÃĪttre resultat med den nya fÃķrbehandlingsmetoden, som kallas FluxFlow (till hÃķger om bilden i videon nedan):

Klicka fÃķr att spela upp

I det andra exemplet (med NOVA-0.6B) ser vi att en central rÃķrelse som involverar en katt pÃĨ nÃĨgot sÃĪtt har korrumperats eller undersamples vid trÃĪningsstadiet, till den grad att den generativa systemet blir “fÃķrlamat” och inte kan fÃĨ fÃķremÃĨlet att rÃķra sig:

Klicka fÃķr att spela upp

Denna syndrom, dÃĪr rÃķrelsen eller fÃķremÃĨlet blir “fast”, ÃĪr ett av de vanligaste problemen som rapporteras i HV och Wan, i olika bild- och videosyntesgrupper.

NÃĨgra av dessa problem ÃĪr relaterade till videokapitelproblemen i kÃĪlldatan, som vi tittade pÃĨ den hÃĪr veckan; men fÃķrfattarna till det nya arbetet fokuserar sina anstrÃĪngningar pÃĨ de temporala egenskaperna hos trÃĪningsdatan istÃĪllet, och presenterar ett Ãķvertygande argument fÃķr att hantering av utmaningarna frÃĨn den synvinkeln kan ge anvÃĪndbara resultat.

Som nÃĪmndes i den tidigare artikeln om videokapitel, ÃĪr vissa sporter sÃĪrskilt svÃĨra att destillera till nyckelmoment, vilket innebÃĪr att kritiska hÃĪndelser (sÃĨsom en dunk) inte fÃĨr den uppmÃĪrksamhet de behÃķver under trÃĪningsfasen:

Klicka fÃķr att spela upp

I exemplet ovan vet den generativa systemet inte hur den ska gÃĨ vidare till nÃĪsta rÃķrelsefas, och ÃķvergÃĨr illogiskt frÃĨn en pose till en annan, och ÃĪndrar spelarens attityd och geometri under processen.

Detta ÃĪr stora rÃķrelser som gick fÃķrlorade under trÃĪningsfasen – men lika sÃĨrbara ÃĪr mycket mindre men avgÃķrande rÃķrelser, sÃĨsom flaxandet av en fjÃĪrils vingar:

Klicka fÃķr att spela upp.

Till skillnad frÃĨn dunkningen ÃĪr flaxandet av vingarna inte en “sÃĪllsynt” utan snarare en ihÃĨllande och monoton hÃĪndelse. Men dess konsekvens gÃĨr fÃķrlorad i urvalsprocessen, eftersom rÃķrelsen ÃĪr sÃĨ snabb att den ÃĪr mycket svÃĨr att etablera temporalt.

Detta ÃĪr inte sÃĪrskilt nya problem, men de fÃĨr nu stÃķrre uppmÃĪrksamhet eftersom kraftfulla generativa videomodeller ÃĪr tillgÃĪngliga fÃķr entusiaster fÃķr lokal installation och fri generation.

SamhÃĪllena pÃĨ Reddit och Discord har initialt behandlat dessa problem som “anvÃĪndarrelaterade”. Detta ÃĪr en fÃķrstÃĨelig antagande, eftersom systemen i frÃĨga ÃĪr mycket nya och minimalt dokumenterade. DÃĪrfÃķr har olika experter fÃķreslagit olika (och inte alltid effektiva) lÃķsningar fÃķr nÃĨgra av de buggar som dokumenteras hÃĪr, sÃĨsom att ÃĪndra instÃĪllningarna i olika komponenter av olika typer av ComfyUI-arbetsflÃķden fÃķr Hunyuan Video (HV) och Wan 2.1.

I vissa fall producerar bÃĨde HV och Wan inte snabb rÃķrelse, utan lÃĨngsam rÃķrelse. FÃķrslag frÃĨn Reddit och ChatGPT (som i huvudsak anvÃĪnder Reddit) inkluderar att ÃĪndra antalet ramar i den begÃĪrda generationen, eller radikalt sÃĪnka bildfrekvensen*.

Detta ÃĪr allt desperat; den framvÃĪxande sanningen ÃĪr att vi ÃĪnnu inte kÃĪnner till den exakta orsaken eller den exakta lÃķsningen fÃķr dessa problem; det ÃĪr uppenbart att att plÃĨga generationsinstÃĪllningarna fÃķr att komma runt dem (sÃĪrskilt nÃĪr detta fÃķrsÃĪmrar utdatakvaliteten, till exempel med en fÃķr lÃĨg fps-takt) ÃĪr bara en tillfÃĪllig lÃķsning, och det ÃĪr bra att se att forskningsscenen hanterar dessa framvÃĪxande problem sÃĨ snabbt.

SÃĨ, fÃķrutom den hÃĪr veckans titt pÃĨ hur kapitel pÃĨverkar trÃĪningsfasen, lÃĨt oss titta pÃĨ den nya artikeln om temporal reglering, och vilka fÃķrbÃĪttringar den kan erbjuda den nuvarande generativa videoscenen.

Den centrala idÃĐn ÃĪr ganska enkel och subtil, och inte sÃĪmre fÃķr det; trots att artikeln ÃĪr nÃĨgot uppblÃĨst fÃķr att nÃĨ de ÃĨtta fÃķreskrivna sidorna, sÃĨ kommer vi att hoppa Ãķver denna uppblÃĨsthet nÃĪr det ÃĪr nÃķdvÃĪndigt.

Fisken i den naturliga generationen av VideoCrafter-ramverket ÃĪr statisk, medan FluxFlow-ÃĪndrade versionen fÃĨngar de erforderliga fÃķrÃĪndringarna. KÃĪlla: https://arxiv.org/pdf/2503.15417

Fisken i den naturliga generationen av VideoCrafter-ramverket ÃĪr statisk, medan FluxFlow-ÃĪndrade versionen fÃĨngar de erforderliga fÃķrÃĪndringarna. KÃĪlla: https://arxiv.org/pdf/2503.15417

Det nya arbetet heter Temporal Regularization Makes Your Video Generator Stronger, och kommer frÃĨn ÃĨtta forskare pÃĨ Everlyn AI, Hong Kong University of Science and Technology (HKUST), University of Central Florida (UCF) och The University of Hong Kong (HKU).

(vid tidpunkten fÃķr skrivande, finns det vissa problem med artikeln som medfÃķljer projektwebbplatsen)

FluxFlow

Den centrala idÃĐn bakom FluxFlow, fÃķrfattarnas nya fÃķrtrÃĪningschema, ÃĪr att Ãķvervinna de allmÃĪnna problemen flickering och temporalt ofullstÃĪndighet genom att blanda block och grupper av block i den temporala ramordningen nÃĪr kÃĪlldatan exponeras fÃķr trÃĪningsprocessen:

Den centrala idÃĐn bakom FluxFlow ÃĪr att flytta block och grupper av block till ovÃĪntade och icke-temporala positioner, som en form av datafÃķrstÃĪrkning.

Den centrala idÃĐn bakom FluxFlow ÃĪr att flytta block och grupper av block till ovÃĪntade och icke-temporala positioner, som en form av datafÃķrstÃĪrkning.

Artikeln fÃķrklarar:

‘[Artefakter] hÃĪrrÃķr frÃĨn en grundlÃĪggande begrÃĪnsning: trots att de anvÃĪnder storskaliga dataset, fÃķrlitar sig nuvarande modeller ofta pÃĨ fÃķrenklade temporala mÃķnster i trÃĪningsdatat (t.ex. fast gÃĨngriktning eller upprepade ramÃķvergÃĨngar) snarare ÃĪn att lÃĪra sig olika och trovÃĪrdiga temporala dynamik.

‘Detta problem fÃķrvÃĪrras ytterligare av bristen pÃĨ explicit temporalt fÃķrstÃĪrkning under trÃĪningsfasen, vilket gÃķr att modellerna ÃĪr benÃĪgna att Ãķveranpassa sig till tillfÃĪlliga temporala korrelationer (t.ex. “ram #5 mÃĨste fÃķlja #4”) snarare ÃĪn att generalisera Ãķver olika rÃķrelsescenarier.’

De flesta videogenereringsmodeller, fÃķrklarar fÃķrfattarna, lÃĨnar fortfarande fÃķr mycket frÃĨn bildsyntes, med fokus pÃĨ rumslig trohet medan de i huvudsak ignorerar den temporala axeln. Även om tekniker som beskÃĪrning, vÃĪndning och fÃĪrgjitter har hjÃĪlpt till att fÃķrbÃĪttra den statiska bildkvaliteten, ÃĪr de inte tillrÃĪckliga lÃķsningar nÃĪr de tillÃĪmpas pÃĨ videor, dÃĪr rÃķrelseillusionen beror pÃĨ konsekventa ÃķvergÃĨngar mellan ramar.

De resulterande problemen inkluderar flimrande texturer, stÃķtande klipp mellan ramar och upprepade eller alltfÃķr enkla rÃķrelsemÃķnster.

Klicka fÃķr att spela upp.

Artikeln hÃĪvdar att ÃĪven om vissa modeller – inklusive Stable Video Diffusion och LlamaGen – kompenserar med alltmer komplexa arkitekturer eller konstruerade begrÃĪnsningar, kommer dessa pÃĨ bekostnad av berÃĪknings- och flexibilitetskostnader.

Eftersom temporalt datafÃķrstÃĪrkning redan har visat sig vara anvÃĪndbar i video fÃķrstÃĨelseuppgifter (i ramverk som FineCliper, SeFAR och SVFormer) ÃĪr det fÃķrvÃĨnande, hÃĪvdar fÃķrfattarna, att denna taktik sÃĪllan tillÃĪmpas i en generativ kontext.

StÃķrande beteende

Forskarna hÃĪvdar att enkla, strukturerade stÃķrningar i temporal ordning under trÃĪningsfasen hjÃĪlper modellerna att generalisera bÃĪttre till realistiska, varierande rÃķrelser:

‘Genom att trÃĪna pÃĨ oordnade sekvenser lÃĪr sig generatoren att ÃĨterstÃĪlla trovÃĪrdiga banor, och reglerar effektivt den temporala entropin. FLUXFLOW brottas Ãķver klyftan mellan diskriminativ och generativ temporalt fÃķrstÃĪrkning, och erbjuder en plug-and-play-fÃķrbÃĪttringslÃķsning fÃķr temporalt trovÃĪrdig videogenerering, samtidigt som den fÃķrbÃĪttrar den Ãķvergripande kvaliteten.

‘Till skillnad frÃĨn befintliga metoder som introducerar arkitekturfÃķrÃĪndringar eller fÃķrlitar sig pÃĨ efterbearbetning, fungerar FLUXFLOW direkt pÃĨ datanivÃĨn, och introducerar kontrollerade temporala stÃķrningar under trÃĪningsfasen.’

Klicka fÃķr att spela upp.

RamnivÃĨstÃķrningar, fÃķrklarar fÃķrfattarna, introducerar fina stÃķrningar inom en sekvens. Denna typ av stÃķrning ÃĪr inte sÃĨ olika maskering av fÃķrstÃĪrkning, dÃĪr delar av data slumpmÃĪssigt blockeras, fÃķr att fÃķrhindra att systemet Ãķveranpassar sig till datapunkter, och uppmuntrar bÃĪttre generalisering.

Tester

Även om den centrala idÃĐn hÃĪr inte rÃĪcker till en fullstÃĪndig artikel, pÃĨ grund av dess enkelhet, finns det ÃĪndÃĨ ett testavsnitt som vi kan titta pÃĨ.

FÃķrfattarna testade fÃķr fyra frÃĨgor relaterade till fÃķrbÃĪttrad temporalt kvalitet samtidigt som de upprÃĪtthÃķll rumslig trohet; fÃķrmÃĨga att lÃĪra sig rÃķrelse/optisk flÃķdesdynamik; upprÃĪtthÃĨllande av temporalt kvalitet i extraterm generation; och kÃĪnslighet fÃķr viktiga hyperparametrar.

Forskarna tillÃĪmpade FluxFlow pÃĨ tre generativa arkitekturer: U-Net-baserad, i form av VideoCrafter2; DiT-baserad, i form av CogVideoX-2B; och AR-baserad, i form av NOVA-0.6B.

FÃķr en rÃĪttvis jÃĪmfÃķrelse, finjusterade de arkitekturernas basmodeller med FluxFlow som en extra trÃĪningsfas, under en epoch, pÃĨ OpenVidHD-0.4M-datat.

Modellerna utvÃĪrderades mot tvÃĨ populÃĪra benchmark: UCF-101; och VBench.

FÃķr UCF anvÃĪndes FrÃĐchet Video Distance (FVD) och Inception Score (IS) metriker. FÃķr VBench fokuserade forskarna pÃĨ temporalt kvalitet, ramvis kvalitet och Ãķvergripande kvalitet.

Kvantitativ initial utvÃĪrdering av FluxFlow-Frame.

Kvantitativ initial utvÃĪrdering av FluxFlow-Frame. “+ Original” indikerar trÃĪningsfas utan FLUXFLOW, medan “+ Num × 1” visar olika FluxFlow-Frame-konfigurationer. BÃĪsta resultat ÃĪr skuggade; andra bÃĪsta ÃĪr understrukna fÃķr varje modell.

NÃĪr de kommenterar dessa resultat, hÃĪvdar fÃķrfattarna:

‘BÃĨde FLUXFLOW-FRAME och FLUXFLOW-BLOCK fÃķrbÃĪttrar temporalt kvalitet, som bevisas av metricerna i tabellerna 1, 2 (dvs. FVD, Subject, Flicker, Motion och Dynamic) och kvalitativa resultat i [bild nedan].

‘Till exempel blir rÃķrelsen av den driva bilen i VC2, katten som jagar sin svans i NOVA och surfaren som ÃĨker en vÃĨg i CVX mÃĪrkbart mer flytande med FLUXFLOW. Det ÃĪr viktigt att dessa temporala fÃķrbÃĪttringar uppnÃĨs utan att offra rumslig trohet, som bevisas av de skarpa detaljerna i vattensprut, rÃķkstrimmor och vÃĨgtexturer, tillsammans med rumslig och Ãķvergripande trohet.

Nedan ser vi urval frÃĨn de kvalitativa resultaten som fÃķrfattarna hÃĪnvisar till (se den ursprungliga artikeln fÃķr fullstÃĪndiga resultat och bÃĪttre upplÃķsning):

Urval frÃĨn de kvalitativa resultaten.

Urval frÃĨn de kvalitativa resultaten.

Artikeln fÃķreslÃĨr att ÃĪven om bÃĨde ramnivÃĨ- och blocknivÃĨstÃķrningar fÃķrbÃĪttrar temporalt kvalitet, tenderar ramnivÃĨmetoder att fungera bÃĪttre. Detta tillskrivs deras finare granularitet, som mÃķjliggÃķr mer precisa temporala justeringar. BlocknivÃĨstÃķrningar, ÃĨ andra sidan, kan introducera brus pÃĨ grund av tÃĪtt sammankopplade rumsliga och temporala mÃķnster inom block, vilket minskar deras effektivitet.

Slutsats

Denna artikel, tillsammans med Bytedance-Tsinghua samarbete om kapitel som slÃĪpptes den hÃĪr veckan, har gjort det klart fÃķr mig att de uppenbara bristerna i den nya generationen av generativa videomodeller inte nÃķdvÃĪndigtvis beror pÃĨ anvÃĪndarfel, institutionella misstag eller begrÃĪnsningar i finansiering, utan snarare pÃĨ en forskningsfokus som har prioriterat mer brÃĨdskande utmaningar, sÃĨsom temporalt sammanhang och konsekvens, Ãķver dessa mindre problem.

Fram till nyligen var resultaten frÃĨn fritt tillgÃĪngliga och nedladdningsbara generativa videosystem sÃĨ komprometterade att ingen stor anstrÃĪngning frÃĨn entusiastgemenskapen att ÃĨtgÃĪrda problemen uppstod (inte minst fÃķr att problemen var grundlÃĪggande och inte trivialt lÃķsbara).

Nu nÃĪr vi ÃĪr sÃĨ mycket nÃĪrmare den lÃĨngvarigt fÃķrutsagda eran av renodlat AI-genererade fotorealistiska videooutput, ÃĪr det uppenbart att bÃĨde forsknings- och entusiastgemenskaperna tar ett djupare och mer produktivt intresse fÃķr att lÃķsa de ÃĨterstÃĨende problemen; med lite tur ÃĪr dessa inte oÃķvervinnliga hinder.

 

* Wans naturliga bildfrekvens ÃĪr en blyg 16fps, och som svar pÃĨ mina egna problem, noterar jag att forum har fÃķreslagit att sÃĪnka bildfrekvensen sÃĨ lÃĨgt som 12fps, och sedan anvÃĪnda FlowFrames eller andra AI-baserade omflÃķdesystem fÃķr att interpolera gapen mellan sÃĨdana glesa antal ramar.

Publicerad fÃķrsta gÃĨngen fredagen den 21 mars 2025

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]