Andersons vinkel

AI-video fÃķrbÃĪttrar kattselfie

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

AI-videogenereringsverktyg ger ofta resultat som ÃĪr nÃĪra, men inte riktigt, vad som Ãķnskades i textprompten. Men en ny hÃķgnivÃĨkorrektion gÃķr all skillnad.

 

Generativa videosystem har ofta svÃĨrt att skapa videor som ÃĪr riktigt kreativa eller vilda, och ofta lever de inte upp till anvÃĪndarnas textpromptsfÃķrvÃĪntningar.

En del av orsaken till detta ÃĪr sammanflÃĪtning – det faktum att vision/sprÃĨkmodeller mÃĨste kompromissa med hur lÃĪnge de trÃĪnar pÃĨ sina kÃĪlldata. FÃķr lite trÃĪning, och koncepten ÃĪr flexibla, men inte fullt utvecklade – fÃķr mycket, och koncepten ÃĪr exakta, men inte lÃĪngre tillrÃĪckligt flexibla fÃķr att inkorporera i nya kombinationer.

Man kan fÃĨ en idÃĐ frÃĨn den ingraverade videon nedan. Till vÃĪnster ÃĪr den typ av kompromiss som mÃĨnga AI-system levererar som svar pÃĨ en krÃĪvande prompt (prompten ÃĪr i toppen av videon i alla fyra exemplen) som ber om en viss kombination av element som ÃĪr fÃķr fantastisk fÃķr att ha varit ett riktigt trÃĪningsexempel. Till hÃķger ÃĪr en AI-utdata som fÃķljer prompten mycket bÃĪttre:

Klicka fÃķr att spela upp (ingen ljud). Till hÃķger ser vi ‘factorized’ WAN 2.2 som verkligen levererar pÃĨ prompten, i jÃĪmfÃķrelse med de suddiga tolkningarna av ‘vanilla’ Wan 2.2., till vÃĪnster. VÃĪnligen se kÃĪllvideofiler fÃķr bÃĪttre upplÃķsning och mÃĨnga fler exempel, ÃĪven om de kuraterade versionerna som visas hÃĪr inte finns pÃĨ projektwebbplatsen och har satts samman fÃķr den hÃĪr artikeln. KÃĪlla

Det ÃĪr tydligt att exemplen till hÃķger fÃķljer den ursprungliga textprompten mycket bÃĪttre ÃĪn de till vÃĪnster.

Intressant nog ÃĪr bÃĨda arkitekturerna i princip samma – den populÃĪra och mycket kapabla Wan 2.2, en kinesisk release som har vunnit mark i den Ãķppna kÃĪllkoden och hobbyistgemenskapen i ÃĨr.

Skillnaden ÃĪr att den andra generativa pipeline ÃĪr factoriserad, vilket i det hÃĪr fallet betyder att en stor sprÃĨkmodell (LLM) har anvÃĪnts fÃķr att tolka om den fÃķrsta (seed) ramen i videon, sÃĨ att det blir mycket lÃĪttare fÃķr systemet att leverera vad anvÃĪndaren ber om.

Denna ‘visuella fÃķrankring’ innebÃĪr att en bild skapad frÃĨn denna LLM-fÃķrbÃĪttrade prompt injiceras i den generativa pipeline som en ‘startbild’, och att en LoRA-tolkningsmodell anvÃĪnds fÃķr att hjÃĪlpa till att integrera ‘inkrÃĪktar’-ramen i videokreationsprocessen.

Resultaten, i termer av prompttrohet, ÃĪr ganska anmÃĪrkningsvÃĪrda, sÃĪrskilt fÃķr en lÃķsning som verkar ganska elegant:

Klicka fÃķr att spela upp (ingen ljud). Flera exempel pÃĨ ‘factorized’ videogenerering som verkligen fÃķljer manus. VÃĪnligen se kÃĪllvideofiler fÃķr bÃĪttre upplÃķsning och mÃĨnga fler exempel, ÃĪven om de kuraterade versionerna som visas hÃĪr inte finns pÃĨ projektwebbplatsen och har satts samman fÃķr den hÃĪr artikeln.

Denna lÃķsning kommer i form av den nya artikeln Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, och dess videofyllda projektwebbplats.

Medan mÃĨnga nuvarande system fÃķrsÃķker fÃķrbÃĪttra promptexakthet genom att anvÃĪnda sprÃĨkmodeller fÃķr att omformulera suddiga eller underspecificerade texter, hÃĪvdar den nya artikeln att denna strategi fortfarande leder till misslyckande nÃĪr modellens inre scenerpresentation ÃĪr felaktig.

Även med en detaljerad omformulerad prompt, misslyckas text-till-video-modeller ofta med att komponera nyckelelement eller generera ofÃķrenliga initialtillstÃĨnd som bryter mot animationens logik. SÃĨ lÃĪnge den fÃķrsta ramen inte ÃĨterspeglar vad prompten beskriver, kan den resulterande videon inte ÃĨterhÃĪmta sig, oavsett hur bra rÃķrelsemodellen ÃĪr.

Artikeln hÃĪvdar*:

‘[Text-till-video] modeller producerar ofta distributionellt fÃķrskjutna ramar, men uppnÃĨr ÃĪndÃĨ [utvÃĪrderingspoÃĪng] som ÃĪr jÃĪmfÃķrbara med I2V-modeller, vilket indikerar att deras rÃķrelsemodellering fÃķrblir rimligt naturlig ÃĪven nÃĪr scenernas trohet ÃĪr relativt dÃĨlig.

‘[Bild-till-video] modeller visar det komplementÃĪra beteendet, starka [utvÃĪrderingspoÃĪng] frÃĨn exakta initiala scener och svagare temporalt sammanhang, medan I2V+text balanserar bÃĨda aspekterna.

‘Denna kontrast tyder pÃĨ en strukturmÃĪssig missmatchning i nuvarande T2V-modeller: scenernas fÃķrankring och temporalt sammanhang dra nytta av olika induktiva fÃķrdomar, men existerande arkitekturer fÃķrsÃķker lÃĪra sig bÃĨda samtidigt inom en enda modell.’

En diagnostisk jÃĪmfÃķrelse av genereringslÃĪgen fann att modeller utan explicit scenerfÃķrankring presterade bra pÃĨ rÃķrelse, men ofta komprometterade med scenernas layout, medan bildbaserade tillvÃĪgagÃĨngssÃĪtt visade det motsatta mÃķnstret:

JÃĪmfÃķrelse av videogenereringslÃĪgen pÃĨ tvÃĨ datamÃĪngder, som visar att I2V+text uppnÃĨr den bÃĪsta ramkvaliteten (FID) och temporalt sammanhang (FVD), och betonar fÃķrdelen med att separera scenernas konstruktion frÃĨn rÃķrelse.

JÃĪmfÃķrelse av videogenereringslÃĪgen pÃĨ tvÃĨ datamÃĪngder, som visar att I2V+text uppnÃĨr den bÃĪsta ramkvaliteten (FID) och temporalt sammanhang (FVD), och betonar fÃķrdelen med att separera scenernas konstruktion frÃĨn rÃķrelse. KÃĪlla

De hÃĪr resultaten pekar pÃĨ en strukturmÃĪssig brist dÃĪr nuvarande modeller fÃķrsÃķker lÃĪra sig bÃĨde scenernas layout och animation pÃĨ en gÃĨng, ÃĪven om de tvÃĨ uppgifterna krÃĪver olika typer av induktiv fÃķrdom, och hanteras bÃĪttre separat.

Kanske ÃĪr det mest intressanta att denna ‘trick’ potentiellt kan tillÃĪmpas pÃĨ lokala installationer av modeller som Wan 2.1 och 2.2, och liknande videodiffusionsmodeller som Hunyuan Video. Anekdotiskt, jÃĪmfÃķrt med kvaliteten pÃĨ hobbyistutdata med kommersiella generativa portaler som Kling och Runway, fÃķrbÃĪttrar de flesta stora API-leverantÃķrerna sina Ãķppna kÃĪllkods erbjudanden med LoRAs, och – det verkar – med knep av det slag som ses i den nya artikeln. DÃĪrfÃķr kan denna specifika tillvÃĪgagÃĨngssÃĪtt representera en upphÃĪmtning fÃķr FOSS-kontingenten.

Tester som utfÃķrdes fÃķr metoden visar att denna enkla och modulÃĪra tillvÃĪgagÃĨngssÃĪtt erbjuder en ny state-of-the-art pÃĨ T2V-CompBench-benchmarken, och fÃķrbÃĪttrar alla testade modeller avsevÃĪrt. FÃķrfattarna noterar i slutsatsen att deras system radikalt fÃķrbÃĪttrar troheten, men adresserar inte (och ÃĪr inte avsett att adressera) identitetsdrift, som fÃķr nÃĪrvarande ÃĪr generativ AI-forsknings stÃķrsta utmaning.

Den nya artikeln kommer frÃĨn fyra forskare vid Ecole Polytechnique FÃĐdÃĐrale de Lausanne (EPFL) i Schweiz.

Metod och data

Den centrala propositionen i den nya tekniken ÃĪr att text-till-video (T2V) diffusionsmodeller behÃķver ‘ankras’ till startbilder som verkligen passar den Ãķnskade textprompten.

FÃķr att sÃĪkerstÃĪlla att modellen respekterar startbilden, stÃķr den nya metoden den standarddiffusionsprocessen genom att injicera en ren latent frÃĨn ankarmodellen vid tidssteg noll, och ersÃĪtter en av de vanliga bullriga inmatningarna. Denna ovÃĪntade inmatning fÃķrvirrar modellen till en bÃķrjan, men med minimal LoRA finjustering lÃĪr den sig att behandla den injicerade ramen som en fast visuell fÃķrankring snarare ÃĪn en del av bullerbanan:

En tvÃĨstegsmetod fÃķr att fÃķrankra text-till-video-generering med en visuell fÃķrankring: VÃĪnster, modellen finjusteras med hjÃĪlp av en lÃĪtt LoRA fÃķr att behandla en injicerad ren latent som en fast scenerestriktion. HÃķger, prompten delas upp i en fÃķrsta-ram-kapitel, som anvÃĪnds fÃķr att generera ankarmodellen som vÃĪgleder videon.

En tvÃĨstegsmetod fÃķr att fÃķrankra text-till-video-generering med en visuell fÃķrankring: VÃĪnster, modellen finjusteras med hjÃĪlp av en lÃĪtt LoRA fÃķr att behandla en injicerad ren latent som en fast scenerestriktion. HÃķger, prompten delas upp i en fÃķrsta-ram-kapitel, som anvÃĪnds fÃķr att generera ankarmodellen som vÃĪgleder videon.

Vid inferens, skrivs prompten om fÃķr att beskriva endast den fÃķrsta ramen, med hjÃĪlp av en LLM fÃķr att extrahera en rimlig initialscener tillstÃĨnd fokuserad pÃĨ layout och utseende.

Denna omskrivna prompt skickas till en bildgenerator fÃķr att producera en kandidatankarmodell (som kan valfritt fÃķrfinas av anvÃĪndaren). Den valda ramen kodas till en latent och injiceras i diffusionsprocessen genom att ersÃĪtta det fÃķrsta tidssteget, vilket tillÃĨter modellen att generera resten av videon medan den fÃķrblir fÃķrankrad till den initiala scenen – en process som fungerar utan att krÃĪva ÃĪndringar i den underliggande arkitekturen.

Processen testades genom att skapa LoRAs fÃķr Wan2.2-14B, Wan2.1-1B och CogVideo1.5-5B. LoRA-trÃĪningen utfÃķrdes vid en rang pÃĨ 256, pÃĨ 5000 slumpmÃĪssigt valda klipp frÃĨn UltraVideo-samlingen.

TrÃĪningen varade i 6000 steg och krÃĪvde 48 GPU-timmar† fÃķr Wan-1B och CogVideo-5B, och 96 GPU-timmar fÃķr Wan-14B. FÃķrfattarna noterar att Wan-5B stÃķder text-endast och text-bild-konditionering (vilket i det hÃĪr fallet pÃĨtvingas de ÃĪldre ramverken), och krÃĪvde dÃĪrfÃķr ingen fullstÃĪndig omtrÃĪning.

Tester

I de experiment som utfÃķrdes fÃķr processen, fÃķrfinades varje textprompt initialt med hjÃĪlp av Qwen2.5-7B-Instruct, som anvÃĪnde resultatet fÃķr att generera en detaljerad ‘seed image’-kapitel som innehÃķll en beskrivning av hela scenen. Detta skickades sedan till QwenImage, som fick i uppgift att generera ‘magiska ramen’ som skulle injiceras i diffusionsprocessen.

De benchmark som anvÃĪndes fÃķr att utvÃĪrdera systemet inkluderade den ovannÃĪmnda T2V-CompBench, fÃķr att testa kompositionsfÃķrstÃĨelse genom att poÃĪngsÃĪtta hur vÃĪl modellerna bevarade objekt, attribut och ÃĨtgÃĪrder inom en sammanhÃĪngande scen; och VBench 2.0, fÃķr att utvÃĪrdera bredare resonemang och sammanhang Ãķver 18 mÃĨtt, grupperade i kreativitet, allmÃĪnbildningsresonemang, kontroll, mÃĪnsklig trohet och fysik:

Över alla sju utvÃĪrderingskategorier i T2V-CompBench, ÃķvertrÃĪffade den factoriserade T2V-metoden bÃĨde standard- och uppsamlade T2V-baslinjer fÃķr varje testad modell, med vinster pÃĨ upp till 53,25%. De hÃķgst rankade varianterna matchade ofta eller ÃķvertrÃĪffade den proprietÃĪra PixVerse-V3-benchmarken.

Över alla sju utvÃĪrderingskategorier i T2V-CompBench, ÃķvertrÃĪffade den factoriserade T2V-metoden bÃĨde standard- och uppsamlade T2V-baslinjer fÃķr varje testad modell, med vinster pÃĨ upp till 53,25%. De hÃķgst rankade varianterna matchade ofta eller ÃķvertrÃĪffade den proprietÃĪra PixVerse-V3-benchmarken.

FÃķrfattarna noterar*:

‘[Över] alla modeller, fÃķrbÃĪttrar tillÃĪgg av en ankarmodell konsekvent kompositionella prestationer. Alla mindre factoriserade modeller (CogVideo 5B, Wan 5B och Wan 1B) ÃķvertrÃĪffar den stÃķrre Wan 14B T2V-modellen.

‘VÃĨr factoriserade Wan 5B ÃķvertrÃĪffar ocksÃĨ den kommersiella PixVerse-V3-baslinjen, som ÃĪr den bÃĪsta rapporterade modellen pÃĨ benchmarken. Detta visar att visuell fÃķrankring vÃĪsentligt fÃķrbÃĪttrar scener och ÃĨtgÃĪrdsfÃķrstÃĨelse, ÃĪven i mindre kapacitetsmodeller.

‘Inom varje modellfamilj, ÃķvertrÃĪffar den factoriserade versionen den ursprungliga modellen. Noterbart, vÃĨr lÃĪtta ankarmodell-baserade LoRA pÃĨ WAN 14B nÃĨr prestationer som ÃĪr jÃĪmfÃķrbara med dess fÃķrtrÃĪnade I2V 14B-variant (0,661 vs. 0,666), trots att den inte krÃĪver nÃĨgon fullstÃĪndig omtrÃĪning.’

DÃĪrefter fÃķljde VBench2.0-rundan:

Den factoriserade T2V-metoden fÃķrbÃĪttrar konsekvent VBench 2.0-prestationer Ãķver komposition, allmÃĪnbildningsresonemang, kontroll och fysik, med vissa vinster som Ãķverstiger 60% – ÃĪven om mÃĪnsklig trohet fÃķrblev under den proprietÃĪra Veo 3-baslinjen.

Den factoriserade T2V-metoden fÃķrbÃĪttrar konsekvent VBench 2.0-prestationer Ãķver komposition, allmÃĪnbildningsresonemang, kontroll och fysik, med vissa vinster som Ãķverstiger 60% – ÃĪven om mÃĪnsklig trohet fÃķrblev under den proprietÃĪra Veo 3-baslinjen.

Över alla arkitekturer, fÃķrbÃĪttrade den factoriserade metoden poÃĪngen i varje VBench-kategori utom mÃĪnsklig trohet, som nÃĨgot minskade ÃĪven med prompt-Ãķversampling. WAN 5B ÃķvertrÃĪffade den stÃķrre WAN 14B, vilket stÃķder tidigare T2V-CompBench-resultat som visade att visuell fÃķrankring bidrog mer ÃĪn skala.

Medan vinsterna pÃĨ VBench var konsekventa, var de mindre ÃĪn de som sÃĨgs pÃĨ T2V-CompBench, och fÃķrfattarna tillskriver detta VBenchs striktare binÃĪra poÃĪngsÃĪttningsregim.

FÃķr de kvalitativa testerna, tillhandahÃĨller artikeln statiska bilder, men vi hÃĪnvisar lÃĪsaren till de sammansatta videorna ingraverade i den hÃĪr artikeln, fÃķr en tydligare idÃĐ, med fÃķrbehÃĨllet att kÃĪllvideorna ÃĪr mer talrika och varierade, samt har hÃķgre upplÃķsning och detalj. Hitta dem hÃĪr. FÃķrfattarna noterar*:

‘Ankramodell-videor visar konsekvent mer exakt scenerkomposition, starkare objekt-attributbindning och tydligare temporalt framsteg.’

Den factoriserade metoden fÃķrblev stabil ÃĪven nÃĪr antalet diffusionssteg minskades frÃĨn 50 till 15, och visade nÃĪstan ingen prestandafÃķrlust pÃĨ T2V-CompBench. I kontrast, fÃķrsÃĪmrades bÃĨde text-endast och uppsamlade baslinjer kraftigt under samma fÃķrhÃĨllanden.

Även om minskning av steg teoretiskt sett kunde tredubbla hastigheten, blev den fullstÃĪndiga genereringspipelinen endast 2,1 gÃĨnger snabbare i praktiken, pÃĨ grund av fasta kostnader frÃĨn ankarmodellsgenerering. Trots detta, visade resultaten att ankring inte bara fÃķrbÃĪttrade exempelkvalitet, utan ocksÃĨ hjÃĪlpte till att stabilisera diffusionsprocessen, vilket stÃķder snabbare och mer effektiv generering utan fÃķrlust i exakthet.

Projektwebbplatsen tillhandahÃĨller exempel pÃĨ uppsamlade vs. nya metoder-genereringar, av vilka vi erbjuder nÃĨgra (lÃĪgre upplÃķsning) redigerade exempel hÃĪr:

Klicka fÃķr att spela upp (ingen ljud). Uppsamling av startkÃĪllor vs. fÃķrfattarnas factoriserade tillvÃĪgagÃĨngssÃĪtt.

FÃķrfattarna drar fÃķljande slutsats*:

‘VÃĨra resultat tyder pÃĨ att fÃķrbÃĪttrad fÃķrankring, snarare ÃĪn Ãķkad kapacitet ensam, kan vara lika viktigt. Senaste framsteg inom T2V-diffusion har i stor utstrÃĪckning fÃķrlitat sig pÃĨ att Ãķka modellstorlek och trÃĪningsdata, men ÃĪven stora modeller kÃĪmpar ofta fÃķr att hÃĪrleda en sammanhÃĪngande initial scen frÃĨn texten.

‘Detta skiljer sig frÃĨn bild-diffusion, dÃĪr skalning ÃĪr relativt enkelt; i videomodeller, mÃĨste varje arkitektonisk fÃķrbÃĪttring fungera Ãķver en ytterligare temporald dimension, vilket gÃķr skalning avsevÃĪrt mer resurskrÃĪvande.

‘VÃĨra fynd tyder pÃĨ att fÃķrbÃĪttrad fÃķrankring kan komplettera skala genom att hantera en annan flaskhals: att etablera den korrekta scenen innan rÃķrelsesyntes bÃķrjar.

‘Genom att factorisera videogenerering i scenerkonstruktion och temporalt modellering, mildrar vi flera vanliga felmoder utan att krÃĪva avsevÃĪrt stÃķrre modeller. Vi ser detta som ett kompletterande designprincip som kan vÃĪgleda framtida arkitekturer mot mer tillfÃķrlitlig och strukturerad videosyntes.’

Slutsats

Även om problemen med sammanflÃĪtning ÃĪr mycket verkliga, och kan krÃĪva dedikerade lÃķsningar (sÃĨsom fÃķrbÃĪttrad curation och distributionsutvÃĪrdering fÃķre trÃĪning), har det varit en ÃķgonÃķppnare att se factorisering ‘lossa’ flera envisa och ‘fastnar’ konceptprompt-arrangemang till mycket mer exakta ÃĨtergivningar – med endast en mÃĨttlig skikt av LoRA-konditionering, och ingreppet av en anmÃĪrkningsvÃĪrt fÃķrbÃĪttrad start-/seed-bild.

Klyftan i resurser mellan lokal hobbyist-inferens och kommersiella lÃķsningar kanske inte ÃĪr sÃĨ enorm som man kan tro, med tanke pÃĨ att nÃĪstan alla leverantÃķrer fÃķrsÃķker rationalisera sin betydande GPU-resursutlÃĪgg till konsumenter.

Anekdotiskt, verkar en mycket stor andel av de nuvarande generativa videoleverantÃķrerna anvÃĪnda varumÃĪrkesskyddade och generellt ‘uppgraderade’ versioner av kinesiska FOSS-modeller. Den huvudsakliga ‘vallgrav’ som dessa ‘mellanhand’-system verkar ha ÃĪr att de har tagit sig tid att trÃĪna LoRAs, eller ocksÃĨ – till stÃķrre kostnad och nÃĨgot stÃķrre belÃķning – faktiskt genomfÃķrt en fullstÃĪndig finjustering av modellvikterna††.

Insikter av det hÃĪr slaget kunde hjÃĪlpa till att minska den klyftan ytterligare, i en utgÃĨvscen dÃĪr kineserna verkar vara beslutna (inte nÃķdvÃĪndigtvis av altruistiska eller idealistiska skÃĪl) att demokratisera generativ AI, medan vÃĪsterlÃĪndska affÃĪrsintressen kanske fÃķredrar att Ãķka modellstorleken och regleringarna, sÃĨ att de bÃĪsta modellerna sÃĨ smÃĨningom hamnar bakom API:er och flera lager av innehÃĨllsfilter.

 

* FÃķrfattarnas betoning, inte min.

† Artikeln specificerar inte vilken GPU som valdes, eller hur mÃĨnga som anvÃĪndes.

†† Även om LoRA-vÃĪgen ÃĪr mer sannolik, bÃĨde fÃķr ekonomisk enkelhet och fÃķr att fulla vikter, snarare ÃĪn kvantiserade vikter, inte alltid ÃĪr tillgÃĪngliga.

Publicerad fÃķrsta gÃĨngen fredagen den 19 december 2025

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]