Andersons vinkel

AI-video förbättrar kattselfie

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

AI-videogenereringsverktyg ger ofta resultat som är nära, men inte riktigt, vad som önskades i textprompten. Men en ny högnivåkorrektion gör all skillnad.

 

Generativa videosystem har ofta svårt att skapa videor som är riktigt kreativa eller vilda, och ofta lever de inte upp till användarnas textpromptsförväntningar.

En del av orsaken till detta är sammanflätning – det faktum att vision/språkmodeller måste kompromissa med hur länge de tränar på sina källdata. För lite träning, och koncepten är flexibla, men inte fullt utvecklade – för mycket, och koncepten är exakta, men inte längre tillräckligt flexibla för att inkorporera i nya kombinationer.

Man kan få en idé från den ingraverade videon nedan. Till vänster är den typ av kompromiss som många AI-system levererar som svar på en krävande prompt (prompten är i toppen av videon i alla fyra exemplen) som ber om en viss kombination av element som är för fantastisk för att ha varit ett riktigt träningsexempel. Till höger är en AI-utdata som följer prompten mycket bättre:

Klicka för att spela upp (ingen ljud). Till höger ser vi ‘factorized’ WAN 2.2 som verkligen levererar på prompten, i jämförelse med de suddiga tolkningarna av ‘vanilla’ Wan 2.2., till vänster. Vänligen se källvideofiler för bättre upplösning och många fler exempel, även om de kuraterade versionerna som visas här inte finns på projektwebbplatsen och har satts samman för den här artikeln. Källa

Det är tydligt att exemplen till höger följer den ursprungliga textprompten mycket bättre än de till vänster.

Intressant nog är båda arkitekturerna i princip samma – den populära och mycket kapabla Wan 2.2, en kinesisk release som har vunnit mark i den öppna källkoden och hobbyistgemenskapen i år.

Skillnaden är att den andra generativa pipeline är factoriserad, vilket i det här fallet betyder att en stor språkmodell (LLM) har använts för att tolka om den första (seed) ramen i videon, så att det blir mycket lättare för systemet att leverera vad användaren ber om.

Denna ‘visuella förankring’ innebär att en bild skapad från denna LLM-förbättrade prompt injiceras i den generativa pipeline som en ‘startbild’, och att en LoRA-tolkningsmodell används för att hjälpa till att integrera ‘inkräktar’-ramen i videokreationsprocessen.

Resultaten, i termer av prompttrohet, är ganska anmärkningsvärda, särskilt för en lösning som verkar ganska elegant:

Klicka för att spela upp (ingen ljud). Flera exempel på ‘factorized’ videogenerering som verkligen följer manus. Vänligen se källvideofiler för bättre upplösning och många fler exempel, även om de kuraterade versionerna som visas här inte finns på projektwebbplatsen och har satts samman för den här artikeln.

Denna lösning kommer i form av den nya artikeln Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, och dess videofyllda projektwebbplats.

Medan många nuvarande system försöker förbättra promptexakthet genom att använda språkmodeller för att omformulera suddiga eller underspecificerade texter, hävdar den nya artikeln att denna strategi fortfarande leder till misslyckande när modellens inre scenerpresentation är felaktig.

Även med en detaljerad omformulerad prompt, misslyckas text-till-video-modeller ofta med att komponera nyckelelement eller generera oförenliga initialtillstånd som bryter mot animationens logik. Så länge den första ramen inte återspeglar vad prompten beskriver, kan den resulterande videon inte återhämta sig, oavsett hur bra rörelsemodellen är.

Artikeln hävdar*:

‘[Text-till-video] modeller producerar ofta distributionellt förskjutna ramar, men uppnår ändå [utvärderingspoäng] som är jämförbara med I2V-modeller, vilket indikerar att deras rörelsemodellering förblir rimligt naturlig även när scenernas trohet är relativt dålig.

‘[Bild-till-video] modeller visar det komplementära beteendet, starka [utvärderingspoäng] från exakta initiala scener och svagare temporalt sammanhang, medan I2V+text balanserar båda aspekterna.

‘Denna kontrast tyder på en strukturmässig missmatchning i nuvarande T2V-modeller: scenernas förankring och temporalt sammanhang dra nytta av olika induktiva fördomar, men existerande arkitekturer försöker lära sig båda samtidigt inom en enda modell.’

En diagnostisk jämförelse av genereringslägen fann att modeller utan explicit scenerförankring presterade bra på rörelse, men ofta komprometterade med scenernas layout, medan bildbaserade tillvägagångssätt visade det motsatta mönstret:

Jämförelse av videogenereringslägen på två datamängder, som visar att I2V+text uppnår den bästa ramkvaliteten (FID) och temporalt sammanhang (FVD), och betonar fördelen med att separera scenernas konstruktion från rörelse.

Jämförelse av videogenereringslägen på två datamängder, som visar att I2V+text uppnår den bästa ramkvaliteten (FID) och temporalt sammanhang (FVD), och betonar fördelen med att separera scenernas konstruktion från rörelse. Källa

De här resultaten pekar på en strukturmässig brist där nuvarande modeller försöker lära sig både scenernas layout och animation på en gång, även om de två uppgifterna kräver olika typer av induktiv fördom, och hanteras bättre separat.

Kanske är det mest intressanta att denna ‘trick’ potentiellt kan tillämpas på lokala installationer av modeller som Wan 2.1 och 2.2, och liknande videodiffusionsmodeller som Hunyuan Video. Anekdotiskt, jämfört med kvaliteten på hobbyistutdata med kommersiella generativa portaler som Kling och Runway, förbättrar de flesta stora API-leverantörerna sina öppna källkods erbjudanden med LoRAs, och – det verkar – med knep av det slag som ses i den nya artikeln. Därför kan denna specifika tillvägagångssätt representera en upphämtning för FOSS-kontingenten.

Tester som utfördes för metoden visar att denna enkla och modulära tillvägagångssätt erbjuder en ny state-of-the-art på T2V-CompBench-benchmarken, och förbättrar alla testade modeller avsevärt. Författarna noterar i slutsatsen att deras system radikalt förbättrar troheten, men adresserar inte (och är inte avsett att adressera) identitetsdrift, som för närvarande är generativ AI-forsknings största utmaning.

Den nya artikeln kommer från fyra forskare vid Ecole Polytechnique Fédérale de Lausanne (EPFL) i Schweiz.

Metod och data

Den centrala propositionen i den nya tekniken är att text-till-video (T2V) diffusionsmodeller behöver ‘ankras’ till startbilder som verkligen passar den önskade textprompten.

För att säkerställa att modellen respekterar startbilden, stör den nya metoden den standarddiffusionsprocessen genom att injicera en ren latent från ankarmodellen vid tidssteg noll, och ersätter en av de vanliga bullriga inmatningarna. Denna oväntade inmatning förvirrar modellen till en början, men med minimal LoRA finjustering lär den sig att behandla den injicerade ramen som en fast visuell förankring snarare än en del av bullerbanan:

En tvåstegsmetod för att förankra text-till-video-generering med en visuell förankring: Vänster, modellen finjusteras med hjälp av en lätt LoRA för att behandla en injicerad ren latent som en fast scenerestriktion. Höger, prompten delas upp i en första-ram-kapitel, som används för att generera ankarmodellen som vägleder videon.

En tvåstegsmetod för att förankra text-till-video-generering med en visuell förankring: Vänster, modellen finjusteras med hjälp av en lätt LoRA för att behandla en injicerad ren latent som en fast scenerestriktion. Höger, prompten delas upp i en första-ram-kapitel, som används för att generera ankarmodellen som vägleder videon.

Vid inferens, skrivs prompten om för att beskriva endast den första ramen, med hjälp av en LLM för att extrahera en rimlig initialscener tillstånd fokuserad på layout och utseende.

Denna omskrivna prompt skickas till en bildgenerator för att producera en kandidatankarmodell (som kan valfritt förfinas av användaren). Den valda ramen kodas till en latent och injiceras i diffusionsprocessen genom att ersätta det första tidssteget, vilket tillåter modellen att generera resten av videon medan den förblir förankrad till den initiala scenen – en process som fungerar utan att kräva ändringar i den underliggande arkitekturen.

Processen testades genom att skapa LoRAs för Wan2.2-14B, Wan2.1-1B och CogVideo1.5-5B. LoRA-träningen utfördes vid en rang på 256, på 5000 slumpmässigt valda klipp från UltraVideo-samlingen.

Träningen varade i 6000 steg och krävde 48 GPU-timmar† för Wan-1B och CogVideo-5B, och 96 GPU-timmar för Wan-14B. Författarna noterar att Wan-5B stöder text-endast och text-bild-konditionering (vilket i det här fallet påtvingas de äldre ramverken), och krävde därför ingen fullständig omträning.

Tester

I de experiment som utfördes för processen, förfinades varje textprompt initialt med hjälp av Qwen2.5-7B-Instruct, som använde resultatet för att generera en detaljerad ‘seed image’-kapitel som innehöll en beskrivning av hela scenen. Detta skickades sedan till QwenImage, som fick i uppgift att generera ‘magiska ramen’ som skulle injiceras i diffusionsprocessen.

De benchmark som användes för att utvärdera systemet inkluderade den ovannämnda T2V-CompBench, för att testa kompositionsförståelse genom att poängsätta hur väl modellerna bevarade objekt, attribut och åtgärder inom en sammanhängande scen; och VBench 2.0, för att utvärdera bredare resonemang och sammanhang över 18 mått, grupperade i kreativitet, allmänbildningsresonemang, kontroll, mänsklig trohet och fysik:

Över alla sju utvärderingskategorier i T2V-CompBench, överträffade den factoriserade T2V-metoden både standard- och uppsamlade T2V-baslinjer för varje testad modell, med vinster på upp till 53,25%. De högst rankade varianterna matchade ofta eller överträffade den proprietära PixVerse-V3-benchmarken.

Över alla sju utvärderingskategorier i T2V-CompBench, överträffade den factoriserade T2V-metoden både standard- och uppsamlade T2V-baslinjer för varje testad modell, med vinster på upp till 53,25%. De högst rankade varianterna matchade ofta eller överträffade den proprietära PixVerse-V3-benchmarken.

Författarna noterar*:

‘[Över] alla modeller, förbättrar tillägg av en ankarmodell konsekvent kompositionella prestationer. Alla mindre factoriserade modeller (CogVideo 5B, Wan 5B och Wan 1B) överträffar den större Wan 14B T2V-modellen.

‘Vår factoriserade Wan 5B överträffar också den kommersiella PixVerse-V3-baslinjen, som är den bästa rapporterade modellen på benchmarken. Detta visar att visuell förankring väsentligt förbättrar scener och åtgärdsförståelse, även i mindre kapacitetsmodeller.

‘Inom varje modellfamilj, överträffar den factoriserade versionen den ursprungliga modellen. Noterbart, vår lätta ankarmodell-baserade LoRA på WAN 14B når prestationer som är jämförbara med dess förtränade I2V 14B-variant (0,661 vs. 0,666), trots att den inte kräver någon fullständig omträning.’

Därefter följde VBench2.0-rundan:

Den factoriserade T2V-metoden förbättrar konsekvent VBench 2.0-prestationer över komposition, allmänbildningsresonemang, kontroll och fysik, med vissa vinster som överstiger 60% – även om mänsklig trohet förblev under den proprietära Veo 3-baslinjen.

Den factoriserade T2V-metoden förbättrar konsekvent VBench 2.0-prestationer över komposition, allmänbildningsresonemang, kontroll och fysik, med vissa vinster som överstiger 60% – även om mänsklig trohet förblev under den proprietära Veo 3-baslinjen.

Över alla arkitekturer, förbättrade den factoriserade metoden poängen i varje VBench-kategori utom mänsklig trohet, som något minskade även med prompt-översampling. WAN 5B överträffade den större WAN 14B, vilket stöder tidigare T2V-CompBench-resultat som visade att visuell förankring bidrog mer än skala.

Medan vinsterna på VBench var konsekventa, var de mindre än de som sågs på T2V-CompBench, och författarna tillskriver detta VBenchs striktare binära poängsättningsregim.

För de kvalitativa testerna, tillhandahåller artikeln statiska bilder, men vi hänvisar läsaren till de sammansatta videorna ingraverade i den här artikeln, för en tydligare idé, med förbehållet att källvideorna är mer talrika och varierade, samt har högre upplösning och detalj. Hitta dem här. Författarna noterar*:

‘Ankramodell-videor visar konsekvent mer exakt scenerkomposition, starkare objekt-attributbindning och tydligare temporalt framsteg.’

Den factoriserade metoden förblev stabil även när antalet diffusionssteg minskades från 50 till 15, och visade nästan ingen prestandaförlust på T2V-CompBench. I kontrast, försämrades både text-endast och uppsamlade baslinjer kraftigt under samma förhållanden.

Även om minskning av steg teoretiskt sett kunde tredubbla hastigheten, blev den fullständiga genereringspipelinen endast 2,1 gånger snabbare i praktiken, på grund av fasta kostnader från ankarmodellsgenerering. Trots detta, visade resultaten att ankring inte bara förbättrade exempelkvalitet, utan också hjälpte till att stabilisera diffusionsprocessen, vilket stöder snabbare och mer effektiv generering utan förlust i exakthet.

Projektwebbplatsen tillhandahåller exempel på uppsamlade vs. nya metoder-genereringar, av vilka vi erbjuder några (lägre upplösning) redigerade exempel här:

Klicka för att spela upp (ingen ljud). Uppsamling av startkällor vs. författarnas factoriserade tillvägagångssätt.

Författarna drar följande slutsats*:

‘Våra resultat tyder på att förbättrad förankring, snarare än ökad kapacitet ensam, kan vara lika viktigt. Senaste framsteg inom T2V-diffusion har i stor utsträckning förlitat sig på att öka modellstorlek och träningsdata, men även stora modeller kämpar ofta för att härleda en sammanhängande initial scen från texten.

‘Detta skiljer sig från bild-diffusion, där skalning är relativt enkelt; i videomodeller, måste varje arkitektonisk förbättring fungera över en ytterligare temporald dimension, vilket gör skalning avsevärt mer resurskrävande.

‘Våra fynd tyder på att förbättrad förankring kan komplettera skala genom att hantera en annan flaskhals: att etablera den korrekta scenen innan rörelsesyntes börjar.

‘Genom att factorisera videogenerering i scenerkonstruktion och temporalt modellering, mildrar vi flera vanliga felmoder utan att kräva avsevärt större modeller. Vi ser detta som ett kompletterande designprincip som kan vägleda framtida arkitekturer mot mer tillförlitlig och strukturerad videosyntes.’

Slutsats

Även om problemen med sammanflätning är mycket verkliga, och kan kräva dedikerade lösningar (såsom förbättrad curation och distributionsutvärdering före träning), har det varit en ögonöppnare att se factorisering ‘lossa’ flera envisa och ‘fastnar’ konceptprompt-arrangemang till mycket mer exakta återgivningar – med endast en måttlig skikt av LoRA-konditionering, och ingreppet av en anmärkningsvärt förbättrad start-/seed-bild.

Klyftan i resurser mellan lokal hobbyist-inferens och kommersiella lösningar kanske inte är så enorm som man kan tro, med tanke på att nästan alla leverantörer försöker rationalisera sin betydande GPU-resursutlägg till konsumenter.

Anekdotiskt, verkar en mycket stor andel av de nuvarande generativa videoleverantörerna använda varumärkesskyddade och generellt ‘uppgraderade’ versioner av kinesiska FOSS-modeller. Den huvudsakliga ‘vallgrav’ som dessa ‘mellanhand’-system verkar ha är att de har tagit sig tid att träna LoRAs, eller också – till större kostnad och något större belöning – faktiskt genomfört en fullständig finjustering av modellvikterna††.

Insikter av det här slaget kunde hjälpa till att minska den klyftan ytterligare, i en utgåvscen där kineserna verkar vara beslutna (inte nödvändigtvis av altruistiska eller idealistiska skäl) att demokratisera generativ AI, medan västerländska affärsintressen kanske föredrar att öka modellstorleken och regleringarna, så att de bästa modellerna så småningom hamnar bakom API:er och flera lager av innehållsfilter.

 

* Författarnas betoning, inte min.

† Artikeln specificerar inte vilken GPU som valdes, eller hur många som användes.

†† Även om LoRA-vägen är mer sannolik, både för ekonomisk enkelhet och för att fulla vikter, snarare än kvantiserade vikter, inte alltid är tillgängliga.

Publicerad första gången fredagen den 19 december 2025

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai