Andersons vinkel
AI-video perfekterer kat-selvportrÃĶttet

AI-video-genereringsmodeller giver ofte resultater, der er tÃĶt pÃĨ, men ikke helt, hvad brugerens tekstprompt havde Ãļnsket. Men en ny hÃļjniveau-lÃļsning gÃļr alle forskellen.
Â
Generative videosystemer har ofte svÃĶrt ved at lave videoer, der er virkelig kreative eller vilde, og ofte leverer de ikke op til brugerens tekstprompts forventninger.
En del af ÃĨrsagen til dette er entanglement â det faktum, at vision/sprogmodeller mÃĨ gÃĨ pÃĨ kompromis med, hvor lÃĶnge de trÃĶner pÃĨ deres kildedata. For lidt trÃĶning, og koncepterne er fleksible, men ikke fuldt udformede â for meget, og koncepterne er nÃļjagtige, men ikke lÃĶngere fleksible nok til at inkorporere i nye kombinationer.
Man kan fÃĨ en idÃĐ om, hvad der sker, fra videoen nedenfor. Til venstre ser man den slags kompromis, som mange AI-systemer leverer i svaret pÃĨ en krÃĶvende prompt (prompten er Ãļverst i videoen i alle fire eksempler), der beder om en vis sammentÃĶlling af elementer, der er for fantastisk til at have vÃĶret et rigtigt trÃĶnings eksempel. Til hÃļjre ser man en AI-udgang, der holder bedre fast i prompten:
Klik for at afspille (ingen lyd). Til hÃļjre ser vi âfactorizedâ WAN 2.2, der virkelig leverer pÃĨ prompten, i sammenligning med de vagt fortolkninger af âvanillaâ Wan 2.2, til venstre. Se venligst kildevideo-filerne for bedre oplÃļsning og mange flere eksempler, selvom de kuraterede versioner, der ses her, ikke findes pÃĨ projektets hjemmeside og er samlet til denne artikel. Kilde
Det er tydeligt, at eksemplerne til hÃļjre holder bedre fast i den oprindelige tekstprompt end dem til venstre.
Interessant nok er begge arkitekturer grundlÃĶggende den same arkitektur â den populÃĶre og meget kapable Wan 2.2, en kinesisk udgivelse, der har vundet betydelig ground i det ÃĨbne kilde- og hobbyist-miljÃļ i ÃĨr.
Forskellen er, at den anden generative pipeline er factorized, hvilket i dette tilfÃĶlde betyder, at en stor sprogmodel (LLM) er blevet brugt til at genfortolke den fÃļrste (seed) ramme af videoen, sÃĨ den vil vÃĶre meget lettere for systemet at levere, hvad brugeren beder om.
Dette âvisuelle ankeringâ indebÃĶrer at indsprÃļjte et billede, der er lavet fra denne LLM-forbedrede prompt, i den generative pipeline som en âstart-rammeâ, og bruge en LoRA-fortolkende model til at hjÃĶlpe med at integrere âintrus-rammenâ i video-skabelsesprocessen.
Resultaterne, i forhold til prompt-trofasthed, er ret bemÃĶrkelsesvÃĶrdige, isÃĶr for en lÃļsning, der synes ret elegant:
Klik for at afspille (ingen lyd). Yderligere eksempler pÃĨ âfactorizedâ video-genereringer, der virkelig holder fast i manuskriptet. Se venligst kildevideo-filerne for bedre oplÃļsning og mange flere eksempler, selvom de kuraterede versioner, der ses her, ikke findes pÃĨ projektets hjemmeside og er samlet til denne artikel.
Denne lÃļsning kommer i form af den nye artikel Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, og dens video-ladne ledsagende projekt-hjemmeside.
mens mange nuvÃĶrende systemer forsÃļger at forbedre prompt-nÃļjagtighed ved at bruge sprogmodeller til at omskrive vagt eller underbestemt tekst, argumenterer den nye artikel for, at denne strategi stadig fÃļrer til fejl, nÃĨr modellens interne scene-reprÃĶsentation er fejl.
Even med en detaljeret omskrevet prompt, tekst-til-video-modeller ofte miscomposer nÃļgle-elementer eller genererer inkompatible initialtilstande, der bryder logikken i animationen. SÃĨ lÃĶnge den fÃļrste ramme ikke afspejler, hvad prompten beskriver, kan den resulterende video ikke genskabes, uanset hvor god motion-modellen er.
Artiklen siger*:
â[Tekst-til-video]-modeller producerer ofte distributionelt forskudt rammer, men opnÃĨr alligevel [evaluerings-score] sammenlignelige med I2V-modeller, hvilket indikerer, at deres motion-modellering forbliver rimelig naturlig, selv nÃĨr scene-trofasthed er relativt dÃĨrlig.
â[Billede-til-video]-modeller viser det komplementÃĶre adfÃĶrd, stÃĶrke [evaluerings-score] fra prÃĶcise initialscener og svagere temporal koherens, mens I2V+tekst balancerer begge aspekter.
âDette kontrast suger en strukturel mismatch i nuvÃĶrende T2V-modeller: scene-grounding og temporal syntese fordelene fra forskellige induktive bias, men eksisterende arkitekturer forsÃļger at lÃĶre begge samtidigt inden for en enkelt model.â
En diagnostisk sammenligning af generationsmodi fandt, at modeller uden eksplizit scene-ankring scorede godt pÃĨ motion, men ofte kompromitterede pÃĨ scene-layout, mens billed-konditionerings-tilgange viste det modsatte mÃļnster:

Sammenligning af video-generationsmodi pÃĨ to datasÃĶt, der viser, at I2V+tekst opnÃĨr den bedste ramme-kvalitet (FID) og temporal koherens (FVD), hvilket understreger fordelene ved at adskille scene-konstruktion fra motion. Kilde
Disse fund peger pÃĨ en strukturel fejl, hvor nuvÃĶrende modeller forsÃļger at lÃĶre bÃĨde scene-layout og animation pÃĨ ÃĐn gang, selvom de to opgaver krÃĶver forskellige former for induktiv bias, og hÃĨndteres bedst separat.
MÃĨske er det mest interessante, at denne âtrickâ potentielt kan anvendes pÃĨ lokale installationer af modeller som Wan 2.1 og 2.2, og lignende video-diffusionsmodeller som Hunyuan Video. Anekdotisk set ligner sammenligningen af kvaliteten pÃĨ hobbyist-udgang og kommercielle generative porte som Kling og Runway, at de fleste af de stÃļrre API-udbydere forbedrer pÃĨ ÃĨbne kilde-tilbud som WAN med LoRAs, og â det ser ud til â med tricks af samme type som dem, der ses i den nye artikel. Derfor kunne denne specifikke tilgang reprÃĶsentere en opfangning for FOSS-kontingenten.
Tests udfÃļrt for metoden indikerer, at denne simple og modulÃĶre tilgang tilbyder en ny state-of-the-art pÃĨ T2V-CompBench-benchmarket, og betydeligt forbedrer alle testede modeller. Forfatterne bemÃĶrker i konklusionen, at selvom deres system radikalt forbedrer trofasthed, sÃĨ adresserer det ikke (og er ikke designet til at adresse) identitets-drift, der i Ãļjeblikket er generativ AI-forsknings stÃļrste udfordring.
Den nye artikel kommer fra fire forskere ved Ecole Polytechnique FÃĐdÃĐrale de Lausanne (EPFL) i Schweiz.
Metode og Data
Den centrale tese i den nye teknik er, at tekst-til-video (T2V)-diffusionsmodeller behÃļver at vÃĶre âankretâ til start-rammer, der virkelig passer til den Ãļnskede tekst-prompt.
For at sikre, at modellen respekterer start-rammen, forstyrrer den nye metode den standard diffusionsproces ved at indsprÃļjte en ren latent fra anchor-billedet ved tidsrum nul, og erstatter en af de sÃĶdvanlige stÃļjende input. Denne ukendte input forvirrer modellen fÃļrst, men med minimal LoRA finjustering, lÃĶrer den at behandle den indsprÃļjtede ramme som en fast visuel anchor i stedet for en del af stÃļj-trafikken:

To-trins metode til at grounde tekst-til-video-generering med en visuel anchor: Venstre, modellen er finjusteret med en letvÃĶgts LoRA til at behandle en indsprÃļjet ren latent som en fast scene-begrÃĶnsning. HÃļjre, prompten er splittet op i en fÃļrste-ramme-kaption, der bruges til at generere anchor-billedet, der vejleder videoen.
Ved inferens omskriver metoden prompten til kun at beskrive kun den fÃļrste ramme, ved at bruge en LLM til at trÃĶkke en plausibel initial scene-tilstand fokuseret pÃĨ layout og udseende.
Denne omskrevne prompt bliver sendt til en billed-generator for at producere en kandidat-anchor-ramme (der kan valgfrit blive forbedret af brugeren). Den valgte ramme bliver kodet ind i en latent og indsprÃļjet i diffusionsprocessen ved at erstatte den fÃļrste tidsrum, og giver modellen mulighed for at generere resten af videoen mens den forbliver ankret til den initiale scene â en proces, der fungerer uden at krÃĶve ÃĶndringer i den underliggende arkitektur.
Processen blev testet ved at oprette LoRAs for Wan2.2-14B, Wan2.1-1B, og CogVideo1.5-5B. LoRA-trÃĶningen blev udfÃļrt pÃĨ en rang af 256, pÃĨ 5000 tilfÃĶldigt valgte klip fra UltraVideo-samlingen.
TrÃĶningen varede 6000 trin, og krÃĶvede 48 GPU-timerâ for Wan-1B og CogVideo-5B, og 96 GPU-timer for Wan-14B. Forfatterne bemÃĶrker, at Wan-5B naturligt understÃļtter tekst-kun og tekst-billede-betingelser (der i dette tilfÃĶlde bliver pÃĨtvunget til de ÃĶldre rammer), og derfor ikke krÃĶvede nogen finjustering.
Tests
I de eksperimenter, der blev udfÃļrt for processen, blev hver tekst-prompt fÃļrst forbedret med Qwen2.5-7B-Instruct, der brugte resultatet til at generere en detaljeret âseed-billedeâ-kaption, der indeholdt en beskrivelse af hele scenen. Dette blev derefter sendt til QwenImage, der blev bedt om at generere âmagi-rammenâ, der skulle indsÃĶttes i diffusionsprocessen.
Benchmarkene, der blev brugt til at evaluere systemet, omfattede det ovennÃĶvnte T2V-CompBench, til test af kompositionel forstÃĨelse ved at score, hvor godt modellerne bevarede objekter, attributter og handlinger inden for en koherent scene; og VBench 2.0, til evaluering af bredere forstÃĨelse og konsistens pÃĨ 18 metrikker, grupperet i kreativitet, commonsense-forstÃĨelse, kontrollabilitet, menneskelig trofasthed, og fysik:

PÃĨ tvÃĶrs af alle syv evaluering-kategorier i T2V-CompBench, overgik den factorizede T2V-metode bÃĨde standard- og opskalerede T2V-baselines for hver testet model, med gevinster op til 53,25%. De hÃļjest scorende varianter matchede eller overgik ofte den proprietÃĶre PixVerse-V3-benchmark.
Med hensyn til denne fÃļrste runde af tests, bemÃĶrker forfatterne*:
â[PÃĨ tvÃĶrs af] alle modeller, forbedrer tilfÃļjelsen af en anchor-billede konsekvent kompositionelle prÃĶstationer. Alle mindre factorizede modeller (CogVideo 5B, Wan 5B og Wan 1B) overgÃĨr den stÃļrre Wan 14B T2V-model.
âVores factorizede Wan 5B overgÃĨr ogsÃĨ den kommercielle PixVerse-V3-baseline, der er den bedste rapporterede model pÃĨ benchmarket. Dette demonstrerer, at visuel ankering vÃĶsentligt forbedrer scene- og handling-forstÃĨelse, selv i mindre kapacitets-modeller.
âInden for hver model-familie, overgÃĨr den factorizede version den oprindelige model. BemÃĶrkelsesvÃĶrdigt, vores letvÃĶgts-ankret LoRA pÃĨ WAN 14B nÃĨr en prÃĶstation, der er sammenlignelig med dens forudtrÃĶnede I2V 14B-variant (0,661 vs. 0,666), pÃĨ trods af at den ikke krÃĶver nogen fuld omskoling.â
Derefter kom VBench2.0-runden:

Den factorizede T2V-tilgang forbedrer konsekvent VBench 2.0-prÃĶstation pÃĨ tvÃĶrs af komposition, commonsense-forstÃĨelse, kontrollabilitet og fysik, med nogle gevinster, der overgÃĨr 60% â selvom menneskelig trofasthed forblev under den proprietÃĶre Veo 3-baseline.
PÃĨ tvÃĶrs af alle arkitekturer, forbedrede den factorizede tilgang score i hver VBench-kategori, undtagen menneskelig trofasthed, der let faldt, selv med prompt-opskalerings. WAN 5B overgik den stÃļrre WAN 14B, og understregede tidligere T2V-CompBench-resultater, der viste, at visuel ankering bidrog mere end skala.
Gevinsterne pÃĨ VBench var konsekvente, men mindre end dem, der blev set pÃĨ T2V-CompBench, og forfatterne tilskriver dette VBenchs strengere binÃĶr scoringsregime.
Til de kvalitative tests, leverer artiklen statiske billeder, men vi henviser lÃĶseren til de sammensatte videoer, der er indlejret i denne artikel, for en klarere idÃĐ, med den bemÃĶrkning, at kildevideoerne er mere talrige og diverse, sÃĨvel som havende stÃļrre oplÃļsning og detaljer. Find dem her. Med hensyn til kvalitative resultater, bemÃĶrker artiklen:
âAnkret videoer viser konsekvent mere prÃĶcis scene-komposition, stÃĶrkere objekt-egenskabs-binding og klarere temporal progression.â
Den factorizede metode forblev stabil, selv nÃĨr antallet af diffusions-trin blev reduceret fra 50 til 15, og viste nÃĶsten ingen prÃĶstations-tab pÃĨ T2V-CompBench. I modsÃĶtning hertil faldt bÃĨde tekst-kun og opskalerede baselines skarpt under de samme betingelser.
Selv om reduktion af trin teoretisk kunne tredoble hastigheden, blev den fulde generations-proces kun 2,1 gange hurtigere i praksis, pÃĨ grund af faste omkostninger fra anchor-billede-generering. Alligevel viste resultaterne, at ankering ikke kun forbedrede prÃĶstations-kvalitet, men ogsÃĨ hjalp med at stabilisere diffusionsprocessen, og understÃļttede hurtigere og mere effektiv generering uden tab i nÃļjagtighed.
Projektets hjemmeside tilbyder eksempler pÃĨ opskalerede vs. nye metode-genereringer, af hvilke vi tilbyder et par (lavere oplÃļsning) redigerede eksempler her:
Klik for at afspille (ingen lyd). Opskalerede start-kilder vs. forfatternes factorizede tilgang.
Forfatterne konkluderer:
âVores resultater antyder, at forbedret ankering, snarere end Ãļget kapacitet alene, kan vÃĶre lige sÃĨ vigtigt. Seneste fremskridt i T2V-diffusion har i hÃļj grad afhÃĶngt af Ãļget model-stÃļrrelse og trÃĶningsdata, men selv store modeller kÃĶmper ofte for at slutte en koherent initial-scene fra tekst alene.
âDette modsiger sig med billed-diffusion, hvor skalaering er relativt ligetil; i video-modeller mÃĨ hver arkitektonisk forbedring operere over en ekstra temporal dimension, hvilket gÃļr skalaering vÃĶsentligt mere ressource-krÃĶvende.
âVores fund antyder, at forbedret ankering kan supplere skala ved at adresse en anden flaskehals: etablering af den korrekte scene, fÃļr motion-syntese begynder.
âVed at factorisere video-generering i scene-konstruktion og temporal modellering, mildner vi flere almindelige fejlmodi uden at krÃĶve vÃĶsentligt stÃļrre modeller. Vi ser pÃĨ dette som en komplementÃĶr design-princip, der kan vejlede fremtidige arkitekturer mod mere pÃĨlidelig og struktureret video-syntese.â
Konklusion
Selv om problemerne med entanglement er meget reelle, og kan krÃĶve dedikerede lÃļsninger (sÃĨsom forbedret curation og distributions-evaluering fÃļr trÃĶning), har det vÃĶret en ÃļjenÃĨbner at se, hvordan factorisering kan âlÃļsneâ flerestubbe og âfastlÃĨsteâ koncept-prompt-orkestreringer til mere nÃļjagtige renderinger â med kun en moderat lag af LoRA-betingelser og en markant forbedret start-/seed-billede.
Gapet i ressourcer mellem lokal hobbyist-inferens og kommercielle lÃļsninger kan mÃĨske ikke vÃĶre sÃĨ enormt, som antaget, da nÃĶsten alle udbydere sÃļger at rationalisere deres betydelige GPU-resurse-udlag til forbrugerne.
Anekdotisk set ser det ud til, at en meget stor del af de nuvÃĶrende generative video-udbydere bruger brandede og generelt âforbedredeâ versioner af kinesiske FOSS-modeller. Den primÃĶre âmoatâ, disse âmellemliggendeâ systemer synes at have, er, at de har taget sig tid til at trÃĶne LoRAs, eller ogsÃĨ â til en stÃļrre omkostning og lidt stÃļrre belÃļnning â har gennemfÃļrt en fuld finjustering af model-vÃĶgterneâ â .
Indsigter af denne type kunne hjÃĶlpe med at lukke dette gap yderligere, i en udgivelseskontekst, hvor kineserne synes at vÃĶre fast besluttede (ikke nÃļdvendigvis af altruistiske eller idealistiske ÃĨrsager) pÃĨ at demokratisere generativ AI, hvorimod vestlige forretningsinteresser mÃĨske ville foretrÃĶkke, at Ãļget model-stÃļrrelse og reguleringer til sidst isolerer de bedste modeller bag APIâer og multiple lag af indholdsfilters.
Â
* Forfatternes betoning, ikke min.
â Artiklen specificerer ikke, hvilken GPU der blev valgt, eller hvor mange der blev brugt.
â â LoRA-ruten er mere sandsynlig, bÃĨde pÃĨ grund af Ãļkonomisk let brug og fordi de fulde vÃĶgte, snarere end kvantificerede vÃĶgte, ikke altid er tilgÃĶngelige.
Offentliggjort fÃļrste gang fredag, den 19. december 2025












