Andersons vinkel
Hvorfor AI-video kan få det forkert

Hvis 2022 var året, hvor generative AI fik fat i en bredere offentligheds forestilling, er 2025 året, hvor den nye race af generative video-rammer fra Kina synes at være på vej til at gøre det samme.
Tencents Hunyuan Video har haft en stor impact på hobbyist AI-fællesskabet med sin open-source-udgivelse af en fuld-verden video-diffusionsmodel, som brugere kan tilpasse til deres behov.
Tæt på dens hæler er Alibabas mere nylige Wan 2.1, en af de mest kraftfulde image-to-video FOSS-løsninger i denne periode – nu med støtte til tilpasning gennem Wan LoRAs.
Ud over tilgængeligheden af den nyeste menneskecentrerede grundmodel SkyReels, venter vi på udgivelsen af Alibabas omfattende VACE video-oprettelses- og redigerings-suite:
Klik for at afspille. Den forestående udgivelse af Alibabas multifunktionelle AI-redigerings-suite VACE har begejstret brugerfællesskabet. Kilde: https://ali-vilab.github.io/VACE-Page/
Pludselig Impact
Forskningen i generativ video-AI er ikke mindre eksplosiv; det er stadig kun første halvdel af marts, og tirsdagens indsendelser til Arxivs Computer Vision-sektion (et hub for generativ AI-papirer) nåede næsten 350 indsendelser – et tal, der normalt er forbundet med højdepunkterne i konference-sæsonen.
De to år siden lanceringen af Stable Diffusion i sommeren 2022 (og den efterfølgende udvikling af Dreambooth og LoRA-tilpasningsmetoder) har været kendetegnet ved mangel på yderligere store udviklinger, indtil de sidste få uger, hvor nye udgivelser og innovationer er sket i så hurtigt et tempo, at det er næsten umuligt at holde sig ajour, ikke mindst dække det hele.
Video-diffusionsmodeller som Hunyuan og Wan 2.1 har løst, efter mange års mislykkede forsøg fra hundredvis af forskningsinitiativer, problemet med temporær konsistens i forhold til generering af mennesker og i høj grad også til miljøer og objekter.
Der kan være lidt tvivl om, at VFX-studier i øjeblikket anvender personale og ressourcer til at tilpasse de nye kinesiske video-modeller til at løse umiddelbare udfordringer som ansigtsskift, på trods af den nuværende mangel på ControlNet-lignende hjælpe-mekanismer for disse systemer.
Det må være en stor lettelse, at en sådan betydelig forhindring potentielt er overvundet, omend ikke gennem de forventede kanaler.
Af de problemer, der er tilbage, er dette dog ikke uvæsentligt:
Klik for at afspille. Baseret på prompten ‘En lille sten ruller ned ad en stejl, klippefuld skråning, forskyder jord og små sten ‘, Wan 2.1, som opnåede de højeste score i den nye artikel, begår en enkel fejl. Kilde: https://videophy2.github.io/
Op Ad Bakken Baglæns
Alle tekst-til-video og billed-til-video-systemer, der i øjeblikket er tilgængelige, herunder kommercielle lukkede kildemodeller, har en tendens til at producere fysik-fejl som den ovenfor, hvor videoen viser en sten, der ruller op ad bakken, baseret på prompten ‘En lille sten ruller ned ad en stejl, klippefuld skråning, forskyder jord og små sten ‘.
En teori om, hvorfor dette sker, forslagt i en akademisk samarbejdsprojekt mellem Alibaba og UAE, er, at modellerne altid trænes på enkeltbilleder, i en vis forstand, selv når de trænes på videoer (der skrives ud til enkelt-rammesekvenser til træningsformål); og de kan ikke nødvendigvis lære den korrekte tidsmæssige rækkefølge af ‘før’ og ‘efter’-billeder.
Men den mest sandsynlige løsning er, at modellerne i spørgsmålet har brugt data-forstærknings-rutiner, der indebærer, at en kilde-træningsklip udsættes for modellen både fremad og baglæns, effektivt fordobler træningsdataene.
Det har længe været kendt, at dette ikke skal gøres arbitrært, fordi nogle bevægelser fungerer i omvendt rækkefølge, men mange gør ikke. En studie fra 2019 fra Storbritanniens University of Bristol forsøgte at udvikle en metode, der kunne skelne ækvivariante, invariante og irreversible kilde-data-video-klip, der samexisterer i en enkelt dataset (se billedet nedenfor), med den tanke, at uegnede kilde-klip måske kan filtreres ud fra data-forstærknings-rutiner.

Eksempler på tre typer bevægelse, hvoraf kun en er frit omvendelig med bevarelse af plausibelt fysisk dynamik. Kilde: https://arxiv.org/abs/1909.09422
Forfatterne af dette arbejde rammer problemet klart:
‘Vi finder, at realisme i omvendte videoer forrådes af omvendt-artefakter, aspekter af scenen, der ikke ville være mulige i en naturlig verden. Nogle artefakter er subtile, mens andre er lette at spotte, som en omvendt ‘kast’-handling, hvor det kastede objekt spontant stiger fra gulvet.
‘Vi observerer to typer omvendt-artefakter, fysiske, der viser overtrædelser af naturlovene, og usandsynlige, der afbilder en mulig, men usandsynlig scene. Disse er ikke eksklusive, og mange omvendte handlinger lider af begge typer artefakter, som når man udstrækker et stykke papir.
‘Eksempler på fysiske artefakter inkluderer: inverteret tyngdekraft (f.eks. ‘lader noget’), spontane impulser på objekter (f.eks. ‘spinder en pen’), og irreversibelt tilstandsskift (f.eks. ‘brænder en lys’). Et eksempel på en usandsynlig artefakt: tager en tallerken fra skabet, tørrer den og placerer den på tørreskabet.
‘Denne type genbrug af data er meget almindelig under træningstiden og kan være nyttigt – for eksempel, i at sikre, at modellen ikke kun lærer en visning af et billede eller et objekt, som kan vendes eller roteres uden at miste sin centrale kohærens og logik.
‘Dette fungerer kun for objekter, der er sandt symmetriske, naturligvis; og at lære fysik fra en ‘omvendt’ video kun fungerer, hvis den omvendte version giver lige så megen mening som den forreste version.’
Midlertidige Omvendelser
Vi har ingen beviser for, at systemer som Hunyuan Video og Wan 2.1 tillod arbitrært ‘omvendte’ klip at blive udsat for modellen under træning (ingen af forskergrupperne har været specifikke med hensyn til data-forstærknings-rutiner).
Men den eneste rimelige alternative mulighed, i lyset af så mange rapporter (og min egen praktiske erfaring), ville synes at være, at hyperskala-datasæt, der driver disse modeller, kan indeholde klip, der i virkeligheden viser bevægelser, der sker i omvendt rækkefølge.
Stenen i det ovenfor indlejrede video blev genereret ved hjælp af Wan 2.1 og er en del af en ny undersøgelse, der undersøger, hvor godt video-diffusionsmodeller kan håndtere fysik.
I tests for dette projekt opnåede Wan 2.1 en score på kun 22% i forhold til dens evne til konsekvent at overholde fysiske love.
Men det er den bedste score af nogen system, der er testet i dette arbejde, hvilket indikerer, at vi måske har fundet vores næste hindring for video-AI:

Score opnået af førende åbne og lukkede kildesystemer, med output fra rammerne vurderet af menneskelige annotatorer. Kilde: https://arxiv.org/pdf/2503.06800
Forfatterne af dette nye arbejde har udviklet en benchmark-system, nu i sin anden iteration, kaldet VideoPhy, med koden tilgængelig på GitHub.
Selv om omfanget af dette arbejde er ud over, hvad vi kan dække her, lad os tage et generelt kig på dens metode og dens potentiale for at etablere en målestok, der kan hjælpe med at styre retningen for fremtidige model-træningssessioner væk fra disse bizarre tilfælde af omvendelse.
Studiet, udført af seks forskere fra UCLA og Google Research, hedder VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation. En overfyldt ledsagende projektside er også tilgængelig, sammen med kode og datasæt på GitHub, og en datasæt-visning på Hugging Face.
Klik for at afspille. Her fejler OpenAI Sora-modellen at forstå interaktionerne mellem årer og reflekser og kan ikke give en logisk fysisk flow heller for personen i båden eller måden, båden interagerer med hende på.
Metode
Forfatterne beskriver den seneste version af deres arbejde, VideoPhy-2, som en ‘udfordrende fælles-sans-evaluering-datasæt for virkelige handlinger.’ Samlingen indeholder 197 handlinger på tværs af en række forskellige fysiske aktiviteter, såsom hula-hoop, gymnastik og tennis, samt objekt-interaktioner, såsom bøjning af et objekt, indtil det brister.
En stor sprogmodel (LLM) bruges til at generere 3840 prompts fra disse seed-handlinger, og prompterne bruges derefter til at syntetisere videoer via de forskellige rammer, der afprøves.
Under processen har forfatterne udviklet en liste over ‘kandidat’-fysiske regler og love, som AI-genererede videoer skal opfylde, ved hjælp af vision-sprog-modeller til evaluering.
Forfatterne skriver:
‘For eksempel, i en video af en sportsudøver, der spiller tennis, ville en fysisk regel være, at en tennisbold skulle følge en parabolisk bane under tyngdekraft. For guldstandard-vurderinger beder vi menneskelige annotatorer om at score hver video baseret på overordnet semantisk overensstemmelse og fysisk fælles-sans, og til at markere overensstemmelse med forskellige fysiske regler.’

Ovenfor: En tekstprompt genereres fra en handling ved hjælp af en LLM og bruges til at oprette en video med en tekst-til-video-genererator. En vision-sprog-model beskriver videoen og identificerer mulige fysiske regler på spil. Nedenfor: Menneskelige annotatorer vurderer videoens realisme, bekræfter regel-overtrædelser, tilføjer manglende regler og kontrollerer, om videoen matcher den oprindelige prompt.
Forfatterne startede med at kuraterer en samling af handlinger for at evaluere fysisk fælles-sans i AI-genererede videoer. De startede med over 600 handlinger fra Kinetics, UCF-101 og SSv2-datasættene, fokuserer på aktiviteter, der involverer sport, objekt-interaktioner og virkelige fysik.
To uafhængige grupper af STEM-uddannede studerende-annotatorer (med en minimum bachelor-uddannelse) gennemgik og filtrerede listen, valgte handlinger, der testede principper såsom tyngdekraft, impuls og elasticitet, mens de fjernede lav-bevægelsesopgaver såsom at skrive, at klappe en kat eller at tygge.
Efter yderligere finjustering med Gemini-2.0-Flash-Exp for at eliminere duplikater, indeholdt den endelige datasæt 197 handlinger, med 54 involverende objekt-interaktioner og 143 centreret om fysiske og sportsaktiviteter:

Eksempler fra de destillerede handlinger.
I den anden fase brugte forskerne Gemini-2.0-Flash-Exp til at generere 20 prompts for hver handling i datasættet, resulterende i i alt 3.940 prompts. Genereringsprocessen fokuserede på synlige fysiske interaktioner, der kunne tydeligt repræsenteres i en genereret video. Dette udelukkede ikke-visualiserbare elementer såsom følelser, sanse-detajler og abstrakt sprog, men inkorporerede diverse karakterer og objekter.
For eksempel, i stedet for en simpel prompt som ‘En bueskytte frigør pilen’, blev modellen guidet til at producere en mere detaljeret version såsom ‘En bueskytte trækker strengen tilbage til fuld spænding, derefter frigør pilen, som flyver lige og rammer en bullseye på et papir-mål‘.
Da moderne video-modeller kan fortolke længere beskrivelser, forbedrede forskerne yderligere beskrivelserne ved hjælp af Mistral-NeMo-12B-Instruct-prompt-opsamleren for at tilføje visuelle detaljer uden at ændre den oprindelige mening.

Eksempler på prompts fra VideoPhy-2, kategoriseret efter fysiske aktiviteter eller objekt-interaktioner. Hver prompt er parret med den tilsvarende handling og den relevante fysiske princip, det tester.
For den tredje fase blev fysiske regler ikke afledt fra tekst-prompts, men fra genererede videoer, da generative modeller kan have svært ved at overholde betingede tekst-prompts.
Videoer blev først oprettet ved hjælp af VideoPhy-2-prompts, derefter ‘op-kaptions’-med Gemini-2.0-Flash-Exp for at trække ud nøgle-detajler. Modellen foreslog tre forventede fysiske regler per video, som menneskelige annotatorer gennemgik og udvidede ved at identificere yderligere potentielle overtrædelser.

Eksempler fra de op-sampled-kaptions.
Derefter, for at identificere de mest udfordrende handlinger, genererede forskerne videoer ved hjælp af CogVideoX-5B med prompts fra VideoPhy-2-datasættet. De valgte derefter 60 handlinger ud af 197, hvor modellen konsekvent fejlede i at følge både prompterne og grundlæggende fysisk fælles-sans.
Disse handlinger involverede fysik-rige interaktioner såsom impuls-overførsel ved diskus-kast, tilstandsskift såsom bøjning af et objekt, indtil det brister, balance-opgaver såsom line-dans og komplekse bevægelser, der inkluderer bag-spring, stang-spring og pizza-kast, blandt andet. I alt blev 1.200 prompts valgt for at øge sværhedsgraden af under-datasættet.
Det resulterende datasæt bestod af 3.940 kaptions – 5,72 gange mere end den tidligere version af VideoPhy. Den gennemsnitlige længde af de oprindelige kaptions er 16 tokens, mens op-sampled kaptions når 138 tokens – 1,88 gange og 16,2 gange længere, henholdsvis.
Datasættet indeholder også 102.000 menneskelige annotationer, der dækker semantisk overensstemmelse, fysisk fælles-sans og regel-overtrædelser på tværs af multiple video-genererings-modeller.
Evaluering
Forskerne definerede derefter klare kriterier for at evaluere videoer. Det primære mål var at vurderere, hvor godt hver video matchede dens input-prompt og fulgte grundlæggende fysiske principper.
I stedet for blot at rangere videoer efter præference, brugte de en vurdering-baseret feedback til at fange specifikke succeser og fejl. Menneskelige annotatorer scorede videoer på en fem-punkts-skala, hvilket tillod mere detaljerede vurderinger, mens evalueringen også kontrollerede, om videoer fulgte forskellige fysiske regler og love.
For menneskelig evaluering blev en gruppe på 12 annotatorer valgt fra prøver på Amazon Mechanical Turk (AMT), og fik vurderinger efter at have modtaget detaljerede fjern-instruktioner. For retfærdighed blev semantisk overensstemmelse og fysisk fælles-sans vurderet separat (i den oprindelige VideoPhy-undersøgelse blev de vurderet sammen).
Annotatorerne vurderede først, hvor godt videoer matchede deres input-prompts, og derefter separat vurderede fysisk plausibilitet, scorede regel-overtrædelser og overordnet realisme på en fem-punkts-skala. Kun de oprindelige prompts blev vist, for at opretholde en retfærdig sammenligning på tværs af modeller.

Grænsefladen, der blev præsenteret for AMT-annotatorerne.
Selv om menneskelig vurdering forbliver guld-standard, er det dyrt og kommer med en række begrænsninger. Derfor er automatiseret evaluering essentiel for hurtigere og mere skalerbare model-vurderinger.
Forfatterne af artiklen testede flere video-sprog-modeller, herunder Gemini-2.0-Flash-Exp og VideoScore, på deres evne til at score videoer for semantisk nøjagtighed og for ‘fysisk fælles-sans’.
Modellerne vurderede igen hver video på en fem-punkts-skala, mens en separat klassificering-opgave bestemte, om fysiske regler blev overholdt, overtrådt eller var uklare.
Eksperimenter viste, at eksisterende video-sprog-modeller kæmpede med at matche menneskelig vurdering, primært på grund af svag fysisk resonans og kompleksiteten af prompterne. For at forbedre automatiseret evaluering udviklede forskerne VideoPhy-2-Autoeval, en 7B-parameter-model designet til at give mere præcise forudsigelser på tværs af tre kategorier: semantisk overensstemmelse; fysisk fælles-sans; og regel-overensstemmelse, fin-justeret på VideoCon-Physics-modellen ved hjælp af 50.000 menneskelige annotationer*.
Data og Tests
Med disse værktøjer på plads testede forfatterne en række generative video-systemer, både gennem lokale installationer og, hvor nødvendigt, via kommercielle API’er: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; og Luma Ray.
Modellerne blev promptet med op-sampled kaptions, hvor muligt, undtagen at Hunyuan Video og VideoCrafter2 opererer under 77-token CLIP-begrænsninger og kan ikke acceptere prompts over en vis længde.
Genererede videoer blev holdt under 6 sekunder, da kortere output er lettere at evaluere.
Drive-dataen kom fra VideoPhy-2-datasættet, som blev delt i en benchmark og en træningssæt. 590 videoer blev genereret per model, undtagen for Sora og Ray2; på grund af omkostningsfaktoren (lavere antal videoer blev genereret for disse).
(Henvis til den oprindelige artikel for yderligere evaluering detaljer, som er udførligt kronikeret der)
Den første evaluering omhandlede fysiske aktiviteter/sport (PA) og objekt-interaktioner (OI), og testede både den generelle datasæt og den ovenfor nævnte ‘sværere’ under-sæt:

Resultater fra den første runde.
Her kommenterer forfatterne:
‘Selv den bedst-performerende model, Wan2.1-14B, opnår kun 32,6% og 21,9% på den fulde og hårde dele af vores datasæt, henholdsvis. Dens relativt stærke præstation i forhold til andre modeller kan tilskrives diversiteten af dets multimodale træningsdata, samt robust bevægelses-filtrering, der bevarer høj-kvalitets-videoer på tværs af et bredt spektrum af handlinger.
‘Desuden observerer vi, at lukkede modeller, såsom Ray2, performer dårligere end åbne modeller som Wan2.1-14B og CogVideoX-5B. Dette antyder, at lukkede modeller ikke nødvendigvis er overlegne åbne modeller i at fange fysisk fælles-sans.
‘Bemærkelsesværdigt opnår Cosmos-Diffusion-7B den bedste score på den hårde del, selv om den overgår den langt større HunyuanVideo-13B-model. Dette kan skyldes den høje repræsentation af menneskelige handlinger i dens træningsdata, samt syntetisk-renderede simulationer.’
Resultaterne viste, at video-modellerne kæmpede mere med fysiske aktiviteter som sport end med simple objekt-interaktioner. Dette antyder, at forbedring af AI-genererede videoer på dette område vil kræve bedre datasæt – især høj-kvalitets-optagelser af sport som tennis, diskus, baseball og cricket.
Studiet undersøgte også, om en models fysisk plausibilitet korrelerede med andre video-kvalitets-målinger, såsom æstetik og bevægelses-glatthed. Resultaterne afslørede ingen stærk korrelation, hvilket betyder, at en model ikke kan forbedre sin præstation på VideoPhy-2 blot ved at generere visuelt tiltalende eller fluide bevægelser – den kræver en dybere forståelse af fysisk fælles-sans.
Selv om artiklen leverer mange kvalitative eksempler, synes få af de statiske eksempler, der er leveret i PDF’en, at have noget at gøre med de omfattende video-eksempler, som forfatterne leverer på projekt-siden. Derfor vil vi se på et lille udvalg af de statiske eksempler og derefter nogle flere af de faktiske projekt-videoer.

Den øverste række viser videoer genereret af Wan2.1. (a) I Ray2 ligger jet-ski’en på venstre side efter og bevæger sig baglæns. (b) I Hunyuan-13B deformeres hammeren midt i svinget, og en brækket træplade dukker op uventet. (c) I Cosmos-7B udskyder spydet sand, før det kommer i kontakt med jorden.
Med hensyn til ovenstående kvalitative test kommenterer forfatterne:
‘[Vi] observerer overtrædelser af fysisk fælles-sans, såsom jet-ski’er, der bevæger sig på en ikke-naturlig måde baglæns, og deformation af en solid hammer, der modsiger principperne om elasticitet. Men selv Wan lider af mangel på fysisk fælles-sans, som vist i [klippet indlejret i starten af denne artikel].
‘I dette tilfælde fremhæver vi, at en sten begynder at rulle og accelerere op ad bakken, i modstrid med tyngdelovens princip.’
Yderligere eksempler fra projekt-siden:
Klik for at afspille. Her var prompten ‘En person vrider en våd håndklæde, vand sprøjter udad i en synlig bue’ – men den resulterende kilde til vand ligner mere en vandhane end en håndklæde.
Klik for at afspille. Her var prompten ‘En kemiker hælder en klar væske fra en kolbe til en prøve-rør, undgår omhyggeligt at spilde’, men vi kan se, at volumenet af vand, der tilføres kolben, ikke er konsistent med mængden, der forlader kanden.
Som jeg nævnte i begyndelsen, overstiger mængden af materiale associeret med dette projekt, hvad der kan dækkes her. Derfor henviser vi til den oprindelige artikel, projekt-siden og relaterede sider, der er nævnt tidligere, for en udførlig gennemgang af forfatternes procedurer og mange flere test-eksempler og proceduredetaljer.
* Med hensyn til proveniens af annotationerne, specificerer artiklen kun ‘erhvervet til disse opgaver’ – det ser ud til at være meget at have været genereret af 12 AMT-arbejdere.
Først udgivet torsdag, 13. marts 2025












