Andersons vinkel

Varför AI-video ibland får det bak och fram

mm
Lägg till Unite.AI bland dina föredragna källor på Google
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Om 2022 var det år då generativ AI fångade en bredare allmänhetens fantasi, är 2025 det år då den nya generationen av generativa video-ramverk från Kina verkar vara på väg att göra detsamma.

Tencents Hunyuan Video har gjort en stor påverkan på hobbyist-AI-samhället med sin öppen källkodsrelease av en fullständig video-diffusionsmodell som användare kan anpassa efter sina behov.

Nära på dess häl är Alibaba’s mer nyliga Wan 2.1, en av de kraftfullaste bild-till-video-FOSS-lösningarna under denna period – nu med stöd för anpassning via Wan LoRAs.

Förutom tillgängligheten av den senaste mänskliga grundmodellen SkyReels, väntar vi vid tidpunkten för skrivande också på utgivningen av Alibaba’s omfattande VACE-video skapande och redigerings svit:

Klicka för att spela. Den förestående utgivningen av Alibaba’s multifunktionella AI-redigerings svit VACE har exciterat användarsamhället. Källa: https://ali-vilab.github.io/VACE-Page/

Plötslig påverkan

Forskningen om generativ video-AI är inte mindre explosiv; det är fortfarande första halvan av mars, och tisdagens inlämnanden till Arxiv’s datorseendeavdelning (en nav för generativ AI-papper) kom till nästan 350 inlämnanden – en siffra som är mer förknippad med höjden av konferenssäsongen.

De två åren sedan lanseringen av Stable Diffusion sommaren 2022 (och den efterföljande utvecklingen av Dreambooth och LoRA-anpassningsmetoder) har kännetecknats av bristen på ytterligare stora framsteg, tills de senaste veckorna, där nya utgåvor och innovationer har fortskridit i sådan takt att det är nästan omöjligt att hålla sig à jour, än mindre täcka allt.

Video-diffusionsmodeller som Hunyuan och Wan 2.1 har löst, efter lång tid och efter år av misslyckade försök från hundratals forskningsinitiativ, problemet med temporär konsekvens i samband med generering av människor, och i stor utsträckning också till miljöer och föremål.

Det kan knappast råda någon tvekan om att VFX-studior för närvarande tillämpar personal och resurser för att anpassa de nya kinesiska video-modellerna för att lösa omedelbara utmaningar som ansiktsbyten, trots den nuvarande bristen på ControlNet-liknande hjälp mekanismer för dessa system.

Det måste vara en sådan lättnad att en sådan betydande hinder har potentiellt övervunnits, om än inte genom de vägar som förväntades.

Bland de problem som återstår, är detta dock inte oväsentligt:

Klicka för att spela. Baserat på prompten ‘En liten sten rullar ner för en brant, stenig sluttning, och förskjuter jord och små stenar’, Wan 2.1, som uppnådde de högsta poängen i den nya artikeln, gör ett enkelt fel. Källa: https://videophy2.github.io/

Upp för backen baklänges

Alla text-till-video och bild-till-video system som för närvarande är tillgängliga, inklusive kommersiella slutna modeller, har en tendens att producera fysiska fel som den ovan, där videon visar en sten som rullar uppför, baserat på prompten ‘En liten sten rullar ner för en brant, stenig sluttning, och förskjuter jord och små stenar‘.

En teori om varför detta händer, nyligen föreslagen i en akademisk samarbete mellan Alibaba och Förenade Arabemiraten, är att modellerna alltid tränas på enskilda bilder, i en viss mening, även när de tränas på videor (som skrivs ut till enskilda bildsekvenser för träningsändamål); och de kan inte nödvändigtvis lära sig den korrekta temporala ordningen för ‘före’ och ‘efter’-bilder.

Men den mest sannolika lösningen är att modellerna i fråga har använt data förstärkning-rutiner som involverar att utsätta en källträning klipp för modellen både framåt och bakåt, effektivt dubblar träningsdata.

Det har länge varit känt att detta inte bör göras godtyckligt, eftersom vissa rörelser fungerar i omvänd ordning, men många gör det inte. En 2019-studie från Storbritanniens University of Bristol försökte utveckla en metod som kunde skilja ekvivariant, invariant och omvändbar käll data video klipp som samexisterar i en enda dataset (se bild nedan), med tanken att olämpliga källklipp kanske kunde filtreras bort från data förstärkningsrutiner.

Exempel på tre typer av rörelse, varav endast en är fritt omvändbar medan den upprätthåller trovärdig fysisk dynamik. Källa: https://arxiv.org/abs/1909.09422

Exempel på tre typer av rörelse, varav endast en är fritt omvändbar medan den upprätthåller trovärdig fysisk dynamik. Källa: https://arxiv.org/abs/1909.09422

Författarna till detta arbete rammar in problemet tydligt:

‘Vi finner att realismen i omvända videor förråds av omvända artefakter, aspekter av scenen som inte skulle vara möjliga i en naturlig värld. Vissa artefakter är subtila, medan andra är lätta att upptäcka, som en omvänd ‘kast’ åtgärd där det kastade föremålet spontant stiger från golvet.

‘Vi observerar två typer av omvända artefakter, fysiska, de som visar brott mot natur lagarna, och osannolika, de som avbildar en möjlig men osannolik scenario. Dessa är inte uteslutande, och många omvända åtgärder lider av båda typerna av artefakter, som när man rynkar en bit papper.

‘Exempel på fysiska artefakter inkluderar: inverterad gravitation (t.ex. ‘släppa något’), spontana impulser på föremål (t.ex. ‘snurra en penna’), och omvända tillståndsändringar (t.ex. ‘bränna en ljus’). Ett exempel på en osannolik artefakt: ta en tallrik från skåpet, torka den och placera den på torkställningen.

‘Denna typ av återanvändning av data är mycket vanlig under tränings tiden, och kan vara fördelaktig – till exempel, för att säkerställa att modellen inte lär sig endast en vy av en bild eller föremål som kan vändas eller roteras utan att förlora sin centrala sammanhängighet och logik.

‘Detta fungerar bara för föremål som är sant symmetriska, naturligtvis; och att lära sig fysik från en ‘omvänd’ video fungerar bara om den omvända versionen har lika mycket mening som den främre versionen.’

Tillfälliga omvändningar

Vi har inga bevis för att system som Hunyuan Video och Wan 2.1 tillåtit godtyckligt ‘omvända’ klipp att exponeras för modellen under tränings tiden (varken forskargrupp har varit specifik angående data förstärknings rutiner).

Men den enda rimliga alternativa möjligheten, i ansiktet av så många rapporter (och min egen praktiska erfarenhet), skulle tyckas vara att hyperskala dataset som driver dessa modeller kan innehålla klipp som verkligen innehåller rörelser som sker i omvänd ordning.

Stenen i exemplet videon ovan genererades med Wan 2.1, och visas i en ny studie som undersöker hur bra video-diffusionsmodeller hanterar fysik.

I tester för detta projekt uppnådde Wan 2.1 en poäng på endast 22% när det gäller dess förmåga att konsekvent följa fysiska lagar.

Men det är den bästa poängen av alla system som testades för arbetet, vilket indikerar att vi kanske har funnit vår nästa hinder för video-AI:

Poäng som erhållits av ledande öppna och slutna system, med utdata från ramverken utvärderade av mänskliga annotatorer. Källa: https://arxiv.org/pdf/2503.06800

Poäng som erhållits av ledande öppna och slutna system, med utdata från ramverken utvärderade av mänskliga annotatorer. Källa: https://arxiv.org/pdf/2503.06800

Författarna till det nya arbetet har utvecklat ett benchmark-system, nu i sin andra iteration, kallat VideoPhy, med koden tillgänglig på GitHub.

Även om omfattningen av arbetet är bortom vad vi kan täcka här, låt oss ta en allmän titt på dess metod och dess potential för att etablera en metric som kunde hjälpa till att styra kursen för framtida modell-tränings sessioner bort från dessa underliga exempel på omvändning.

Den studien, utförd av sex forskare från UCLA och Google Research, kallas VideoPhy-2: En utmanande action-centrerad fysisk sunt förnuft utvärdering i video generation. En trång projekt webbplats är också tillgänglig, tillsammans med kod och dataset på GitHub, och ett dataset visare på Hugging Face.

Klicka för att spela. Här misslyckas den berömda OpenAI Sora-modellen med att förstå interaktionerna mellan åror och reflektioner, och kan inte heller tillhandahålla en logisk fysisk flöde antingen för personen i båten eller hur båten interagerar med henne.

Metod

Författarna beskriver den senaste versionen av sitt arbete, VideoPhy-2, som en ‘utmanande sunt förnuft utvärdering dataset för verkliga åtgärder.’ Samlingen innehåller 197 åtgärder över ett brett spektrum av fysiska aktiviteter, såsom hulahop, gymnastik och tennis, samt objekt interaktioner, såsom böja ett föremål tills det går sönder.

En stor språkmodell (LLM) används för att generera 3840 prompter från dessa ursprungsåtgärder, och prompterna används sedan för att syntetisera videor via de olika ramverken som testas.

Under hela processen har författarna utvecklat en lista över ‘kandidat’ fysiska regler och lagar som AI-genererade videor bör uppfylla, med hjälp av vision-språk modeller för utvärdering.

Författarna påstår:

‘Till exempel, i en video av en idrottare som spelar tennis, skulle en fysisk regel vara att en tennisboll bör följa en parabolisk bana under gravitation. För guldstandardbedömningar ber vi mänskliga annotatorer att poängsätta varje video baserat på övergripande semantisk överensstämmelse och fysiskt sunt förnuft, och att markera dess överensstämmelse med olika fysiska regler.’

Ovan: En textprompt genereras från en åtgärd med en LLM och används för att skapa en video med en text-till-video generator. En vision-språk modell lägger till undertexter för videon, identifierar möjliga fysiska regler som gäller. Nedan: Mänskliga annotatorer utvärderar videons realism, bekräftar regelbrott, lägger till saknade regler och kontrollerar om videon matchar den ursprungliga prompten.

Ovan: En textprompt genereras från en åtgärd med en LLM och används för att skapa en video med en text-till-video generator. En vision-språk modell lägger till undertexter för videon, identifierar möjliga fysiska regler som gäller. Nedan: Mänskliga annotatorer utvärderar videons realism, bekräftar regelbrott, lägger till saknade regler och kontrollerar om videon matchar den ursprungliga prompten.

Initialt kuraterade forskarna en uppsättning åtgärder för att utvärdera fysiskt sunt förnuft i AI-genererade videor. De började med över 600 åtgärder från Kinetics, UCF-101, och SSv2 dataset, fokuserande på aktiviteter som involverar sport, objekt interaktioner och verkliga fysiska fenomen.

Två oberoende grupper av STEM-utbildade studenter annotatorer (med en minimi examen på kandidatnivå) granskade och filtrerade listan, väljande åtgärder som testade principer som gravitation, momentum och elasticitet, medan de tog bort låg-rörelse uppgifter som skriva, klappa en katt eller tugga.

Efter ytterligare förfining med Gemini-2.0-Flash-Exp för att eliminera dubbletter, inkluderade den slutliga dataseten 197 åtgärder, med 54 som involverade objekt interaktioner och 143 som fokuserade på fysiska och sportrelaterade aktiviteter:

Exempel från de destillerade åtgärderna.

Exempel från de destillerade åtgärderna.

I den andra etappen använde forskarna CogVideoX-5B för att generera 20 prompter för varje åtgärd i dataseten, resulterande i totalt 3,940 prompter. Genereringsprocessen fokuserade på synliga fysiska interaktioner som kunde tydligt representeras i en genererad video. Detta uteslöt icke-visuella element som känslor, sensory detaljer och abstrakt språk, men inkorporerade diverse karaktärer och föremål.

Till exempel, istället för en enkel prompt som ‘En bågskytt släpper pilen’, vägledde modellen till att producera en mer detaljerad version som ‘En bågskytt drar strängen tillbaka till full spänning, sedan släpper pilen, som flyger rakt och träffar en prick på ett papper mål’.

Eftersom moderna video modeller kan tolka längre beskrivningar, förfinade forskarna ytterligare beskrivningarna med Mistral-NeMo-12B-Instruct prompt-översättare, för att lägga till visuella detaljer utan att ändra den ursprungliga meningen.

Exempel på prompter från VideoPhy-2, kategoriserade efter fysiska aktiviteter eller objekt interaktioner. Varje prompt är parat med sin motsvarande åtgärd och den relevanta fysiska principen den testar.

Exempel på prompter från VideoPhy-2, kategoriserade efter fysiska aktiviteter eller objekt interaktioner. Varje prompt är parat med sin motsvarande åtgärd och den relevanta fysiska principen den testar.

För den tredje etappen härleddes fysiska regler inte från textprompter, utan från genererade videor, eftersom generativa modeller kan ha svårt att följa villkorsprompter.

Videor skapades först med VideoPhy-2-prompter, sedan ‘uppkapades’ med Gemini-2.0-Flash-Exp för att extrahera nyckelinformation. Modellen föreslog tre förväntade fysiska regler per video, som mänskliga annotatorer granskade och utvidgade genom att identifiera ytterligare potentiella brott.

Exempel på de uppskalade beskrivningarna.

Exempel på de uppskalade beskrivningarna.

Sedan genererade forskarna videor med CogVideoX-5B med prompter från VideoPhy-2-dataseten. De valde sedan 60 åtgärder av 197 där modellen konsekvent misslyckades med att följa både prompter och grundläggande fysiskt sunt förnuft.

Dessa åtgärder involverade fysikrika interaktioner som momentumöverföring i diskuskastning, tillståndsändringar som att böja ett föremål tills det går sönder, balansuppgifter som tightrope gång, och komplexa rörelser som inkluderade bakflips, polstångshopp och pizzakastning, bland annat. Totalt valdes 1,200 prompter för att öka svårighetsgraden av underdataseten.

Det resulterande dataseten bestod av 3,940 beskrivningar – 5,72 gånger mer än den tidigare versionen av VideoPhy. Den genomsnittliga längden på de ursprungliga beskrivningarna är 16 token, medan uppskalade beskrivningar når 138 token – 1,88 gånger och 16,2 gånger längre, respektive.

Datasetet innehåller också 102,000 mänskliga annoteringar som täcker semantisk överensstämmelse, fysiskt sunt förnuft och regelbrott över flera video-genereringsmodeller.

Utvärdering

Forskarna definierade sedan tydliga kriterier för att utvärdera videorna. Det primära målet var att bedöma hur bra varje video matchade sin ingångsprompt och följde grundläggande fysiska principer.

Istället för att enkelt rangordna videor efter preferens, använde de poängbaserad återkoppling för att fånga specifika framgångar och misslyckanden. Mänskliga annotatorer poängsatte videor på en femgradig skala, vilket möjliggjorde mer detaljerade bedömningar, medan utvärderingen också kontrollerade om videorna följde olika fysiska regler och lagar.

För mänsklig utvärdering valdes en grupp av 12 annotatorer ut från tester på Amazon Mechanical Turk (AMT), och tillhandahöll poäng efter att ha fått detaljerad fjärrundervisning. För rättvisa utvärderades semantisk överensstämmelse och fysiskt sunt förnuft separat (i den ursprungliga VideoPhy-studien utvärderades de gemensamt).

Annotatorerna poängsatte först hur bra videor matchade sina ingångsprompter, sedan utvärderade de fysisk plausibilitet, poängsatte regelbrott och övergripande realism på en femgradig skala. Endast de ursprungliga prompterna visades, för att upprätthålla en rättvis jämförelse över modeller.

Gränssnittet som presenterades för AMT-annotatorerna.

Gränssnittet som presenterades för AMT-annotatorerna.

Även om mänsklig bedömning förblir guldstandarden, är den dyra och kommer med ett antal kaveat. Därför är automatiserad utvärdering avgörande för snabbare och mer skalbar modellutvärdering.

Författarnas papper testade flera video-språk modeller, inklusive Gemini-2.0-Flash-Exp och VideoScore, på deras förmåga att poängsätta videor för semantisk noggrannhet och för ‘fysiskt sunt förnuft’.

Modellerna poängsatte varje video på en femgradig skala, medan en separat klassificeringsuppgift bestämde om fysiska regler följdes, bröts eller var oklara.

Experiment visade att befintliga video-språk modeller kämpade för att matcha mänskliga bedömningar, främst på grund av svag fysisk resonemang och komplexiteten i prompterna. För att förbättra automatiserad utvärdering utvecklade forskarna VideoPhy-2-Autoeval, en 7B-parameter modell som är utformad för att ge mer exakta förutsägelser över tre kategorier: semantisk överensstämmelse; fysiskt sunt förnuft; och regelöverensstämmelse, finjusterad på VideoCon-Physics-modellen med 50,000 mänskliga annoteringar*.

Data och tester

Med dessa verktyg på plats testade författarna ett antal generativa video system, både genom lokala installationer och, där nödvändigt, via kommersiella API:er: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; och Luma Ray.

Modellerna promptades med uppskalade beskrivningar där möjligt, förutom att Hunyuan Video och VideoCrafter2 opererar under 77-token CLIP-begränsningar, och kan inte acceptera prompter över en viss längd.

Videor som genererades hölls till under 6 sekunder, eftersom kortare utdata är lättare att utvärdera.

Drivdata var från VideoPhy-2-datasetet, som delades upp i en benchmark och en träningsuppsättning. 590 videor genererades per modell, förutom för Sora och Ray2; på grund av kostnadsfaktorn (lägre antal videor genererades för dessa).

(Vänligen se den ursprungliga artikeln för ytterligare utvärderingsdetaljer, som är utförligt dokumenterade där)

Den initiala utvärderingen handlade om fysiska aktiviteter/sport (PA) och objekt interaktioner (OI), och testade både den allmänna dataseten och den ovannämnda ‘svårare’ undermängden:

Resultat från den första omgången.

Resultat från den första omgången.

Här kommenterar författarna:

‘Även den bäst presterande modellen, Wan2.1-14B, uppnår endast 32,6% och 21,9% på den fullständiga och svårare delmängden av vårt dataset, respektive. Dess relativt starka prestation kan tillskrivas mångfalden av dess multimodala träningsdata, tillsammans med robust rörelsefilter som bevarar högkvalitativa videor över ett brett spektrum av åtgärder.

‘Vi observerar att slutna modeller, som Ray2, presterar sämre än öppna modeller som Wan2.1-14B och CogVideoX-5B. Detta tyder på att slutna modeller inte nödvändigtvis är överlägsna öppna modeller när det gäller att fånga fysiskt sunt förnuft.

‘Noterbart är att Cosmos-Diffusion-7B uppnår den näst bästa poängen på den svårare delmängden, och till och med överträffar den mycket större HunyuanVideo-13B-modellen. Detta kan bero på den höga representationen av mänskliga åtgärder i dess träningsdata, tillsammans med syntetiskt renderade simuleringar.’

Resultaten visade att video-modellerna kämpade mer med fysiska aktiviteter som sport än med enklare objekt interaktioner. Detta tyder på att förbättring av AI-genererade videor i detta område kommer att kräva bättre dataset – särskilt högkvalitativa filmer av sport som tennis, diskuskastning, baseboll och cricket.

Studien undersökte också om en modells fysisk plausibilitet korrelerade med andra video-kvalitetsmått, såsom estetik och rörelse-smoothness. Resultaten visade att det inte fanns någon stark korrelation, vilket betyder att en modell inte kan förbättra sin prestation på VideoPhy-2 genom att enbart generera visuellt tilltalande eller flytande rörelse – den behöver en djupare förståelse av fysiskt sunt förnuft.

Även om artikeln tillhandahåller många kvalitativa exempel, verkar få av de statiska exemplen i PDF:en relatera till de omfattande video-exemplen som författarna tillhandahåller på projektwebbplatsen. Därför kommer vi att titta på ett litet urval av de statiska exemplen och sedan några fler av de faktiska projektvideorna.

Den översta raden visar videor genererade av Wan2.1. (a) I Ray2 ligger jetskin på vänster sida efter och rör sig bakåt. (b) I Hunyuan-13B deformeras en slägga mitt i svängen, och en trasig träbräda dyker upp oväntat. (c) I Cosmos-7B expellerar en spjut sand innan den kommer i kontakt med marken.

Den översta raden visar videor genererade av Wan2.1. (a) I Ray2 ligger jetskin på vänster sida efter och rör sig bakåt. (b) I Hunyuan-13B deformeras en slägga mitt i svängen, och en trasig träbräda dyker upp oväntat. (c) I Cosmos-7B expellerar en spjut sand innan den kommer i kontakt med marken.

Angående ovanstående kvalitativa test, kommenterar författarna:

‘[Vi] observerar brott mot fysiskt sunt förnuft, såsom jetski som rör sig onaturligt i omvänd ordning och deformationen av en solid slägga, som strider mot principerna för elasticitet. Men även Wan lider av bristen på fysiskt sunt förnuft, som visas i [den inbäddade videon i början av den här artikeln].

‘I detta fall betonar vi att en sten börjar rulla och accelerera uppför, i strid med den fysiska lagen om gravitation.’

Ytterligare exempel från projektwebbplatsen:

Klicka för att spela. Här var beskrivningen ‘En person vrider en våt handduk, vatten sprutar utåt i en synlig båge’ – men den resulterande källan till vatten är mer som en vattenslang än en handduk.

Klicka för att spela.Här var beskrivningen ‘En kemist häller en klar vätska från en bägare till en provrör, undviker noggrant spill’ – men vi kan se att volymen av vatten som tillförs bägaren inte är konsekvent med den mängd som lämnar kärlet.

Som jag nämnde i början, är volymen av material associerat med detta projekt långt utöver vad som kan täckas här. Därför hänvisar vi till den ursprungliga artikeln, projektwebbplatsen och relaterade webbplatser som nämns tidigare, för en fullständig översikt av författarnas procedurer och betydligt fler testexempel och procedur detaljer.

 

* Såsom proveniens för annoteringarna, anger artikeln endast ‘förvärvade för dessa uppgifter’ – det verkar vara en hel del för att ha genererats av 12 AMT-arbetare.

Publicerad första gången torsdag, 13 mars 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai