Andersons vinkel

Hvorfor AI-video noen ganger får det bakfra

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Hvis 2022 var året da generativ AI fanget en videre offentlighetens forestilling, er 2025 året hvor den nye generasjonen av generative video-rammeverk fra Kina ser ut til å gjøre det samme.

Tencents Hunyuan Video har hatt en stor innvirkning på hobbyist AI-samfunnet med sin åpne kilde-utgivelse av en full-verden video-diffusjonsmodell som brukerne kan tilpasse til sine behov.

Nært på hælene er Alibabas mer nylige Wan 2.1, en av de mest kraftfulle bilde-til-video FOSS-løsningene i denne perioden – nå med støtte for tilpasning gjennom Wan LoRAs.

Foruten tilgjengeligheten av den nyeste menneske-sentrerte grunnmodell SkyReels, venter vi på utgivelsen av Alibabas omfattende VACE video-oppbygging og redigeringssuite:

Klikk for å spille. Den forestående utgivelsen av Alibabas multi-funksjon AI-redigeringspakke VACE har begeistrat brukersamfunnet. Kilde: https://ali-vilab.github.io/VACE-Page/

Plutselig Innvirkning

Den generative video AI-forskningscen selv er ikke mindre eksplosiv; det er fortsatt første halvdel av mars, og tirsdagens innleveringer til Arxivs datavisjon-seksjon (et knutepunkt for generativ AI-papirer) kom til nesten 350 innleveringer – et tall som vanligvis er forbundet med høydepunktet av konferansesæsonen.

De to årene siden lanseringen av Stable Diffusion sommeren 2022 (og den påfølgende utviklingen av Dreambooth og LoRA-tilpasningsmetoder) har vært kjennetegnet av mangelen på videre store fremgang, frem til de siste ukene, hvor nye utgivelser og innovasjoner har skjedd i så raskt et tempo at det er nesten umulig å holde seg oppdatert, ikke å nevne å dekke det hele.

Video-diffusjonsmodeller som Hunyuan og Wan 2.1 har løst, til slutt, og etter år med mislykkede forsøk fra hundrevis av forskningsinitiativer, problemet med temporær konsistens i forhold til generering av mennesker, og i stor grad også til miljøer og objekter.

Det kan være liten tvil om at VFX-studioer nå anvender ansatte og ressurser for å tilpasse de nye kinesiske video-modellene for å løse umiddelbare utfordringer som ansikt-erstatning, til tross for mangelen på ControlNet-lignende hjelpe-mekanismer for disse systemene.

Det må være en så stor lettelse at en slik betydelig hindring nå er overvunnet, om enn ikke gjennom de forventede kanaler.

Av de problemer som gjenstår, er dette imidlertid ikke ubetydelig:

Klikk for å spille. Basert på prompten ‘En liten stein ruller ned en bratt, steinete skråning, forflytter jord og små steiner ‘, Wan 2.1, som oppnådde de høyeste poengene i den nye artikkelen, gjør en enkel feil. Kilde: https://videophy2.github.io/

Opp Bakken Bakover

Alle tekst-til-video og bilde-til-video-systemer som er tilgjengelige nå, inkludert kommersielle lukkede kilde-modeller, har en tendens til å produsere fysikk-feil som den ovennevnte, hvor videoen viser en stein som ruller oppover, basert på prompten ‘En liten stein ruller ned en bratt, steinete skråning, forflytter jord og små steiner ‘.

En teori om hvorfor dette skjer, nylig foreslått i en akademisk samarbeid mellom Alibaba og UAE, er at modellene alltid trenes på enkeltbilder, i en viss forstand, selv når de trenes på videoer (som skrives ut til enkelt-rammesequenser for treningsformål); og de kan ikke nødvendigvis lære den korrekte temporale rekkefølgen av ‘før’ og ‘etter’-bilder.

Imidlertid er den mest sannsynlige løsningen at modellene i question har brukt data-forstørrelse-rutiner som involverer å eksponere en kilde-trening-klipp for modellen både fremover og bakover, effektivt fordobler treningsdataene.

Det har lenge vært kjent at dette ikke bør gjøres arbitrært, fordi noen bevegelser fungerer i revers, men mange gjør det ikke. En 2019-studie fra Storbritannias University of Bristol forsøkte å utvikle en metode som kunne skille ekvivariant, invariant og irreversibel kilde-data video-klipp som samexisterer i en enkelt dataset (se bilde under), med tanken om at uegnede kilde-klipp kunne filtreres ut fra data-forstørrelse-rutiner.

Eksempler på tre typer bevegelser, hvorav bare en er fritt reverserbar mens den opprettholder plausibel fysisk dynamikk. Kilde: https://arxiv.org/abs/1909.09422

Eksempler på tre typer bevegelser, hvorav bare en er fritt reverserbar mens den opprettholder plausibel fysisk dynamikk. Kilde: https://arxiv.org/abs/1909.09422

Forfatterne av dette arbeidet rammer problemet tydelig:

‘Vi finner at realisme i reverserte videoer forrådes av reverseringsartefakter, aspekter av scenen som ikke ville være mulig i en naturlig verden. Noen artefakter er subtile, mens andre er lette å spore, som en reversert ‘kast’ handling hvor det kastede objektet spontant stiger fra gulvet.

‘Vi observerer to typer reverseringsartefakter, fysiske, de som viser brudd på naturlovene, og usannsynlige, de som avbilder en mulig, men usannsynlig scenario. Disse er ikke eksklusive, og mange reverserte handlinger lider av begge typer artefakter, som når man ukrøller et ark papir.

‘Eksempler på fysiske artefakter inkluderer: invertert tyngdekraft (f.eks. ‘dropping noe’), spontane impulser på objekter (f.eks. ‘spinning en pen’), og irreversibel tilstandsforandring (f.eks. ‘brenning en lys’). Et eksempel på en usannsynlig artefakt: å ta en plate fra skapet, tørke den og plassere den på tørkestativet.

‘Dette type gjenbruk av data er svært vanlig under trenings-tid, og kan være nyttig – for eksempel, i å sikre at modellen ikke lærer bare en visning av et bilde eller objekt som kan bli snudd eller rotert uten å tape sin sentrale kohensjon og logikk.

‘Dette fungerer bare for objekter som er sannt symmetriske, naturligvis; og å lære fysikk fra en ‘reversert’ video fungerer bare hvis den reverserte versjonen har like mye mening som den fremoverrettede versjonen.’

Midlertidige Reverseringer

Vi har ingen bevis for at systemer som Hunyuan Video og Wan 2.1 tillot arbitrært ‘reverserte’ klipp å bli eksponert for modellen under trenings-tid (hverken gruppe av forskere har vært spesifikke angående data-forstørrelse-rutiner).

Likevel er den eneste rimelige alternative muligheten, i lys av så mange rapporter (og min egen praktiske erfaring), å se ut til å være at hyperskala-datasettene som driver disse modellene kan inneholde klipp som faktisk viser bevegelser som skjer i revers.

Steinen i eksempel-videoen ovenfor ble generert ved hjelp av Wan 2.1, og vises i en ny studie som undersøker hvordan godt video-diffusjonsmodeller håndterer fysikk.

I tester for dette prosjektet oppnådde Wan 2.1 en score på bare 22% når det gjelder evnen til å holde fast ved fysikklover.

Imidlertid er dette den beste scoren av noen system testet for arbeidet, noe som indikerer at vi kanskje har funnet vår neste hinder for video-AI:

Poeng oppnådd av ledende åpne og lukkede kilde-systemer, med utgangen fra rammeverkene evaluert av menneskelige annotatorer. Kilde: https://arxiv.org/pdf/2503.06800

Poeng oppnådd av ledende åpne og lukkede kilde-systemer, med utgangen fra rammeverkene evaluert av menneskelige annotatorer. Kilde: https://arxiv.org/pdf/2503.06800

Forfatterne av det nye arbeidet har utviklet en benchmarking-system, nå i sin andre iterasjon, kalt VideoPhy, med koden tilgjengelig på GitHub.

Selv om omfanget av arbeidet er utenfor hva vi kan dekke her, la oss ta en generell titt på metodikken og dens potensiale for å etablere en målestokk som kan hjelpe å styre kursen for fremtidige modell-trenings-sesjoner bort fra disse merkelige eksemplene på reversering.

Studien, utført av seks forskere fra UCLA og Google Research, heter VideoPhy-2: En utfordrende action-sentrert fysisk fornuft-evaluering i video-generering. En travel ledsagende prosjekt-side er også tilgjengelig, sammen med kode og datasett på GitHub, og et datasett-visnings-verktøy på Hugging Face.

Klikk for å spille. Her feiler OpenAI Sora-modellen i å forstå interaksjonene mellom årer og refleksjoner, og kan ikke levere en logisk fysisk flyt heller for personen i båten eller måten båten interagerer med henne på.

Metode

Forfatterne beskriver den nyeste versjonen av deres arbeid, VideoPhy-2, som en ‘utfordrende felles fornuft-evaluering-datasett for virkelige handlinger.’ Samlingen inneholder 197 handlinger over en rekke diverse fysiske aktiviteter som hula-hopping, gymnastikk og tennis, samt objekt-interaksjoner, som bøyning av et objekt til det knekker.

En stor språk-modell (LLM) brukes til å generere 3840 prompter fra disse seed-handlingene, og promptene brukes til å syntetisere videoer via de forskjellige rammeverkene som testes.

Gjennom prosessen har forfatterne utviklet en liste over ‘kandidat’ fysiske regler og lover som AI-genererte videoer bør oppfylle, ved hjelp av visjon-språk-modeller for evaluering.

Forfatterne sier:

‘For eksempel, i en video av en idrettsutøver som spiller tennis, ville en fysisk regel være at en tennis-ball skulle følge en parabolsk bane under tyngdekraften. For gull-standard-dømming, ber vi menneskelige annotatorer om å score hver video basert på overordnet semantisk overensstemmelse og fysisk fornuft, og å merke deres overensstemmelse med forskjellige fysiske regler.’

Ovenfor: En tekst-prompt genereres fra en handling ved hjelp av en LLM og brukes til å lage en video med en tekst-til-video-genererator. En visjon-språk-modell legger til en tittel på videoen, og identifiserer mulige fysiske regler som er i spill. Under: Menneskelige annotatorer vurderer videoens realisme, bekrefter regel-brudd, legger til manglende regler og sjekker om videoen matcher den opprinnelige prompten.

Ovenfor: En tekst-prompt genereres fra en handling ved hjelp av en LLM og brukes til å lage en video med en tekst-til-video-genererator. En visjon-språk-modell legger til en tittel på videoen, og identifiserer mulige fysiske regler som er i spill. Under: Menneskelige annotatorer vurderer videoens realisme, bekrefter regel-brudd, legger til manglende regler og sjekker om videoen matcher den opprinnelige prompten.

Forskerne curerte opprinnelig en samling av handlinger for å evaluere fysisk fornuft i AI-genererte videoer. De startet med over 600 handlinger hentet fra Kinetics, UCF-101 og SSv2-datasettene, med fokus på aktiviteter som involverer idrett, objekt-interaksjoner og virkelige fysikk.

To uavhengige grupper av STEM-utdannede student-annotatorer (med en minimums bachelor-grad) gjennomgikk og filtrerte listen, og valgte handlinger som testet prinsipper som tyngdekraft, bevegelsesmengde og elasticitet, mens de fjernet lav-bevegelses-oppdrag som skriving, klappende en katt eller tygging.

Etter videre finjustering med Gemini-2.0-Flash-Exp for å eliminere duplikater, inkluderte den endelige datasett 197 handlinger, med 54 som involverte objekt-interaksjoner og 143 som var sentrert rundt fysiske og idretts-aktiviteter:

Eksempler fra de destillerte handlingene.

Eksempler fra de destillerte handlingene.

I den andre fasen brukte forskerne Gemini-2.0-Flash-Exp til å generere 20 prompter for hver handling i datasett, noe som resulterte i totalt 3 940 prompter. Genereringsprosessen fokuserte på synlige fysiske interaksjoner som kunne bli tydelig representert i en generert video. Dette ekskluderte ikke-visualiserbare elementer som emosjoner, sanse-detaljer og abstrakt språk, men inkluderte diverse karakterer og objekter.

For eksempel, i stedet for en enkel prompt som ‘En bueskytter slipper pilen’, ble modellen guidet til å produsere en mer detaljert versjon som ‘En bueskytter trekker buen tilbake til full spenning, og slipper pilen, som flyr rett og treffer et mål på et papir-mål’.

Siden moderne video-modeller kan tolke lengre beskrivelser, finjusterte forskerne videre beskrivelsene ved hjelp av Mistral-NeMo-12B-Instruct-prompt-oppgraderingen, for å legge til visuelle detaljer uten å endre den opprinnelige betydningen.

Eksempler på prompter fra VideoPhy-2, kategorisert etter fysiske aktiviteter eller objekt-interaksjoner. Hver prompt er parret med sin korresponderende handling og den relevante fysiske prinsippet den tester.

Eksempler på prompter fra VideoPhy-2, kategorisert etter fysiske aktiviteter eller objekt-interaksjoner. Hver prompt er parret med sin korresponderende handling og den relevante fysiske prinsippet den tester.

I den tredje fasen ble fysiske regler ikke avledet fra tekst-prompter, men fra genererte videoer, ettersom generative modeller kan slite med å holde seg til betingede tekst-prompter.

Videoer ble først generert ved hjelp av VideoPhy-2-prompter, og deretter ‘opp-kapte’ med Gemini-2.0-Flash-Exp for å trekke ut nøkkel-detaljer. Modellen foreslo tre forventede fysiske regler per video, som menneskelige annotatorer gjennomgikk og utvidet ved å identifisere ytterligere potensielle brudd.

Eksempler fra de opp-kapte beskrivelsene.

Eksempler fra de opp-kapte beskrivelsene.

Neste, for å identifisere de mest utfordrende handlingene, genererte forskerne videoer ved hjelp av CogVideoX-5B med prompter fra VideoPhy-2-datasett. De valgte deretter 60 handlinger ut av 197 hvor modellen konsekvent feilet i å følge både promptene og grunnleggende fysisk fornuft.

Disse handlingene involverte fysikk-rike interaksjoner som bevegelsesmengde-overføring i diskos-kasting, tilstandsforandringer som bøyning av et objekt til det knekker, balanse-oppdrag som line-dansing og komplekse bevegelser som inkluderte bak-fliper, stang-hopping og pizza-kasting, blant andre. Totalt ble 1 200 prompter valgt for å øke vanskelighetsgraden av under-datasett.

Det resulterende datasett bestod av 3 940 beskrivelser – 5,72 ganger mer enn den tidligere versjonen av VideoPhy. Gjennomsnittlig lengde på de opprinnelige beskrivelsene er 16 token, mens opp-kapte beskrivelser når 138 token – 1,88 ganger og 16,2 ganger lengre, henholdsvis.

Datasett inkluderer også 102 000 menneskelige annotasjoner som dekker semantisk overensstemmelse, fysisk fornuft og regel-brudd over flere video-genererings-modeller.

Evaluering

Forskerne definerte deretter klare kriterier for å evaluere videoene. Hovedmålet var å vurdere hvor godt hver video matchet sin inndata-prompt og fulgte grunnleggende fysiske prinsipper.

I stedet for å bare rangere videoer etter preferanse, brukte de en vurdering-basert tilbakemelding for å fange spesifikke suksesser og feil. Menneskelige annotatorer ga videoer en score på en fem-punkts skala, noe som tillot mer detaljerte vurderinger, mens evalueringen også sjekket om videoene fulgte forskjellige fysiske regler og lover.

For menneskelig evaluering ble en gruppe på 12 annotatorer valgt fra prøver på Amazon Mechanical Turk (AMT), og ga vurderinger etter å ha mottatt detaljerte fjern-instruksjoner. For rettferdighet ble semantisk overensstemmelse og fysisk fornuft evaluert separat (i den opprinnelige VideoPhy-studien ble de evaluert sammen).

Annotatorene ga først en vurdering av hvor godt videoene matchet sine inndata-prompter, og deretter vurderingen av fysisk plausibilitet, scoring regel-brudd og overordnet realisme på en fem-punkts skala. Bare de opprinnelige promptene ble vist, for å opprettholde en rettferdig sammenligning over modellene.

Grensesnittet presentert for AMT-annotatorene.

Grensesnittet presentert for AMT-annotatorene.

Selv om menneskelig dømmekraft forblir gull-standarden, er det dyrt og kommer med en rekke med begrensninger. Derfor er automatisert evaluering essensiell for raskere og mer skalerbare modell-vurderinger.

Forfatterne testet flere video-språk-modeller, inkludert Gemini-2.0-Flash-Exp og VideoScore, på deres evne til å score videoer for semantisk nøyaktighet og for ‘fysisk fornuft’.

Modellene ga hver video en score på en fem-punkts skala, mens en separat klassifiserings-oppgave bestemte om fysiske regler ble fulgt, brutt eller uklare.

Eksperimenter viste at eksisterende video-språk-modeller slite med å matche menneskelige vurderinger, hovedsakelig på grunn av svak fysisk resonnering og kompleksiteten i promptene. For å forbedre automatisert evaluering, utviklet forskerne VideoPhy-2-Autoeval, en 7B-parameter modell designet til å gi mer nøyaktige forutsigelser over tre kategorier: semantisk overensstemmelse; fysisk fornuft; og regel-overensstemmelse, finjustert på VideoCon-Physics-modellen ved hjelp av 50 000 menneskelige annotasjoner*.

Data og Tester

Med disse verktøyene på plass, testet forfatterne en rekke generative video-systemer, både gjennom lokale installasjoner og, hvor nødvendig, via kommersielle API-er: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; og Luma Ray.

Modellene ble promptet med opp-kapte beskrivelser hvor mulig, unntatt at Hunyuan Video og VideoCrafter2 opererer under 77-token CLIP-begrensninger, og kan ikke akseptere prompter over en bestemt lengde.

Genererte videoer ble holdt under 6 sekunder, ettersom kortere utgang er lettere å evaluere.

Drive-dataene kom fra VideoPhy-2-datasett, som ble delt inn i en benchmark og en trenings-sett. 590 videoer ble generert per modell, unntatt for Sora og Ray2; på grunn av kost-faktoren (lavere antall videoer ble generert for disse).

(Vennligst se den opprinnelige artikkelen for ytterligere evaluering-detaljer, som er uttømmelig dokumentert der)

Den initielle evalueringen omhandlet fysiske aktiviteter/idrett (PA) og objekt-interaksjoner (OI), og testet både det generelle datasett og den ovennevnte ‘hardere’ under-dataset:

Resultater fra den første runden.

Resultater fra den første runden.

Her kommenterer forfatterne:

‘Selv den best-performende modellen, Wan2.1-14B, oppnår bare 32,6% og 21,9% på det fullstendige og harde delsett av vårt datasett, henholdsvis. Dens relativt sterke ytelse i forhold til andre modeller kan tilskrives mangfoldet av dens multimodale trenings-data, samt robust bevegelses-filtrering som bevare høykvalitets-videoer over en rekke handlinger.

‘Vi observerer at lukkede modeller, som Ray2, performer dårligere enn åpne modeller som Wan2.1-14B og CogVideoX-5B. Dette antyder at lukkede modeller ikke nødvendigvis er overlegne åpne modeller i å fange fysisk fornuft.

‘Det er også verdt å merke seg at Cosmos-Diffusion-7B oppnår den nest beste scoren på det harde delsett, og overstiger til og med den mye større HunyuanVideo-13B-modellen. Dette kan skyldes den høye representasjonen av menneskelige handlinger i dens trenings-data, samt syntetisk renderte simuleringer.’

Resultatene viste at video-modellene slite mer med fysiske aktiviteter som idrett enn med enklere objekt-interaksjoner. Dette antyder at å forbedre AI-genererte videoer i dette området vil kreve bedre datasett – spesielt høykvalitets-footage av idrett som tennis, diskos, baseball og cricket.

Studien undersøkte også om en modells fysisk plausibilitet korrelerte med andre video-kvalitets-målinger, som estetikk og bevegelses-glatthet. Funndene avdekket ingen sterk korrelasjon, noe som betyr at en modell ikke kan forbedre sin ytelse på VideoPhy-2 bare ved å generere visuelt tiltalende eller flytende bevegelse – den trenger en dypere forståelse av fysisk fornuft.

Som jeg nevnte i begynnelsen, er volumet av materiale assosiert med dette prosjektet langt større enn hva som kan dekket her. Derfor vennligst se den opprinnelige artikkelen, prosjekt-siden og relaterte sider nevnt tidligere, for en fullstendig oversikt over forfatternes prosedyrer, og betraktelig flere test-eksempler og prosedyre-detaljer.

 

* Som for provenansen av annotasjonene, spesifiserer artikkelen bare ‘ervervet for disse oppgavene’ – det ser ut til å være mye å ha blitt generert av 12 AMT-arbeidere.

Først publisert torsdag, 13. mars 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai