AI-modeller og plattformer

Tilberedning av narrative konsistens for lang video-generering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Den nylige offentlige utgivelsen av Hunyuan Video generative AI-modellen har intensivert pågående diskusjoner om potensialet for store multimodale visjon-språk-modeller til en dag å kunne lage hele filmer.

Men som vi har observert, er dette et svært fjernt prospekt for øyeblikket, av en rekke grunner. En av dem er den svært korte oppmerksomhetsvinduet for de fleste AI-video-generatorene, som sliter med å opprettholde konsistens, selv i en kort enkelt scene, ikke å si en rekke scener.

En annen er at konsistente referanser til video-innhold (slik som utforskbare miljøer, som ikke bør endre seg tilfeldig hvis du går tilbake til dem) bare kan oppnås i diffusjonsmodeller ved tilpasnings-teknikker som lav-rank-tilpasning (LoRA), som begrenser de uten-av-boksen-egenskapene til grunn-modellene.

Derfor ser utviklingen av generativ video ut til å stalle, med mindre nye tilnærminger til narrative konsistens utvikles.

Oppskrift for konsistens

Med dette i mente, har et nytt samarbeid mellom USA og Kina foreslått å bruke instruksjonsvideoer for matlaging som en mulig mal for fremtidige narrative konsistens-systemer.

Klikk for å spille. VideoAuteur-prosjektet systematiserer analysen av deler av en matlagningsprosess, for å produsere en fin-kapslet ny datasett og en orkestreringsmetode for generering av matlagningsvideoer. Se kilde-nettsted for bedre oppløsning. Kilde: https://videoauteur.github.io/

Tittelen VideoAuteur foreslår en to-trinns pipeline for å generere instruksjonsvideoer for matlaging, ved å kombinere nøkkel-rammer og undertekster, og oppnår state-of-the-art-resultater i – i all hemmelighet – en under-betjent rom.

VideoAuteurs prosjekt-side inkluderer også en rekke mer oppmerksomhet-tiltrekkende videoer som bruker samme teknikken, som en foreslått trailer for en (ikke-eksisterende) Marvel/DC-kryssning:

Klikk for å spille. To superhelter fra alternative universer møtes i en falsk trailer fra VideoAuteur. Se kilde-nettsted for bedre oppløsning.

Siden inkluderer også lignende-stilte promo-videoer for en likevel ikke-eksisterende Netflix-dyreserie og en Tesla (TSLA ) -bil-reklame.

I utviklingen av VideoAuteur, eksperimenterte forfatterne med diverse tap-funksjoner, og andre nye tilnærminger. For å utvikle en oppskrift for hvordan-gjøre-generering, kurerte de også CookGen, den største datasett fokusert på matlagnings-domenet, med 200 000 video-klipp med en gjennomsnittlig varighet på 9,5 sekunder.

Med en gjennomsnitt på 768,3 ord per video, er CookGen komfortabelt den mest omfattende annoterte datasett av sin type. Diverse visjon/språk-modeller ble brukt, blant annet for å sikre at beskrivelsene var så detaljerte, relevante og nøyaktige som mulig.

Matlagningsvideoer ble valgt fordi matlagnings-instruksjoner har en strukturert og ubestemt narrativ, som gjør annotering og evaluering en enklere oppgave. Unntatt for pornografiske videoer (som sannsynligvis vil komme inn i denne spesielle rommen før eller senere), er det vanskelig å tenke på noen annen sjanger like visuelt og narrativt ‘formulær’.

Forfatterne sier:

‘Vår foreslåtte to-trinns auto-regressive pipeline, som inkluderer en lang narrativ direktør og visuell-betinget video-generering, demonstrerer lovende forbedringer i semantisk konsistens og visuell trofasthet i genererte lange narrative videoer.

‘Gjennom eksperimenter på vår datasett, observerer vi forbedringer i romlig og tidsmessig kohesjon over video-sekvenser. ‘

‘Vi håper at vårt arbeid kan fasilitere videre forskning i lange narrative video-generering.’

Den nye arbeidet er tittelen VideoAuteur: Mot lange narrative video-generering, og kommer fra åtte forfattere fra Johns Hopkins University, ByteDance og ByteDance Seed.

Dataset-kurering

For å utvikle CookGen, som driver en to-trinns generativ system for å produsere AI-matlagningsvideoer, brukte forfatterne materiale fra YouCook og HowTo100M-samlinger. Forfatterne sammenligner skalaen på CookGen med tidligere datasett fokusert på narrative utvikling i generativ video, som Flintstones-datasettet, Pororo-tegneserie-datasettet, StoryGen, Tencent’s StoryStream og VIST.

Sammenligning av bilder og tekstlengde mellom CookGen og de nærmeste mest befolkede lignende datasett. Kilde: https://arxiv.org/pdf/2501.06173

Sammenligning av bilder og tekstlengde mellom CookGen og de nærmeste mest befolkede lignende datasett. Kilde: https://arxiv.org/pdf/2501.06173

CookGen fokuserer på virkelige narrative, spesielt prosedyre-aktiviteter som matlaging, og tilbyr klarere og enklere å annotere historier sammenlignet med bilde-baserte tegneserie-datasett. Det overgår det største eksisterende datasettet, StoryStream, med 150x flere rammeverk og 5x tettere tekst-beskrivelser.

Forskerne tilpasset en undertekst-modell ved å bruke metodologien til LLaVA-NeXT som basis. De automatiske tale-gjenkjenning (ASR) pseudo-merkene som ble oppnådd for HowTo100M, ble brukt som ‘handling’ for hver video, og deretter forbedret videre av store språk-modeller (LLM).

For eksempel ble ChatGPT-4o brukt til å produsere en undertekst-datasett, og ble bedt om å fokusere på subjekt-objekt-interaksjoner (slik som hender som håndterer redskaper og mat), objekt-egenskaper og tids-dynamikk.

Ettersom ASR-skriptene sannsynligvis inneholder uakkurater og er generelt ‘støyende’, ble Intersection-over-Union (IoU) brukt som en metode for å måle hvor nær undertekstene konformerte til den delen av videoen de var rettet mot. Forfatterne merker at dette var avgjørende for å skape narrative konsistens.

De kurerte klippene ble evaluert ved å bruke Fréchet Video Distance (FVD), som måler forskjellen mellom grunn-sannhet (virkelige verden) eksempler og genererte eksempler, både med og uten grunn-sannhet nøkkel-rammer, og nådde et performant resultat:

Bruk av FVD til å evaluere avstanden mellom videoer generert med de nye undertekstene, både med og uten bruk av nøkkel-rammer fanget fra eksempel-videoene.

Bruk av FVD til å evaluere avstanden mellom videoer generert med de nye undertekstene, både med og uten bruk av nøkkel-rammer fanget fra eksempel-videoene.

I tillegg ble klippene vurderet både av GPT-4o og seks menneskelige annotatorer, etter LLaVA-Hound‘s definisjon av ‘hallusinasjon’ (dvs. evnen til å oppfinne spuriøse innhold).

Forskerne sammenlignet kvaliteten på undertekstene med Qwen2-VL-72B-samlingen, og oppnådde en litt forbedret score.

Sammenligning av FVD- og menneskelig vurderingsscore mellom Qwen2-VL-72B og forfatternes samling.

Sammenligning av FVD- og menneskelig vurderingsscore mellom Qwen2-VL-72B og forfatternes samling.

Metode

VideoAuteurs generative fase er delt mellom Lang Narrativ Direktør (LND) og visuell-betinget video-genereringsmodell (VCVGM).

LND genererer en sekvens av visuelle innlejninger eller nøkkel-rammer som karakteriserer den narrative flyten, lignende ‘essensielle høydepunkter’. VCVGM genererer video-klipp basert på disse valg.

Skjema for VideoAuteur-prosessen. Lang Narrativ Direktør gjør passende valg for å mata til Seed-X-drevet genereringsmodul.

Skjema for VideoAuteur-prosessen. Lang Narrativ Direktør gjør passende valg for å mata til Seed-X-drevet genereringsmodul.

Forfatterne diskuterer omfattende de forskjellige fortjenestene med en interleaving image-text direktør og en språk-sentrert nøkkel-ramme-direktør, og konkluderer med at den førstnevnte er den mest effektive tilnærmingen.

Interleaving image-text direktøren genererer en sekvens ved å interpolere tekst-token og visuelle innlejninger, ved å bruke en auto-regressiv modell til å forutsi neste token, basert på den kombinerte konteksten av både tekst og bilder. Dette sikrer en tett tilknytning mellom visuelle og tekst.

I motsetning genererer den språk-senterte nøkkel-ramme-direktøren nøkkel-rammer ved å bruke en tekst-betinget diffusjonsmodell basert bare på undertekster, uten å inkorporere visuelle innlejninger i genereringsprosessen.

Forskerne fant at selv om den språk-senterte metoden genererer visuelt tiltalende nøkkel-rammer, mangler den konsistens over rammer, og argumenterer for at den interpolerte metoden oppnår høyere score i realisme og visuell konsistens. De fant også at denne metoden var bedre i stand til å lære en realistisk visuell stil gjennom trening, selv om den noen ganger hadde noen repetitive eller støyende elementer.

Usannsynlig, i en forsknings-retning dominert av å bruke Stable Diffusion og Flux i arbeidsflyten, brukte forfatterne Tencent’s SEED-X 7B-parameter multi-modal LLM grunn-modell for deres generative pipeline (selv om denne modellen også utnytter Stability.ai’s SDXL-utgave av Stable Diffusion for en begrenset del av arkitekturen).

Forfatterne sier:

‘I motsetning til den klassiske Image-to-Video (I2V)-pipelinen som bruker et bilde som start-ramme, vår tilnærming utnytter [regressede visuelle latenter] som kontinuerlige betingelser gjennom hele [sekvensen].

‘Vi forbedrer også robustheten og kvaliteten på de genererte videoene ved å tilpasse modellen til å håndtere støyende visuelle innlejninger, siden de regrederte visuelle latentene ikke alltid er perfekte på grunn av regresjons-feil.’

Selv om typiske visuell-betingede generative pipeliner av denne typen ofte bruker initial-nøkkel-rammer som en start-punkt for modell-guidance, utvider VideoAuteur på denne paradigmen ved å generere multi-delt visuelle tilstander i en semantisk kohærent latent-rom, og unngår den potensielle forutinntakten av å basere videre generering bare på ‘start-rammer’.

Skjema for bruk av visuelle tilstands-innlejninger som en overlegen betingelses-metode.

Skjema for bruk av visuelle tilstands-innlejninger som en overlegen betingelses-metode.

Tester

I tråd med metodene til SeedStory, bruker forskerne SEED-X til å anvende LoRA-tilpasning på deres narrative datasett, og beskriver resultatet som en ‘Sora-lignende modell’, forhåndstrænet på stor-skala video/tale-par, og i stand til å akseptere både visuelle og tekst-betingelser og -prompt.

32 000 narrative videoer ble brukt til modell-utvikling, med 1 000 holdt til side som validerings-eksempler. Videoene ble beskåret til 448 piksler på den korte siden og deretter midt-beskåret til 448x448px.

For trening, ble den narrative genereringen evaluert primært på YouCook2-valideringssettet. Howto100M-settet ble brukt til data-kvalitets-evaluering og også for bilde-til-video-generering.

For visuell-betinget tap, brukte forfatterne diffusjons-tap fra DiT og en 2024-arbeid basert rundt Stable Diffusion.

For å bevise deres påstand om at interleaving er en overlegen tilnærming, stilte forfatterne VideoAuteur mot flere metoder som bare avhenger av tekst-basert input: EMU-2, SEED-X, SDXL og FLUX.1-schnell (FLUX.1-s).

Gitt en global prompt, 'Steg-for-steg guide til å lage mapo-tofu', genererer den interpolerte direktøren handlinger, undertekster og bilde-innlejninger sekvensielt for å fortelle prosessen. De første to radene viser nøkkel-rammer dekodet fra EMU-2 og SEED-X latente rom. Disse bildene er realistiske og konsistente, men mindre polerte enn de fra avanserte modeller som SDXL og FLUX.

Gitt en global prompt, ‘Steg-for-steg guide til å lage mapo-tofu’, genererer den interpolerte direktøren handlinger, undertekster og bilde-innlejninger sekvensielt for å fortelle prosessen. De første to radene viser nøkkel-rammer dekodet fra EMU-2 og SEED-X latente rom. Disse bildene er realistiske og konsistente, men mindre polerte enn de fra avanserte modeller som SDXL og FLUX.

Forfatterne sier:

‘Den språk-senterte tilnærmingen som bruker tekst-til-bilde-modeller produserer visuelt tiltalende nøkkel-rammer, men lider under en mangel på konsistens over rammer på grunn av begrenset gjensidig informasjon. I motsetning til dette, oppnår den interpolerte genererings-metoden en realistisk visuell stil gjennom trening. ‘

‘Men den genererer noen ganger bilder med repetitive eller støyende elementer, da den auto-regressive modellen sliter med å skape nøyaktige innlejninger i en enkelt pass.’

Menneskelig evaluering bekrefter også forfatternes påstand om den forbedrede ytelsen til den interpolerte tilnærmingen, med interpolerte metoder som oppnår de høyeste scorene i en undersøkelse.

Sammenligning av tilnærminger fra en menneskelig studie gjennomført for papiret.

Sammenligning av tilnærminger fra en menneskelig studie gjennomført for papiret.

Men vi merker at språk-senterte tilnærminger oppnår de beste estetiske scorene. Forfatterne hevder likevel at dette ikke er det sentrale spørsmålet i generering av lange narrative videoer.

Klikk for å spille. Sekvenser generert for en pizza-bygging-video, av VideoAuteur.

Konklusjon

Den mest populære forsknings-retningen i forhold til denne utfordringen, dvs. narrative konsistens i lang-forms video-generering, er opptatt av enkelt-bilder. Prosjekter av denne typen inkluderer DreamStory, StoryDiffusion, TheaterGen og NVIDIA’s ConsiStory.

I en viss forstand, faller VideoAuteur også inn i denne ‘statiske’ kategorien, siden det bruker seed-bilder fra hvilke klipp-deler genereres. Men den interpolerte kombinasjonen av video og semantisk innhold bringer prosessen et skritt nærmere en praktisk pipeline.

 

Først publisert torsdag, 16. januar 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai