AI-modeller og platforme

Opskrift på kontinuitet til lang videogenerering

mm
Føj Unite.AI til dine foretrukne kilder på Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Den seneste offentlige udgivelse af Hunyuan Video generative AI-model har intensiveret de pågående diskussioner om potentialet for store multimodale vision-language-modeller til en dag at skabe hele film.

Men som vi har observeret, er dette et meget fjernt perspektiv på nuværende tidspunkt, af en række årsager. En af dem er den meget korte opmærksomheds窗 for de fleste AI-video-genereringsmodeller, som kæmper for at opretholde konsistens, selv i en kort enkelt optagelse, endsige en række optagelser.

En anden årsag er, at konsistente henvisninger til videoindhold (såsom gennemgåelige miljøer, som ikke skal ændre sig tilfældigt, hvis man genserer dem) kun kan opnås i diffusionsmodeller ved hjælp af tilpasningsteknikker såsom low-rank adaptation (LoRA), som begrænser grundmodelleternes ud af boksen-kapaciteter.

Derfor synes udviklingen af generativ video at være sat til at stagnere, medmindre der udvikles nye tilgange til narrativ kontinuitet.

Opskrift på kontinuitet

Med dette i mente har et nyt samarbejde mellem USA og Kina foreslået at bruge instruktionsvideoer til madlavning som en mulig skabelon for fremtidige narrativ kontinuitetssystemer.

Klik for at afspille. VideoAuteur-projektet systematiserer analysen af dele af en madlavningsproces for at producere en fint-undertitel ny dataset og en orkestreringsmetode til generering af madlavningsvideoer. Se kilde-side for bedre opløsning.  Kilde: https://videoauteur.github.io/

Arbejdet er titlen VideoAuteur, og foreslår en to-trins pipeline til at generere instruktionsvideoer til madlavning ved hjælp af samordnede tilstande, der kombinerer nøgleframes og undertekster, og opnår state-of-the-art resultater i – i det mindste – et under-tilskrevet område.

VideoAuteurs projektside indeholder også en række mere opmærksomhedskrævende videoer, der bruger samme teknik, såsom en foreslået trailer for en (ikke-eksisterende) Marvel/DC crossover:

Klik for at afspille. To superhelte fra alternative universer mødes i en falsk trailer fra VideoAuteur. Se kilde-side for bedre opløsning.

Siden indeholder også lignende-styled promo-videoer for en lige så ikke-eksisterende Netflix-dyreserie og en Tesla (TSLA ) -bilreklame.

Ved udviklingen af VideoAuteur eksperimenterede forfatterne med diverse tab-funktioner og andre nytænkende tilgange. For at udvikle en opskrift til hvordan-genererings-arbejdsgang, kuraterede de CookGen, den største dataset fokuseret på madlavning, med 200.000 video-klip med en gennemsnitlig varighed på 9,5 sekunder.

Med en gennemsnit på 768,3 ord per video er CookGen komfortabelt den mest udførligt annoterede dataset af sin art. Forskellige vision/sprog-modeller blev brugt, blandt andet for at sikre, at beskrivelserne var så detaljerede, relevante og nøjagtige som muligt.

Madlavningsvideoer blev valgt, fordi madlavnings-instruktions-gennemgang har en struktureret og ubestemt narrativ, der gør annotation og evaluering til en lettere opgave. Undtagen for pornografiske videoer (som sandsynligvis vil indtræde i dette specifikke område før eller senere), er det svært at tænke på noget andet genre, der er lige så visuelt og narrativt ‘formel’.

Forfatterne skriver:

‘Vores foreslåede to-trins auto-regressive pipeline, der inkluderer en lang narrativ direktør og visuelt-betinget video-generering, demonstrerer lovende forbedringer i semantisk konsistens og visuel troværdighed i genererede lange narrative videoer.

‘Gennem eksperimenter på vores dataset observerer vi forbedringer i rumlig og tidsmæssig kohærens over video-sekvenser.

‘Vi håber, at vores arbejde kan facilitere yderligere forskning i lang narrativ video-generering.’

Det nye arbejde er titlen VideoAuteur: Towards Long Narrative Video Generation, og kommer fra otte forfattere på tværs af Johns Hopkins University, ByteDance og ByteDance Seed.

Dataset-kurering

For at udvikle CookGen, der driver en to-trins generativ system til at producere AI-madlavning-videoer, brugte forfatterne materiale fra YouCook og HowTo100M-samlinger. Forfatterne sammenligner størrelsen af CookGen med tidligere datasets fokuseret på narrativ udvikling i generativ video, såsom Flintstones-dataset, Pororo-tegneserie-dataset, StoryGen, Tencents StoryStream og VIST.

Sammenligning af billeder og tekstlængde mellem CookGen og de nærmest befolkede lignende datasets. Kilde: https://arxiv.org/pdf/2501.06173

Sammenligning af billeder og tekstlængde mellem CookGen og de nærmest befolkede lignende datasets. Kilde: https://arxiv.org/pdf/2501.06173

CookGen fokuserer på virkelige narrativer, særligt procedurer som madlavning, og tilbyder klarere og lettere-at-annotere historier i forhold til billed-baserede tegneserie-datasets. Det overgår det største eksisterende dataset, StoryStream, med 150 gange flere billeder og 5 gange tættere tekstbeskrivelser.

Forskere tilpassede en undertitel-model ved hjælp af LLaVA-NeXT’s metode som grund. De automatiske tale-genkendelses (ASR) pseudo-mærker, der blev erhvervet for HowTo100M, blev brugt som ‘handling’ for hver video, og derefter yderligere raffineret af store sprog-modeller (LLM’er).

For eksempel blev ChatGPT-4o brugt til at producere en undertitel-dataset, og blev bedt om at fokusere på subjekt-objekt-interaktioner (såsom hænder, der håndterer redskaber og mad), objekt-egenskaber og tidsdynamik.

Da ASR-manuskripter sandsynligvis indeholder uøjagtigheder og er generelt ‘støjende’, blev Intersection-over-Union (IoU) brugt som en metode til at måle, hvor tæt undertitlerne svarede til den del af videoen, de omhandlede. Forfatterne bemærker, at dette var afgørende for skabelsen af narrativ konsistens.

De kuraterede klip blev vurderet ved hjælp af Fréchet Video Distance (FVD), der måler forskellen mellem grund-sandhed (virkelige) eksempler og genererede eksempler, både med og uden grund-sandhed nøgle-frames, og opnåede et performant resultat:

Brug af FVD til at evaluere afstanden mellem videoer genereret med de nye undertekster, både med og uden brug af nøgle-frames fanget fra eksempel-videoerne.

Brug af FVD til at evaluere afstanden mellem videoer genereret med de nye undertekster, både med og uden brug af nøgle-frames fanget fra eksempel-videoerne.

Desuden blev klipene vurderet både af GPT-4o og seks menneskelige annotatorer, efter LLaVA-Hound‘s definition af ‘hallucination’ (dvs. evnen til at opfinde spurious indhold).

Forskere sammenlignede kvaliteten af underteksterne med Qwen2-VL-72B-samlingen og opnåede en lidt forbedret score.

Sammenligning af FVD- og menneske-vurderingsscores mellem Qwen2-VL-72B og forfatternes samling.

Sammenligning af FVD- og menneske-vurderingsscores mellem Qwen2-VL-72B og forfatternes samling.

Metode

VideoAuteurs generative fase er inddelt mellem Long Narrative Director (LND) og visuelt-betinget video-genereringsmodel (VCVGM).

LND genererer en sekvens af visuelle indlejninger eller nøgle-frames, der karakteriserer narrativ-flows, lignende ‘essentiel highlights’. VCVGM genererer video-klip baseret på disse valg.

Schema for VideoAuteur-behandling-pipeline. Long Narrative Video Director foretager passende valg til at føde til Seed-X-drevet genereringsmodul.

Schema for VideoAuteur-behandling-pipeline. Long Narrative Video Director foretager passende valg til at føde til Seed-X-drevet genereringsmodul.

Forfatterne diskuterer omfattende de forskellige fortjenester af en interleaved image-text direktør og en sprog-centreret nøgle-frames direktør, og konkluderer, at den førstnævnte er den mere effektive tilgang.

Den interleaved image-text direktør genererer en sekvens ved at interpolere tekst-token og visuelle indlejninger, ved hjælp af en auto-regressiv model til at forudsige det næste token, baseret på den kombinerede kontekst af både tekst og billeder. Dette sikrer en tæt tilknytning mellem visuelle og tekst.

I modsætning hertil syntetiserer den sprog-centreret nøgle-frames direktør nøgle-frames ved hjælp af en tekst-betinget diffusionsmodel baseret kun på undertekster, uden at inkorporere visuelle indlejninger i genereringsprocessen.

Forskere fandt, at mens den sprog-centreret metode genererer visuelt tiltalende nøgle-frames, mangler den konsistens over frames, og argumenterer for, at den interleavede metode opnår højere scores i realisme og visuel konsistens. De fandt også, at denne metode var bedre i stand til at lære en realistisk visuel stil gennem træning, selvom det nogle gange medførte nogen gentagne eller støjende elementer.

Usædvanligt, i en forskningsstræng, der er domineret af optagelse af Stable Diffusion og Flux i arbejdsgange, brugte forfatterne Tencents SEED-X 7B-parameter multi-modal LLM grundmodel for deres generative pipeline (selvom denne model udnytter Stability.ai’s SDXL-udgave af Stable Diffusion for en begrænset del af sin arkitektur).

Forfatterne skriver:

‘I modsætning til den klassiske Image-to-Video (I2V) pipeline, der bruger et billede som start-ramme, udnytter vores tilgang [regressede visuelle latenter] som kontinuerlige betingelser på tværs af [sekvensen].

‘Desuden forbedrer vi robustheden og kvaliteten af de genererede videoer ved at tilpasse modellen til at håndtere støjende visuelle indlejninger, da de regressede visuelle latenter ikke er perfekte på grund af regressionsfejl.’

Selvom typiske visuelt-betingede generative pipelines af denne type ofte bruger initial nøgle-frames som start-punkt for model-guidance, udvider VideoAuteur på denne paradigme ved at generere multi-del visuelle tilstande i en semantisk kohærent latent rum, og undgår dermed den potentielle bias af at basere yderligere generering kun på ‘start-frames’.

Schema for brug af visuelle tilstands-indlejninger som en overlegen betingelsesmetode.

Schema for brug af visuelle tilstands-indlejninger som en overlegen betingelsesmetode.

Tests

I overensstemmelse med metoderne i SeedStory, bruger forskerne SEED-X til at anvende LoRA-tilpasning på deres narrative dataset, og beskriver resultaterne som en ‘Sora-lignende model’, forudtrænet på store video/titel-par, og i stand til at acceptere både visuelle og tekst-betingelser.

32.000 narrative videoer blev brugt til model-udvikling, med 1.000 sat til side som validerings-prøver. Videoerne blev beskåret til 448 pixels på den korte side og derefter center-beskåret til 448x448px.

Til træning blev narrativ generering primært vurderet på YouCook2-validerings-sættet. Howto100M-sættet blev brugt til datakvalitets-vurdering og også til billed-til-video-generering.

Til visuelt-betinget tab, brugte forfatterne diffusions-tab fra DiT og en 2024-arbejde baseret på Stable Diffusion.

For at bevise deres påstand om, at interleaving er en overlegen tilgang, satte forfatterne VideoAuteur op imod flere metoder, der kun afhænger af tekst-baseret input: EMU-2, SEED-X, SDXL og FLUX.1-schnell (FLUX.1-s).

Givet en global prompt, 'Trin-for-trin guide til at lave mapo-tofu', genererer den interleavede direktør handlinger, undertekster og billed-indlejninger sekventielt for at fortælle processen. De første to rækker viser nøgle-frames dekodet fra EMU-2 og SEED-X latent-rum. Disse billeder er realistiske og konsistente, men mindre polerede end dem fra avancerede modeller som SDXL og FLUX.

Givet en global prompt, ‘Trin-for-trin guide til at lave mapo-tofu’, genererer den interleavede direktør handlinger, undertekster og billed-indlejninger sekventielt for at fortælle processen. De første to rækker viser nøgle-frames dekodet fra EMU-2 og SEED-X latent-rum. Disse billeder er realistiske og konsistente, men mindre polerede end dem fra avancerede modeller som SDXL og FLUX.

Forfatterne skriver:

‘Den sprog-centreret tilgang, der bruger tekst-til-billede-modeller, producerer visuelt tiltalende nøgle-frames, men lider under en mangel på konsistens over frames på grund af begrænset gensidig information. I modsætning hertil udnytter den interleavede genereringsmetode sprog-tilpasse visuelle latenter, og opnår en realistisk visuel stil gennem træning.

‘Dog genererer den af og til billeder med gentagne eller støjende elementer, da den auto-regressive model kæmper for at skabe nøjagtige indlejninger i en enkelt omgang.’

Menneske-vurdering bekræfter yderligere forfatternes påstand om den forbedrede præstation af den interleavede metode, med interleavede metoder, der opnår de højeste scores i en undersøgelse.

Sammenligning af tilgange fra en menneske-undersøgelse gennemført for artiklen.

Sammenligning af tilgange fra en menneske-undersøgelse gennemført for artiklen.

Men vi bemærker, at sprog-centreret tilgange opnår de bedste æstetiske scores. Forfatterne fastslår dog, at dette ikke er det centrale spørgsmål i generering af lange narrative videoer.

Klik for at afspille. Sekvenser genereret til en pizza-bygning-video, af VideoAuteur.

Konklusion

Den mest populære forskningsstræng i forhold til denne udfordring, dvs. narrativ konsistens i lang-form video-generering, er beskæftiget med enkelt billeder. Projekter af denne type omfatter DreamStory, StoryDiffusion, TheaterGen og NVIDIA’s ConsiStory.

I en vis forstand falder VideoAuteur også ind i denne ‘statiske’ kategori, da det bruger seed-billeder, hvorfra klip-sektioner genereres. Dog bringer den interleavede video og semantisk indhold processen et skridt nærmere en praktisk pipeline.

 

Offentliggjort torsdag, 16. januar 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai