AI-modeller och plattformar

Tillagning av berättande konsekvens för lång videogenerering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Den nyliga offentliga utgåvan av Hunyuan Video generativ AI-modell har intensifierat pågående diskussioner om potentialen för stora multimodala vision-språkmodeller att en dag skapa hela filmer.

Men som vi har observerat, är detta en mycket avlägsen prospekt för tillfället, av flera skäl. Ett är den mycket korta uppmärksamhetsfönstret för de flesta AI-videogenererare, som kämpar för att upprätthålla konsekvens även i en kort enskild skott, för att inte tala om en serie skott.

Ett annat är att konsekventa referenser till videoinnehåll (såsom utforskbara miljöer, som inte bör ändras slumpmässigt om du går tillbaka genom dem) endast kan uppnås i diffusionsmodeller genom anpassningstekniker såsom låg-rankad anpassning (LoRA), som begränsar de färdiga funktionerna i grundmodellerna.

Därför verkar utvecklingen av generativ video vara på väg att stanna av om inte nya tillvägagångssätt för berättande konsekvens utvecklas.

Recept för konsekvens

Med detta i åtanke har ett nytt samarbete mellan USA och Kina föreslagit användningen av instruktionsvideor för matlagning som en möjlig mall för framtida system för berättande konsekvens.

Klicka för att spela. VideoAuteur-systemet systematiserar analysen av delar av en matlagningsprocess för att producera en fint annoterad ny dataset och en orkestreringsmetod för generering av matlagningsvideor. Se källsidan för bättre upplösning. Källa: https://videoauteur.github.io/

Arbetet, som heter VideoAuteur, föreslår en tvåstegs pipeline för att generera instruktionsvideor för matlagning med hjälp av sammanhängande tillstånd som kombinerar nyckelbilder och undertexter, och uppnår toppmoderna resultat i – i alla fall – en underbeskriven utrymme.

VideoAuteurs projektsida innehåller också ett antal mer uppmärksammade videor som använder samma teknik, såsom en föreslagen trailer för en (icke-existerande) Marvel/DC-korsning:

Klicka för att spela. Två superhjältar från alternativa universum möts i en falsk trailer från VideoAuteur. Se källsidan för bättre upplösning.

Sidan innehåller också liknande promovideor för en lika icke-existerande Netflix-djurserie och en Tesla (TSLA ) -bilannons.

I utvecklingen av VideoAuteur experimenterade författarna med olika förlustfunktioner och andra nya tillvägagångssätt. För att utveckla en recept-genereringsarbetsflöde, curerade de också CookGen, den största dataseten fokuserad på matlagningsdomänen, som innehåller 200 000 videoklipp med en genomsnittlig varaktighet på 9,5 sekunder.

I genomsnitt 768,3 ord per video är CookGen bekvämt den mest omfattande annoterade dataseten av sitt slag. Diverse vision/språkmodeller användes, bland annat, för att säkerställa att beskrivningarna var så detaljerade, relevanta och precisa som möjligt.

Matlagningsvideor valdes eftersom matlagningsinstruktionsgenomgångar har en strukturerad och entydig berättelse, vilket gör annotering och utvärdering en lättare uppgift. Utom för pornografiska videor (som sannolikt kommer att komma in i denna specifika utrymme ganska snart) är det svårt att tänka sig någon annan genre som är lika visuellt och berättande “formelbunden”.

Författarna påstår:

‘Vår föreslagna tvåstegs auto-regressiva pipeline, som innehåller en lång berättelsedirektör och visuellt villkorsgiven videogenerering, demonstrerar lovande förbättringar i semantisk konsekvens och visuell trohet i genererade långa berättande videor.

‘Genom experiment på vår dataset observerar vi förbättringar i rumslig och temporär sammanhängighet över videosekvenser. ‘

‘Vi hoppas att vårt arbete kan underlätta ytterligare forskning i långa berättande videogenerering.’

Det nya arbetet heter VideoAuteur: Mot långa berättande videogenerering och kommer från åtta författare på Johns Hopkins University, ByteDance och ByteDance Seed.

Datasetkurering

För att utveckla CookGen, som driver en tvåstegs generativ system för producera AI-matlagningsvideor, använde författarna material från YouCook- och HowTo100M-samlingarna. Författarna jämför storleken på CookGen med tidigare dataset fokuserade på berättandeutveckling i generativ video, såsom Flintstones-datasetet, Pororo-tecknad dataset, StoryGen, Tencents StoryStream och VIST.

Jämförelse av bilder och textlängd mellan CookGen och den närmast mest befolkade liknande dataseten. Källa: https://arxiv.org/pdf/2501.06173

Jämförelse av bilder och textlängd mellan CookGen och den närmast mest befolkade liknande dataseten. Källa: https://arxiv.org/pdf/2501.06173

CookGen fokuserar på verkliga berättelser, särskilt proceduraktiviteter som matlagning, och erbjuder tydligare och lättare annoterade berättelser jämfört med bildbaserade seriealbum. Det överträffar den största befintliga dataseten, StoryStream, med 150 gånger fler ramar och 5 gånger tätare textbeskrivningar.

Forskarna finjusterade en annoteringsmodell med hjälp av LLaVA-NeXT som bas. De automatiska taligenkänningspseudomärkena (ASR) som erhölls för HowTo100M användes som “åtgärder” för varje video, och sedan finslipades ytterligare med stora språkmodeller (LLM).

Till exempel användes ChatGPT-4o för att producera en annoteringsdataset, och bads fokusera på subjekt-objektinteraktioner (såsom händer som hanterar redskap och mat), objektegenskaper och temporala dynamiker.

Eftersom ASR-manuskript sannolikt innehåller fel och är “bullriga”, användes Intersection-over-Union (IoU) som en mått för att mäta hur nära annoteringarna överensstämde med den del av videon de behandlade. Författarna påpekar att detta var avgörande för skapandet av berättande konsekvens.

De kuraterade klippen utvärderades med hjälp av Fréchet Video Distance (FVD), som mäter skillnaden mellan grundväghet (verkliga världen) exempel och genererade exempel, både med och utan grundväghetsnyckelbilder, och nådde ett presterande resultat:

Användning av FVD för att utvärdera avståndet mellan videor genererade med de nya annoteringarna, både med och utan användning av nyckelbilder fångade från exempelvideor.

Användning av FVD för att utvärdera avståndet mellan videor genererade med de nya annoteringarna, både med och utan användning av nyckelbilder fångade från exempelvideor.

Dessutom utvärderades klippen av GPT-4o och sex mänskliga annotatorer, enligt LLaVA-Hounds definition av “hallucination” (dvs. förmågan hos en modell att uppfinna spurious innehåll).

Forskarna jämförde kvaliteten på annoteringarna med Qwen2-VL-72B-samlingen och fick en något förbättrad poäng.

Jämförelse av FVD och mänsklig utvärderingsscore mellan Qwen2-VL-72B och författarnas samling.

Jämförelse av FVD och mänsklig utvärderingsscore mellan Qwen2-VL-72B och författarnas samling.

Metod

VideoAuteurs generativa fas är uppdelad mellan den Långa berättelsedirektören (LND) och den visuellt villkorsgivna videogenereringsmodellen (VCVGM).

LND genererar en sekvens av visuella inbäddningar eller nyckelbilder som karakteriserar berättelsens flöde, liknande “essentiella höjdpunkter”. VCVGM genererar videoklipp baserat på dessa val.

Schema för VideoAuteurs bearbetningspipeline. Den Långa berättelsedirektören gör lämpliga val för att mata till den Seed-X-drivna generativa modulen.

Schema för VideoAuteurs bearbetningspipeline. Den Långa berättelsedirektören gör lämpliga val för att mata till den Seed-X-drivna generativa modulen.

Författarna diskuterar utförligt de olika fördelarna med en interleaverad bild-textdirektör och en språkcentrerad nyckelbildsdirektör, och drar slutsatsen att den förra är det mer effektiva tillvägagångssättet.

Den interleaverade bild-textdirektören genererar en sekvens genom att interfoliera texttoken och visuella inbäddningar, med hjälp av en auto-regressiv modell för att förutsäga nästa token, baserat på den kombinerade kontexten av både text och bilder. Detta säkerställer en tät anpassning mellan visuella och text.

I kontrast syntheserar den språkcentrerade nyckelbildsdirektören nyckelbilder med hjälp av en textvillkorsgiven diffusionsmodell, baserad enbart på undertexter, utan att inkorporera visuella inbäddningar i genereringsprocessen.

Forskarna fann att medan den språkcentrerade metoden genererar visuellt tilltalande nyckelbilder, saknar den konsekvens över flera ramar, och hävdar att den interleaverade metoden uppnår högre poäng i realism och visuell konsekvens. De fann också att denna metod var bättre lämpad att lära en realistisk visuell stil genom träning, även om den ibland genererade bilder med upprepade eller bullriga element.

Ovanligt, i en forskningssträng som domineras av inkorporeringen av Stable Diffusion och Flux i arbetsflöden, använde författarna Tencents SEED-X 7B-parameter multimodalt LLM-grundmodell för sin generativa pipeline (även om denna modell använder Stability.ai:s SDXL version av Stable Diffusion för en begränsad del av sin arkitektur).

Författarna påstår:

‘Till skillnad från den klassiska Bild-till-Video (I2V) pipeline som använder en bild som startbild, använder vår metod [regresserade visuella latenter] som kontinuerliga villkor under hela sekvensen.

‘Vi förbättrar också robustheten och kvaliteten på de genererade videorna genom att anpassa modellen för att hantera bullriga visuella inbäddningar, eftersom de regresserade visuella latenterna inte är perfekta på grund av regressionsfel.’

Trots att typiska visuellt villkorsgivna generativa pipelines av detta slag ofta använder initiala nyckelbilder som en startpunkt för modellguidning, utvidgar VideoAuteur detta paradigm genom att generera multi-delade visuella tillstånd i ett semantiskt sammanhängande latentsrum, och undviker den potentiella biasen av att basera ytterligare generering enbart på “startbilder”.

Schema för användning av visuella tillstånds-inbäddningar som en överlägsen villkorsmetod.

Schema för användning av visuella tillstånds-inbäddningar som en överlägsen villkorsmetod.

Tester

I linje med metoderna i SeedStory, använder forskarna SEED-X för att tillämpa LoRA-fine-tuning på sin berättelsedataset, och beskriver resultatet som en “Sora-liknande modell”, förutbildad på storskaliga video/text-par, och kan acceptera både visuella och textbaserade villkor och prompter.

32 000 berättelsevideor användes för modellutveckling, med 1 000 som hölls åt sidan som valideringsprover. Videorna beskars till 448 pixlar på den korta sidan och sedan centrerbeskars till 448x448px.

För utbildning utvärderades berättelsegenereringen främst på YouCook2-valideringsuppsättningen. Howto100M-uppsättningen användes för datakvalitetsutvärdering och även för bild-till-video-generering.

För visuell villkorsförlust användes diffusionsförlust från DiT och ett 2024-arbete baserat kring Stable Diffusion.

För att bevisa sin påstående att interfoliering är ett överlägset tillvägagångssätt, ställde författarna VideoAuteur mot flera metoder som enbart förlitar sig på textbaserad inmatning: EMU-2, SEED-X, SDXL och FLUX.1-schnell (FLUX.1-s).

Givet en global prompt, 'Steg-för-steg-guide till matlagning av mapo-tofu', genererar den interleaverade direktören åtgärder, undertexter och bildinbäddningar sekventiellt för att berätta processen. De första två raderna visar nyckelbilder dekoderade från EMU-2 och SEED-X latentsrum. Dessa bilder är realistiska och konsekventa men mindre polerade än de från avancerade modeller som SDXL och FLUX.

Givet en global prompt, ‘Steg-för-steg-guide till matlagning av mapo-tofu’, genererar den interleaverade direktören åtgärder, undertexter och bildinbäddningar sekventiellt för att berätta processen. De första två raderna visar nyckelbilder dekoderade från EMU-2 och SEED-X latentsrum. Dessa bilder är realistiska och konsekventa men mindre polerade än de från avancerade modeller som SDXL och FLUX.

Författarna påstår:

‘Den språkcentrerade metoden med hjälp av text-till-bild-modeller producerar visuellt tilltalande nyckelbilder men lider av brist på konsekvens över flera ramar på grund av begränsad ömsesidig information. I kontrast till detta använder den interleaverade genereringsmetoden språk-anpassade visuella latenter, och uppnår en realistisk visuell stil genom träning.

‘Men den genererar ibland bilder med upprepade eller bullriga element, eftersom den auto-regressiva modellen kämpar för att skapa precisa inbäddningar i en enda passage.’

Mänsklig utvärdering bekräftar ytterligare författarnas påstående om den förbättrade prestandan hos den interleaverade metoden, med interleaverade metoder som uppnår de högsta poängen i en undersökning.

Jämförelse av metoder från en mänsklig studie som genomfördes för artikeln.

Jämförelse av metoder från en mänsklig studie som genomfördes för artikeln.

Men vi noterar att språkcentrerade metoder uppnår de bästa estetiska poängen. Författarna hävdar dock att detta inte är den centrala frågan i genereringen av långa berättande videor.

Klicka för att spela. Genererade segment för en pizzabyggnadsvideo, av VideoAuteur.

Slutsats

Den mest populära forskningssträngen i fråga om denna utmaning, dvs. berättande konsekvens i långformad videogenerering, är inriktad på enskilda bilder. Projekt av detta slag inkluderar DreamStory, StoryDiffusion, TheaterGen och NVIDIA’s ConsiStory.

I en viss mening faller VideoAuteur också in i denna “statiska” kategori, eftersom det använder sig av seed-bilder från vilka klippdelar genereras. Men interfolieringen av video och semantiskt innehåll bringar processen ett steg närmare en praktisk pipeline.

 

Publicerad första gången torsdagen den 16 januari 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai