AI-modellen en platforms
Het koken van narratieve consistentie voor lange videogeneratie

De recente openbare release van het Hunyuan Video generatieve AI-model heeft de lopende discussies over het potentieel van grote multimodale visuele taalmodellen om ooit complete films te creëren, versterkt.
Hoewel we hebben opgemerkt, is dit op dit moment een zeer verre vooruitzicht, om een aantal redenen. Een van de redenen is het zeer korte aandachtvenster van de meeste AI-videogeneratoren, die moeite hebben om consistentie te behouden, zelfs in een korte enkele shot, laat staan een reeks shots.
Een andere reden is dat consistente verwijzingen naar videoinhoud (zoals verkenningsomgevingen, die niet willekeurig moeten veranderen als je je stappen door hen heen terugspoelt) alleen in diffusiemodellen kunnen worden bereikt door aanpassingstechnieken zoals low-rank adaptation (LoRA), wat de out-of-the-box-mogelijkheden van foundation-modellen beperkt.
Daarom lijkt de evolutie van generatieve video te worden stilgelegd, tenzij er nieuwe benaderingen voor narratieve consistentie worden ontwikkeld.
Recept voor consistentie
Met dit in gedachten heeft een nieuwe samenwerking tussen de VS en China het gebruik van instructieve kookvideo’s voorgesteld als een mogelijke sjabloon voor toekomstige narratieve consistentiesystemen.
Click to play. Het VideoAuteur-project systematiseert de analyse van delen van een kookproces om een nieuw, fijn ondertiteld dataset en een orkestratiemethode voor de generatie van kookvideo’s te produceren. Verwijs naar de bronwebsite voor een betere resolutie. Bron: https://videoauteur.github.io/
Genoemd VideoAuteur, stelt het werk een tweestaps pijplijn voor om instructieve kookvideo’s te genereren met behulp van coherente staten die keyframes en ondertiteling combineren, waarmee state-of-the-art resultaten worden behaald in – toegegeven – een ondergeschreven ruimte.
De projectpagina van VideoAuteur bevat ook een aantal meer aandachttrekkende video’s die dezelfde techniek gebruiken, zoals een voorgestelde trailer voor een (niet-bestaande) Marvel/DC-cross-over:
Click to play. Twee superheroes uit alternatieve universums komen elkaar tegen in een nep-trailer van VideoAuteur. Verwijs naar de bronwebsite voor een betere resolutie.
De pagina bevat ook soortgelijke promo-video’s voor een eveneens niet-bestaande Netflix-dierenreeks en een Tesla (TSLA ) -auto-advertentie.
Bij het ontwikkelen van VideoAuteur, hebben de auteurs geëxperimenteerd met diverse verliesfuncties en andere nieuwe benaderingen. Om een recept voor een how-to-generatie-workflow te ontwikkelen, hebben ze ook CookGen gecureerd, de grootste dataset gericht op het kookdomein, met 200.000 videoclips met een gemiddelde duur van 9,5 seconden.
Met een gemiddelde van 768,3 woorden per video, is CookGen comfortabel de meest uitgebreid geannoteerde dataset van zijn soort. Diverse visuele/taalmodellen werden gebruikt, onder andere om ervoor te zorgen dat de beschrijvingen zo gedetailleerd, relevant en nauwkeurig mogelijk waren.
Kookvideo’s werden gekozen omdat kookinstructie-wandelingen een gestructureerd en ondubbelzinnig verhaal hebben, waardoor annotatie en evaluatie een gemakkelijkere taak is. Behalve voor pornografische video’s (die waarschijnlijk binnenkort in deze ruimte zullen verschijnen), is het moeilijk om een ander genre te bedenken dat zo visueel en narratief ‘formulair’ is.
De auteurs verklaren:
‘Ons voorgestelde tweestaps auto-regressieve pijplijn, die een lange narratieve regisseur en visueel-geconditioneerde videogeneratie omvat, toont veelbelovende verbeteringen in semantische consistentie en visuele geloofwaardigheid in gegenereerde lange narratieve video’s.
‘Door middel van experimenten op onze dataset, observeren we verbeteringen in ruimtelijke en temporele coherentie over videosequenties.
‘We hopen dat ons werk verdere onderzoek kan faciliteren in de generatie van lange narratieve video’s.’
Het nieuwe werk is getiteld VideoAuteur: Naar lange narratieve videogeneratie, en komt van acht auteurs uit Johns Hopkins University, ByteDance en ByteDance Seed.
Dataset-curatie
Om CookGen te ontwikkelen, dat een tweestaps generatief systeem aandrijft voor het produceren van AI-kookvideo’s, hebben de auteurs materiaal gebruikt uit de YouCook en HowTo100M collecties. De auteurs vergelijken de omvang van CookGen met eerdere datasets gericht op narratieve ontwikkeling in generatieve video, zoals de Flintstones-dataset, de Pororo cartoon-dataset, StoryGen, Tencent’s StoryStream en VIST.

Vergelijking van afbeeldingen en tekstlengte tussen CookGen en de meest populaire vergelijkbare datasets. Bron: https://arxiv.org/pdf/2501.06173
CookGen richt zich op real-world narratieven, met name procedurele activiteiten zoals koken, en biedt duidelijkere en gemakkelijkere verhalen om te annoteren en te evalueren in vergelijking met image-gebaseerde comic-datasets. Het overtreft de grootste bestaande dataset, StoryStream, met 150x meer frames en 5x dichtere tekstuele beschrijvingen.
De onderzoekers hebben een ondertitelingsmodel gefinetuned met de methodologie van LLaVA-NeXT als basis. De automatische spraakherkenningspseudo-labels die zijn verkregen voor HowTo100M, werden gebruikt als ‘acties’ voor elke video en vervolgens verder verfijnd door grote taalmodellen (LLM’s).
Bijvoorbeeld werd ChatGPT-4o gebruikt om een ondertitelingsdataset te produceren en werd gevraagd om te focussen op subject-object-interacties (zoals handen die keukengerei en voedsel behandelen) en object-attributen en temporele dynamica.
Aangezien ASR-scripts waarschijnlijk onnauwkeurigheden bevatten en over het algemeen ‘luidruchtig’ zijn, werd Intersection-over-Union (IoU) gebruikt als een metriek om te meten hoe nauwkeurig de ondertitelingen overeenkwamen met het deel van de video waar ze zich op richtten. De auteurs merken op dat dit cruciaal was voor de creatie van narratieve consistentie.
De gecureerde clips werden geëvalueerd met behulp van Fréchet Video Distance (FVD), die de dispariteit meet tussen grondwaarheid (werkelijke wereld) voorbeelden en gegenereerde voorbeelden, zowel met als zonder grondwaarheid-sleutelkaders, en kwamen tot een prestatiegericht resultaat:

Gebruik van FVD om de afstand te evalueren tussen video’s gegenereerd met de nieuwe ondertitelingen, zowel met als zonder het gebruik van sleutelkaders vastgelegd van de voorbeeldvideo’s.
Bovendien werden de clips beoordeeld door zowel GPT-4o als zes menselijke annotators, volgens LLaVA-Hound‘s definitie van ‘hallucinatie’ (d.w.z. de capaciteit van een model om spurious inhoud te verzinnen).
De onderzoekers vergeleken de kwaliteit van de ondertitelingen met de Qwen2-VL-72B collectie en behaalden een licht verbeterde score.

Vergelijking van FVD- en menselijke evaluatiescores tussen Qwen2-VL-72B en de collectie van de auteurs.
Methode
De generatieve fase van VideoAuteur is verdeeld tussen de Long Narrative Director (LND) en de visueel-geconditioneerde videogeneratiemethode (VCVGM).
LND genereert een reeks van visuele embeddings of sleutelkaders die de narratieve stroom karakteriseren, vergelijkbaar met ‘essentiële highlights’. De VCVGM genereert videoclips op basis van deze keuzes.

Schema voor de VideoAuteur-verwerkingpijplijn. De Long Narrative Video Director maakt geschikte selecties om door te geven aan de Seed-X-geactiveerde generatiemodule.
De auteurs bespreken uitgebreid de verschillende verdiensten van een interleaved image-text director en een taal-georiënteerde sleutelkaderregisseur, en concluderen dat de eerste benadering effectiever is.
De interleaved image-text director genereert een reeks door teksttokens en visuele embeddings te combineren, met behulp van een auto-regressief model om het volgende token te voorspellen op basis van de gecombineerde context van zowel tekst als afbeeldingen. Dit zorgt voor een nauwe overeenstemming tussen visuele en tekstuele elementen.
Daarentegen synthetiseert de taal-georiënteerde sleutelkaderregisseur sleutelkaders met behulp van een tekst-geconditioneerd diffusiemodel, gebaseerd op ondertitelingen, zonder visuele embeddings in het generatieproces op te nemen.
De onderzoekers vonden dat, hoewel de taal-georiënteerde methode visueel aantrekkelijke sleutelkaders genereert, deze een gebrek aan consistentie over frames vertoont, en betogen dat de interleaved methode hogere scores behaalt in realisme en visuele consistentie. Ze vonden ook dat deze methode beter in staat was om een realistische visuele stijl te leren door training, soms met enkele herhalende of lawaaierige elementen.
Ongebruikelijk, in een onderzoekslijn die gedomineerd wordt door de inlijving van Stable Diffusion en Flux in workflows, hebben de auteurs Tencent’s SEED-X 7B-parameter multi-modale LLM-basismodel gebruikt voor hun generatieve pijplijn (hoewel dit model Stability.ai’s SDXL release van Stable Diffusion voor een beperkt deel van zijn architectuur gebruikt).
De auteurs verklaren:
‘In tegenstelling tot de klassieke Image-to-Video (I2V)-pijplijn die een afbeelding als startframe gebruikt, maakt onze benadering gebruik van [geredge visuele latenten] als continue voorwaarden voor de hele [sequentie].
‘Bovendien verbeteren we de robuustheid en kwaliteit van de gegenereerde video’s door het model aan te passen om lawaaierige visuele embeddings te verwerken, aangezien de geredge visuele latenten niet perfect kunnen zijn vanwege regressiefouten.’
Hoewel typische visueel-geconditioneerde generatieve pijplijnen van deze soort vaak initiële sleutelkaders als startpunt voor modelbegeleiding gebruiken, breidt VideoAuteur deze paradigma uit door meerdere visuele staten in een semantisch coherent latent ruimte te genereren, waardoor de potentiële bias van verdere generatie uitsluitend op ‘startframes’ wordt vermeden.

Schema voor het gebruik van visuele staat-embeddings als een superieure conditioneringmethode.
Tests
In overeenstemming met de methoden van SeedStory, gebruiken de onderzoekers SEED-X om LoRA-fine-tuning toe te passen op hun narratieve dataset, en beschrijven het resultaat enigmatisch als een ‘Sora-achtig model’, voorafgetraind op grote schaal video/titelkoppelingen, en in staat om zowel visuele als tekstuele prompts en voorwaarden te accepteren.
32.000 narratieve video’s werden gebruikt voor modelontwikkeling, met 1.000 opzij gezet als validatievoorbeelden. De video’s werden afgeknipt tot 448 pixels aan de korte kant en vervolgens gecentreerd afgeknipt tot 448x448px.
Voor training werd de narratieve generatie voornamelijk geëvalueerd op de YouCook2-validatieset. De Howto100M-set werd gebruikt voor gegevenskwaliteitsevaluatie en ook voor image-to-video-generatie.
Voor visuele conditioneringverlies werd door de auteurs diffusieverlies van DiT en een 2024-werk gebaseerd op Stable Diffusion gebruikt.
Om hun bewering te bewijzen dat interleaving een superieure benadering is, hebben de auteurs VideoAuteur tegenover verschillende methoden gezet die uitsluitend op tekstuele invoer vertrouwen: EMU-2, SEED-X, SDXL en FLUX.1-schnell (FLUX.1-s).

Gegeven een globale prompt, ‘Stap-voor-stap-gids voor het koken van mapo tofu’, genereert de interleaved director acties, ondertitelingen en afbeeldingsembeddings sequentieel om het proces te vertellen. De eerste twee rijen laten sleutelkaders zien die zijn gedecodeerd uit EMU-2- en SEED-X-latent ruimtes. Deze afbeeldingen zijn realistisch en consistent, maar minder gepolijst dan die van geavanceerde modellen zoals SDXL en FLUX.
De auteurs verklaren:
‘De taal-georiënteerde benadering met behulp van tekst-naar-afbeeldingmodellen produceert visueel aantrekkelijke sleutelkaders, maar lijdt aan een gebrek aan consistentie over frames vanwege beperkte wederzijdse informatie. In tegenstelling daarmee maakt de interleaved generatiemethode gebruik van taal-georiënteerde visuele latenten, waarmee een realistische visuele stijl wordt bereikt door training.
‘Echter, deze methode genereert soms afbeeldingen met herhalende of lawaaierige elementen, omdat het auto-regressieve model moeite heeft om accurate embeddings in één pas te creëren.’
Menselijke evaluatie bevestigt verder de bewering van de auteurs over de verbeterde prestaties van de interleaved benadering, waarbij de interleaved methoden de hoogste scores behalen in een enquête.

Vergelijking van benaderingen uit een door de auteurs uitgevoerde menselijke studie.
Hoewel we opmerken dat taal-georiënteerde benaderingen de beste esthetische scores behalen. De auteurs betogen echter dat dit niet het centrale punt is bij de generatie van lange narratieve video’s.
Click to play. Segmenten gegenereerd voor een pizza-bouwvideo, door VideoAuteur.
Conclusie
De meest populaire onderzoekslijn met betrekking tot deze uitdaging, namelijk narratieve consistentie in lange videogeneratie, houdt zich bezig met enkele afbeeldingen. Projecten van deze soort omvatten DreamStory, StoryDiffusion, TheaterGen en NVIDIA’s ConsiStory.
In zekere zin valt VideoAuteur ook in deze ‘statische’ categorie, aangezien het gebruikmaakt van startafbeeldingen waaruit clip-secties worden gegenereerd. Echter, het combineren van video en semantische inhoud brengt het proces een stap dichter bij een praktische pijplijn.
First published Thursday, 16 januari 2025












