KI-Modelle und Plattformen

Rezepte für Kontinuität bei der Erstellung von Langvideos

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Die jüngste öffentliche Veröffentlichung des Hunyuan-Video-Generative-AI-Modells hat die laufenden Diskussionen über das Potenzial großer multimodaler Vision-Language-Modelle, eines Tages ganze Filme zu erstellen, intensiviert.

Wie wir jedoch beobachtet haben, ist dies ein sehr ferner Ausblick, da es viele Gründe gibt. Einer davon ist das sehr kurze Aufmerksamkeitsfenster der meisten AI-Video-Generatoren, die Schwierigkeiten haben, die Konsistenz sogar in einem kurzen Einzelschuss beizubehalten, geschweige denn in einer Reihe von Schüssen.

Ein weiterer Grund ist, dass konsistente Referenzen zu Videoinhalten (wie beispielsweise erkundbaren Umgebungen, die nicht zufällig geändert werden sollten, wenn man seine Schritte durch sie zurückverfolgt) in Diffusionsmodellen nur durch Anpassungstechniken wie Low-Rank-Adaptation (LoRA) erreicht werden können, was die Out-of-the-Box-Fähigkeiten der Grundmodelle begrenzt.

Daher ist die Evolution der generativen Videoerstellung darauf angewiesen, neue Ansätze für narrative Kontinuität zu entwickeln.

Rezept für Kontinuität

Mit diesem Hintergrund haben eine neue Zusammenarbeit zwischen den USA und China den Einsatz von anleitenden Kochvideos als mögliche Vorlage für zukünftige Systeme der narrativen Kontinuität vorgeschlagen.

Bitte klicken Sie, um abzuspielen. Das VideoAuteur-Projekt systematisiert die Analyse von Teilen eines Kochprozesses, um ein fein untertiteltes neues Dataset und eine Orchestrierungsmethode für die Erstellung von Kochvideos zu produzieren. Bitte besuchen Sie die Quellseite für eine bessere Auflösung. Quelle: https://videoauteur.github.io/

Das Werk mit dem Titel VideoAuteur schlägt eine zweistufige Pipeline vor, um anleitende Kochvideos unter Verwendung von kohärenten Zuständen, die Schlüsselbilder und Untertitel kombinieren, zu generieren und damit state-of-the-art-Ergebnisse in einem – zugegebenermaßen – unterbeschriebenen Bereich zu erzielen.

Auf der Projektseite von VideoAuteur finden sich auch einige eher auffälligere Videos, die die gleiche Technik verwenden, wie beispielsweise ein vorgeschlagener Trailer für ein (nicht existierendes) Marvel/DC-Crossover:

Bitte klicken Sie, um abzuspielen. Zwei Superhelden aus alternativen Universen kommen in einem Fake-Trailer von VideoAuteur zusammen. Bitte besuchen Sie die Quellseite für eine bessere Auflösung.

Auf der Seite finden sich auch ähnlich gestaltete Promo-Videos für eine nicht existierende Netflix-Tier-Serie und einen Tesla (TSLA ) -Werbespot.

Bei der Entwicklung von VideoAuteur experimentierten die Autoren mit verschiedenen Verlustfunktionen und anderen neuen Ansätzen. Um eine Rezept-How-to-Generation-Workflow zu entwickeln, curierten sie auch CookGen, das größte Dataset, das sich auf den Kochbereich konzentriert, mit 200.000 Video-Clips und einer durchschnittlichen Dauer von 9,5 Sekunden.

Bei durchschnittlich 768,3 Wörtern pro Video ist CookGen das umfassendste annotierte Dataset seiner Art. Es wurden diverse Vision-Language-Modelle verwendet, um sicherzustellen, dass die Beschreibungen so detailliert, relevant und genau wie möglich waren.

Kochvideos wurden gewählt, weil Kochanleitungen eine strukturierte und unmissverständliche Erzählung haben, was die Annotation und Bewertung zu einer einfacheren Aufgabe macht. Abgesehen von pornografischen Videos (die wahrscheinlich bald in diesen Bereich eindringen werden) ist es schwierig, eine andere Gattung zu finden, die so visuell und narrativ “formelhaft” ist.

Die Autoren erklären:

‘Unser vorgeschlagener zweistufiger auto-regressiver Pipeline, der einen langen narrativen Regisseur und eine visuell bedingte Video-Generierung umfasst, zeigt vielversprechende Verbesserungen in semantischer Konsistenz und visueller Treue in generierten Langnarrativ-Videos.

‘Durch Experimente auf unserem Dataset beobachten wir Verbesserungen in räumlicher und zeitlicher Kohärenz über Video-Sequenzen hinweg.

‘Wir hoffen, dass unsere Arbeit weitere Forschung in der Erstellung von Langnarrativ-Videos fördern kann.’

Die neue Arbeit trägt den Titel VideoAuteur: Towards Long Narrative Video Generation und stammt von acht Autoren aus der Johns Hopkins University, ByteDance und ByteDance Seed.

Dataset-Curation

Um CookGen zu entwickeln, das ein zweistufiges generatives System für die Erstellung von AI-Kochvideos antreibt, verwendeten die Autoren Material aus den YouCook– und HowTo100M-Sammlungen. Die Autoren vergleichen die Größe von CookGen mit früheren Datasets, die sich auf narrative Entwicklung in generativer Videoerstellung konzentrieren, wie das Flintstones-Dataset, das Pororo-Cartoon-Dataset, StoryGen, Tencents StoryStream und VIST.

Vergleich von Bildern und Textlänge zwischen CookGen und den nächstgelegenen ähnlichen Datasets. Quelle: https://arxiv.org/pdf/2501.06173

Vergleich von Bildern und Textlänge zwischen CookGen und den nächstgelegenen ähnlichen Datasets. Quelle: https://arxiv.org/pdf/2501.06173

CookGen konzentriert sich auf realweltliche Erzählungen, insbesondere auf prozedurale Aktivitäten wie Kochen, und bietet klarere und einfacher zu annotierende Geschichten im Vergleich zu imagebasierten Comic-Datasets. Es übertrifft das größte existierende Dataset, StoryStream, mit 150-mal mehr Frames und 5-mal dichteren textuellen Beschreibungen.

Die Forscher feinjustierten ein Caption-Modell unter Verwendung der Methodik von LLaVA-NeXT als Basis. Die automatischen Spracherkennung (ASR)-Pseudo-Labels, die für HowTo100M erhalten wurden, wurden als “Aktionen” für jedes Video verwendet und dann durch große Sprachmodelle (LLMs) weiter verfeinert.

Beispielsweise wurde ChatGPT-4o verwendet, um ein Caption-Dataset zu erstellen, und wurde gebeten, sich auf Subjekt-Objekt-Interaktionen (wie Hände, die Utensilien und Lebensmittel handhaben) und Objekt-Attribute sowie temporale Dynamiken zu konzentrieren.

Da ASR-Skripte wahrscheinlich Ungenauigkeiten enthalten und im Allgemeinen “laut” sind, wurde die Intersection-over-Union (IoU) als Metrik verwendet, um zu messen, wie genau die Untertitel dem Teil des Videos entsprachen, den sie ansprachen. Die Autoren betonen, dass dies für die Schaffung von narrativer Konsistenz von entscheidender Bedeutung war.

Die kuratierten Clips wurden unter Verwendung von Fréchet-Video-Distanz (FVD) bewertet, die die Diskrepanz zwischen Ground-Truth- (reale Welt-) Beispielen und generierten Beispielen misst, sowohl mit als auch ohne Ground-Truth-Schlüsselbilder, und kamen zu einem leistungsfähigen Ergebnis:

Verwendung von FVD, um die Distanz zwischen Videos zu bewerten, die mit den neuen Untertiteln generiert wurden, sowohl mit als auch ohne die Verwendung von Schlüsselbildern, die aus den Beispielvideos aufgenommen wurden.

Verwendung von FVD, um die Distanz zwischen Videos zu bewerten, die mit den neuen Untertiteln generiert wurden, sowohl mit als auch ohne die Verwendung von Schlüsselbildern, die aus den Beispielvideos aufgenommen wurden.

Zusätzlich wurden die Clips von GPT-4o und sechs menschlichen Annotatoren bewertet, unter Verwendung der Definition von “Halluzination” von LLaVA-Hound (d. h. die Fähigkeit eines Modells, spurious Inhalte zu erfinden).

Die Forscher verglichen die Qualität der Untertitel mit der Qwen2-VL-72B-Sammlung und erhielten einen leicht verbesserten Score.

Vergleich von FVD- und menschlicher Bewertung zwischen Qwen2-VL-72B und der Sammlung der Autoren.

Vergleich von FVD- und menschlicher Bewertung zwischen Qwen2-VL-72B und der Sammlung der Autoren.

Methode

Die generative Phase von VideoAuteur ist in zwei Teile aufgeteilt: den Langen narrativen Regisseur (LND) und das visuell bedingte Video-Generierungsmodell (VCVGM).

LND generiert eine Sequenz von visuellen Embeddings oder Schlüsselbildern, die den narrativen Fluss charakterisieren, ähnlich wie “wesentliche Highlights”. Das VCVGM generiert Video-Clips auf der Grundlage dieser Auswahl.

Schema für die VideoAuteur-Verarbeitungspipeline. Der lange narrative Regisseur macht geeignete Auswahlmöglichkeiten, um dem Seed-X-gesteuerten generativen Modul zu füttern.

Schema für die VideoAuteur-Verarbeitungspipeline. Der lange narrative Regisseur macht geeignete Auswahlmöglichkeiten, um dem Seed-X-gesteuerten generativen Modul zu füttern.

Die Autoren diskutieren ausführlich die unterschiedlichen Vorzüge eines interleaved Bild-Text-Regisseurs und eines sprachzentrierten Schlüsselbild-Regisseurs und kommen zu dem Schluss, dass der erste Ansatz effektiver ist.

Der interleaved Bild-Text-Regisseur generiert eine Sequenz, indem er Text-Tokens und visuelle Embeddings abwechselnd verwendet, unter Verwendung eines auto-regressiven Modells, um den nächsten Token vorherzusagen, basierend auf dem kombinierten Kontext von Text und Bildern. Dies stellt eine enge Ausrichtung zwischen visuellen und textlichen Elementen sicher.

Im Gegensatz dazu synthesiert der sprachzentrierte Schlüsselbild-Regisseur Schlüsselbilder unter Verwendung eines textbedingten Diffusionsmodells, das ausschließlich auf Untertiteln basiert, ohne visuelle Embeddings in den Generierungsprozess einzubeziehen.

Die Forscher fanden heraus, dass der sprachzentrierte Ansatz visuell ansprechende Schlüsselbilder generiert, aber an Konsistenz über Frames hinweg mangelt, und argumentieren, dass der interleaved Ansatz höhere Scores in Realismus und visueller Konsistenz erzielt. Sie fanden auch heraus, dass dieser Ansatz besser in der Lage war, einen realistischen visuellen Stil durch Training zu erlernen, manchmal jedoch mit wiederholten oder lautem Elementen.

Unüblicherweise in einem Forschungsstrang, der von der Übernahme von Stable Diffusion und Flux in Workflows dominiert wird, verwendeten die Autoren Tencents SEED-X-Modell mit 7 Milliarden Parametern als Grundlage für ihre generative Pipeline (obwohl dieses Modell Stability.ai’s SDXL-Release von Stable Diffusion für einen begrenzten Teil seiner Architektur nutzt).

Die Autoren erklären:

‘Unser Ansatz, der [regressed visual latents] als kontinuierliche Bedingungen über die Sequenz hinweg nutzt, unterscheidet sich von dem klassischen Bild-zu-Video-(I2V)-Pipeline, der ein Bild als Startframe verwendet.

‘Wir verbessern die Robustheit und Qualität der generierten Videos, indem wir das Modell anpassen, um mit lautem visuellem Embeddings umzugehen, da die regressed visual latents aufgrund von Regressionsfehlern nicht perfekt sein können.’

Obwohl typische visuell bedingte generative Pipelines dieser Art oft anfängliche Schlüsselbilder als Startpunkt für die Modellsteuerung verwenden, erweitert VideoAuteur dieses Paradigma, indem es mehrteilige visuelle Zustände in einem semantisch kohärenten latenten Raum generiert, wodurch die potenzielle Voreingenommenheit vermieden wird, die durch die alleinige Verwendung von “Startframes” entsteht.

Schema für die Verwendung von visuellen Zustandsembeddings als überlegene Bedingungsmethode.

Schema für die Verwendung von visuellen Zustandsembeddings als überlegene Bedingungsmethode.

Tests

In Übereinstimmung mit den Methoden von SeedStory verwenden die Forscher SEED-X, um LoRA-Feinjustierung auf ihrem narrativen Dataset anzuwenden, und beschreiben das Ergebnis als “Sora-ähnliches Modell”, das auf großen Video-Text-Kopplungen vorgebildet ist und in der Lage ist, sowohl visuelle als auch textuelle Prompts und Bedingungen zu akzeptieren.

32.000 narrative Videos wurden für die Modellentwicklung verwendet, und 1.000 wurden als Validierungsbeispiele beiseite gelegt. Die Videos wurden auf 448 Pixel auf der kurzen Seite zugeschnitten und dann auf 448x448px zentriert.

Für die Ausbildung wurde die narrative Generierung hauptsächlich auf dem YouCook2-Validierungsset bewertet. Das Howto100M-Set wurde für die Bewertung der Datenqualität und auch für die Bild-zu-Video-Generierung verwendet.

Für den visuellen Konditionierungsverlust verwendeten die Autoren den Diffusionsverlust von DiT und einer 2024-Arbeit, die auf Stable Diffusion basiert.

Um ihre Behauptung zu beweisen, dass die Interleaving-Methode überlegen ist, setzten die Autoren VideoAuteur gegen mehrere Methoden ein, die ausschließlich auf textbasierte Eingaben angewiesen sind: EMU-2, SEED-X, SDXL und FLUX.1-schnell (FLUX.1-s).

Gegeben ein globales Prompt, 'Schritt-für-Schritt-Anleitung zum Kochen von Mapo-Tofu', generiert der interleaved Regisseur Aktionen, Untertitel und Bild-Embeddings sequenziell, um den Prozess zu erzählen. Die ersten beiden Reihen zeigen Schlüsselbilder, die aus den EMU-2- und SEED-X-Latent-Räumen decodiert wurden. Diese Bilder sind realistisch und konsistent, aber weniger poliert als die von fortschrittlichen Modellen wie SDXL und FLUX.

Gegeben ein globales Prompt, ‘Schritt-für-Schritt-Anleitung zum Kochen von Mapo-Tofu’, generiert der interleaved Regisseur Aktionen, Untertitel und Bild-Embeddings sequenziell, um den Prozess zu erzählen. Die ersten beiden Reihen zeigen Schlüsselbilder, die aus den EMU-2- und SEED-X-Latent-Räumen decodiert wurden. Diese Bilder sind realistisch und konsistent, aber weniger poliert als die von fortschrittlichen Modellen wie SDXL und FLUX.

Die Autoren erklären:

‘Die sprachzentrierte Methode unter Verwendung von Text-zu-Bild-Modellen produziert visuell ansprechende Schlüsselbilder, aber leidet an mangelnder Konsistenz über Frames hinweg aufgrund begrenzter wechselseitiger Informationen. Im Gegensatz dazu nutzt die Interleaving-Generierungsmethode sprachlich ausgerichtete visuelle Latente, um einen realistischen visuellen Stil durch Training zu erreichen.

‘Allerdings generiert sie manchmal Bilder mit wiederholten oder lautem Elementen, da das auto-regressive Modell Schwierigkeiten hat, genaue Embeddings in einem einzigen Durchgang zu erstellen.’

Menschliche Bewertung bestätigt ebenfalls die Behauptung der Autoren über die verbesserte Leistung des Interleaving-Ansatzes, wobei die Interleaving-Methoden die höchsten Scores in einer Umfrage erzielen.

Vergleich von Ansätzen aus einer menschlichen Studie, die für den Artikel durchgeführt wurde.

Vergleich von Ansätzen aus einer menschlichen Studie, die für den Artikel durchgeführt wurde.

Es ist jedoch zu beachten, dass sprachzentrierte Ansätze die besten ästhetischen Scores erzielen. Die Autoren argumentieren jedoch, dass dies nicht das zentrale Problem bei der Erstellung von Langnarrativ-Videos ist.

Bitte klicken Sie, um abzuspielen. Segmente, die für ein Pizza-Bau-Video von VideoAuteur generiert wurden.

Fazit

Der beliebteste Forschungsstrang in Bezug auf diese Herausforderung, nämlich narrative Konsistenz in der Langvideoerstellung, beschäftigt sich mit einzelnen Bildern. Projekte dieser Art umfassen DreamStory, StoryDiffusion, TheaterGen und NVIDIA’s ConsiStory.

In einem Sinne fällt VideoAuteur auch in diese ‘statische’ Kategorie, da es Seed-Bilder verwendet, aus denen Clip-Sektionen generiert werden. Die Interleaving von Video- und semantischen Inhalten bringt den Prozess jedoch einen Schritt näher an eine praktische Pipeline.

 

Erstveröffentlichung: Donnerstag, 16. Januar 2025

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai