Andersons Blickwinkel

Bessere Generative KI-Videos durch das Shuffeln von Frames während des Trainings

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
Adobe Firefly, various prompts and edits.

Eine neue Studie, die diese Woche auf Arxiv veröffentlicht wurde, behandelt ein Problem, auf das jeder, der den Hunyuan-Video– oder Wan-2.1-AI-Video-Generatoren ausprobiert hat, bereits gestoßen ist: temporale Aberrationen, bei denen der generative Prozess dazu neigt, plötzlich zu beschleunigen, zu verbinden, wegzulassen oder auf andere Weise wichtige Momente in einem generierten Video zu stören:

Bitte klicken, um abzuspielen. Einige der temporalen Fehler, die bei Benutzern der neuen Generation generativer Video-Systeme immer häufiger auftreten, werden in der neuen Studie hervorgehoben. Rechts im Video ist der positive Effekt des neuen FluxFlow-Ansatzes zu sehen. Quelle: https://haroldchen19.github.io/FluxFlow/

Das oben gezeigte Video enthält Ausschnitte aus Beispieltestvideos auf der (vorsicht: ziemlich chaotischen) Projektseite der Studie. Wir können mehrere immer vertrautere Probleme sehen, die durch die Methode der Autoren (rechts im Video) behoben werden, die im Wesentlichen eine Technik zur Vorverarbeitung von Daten ist, die auf jede generative Video-Architektur anwendbar ist.

Im ersten Beispiel, das “zwei Kinder, die mit einem Ball spielen” zeigt, generiert von CogVideoX, sehen wir (links im Kompilationsvideo oben und im spezifischen Beispiel unten), dass die native Generierung schnell durch mehrere wesentliche Mikrobewegungen springt und die Aktivität der Kinder auf ein “Cartoon”-Tempo beschleunigt. Im Gegensatz dazu erzielt dieselbe Datenmenge und Methode mit der neuen Vorverarbeitungstechnik, die FluxFlow genannt wird (rechts im Video), bessere Ergebnisse:

Bitte klicken, um abzuspielen.

Im zweiten Beispiel (mit NOVA-0.6B) sehen wir, dass eine zentrale Bewegung, bei der eine Katze beteiligt ist, auf某种 Weise während der Trainingsphase korrupt oder unterabgetastet wurde, sodass das generative System “gelähmt” wird und nicht in der Lage ist, das Subjekt zu bewegen:

Bitte klicken, um abzuspielen.

Dieses Syndrom, bei dem die Bewegung oder das Subjekt “stecken bleibt”, ist eines der am häufigsten gemeldeten Probleme von HV und Wan in den verschiedenen Bild- und Videosynthese-Gruppen.

Einige dieser Probleme sind mit Video-Untertitelungsproblemen in der Quelldatenmenge verbunden, die wir diese Woche betrachtet haben; die Autoren der neuen Studie konzentrieren sich jedoch auf die temporalen Qualitäten der Trainingsdaten und machen eine überzeugende Argumentation, dass die Bewältigung der Herausforderungen aus dieser Perspektive nützliche Ergebnisse liefern kann.

Wie in dem früheren Artikel über Video-Untertitelung erwähnt, sind bestimmte Sportarten besonders schwierig zu destillieren, um wichtige Momente zu erhalten, was bedeutet, dass kritische Ereignisse (wie ein Slam-Dunk) nicht die notwendige Aufmerksamkeit während der Trainingszeit erhalten:

Bitte klicken, um abzuspielen.

Im obigen Beispiel weiß das generative System nicht, wie es zum nächsten Bewegungsstadium gelangen soll, und wechselt illogisch von einer Pose zu einer anderen, wobei die Haltung und Geometrie des Spielers im Prozess geändert werden.

Diese sind große Bewegungen, die während der Trainingsphase verloren gegangen sind, aber ebenso anfällig sind auch viel kleinere, aber wichtige Bewegungen, wie das Flattern von Schmetterlingsflügeln:

Bitte klicken, um abzuspielen.

Im Gegensatz zum Slam-Dunk ist das Flattern der Flügel kein “seltenes” sondern ein persistentes und monotoneres Ereignis. Allerdings wird seine Konsistenz durch die Abtastung verloren, da die Bewegung so schnell ist, dass es sehr schwierig ist, sie zeitlich zu etablieren.

Diese sind nicht besonders neue Probleme, aber sie erhalten jetzt, da leistungsstarke generative Video-Modelle für Enthusiasten verfügbar sind, mehr Aufmerksamkeit.

Die Gemeinschaften auf Reddit und Discord haben diese Probleme anfangs als “benutzerbezogen” behandelt. Dies ist eine verständliche Annahme, da die Systeme in Frage sehr neu und minimal dokumentiert sind. Daher haben verschiedene Experten diverse (und nicht immer effektive) Abhilfemaßnahmen für einige der hier dokumentierten Fehler vorgeschlagen, wie z. B. die Änderung der Einstellungen in verschiedenen Komponenten von ComfyUI-Workflows für Hunyuan-Video (HV) und Wan 2.1.

In einigen Fällen produziert HV anstelle von schneller Bewegung langsame Bewegung. Vorschläge von Reddit und ChatGPT (die hauptsächlich auf Reddit basieren) umfassen das Ändern der Anzahl der Frames in der angeforderten Generierung oder das radikale Senken der Bildfrequenz*.

Dies ist alles verzweifeltes Zeug; die aufkommende Wahrheit ist, dass wir noch nicht wissen, was die genaue Ursache oder das genaue Mittel für diese Probleme ist; klar ist, dass das Quälen der Generierungseinstellungen, um sie zu umgehen (besonders wenn dies die Ausgabequalität verschlechtert, z. B. mit einer zu niedrigen Bildfrequenz), nur ein vorübergehender Lösungsansatz ist, und es ist gut zu sehen, dass die Forschungsszene diese aufkommenden Probleme so schnell angeht.

Also, neben unserem Blick auf die Video-Untertitelung, die diese Woche veröffentlicht wurde, lassen Sie uns einen Blick auf die neue Studie über temporale Regularisierung werfen und welche Verbesserungen sie dem aktuellen generativen Video-Szenario bieten könnte.

Die zentrale Idee ist ziemlich einfach und unauffällig, und nichtsdestotrotz ist die Studie etwas aufgebläht, um die vorgeschriebenen acht Seiten zu erreichen, und wir werden diese Aufblähung bei Bedarf überspringen.

Der Fisch in der nativen Generierung des VideoCrafter-Frameworks ist statisch, während die FluxFlow-geänderte Version die erforderlichen Änderungen erfasst. Quelle: https://arxiv.org/pdf/2503.15417

Der Fisch in der nativen Generierung des VideoCrafter-Frameworks ist statisch, während die FluxFlow-geänderte Version die erforderlichen Änderungen erfasst. Quelle: https://arxiv.org/pdf/2503.15417

Die neue Studie trägt den Titel Temporale Regularisierung macht Ihren Video-Generator stärker und stammt von acht Forschern aus Everlyn AI, der Universität für Wissenschaft und Technologie Hongkong (HKUST), der Universität von Central Florida (UCF) und der Universität von Hongkong (HKU).

(zum Zeitpunkt des Schreibens gibt es einige Probleme mit der Begleitseite der Studie)

FluxFlow

Die zentrale Idee hinter FluxFlow, dem neuen Vorverarbeitungsschema der Autoren, besteht darin, die weit verbreiteten Probleme Flickering und temporale Inkonsistenz zu überwinden, indem Blöcke und Gruppen von Blöcken in den temporalen Frame-Reihenfolgen während des Trainingsprozesses neu angeordnet werden:

Die zentrale Idee hinter FluxFlow ist, Blöcke und Gruppen von Blöcken in unerwartete und nicht-temporale Positionen zu verschieben, als eine Form der Datenverarbeitung.

Die zentrale Idee hinter FluxFlow ist, Blöcke und Gruppen von Blöcken in unerwartete und nicht-temporale Positionen zu verschieben, als eine Form der Datenverarbeitung.

Die Studie erklärt:

‘[Artefakte] stammen aus einer grundlegenden Einschränkung: Trotz der Nutzung großer Datenmengen verlassen sich aktuelle Modelle oft auf vereinfachte temporale Muster in den Trainingsdaten (z. B. feste Laufrichtungen oder repetitive Frame-Übergänge) anstatt vielfältige und plausible temporale Dynamiken zu erlernen.

‘Dieses Problem wird durch den Mangel an expliziter temporaler Verarbeitung während des Trainings noch verstärkt, wodurch Modelle anfällig für Überanpassung an zufällige temporale Korrelationen (z. B. “Frame #5 muss Frame #4 folgen”) anstatt generalisierbar über verschiedene Bewegungsszenarien zu sein.’

Die meisten Video-Generierungsmodelle, so erklären die Autoren, borgen noch zu sehr von der Bild-Synthese, konzentrieren sich auf räumliche Treue und ignorieren weitgehend die temporale Achse. Obwohl Techniken wie Beschneiden, Spiegeln und Farb-Jittering die statische Bildqualität verbessert haben, sind sie keine ausreichenden Lösungen, wenn sie auf Videos angewendet werden, bei denen die Illusion der Bewegung von konsistenten Übergängen zwischen Frames abhängt.

Die resultierenden Probleme umfassen flackernde Texturen, ruckartige Schnitte zwischen Frames und repetitive oder zu einfache Bewegungsmuster.

Bitte klicken, um abzuspielen.

Die Studie argumentiert, dass einige Modelle – einschließlich Stable Video Diffusion und LlamaGen – durch immer komplexere Architekturen oder konstruierte Einschränkungen kompensieren, was jedoch einen Kostenaufwand in Bezug auf Rechenleistung und Flexibilität bedeutet.

Da temporale Datenverarbeitung bereits in Video-Verständnis-Aufgaben (in Frameworks wie FineCliper, SeFAR und SVFormer) nützlich erwiesen hat, ist es überraschend, so behaupten die Autoren, dass diese Taktik in einem generativen Kontext selten angewendet wird.

Störendes Verhalten

Die Forscher behaupten, dass einfache, strukturierte Störungen in der temporalen Reihenfolge während des Trainings dazu beitragen, dass Modelle besser generalisieren, um realistische, vielfältige Bewegungen zu erzeugen:

‘Durch das Training auf ungeordneten Sequenzen lernt der Generator, plausible Traektorien zu ermitteln, was effektiv die temporale Entropie regularisiert. FLUXFLOW verbindet die Lücke zwischen diskriminativer und generativer temporaler Verarbeitung und bietet eine Plug-and-Play-Verbesserungslösung für temporale Video-Generierung, während die Gesamtqualität verbessert wird.

‘Im Gegensatz zu bestehenden Methoden, die architektonische Änderungen einführen oder auf Nachbearbeitung angewiesen sind, operiert FLUXFLOW direkt auf der Datenebene und führt kontrollierte temporale Störungen während des Trainings ein.’

Bitte klicken, um abzuspielen.

Frame-ebene Störungen, so erklären die Autoren, führen feinkörnige Störungen innerhalb einer Sequenz ein. Diese Art von Störung ist nicht unähnlich der Maskierungsaugmentation, bei der Abschnitte von Daten zufällig blockiert werden, um zu verhindern, dass das System überanpasst auf Datenpunkte und um bessere Generalisierung zu fördern.

Tests

Obwohl die zentrale Idee hier nicht zu einer vollständigen Studie ausreicht, gibt es dennoch einen Testabschnitt, den wir uns ansehen können.

Die Autoren testeten vier Anfragen in Bezug auf verbesserte temporale Qualität bei gleichzeitiger Beibehaltung der räumlichen Treue; Fähigkeit, Bewegungs- und optische Flussdynamiken zu erlernen; Beibehaltung der temporalen Qualität bei extraterminaler Generierung; und Empfindlichkeit gegenüber wichtigen Hyperparametern.

Die Forscher wendeten FluxFlow auf drei generative Architekturen an: U-Net-basiert, in Form von VideoCrafter2; DiT-basiert, in Form von CogVideoX-2B; und AR-basiert, in Form von NOVA-0.6B.

Um einen fairen Vergleich zu ermöglichen, feinjustierten sie die Basismodelle der Architekturen mit FluxFlow als zusätzliche Trainingsphase, für eine Epoch, auf dem OpenVidHD-0.4M-Dataset.

Die Modelle wurden gegen zwei beliebte Benchmarks getestet: UCF-101; und VBench.

Für UCF wurden die Fréchet-Video-Distanz (FVD) und Inception-Score (IS) verwendet. Für VBench konzentrierten sich die Forscher auf temporale Qualität, frame-weise Qualität und Gesamtqualität.

Quantitative anfängliche Bewertung von FluxFlow-Frame.

Quantitative anfängliche Bewertung von FluxFlow-Frame. "+ Original" zeigt das Training ohne FLUXFLOW, während "+ Num × 1" verschiedene FluxFlow-Frame-Konfigurationen anzeigt. Die besten Ergebnisse sind schattiert; die zweitbesten sind für jedes Modell unterstrichen.

Die Autoren kommentieren diese Ergebnisse wie folgt:

‘Sowohl FLUXFLOW-FRAME als auch FLUXFLOW-BLOCK verbessern die temporale Qualität erheblich, wie durch die Metriken in Tab. 1, 2 (d. h. FVD, Subject, Flicker, Motion und Dynamic) und qualitative Ergebnisse in [Bild unten] belegt wird.

‘Zum Beispiel wird die Bewegung des driftenden Autos in VC2, die Katze, die ihrem Schwanz nachjagt, in NOVA, und der Surfer, der auf einer Welle reitet, in CVX, mit FLUXFLOW deutlich flüssiger. Wichtig ist, dass diese temporalen Verbesserungen ohne Opferung der räumlichen Treue erzielt werden, wie durch die scharfen Details von Wasserspritzern, Rauchfahnen und Wellentexturen sowie räumliche und Gesamttreue-Metriken belegt wird.’

Unten sehen wir Auswahlmöglichkeiten aus den qualitativen Ergebnissen, auf die die Autoren hinweisen:

Auswahlmöglichkeiten aus den qualitativen Ergebnissen.

Auswahlmöglichkeiten aus den qualitativen Ergebnissen.

Die Studie legt nahe, dass sowohl frame-ebene als auch block-ebene Störungen die temporale Qualität verbessern, frame-ebene Methoden jedoch aufgrund ihrer feineren Granularität tendenziell besser abschneiden. Block-ebene Störungen können dagegen aufgrund der engen Verbindung zwischen räumlichen und temporalen Mustern innerhalb von Blöcken Rauschen einführen und ihre Wirksamkeit verringern.

Schlussfolgerung

Diese Studie, zusammen mit der Bytedance-Tsinghua-Kollaboration zur Video-Untertitelung, die diese Woche veröffentlicht wurde, hat mir klargemacht, dass die offensichtlichen Mängel in der neuen Generation generativer Video-Modelle möglicherweise nicht auf Benutzerfehler, institutionelle Fehltritte oder Finanzierungsgrenzen zurückzuführen sind, sondern vielmehr auf eine Forschungskonzentration, die berechtigterweise dringendere Herausforderungen wie temporale Kohärenz und Konsistenz priorisiert hat:

Bis vor kurzem waren die Ergebnisse von frei verfügbaren und herunterladbaren generativen Video-Systemen so beeinträchtigt, dass keine große Anstrengung innerhalb der Enthusiastengemeinschaft unternommen wurde, um diese Probleme zu beheben (nicht zuletzt, weil die Probleme fundamental und nicht trivial zu lösen waren).

Jetzt, da wir so viel näher an das vorhergesagte Zeitalter rein AI-generierter photorealistischer Video-Ausgabe sind, ist es klar, dass sowohl die Forschungs- als auch die Casual-Gemeinschaft ein tieferes und produktiveres Interesse daran haben, die verbleibenden Probleme zu lösen; mit etwas Glück sind diese nicht unüberwindliche Hindernisse.

 

* Wans native Bildfrequenz ist ein mageres 16fps, und als Reaktion auf meine eigenen Probleme habe ich festgestellt, dass Foren vorgeschlagen haben, die Bildfrequenz auf bis zu 12fps zu senken und dann FlowFrames oder andere AI-basierte Re-Fluss-Systeme zu verwenden, um die Lücken zwischen solch einer spärlichen Anzahl von Frames zu interpolieren.

Erstveröffentlichung am Freitag, dem 21. März 2025

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai