Andersons Blickwinkel

Ein Video-Codec für künstlich generierte Videos

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

Da die Ära der künstlichen Intelligenz mit unbegrenztem Zugang zu Ende geht, verspricht ein neuer, wirtschaftlicher Ansatz für die künstliche Videogenerierung bemerkenswerte Einsparungen an Token und Zeit.

 

Die tatsächlichen Kosten der künstlichen Intelligenz bringen eine neue Note der Besonnenheit in das atemberaubende Tempo der aktuellen künstlichen Intelligenz-Revolution, mit zunehmendem Interesse an der Rationalisierung der Kosten des maschinellen Lernens. Neben dem Potenzial, künstliche Intelligenz in-house zu bringen, und dem allgemeinen Anstieg der privaten künstlichen Intelligenz, werden VRAM-hungrige und ressourcenfressende maschinelle Lernalgorithmen offensichtlich auch optimiert werden müssen.

Die Videogenerierung ist vielleicht der größte Sünder in dieser Hinsicht. Wenn Sie jemals einen Film rekomprimiert oder aus einer Video-Editier-Suite exportiert haben, wissen Sie bereits die Belastung, die diese spezielle (nicht-künstliche) Aufgabe auf Ihre Hardware hat – sie frisst RAM und CPU-Zyklen und blockiert oft die Maschine für jede andere Verwendung, es sei denn, Maßnahmen werden ergriffen, um die Auswirkungen des Komprimierungsalgorithmus auf den Host-Computer zu begrenzen.

Daher muss man sich nur vorstellen, in welchem Ausmaß der Aufstieg der künstlichen Intelligenz in Videos diese “energieverschwendende” Prozedur in Rechenzentren auf der ganzen Welt wiederholt. In diesem Maßstab werden die kleinsten Gewinne sofort bedeutend im Gesamtberechnung.

Im Rahmen

Mit diesem im Hinterkopf, schlägt eine neue Forschungsarbeit aus Shanghai, in Zusammenarbeit mit JD.com (JD ), einen Video-Codec vor, der nicht auf den Render-Prozess (den Prozess der Komprimierung großer, roher Frames in eine kleinere Video-Dateigröße) abzielt, sondern auf den eigentlichen künstlichen Videogenerierungsprozess selbst.

Ein normaler Video-Codec funktioniert, indem er nicht jeden Frame als vollständiges Bild speichert, sondern eine kleinere Anzahl vollständiger Bilder, sogenannte I-Frames, erstellt und dann die Änderungen zwischen Frames speichert.

Beispielsweise, wenn eine Person in einem Video leicht bewegt, speichert der Codec nur die Teile des Frames, die diese Änderung registrieren, anstatt das gesamte Szenario neu zu schreiben. Diese sind P-Frames, die von früheren Frames abgeleitet sind, und B-Frames, die auch Informationen in zukünftigen Frames vorhersagen können:

Anatomie eines Video-Codecs: Obere Reihe zeigt Frames über die Zeit mit I-, P- und B-Labels, wobei I-Frames vollständig in Farbe gespeichert sind und P- und B-Frames verblasst sind, um die Rekonstruktion anzuzeigen; Pfeile zeigen an, ob Frames frühere Frames, spätere Frames oder beides verwenden; untere Panels zeigen ein vollständig gespeichertes Frame (I-Frame, links), ein Frame, der aus einem früheren Frame gebaut ist (P-Frame, zweite von links), und ein Frame, der aus früheren und späteren Frames gebaut ist (B-Frame, rechts).

Anatomie eines Video-Codecs: Obere Reihe zeigt Frames über die Zeit mit I-, P- und B-Labels, wobei I-Frames vollständig in Farbe gespeichert sind und P- und B-Frames verblasst sind, um die Rekonstruktion anzuzeigen; Pfeile zeigen an, ob Frames frühere Frames, spätere Frames oder beides verwenden; untere Panels zeigen ein vollständig gespeichertes Frame (I-Frame, links), ein Frame, der aus einem früheren Frame gebaut ist (P-Frame, zweite von links), und ein Frame, der aus früheren und späteren Frames gebaut ist (B-Frame, rechts).

Diese Wiederverwendung von benachbarter Information ist der Grund, warum Video-Dateien klein bleiben, wobei die meisten Frames nicht als neue Bilder, sondern als Anweisungen funktionieren, die beschreiben, wie der vorherige Frame geändert wurde. Daher sind I-Frames “vollwertige”, platzintensive unkomprimierte (oder minimal komprimierte) Bilder, während die Frames dazwischen nur die Differenz zwischen I-Frames (und zwischen ihnen selbst) darstellen.

Wenn jeder einzelne Frame ein vollständiges unkomprimiertes Bild ist, hat das Video im Wesentlichen keine Komprimierung. Das Speichern eines Films auf diese Weise, als unkomprimiertes Video, würde zu einer 2-stündigen Filmdatei führen, die fast (oder mehr als) ein Terabyte an Festplattenspeicher benötigt. Doch genau so erstellt künstliche Intelligenz Filme – indem sie gleiche Ressourcen und Token für jeden Frame zuweist, wenn sie berechnet, wie sie das Video formulieren soll.

Wirtschaftlichkeit

Die neue Arbeit, betitelt AdaCodec: Ein prädiktiver visueller Code für Video-MLLMs, gibt vollständige visuelle Token ausschließlich für Referenz-Frames (I-Frames) aus, während alle Zwischen-Frames als “kompakte P-Tokens” gerendert werden – ein Paradigma, das offensichtlich von der traditionellen Komprimierung historischer “realer Welt”-Video-Codecs übernommen wurde.

Nachdem diese interne Komprimierung stattgefunden hat, kann das künstliche Intelligenz-Video dann normal komprimiert werden, und in der Theorie sind alle Einsparungen serverseitig:

Überblick über AdaCodec. Links, Videos werden in adaptive Gruppen von Bildern unterteilt, wobei vollständige I-Frames für Momente reserviert sind, die schwer vorherzusagen sind, und Zwischen-P-Frames mithilfe kompakten Bewegungs- und Restinformationen dargestellt werden. Rechts, das resultierende System entspricht oder übertrifft Qwen3-VL-8B in elf Benchmarks, behält eine höhere Langvideo-Genauigkeit bei Token-Budgets bei und reduziert die Antwortverzögerung, während es wesentlich weniger Video-Tokens verarbeitet. Quelle - https://arxiv.org/pdf/2606.02569

Überblick über AdaCodec. Links, Videos werden in adaptive Gruppen von Bildern unterteilt, wobei vollständige I-Frames für Momente reserviert sind, die schwer vorherzusagen sind, und Zwischen-P-Frames mithilfe kompakten Bewegungs- und Restinformationen dargestellt werden. Rechts, das resultierende System entspricht oder übertrifft Qwen3-VL-8B in elf Benchmarks, behält eine höhere Langvideo-Genauigkeit bei Token-Budgets bei und reduziert die Antwortverzögerung, während es wesentlich weniger Video-Tokens verarbeitet. Quelle

Die Einsparungen, laut den Ergebnissen von Tests für AdaCodec, sind es wert, verfolgt zu werden; die Arbeit besagt, dass das System das unveränderte Qwen3-VL-8B-Modell in allen wichtigen Benchmarks übertraf, während es die gleiche Menge an Verarbeitung verwendete; und entsprach oder übertraf das Modell auch nach dem Schneiden von Video-Tokens um etwa 86%.

Die Autoren erklären*:

‘Wir ziehen Inspiration aus der prädiktiven Kodierung, bei der ein System Fehler von einer Vorhersage überträgt, anstatt das rohe Signal. Dieses Prinzip hat biologische Grundlagen: Das visuelle System kodiert Vorhersagefehler, die Diskrepanz zwischen erwarteter und beobachteter Eingabe, anstatt des Signals selbst.

‘Moderne Video-Codecs verwenden die gleiche Residual-Kodierungs-Idee in der Technik: Referenz-Frames tragen vollständigen Inhalt, während prädiktive Frames Bewegung und Restsignale relativ zu einem Referenz.

‘Diese Systeme haben unterschiedliche Ziele, aber sie teilen die gleiche bedingte Struktur: Wenn benachbarte Proben redundant sind, sollte der Kanal das übertragen, was die Vorhersage nicht erklärt.

‘Standard-Codecs optimieren für Bitströme und menschlich sichtbare Rekonstruktion, nicht für visuelle Token, die von einem LLM verbraucht werden. Wir haben daher diesen Mechanismus als MLLM-Schnittstelle für Video-Verständnis neu entworfen.’

Die neue Arbeit, geschrieben von 11 Forschern der Shanghai Jiao Tong University, Shanghai Innovation Institute und JD.com, kommt mit einer zugehörigen Projektseite, mit der Veröffentlichung des Quellcodes versprochen.

Methode

Wie besprochen, behandelt das System nicht jeden Frame als ein vollständig neues Bild, sondern sucht nach dem, was zwischen einem Frame und dem nächsten geändert wurde. Auf der linken Seite, im Bild unten, sehen wir eine kleine Region des aktuellen Frames, die mit der ähnlichsten Region in einem früheren Frame abgeglichen wird:

Schema-Überblick für AdaCodec.

Schema-Überblick für AdaCodec.

Der Abstand zwischen den beiden Positionen wird zu einem Bewegungsvektor, während die verbleibenden visuellen Unterschiede zu einem Rest werden, wobei diese kompakten Beschreibungen den Bedarf ersetzen, ein vollständiges Bild zu speichern.

Auf der rechten Seite sehen wir die resultierenden Informationen, die in das künstliche Intelligenz-Modell eingegeben werden: wichtige Referenz-Frames werden immer noch als vollständige Bilder verarbeitet, aber die Zwischen-Frames werden durch viel kleinere Bewegungs- und Rest-Token dargestellt – offensichtlich ermöglicht es dem Modell, genug Informationen zu behalten, um das Video zu parsen, während es wesentlich weniger visuelle Daten verarbeitet.

Ein interessante Herausforderung ist, zu entscheiden, welche Frames in voller Länge gespeichert werden sollten: traditionelle Video-Codecs legen normalerweise Referenz-Frames in regelmäßigen Abständen, ob sie benötigt werden oder nicht. AdaCodec versucht stattdessen, die Momente zu identifizieren, die am meisten zählen.

Beispielsweise betrachten Sie eine Szene, die hauptsächlich ein statisches Gespräch zwischen zwei Personen in einer Wohnung zeigt – und plötzlich stürmt ein SWAT-Team durch das Fenster. Sofort werden die Kameraansichten und die Anzahl der Schnitte rapide ansteigen und erfordern viel mehr Daten als ein regulärer Referenz-Frame-Intervall bereitstellen kann:

Folge von Frames, die ein leeres Zimmer, zwei Personen, die sprechen, eine Gruppe, die durch das Fenster eintritt, die zwei Personen, die weggeführt werden, und das leere Zimmer wieder zeigen. Der Streifen der Zwischen-Frames unten zeigt die gleichen Ereignisse über einen längeren Zeitraum, wobei ausgewählte Frames in Blau hervorgehoben sind. Eine horizontale Skala mit der Beschriftung

Dies ist die Logik hinter variablen Komprimierungs- (variabler Bitrate) Komprimierungsmethoden, die die Quell-Video für solche “beschäftigte” Perioden analysieren und mehr Daten zuweisen, wo sie benötigt werden – ohne großen Zeit- und Ressourcenaufwand.

In AdaCodec, wenn ein Frame genau aus benachbarten Frames vorhergesagt werden kann, setzt das System die kompakten Bewegungs- und Rest-Token fort; wenn die Szene wesentlich ändert (z.B. das SWAT-Team-Beispiel oben oder etwas weniger dramatisch), wird ein vollständiger Referenz-Frame eingefügt. Dies ermöglicht es, mehr des verfügbaren Verarbeitungsbudgets für wichtige visuelle Informationen auszugeben, anstatt es gleichmäßig über das gesamte Video zu verteilen.

Daten und Tests

Im Test verwendeten die Forscher das oben genannte Qwen3-VL-8B als Basis-Modell und bewerteten AdaCodec in elf Benchmarks, die drei Bereiche des Video-Verständnisses umfassen: Langvideo-Leistung wurde mit MLVU, LongVideoBench und LVBench bewertet; zeitliches Verständnis mit TempCompass, MotionBench und TOMATO; und allgemeines Video-Verständnis mit Video-MME, MVBench, NExT-QA, PerceptionTest und EgoSchema.

Offene Modelle, die getestet wurden, waren InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; und Molmo2-O-7B.

Die GPT-5-, Gemini- und Claude-Varianten erscheinen in der folgenden Tabelle nur als Vergleichsbaselines. CoPE-VideoLM-7B und ReMoRa-7B sind frühere Video-Sprachmodelle, die die visuelle Token-Nutzung durch codec-inspirierte Komprimierung reduzieren, was sie zu den direktesten Wettbewerbern von AdaCodec macht:

Hauptergebnisse über elf Benchmarks, die Langvideo-Verständnis, zeitliches Verständnis und allgemeines Video-Verständnis abdecken. Höhere Werte bedeuten bessere Leistung. LVB = LongVideoBench; V-MME = Video-MME. Fett und unterstrichene Werte zeigen die höchsten und zweithöchsten Werte unter den offenen Modellen an. Werte für geschlossene Modelle wurden aus offiziellen Berichten übernommen, wo verfügbar, und fehlende Ergebnisse aus Molmo2 oder von den Autoren ausgewertet.

Hauptergebnisse über elf Benchmarks, die Langvideo-Verständnis, zeitliches Verständnis und allgemeines Video-Verständnis abdecken. Höhere Werte bedeuten bessere Leistung. LVB = LongVideoBench; V-MME = Video-MME. Fett und unterstrichene Werte zeigen die höchsten und zweithöchsten Werte unter den offenen Modellen an. Werte für geschlossene Modelle wurden aus offiziellen Berichten übernommen, wo verfügbar, und fehlende Ergebnisse aus Molmo2 oder von den Autoren ausgewertet.

Um einen fairen Vergleich zu gewährleisten, wurde die gleiche Anzahl an visuellen Token sowohl für AdaCodec als auch für das Standard-Qwen3-VL-8B-System zugewiesen, um die Ergebnisse so zu gestalten, dass sie die Effektivität des Komprimierungsansatzes widerspiegeln, anstatt Unterschiede in den Rechenressourcen.

Bei der aggressivsten Einstellung reduzierte AdaCodec die visuelle Token-Nutzung um etwa 86%, während es das Basissystem auf Langvideo-, zeitlichen und allgemeinen Video-Verständnis-Aufgaben noch immer entsprach oder leicht übertraf.

Wenn die gesparten Token in die Verarbeitung von mehr Video-Frames investiert wurden, verbesserte sich die Leistung über alle Langvideo-Benchmarks und alle zeitlichen Benchmarks, mit Gewinnen von +5,4 Punkten auf LongVideoBench und +4,3 Punkten auf TOMATO, während es auch einige der stärksten offenen Ergebnisse in der Studie produzierte.

Schlussfolgerung

Obwohl Projekte dieser Art normalerweise auf Hyperscale-Anbieter abzielen, ist dies der Art von Bemühungen, die auch für Hobbyisten und KMUs von Interesse sein werden, als Teil einer potenziellen neuen “öffentlichen Askese” um lokale, rationalisierte künstliche Intelligenz-Implementierung.

In Gemeinschaften wie r/stablediffusion ist dies sehr alte Neuigkeiten, da jedes große offene Release, das dort ankommt, regelmäßig in eine hyper-optimierte (GGUF, quantifizierte Gewichte usw.) Version umgewandelt wird, die mit etwas Geduld auf niedrigeren Grafikkarten laufen kann.

Wenn die “performative Phase” dieser dritten künstlichen Intelligenz-Welle tatsächlich vorbei ist und unter der Annahme, dass Unternehmen von den wahren Kosten der Inferenz abgeschreckt werden, könnten Initiativen wie AdaCodec Teil einer kommenden “großen Optimierung” sein.

 

† Dies ist nicht dasselbe wie das Rendern des Videos in ein benutzerfreundliches Format/Dateigröße; vielmehr geht es um die interne Generierung und Kollation von Frames, die innerhalb des künstlichen Intelligenz-Modells bei der Inferenzzeit stattfindet.

* Meine Umwandlung, im Rahmen des Möglichen, der Autoren-Inline-Zitate in Hyperlinks.

Erstveröffentlicht am Donnerstag, 4. Juni 2026

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai