Kąt Andersona

Kodek wideo dla filmów generowanych przez AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

Podczas gdy era wszystkiego, co można zjeść, w przypadku AI dobiega końca, nowe, ekonomiczne podejście do generowania wideo przez AI obiecuje znaczne oszczędności w tokenach i czasie.

 

Rzeczywisty koszt wnioskowania AI wprowadza nowy ton powagi do błyskawicznego tempa obecnej rewolucji AI, z zwiększonym zainteresowaniem racjonalizacją kosztów maszynowego uczenia się. Poza potencjałem przeniesienia AI do środowiska lokalnego oraz ogólnym wzrostem prywatnego AI, procedury maszynowego uczenia się, które są głodne pamięci VRAM i pochłaniające zasoby, również będą wymagać optymalizacji.

Generowanie wideo jest być może największym sprawcą w tym zakresie. Jeśli kiedykolwiek rekompresowaliście film lub wyeksportowali go z programu do edycji wideo, już wiecie jaki wpływ ma to na Wasze urządzenie – zużywa pamięć RAM i cykle procesora, a często blokuje maszynę dla jakiegokolwiek innego użycia, chyba że podjęte zostaną środki w celu ograniczenia wpływu algorytmu kompresji na komputer hosta.

Dlatego wystarczy tylko wyobrazić sobie, w jakim stopniu wzrost wideo AI powtarza tę “szaloną” procedurę w centrach danych na całym świecie. W tej skali działania nawet najmniejsze zyski stają się natychmiast znaczące w agregowanym rozrachunku.

W kadrze

Mając to na uwadze, nowa praca badawcza z Szanghaju, we współpracy z JD.com (JD ), proponuje kodowanie wideo nie przeznaczone do procesu renderowania (procesu kompresowania ogromnych, surowych klatek w mniejszy rozmiar pliku wideo), ale do samego procesu generowania wideo AI.

Zwykły kodowanie wideo działa poprzez nieprzechowywanie każdej klatki jako pełnego obrazu, ale poprzez tworzenie mniejszej liczby pełnych obrazów, zwanych klatkami I, a następnie przechowywanie zmian między klatkami.

Na przykład, jeśli osoba porusza się nieznacznie w filmie, kodowanie rejestruje tylko te części klatki, które rejestrują tę zmianę, zamiast ponownego zapisania całej sceny. Są to klatki P, które są pochodnymi wcześniejszych klatek, oraz klatki B, które mogą również przewidywać informacje w przyszłych klatkach:

Anatomia kodowania wideo: górny rząd pokazuje klatki w czasie oznaczone jako I, P i B, z klatkami I przechowywanymi w pełnym kolorze i klatkami P i B wyświetlanymi w wyblakłym kolorze, aby wskazać rekonstrukcję; strzałki wskazują, czy klatki używają wcześniejszych klatek, późniejszych klatek, czy obu; dolne panele przedstawiają pełną klatkę (klatka I, lewa), klatkę zbudowaną z poprzedniej klatki (klatka P, druga z lewej) i klatkę zbudowaną z wcześniejszych i późniejszych klatek (klatka B, prawa).

Anatomia kodowania wideo: górny rząd pokazuje klatki w czasie oznaczone jako I, P i B, z klatkami I przechowywanymi w pełnym kolorze i klatkami P i B wyświetlanymi w wyblakłym kolorze, aby wskazać rekonstrukcję; strzałki wskazują, czy klatki używają wcześniejszych klatek, późniejszych klatek, czy obu; dolne panele przedstawiają pełną klatkę (klatka I, lewa), klatkę zbudowaną z poprzedniej klatki (klatka P, druga z lewej) i klatkę zbudowaną z wcześniejszych i późniejszych klatek (klatka B, prawa).

To ponowne wykorzystanie pobliskich informacji jest powodem, dla którego pliki wideo pozostają małe, a większość klatek działa nie jako nowe obrazy, ale jako instrukcje opisujące, jak poprzednia klatka się zmieniła. Dlatego klatki I stanowią “pełne”, pochłaniające miejsce, niekompresowane (lub minimalnie skompresowane) obrazy, a klatki między nimi stanowią tylko różnicę między klatkami I (i między sobą).

Gdy każda pojedyncza klatka jest pełnym, niekompresowanym obrazem, film nie ma żadnej kompresji. Zapisywanie filmu w ten sposób, jako wideo niekompresowane, wymagałoby około (lub więcej niż) terabajta miejsca na dysku. Jednak to właśnie w ten sposób AI tworzy filmy† – poświęcając równy zasoby i tokeny każdej i każdej klatce, gdy oblicza, jak sformułować wideo.

Gospodarka skali

Nowa praca, zatytułowana AdaCodec: Przewidywalny kod wizualny dla MLLM wideo, wydatkuje pełne tokeny wizualne wyłącznie na klatki odniesienia (klatki I), a wszystkie klatki między nimi są renderowane jako “kompaktowe tokeny P” – paradygmat wyraźnie zaczerpnięty z tradycyjnej kompresji stosowanej przez historyczne “rzeczywiste” kodowania wideo.

Po tym, jak zewnętrzna kompresja miała miejsce, wideo AI może być następnie skompresowane normalnie, a teoretycznie wszystkie oszczędności są po stronie serwera:

Przegląd AdaCodec. Po lewej, filmy są podzielone na adaptacyjne grupy obrazów, z pełnymi klatkami I zarezerwowanymi dla momentów, które są trudne do przewidzenia, a pośrednie klatki P reprezentowane są przy użyciu kompaktowych informacji o ruchu i resztkowych. Po prawej, wynikający system odpowiada lub przewyższa Qwen3-VL-8B w jedenastu benchmarkach, utrzymuje wyższą dokładność długich filmów w różnych budżetach tokenów i redukuje opóźnienie odpowiedzi podczas przetwarzania znacznie mniej tokenów wideo. Źródło - https://arxiv.org/pdf/2606.02569

Przegląd AdaCodec. Po lewej, filmy są podzielone na adaptacyjne grupy obrazów, z pełnymi klatkami I zarezerwowanymi dla momentów, które są trudne do przewidzenia, a pośrednie klatki P reprezentowane są przy użyciu kompaktowych informacji o ruchu i resztkowych. Po prawej, wynikający system odpowiada lub przewyższa Qwen3-VL-8B w jedenastu benchmarkach, utrzymuje wyższą dokładność długich filmów w różnych budżetach tokenów i redukuje opóźnienie odpowiedzi podczas przetwarzania znacznie mniej tokenów wideo. Źródło

Oszczędności, zgodnie z wynikami testów dla AdaCodec, są warte poświęcenia; artykuł stwierdza, że system przewyższył niezmodyfikowany model Qwen3-VL-8B we wszystkich głównych benchmarkach, przy użyciu tej samej ilości przetwarzania; i nadal odpowiadał lub przewyższał ten model, nawet po obcięciu tokenów wideo o około 86%.

Autorzy stwierdzają*:

‘Czerpiemy inspirację z kodowania predykcyjnego, gdzie system transmits błędy z predykcji zamiast surowego sygnału. To zasada ma biologiczne podstawy: układ wzrokowy jest uważany za kodowanie błędów predykcji, niezgodność między oczekiwanym a obserwowanym wejściem, zamiast samego wejścia.

‘Nowoczesne kodowania wideo używają tej samej idei kodowania resztkowego w inżynierii: klatki odniesienia przenoszą pełną treść, podczas gdy klatki predykcyjne przenoszą ruch i resztkowe sygnały względem odniesienia

‘Te systemy mają różne cele, ale dzielą tę samą strukturę warunkową: gdy pobliskie próbki są nadmiarowe, kanał powinien przenosić to, co nie udaje się wyjaśnić predykcji.

‘Standardowe kodowania, jednak, optymalizują dla strumieni bitowych i ludzkiej widoczności, a nie dla tokenów wizualnych zużywanych przez MLLM. Dlatego przebudowujemy ten mechanizm jako interfejs MLLM dla zrozumienia wideo.’

Nowa praca, napisana przez 11 badaczy z Uniwersytetu w Szanghaju, Instytutu Innowacji w Szanghaju i JD.com, jest dostępna wraz ze stroną projektu, z obietnicą wydania kodu źródłowego.

Metoda

Jak omówiono, zamiast traktować każdą klatkę jako całkowicie nowy obraz, system szuka tego, co się zmieniło między jedną klatką a następną. Po lewej, na poniższym obrazie, widzimy mały obszar bieżącej klatki, który jest dopasowany do najbardziej podobnego obszaru w poprzedniej klatce:

Przegląd schematu dla AdaCodec.

Przegląd schematu dla AdaCodec.

Odległość między dwoma lokalizacjami staje się wektorem ruchu, a pozostałe różnice wizualne stają się resztkowymi, a te kompaktowe opisy zastępują potrzebę przechowywania pełnego obrazu.

Na prawo widzimy wynikające informacje wprowadzane do modelu AI: ważne klatki odniesienia są nadal przetwarzane jako pełne obrazy, ale klatki między nimi są reprezentowane przez znacznie mniejsze ruch i resztkowe tokeny – pozornie pozwalając modelowi na zachowanie wystarczającej ilości informacji, aby rozpoznać wideo, przy jednoczesnym przetwarzaniu znacznie mniej danych wizualnych.

Jednym z interesujących wyzwań jest decyzja, które klatki zasługują na pełne przechowywanie: tradycyjne kodowania wideo zwykle umieszczają klatki odniesienia w regularnych odstępach, niezależnie od tego, czy są one potrzebne, czy nie. AdaCodec, zamiast tego, próbuje zidentyfikować momenty, które mają największe znaczenie.

Na przykład, rozważmy scenę, w której dwie osoby rozmawiają w mieszkaniu – i nagle zespół SWAT wkracza do pomieszczenia przez okno. Natychmiast widok kamery i liczba cięć montażowych wzrosną i będą wymagać znacznie więcej danych niż regularny interwał klatek odniesienia może dostarczyć:

Sekwencja klatek pokazująca pusty pokój, dwie osoby rozmawiające, grupę wkraczającą przez okno, dwie osoby wyprowadzane i pusty pokój ponownie. Pasek klatek pośrednich poniżej przedstawia te same wydarzenia w dłuższym czasie, z wybranymi klatkami wyróżnionymi na niebiesko. Skala pozioma oznaczona jako

To jest logika, która stoi za metodami kompresji o zmiennej przepływności (kompresja o zmiennej przepływności) – analizują one źródłowe wideo w poszukiwaniu takich “zajętych” okresów i przydzielają większe dane tam, gdzie są one potrzebne – przy niezbyt małym koszcie czasu i zasobów.

W AdaCodec, jeśli klatka może być przewidziana dokładnie z pobliskich klatek, system kontynuuje używanie kompaktowych tokenów ruchu i resztkowych; jeśli scena ulega znacznej zmianie (tj. przykład zespołu SWAT powyżej, lub coś mniej dramatycznego), pełna klatka odniesienia jest wstawiana. To pozwala na wydanie większej części dostępnego budżetu przetwarzania na ważne informacje wizualne, zamiast rozdzielać je równomiernie na całe wideo.

Dane i testy

Podczas testów, badacze użyli wspomnianego Qwen3-VL-8B jako modelu podstawowego i ocenili AdaCodec w jedenastu benchmarkach, obejmujących trzy obszary zrozumienia wideo: wykonanie długich filmów zostało ocenione za pomocą MLVU, LongVideoBench i LVBench; rozumienie czasowe z TempCompass, MotionBench i TOMATO; i ogólne zrozumienie wideo z Video-MME, MVBench, NExT-QA, PerceptionTest i EgoSchema.

Modele open-source, które zostały przetestowane, to InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; i Molmo2-O-7B.

Wersje GPT-5, Gemini i Claude pojawiają się w poniższej tabeli tylko jako linie porównawcze. CoPE-VideoLM-7B i ReMoRa-7B to wcześniejsze modele języka wideo, które redukują użycie tokenów wizualnych za pomocą kompresji inspirowanej kodowaniem, co czyni je najbliższymi bezpośrednimi konkurentami dla AdaCodec:

Główne wyniki w jedenastu benchmarkach, obejmujących długie filmy, rozumienie czasowe i ogólne zrozumienie wideo. Wyższe wyniki wskazują lepszą wydajność. LVB = LongVideoBench; V-MME = Video-MME. Wyróżnione i podkreślone wartości wskazują najwyższe i drugie najwyższe wyniki wśród modeli open-source. Wyniki dla modeli zamkniętych pochodzą z oficjalnych raportów, jeśli są dostępne, z brakującymi wynikami pochodzącymi z Molmo2 lub ocenianymi przez autorów.

Główne wyniki w jedenastu benchmarkach, obejmujących długie filmy, rozumienie czasowe i ogólne zrozumienie wideo. Wyższe wyniki wskazują lepszą wydajność. LVB = LongVideoBench; V-MME = Video-MME. Wyróżnione i podkreślone wartości wskazują najwyższe i drugie najwyższe wyniki wśród modeli open-source. Wyniki dla modeli zamkniętych pochodzą z oficjalnych raportów, jeśli są dostępne, z brakującymi wynikami pochodzącymi z Molmo2 lub ocenianymi przez autorów.

Aby zapewnić uczciwe porównanie, ta sama liczba tokenów wizualnych została przydzielona do AdaCodec i standardowego systemu Qwen3-VL-8B, co pozwoliło wynikom odzwierciedlić skuteczność podejścia kompresji, a nie różnice w zasobach obliczeniowych.

Przy najbardziej agresywnym ustawieniu, AdaCodec zmniejszył użycie tokenów wizualnych o około 86%, jednocześnie odpowiadając lub nieznacznie przewyższając system podstawowy w zadaniach zrozumienia długich filmów, czasowych i ogólnych zrozumienia wideo.

Gdy zaoszczędzone tokeny zostały ponownie zainwestowane w przetwarzanie większej liczby klatek wideo, wydajność poprawiła się we wszystkich benchmarkach długich filmów i wszystkich benchmarkach czasowych, z zyskami sięgającymi +5,4 punkty na LongVideoBench i +4,3 punkty na TOMATO, a także produkując niektóre z najmocniejszych wyników open-source w badaniu.

Wnioski

Chociaż projekty tego rodzaju są zwykle skierowane do dostawców hyperscale, to jest to rodzaj wysiłku, który będzie interesował hobbystów i małe oraz średnie przedsiębiorstwa, jako część potencjalnej nowej “publicznej ascezy” wokół lokalnego, racjonalizowanego wdrożenia AI.

W społecznościach takich jak r/stablediffusion, jest to bardzo stare wieści, ponieważ każde główne wydanie open-source, które pojawia się tam, jest regularnie torturowane w celu stworzenia hiper-optymalizowanej (GGUF, kwantyzowane wag, itp.) wersji, która może działać, z pewną cierpliwością, na niższych kartach graficznych.

Jeśli “spektakularna” faza tego trzeciego wzrostu AI rzeczywiście się skończyła, a przy założeniu, że korporacje będą odpychane przez rzeczywiste koszty wnioskowania, to inicjatywy takie jak AdaCodec mogą stanowić część nadchodzącej “wielkiej optymalizacji”.

 

† To nie jest to samo, co renderowanie wideo w przyjaznym dla użytkownika formacie/rozmiarze pliku; raczej, dotyczy to wewnętrznej generacji i konsolidacji klatek, która zachodzi wewnątrz modelu AI w czasie wnioskowania.

* Moja konwersja, w rozsądku, inline cytowań autorów do hiperłączy.

Pierwotnie opublikowane w czwartek, 4 czerwca 2026

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai