Andersonův úhel
Video kodek pro AI generované záběry

Jelikož éra “vše, co můžete sníst” umírající, ekonomicky nová metoda generování videa pomocí AI slibuje významné úspory tokenů a času.
Skutečné náklady na inference AI přinášejí novou poznámku zdrženlivosti k bezprecedentnímu tempu současné AI revoluce, s rostoucím zájmem o racionalizaci nákladů na strojové učení. Kromě potenciálu přinesení AI domů a obecného vzestupu soukromé AI, budou rutiny strojového učení, které jsou náročné na VRAM a zdroje, také potřebovat optimalizaci.
Generování videa je možná největším viníkem v tomto ohledu. Pokud jste již někdy rekompresovali film nebo exportovali jej z videoeditorského softwaru, už víte náklad, který tato konkrétní (ne-AI) úloha představuje pro vaše hardwarové vybavení – spotřebuje RAM a CPU cykly a často blokuje stroj pro jakékoli jiné použití, pokud nejsou přijata opatření k omezení dopadu kompresního algoritmu na hostitelský počítač.
Proto stačí si jen představit, do jaké míry se vzestup AI videa opakuje v tomto “energeticky závislém” postupu v datových centrech po celém světě. V této škále provozu se i ty nejmenší zisky stanou okamžitě významné v souhrnném vyúčtování.
V rámu
S tímto na paměti, nová výzkumná nabídka ze Šanghaje, ve spolupráci s JD.com (JD ), navrhuje video kodek zaměřený ne na proces renderingu (proces komprimování velkých, surových snímků do menších video souborů), ale na samotný proces generování videa pomocí AI.
Normální video kodek funguje tak, že neukládá každý snímek jako plnou obrazovku, ale vytváří menší počet kompletních obrazovek, nazývaných I-snímky, a poté ukládá změny mezi snímky.
Například, pokud se osoba mírně pohne ve videu, kodek zaznamenává pouze části snímku, které registrovaly tuto změnu, místo toho, aby přepisoval celou scénu. Tyto jsou P-snímky, které jsou odvozeny z předchozích snímků, a B-snímky, které mohou také předpovídat informace ve budoucích snímcích:

Anatomie video kodeku: horní řada ukazuje snímky v čase označené I, P a B, s I-snímky plně uloženými v plné barvě a P- a B-snímky zobrazenými ztmavenými, aby naznačovaly rekonstrukci; šipky ukazují, zda snímky používají předchozí snímky, budoucí snímky nebo obojí; dolní panely znázorňují plně uložený snímek (I-snímek, vlevo), snímek sestavený z předchozího snímku (P-snímek, druhý zleva) a snímek sestavený z předchozích a budoucích snímků (B-snímek, vpravo).
Tento opakovaný použití blízkých informací je důvodem, proč video soubory zůstávají malé, s většinou snímků fungujících ne jako nové obrázky, ale jako instrukce popisující, jak se předchozí snímek změnil. Proto I-snímky tvoří “plnotučené”, prostorově náročné nekomprimované (nebo minimálně komprimované) obrázky, se snímky mezi nimi tvořícími pouze rozdíl mezi I-snímky (a mezi nimi samými).
Když každý jednotlivý snímek je plnou nekomprimovanou obrazovkou, film prakticky žádnou kompresi nemá. Ukládání filmu tímto způsobem, jako nekomprimované video, by vyžadovalo pro 2hodinový film téměř (nebo více než) 1 terabyte místa na disku. Avšak toto je způsob, jakým AI vytváří filmy† – tím, že věnuje stejné zdroje a tokeny každému jednotlivému snímku, když vypočítává, jak formulovat video.
Ekonomie rozsahu
Nová práce, nazvaná AdaCodec: Prediktivní vizuální kodek pro video MLLM, místo toho vynakládá plné vizuální tokeny výhradně na referenční snímky (I-snímky), se všemi mezilehlými snímky renderovanými jako “kompaktní P-tokeny” – paradigma jasně převzaté z tradiční komprese používané historickými “reálnými” video kodeky.
Po tomto interním kompresním procesu může být video poté komprimováno normálně, a v teorii jsou všechny úspory na straně serveru:

Přehled AdaCodec. Vlevo, videa jsou rozdělena do adaptivních skupin snímků, s plnými I-snímky rezervovanými pro okamžiky, které jsou obtížně předpověditelné, a mezilehlými P-snímky reprezentovanými pomocí kompaktního pohybu a zbytkových informací. Vpravo, výsledný systém odpovídá nebo přesahuje Qwen3-VL-8B napříč jedenácti benchmarky, udržuje vyšší dlouhou-video přesnost napříč tokenovými rozpočty a snižuje latenci odpovědi, zatímco zpracovává podstatně méně video tokenů. Zdroj
Úspory, podle hlášených výsledků z testů pro AdaCodec, jsou hodné sledování; článek uvádí, že systém překonal neupravený Qwen3-VL-8B model napříč všemi hlavními benchmarky, zatímco používal stejné množství zpracování; a stále odpovídal nebo přesahoval výkon tohoto modelu po snížení video tokenů o přibližně 86%.
Autoři uvádějí*:
‘Čerpáme inspiraci z prediktivní kódování, kde systém přenáší chyby z předpovědi místo surového signálu. Tento princip má biologický základ: vizuální systém se domnívá, že kóduje chyby předpovědi, nesoulad mezi očekávaným a pozorovaným vstupem, ne samý vstup.
‘Moderní video kodeky používají stejnou myšlenku reziduální kódování v inženýrství: referenční snímky nesou plný obsah, zatímco prediktivní snímky nesou pohybové a zbytkové signály vzhledem k referenčnímu.
‘Tyto systémy mají odlišné cíle, ale sdílejí stejnou podmíněnou strukturu: když jsou blízké vzorky redundadní, kanál by měl nést to, co předpověď nedokáže vysvětlit.
‘Standardní kodeky, nicméně, optimalizují pro bitové proudy a lidsky čitelnou rekonstrukci, ne pro vizuální tokeny spotřebované LLM. Proto přebudujeme tuto mechaniku jako rozhraní MLLM pro video pochopení.’
Nová práce, napsaná 11 výzkumníky ze Šanghajské univerzity Jiao Tong, Šanghajského inovačního institutu a JD.com, přichází s asociovanou projektovou stránkou, se slibem vydání zdrojového kódu.
Metoda
Jak bylo diskutováno, místo toho, aby se každý snímek považoval za úplně nový obrázek, systém hledá, co se změnilo mezi jedním snímkem a dalším. Na levé straně, na obrázku níže, vidíme malou oblast aktuálního snímku, která je porovnávána s nejpodobnější oblastí v předchozím snímku:

Schéma přehledu pro AdaCodec.
Vzdálenost mezi těmito dvěma místy se stává pohybovým vektorem, zatímco jakékoli zbývající vizuální rozdíly se stávají zbytkem, s těmito kompaktními popisy nahrazujícími potřebu uložit plný obrázek.
Na pravé straně vidíme výsledné informace zavedené do modelu AI: důležité referenční snímky jsou stále zpracovávány jako kompletní obrázky, ale mezilehlé snímky jsou reprezentovány mnohem menšími pohybovými a zbytkovými tokeny – zdá se, že modelu umožňuje zachovat dostatek informací k analýze videa, zatímco zpracovává podstatně méně vizuálních dat.
Jednou z zajímavých výzev je rozhodnutí, které snímky si zaslouží být uloženy v plném rozsahu: tradiční video kodeky obvykle umisťují referenční snímky do pravidelných intervalů, ať už jsou potřebné nebo ne. AdaCodec se naopak snaží identifikovat okamžiky, které jsou nejdůležitější.
Například, zvažte scénu, která většinou zobrazuje statickou konverzaci mezi dvěma lidmi v bytě – a najednou se do okna vlomí policejní tým. Okamžitě se zvyšují kamerové pohledy a počet střihů a vyžadují mnohem více dat, než by pravidelný referenční interval poskytl:

To je logika za metodami komprese s proměnlivou bitrate (proměnlivá bitrate), které analyzují zdrojové video pro takové “zaneprázdněné” období a přidělují více dat, kde je to potřeba – za cenu času a zdrojů.
V AdaCodec, pokud lze snímek přesně předpovědět z blízkých snímků, systém pokračuje v použití kompaktních pohybových a zbytkových tokenů; pokud se scéna podstatně změní (tj. policejní tým výše, nebo něco méně dramatického), je vložen plný referenční snímek. To umožňuje, aby více dostupného procesního rozpočtu bylo vynaloženo na důležité vizuální informace místo toho, aby bylo rovnoměrně rozděleno po celém videu.
Data a testy
Při testování výzkumníci použili výše zmíněný Qwen3-VL-8B jako základní model a vyhodnotili AdaCodec napříč jedenácti benchmarky pokrývajícími tři oblasti video pochopení: dlouhé video výkony byly hodnoceny s MLVU, LongVideoBench, a LVBench; časové pochopení s TempCompass, MotionBench, a TOMATO; a obecné video pochopení s Video-MME, MVBench, NExT-QA, PerceptionTest, a EgoSchema.
Otevřené modely testované byly InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; a Molmo2-O-7B.
GPT-5, Gemini a Claude varianty se objevují v tabulce níže pouze jako srovnávací základy. CoPE-VideoLM-7B a ReMoRa-7B jsou dříve video-jazykové modely, které snižují spotřebu vizuálních tokenů prostřednictvím kodek-inspirované komprese, což je činí nejbližšími přímými konkurenty AdaCodec:

Hlavní výsledky napříč jedenácti benchmarky pokrývajícími dlouhou video analýzu, časové rozpoznávání a obecné video pochopení. Vyšší skóre indikují lepší výkon. LVB = LongVideoBench; V-MME = Video-MME. Tučné a podtržené hodnoty indikují nejvyšší a druhý nejvyšší skóre mezi otevřenými modely. Skóre pro uzavřené modely byly získány z oficiálních zpráv, kde dostupné, s chybějícími výsledky získanými z Molmo2 nebo hodnocenými autory.
Pro zajištění spravedlivého srovnání, stejný počet vizuálních tokenů byl přidělen jak AdaCodec, tak standardnímu Qwen3-VL-8B systému, což umožňuje výsledkům odrážet účinnost kompresního přístupu, spíše než jakékoli rozdíly v výpočetních zdrojích.
Při nejagresivnějším nastavení AdaCodec snížil spotřebu vizuálních tokenů o přibližně 86%, zatímco stále odpovídal nebo mírně přesahoval základní systém na dlouhou video analýzu, časovém rozpoznávání a obecném video pochopení.
Když byly uložené tokeny reinvestovány do zpracování dalších video snímků, výkon se zlepšil napříč všemi dlouhou video benchmarky a všemi časovými benchmarky, s zisky dosahující +5,4 bodů na LongVideoBench a +4,3 bodů na TOMATO, zatímco také produkoval některé z nejsilnějších otevřených výsledků ve studii.
Závěr
Ačkoli jsou projekty této povahy obvykle zaměřeny na hyperscale poskytovatele, je to typ úsilí, které bude zajímavé pro hobbyisty a malé a střední podniky, jako součást potenciální nové “veřejné asketiky” kolem lokálního, racionalizovaného nasazení AI.
V komunitách, jako je r/stablediffusion, je to velmi stará zpráva, protože každá nová otevřená verze, která tam přichází, je pravidelně optimalizována do hyper-optimalizované (GGUF, kvantizované váhy atd.) verze, která může běžet, s určitou trpělivostí, na nižších grafických kartách.
Jestliže “výkonná fáze” této třetí AI vlny skončila, a za předpokladu, že korporace budou odpuzeny skutečnými náklady na inference, pak iniciativy, jako je AdaCodec, mohou tvořit část nadcházející “velké optimalizace”.












