Andersons vinkel

En Video Codec til AI-Genereret Footage

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

Da den alt-kan-spises-æra for AI nærmer sig sin afslutning, lover en økonomisk ny tilgang til AI-video-generering betydelige besparelser i tokens og tid.

 

Den virkelige omkostning ved AI-inferens bringer en ny tone af besindighed til den hektiske tempo i den nuværende AI-revolution, med øget interesse for at rationalisere omkostningerne ved maskinlæring. Ud over potentialet for at få AI hjemme, og den generelle stigning i privat AI, vil VRAM-sultne og ressource-slukende maskinlærings-rutiner også klart behøve optimering.

Video-generering er måske den største syndere i denne henseende. Hvis du nogensinde har genkomprimeret en film eller eksporteret en ud fra et video-redigeringsprogram, ved du allerede omkostningerne ved denne specifikke (ikke-AI) opgave på din hardware – æder RAM og CPU-cykler og blokerer ofte maskinen for enhver anden brug, medmindre der tages foranstaltninger for at begrænse kompressionsalgoritmens indvirkning på værten.

Derfor behøver man kun at forestille sig, i hvilken udstrækning stigningen i AI-video gentager denne ‘kraft-ivrige’ procedure i datacentre verden over. På denne skala bliver selv de mindste gevinster straks betydelige i den samlede regnskab.

I Rammen

Med dette i mente er en ny forskningspræsentation fra Shanghai, i samarbejde med JD.com (JD ), en video codec rettet mod ikke udrendringsprocessen (processen med at komprimere enorme, rå billeder til en mindre video-fil-størrelse), men mod selve AI-video-genereringsprocessen.

En normal video codec fungerer ved ikke at gemme hvert billede som et fuldt billede, men ved at oprette et mindre antal fuldstændige billeder, kaldet I-frames, og derefter gemme ændringer mellem billeder.

For eksempel, hvis en person bevæger sig lidt i en video, optager codec kun de dele af billedet, der registrerer ændringen, og ikke hele scenen. Disse er P-frames, der er afledt fra tidligere billeder, og B-frames, der også kan forudse information i fremtidige billeder:

Anatomi af en video codec: top-række viser billeder over tid med I-, P- og B-mærker, med I-frames fuldt gemt i fuld farve og P- og B-frames vist med mindre farve til at indikere rekonstruktion; pile viser, om billeder bruger tidligere eller senere billeder; nederste panel viser et fuldt gemt billede (I-frame, venstre), et billede bygget fra et tidligere billede (P-frame, anden fra venstre) og et billede bygget fra både tidligere og senere billeder (B-frame, højre).

Anatomi af en video codec: top-række viser billeder over tid med I-, P- og B-mærker, med I-frames fuldt gemt i fuld farve og P- og B-frames vist med mindre farve til at indikere rekonstruktion; pile viser, om billeder bruger tidligere eller senere billeder; nederste panel viser et fuldt gemt billede (I-frame, venstre), et billede bygget fra et tidligere billede (P-frame, anden fra venstre) og et billede bygget fra både tidligere og senere billeder (B-frame, højre).

Dette genbrug af nærliggende information er årsagen til, at video-filer forbliver små, med de fleste billeder, der fungerer ikke som nye billeder, men som instruktioner, der beskriver, hvordan det foregående billede er ændret. Derfor udgør I-frames ‘fedt’, plads-krævende ukomprimerede (eller minimalt komprimerede) billeder, med billederne imellem udgør kun forskellen mellem I-frames (og mellem sig selv).

Når hvert enkelt billede er et fuldt ukomprimeret billede, har filmen essentielt ingen kompression. At gemme en film på denne måde, som ukomprimeret video, ville resultere i, at en 2-timers film ville kræve næsten (eller mere end) en terabyte diskplads. Men dette er, hvordan AI laver film† – ved at dedikere lige så mange ressourcer og tokens til hvert enkelt billede, når det beregner, hvordan det skal formulere videoen.

Økonomi af Størrelse

Det nye arbejde, med titlen AdaCodec: En Prædictiv Visuel Codec til Video MLLMs, udgifter fulde visuelle tokens kun på reference-frames (I-frames), med alle mellem-billeder repræsenteret som ‘kompakte P-tokens’ – en paradigme, der tydeligt er taget fra den traditionelle kompression, der anvendes af historiske ‘virkelige verden’-video-codecs.

Efter denne interne kompression har fundet sted, kan genAI-videoen derefter komprimeres normalt, og i teorien er alle besparelser server-side:

Oversigt over AdaCodec. Venstre, videoer er inddelt i adaptive grupper af billeder, med fulde I-frames reserveret for øjeblikke, der er svære at forudsige, og mellem-billeder repræsenteret ved kompakt bevægelses- og restinformation. Højre, det resulterende system matcher eller overgår Qwen3-VL-8B på elleve benchmarks, opretholder højere lang-video-nøjagtighed på tværs af token-budgetter og reducerer respons-forsinkelse, mens det behandler væsentligt færre video-tokens. Kilde - https://arxiv.org/pdf/2606.02569

Oversigt over AdaCodec. Venstre, videoer er inddelt i adaptive grupper af billeder, med fulde I-frames reserveret for øjeblikke, der er svære at forudsige, og mellem-billeder repræsenteret ved kompakt bevægelses- og restinformation. Højre, det resulterende system matcher eller overgår Qwen3-VL-8B på elleve benchmarks, opretholder højere lang-video-nøjagtighed på tværs af token-budgetter og reducerer respons-forsinkelse, mens det behandler væsentligt færre video-tokens. Kilde

Besparelserne, ifølge rapporterede resultater fra tests for AdaCodec, er værd at forfølge; artiklen fastslår, at systemet overgik den umodificerede Qwen3-VL-8B-model på hver af de vigtigste benchmarks, mens det brugte samme mængde proceskraft; og matchede eller overgik denne models præstation efter at have reduceret video-tokens med omkring 86%.

Forfatterne fastslår*:

‘Vi drager inspiration fra prædictiv kodning, hvor et system transmitterer fejl fra en forudsigelse i stedet for den rå signal. Dette princip har biologisk grundlag: det visuelle system menes at kodificere forudsigelsesfejl, mismatchet mellem forventet og observeret input, i stedet for input selv.

‘Moderne video-codecs bruger samme rest-kodningsidé i ingeniørarbejde: reference-frames bærer fuld indhold, mens prædictive frames bærer bevægelses- og restsignaler i forhold til en reference.

‘Disse systemer har forskellige mål, men de deler samme betinget struktur: når nærliggende prøver er redundant, skal kanalen bære, hvad forudsigelsen ikke kan forklare.

‘Standard-codecs er dog optimeret til bitstrømme og menneske-tilgængelige rekonstruktion, ikke til visuelle tokens, der forbruges af en LLM. Vi genopbygger derfor denne mekanisme som en MLLM-grænseflade til video-forståelse.’

Det nye arbejde, skrevet af 11 forskere fra Shanghai Jiao Tong University, Shanghai Innovation Institute og JD.com, kommer med en tilhørende projekt-side, med udgivelse af kildekode lovede.

Metode

Som diskuteret, behandler systemet ikke hvert billede som et fuldt nyt billede, men søger efter, hvad der er ændret mellem ét billede og det næste. Til venstre i billedet nedenfor ser vi en lille region af det nuværende billede, der matcher den mest lignende region i et tidligere billede:

Schema-overblik for AdaCodec.

Schema-overblik for AdaCodec.

Afstanden mellem de to lokaliteter bliver en bevægelses-vektor, mens eventuelle visuelle forskelle bliver en rest, med disse kompakte beskrivelser erstatter behovet for at gemme et fuldt billede.

Til højre ser vi den resulterende information, der føres ind i AI-modellen: vigtige reference-frames behandles stadig som fulde billeder, men de mellem-liggende billeder repræsenteres af meget mindre bevægelses- og rest-tokens – åbenbart tillader modellen at beholde tilstrækkelig information til at parse videoen, mens den behandler betydeligt mindre visuel data.

En interessant udfordring er at afgøre, hvilke billeder fortjener at blive gemt i fuld udstrækning: traditionelle video-codecs placerer normalt reference-frames ved jævne interval, uanset om de er nødvendige eller ej. AdaCodec prøver i stedet at identificere de øjeblikke, der betyder mest.

For eksempel, overvej en scene, der hovedsageligt viser en statisk samtale mellem to personer i en lejlighed – og pludselig stormer en SWAT-enhed ind gennem vinduet. Øjeblikkeligt vil kamera-værne og antallet af redigeringsklip øge og kræve langt mere data, end en regulariseret reference-frame-interval vil give:

Sekvens af billeder, der viser en tom rum, to personer, der taler, en gruppe, der går ind gennem vinduet, de to personer, der bliver ført væk, og rummet, der er tomt igen. Strimen af mellem-billeder nedenfor viser samme begivenheder over en længere tidsramme, med valgte billeder fremhævet i blåt. En vandret skala med mærket

Dette er logikken bag variabel kompression (variabel bitrate) kompressionsmetoder, der analyserer kilde-video for sådanne ‘beskæftigede’ perioder og tildeler større data, hvor det er nødvendigt – på bekostning af tid og ressourcer.

I AdaCodec, hvis et billede kan forudsiges nøjagtigt fra nærliggende billeder, fortsætter systemet med at bruge kompakte bevægelses- og rest-tokens; hvis scenen ændrer sig væsentligt (f.eks. SWAT-eksemplet ovenfor eller noget mindre dramatisk), indsættes en fuld reference-frame. Dette tillader, at mere af den tilgængelige proces-budget kan bruges på vigtig visuel information i stedet for at fordeles jævnt over hele videoen.

Data og Tests

Under test, brugte forskerne den ovennævnte Qwen3-VL-8B som basis-modellen og evaluerede AdaCodec på elleve benchmarks, der dækker tre områder af video-forståelse: lang-video-præstation blev vurderet med MLVU, LongVideoBench og LVBench; temporal forståelse med TempCompass, MotionBench og TOMATO; og generel video-forståelse med Video-MME, MVBench, NExT-QA, PerceptionTest og EgoSchema.

Åbne kildemodelle, der blev testet, var InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; og Molmo2-O-7B.

GPT-5, Gemini og Claude-variationer vises i tabellen nedenfor kun som sammenlignings-baselines. CoPE-VideoLM-7B og ReMoRa-7B er tidligere video-sprog-modeller, der reducerer visuel-token-brug gennem codec-inspireret kompression, hvilket gør dem til de nærmeste direkte konkurrenter til AdaCodec:

Hovedresultater på elleve benchmarks, der dækker lang-video-forståelse, temporal forståelse og generel video-forståelse. Højere score indikerer bedre præstation. LVB = LongVideoBench; V-MME = Video-MME. Fed og underliniede værdier indikerer den højeste og næsthøjeste score blandt åbne kildemodeller. Score for lukkede kildemodeller blev taget fra officielle rapporter, hvor det var muligt, med manglende resultater hentet fra Molmo2 eller vurderet af forfatterne.

Hovedresultater på elleve benchmarks, der dækker lang-video-forståelse, temporal forståelse og generel video-forståelse. Højere score indikerer bedre præstation. LVB = LongVideoBench; V-MME = Video-MME. Fed og underliniede værdier indikerer den højeste og næsthøjeste score blandt åbne kildemodeller. Score for lukkede kildemodeller blev taget fra officielle rapporter, hvor det var muligt, med manglende resultater hentet fra Molmo2 eller vurderet af forfatterne.

For at sikre en fair sammenligning blev det samme antal visuelle tokens tildelt både AdaCodec og den standard Qwen3-VL-8B-system, hvilket tillader resultaterne at reflektere effektiviteten af kompressions-tilgangen, snarere end eventuelle forskelle i beregningsressourcer.

Ved den mest aggressive indstilling reducerede AdaCodec visuel-token-brug med omkring 86%, mens den stadig matchede eller let overgik baseline-systemet på lang-video-, temporal- og generel video-forståelse-opgaver.

Når de sparede tokens blev geninvesteret i at behandle flere video-frames, forbedredes præstationen over hele elleve lang-video-benchmarks og hele elleve temporal-benchmarks, med gevinster op til +5,4 point på LongVideoBench og +4,3 point på TOMATO, samt producerede nogle af de stærkeste åbne kilderesultater i studiet.

Konklusion

Selvom projekter af denne art normalt er rettet mod hyperskala-leverandører, er dette den type indsats, der vil være af interesse for både hobbyister og SME’er, som en del af en potentiel ny ‘offentlig askese’ omkring lokal, rationaliseret AI-udvikling.

I fællesskaber som r/stablediffusion er dette meget gamle nyheder, da hver større åben kilde-udgivelse, der ankommer der, regelmæssigt bliver torteret ind i en hyper-optimeret (GGUF, kvantificerede vægte osv.) version, der kan køre, med lidt tålmodighed, på lavere-end-graphic-kort.

Hvis ‘performative-scenen’ i denne tredje AI-opsving er virkelig forbi, og under antagelse af, at virksomheder vil blive frastødt af de sandende omkostninger ved inferens, kan initiativer som AdaCodec måske udgøre en del af en kommende ‘stor optimering’.

 

† Dette er ikke det samme som at rendre videoen ud til en brugervenlig format/fil-størrelse; det handler i stedet om den interne generering og samling af billeder, der finder sted inden i AI-modellen på inferens-tidspunktet.

* Min konvertering, inden for rimelighed, af forfatternes inline-citationer til hyperlinks.

Først udgivet torsdag, 4. juni 2026

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai