Unghiul lui Anderson

Un codec video pentru imagini generate de IA

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

Pe măsură ce era “all-you-can-eat” a IA se încheie, o abordare economică nouă pentru generarea de video IA promite economii notabile în tokeni și timp.

 

Costul real al inferenței IA aduce o notă de sobrietate la ritmul actual al revoluției IA, cu un interes crescut în raționalizarea costului învățării mașinilor. În afara potențialului de a aduce IA acasă și a creșterii generale a IA private, rutinele de învățare a mașinilor care consumă multă VRAM și resurse vor avea nevoie și de optimizare.

Generarea de video este, probabil, cel mai mare vinovat în acest sens. Dacă ați recomprimat vreodată un film sau l-ați exportat dintr-un program de editare video, știți deja taxa pe care o impune această sarcină asupra hardware-ului dvs. – consumând RAM și cicli de CPU și, adesea, blocând mașina pentru orice altă utilizare, cu excepția cazului în care se iau măsuri pentru a limita impactul algoritmului de compresie asupra computerului gazdă.

Prin urmare, nu trebuie decât să vă imaginați amploarea în care creșterea video-ului IA reia această procedură “înfometată de putere” în centrele de date de pe glob. La acea scară de operare, cele mai mici câștiguri devin imediat semnificative în calculul agregat.

În cadru

Având în vedere acest lucru, o nouă ofertă de cercetare de la Shanghai, în colaborare cu JD.com (JD ), propune un codec video care nu este destinat procesului de renderizare (procesul de comprimare a cadrelor brute și mari într-un fișier video de dimensiune mai mică), ci procesului real de generare a video-ului IA.

Un codec video normal funcționează prin stocarea nu a fiecărui cadru ca imagine completă, ci prin crearea unui număr mai mic de imagini complete, numite cadre I, și apoi stocarea schimbărilor dintre cadre.

De exemplu, dacă o persoană se mișcă ușor într-un video, codec-ul înregistrează doar părțile cadrelor care înregistrează această schimbare, și nu rescrie întreaga scenă. Acestea sunt cadre P, care sunt derivate din cadrele anterioare, și cadre B, care pot anticipa, de asemenea, informații din cadrele viitoare:

Anatomia unui codec video: rândul superior arată cadrele în timp, etichetate I, P și B, cu cadrele I stocate în culori complete și cadrele P și B afișate estompate pentru a indica reconstrucția; săgețile indică dacă cadrele utilizează cadrele anterioare, cadrele viitoare sau ambele; panourile inferioare prezintă un cadru stocat complet (I, stânga), un cadru construit dintr-un cadru anterior (P, al doilea din stânga) și un cadru construit din cadrele anterioare și viitoare (B, dreapta).

Anatomia unui codec video: rândul superior arată cadrele în timp, etichetate I, P și B, cu cadrele I stocate în culori complete și cadrele P și B afișate estompate pentru a indica reconstrucția; săgețile indică dacă cadrele utilizează cadrele anterioare, cadrele viitoare sau ambele; panourile inferioare prezintă un cadru stocat complet (I, stânga), un cadru construit dintr-un cadru anterior (P, al doilea din stânga) și un cadru construit din cadrele anterioare și viitoare (B, dreapta).

Acest reutilizare a informațiilor din apropiere este motivul pentru care fișierele video rămân mici, cu majoritatea cadrelor care funcționează nu ca imagini noi, ci ca instrucțiuni care descriu cum s-a schimbat cadru anterior. Prin urmare, cadrele I constituie imagini “grase”, care consumă spațiu și nu sunt comprimate (sau comprimate minim), în timp ce cadrele dintre ele constituie doar diferența dintre cadrele I (și între ele).

Când fiecare cadru este o imagine completă și necomprimată, filmul nu are comprimare. Salvarea unui film în acest mod, ca video necomprimat, ar necesita aproximativ un terabyte de spațiu pe disc pentru un film de 2 ore. Și totuși, acesta este modul în care IA creează filme – dedicând resurse și tokeni egali pentru fiecare cadru, atunci când calculează cum să formuleze video-ul.

Economia de scară

Noua lucrare, intitulată AdaCodec: Un codec vizual predictiv pentru MLLM-uri video, cheltuiește tokeni vizuali compleți exclusiv pe cadre de referință (cadre I), cu toate cadrele interstițiale reprezentate ca “tokeni P compacți” – un paradigma evident preluată din compresia tradițională utilizată de codec-urile video “reale”.

După ce această compresie internă a avut loc, video-ul IA poate fi comprimat în mod normal, iar, în teorie, toate economiile sunt de partea serverului:

Prezentare generală a AdaCodec. Stânga, videourile sunt împărțite în grupuri adaptive de imagini, cu cadre I complete rezervate pentru momente care sunt greu de prezis și cadre P intermediare reprezentate utilizând informații compacte de mișcare și reziduale. Dreapta, sistemul rezultat se potrivește sau depășește Qwen3-VL-8B pe unsprezece benchmark-uri, menține o acuratețe mai mare a videourilor lungi pe bugete de tokeni și reduce latența de răspuns, procesând în același timp mai puțini tokeni video.

Prezentare generală a AdaCodec. Stânga, videourile sunt împărțite în grupuri adaptive de imagini, cu cadre I complete rezervate pentru momente care sunt greu de prezis și cadre P intermediare reprezentate utilizând informații compacte de mișcare și reziduale. Dreapta, sistemul rezultat se potrivește sau depășește Qwen3-VL-8B pe unsprezece benchmark-uri, menține o acuratețe mai mare a videourilor lungi pe bugete de tokeni și reduce latența de răspuns, procesând în același timp mai puțini tokeni video. Sursă

Economia, conform rezultatelor raportate din testele pentru AdaCodec, este demnă de urmat; articolul afirmă că sistemul a depășit modelul nemodificat Qwen3-VL-8B pe toate principalele benchmark-uri, utilizând aceeași cantitate de procesare; și a egalat sau a depășit performanța acelui model după reducerea tokenilor video cu aproximativ 86%.

Autorii afirmă*:

‘Ne inspirăm din codarea predictivă, unde un sistem transmite erori de la o previziune, mai degrabă decât semnalul brut. Acest principiu are o bază biologică: sistemul vizual este considerat a codifica erorile de previziune, discrepanța dintre intrarea anticipată și observată, mai degrabă decât intrarea însăși.

‘Codec-urile video moderne utilizează aceeași idee de codare reziduală în inginerie: cadrele de referință conțin conținut complet, în timp ce cadrele predictive conțin semnale de mișcare și reziduale relative unei referințe.

‘Aceste sisteme au obiective diferite, dar împărtășesc aceeași structură condiționată: atunci când mostrele din apropiere sunt redundante, canalul ar trebui să transporte ceea ce previziunea nu reușește să explice.

‘Codec-urile standard, totuși, optimizează pentru fluxuri de biți și reconstrucție vizibilă pentru oameni, nu pentru tokeni vizuali consumați de un LLM. Prin urmare, redesenăm acest mecanism ca o interfață MLLM pentru înțelegerea video.’

Noua lucrare, scrisă de 11 cercetători de la Universitatea Jiao Tong din Shanghai, Institutul de Inovare Shanghai și JD.com, vine cu o pagină de proiect asociată, cu promisiunea de a lansa codul sursă.

Metodă

Așa cum s-a discutat, în loc de a trata fiecare cadru ca o imagine complet nouă, sistemul caută ce s-a schimbat între un cadru și următorul. În imaginea de mai jos, pe stânga, vedem o mică regiune a cadrelor actuale care se potrivește cu cea mai asemănătoare regiune dintr-un cadru anterior:

Prezentare generală a schemei pentru AdaCodec.

Prezentare generală a schemei pentru AdaCodec.

Distanța dintre cele două locații devine un vector de mișcare, în timp ce orice diferențe vizuale rămase devin o reziduă, aceste descrieri compacte înlocuind nevoia de a stoca o imagine completă.

Pe dreapta, vedem informațiile rezultate introduse în modelul IA: cadrele de referință importante sunt încă procesate ca imagini complete, dar cadrele intermediare sunt reprezentate de tokeni mișcare și reziduă mult mai mici – aparent permițând modelului să păstreze suficiente informații pentru a analiza video-ul, în timp ce procesează mai puține date vizuale.

O provocare interesantă este decizia cu privire la care cadre merită să fie stocate în întregime: codec-urile video tradiționale plasează, de obicei, cadrele de referință la intervale regulate, indiferent dacă sunt necesare sau nu. AdaCodec, în schimb, încearcă să identifice momentele care contează cel mai mult.

De exemplu, considerați o scenă care prezintă, în mare parte, o conversație statică între două persoane într-un apartament – și, brusc, o echipă SWAT intră prin fereastra apartamentului. Immediat, vederile camerei și numărul de tăieturi de editare vor crește și vor necesita mult mai multe date decât ar putea oferi un interval regulat de cadre de referință:

Secvență de cadre care arată o cameră goală, două persoane care vorbesc, un grup care intră prin fereastra apartamentului, cele două persoane care sunt escortate afară și camera goală din nou. Benzi de cadre intermediare de mai jos arată aceleași evenimente pe o perioadă mai lungă de timp, cu cadre selectate evidențiate în albastru. O scară orizontală etichetată

Acesta este logicul din spatele metodelor de compresie cu debit variabil, care analizează video-ul sursă pentru perioade “aglomerate” și alocă mai multe date acolo unde sunt necesare – la un cost nu prea mic de timp și resurse.

În AdaCodec, dacă un cadru poate fi prezis cu acuratețe din cadrele din apropiere, sistemul continuă să utilizeze tokeni compacți de mișcare și reziduă; dacă scena se schimbă substanțial (de exemplu, exemplul echipajului SWAT de mai sus, sau ceva mai puțin dramatic), se introduce un cadru de referință complet. Acest lucru permite ca mai mult din bugetul disponibil să fie cheltuit pe informații vizuale importante, în loc de a fi distribuit uniform pe întregul video.

Date și teste

În testele efectuate, cercetătorii au utilizat Qwen3-VL-8B ca model de bază și au evaluat AdaCodec pe unsprezece benchmark-uri care acoperă trei domenii de înțelegere a video-ului: performanța video-ului lung a fost evaluată cu MLVU, LongVideoBench și LVBench; înțelegerea temporală cu TempCompass, MotionBench și TOMATO; și înțelegerea generală a video-ului cu Video-MME, MVBench, NExT-QA, PerceptionTest și EgoSchema.

Modelele deschise testate au fost InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B și Molmo2-O-7B.

Modelele GPT-5, Gemini și Claude apar în tabelul de mai jos doar ca linii de bază pentru comparație. CoPE-VideoLM-7B și ReMoRa-7B sunt modele de limbaj video mai vechi care reduc utilizarea tokenilor vizuali prin compresie inspirată de codec, făcându-le competitori direcți ai AdaCodec:

Rezultate principale pe unsprezece benchmark-uri care acoperă înțelegerea video-ului lung, raționamentul temporal și înțelegerea generală a video-ului. Scoruri mai mari indică o performanță mai bună. LVB = LongVideoBench; V-MME = Video-MME. Valorile subliniate și încercuite indică cele mai mari și cele mai mici scoruri printre modelele deschise. Scorurile pentru modelele închise au fost luate din rapoartele oficiale, acolo unde au fost disponibile, cu rezultate lipsă preluate din Molmo2 sau evaluate de autori.

Rezultate principale pe unsprezece benchmark-uri care acoperă înțelegerea video-ului lung, raționamentul temporal și înțelegerea generală a video-ului. Scoruri mai mari indică o performanță mai bună. LVB = LongVideoBench; V-MME = Video-MME. Valorile subliniate și încercuite indică cele mai mari și cele mai mici scoruri printre modelele deschise. Scorurile pentru modelele închise au fost luate din rapoartele oficiale, acolo unde au fost disponibile, cu rezultate lipsă preluate din Molmo2 sau evaluate de autori.

Pentru a asigura o comparație corectă, același număr de tokeni vizuali a fost alocat atât pentru AdaCodec, cât și pentru sistemul standard Qwen3-VL-8B, permițând rezultatelor să reflecte eficacitatea abordării de compresie, mai degrabă decât orice diferențe în resursele de calcul.

La setarea cea mai agresivă, AdaCodec a redus utilizarea tokenilor vizuali cu aproximativ 86%, în timp ce a egalat sau a depășit ușor sistemul de bază pe sarcinile de înțelegere a video-ului lung, temporal și general.

Când tokenii economisiți au fost reinvestiți în procesarea a mai multe cadre video, performanța a fost îmbunătățită pe toate benchmark-urile de video lung și toate benchmark-urile temporale, cu câștiguri care ajung la +5,4 puncte pe LongVideoBench și +4,3 puncte pe TOMATO, producând, de asemenea, unele dintre cele mai puternice rezultate deschise din studiu.

Concluzie

Deși proiectele de acest fel sunt, de obicei, destinate furnizorilor de hiperscală, acesta este genul de efort care va fi de interes și pentru hobiști și IMM-uri, ca parte a unei noi “ascetism public” în jurul implementării locale și raționalizate a IA.

În comunități precum r/stablediffusion, aceasta este vechea știre, deoarece fiecare lansare importantă de sursă deschisă care ajunge acolo este regulat “torturată” într-o versiune hiper-optimizată (GGUF, cântărire cuantică, etc.) care poate rula, cu răbdare, pe plăci grafice de nivel inferior.

Dacă “scena de performanță” a acestei a treia avânturi a IA este, într-adevăr, terminată și, presupunând că corporațiile vor fi respinse de costurile reale ale inferenței, atunci inițiative precum AdaCodec pot face parte dintr-o “optimizare grandioasă” care urmează.

 

Acest lucru nu este același cu renderizarea video-ului într-un format utilizator/pentru dimensiunea fișierului; mai degrabă, se ocupă de generarea internă și de colectarea cadrelor care are loc în interiorul modelului IA la momentul inferenței.

* Conversia mea, în limite rezonabile, a citatelor inline ale autorilor în legături hipertext.

Publicat pentru prima dată joi, 4 iunie 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai