Unghiul lui Anderson

Provocarea subtitrării videourilor la mai mult de 1fps

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Trails in a basketball scene - source: https://www.youtube.com/watch?v=ORfjgE6n2Pc

Capacitatea sistemelor de învățare automată de a recunoaște evenimentele care au loc într-un videoclip este crucială pentru viitorul generării de videoclipuri bazate pe inteligență artificială, în special pentru că seturile de date video necesită subtitrări precise pentru a produce modele care respectă solicitările utilizatorului și nu exagerează halucinațiile.

Un exemplu de schemă de subtitrare din proiectul VidReCap de la Google. Sursă: https://sites.google.com/view/vidrecap

Un exemplu de schemă de subtitrare din proiectul VidReCap de la Google. Sursă: https://sites.google.com/view/vidrecap

Subtitrarea manuală a numărului necesar de videoclipuri pentru seturi de date de antrenare eficiente este o perspectivă incredibilă. Deși este posibil să se antreneze sisteme AI pentru a subtitra automat videoclipuri, sunt necesare multe exemple create de oameni ca adevăruri de referință, pentru varietate și acoperire.

Mai important, aproape toate modelele actuale de subtitrare a videoclipurilor bazate pe inteligență artificială funcționează la 1fps, care nu este o rată de captură suficient de densă pentru a discerne variații în multe scenarii: schimbări ale micro-expresiilor pentru sistemele de recunoaștere a emoțiilor; evenimente rapide în sporturi cu viteze mari, cum ar fi baschetul; mișcări violente; tăieturi rapide în filme dramatice, unde sistemele precum PySceneDetect pot să nu identifice acestea (sau nu sunt utilizate); și multe alte scenarii în care ferestra de atenție trebuie să fie mult mai intensă.

Apăsați pentru a reda. Acțiune rapidă, dar cu schimbări de viață, într-unul dintre cele mai lente sporturi din lume, când Alex Higgins câștigă campionatul mondial împotriva lui Ray Reardon în 1982. Sursă: https://www.youtube.com/watch?v=_1PuqKno_Ok

Mută-te repede și sparge logica

Această rată scăzută este standardul pentru diverse motive logistice. În primul rând, subtitrarea videoclipurilor este o activitate care consumă multe resurse, indiferent dacă sistemul studiază un cadru secvențial la un moment dat sau utilizează diverse metode pentru a cohera semantic o serie de cadre într-o secvență de subtitrare interpretabilă. În orice caz, fereastra de context este inevitabil limitată de constrângerile hardware.

Un alt motiv pentru care 1fps este standardul actual este că videoclipurile nu sunt, în general, pline de evenimente rapide; prin urmare, este redundant să se acorde 300 de cadre cu o masă de biliard statică aceeași atenție ca și momentul în care o bilă neagră este lovită și câștigă campionatul (a se vedea exemplul de mai sus).

Este posibil să se utilizeze indicii secundare mai largi pentru a identifica momente cheie într-un videoclip sportiv, cum ar fi reacția prelungită a mulțimii la un slam-dunk rapid într-un meci de baschet. Cu toate acestea, astfel de indicii pot apărea din alte motive (cum ar fi accidentări ale jucătorilor) și nu pot fi considerate fiabile. Acesta este un exemplu de modul în care o set de date video etichetată incorect poate duce la un model de videoclip generativ care halucinează sau interpretează greșit instrucțiunile, adică, deoarece modelul ar putea arăta o accidentare a jucătorului atunci când i s-a cerut să genereze un slam-dunk (deoarece “indicele secundar” al agitației mulțimii nu a fost exclusiv pentru un anumit tip de eveniment).

Acesta este, în multe feluri, un “problema bugetară” și, în alte feluri, o problemă procedurală. Cadrele cheie rare au funcționat până acum pe principiul că pot captura eficient informații esențiale, dar acest lucru este mai eficient pentru stabilirea genului și a altor aspecte ale subiectului videoclipului, deoarece dovezi, în acest caz, persistă pe multiple cadre.

F-16

Un nou articol din China oferă o soluție, sub forma primului model de limbaj multimodal mare (MLLM, sau pur și simplu LLM) care poate analiza videoclipuri la 16fps în loc de 1fps standard, evitând totodată capcanele majore ale creșterii ratei de analiză.

În teste, autorii susțin că noul sistem, intitulat F-16, depășește modelele proprietare de ultimă generație, cum ar fi GPT-4o și Google’s Gemini-1.5 pro. Deși alte modele actuale au putut să egaleze sau să depășească rezultatele F-16 în teste, modelele concurente au fost mult mai mari și mai greu de manevrat.

Deși F-16 a fost antrenat pe unele hardware serioase (așa cum vom examina în curând), inferența este, de obicei, mult mai puțin solicitantă decât antrenamentul. Prin urmare, putem spera că codul (promis pentru o lansare în viitorul apropiat) va fi capabil să ruleze pe GPU-uri domestice de nivel mediu sau ridicat.

Ce este necesar pentru vitalitatea scenei hobbyiștilor (și care include, de obicei, scena profesională VFX) este un model de subtitrare a videoclipurilor de acest fel care poate funcționa, poate cuantificat, pe sistemele consumatorilor, astfel încât întreaga scenă a videoclipurilor generative să nu migreze către sisteme comerciale bazate pe API sau să forțeze consumatorii să conecteze cadrele locale la servicii comerciale de GPU online.

Dincolo de scalare

Autorii observă că acest tip de abordare este o alternativă practică la scalarea seturilor de date. Putem infera, de asemenea, că, dacă am arunca mai multe date la problema, acesta ar fi totuși tipul de abordare care ar putea fi preferat, deoarece noul sistem distinge evenimente într-un mod mai granular.

Ei afirmă:

‘Eșantionarea cu rată de cadre scăzută poate duce la pierderea informațiilor vizuale critice, în special în videoclipuri cu scene rapide, detalii complexe sau mișcări rapide. În plus, dacă cadrele cheie sunt pierdute, iar modelul este antrenat pe etichete care se bazează pe informații despre cadrele cheie, poate să aibă dificultăți în a-și alinia predicțiile cu conținutul așteptat, ceea ce poate duce la halucinații și la o performanță degradată…

‘… F-16 realizează o performanță fără precedent în înțelegerea generală a videoclipurilor printre modele de aceeași mărime și demonstrează un avantaj clar în înțelegerea videoclipurilor cu rată de cadre ridicată, depășind modelele comerciale, cum ar fi GPT-4o. Această lucrare deschide noi direcții pentru avansarea înțelegerii videoclipurilor cu rată de cadre ridicată în cercetarea LLM multimodală.’

Noul articol, intitulat Îmbunătățirea înțelegerii videoclipurilor LLM cu 16 cadre pe secundă, provine de la opt autori de la Universitatea Tsinghua și ByteDance.

Metodă

Deoarece cadrele consecutive conțin adesea informații redundante, F-16 aplică un aliniator cu rată de cadre ridicată pentru a comprima și codifica detalii de mișcare cheie, păstrând în același timp semantica vizuală. Fiecare cadru este procesat mai întâi de un codator de imagini preantrenat, care extrage reprezentări de caracteristici înainte de a fi transmis unui aliniator bazat pe Unități de eroare liniară Gaussiană (GELU).

Arhitectura F-16 procesează videoclipuri la 16 FPS, capturând mai multe cadre decât modelele cu rată de cadre scăzută, iar aliniatorul său cu rată de cadre ridicată păstrează semantica vizuală, codificând în același timp dinamică mișcării fără a adăuga tokeni vizuali suplimentari. Sursă: https://arxiv.org/pdf/2503.13956

Arhitectura F-16 procesează videoclipuri la 16 FPS, capturând mai multe cadre decât modelele cu rată de cadre scăzută, iar aliniatorul său cu rată de cadre ridicată păstrează semantica vizuală, codificând în același timp dinamică mișcării fără a adăuga tokeni vizuali suplimentari. Sursă: https://arxiv.org/pdf/2503.13956

Pentru a gestiona eficient numărul crescut de cadre, F-16 grupează cadrele în ferestre de procesare mici, combinând caracteristici vizuale utilizând un Perceptron Multistrat (MLP) cu trei straturi, ajutând la păstrarea doar a celor mai relevante detalii de mișcare și reducerea duplicării inutile, în timp ce se păstrează fluxul temporal al acțiunilor. Un strat de max-pooling spațial comprimă în continuare numărul de tokeni, menținând costurile computaționale în limite.

Tokenii de videoclip procesați sunt apoi introduceți în Qwen2-7B LLM, care generează răspunsuri textuale bazate pe caracteristicile vizuale extrase și o prompt utilizator dat.

Prin structurarea intrării de videoclip în acest mod, F-16 permite, susțin autorii, o recunoaștere a evenimentelor mai precisă în scene dinamice, menținând în același timp eficiența.

Versiunea scurtă

F-16 extinde un model LLM de imagine preantrenat, LLaVA-OneVision, pentru a procesa videoclipuri prin transformarea pipeline-ului său de intrare vizuală. În timp ce modelele LLM de imagine standard procesează cadre izolate, aliniatorul F-16 cu rată de cadre ridicată reformatează multiple cadre într-o formă pe care modelul o poate procesa mai eficient; această abordare evită suprasolicitarea sistemului cu informații redundante, păstrând în același timp indicii de mișcare cheie necesari pentru o înțelegere precisă a videoclipurilor.

Pentru a asigura compatibilitatea cu baza sa de imagine, F-16 reutilizează parametrii preantrenați prin restructurarea aliniatorului în sub-matrici. Acestă abordare îi permite să integreze cunoștințe din modelele cu cadre individuale, adaptându-se în același timp la intrările de videoclip secvențiale.

Aliniatorul comprimă mai întâi secvențele de cadre într-un format optimizat pentru LLM, păstrând caracteristicile cele mai informative, în timp ce elimină detalii inutile. Proiectarea arhitecturii permite sistemului să proceseze videoclipuri cu rată de cadre ridicată, menținând în același timp cerințele computaționale sub control, ceea ce autorii consideră a fi o dovadă că scalarea nu este singura (sau cea mai bună) cale înainte pentru subtitrarea videoclipurilor.

Variația ritmului

Deoarece procesarea videoclipurilor la 16 FPS îmbunătățește înțelegerea mișcării, dar crește costul computațional, în special în timpul inferenței, F-16 introduce o decodificare cu rată de cadre variabilă, permițându-i să ajusteze rata de cadre dinamic, fără a necesita reantrenarea.

Aliniatorii de cadre individuale și cu rată de cadre ridicată disponibili pentru F-16.

Aliniatorii de cadre individuale și cu rată de cadre ridicată disponibili pentru F-16.

Această flexibilitate permite modelului să funcționeze eficient la rate de cadre mai mici atunci când precizia ridicată nu este necesară și reduce suprasarcina computațională.

În timpul testării, atunci când se selectează o rată de cadre mai mică, F-16 reutilizează parametrii aliniatorului preantrenați, repetând cadrele de intrare pentru a se potrivi cu dimensiunile așteptate. Acest lucru asigură că modelul poate procesa în continuare videoclipuri eficient, fără a modifica arhitectura sa.

În contrast cu eșantionarea simplă (de exemplu, pur și simplu eliminarea cadrelor), care riscă să piardă detalii de mișcare critice, această metodă păstrează reprezentările de mișcare învățate de aliniator, menținând acuratețea chiar și la rate de cadre reduse. Pentru înțelegerea generală a videoclipurilor, o setare cu rată de cadre mai mică poate accelera inferența fără a compromite semnificativ performanța, în timp ce analiza mișcării rapide poate încă să utilizeze capacitatea completă de 16 FPS.

Date și teste

Construit pe baza Qwen2-7B, FP-16 extinde LLaVA-OneVision utilizând SigLIP ca codator de imagine. Cu cadre de videoclip eșantionate la 16 FPS, până la 1.760 de cadre pot fi obținute din fiecare videoclip. Pentru clipuri de videoclip mai lungi, cadrele au fost eșantionate uniform (adică, mai rar).

Pentru antrenament, F-16 a utilizat aceleași seturi de date video generale ca și LLaVA-Video, incluzând LLaVA-Video-178K, NExT-QA, ActivityNet-QA și PerceptionTest.

F-16 a fost, de asemenea, ajustat fin pe seturile de date sportive cu rată de cadre ridicată FineGym, Diving48 și SoccerNet. Autorii au, de asemenea, creat o colecție de 276 de meciuri de baschet NBA jucate între 13 și 25 noiembrie 2024, axându-se pe determinarea dacă un aruncător a fost reușit, o sarcină care necesită procesarea la rată de cadre ridicată.

Modelul a fost evaluat utilizând setul de test NSVA, cu performanța măsurată prin scor F1.

Modelele de gimnastică și înot au fost evaluate pe baza acurateței de recunoaștere a evenimentelor, în timp ce modelele de fotbal și baschet au urmărit pase și rezultatele aruncătorilor.

Modelul a fost antrenat timp de 1 epocă utilizând 128 GPU-uri NVIDIA H100 (și la o cantitate standard de 80GB de VRAM pe GPU, ceea ce a necesitat utilizarea a 10,24 terabytes de memorie GPU; chiar și după standardele recente, aceasta este cea mai bine echipată cluster de GPU pe care am întâlnit-o în urmărirea literaturii de cercetare în domeniul viziunii computaționale). O rată de învățare de 2×10⁻⁵ a fost utilizată în timpul antrenamentului.

În plus, un LoRA a fost ajustat fin pe date sportive utilizând adaptori LoRA cu 64 de GPU-uri timp de 5 epoci. Aici, doar LLM a fost antrenat, lăsând codatorul de imagine înghețat.

Modelele concurente testate în prima rundă pentru “înțelegerea generală a videoclipurilor” au fost GPT-4o; Gemini-1.5-Pro; Qwen2-VL-7B; VideoLLaMA2-7B; VideoChat2-HD-7B; LLaVA-OV-7B; MiniCPM-V2.6-8B; LLaVA-Video-7B; și NVILA-7B;

Modelele au fost evaluate pe Video-MME; VideoVista; TemporalBench; MotionBench; Next-QA; MLVU; și LongVideoBench.

Comparație a rezultatelor videoclipurilor între modele, arătând limitele de FPS și performanța pe multiple benchmark-uri. F-16 realizează o performanță fără precedent printre modelele de 7B pe Video-MME, NQA, TPB și MB, rivalizând cu modelele proprietare, cum ar fi GPT-4o și Gemini-1.5-Pro.

Comparație a rezultatelor videoclipurilor între modele, arătând limitele de FPS și performanța pe multiple benchmark-uri. F-16 realizează o performanță fără precedent printre modelele de 7B pe Video-MME, NQA, TPB și MB, rivalizând cu modelele proprietare, cum ar fi GPT-4o și Gemini-1.5-Pro.

Dintre aceste rezultate, autorii afirmă:

‘Pe seturile de date Video-MME Short, Medium și NeXT-QA—fiecare proiectat pentru înțelegerea videoclipurilor scurte—modelul nostru depășește modelul 7B precedent cu 3,2%, 1,0% și 0,9% în acuratețe, subliniind performanța sa puternică pe videoclipuri scurte.

‘Pentru benchmark-urile care evaluează înțelegerea videoclipurilor lungi, cum ar fi Video-MME Long, LongVideoBench și MLVU, provocarea este mai mare din cauza eșantionării mai rare a cadrelor, ceea ce face ca cadrele din fereastra de procesare să prezinte variații mai semnificative.

‘Acest lucru crește dificultatea pentru aliniatorul de modality de a codifica eficient schimbările temporale în reprezentarea limitată de tokeni. Ca rezultat, F-16 experimentează o scădere ușoară a performanței în comparație cu [LLaVA-Video-7B], care este antrenat pe același set de date video.’

Performanța de înaltă rată de cadre a F-16, continuă autorii, a dus și la o îmbunătățire de 13,5% pe TemporalBench și o creștere de 2,5% pe MotionBench, comparativ cu modelele existente de 7B, și a realizat o performanță similară cu modelele comerciale, cum ar fi GPT-4o și Gemini-1.5-Pro.

Înțelegerea videoclipurilor sportive cu viteză ridicată

F-16 a fost testat pe seturile de date FineGym, Diving48, SoccerNet și NBA pentru a evalua capacitatea sa de a înțelege acțiuni sportive cu viteză ridicată.

Utilizând 10.000 de clipuri de baschet NBA etichetate manual, antrenamentul s-a concentrat pe mișcarea bilei și acțiunile jucătorilor, și pe capacitatea modelului de a determina corect dacă un aruncător a fost reușit, utilizând setul de test NSVA evaluat prin scor F1.

Rezultatele analizei videoclipurilor sportive cu viteză ridicată. F-16 cu aliniatorul de rată de cadre ridicată a performant mai bine decât omologul său cu rată de cadre scăzută în toate sarcinile sportive. GPT-4o și Gemini-1.5-Pro au fost, de asemenea, evaluate pe NBA și SoccerNet QA, unde nu a fost necesară cunoașterea din domeniu.

Rezultatele analizei videoclipurilor sportive cu viteză ridicată. F-16 cu aliniatorul de rată de cadre ridicată a performant mai bine decât omologul său cu rată de cadre scăzută în toate sarcinile sportive. GPT-4o și Gemini-1.5-Pro au fost, de asemenea, evaluate pe NBA și SoccerNet QA, unde nu a fost necesară cunoașterea din domeniu.

Pe FineGym, care măsoară recunoașterea acțiunilor de gimnastică, F-16 a performant cu 13,8% mai bine decât modelul 7B precedent, demonstrând o înțelegere îmbunătățită a mișcării fine.

Diving48 a necesitat identificarea unor secvențe de mișcare complexe, cum ar fi faza de decolare, somersault, twist și zbor, și F-16 a arătat o acuratețe mai mare în recunoașterea acestor tranziții.

Pentru SoccerNet, modelul a analizat clipuri de 10 secunde, identificând pase și rezultatele aruncătorilor, și a arătat o îmbunătățire față de modelele 7B existente, indicând că o rată de cadre mai mare contribuie la urmărirea mișcărilor mici și rapide.

În setul de date NBA, capacitatea F-16 de a determina rezultatele aruncătorilor a fost aproape de acuratețea modelelor mai mari, cum ar fi GPT-4o și Gemini-1.5-Pro, sugerând în continuare că o rată de cadre mai mare îmbunătățește capacitatea sa de a procesa mișcări dinamice.

Rate de cadre variabile

F-16 a fost testat la diferite rate de cadre pentru a măsura adaptabilitatea sa. În loc de reantrenare, a gestionat rate de cadre mai mici prin repetarea cadrelor pentru a se potrivi cu structura de intrare a aliniatorului. Această abordare a păstrat mai multă performanță decât simpla eliminare a cadrelor (care este predispusă la pierderea acurateței).

Rezultatele indică faptul că, deși reducerea ratei de cadre a avut un anumit impact asupra recunoașterii mișcării, F-16 a continuat să depășească modelele cu rată de cadre scăzută și a menținut rezultate puternice, chiar și sub 16 FPS.

Stânga, consumul de timp al diferitelor module F-16 în timpul inferenței, măsurat pe 300 de videoclipuri din setul Video-MME Long la diferite rate de cadre de test și lungimi de secvență. Dreapta, o comparație între performanța Video-MME pentru modele antrenate și testate la diferite rate de cadre. Linia solidă reprezintă modele antrenate și testate la aceeași rată de cadre, în timp ce linia punctată arată performanța atunci când un model antrenat la 16 FPS este testat la o rată de cadre mai mică.

Stânga, consumul de timp al diferitelor module F-16 în timpul inferenței, măsurat pe 300 de videoclipuri din setul Video-MME Long la diferite rate de cadre de test și lungimi de secvență. Dreapta, o comparație între performanța Video-MME pentru modele antrenate și testate la diferite rate de cadre. Linia solidă reprezintă modele antrenate și testate la aceeași rată de cadre, în timp ce linia punctată arată performanța atunci când un model antrenat la 16 FPS este testat la o rată de cadre mai mică.

Procesarea F-16 la o rată de cadre ridicată a crescut cerințele computaționale, deși aliniatorul său a ajutat la gestionarea acestor costuri prin comprimarea tokenilor vizuali redundanți.

Modelul a necesitat mai multe FLOP-uri pe videoclip decât modelele cu rată de cadre scăzută, dar a realizat și o acuratețe mai bună pe token, sugerând că strategiile sale de selecție a cadrelor și comprimare a tokenilor au contribuit la compensarea calculului suplimentar.

Concluzie

Este dificil de a subestima fie importanța, fie provocările acestei ramuri specifice de cercetare – în special în acest an, care se anunță a fi anul deosebit de important pentru videoclipurile generative, care evidențiază neajunsurile curățirii seturilor de date video și calității subtitrărilor în relief.

Ar trebui, de asemenea, subliniat că provocările implicate în obținerea descrierilor precise ale detaliilor interne ale videoclipurilor nu pot fi rezolvate exclusiv prin aruncarea de VRAM, timp sau spațiu pe disc la problema. Metoda prin care evenimentele sunt izolate/extractate din videoclipuri lungi și plictisitoare (cum ar fi clipurile de golf sau snooker) va beneficia de o reevaluare a abordărilor semantice și mecanismelor actuale care domină soluțiile de ultimă generație – deoarece unele dintre aceste limitări au fost stabilite în timpuri mai sărace în resurse.

(întâmplător, chiar dacă 16fps pare a fi o rată de cadre scăzută pentru 2025, este interesant de remarcat că aceasta este, de asemenea, viteza de antrenament nativă a clipurilor de videoclip utilizate în modelul de videoclip generativ foarte popular Wan 2.1, și viteza la care funcționează cu cele mai puține probleme. Sperăm că scena de cercetare va păstra o privire atentă asupra posibilei “entropii standard” aici; uneori, constrângerile învechite pot perpetua standardele viitoare)

 

Publicat pentru prima dată miercuri, 19 martie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai