Unghiul lui Anderson
Generarea de videoclipuri cu inteligență artificială mai bună prin rearanjarea cadrelor în timpul antrenamentului

O nouă lucrare apărută săptămâna aceasta pe Arxiv abordează o problemă cu care oricine care a adoptat generatorul de videoclipuri Hunyuan Video sau Wan 2.1 AI va fi confruntat până acum: aberrations temporale, unde procesul generativ are tendința de a accelera brusc, de a confunda, de a omite sau de a strica în alt mod momente cruciale dintr-un videoclip generat:
Click pentru a reda. Unele dintre glitch-urile temporale care devin familiare utilizatorilor noilor sisteme generative de videoclipuri, evidențiate în noua lucrare. La dreapta, efectul ameliorator al noii abordări FluxFlow. Sursă: https://haroldchen19.github.io/FluxFlow/
Videoclipul de mai sus conține extrase din videoclipuri de test de pe site-ul proiectului (atenționare: destul de haotic) pentru lucrarea. Putem vedea mai multe probleme din ce în ce mai familiare care sunt ameliorate de metoda autorilor (ilustrată în partea dreaptă a videoclipului), care este, în esență, o tehnică de prelucrare a datelor aplicabilă oricărei arhitecturi generative de videoclipuri.
În primul exemplu, care prezintă “doi copii jucându-se cu o minge”, generat de CogVideoX, vedem (în partea stângă a videoclipului de compilare de mai sus și în exemplul specific de mai jos) că generarea nativă sare rapid prin mai multe micro-mișcări esențiale, accelerând activitatea copiilor până la un “pitch” de desen animat. În schimb, aceeași bază de date și metodă oferă rezultate mai bune cu noua tehnică de prelucrare, denumită FluxFlow (în partea dreaptă a imaginii din videoclipul de mai jos):
Click pentru a reda.
În al doilea exemplu (folosind NOVA-0.6B) vedem că o mișcare centrală care implică un pisic a fost coruptă sau sub-echantionată într-un fel la stadiul de antrenament, astfel încât sistemul generativ devine “paralizat” și nu poate face ca subiectul să se miște:
Click pentru a reda.
Acest sindrom, în care mișcarea sau subiectul rămâne “blocat”, este una dintre cele mai frecvent raportate probleme ale HV și Wan, în diverse grupuri de imagine și sinteză de videoclipuri.
Unele dintre aceste probleme sunt legate de probleme de subtitrare a videoclipurilor în baza de date sursă, pe care le-am examinat în această săptămână; dar autorii noii lucrări își concentrează eforturile asupra calităților temporale ale datelor de antrenament, și fac un argument convingător că abordarea provocărilor din această perspectivă poate oferi rezultate utile.
După cum s-a menționat în articolul anterior despre subtitrarea videoclipurilor, anumite sporturi sunt deosebit de dificile de distilat în momente cheie, ceea ce înseamnă că evenimente critice (cum ar fi un slam-dunk) nu primesc atenția necesară în timpul antrenamentului:
Click pentru a reda.
În exemplul de mai sus, sistemul generativ nu știe cum să ajungă la următoarea etapă a mișcării și trece ilogic de la o poziție la alta, schimbând atitudinea și geometria jucătorului în proces.
Acestea sunt mișcări mari care s-au pierdut în antrenament – dar la fel de vulnerabile sunt mișcări mult mai mici, dar decisive, cum ar fi bătăile aripilor unei fluturi:
Click pentru a reda.
În contrast cu slam-dunk-ul, bătăile aripilor nu sunt un eveniment “rar”, ci mai degrabă un eveniment persistent și monoton. Cu toate acestea, consistența sa se pierde în procesul de eșantionare, deoarece mișcarea este atât de rapidă încât este foarte dificil de a o stabili temporal.
Acestea nu sunt probleme deosebit de noi, dar primesc o atenție sporită acum, când modelele generative de videoclipuri puternice sunt disponibile pentru entuziaști pentru instalare locală și generare gratuită.
Comunitățile de pe Reddit și Discord au tratat inițial aceste probleme ca fiind “legate de utilizator”. Acesta este un presupus înțelept, deoarece sistemele în cauză sunt foarte noi și minim documentate. Prin urmare, diverse experți au sugerat diverse remedii (și nu întotdeauna eficiente) pentru unele dintre glitch-urile documentate aici, cum ar fi modificarea setărilor în diverse componente ale fluxurilor de lucru ComfyUI pentru Hunyuan Video (HV) și Wan 2.1.
În unele cazuri, în loc de a produce mișcări rapide, atât HV, cât și Wan pot produce mișcări lente. Sugestiile de pe Reddit și ChatGPT (care se bazează în mare măsură pe Reddit) includ modificarea numărului de cadre în generarea solicitată sau reducerea drastică a ratei de cadre*.
Acesta este un lucru disperat; adevărul emergent este că nu știm încă cauza exactă sau remediu pentru aceste probleme; este clar că chinuirea setărilor de generare pentru a ocoli acestea (în special atunci când aceasta degradează calitatea ieșirii, de exemplu, cu o rată de cadre prea mică) este doar o soluție temporară, și este bine să vedem că scena de cercetare abordează aceste probleme emergente atât de repede.
Deci, pe lângă examinarea noastră din această săptămână a modului în care subtitrarea afectează antrenamentul, să aruncăm o privire asupra noii lucrări despre regularizarea temporală și asupra îmbunătățirilor pe care le-ar putea oferi scena actuală de generare de videoclipuri.
Idea centrală este destul de simplă și subtilă, și nu este mai puțin bună pentru asta; cu toate acestea, lucrarea este puțin umflată pentru a ajunge la cele opt pagini prescrise, și vom sări peste această umflare după cum este necesar.

Peștele în generarea nativă a cadrului VideoCrafter este static, în timp ce versiunea modificată de FluxFlow capturează schimbările necesare. Sursă: https://arxiv.org/pdf/2503.15417
Noua lucrare este intitulată Regularizarea temporală face generatorul dvs. de videoclipuri mai puternic, și provine de la opt cercetători de la Everlyn AI, Universitatea Științifică și Tehnică din Hong Kong (HKUST), Universitatea Centrală din Florida (UCF) și Universitatea din Hong Kong (HKU).
(la momentul scrierii, există unele probleme cu site-ul proiectului care însoțește lucrarea)
FluxFlow
Ideea centrală din spatele FluxFlow, noul schema de pre-antrenament al autorilor, este de a depăși problemele răspândite de licăriri și inconsistență temporală prin rearanjarea blocurilor și grupurilor de blocuri în ordinea cadrelor temporale în timp ce datele sursă sunt expuse procesului de antrenament:

Ideea centrală din spatele FluxFlow este de a muta blocuri și grupuri de blocuri în poziții neașteptate și netemporale, ca o formă de augmentare a datelor.
Lucrarea explică:
‘[Artificiile] provin dintr-o limitare fundamentală: în ciuda faptului că utilizează baze de date de mare scară, modelele actuale se bazează adesea pe tipare temporale simplificate în datele de antrenament (de exemplu, direcții de mers fixe sau tranziții de cadre repetitive) și nu învață dinamici temporale diverse și plauzibile.
‘Această problemă este exacerbate și mai mult de lipsa de augmentare temporală explicită în timpul antrenamentului, lăsând modelele predispuse la suprapunerea corelațiilor temporale spurii (de exemplu, „cadru #5 trebuie să urmeze #4”) și nu se generalizează pe scenarii de mișcare diverse.’
Majoritatea modelelor de generare de videoclipuri, explică autorii, încă se bazează prea mult pe sinteza de imagini, concentrându-se pe fidelitatea spațială și ignorând în mare măsură axa temporală. Deși tehnici precum decuparea, răsturnarea și jitter-ul de culoare au ajutat la îmbunătățirea calității imaginilor statice, nu sunt soluții adecvate atunci când sunt aplicate videoclipurilor, unde iluzia mișcării depinde de tranziții consistente între cadre.
Problemele rezultate includ texturi care licăresc, tăieturi jarring între cadre și tipare de mișcare repetitive sau prea simple.
Click pentru a reda.
Lucrarea susține că, deși unele modele – inclusiv Stable Video Diffusion și LlamaGen – compensează cu arhitecturi din ce în ce mai complexe sau constrângeri inginerizate, acestea vin la un cost în ceea ce privește computarea și flexibilitatea.
Deoarece augmentarea temporală a datelor s-a dovedit utilă în sarcinile de înțelegere a videoclipurilor (în cadrul unor cadre precum FineCliper, SeFAR și SVFormer), este surprinzător, afirmă autorii, că această tactică este rareori aplicată într-un context generativ.
Comportament disruptiv
Cercetătorii susțin că simplele perturbări structurate în ordinea temporală în timpul antrenamentului ajută la generalizarea modelelor la mișcări realiste și diverse:
‘Prin antrenarea pe secvențe dezordonate, generatorul învață să recupereze traiectorii plauzibile, regularizând efectiv entropia temporală. FLUXFLOW face punte între augmentarea temporală discriminativă și generativă, oferind o soluție de îmbunătățire a generării de videoclipuri temporale plauzibile, îmbunătățind în același timp calitatea generală.
‘În contrast cu metodele existente care introduc schimbări arhitecturale sau se bazează pe post-procesare, FLUXFLOW operează direct la nivelul datelor, introducând perturbări temporale controlate în timpul antrenamentului.’
Click pentru a reda.
Perturbările la nivel de cadru introduc perturbări fine într-o secvență. Acest tip de perturbare nu este foarte diferit de augmentarea prin mascare, unde secțiuni de date sunt blocate aleatoriu, pentru a preveni ca sistemul să se suprapună pe puncte de date și să încurajeze o generalizare mai bună.
Teste
Deși ideea centrală de aici nu este suficient de lungă pentru a umple o lucrare completă, din cauza simplității sale, totuși există o secțiune de testare pe care o putem examina.
Autorii au testat pentru patru întrebări legate de îmbunătățirea calității temporale, menținerea fidelității spațiale, capacitatea de a învăța dinamica mișcării și a fluxului optic, menținerea calității temporale în generarea extraterm și sensibilitatea la hipera-parametrii cheie.
Cercetătorii au aplicat FluxFlow la trei arhitecturi generative: U-Net-based, sub forma VideoCrafter2; DiT-based, sub forma CogVideoX-2B; și AR-based, sub forma NOVA-0.6B.
Pentru o comparație corectă, au perfecționat modelele de bază ale arhitecturilor cu FluxFlow ca o fază suplimentară de antrenament, pentru o epocă, pe baza de date OpenVidHD-0.4M.
Modelele au fost evaluate împotriva a două benchmark-uri populare: UCF-101 și VBench.
Pentru UCF, s-au utilizat metricile Fréchet Video Distance (FVD) și Inception Score (IS). Pentru VBench, cercetătorii s-au concentrat pe calitatea temporală, calitatea cadrelor și calitatea generală.

Evaluarea cantitativă inițială a FluxFlow-Frame. "+ Original" indică antrenament fără FLUXFLOW, în timp ce "+ Num × 1" arată diferite configurații FluxFlow-Frame. Cele mai bune rezultate sunt evidențiate; al doilea cel mai bun este subliniat pentru fiecare model.
Comentând aceste rezultate, autorii afirmă:
‘Atât FLUXFLOW-FRAME, cât și FLUXFLOW-BLOCK îmbunătățesc semnificativ calitatea temporală, așa cum se evidențiază în metricile din Tab. 1, 2 (de exemplu, FVD, Subiect, Flicker, Mișcare și Dinamic) și rezultatele calitative din [imaginea de mai jos].
‘De exemplu, mișcarea mașinii care plutește în VC2, pisica care-și urmărește coada în NOVA și surferul care călărește o vală în CVX devin mult mai fluide cu FLUXFLOW. Este important de remarcat că aceste îmbunătățiri temporale sunt realizate fără a sacrifica fidelitatea spațială, așa cum se evidențiază în detaliile ascuțite ale stropilor de apă, urmelor de fum și texturilor valurilor, împreună cu metricile de fidelitate spațială și generală.’
Mai jos vedem selecții din rezultatele calitative la care autorii se referă (vă rugăm să consultați lucrarea originală pentru rezultate complete și o rezoluție mai bună):

Selecții din rezultatele calitative.
Lucrarea sugerează că, deși atât perturbările la nivel de cadru, cât și cele la nivel de bloc îmbunătățesc calitatea temporală, metodele la nivel de cadru tind să performeze mai bine. Acest lucru se datorează granulației lor mai fine, care permite ajustări temporale mai precise. Perturbările la nivel de bloc, pe de altă parte, pot introduce zgomot din cauza tiparelor spațiale și temporale strâns legate din cadrul blocurilor, reducând eficacitatea lor.
Concluzie
Această lucrare, împreună cu colaborarea Bytedance-Tsinghua privind subtitrarea, a făcut clar pentru mine că aparentele lipsuri ale noilor modele generative de videoclipuri nu pot rezulta din erori ale utilizatorilor, greșeli instituționale sau limitări de finanțare, ci mai degrabă dintr-o focalizare a cercetării care a prioritizat provocări mai urgente, cum ar fi coerența și consistența temporală, peste aceste preocupări mai mici.
Până recent, rezultatele de la sistemele generative de videoclipuri disponibile gratuit și descărcabile au fost atât de compromise încât nu a existat un efort semnificativ din partea comunității entuziaștilor pentru a remedia aceste probleme (nu în ultimul rând pentru că problemele erau fundamentale și nu erau soluționate trivial).
Acum, când suntem atât de aproape de era prezisă a videoclipurilor fotorealiste generate în întregime de inteligența artificială, este clar că atât comunitatea de cercetare, cât și cea casuală, iau un interes mai profund și mai productiv în rezolvarea problemelor rămase; cu noroc, acestea nu sunt obstacole intractabile.
* Wan are o rată de cadre nativă de doar 16fps, și ca răspuns la propriile mele probleme, observ că forumurile au sugerat reducerea ratei de cadre la 12fps și apoi utilizarea FlowFrames sau a altor sisteme de re-fluxare bazate pe inteligență artificială pentru a interpolarea golurilor dintre astfel de cadre rare.
Publicat pentru prima dată vineri, 21 martie 2025












