Unghiul lui Anderson

De ce videoul generat de IA poate fi uneori inversat

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Dacă anul 2022 a fost anul în care inteligența artificială generativă a capturat imaginația publicului larg, 2025 este anul în care noua generație de cadre video generative din China pare să facă același lucru.

Hunyuan Video de la Tencent a avut un impact semnificativ asupra comunității de hobby ai cu lansarea sursă deschisă a unui model de difuzie video complet care poate fi personalizat de utilizatori.

În urma sa se află Wan 2.1 de la Alibaba, una dintre cele mai puternice soluții de imagine-la-video FOSS din această perioadă – care suportă acum personalizarea prin Wan LoRAs.

Pe lângă disponibilitatea recentă a modelului de fundație umană SkyReels-V1, la momentul scrierii acestui articol așteptăm lansarea suitei video comprehensive VACE de la Alibaba:

Click pentru a reda. Lansarea iminentă a suitei de editare multi-funcțională VACE de la Alibaba a entuziasmat comunitatea de utilizatori. Source: https://ali-vilab.github.io/VACE-Page/

Impactul Brusc

Scena de cercetare a videoului generativ ia este la fel de explozivă; suntem încă în prima jumătate a lunii martie, iar încărcările de marți pe secțiunea de vedere computerizată a Arxiv (un hub pentru articole de ia generativă) au ajuns la aproape 350 de intrări – un număr asociat cu vârful sezonului conferințelor.

Cele două ani de la lansarea difuziei stabile în vara anului 2022 (și dezvoltarea ulterioară a Dreambooth și a metodelor de personalizare LoRA) au fost caracterizați de lipsa unor dezvoltări majore, până la ultimele câteva săptămâni, în care noile lansări și inovații au avansat atât de rapid încât este aproape imposibil să ținem pasul, cu atât mai mult să le acoperim pe toate.

Modelele de difuzie video, cum ar fi Hunyuan și Wan 2.1, au rezolvat, în sfârșit, și după ani de eforturi eșuate din sute de inițiative de cercetare, problema consistenței temporale în ceea ce privește generarea de oameni, și în mare măsură și a mediului și a obiectelor.

Există puține dubii că studiourile de efecte vizuale sunt în prezent implicate în adaptarea noilor modele video chinezești pentru a rezolva provocări imediate, cum ar fi schimbul de fețe, în ciuda lipsei actuale de mecanisme auxiliare de tip ControlNet pentru aceste sisteme.

Trebuie să fie un mare rahat că unul dintre obstacolele semnificative a fost posibil depășit, chiar dacă nu pe căile așteptate.

Dintre problemele care rămân, aceasta nu este nesemnificativă:

Click pentru a reda. Pornind de la promptul ‘O piatră mică se rostogolește pe o pantă abruptă, deplasând solul și pietrele mici’, Wan 2.1, care a obținut cel mai înalt punctaj în noua lucrare, face o singură greșeală. Source: https://videophy2.github.io/

Sus pe deal înapoi

Toate sistemele de text-la-video și imagine-la-video disponibile în prezent, inclusiv modelele comerciale cu sursă închisă, au tendința de a produce gafe fizice, cum ar fi cea de mai sus, în care videoul arată o piatră care se rostogolește în sus, pe baza promptului ‘O piatră mică se rostogolește pe o pantă abruptă, deplasând solul și pietrele mici’.

O teorie privind motivul pentru care se întâmplă acest lucru, propusă recent într-o colaborare academică între Alibaba și Emiratele Arabe Unite, este că modelele se antrenează întotdeauna pe imagini individuale, într-un anumit sens, chiar și atunci când se antrenează pe videoclipuri (care sunt scrise ca secvențe de cadre individuale pentru scopuri de antrenament); și este posibil ca ele să nu învețe neapărat ordinea temporală corectă a imaginilor ‘înainte’ și ‘după’.

Cu toate acestea, cea mai probabilă soluție este că modelele în cauză au utilizat rutine de augmentare a datelor care implică expunerea unui clip de antrenament la model atât înainte, cât și înapoi, efectiv dublând datele de antrenament.

De mult timp se știe că acest lucru nu ar trebui să se facă în mod arbitrar, deoarece unele mișcări funcționează în sens invers, dar multe nu. Un studiu din 2019 de la Universitatea din Bristol din Marea Britanie a încercat să dezvolte o metodă care să poată distinge clipuri video sursă ‘echivalente’, ‘invariante’ și ‘ireversibile’ care coexistă într-un singur set de date (a se vedea imaginea de mai jos), cu ideea că clipurile sursă nepotrivite ar putea fi filtrate din rutinele de augmentare a datelor.

Exemple de trei tipuri de mișcare, doar una dintre care este reversibilă în timp ce menține dinamica fizică plauzibilă. Source: https://arxiv.org/abs/1909.09422

Exemple de trei tipuri de mișcare, doar una dintre care este reversibilă în timp ce menține dinamica fizică plauzibilă. Source: https://arxiv.org/abs/1909.09422

Autorii acestei lucrări formulează clar problema:

‘Descoperim că realismul videourilor inverse este trădat de artefacte de inversare, aspecte ale scenei care nu ar fi posibile într-o lume naturală. Unele artefacte sunt subtile, în timp ce altele sunt ușor de detectat, cum ar fi o acțiune de ‘aruncare’ inversată în care obiectul aruncat se ridică spontan de pe podea. ‘

‘Observăm două tipuri de artefacte de inversare, fizice, care prezintă încălcări ale legilor naturii, și improbabile, care descriu un scenariu posibil, dar puțin probabil. Acestea nu sunt exclusive, și multe acțiuni inverse suferă de ambele tipuri de artefacte, cum ar fi desfăcerea unei hârtii.

‘Exemple de artefacte fizice includ: gravitație inversă (de exemplu, ‘a lăsa ceva să cadă’), impulsuri spontane asupra obiectelor (de exemplu, ‘a roti un pix’) și schimbări de stare ireversibile (de exemplu, ‘a arde o lumânare’). Un exemplu de artefact improbabil: a lua o farfurie din dulap, a o usca și a o pune pe suportul de uscare.

‘Acest tip de reutilizare a datelor este foarte comun la momentul antrenamentului și poate fi benefic – de exemplu, pentru a se asigura că modelul nu învață doar o vedere a unei imagini sau a unui obiect care poate fi răsturnat sau rotit fără a-și pierde coerența și logica centrală.

‘Acest lucru funcționează doar pentru obiecte care sunt cu adevărat simetrice, desigur; și învățarea fizicii dintr-un videoclip ‘inversat’ funcționează doar dacă versiunea inversată are la fel de mult sens ca și cea directă.’

Reversări Temporare

Nu avem nicio dovadă că sisteme precum Hunyuan Video și Wan 2.1 au permis clipuri ‘inversate’ arbitrare să fie expuse modelului în timpul antrenamentului (niciuna dintre grupurile de cercetători nu a fost specifică cu privire la rutinele de augmentare a datelor).

Însă singura posibilitate rezonabilă, în fața atâtor rapoarte (și a experienței mele practice), pare să fie că seturile de date hiperscale care alimentează aceste modele pot conține clipuri care prezintă mișcări care au loc în sens invers.

Piatra din videoclipul încorporat mai sus a fost generată folosind Wan 2.1 și face parte dintr-un nou studiu care examinează modul în care modelele de difuzie video gestionează fizica.

În testele pentru acest proiect, Wan 2.1 a obținut un punctaj de doar 22% în ceea ce privește capacitatea sa de a se conforma în mod constant legilor fizice.

Cu toate acestea, acesta este cel mai bun punctaj obținut de orice sistem testat pentru această lucrare, ceea ce indică faptul că am putea fi găsit următorul nostru obstacol pentru ia video:

Punctajele obținute de sistemele deschise și închise de top, cu ieșirile cadrului evaluat de annotatori umani. Source: https://arxiv.org/pdf/2503.06800

Punctajele obținute de sistemele deschise și închise de top, cu ieșirile cadrului evaluat de annotatori umani. Source: https://arxiv.org/pdf/2503.06800

Autorii acestei noi lucrări au dezvoltat un sistem de benchmarking, acum în a doua sa iterație, numit VideoPhy, cu codul disponibil pe GitHub.

Deși scopul lucrării depășește ceea ce putem acoperi aici, să aruncăm o privire generală asupra metodologiei sale și asupra potențialului său de a stabili o metrică care să poată ajuta la îndreptarea cursului sesiunilor de antrenament viitoare departe de aceste exemple ciudate de inversare.

Studiul, condus de șase cercetători de la UCLA și Google Research, se numește VideoPhy-2: O evaluare a fizicii acționabile în generarea de videoclipuri și are un site de proiect aferent, împreună cu cod și seturi de date disponibile pe GitHub, și un vizualizator de seturi de date pe Hugging Face.

Click pentru a reda. Aici, modelul OpenAI Sora nu reușește să înțeleagă interacțiunile dintre vâsle și reflexii și nu poate oferi niciun flux fizic logic nici pentru persoana din barcă, nici pentru modul în care barca interacționează cu aceasta.

Metodă

Autorii descriu cea mai recentă versiune a lucrării lor, VideoPhy-2, ca o ‘evaluare dificilă a fizicii acționabile pentru acțiuni din lumea reală’. Colectia prezintă 197 de acțiuni diverse, cum ar fi hula-hoop, gimnastică și tenis, precum și interacțiuni cu obiecte, cum ar fi îndoirea unui obiect până la rupere.

Un model de limbaj mare (LLM) este utilizat pentru a genera 3840 de prompturi din aceste acțiuni inițiale, iar prompturile sunt utilizate pentru a sintetiza videoclipuri prin diversele cadre testate.

Pe tot parcursul procesului, autorii au dezvoltat o listă de ‘candidați’ pentru reguli și legi fizice pe care videoclipurile generate de ia ar trebui să le respecte, utilizând modele de vedere-limbaj pentru evaluare.

Autorii afirmă:

‘De exemplu, într-un videoclip cu un sportiv care joacă tenis, o regulă fizică ar fi că o minge de tenis ar trebui să urmeze o traiectorie parabolică sub gravitație. Pentru judecăți de aur, cerem annotatorilor umani să puncteze fiecare videoclip în funcție de conformitatea semantică generală și de înțelegerea fizică a comunului, și să marcheze conformitatea cu diverse reguli fizice.’

Mai sus: Un prompt de text este generat dintr-o acțiune utilizând un LLM și este utilizat pentru a crea un videoclip cu un generator de text-la-video. Un model de vedere-limbaj captionează videoclipul, identificând posibile reguli fizice în joc. Mai jos: Annotatorii umani evaluează realismul videoclipului, confirmă încălcări ale regulilor, adaugă reguli lipsă și verifică dacă videoclipul se potrivește cu promptul original.

Mai sus: Un prompt de text este generat dintr-o acțiune utilizând un LLM și este utilizat pentru a crea un videoclip cu un generator de text-la-video. Un model de vedere-limbaj captionează videoclipul, identificând posibile reguli fizice în joc. Mai jos: Annotatorii umani evaluează realismul videoclipului, confirmă încălcări ale regulilor, adaugă reguli lipsă și verifică dacă videoclipul se potrivește cu promptul original.

Inițial, cercetătorii au curatoriat un set de acțiuni pentru a evalua fizica comună în videoclipurile generate de ia. Ei au început cu peste 600 de acțiuni sursă din seturile de date Kinetics, UCF-101 și SSv2, concentrându-se pe activități care implică sport, interacțiuni cu obiecte și fizică din lumea reală.

Două grupuri independente de studenți cu pregătire în științe, aleși din încercări pe Amazon Mechanical Turk (AMT), au examinat și filtrat lista, selectând acțiuni care testau principii precum gravitația, impulsul și elasticitatea, în timp ce elimină sarcini cu mișcări reduse, cum ar fi tastarea, mângâierea unui câine sau mestecarea.

Ulterior, cu ajutorul Gemini-2.0-Flash-Exp, au eliminat duplicatele, iar setul de date final a inclus 197 de acțiuni, cu 54 de interacțiuni cu obiecte și 143 de acțiuni fizice și sportive:

Exemple din acțiunile rafinate.

Exemple din acțiunile rafinate.

În a doua etapă, cercetătorii au utilizat Gemini-2.0-Flash-Exp pentru a genera 20 de prompturi pentru fiecare acțiune din setul de date, rezultând un total de 3.940 de prompturi. Procesul de generare s-a concentrat pe interacțiuni fizice vizibile care ar putea fi reprezentate clar într-un videoclip generat. Acesta a exclus elemente nevizuale, cum ar fi emoții, detalii senzoriale și limbaj abstract, dar a inclus caractere și obiecte diverse.

De exemplu, în loc de un prompt simplu ‘Un arcaș eliberează săgeata’, modelul a fost condus să producă o versiune mai detaliată, cum ar fi ‘Un arcaș trage coarda arcului înapoi până la tensiunea maximă, apoi eliberează săgeata, care zboară drept și lovește un țintă pe o țintă de hârtie’.

Deoarece modelele video moderne pot interpreta descrieri mai lungi, cercetătorii au rafinat ulterior captionurile utilizând Mistral-NeMo-12B-Instruct, pentru a adăuga detalii vizuale fără a altera sensul original.

Exemple de prompturi din VideoPhy-2, categorisite după activități fizice sau interacțiuni cu obiecte. Fiecare prompt este asociat cu acțiunea și principiul fizic relevant pe care îl testează.

Exemple de prompturi din VideoPhy-2, categorisite după activități fizice sau interacțiuni cu obiecte. Fiecare prompt este asociat cu acțiunea și principiul fizic relevant pe care îl testează.

Pentru a treia etapă, regulile fizice nu au fost derivate din prompturi de text, ci din videoclipuri generate, deoarece modelele generative pot lupta pentru a se conforma prompturilor de text condiționate.

Videoclipurile au fost create mai întâi utilizând prompturi VideoPhy-2, apoi ‘up-captionate’ cu Gemini-2.0-Flash-Exp pentru a extrage detalii cheie. Modelul a propus trei reguli fizice așteptate pentru fiecare videoclip, pe care annotatorii umani le-au examinat și extins prin identificarea unor potențiale încălcări suplimentare.

Exemple din captionurile up-sample.

Exemple din captionurile up-sample.

Ulterior, pentru a identifica acțiunile cele mai dificile, cercetătorii au generat videoclipuri utilizând CogVideoX-5B cu prompturi din setul de date VideoPhy-2. Ei au selectat 60 de acțiuni din 197 în care modelul a eșuat constant să urmeze atât prompturile, cât și fizica comună de bază.

Aceste acțiuni implicau interacțiuni fizice bogate, cum ar fi transferul de impuls în aruncarea discului, schimbări de stare, cum ar fi îndoirea unui obiect până la rupere, sarcini de echilibru, cum ar fi mersul pe sârmă, și mișcări complexe care includ salturi înapoi, sărituri cu prăjina și aruncarea de pizza, printre altele. În total, au fost alese 1.200 de prompturi pentru a crește dificultatea subansamblului de date.

Setul de date rezultat a cuprins 3.940 de captionuri – 5,72 ori mai mult decât versiunea anterioară a VideoPhy. Lungimea medie a captionurilor originale este de 16 tokeni, în timp ce captionurile up-sample au ajuns la 138 de tokeni – 1,88 ori și, respectiv, 16,2 ori mai lungi.

Setul de date prezintă, de asemenea, 102.000 de annotări umane care acoperă conformitatea semantică, fizica comună și încălcări ale regulilor în multiple modele de generare de videoclipuri.

Evaluare

Cercetătorii au definit apoi criterii clare pentru evaluarea videoclipurilor. Obiectivul principal a fost de a evalua cât de bine fiecare videoclip se potrivea promptului de intrare și urma principiile fizice de bază.

În loc să clasifice pur și simplu videoclipurile prin preferință, ei au utilizat feedback bazat pe notare pentru a captura succese și eșecuri specifice. Annotatorii umani au acordat videoclipurilor note pe o scară de cinci puncte, permițând judecăți mai detaliate, în timp ce evaluarea a verificat, de asemenea, dacă videoclipurile urmau diverse reguli și legi fizice.

Pentru evaluarea umană, un grup de 12 annotatori au fost selectați din încercări pe Amazon Mechanical Turk (AMT) și au primit instrucțiuni detaliate la distanță. Pentru corectitudine, conformitatea semantică și fizica comună au fost evaluate separat (în studiul original VideoPhy, au fost evaluate împreună).

Annotatorii au evaluat mai întâi cât de bine videoclipurile se potriveau prompturilor de intrare, apoi au evaluat separat plauzibilitatea fizică, notând încălcări ale regulilor și realismul general pe o scară de cinci puncte. Doar prompturile originale au fost afișate, pentru a menține o comparație corectă între modele.

Interfața prezentată annotatorilor AMT.

Interfața prezentată annotatorilor AMT.

Deși judecata umană rămâne standardul de aur, este costisitoare și vine cu o serie de limitări. Prin urmare, evaluarea automată este esențială pentru evaluări mai rapide și mai scalabile ale modelului.

Autorii lucrării au testat mai multe modele de limbaj-video, inclusiv Gemini-2.0-Flash-Exp și VideoScore, pentru capacitatea lor de a evalua videoclipurile din punct de vedere al acurateței semantice și al ‘fizicii comune’.

Modelele au evaluat din nou fiecare videoclip pe o scară de cinci puncte, în timp ce o sarcină de clasificare separată a determinat dacă regulile fizice au fost respectate, încălcate sau neclare.

Experimentele au arătat că modelele de limbaj-video existente au luptat pentru a se potrivi cu judecățile umane, în principal din cauza raționamentului fizic slab și a complexității prompturilor. Pentru a îmbunătăți evaluarea automată, cercetătorii au dezvoltat VideoPhy-2-Autoeval, un model cu 7 miliarde de parametri, proiectat pentru a oferi predicții mai precise în trei categorii: conformitate semantică; fizică comună; și conformitate cu regulile, reglat pe modelul VideoCon-Physics, utilizând 50.000 de annotări umane*.

Date și Teste

Cu aceste instrumente în loc, autorii au testat o serie de sisteme generative de videoclipuri, atât prin instalații locale, cât și, acolo unde a fost necesar, prin api comerciale: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; și Luma Ray.

Modelele au fost promptate cu captionuri up-sample, acolo unde a fost posibil, cu excepția faptului că Hunyuan Video și VideoCrafter2 funcționează sub limitări de 77 de tokeni CLIP și nu pot accepta prompturi mai lungi de o anumită lungime.

Videoclipurile generate au fost limitate la mai puțin de 6 secunde, deoarece ieșirile mai scurte sunt mai ușor de evaluat.

Datele de antrenament au provenit din setul de date VideoPhy-2, care a fost împărțit într-un set de referință și un set de antrenament. Au fost generate 590 de videoclipuri pe model, cu excepția lui Sora și Ray2; din cauza factorului de cost (un număr echivalent mai mic de videoclipuri a fost generat pentru acestea).

(Vă rugăm să consultați lucrarea sursă pentru detalii suplimentare de evaluare, care sunt descrise în mod exhaustiv acolo)

Evaluarea inițială s-a ocupat de activități fizice/sport și interacțiuni cu obiecte, și a testat atât setul de date general, cât și subansamblul ‘mai greu’ menționat:

Rezultatele din prima rundă.

Rezultatele din prima rundă.

Aici autorii comentează:

‘Chiar și modelul cu cel mai bun punctaj, Wan2.1-14B, obține doar 32,6% și 21,9% pe setul de date complet și pe subansamblul ‘greu’ al nostru, respectiv. Performanța sa relativ puternică în comparație cu alte modele poate fi atribuită diversității datelor sale multimodale de antrenament, împreună cu filtrarea robustă a mișcării care conservă videoclipuri de înaltă calitate pe o gamă largă de acțiuni.

‘Mai mult, observăm că modelele închise, cum ar fi Ray2, performează mai slab decât modelele deschise, cum ar fi Wan2.1-14B și CogVideoX-5B. Acest lucru sugerează că modelele închise nu sunt neapărat superioare modelelor deschise în ceea ce privește capturarea fizicii comune. ‘

‘În mod remarcabil, Cosmos-Diffusion-7B obține cel de-al doilea cel mai bun punctaj pe subansamblul ‘greu’, chiar depășind modelul mult mai mare HunyuanVideo-13B. Acest lucru se poate datora reprezentării ridicate a acțiunilor umane în datele sale de antrenament, împreună cu simulări sintetice.’

Rezultatele au arătat că modelele de videoclipuri au luptat mai mult cu activitățile fizice, cum ar fi sporturile, decât cu interacțiunile cu obiecte mai simple. Acest lucru sugerează că îmbunătățirea videoclipurilor generate de ia în acest domeniu va necesita seturi de date mai bune – în special, imagini de înaltă calitate ale sporturilor, cum ar fi tenisul, aruncarea discului, baseballul și cricketul.

Studiul a examinat, de asemenea, dacă plauzibilitatea fizică a unui model a corelat cu alte metrici de calitate a videoclipului, cum ar fi estetica și suavitatea mișcării. Rezultatele au arătat că nu există o corelație puternică, ceea ce înseamnă că un model nu poate îmbunătăți performanța sa pe VideoPhy-2 doar prin generarea de videoclipuri vizual atractive sau a mișcărilor fluide – are nevoie de o înțelegere mai profundă a fizicii comune.

Deși lucrarea oferă exemple calitative abundente, puținele exemple statice prezentate în pdf par să nu aibă legătură cu exemplele video extinse furnizate de autori pe site-ul proiectului. Prin urmare, vom examina o selecție mică de exemple statice și apoi unele exemple video reale.

Rândul superior arată videoclipuri generate de Wan2.1. (a) În Ray2, jet-skiul de pe partea stângă se lagă în urmă înainte de a se deplasa înapoi. (b) În Hunyuan-13B, ciocanul de demolare se deformează în timpul mișcării, iar o scândură de lemn ruptă apare în mod neașteptat. (c) În Cosmos-7B, sulița expulzează nisip înainte de a atinge solul.

Rândul superior arată videoclipuri generate de Wan2.1. (a) În Ray2, jet-skiul de pe partea stângă se lagă în urmă înainte de a se deplasa înapoi. (b) În Hunyuan-13B, ciocanul de demolare se deformează în timpul mișcării, iar o scândură de lemn ruptă apare în mod neașteptat. (c) În Cosmos-7B, sulița expulzează nisip înainte de a atinge solul.

Cu privire la testul calitativ de mai sus, autorii comentează:

‘[Noi] observăm încălcări ale fizicii comune, cum ar fi jet-skiuri care se deplasează în mod anormal în sens invers și deformarea unui ciocan de demolare solid, care sfidează principiile elasticității. Cu toate acestea, chiar și Wan suferă de lipsa fizicii comune, așa cum se arată în [clipul încorporat la începutul acestui articol].

‘În acest caz, subliniem că o piatră începe să se rostogolească și să accelereze în sus, sfidând legea fizică a gravitației.’

Exemple suplimentare de pe site-ul proiectului:

Click pentru a reda. Aici, captionul a fost ‘O persoană răsucește cu putere un prosop umed, apa pulverizându-se în afară într-un arc vizibil’ – dar sursa de apă rezultată este mult mai asemănătoare cu un furtun de apă decât cu un prosop.

Click pentru a reda.Aici, captionul a fost ‘Un chimist toarnă un lichid clar dintr-un pahar într-un tub de testare, evitând cu grijă scurgerile’, dar putem vedea că volumul de apă adăugat în pahar nu este consistent cu cantitatea care iese din cană.

Întrucât volumul de material asociat acestui proiect depășește ceea ce putem acoperi aici, vă rugăm să consultați lucrarea sursă, site-ul proiectului și site-urile conexe menționate anterior, pentru o prezentare exhaustivă a procedurilor autorilor și pentru mai multe exemple de testare și detalii procedurale.

 

* În ceea ce privește proveniența annotărilor, lucrarea specifică doar ‘dobândite pentru aceste sarcini’ – pare mult ca să fi fost generate de 12 lucrători AMT.

Publicat pentru prima dată joi, 13 martie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai