Modele și platforme AI

Gătit pentru Consistență Narativă în Generarea de Videoclipuri Lungi

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Lansarea recentă a modelului generativ de inteligență artificială Hunyuan Video a intensificat discuțiile despre potențialul modelelor multimodale de viziune-limbaj de a crea, într-o zi, filme complete.

Însă, așa cum am observat, acest lucru este un prospect foarte îndepărtat în acest moment, din cauza mai multor motive. Unul dintre ele este fereastra de atenție foarte scurtă a majorității generatorilor de videoclipuri AI, care se luptă să mențină coerența chiar și într-un singur cadru scurt, și cu atât mai mult într-o serie de cadre.

Alt motiv este că referințele consistente la conținutul video (cum ar fi medii explorabile, care nu ar trebui să se schimbe aleatoriu dacă retrăim pașii prin ele) pot fi realizate în modelele de difuzie doar prin tehnici de personalizare, cum ar fi adaptarea de rang scăzut (LoRA), care limitează capacitățile din cutie ale modelelor de bază.

Prin urmare, evoluția generării de videoclipuri pare să se oprească, cu excepția cazului în care se dezvoltă noi abordări pentru continuitatea narativă.

Rețetă pentru Continuitate

Având în vedere acest lucru, o nouă colaborare între Statele Unite și China a propus utilizarea videoclipurilor de gătit instructive ca o posibilă temă pentru sistemele de continuitate narativă viitoare.

Faceți clic pentru a reda. Proiectul VideoAuteur sistematizează analiza părților unui proces de gătit, pentru a produce un nou set de date cu subtitrări fine și o metodă de orchestrare pentru generarea de videoclipuri de gătit. Referiți-vă la site-ul sursă pentru o rezoluție mai bună.  Sursă: https://videoauteur.github.io/

Intitulat VideoAuteur, lucrarea propune o conductă în două etape pentru a genera videoclipuri de gătit instructive, utilizând stări coerente care combină cadre cheie și subtitrări, obținând rezultate de ultimă generație în – într-adevăr – un spațiu subscris.

Pagina proiectului VideoAuteur include, de asemenea, o serie de videoclipuri mult mai atractive care utilizează aceeași tehnică, cum ar fi un trailer propus pentru o posibilă fuziune Marvel/DC:

Faceți clic pentru a reda. Două supereroi din universuri alternative se întâlnesc într-un trailer fals de la VideoAuteur. Referiți-vă la site-ul sursă pentru o rezoluție mai bună.

Pagina prezintă, de asemenea, videoclipuri promoționale similare pentru o serie de animale Netflix și un anunț publicitar Tesla (TSLA ).

În dezvoltarea VideoAuteur, autorii au experimentat cu diverse funcții de pierdere și abordări noi. Pentru a dezvolta un flux de lucru de generare de rețete, au curat, de asemenea, CookGen, cel mai mare set de date axat pe domeniul gătitului, cu 200.000 de clipuri video cu o durată medie de 9,5 secunde.

La o medie de 768,3 cuvinte pe videoclip, CookGen este, în mod confortabil, cel mai extensiv set de date annotat de acest fel. Diverse modele de viziune/liturghie au fost utilizate, printre alte abordări, pentru a se asigura că descrierile sunt la fel de detaliate, relevante și precise cu putință.

Videoclipurile de gătit au fost alese pentru că ghidurile de gătit au o narativă structurată și neambiguă, făcând annotarea și evaluarea o sarcină mai ușoară. Cu excepția videoclipurilor pornografice (care sunt probabil să intre în acest spațiu în curând), este greu de gândit la vreun alt gen la fel de “formulaic” vizual și narativ.

Autorii afirmă:

‘Conducta noastră propusă în două etape, care include un regizor de narativă lungă și generare de videoclipuri condiționate vizual, demonstrează îmbunătățiri promițătoare în coerență semantică și fidelitate vizuală în videoclipurile narative lungi generate.

‘Prin experimente pe setul nostru de date, observăm îmbunătățiri în coerență spațială și temporală în secvențele de videoclipuri.

‘Sperăm că lucrarea noastră poate facilita cercetări ulterioare în generarea de videoclipuri narative lungi.’

Noua lucrare este intitulată VideoAuteur: Înspre Generarea de Videoclipuri Narative Lungi și provine de la opt autori de la Universitatea Johns Hopkins, ByteDance și ByteDance Seed.

Curățarea Setului de Date

Pentru a dezvolta CookGen, care alimentează un sistem generativ în două etape pentru producerea de videoclipuri de gătit AI, autorii au utilizat material din colecțiile YouCook și HowTo100M. Autorii compară scala CookGen cu seturile de date anterioare axate pe dezvoltarea narativă în videoclipuri generative, cum ar fi setul de date Flintstones, setul de date Pororo, StoryGen, StoryStream de la Tencent și VIST.

Compararea imaginilor și a lungimii textului între CookGen și seturile de date similare cel mai apropiat.

Compararea imaginilor și a lungimii textului între CookGen și seturile de date similare cel mai apropiat. Sursă: https://arxiv.org/pdf/2501.06173

CookGen se concentrează pe narative din lumea reală, în special pe activități procedurale, cum ar fi gătitul, oferind povești mai clare și mai ușor de annotat în comparație cu seturile de date bazate pe imagini de benzi desenate. Acesta depășește cel mai mare set de date existent, StoryStream, cu 150 de ori mai multe cadre și descrieri textuale de 5 ori mai dense.

Cercetătorii au ajustat un model de subtitrare utilizând metodologia LLaVA-NeXT ca bază. Etichetele pseudo-ASR obținute pentru HowTo100M au fost utilizate ca “acțiuni” pentru fiecare videoclip și, apoi, rafinate ulterior de modele de limbaj mare (LLM).

De exemplu, ChatGPT-4o a fost utilizat pentru a produce un set de date de subtitrări și a fost solicitat să se concentreze pe interacțiunile subiect-obiect (cum ar fi mâinile care manipulează ustensile și alimente), atributele obiectelor și dinamica temporală.

Deoarece scripturile ASR sunt probabil să conțină inexactități și să fie, în general, “zgomotoase”, Intersecția peste Uniune (IoU) a fost utilizată ca o metrică pentru a măsura cât de strâns subtitrările se conformează secțiunii videoclipului pe care o adresează. Autorii notează că acest lucru a fost crucial pentru crearea consistenței narative.

Clipurile curate au fost evaluate utilizând Distanța Video Fréchet (FVD), care măsoară disparitatea dintre exemplele reale (lumea reală) și exemplele generate, atât cu, cât și fără cadre cheie de referință, ajungând la un rezultat performant:

Utilizarea FVD pentru a evalua distanța dintre videoclipurile generate cu noile subtitrări, atât cu, cât și fără utilizarea cadrelor cheie capturate din videoclipurile de exemplu.

Utilizarea FVD pentru a evalua distanța dintre videoclipurile generate cu noile subtitrări, atât cu, cât și fără utilizarea cadrelor cheie capturate din videoclipurile de exemplu.

În plus, clipurile au fost evaluate și de GPT-4o și de șase annotatori umani, urmând definiția LLaVA-Hound a “halucinației” (adică, capacitatea unui model de a inventa conținut spurios).

Cercetătorii au comparat calitatea subtitrărilor cu colecția Qwen2-VL-72B, obținând un punctaj ușor îmbunătățit.

Compararea scorurilor FVD și a evaluărilor umane între Qwen2-VL-72B și colecția autorilor.

Compararea scorurilor FVD și a evaluărilor umane între Qwen2-VL-72B și colecția autorilor.

Metodă

Faza generativă a VideoAuteur este împărțită între Regizorul de Narativă Lungă (LND) și modelul de generare de videoclipuri condiționat vizual (VCVGM).

LND generează o secvență de încorporări vizuale sau cadre cheie care caracterizează fluxul narativ, similar cu “momentele esențiale”. VCVGM generează clipuri video pe baza acestor alegeri.

Schema conductei de procesare VideoAuteur. Regizorul de Narativă Lungă face selecții potrivite pentru a alimenta modulul generativ Seed-X.

Schema conductei de procesare VideoAuteur. Regizorul de Narativă Lungă face selecții potrivite pentru a alimenta modulul generativ Seed-X.

Autorii discută pe larg despre meritele diferite ale unui regizor de imagine-text intercalat și ale unui regizor de cadre cheie centrat pe limbaj, și conchid că prima abordare este mai eficientă.

Regizorul de imagine-text intercalat generează o secvență prin intercalarea tokenilor de text și încorporărilor vizuale, utilizând un model auto-regresiv pentru a prezice tokenul următor, pe baza contextului combinat al textului și imaginilor. Acest lucru asigură o aliniere strânsă între elemente vizuale și text.

În schimb, regizorul de cadre cheie centrat pe limbaj sintetizează cadre cheie utilizând un model de difuzie condiționat de text, bazat numai pe subtitrări, fără a incorpora încorporări vizuale în procesul de generare.

Cercetătorii au descoperit că, deși metoda centrată pe limbaj generează cadre cheie vizual atractive, aceasta lipsește de coerență între cadre, argumentând că metoda intercalată obține scoruri mai mari în realism și coerență vizuală. Ei au descoperit, de asemenea, că această metodă a fost mai capabilă să învețe un stil vizual realist prin antrenament, deși, uneori, cu elemente repetitive sau zgomotoase.

În mod neobișnuit, într-un flux de cercetare dominat de co-optarea Stable Diffusion și Flux în fluxuri de lucru, autorii au utilizat modelul de limbaj multi-modal de 7 miliarde de parametri SEED-X de la Tencent ca model de bază pentru conducta lor generativă (deși acest model utilizează, de asemenea, versiunea SDXL a Stable Diffusion pentru o parte limitată a arhitecturii sale).

Autorii afirmă:

‘Abordarea noastră, care utilizează încorporări vizuale regresate ca condiții continue pe parcursul secvenței, se diferențiază de conducta clasică Imagine-la-Videoclip (I2V) care utilizează o imagine ca cadru de start.

‘Mai mult, îmbunătățim robustețea și calitatea videoclipurilor generate, adaptând modelul pentru a gestiona încorporări vizuale zgomotoase, deoarece încorporările vizuale regresate nu sunt perfecte din cauza erorilor de regresie.’

Deși conductele generative vizuale condiționate de acest tip utilizează, de obicei, cadre cheie inițiale ca punct de plecare pentru ghidarea modelului, VideoAuteur extinde acest paradigme prin generarea de stări vizuale multiple într-un spațiu latent semantic coerent, evitând astfel posibila părtinire a generării ulterioare bazate numai pe “cadre de start”.

Schema utilizării încorporărilor de stare vizuală ca o metodă de condiționare superioară.

Schema utilizării încorporărilor de stare vizuală ca o metodă de condiționare superioară.

Teste

În conformitate cu metodele SeedStory, cercetătorii utilizează SEED-X pentru a aplica ajustarea LoRA pe setul lor de date narative, descriind enigmatic rezultatul ca un “model similar cu Sora”, pre-antrenat pe cuplări video-text la scară largă, și capabil să accepte atât prompturi vizuale, cât și text.

32.000 de videoclipuri narative au fost utilizate pentru dezvoltarea modelului, cu 1.000 păstrate ca mostre de validare. Videoclipurile au fost decupate la 448 de pixeli pe partea scurtă și, apoi, decupate la 448x448px.

Pentru antrenament, generarea de narativă a fost evaluată în primul rând pe setul de validare YouCook2. Setul Howto100M a fost utilizat pentru evaluarea calității datelor și, de asemenea, pentru generarea de imagine-la-videoclip.

Pentru pierderea de condiționare vizuală, autorii au utilizat pierderea de difuzie de la DiT și o lucrare din 2024 bazată pe Stable Diffusion.

Pentru a dovedi afirmația lor că intercalarea este o abordare superioară, autorii au comparat VideoAuteur cu mai multe metode care se bazează numai pe intrări textuale: EMU-2, SEED-X, SDXL și FLUX.1-schnell (FLUX.1-s).

Dat un prompt global, 'Ghid pas cu pas pentru gătit tofu mapo', regizorul intercalat generează acțiuni, subtitrări și încorporări de imagine secvențial pentru a narra procesul. Primele două rânduri arată cadre cheie decodate din spațiile latente EMU-2 și SEED-X. Aceste imagini sunt realiste și consistente, dar mai puțin rafinate decât cele de la modele avansate, cum ar fi SDXL și FLUX.

Dat un prompt global, ‘Ghid pas cu pas pentru gătit tofu mapo’, regizorul intercalat generează acțiuni, subtitrări și încorporări de imagine secvențial pentru a narra procesul. Primele două rânduri arată cadre cheie decodate din spațiile latente EMU-2 și SEED-X. Aceste imagini sunt realiste și consistente, dar mai puțin rafinate decât cele de la modele avansate, cum ar fi SDXL și FLUX.

Autorii afirmă:

‘Abordarea centrată pe limbaj, care utilizează modele text-la-imagine, produce cadre cheie vizual atractive, dar suferă de o lipsă de coerență între cadre, din cauza informației mutuale limitate. În schimb, metoda de generare intercalată utilizează încorporări vizuale aliniate cu limbajul, obținând un stil vizual realist prin antrenament.

‘Cu toate acestea, aceasta generează, ocazional, imagini cu elemente repetitive sau zgomotoase, deoarece modelul auto-regresiv se luptă să creeze încorporări precise într-o singură trecere.’

Evaluarea umană confirmă, de asemenea, afirmația autorilor despre performanța îmbunătățită a metodei intercalate, metodele intercalate obținând cele mai mari scoruri într-un sondaj.

Comparații ale abordărilor dintr-un studiu uman realizat pentru lucrare.

Comparații ale abordărilor dintr-un studiu uman realizat pentru lucrare.

Cu toate acestea, observăm că abordările centrate pe limbaj obțin cele mai bune scoruri estetice. Autorii susțin, însă, că acesta nu este aspectul central în generarea de videoclipuri narative lungi.

Faceți clic pentru a reda. Segmentele generate pentru un videoclip de construire a unei pizza, de către VideoAuteur.

Concluzie

Cea mai populară direcție de cercetare în legătură cu această provocare, adică consistența narativă în generarea de videoclipuri lungi, se concentrează pe imagini individuale. Proiecte de acest fel includ DreamStory, StoryDiffusion, TheaterGen și ConsiStory de la NVIDIA.

Într-un sens, VideoAuteur intră, de asemenea, în această categorie “statică”, deoarece utilizează imagini de start din care se generează secvențe de cadre. Cu toate acestea, intercalarea conținutului video și semantic aduce procesul un pas mai aproape de o conductă practică.

 

Publicat pentru prima dată joi, 16 ianuarie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai