Unghiul lui Anderson

Drumul către o editare video bazată pe inteligența artificială mai bună

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Sectorul de cercetare a sintezei video/imagine produce în mod regulat arhitecturi de editare video, iar în ultimele nouă luni, astfel de apariții au devenit și mai frecvente. Cu toate acestea, majoritatea acestora reprezintă doar progrese incrementale față de starea actuală a tehnologiei, deoarece provocările de bază sunt substanțiale.

Cu toate acestea, o nouă colaborare între China și Japonia, din această săptămână, a produs câteva exemple care merită o examinare mai atentă a abordării, chiar dacă nu este neapărat o lucrare de referință.

În clipul video de mai jos (de pe site-ul proiectului, care – avertizare – poate încărca browserul) vedem că, deși capacitățile de deepfaking ale sistemului sunt inexistente în configurația actuală, sistemul face o treabă excelentă de a altera plauzibil și semnificativ identitatea femeii tinere din imagine, pe baza unei măști video (în partea stângă inferioară):

Apăsați pentru a reda. Pe baza segmentării semantice vizualizate în partea stângă inferioară, femeia originală (în partea stângă superioară) este transformată într-o identitate semnificativ diferită, chiar dacă acest proces nu realizează schimbul de identitate indicat în prompt. Sursă: https://yxbian23.github.io/project/video-painter/ (fiind conștient că, la momentul scrierii, acest site cu redare automată și plin de videoclipuri era înclinat să îmi blocheze browserul). Vă rugăm să consultați videoclipurile sursă, dacă le puteți accesa, pentru o rezoluție și detalii mai bune, sau să verificați exemplele de la videoclipul de prezentare generală a proiectului de la https://www.youtube.com/watch?v=HYzNfsD3A0s

Editarea bazată pe măști de acest tip este bine stabilită în modelele latente difuzive statice, folosind instrumente precum ControlNet. Cu toate acestea, menținerea coerenței fundalului în videoclipuri este mult mai dificilă, chiar și atunci când zonele mascate oferă modelului flexibilitate creativă, așa cum se arată mai jos:

Apăsați pentru a reda. O schimbare de specie, cu noua metodă VideoPainter. Vă rugăm să consultați videoclipurile sursă, dacă le puteți accesa, pentru o rezoluție și detalii mai bune, sau să verificați exemplele de la videoclipul de prezentare generală a proiectului de la https://www.youtube.com/watch?v=HYzNfsD3A0s

Autorii noii lucrări consideră metoda lor în raport cu arhitectura BrushNet a Tencent, precum și cu ControlNet, ambele tratând o arhitectură cu două ramuri capabile să izoleze generarea fundalului și a prim-planului.

Cu toate acestea, aplicarea directă a acestei metode la abordarea Diffusion Transformers (DiT) propusă de OpenAI Sora prezintă provocări deosebite, așa cum remarcă autorii ”

‘Aplicarea directă [a arhitecturii BrushNet și ControlNet] la videoclipurile DiT prezintă mai multe provocări: [În primul rând, având în vedere] fundalul robust generativ și dimensiunea modelului grea, replicarea completă a spatele DiT ca encoder de context ar fi inutilă și prohibitiv de costisitoare din punct de vedere computațional.

‘[În al doilea rând, spre deosebire de] ramura de control pur convoluțională a BrushNet, tokenurile din regiunile mascate conțin în mod inerent informații despre fundal din cauza atenției globale, ceea ce complică distincția dintre regiunile mascate și nemascate în spatele DiT.

‘[În cele din urmă,] ControlNet lipsește injecția de caracteristici pe toate straturile, împiedicând controlul dens al fundalului pentru sarcinile de inpainting.’

Prin urmare, cercetătorii au dezvoltat o abordare plug-and-play sub forma unui cadru cu două ramuri intitulat VideoPainter.

VideoPainter oferă un cadru de inpainting video cu două ramuri care îmbunătățește DiT preantrenate cu un encoder de context ușor. Acest encoder reprezintă doar 6% din parametrii spatei, pe care autorii îl consideră mai eficient decât metodele convenționale.

Modelul propune trei inovații cheie: un encoder de context de două straturi simplificate pentru ghidarea eficientă a fundalului; un sistem de integrare a caracteristicilor selectiv pentru măști care separă tokenurile mascate și nemascate; și o tehnică de resampling a ID-ului regiunii de inpainting care menține coerența identității pe secvențe video lungi.

Prin înghețarea atât a DiT preantrenat, cât și a encoderului de context, introducând un ID-Adapter, VideoPainter asigură că tokenurile regiunilor de inpainting din clipurile anterioare persistă pe tot parcursul unui videoclip, reducând flickeringul și incoerențele.

Cadru este proiectat, de asemenea, pentru compatibilitate plug-and-play, permițând utilizatorilor să îl integreze fără efort în fluxurile de lucru existente de generare și editare video.

Pentru a sprijini lucrarea, care utilizează CogVideo-5B-I2V ca motor generativ, autorii au creat ceea ce afirmă a fi cea mai mare bază de date de inpainting video până în prezent. Intitulată VPData, colecția constă în peste 390.000 de clipuri, pentru o durată totală de peste 886 de ore. De asemenea, au dezvoltat un cadru de benchmarking asociat intitulat VPBench.

Apăsați pentru a reda. Din exemplele de pe site-ul proiectului, vedem capacitățile de segmentare alimentate de colecția VPData și de suita de test VPBench. Vă rugăm să consultați videoclipurile sursă, dacă le puteți accesa, pentru o rezoluție și detalii mai bune, sau să verificați exemplele de la videoclipul de prezentare generală a proiectului de la https://www.youtube.com/watch?v=HYzNfsD3A0s

Noua lucrare se intitulează VideoPainter: Inpainting și editare video de orice lungime cu control de context plug-and-play și provine de la șapte autori de la Tencent ARC Lab, Universitatea Chineză din Hong Kong, Universitatea din Tokyo și Universitatea din Macao.

Pe lângă site-ul proiectului menționat, autorii au lansat, de asemenea, o prezentare generală mai accesibilă pe YouTube, precum și o pagină Hugging Face.

Metodă

Pipeline-ul de colectare a datelor pentru VPData constă în colectare, anotare, împărțire, selecție și captionare:

Schema pentru pipeline-ul de construire a bazei de date. Sursă: https://arxiv.org/pdf/2503.05639

Schema pentru pipeline-ul de construire a bazei de date. Sursă: https://arxiv.org/pdf/2503.05639

Colecțiile sursă utilizate pentru această compilație au provenit de la Videvo și Pexels, cu o cantitate inițială de aproximativ 450.000 de videoclipuri.

Mai multe biblioteci și metode contributive au constituit etapa de preprocesare: framework-ul Recognize Anything a fost utilizat pentru a oferi etichetare video deschisă, însărcinată cu identificarea obiectelor principale; Grounding Dino a fost utilizat pentru detectarea cutiilor de delimitare în jurul obiectelor identificate; și framework-ul Segment Anything Model 2 (SAM 2) a fost utilizat pentru a rafina aceste selecții grosiere în segmentări de mască de înaltă calitate.

Pentru a gestiona tranzițiile de scenă și a asigura coerența în inpainting-ul video, VideoPainter utilizează PySceneDetect pentru a identifica și a segmenta clipurile la puncte de ruptură naturale, evitând schimbările disruptive cauzate de urmărirea aceluiași obiect din multiple unghiuri. Clipurile au fost împărțite în intervale de 10 secunde, orice clip mai scurt de 6 secunde fiind eliminat.

Pentru selecția datelor, au fost aplicate trei criterii de filtrare: calitate estetică, evaluată cu predictorul de scor estetic Laion-Aesthetic; puterea mișcării, măsurată prin flux optic utilizând RAFT; și siguranța conținutului, verificată prin verificatorul de siguranță al difuziei stabile.

O limitare majoră în bazele de date de segmentare video existente este lipsa de annotări textuale detaliate, care sunt esențiale pentru a ghida modelele generative:

Cercetătorii subliniază lipsa de captionare a videoclipurilor în colecțiile comparabile.

Cercetătorii subliniază lipsa de captionare a videoclipurilor în colecțiile comparabile.

Prin urmare, procesul de curare a datelor VideoPainter include modele de viziune-lingvistică de ultimă generație, inclusiv CogVLM2 și Chat GPT-4o, pentru a genera captionări bazate pe cadre cheie și descrieri detaliate ale regiunilor mascate.

VideoPainter îmbunătățește DiT preantrenate prin introducerea unui encoder de context ușor personalizat care separă extragerea contextului fundalului de generarea prim-planului, așa cum se vede în partea dreapta superioară a schemei ilustrative de mai jos:

Schema conceptuală pentru VideoPainter. Encoderul de context VideoPainter procesează latente zgomotoase, măști subspecificate și latente video mascate prin VAE, integrând doar tokenurile fundalului în DiT preantrenat pentru a evita ambiguitatea. Adapterul ID Resample asigură coerența identității prin concatenarea tokenurilor regiunilor mascate în timpul antrenamentului și resampling-ul lor din clipurile anterioare în timpul inferenței.

Schema conceptuală pentru VideoPainter. Encoderul de context VideoPainter procesează latente zgomotoase, măști subspecificate și latente video mascate prin VAE, integrând doar tokenurile fundalului în DiT preantrenat pentru a evita ambiguitatea. Adapterul ID Resample asigură coerența identității prin concatenarea tokenurilor regiunilor mascate în timpul antrenamentului și resampling-ul lor din clipurile anterioare în timpul inferenței.

În loc de a încărca spatele cu procesări redundante, acest encoder funcționează pe o intrare simplificată: o combinație de latent zgomotos, latent video mascat (extras prin intermediul unui autoencoder variabil, sau VAE) și măști subspecificate.

Latentul zgomotos oferă contextul de generare, iar latentul video mascat se aliniază cu distribuția existentă a DiT, urmărind să îmbunătățească compatibilitatea.

Mai degrabă decât să duplicateze mari secțiuni ale modelului, ceea ce autorii afirmă că s-a întâmplat în lucrările anterioare, VideoPainter integrează doar primele două straturi ale DiT. Aceste caracteristici extrase sunt reintroduse în DiT-ul înghețat într-un mod structurat, grupat – caracteristicile straturilor inițiale informează jumătatea inițială a modelului, în timp ce caracteristicile ulterioare rafinează jumătatea a doua.

În plus, un mecanism selectiv de token asigură că doar caracteristicile relevante pentru fundal sunt reintegrate, prevenind confuzia dintre regiunile mascate și nemascate. Acestă abordare, susțin autorii, permite VideoPainter să mențină o înaltă fidelitate în conservarea fundalului, îmbunătățind în același timp eficiența inpainting-ului prim-planului.

Autorii notează că metoda pe care o propun sprijină diverse metode de stilizare, inclusiv cea mai populară, adaptarea de rang scăzut (LoRA).

Date și teste

VideoPainter a fost antrenat utilizând modelul CogVideo-5B-I2V, împreună cu echivalentul său text-la-video. Baza de date VPData curată a fost utilizată la 480x720px, la o rată de învățare de 1×10^-5.

Adapterul ID Resample a fost antrenat timp de 2.000 de pași, iar encoderul de context timp de 80.000 de pași, ambele utilizând optimizerul AdamW. Antrenamentul a avut loc în două etape, utilizând 64 de unități GPU NVIDIA V100 (deși articolul nu specifică dacă acestea aveau 16GB sau 32GB de VRAM).

Pentru benchmarking, a fost utilizat Davis pentru măști aleatoare, iar VPBench pentru măști de segmentare.

Baza de date VPBench prezintă obiecte, animale, oameni, peisaje și diverse sarcini și acoperă patru acțiuni: adăugare, eliminare, schimbare și schimb. Colectia conține 45 de videoclipuri de 6 secunde și nouă videoclipuri cu o durată medie de 30 de secunde.

Au fost utilizate opt metrice pentru proces. Pentru conservarea regiunilor mascate, autorii au utilizat raportul semnal-zgomot (PSNR); metrice de similaritate perceptuală învățate (LPIPS); indicele de similaritate structurală (SSIM); și eroarea medie absolută (MAE).

Pentru alinierea textului, cercetătorii au utilizat similaritatea CLIP atât pentru a evalua distanța semantică dintre captionul clipului și conținutul său perceput, cât și pentru a evalua acuratețea regiunilor mascate.

Pentru a evalua calitatea generală a videoclipurilor de ieșire, a fost utilizată distanța video Fréchet (FVD).

Pentru o comparație cantitativă a inpainting-ului video, autorii și-au comparat sistemul cu abordări anterioare, ProPainter, COCOCO și Cog-Inp (CogVideoX). Testul a constat în inpainting-ul primului cadru al unui clip utilizând modele de inpainting de imagine și, apoi, utilizând un model imagine-la-video (I2V) pentru a propaga rezultatele într-o operație de amestecare latentă, în conformitate cu o metodă propusă de un articol din 2023 din Israel.

Deoarece site-ul proiectului nu este complet funcțional la momentul scrierii și deoarece videoclipul asociat de pe YouTube poate să nu prezinte întregul set de exemple încărcate pe site-ul proiectului, este destul de dificil să găsiți exemple de videoclipuri care sunt foarte specifice rezultatelor prezentate în articol. Prin urmare, vom prezenta rezultate statice parțiale prezentate în articol și vom închide articolul cu câteva exemple video suplimentare pe care am reușit să le extragem de pe site-ul proiectului.

Comparație cantitativă a VideoPainter vs. ProPainter, COCOCO și Cog-Inp pe VPBench (măști de segmentare) și Davis (măști aleatoare). Metricele acoperă conservarea regiunilor mascate, alinierea textului și calitatea videoclipului. Roșu = cel mai bun, Albastru = al doilea cel mai bun.

Comparație cantitativă a VideoPainter vs. ProPainter, COCOCO și Cog-Inp pe VPBench (măști de segmentare) și Davis (măști aleatoare). Metricele acoperă conservarea regiunilor mascate, alinierea textului și calitatea videoclipului. Roșu = cel mai bun, Albastru = al doilea cel mai bun.

Cu privire la aceste rezultate cantitative, autorii comentează:

‘În VPBench bazat pe segmentare, ProPainter și COCOCO prezintă cea mai slabă performanță în majoritatea metricelor, în principal din cauza incapacității de a inpainta obiecte complet mascate și a dificultății arhitecturii cu o singură ramură de a echilibra conservarea fundalului și generarea prim-planului.

‘În benchmark-ul Davis cu măști aleatoare, ProPainter arată o îmbunătățire prin utilizarea informațiilor parțiale de fundal. Cu toate acestea, VideoPainter obține o performanță optimă pe ambele segmentări (standard și lungă) și măști aleatoare, datorită arhitecturii sale cu două ramuri care decuplează eficient conservarea fundalului și generarea prim-planului.’

Autorii prezintă apoi exemple statice de teste calitative, pe care le vom prezenta mai jos. În toate cazurile, ne referim cititorului la site-ul proiectului și la videoclipul de pe YouTube pentru o rezoluție și detalii mai bune.

O comparație cu metodele de inpainting din cadrele anterioare.

O comparație cu metodele de inpainting din cadrele anterioare.

 

Apăsați pentru a reda. Exemple concatenate de noi din videoclipurile ‘rezultate’ de pe site-ul proiectului.

Cu privire la această rundă calitativă de inpainting video, autorii comentează:

‘VideoPainter prezintă în mod constant rezultate excepționale în coerența videoclipului, calitate și aliniere cu captionul text. În mod remarcabil, ProPainter nu reușește să genereze obiecte complet mascate, deoarece se bazează doar pe propagarea pixelilor de fundal în loc de generare.

‘În timp ce COCOCO demonstrează funcționalitate de bază, nu reușește să mențină o identitate consistentă în regiunile inpaintate (apariții inconsistente ale vaselor și schimbări bruște ale terenului) din cauza arhitecturii sale cu o singură ramură care încearcă să echilibreze conservarea fundalului și generarea prim-planului.

‘Cog-Inp obține rezultate de inpainting de bază; cu toate acestea, operația de amestecare a sa nu reușește să detecteze limitele măștilor, ceea ce duce la artefacte semnificative.

‘Mai mult, VideoPainter poate genera videoclipuri coerente care depășesc o minut, menținând coerența ID prin resampling-ul nostru ID.’

Cercetătorii au testat, de asemenea, capacitatea VideoPainter de a îmbunătăți captionările și de a obține rezultate îmbunătățite prin această metodă, comparând sistemul cu UniEdit, DiTCtrl și ReVideo.

Rezultate de editare video împotriva a trei abordări anterioare.

Rezultate de editare video împotriva a trei abordări anterioare.

Autorii comentează:

‘Pentru atât videoclipurile standard, cât și cele lungi din VPBench, VideoPainter obține o performanță superioară, depășind chiar și abordarea de capăt la capăt ReVideo. Acest succes poate fi atribuit arhitecturii sale cu două ramuri, care asigură o conservare excelentă a fundalului și capacități de generare a prim-planului, menținând o fidelitate ridicată în regiunile needitate, în timp ce asigură că regiunile editate se aliniază strâns cu instrucțiunile de editare, completate de resampling-ul ID al regiunilor de inpainting care menține coerența ID în videoclipuri lungi.’

Deși articolul prezintă exemple statice calitative pentru această metrică, acestea sunt neiluminante, și ne referim cititorul la diversele exemple răspândite în videoclipurile publicate pentru acest proiect.

În cele din urmă, a fost efectuat un studiu cu participarea umană, în care treizeci de utilizatori au fost rugați să evalueze 50 de generații selectate aleator din subseturile VPBench și de editare. Exemplele au subliniat conservarea fundalului, alinierea la prompt și calitatea generală a videoclipului.

Rezultatele studiului cu participarea umană pentru VideoPainter.

Rezultatele studiului cu participarea umană pentru VideoPainter.

Autorii afirmă:

‘VideoPainter a depășit semnificativ liniile de bază existente, obținând rate de preferință mai mari în toate criteriile de evaluare în ambele sarcini.’

Ei recunosc, cu toate acestea, că calitatea generațiilor VideoPainter depinde de modelul de bază, care poate lupta cu mișcări complexe și fizică; și observă că acesta se descurcă slab cu măști de calitate scăzută sau captionări nealiniate.

Concluzie

VideoPainter pare a fi o contribuție valoroasă la literatura de specialitate. Caracteristic pentru soluțiile recente, însă, are cerințe computaționale semnificative. De asemenea, multe dintre exemplele selectate pentru prezentare pe site-ul proiectului se situează foarte departe de cele mai bune exemple; ar fi interesant să vedem acest cadru comparat cu intrări viitoare și o gamă mai largă de abordări anterioare.

 

* Este important de menționat că ‘editarea video’ în acest sens nu înseamnă ‘asamblarea unor clipuri diverse într-o secvență’, care este sensul tradițional al acestui termen; ci mai degrabă schimbarea directă sau modificarea într-un fel a conținutului intern al clipurilor video existente, utilizând tehnici de învățare automată

Publicat pentru prima dată luni, 10 martie 2025. Actualizat sâmbătă, 25 iulie 2026, pentru a înlocui videoclipul.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai