Andersons vinkel

Vägen till bättre AI-baserad videoredigering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Videobildsynthesforskningssektorn producerar regelbundet videoredigeringsarkitekturer, och under de senaste nio månaderna har utgåvorna av detta slag blivit ännu vanligare. Det sagt, de flesta av dem representerar bara inkrementella framsteg i utvecklingen, eftersom de grundläggande utmaningarna är betydande.

En ny samarbetsinsats mellan Kina och Japan denna vecka har dock producerat några exempel som förtjänar en närmare granskning av metoden, även om det inte nödvändigtvis är ett banbrytande arbete.

I videoklippet nedan (från projektets webbplats, som kan vara tung för webbläsaren) ser vi att systemets deepfaking-förmågor inte existerar i den nuvarande konfigurationen, men systemet gör ett bra jobb med att trovärdigt och betydligt ändra den unga kvinnans identitet i bilden, baserat på en videomask (nere till vänster):

Klicka för att spela upp. Baserat på den semantiska segmenteringsmasken som visualiseras i nedre vänstra hörnet, omvandlas den ursprungliga (övre vänstra) kvinnan till en betydligt annorlunda identitet, även om denna process inte uppnår identitetsskiftet som anges i prompten. Source: https://yxbian23.github.io/project/video-painter/ ( Observera att webbplatsen var benägen att krascha min webbläsare vid tidpunkten för skrivande). Vänligen se källvideorna, om du kan komma åt dem, för bättre upplösning och detalj, eller kolla exempel på projektets översiktsvideo på https://www.youtube.com/watch?v=HYzNfsD3A0s

Maskbaserad redigering av detta slag är väl etablerad i statiska latent diffusionsmodeller, med hjälp av verktyg som ControlNet. Men att upprätthålla bakgrundsconsistens i video är betydligt svårare, även när maskerade områden ger modellen kreativ flexibilitet, som visas nedan:

Klicka för att spela upp. En förändring av art, med den nya VideoPainter-metoden. Vänligen se källvideorna, om du kan komma åt dem, för bättre upplösning och detalj, eller kolla exempel på projektets översiktsvideo på https://www.youtube.com/watch?v=HYzNfsD3A0s

Författarna till det nya arbetet betraktar sin metod i förhållande till både Tencents egna BrushNet-arkitektur (som vi rapporterade om förra året) och till ControlNet, som båda behandlar en dual-branch-arkitektur som kan isolera förgrunds- och bakgrundsgenerering.

Men att tillämpa denna metod direkt på den mycket produktiva Diffusion Transformers (DiT)-metoden föreslagen av OpenAI:s Sora, medför särskilda utmaningar, som författarna påpekar”

‘[Direkt] tillämpning [av arkitekturen i BrushNet och ControlNet] på video-DiTs presenterar flera utmaningar: [För det första, med tanke på] Video DiTs robusta generativa grund och stor modellstorlek, skulle det vara onödigt och beräkningsmässigt omöjligt att replikera den fulla/halv-stora Video DiT-ryggraden som kontextkodare.

‘[Till skillnad från] BrushNets renodlade konvolutionsbaserade kontrollgren, innehåller DiTs token i maskerade områden inneboende bakgrundsinformation på grund av global uppmärksamhet, vilket komplicerar distinktionen mellan maskerade och omaskerade områden i DiT-ryggraden.

‘[Slutligen,] saknar ControlNet funktion för funktionell injicering över alla lager, vilket hämmar tät bakgrundsstyrning för inpainting-uppgifter.’

Därför har forskarna utvecklat en plug-and-play-metod i form av en dual-branch-ramverk med namnet VideoPainter.

VideoPainter erbjuder en dual-branch-videoinpainting-ramverk som förbättrar förtränade DiTs med en lätt kontextkodare. Denna kodare står för endast 6% av ryggens parametrar, vilket författarna hävdar gör metoden mer effektiv än konventionella metoder.

Modellen föreslår tre nyckelinnovationer: en strömlinjeformad två-lagers kontextkodare för effektiv bakgrundsledning; ett mask-selektivt funktionssammanslagnings-system som separerar maskerade och omaskerade token; och en inpainting-region-ID-omprovnings-teknik som upprätthåller identitetskonsekvens över långa videosekvenser.

Genom att frysa både den förtränade DiT och kontextkodaren medan en ID-Adapter introduceras, säkerställer VideoPainter att inpainting-region-token från tidigare klipp består under hela videon, vilket minskar flimrande och inkonsekvenser.

Ramverket är också utformat för plug-and-play-kompatibilitet, vilket möjliggör för användare att integrera det sömlöst i befintliga videogenererings- och redigeringsarbetsflöden.

För att stödja arbetet, som använder CogVideo-5B-I2V som sin generativa motor, har författarna kuraterat vad de hävdar är den största videoinpainting-databasen hittills. Databasen, som kallas VPData, består av mer än 390 000 klipp, för en total videolängd på mer än 886 timmar. De har också utvecklat en relaterad benchmark-ramverk med namnet VPBench.

Klicka för att spela upp. Från projektets webbplats-exempel ser vi segmenteringsförmågorna som drivs av VPData-samlingen och VPBench-testsviten. Vänligen se källvideorna, om du kan komma åt dem, för bättre upplösning och detalj, eller kolla exempel på projektets översiktsvideo på https://www.youtube.com/watch?v=HYzNfsD3A0s

Det nya arbetet har titeln VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control och kommer från sju författare vid Tencent ARC Lab, The Chinese University of Hong Kong, The University of Tokyo och University of Macau.

Förutom den ovannämnda projektwebbplatsen har författarna också släppt en mer tillgänglig YouTube-översikt, samt en Hugging Face-sida.

Metod

Datainsamlingspipelinen för VPData består av insamling, annotering, uppdelning, urval och undertextning:

Schema för dataset-konstruktionen. Källa: https://arxiv.org/pdf/2503.05639

Schema för dataset-konstruktionen. Källa: https://arxiv.org/pdf/2503.05639

Källsamlingarna som användes för denna samling kom från Videvo och Pexels, med en initial mängd på cirka 450 000 videor.

Flera bidragande bibliotek och metoder ingick i förbehandlingsstadiet: Recognize Anything-ramverket användes för att tillhandahålla öppen video-tagging, med uppgift att identifiera primära objekt; Grounding Dino användes för att upptäcka begränsningsrutor runt de identifierade objekten; och Segment Anything Model 2 (SAM 2)-ramverket användes för att förbättra dessa grova urval till högkvalitativa mask-segmenteringar.

För att hantera scenövergångar och säkerställa konsekvens i videoinpainting, använder VideoPainter PySceneDetect för att identifiera och segmentera klipp vid naturliga brytpunkter, undviker de störande skift som ofta orsakas av att spåra samma objekt från flera vinklar. Klippen delades upp i 10-sekundersintervall, och allt som var kortare än sex sekunder kasserades.

För dataurval tillämpades tre filterkriterier: estetisk kvalitet, bedömd med Laion-Aesthetic Score Predictor; rörelsestyrka, mätt via optisk flöde med RAFT; och innehållssäkerhet, verifierad genom Stable Diffusions Säkerhetskontroll.

En stor begränsning i befintliga video-segmenteringsdatabaser är bristen på detaljerade textbaserade annoteringar, som är avgörande för att vägleda generativa modeller:

Forskarna betonar bristen på video-undertextning i jämförbara samlingar.

Forskarna betonar bristen på video-undertextning i jämförbara samlingar.

Därför ingår VideoPainters datakurering-process diverse ledande vision-språksmodeller, inklusive CogVLM2 och Chat GPT-4o för att generera nyckelfram-undertextning och detaljerade beskrivningar av maskerade områden.

VideoPainter förbättrar förtränade DiTs genom att introducera en anpassad lätt kontextkodare som separerar bakgrunds-sammanhangs-extraktion från förgrunds-generering, synlig till höger om den illustrativa schemat nedan:

Konceptuellt schema för VideoPainter. VideoPainters kontextkodare bearbetar bullriga latenta, nedskalade masker och maskerade videolatenta via VAE, integrerar endast bakgrunds-token i den förtränade DiT för att undvika tvetydighet. ID Resample-adaptern säkerställer identitetskonsekvens genom att konkatenera maskerade områdes-token under träning och omprova dem från tidigare klipp under inferens.

Konceptuellt schema för VideoPainter. VideoPainters kontextkodare bearbetar bullriga latenta, nedskalade masker och maskerade videolatenta via VAE, integrerar endast bakgrunds-token i den förtränade DiT för att undvika tvetydighet. ID Resample-adaptern säkerställer identitetskonsekvens genom att konkatenera maskerade områdes-token under träning och omprova dem från tidigare klipp under inferens.

Istället för att belasta ryggraden med redundant bearbetning, opererar denna kodare på en strömlinjeformad inmatning: en kombination av bullrig latent, maskerad videolatent (extraherad via en variational autoencoder, eller VAE) och nedskalade masker.

Den bullriga latenten tillhandahåller genererings-sammanhang, och den maskerade videolatenten överensstämmer med DiTs befintliga distribution, i syfte att förbättra kompatibilitet.

Istället för att duplicera stora delar av modellen, som författarna hävdar har skett i tidigare arbeten, integrerar VideoPainter endast de första två lagren av DiT. Dessa extraherade funktioner återinförs i den frysta DiT på ett strukturerat, gruppvis sätt – tidiga lager-informera den första halvan av modellen, medan senare funktioner förfinar den andra halvan.

Dessutom säkerställer en token-selektiv mekanism att endast bakgrunds-relevanta funktioner återinförs, vilket förhindrar förvirring mellan maskerade och omaskerade områden. Denna metod, hävdar författarna, tillåter VideoPainter att upprätthålla hög trohet i bakgrundsbevarande samtidigt som förgrunds-inpainting-effektiviteten förbättras.

Författarna noterar att metoden de föreslår stöder diverse stiliseringsmetoder, inklusive den mest populära, Low Rank Adaptation (LoRA).

Data och tester

VideoPainter tränades med CogVideo-5B-I2V-modellen, tillsammans med dess text-till-video-ekvivalent. Den kuraterade VPData-samlingen användes i 480x720px, med en inlärningshastighet på 1×10-5.

ID Resample-adaptern tränades i 2 000 steg, och kontextkodaren i 80 000 steg, båda med AdamW-optimeraren. Träningen ägde rum i två steg med hjälp av 64 NVIDIA V100 GPU:er (även om artikeln inte specificerar om de hade 16 GB eller 32 GB VRAM).

För benchmarking användes Davis för slumpmässiga masker, och författarnas eget VPBench för segmenteringsbaserade masker.

VPBench-databasen innehåller objekt, djur, människor, landskap och diverse uppgifter, och täcker fyra handlingar: lägg till, ta bort, ändra och byta. Samlingen innehåller 45 sexsekundersvideor och nio videor som i genomsnitt varar 30 sekunder.

Åtta metoder användes för processen. För maskerat områdes-bevarande användes Peak Signal-to-Noise Ratio (PSNR); Lärd Perceptuell Likhet (LPIPS); Strukturell Likhet (SSIM); och Medelabsolut Fel (MAE).

För text-alinering användes CLIP-similaritet både för att utvärdera semantisk distans mellan klippets undertext och dess faktiska uppfattade innehåll, och för att utvärdera maskerade områdens noggrannhet.

För att bedöma den allmänna kvaliteten på utgångsvideorna användes Fréchet Video Distance (FVD).

För en kvantitativ jämförelse av videoinpainting ställde författarna sitt system mot tidigare metoder ProPainter, COCOCO och Cog-Inp (CogVideoX). Testet bestod i att måla den första ramen i en klipp med hjälp av bildinpainting-modeller, och sedan använda en bild-till-video (I2V)-ryggrad för att propagera resultaten i en latent blandningsoperation, i enlighet med en metod som föreslogs av en 2023-artikel från Israel.

Eftersom projektwebbplatsen inte är helt fungerande vid tidpunkten för skrivande, och eftersom projektets associerade YouTube-video kanske inte innehåller alla exempel som finns på projektwebbplatsen, är det ganska svårt att hitta videosexempel som är mycket specifika för resultaten i artikeln. Därför kommer vi att visa partiella statiska resultat som presenteras i artikeln, och avsluta artikeln med några ytterligare videosexempel som vi lyckades extrahera från projektwebbplatsen.

Kvantitativ jämförelse av VideoPainter mot ProPainter, COCOCO och Cog-Inp på VPBench (segmenteringsmasker) och Davis (slumpmässiga masker). Metoder täcker maskerat områdes-bevarande, text-alinering och video-kvalitet. Röd = bäst, Blå = näst bäst.

Kvantitativ jämförelse av VideoPainter mot ProPainter, COCOCO och Cog-Inp på VPBench (segmenteringsmasker) och Davis (slumpmässiga masker). Metoder täcker maskerat områdes-bevarande, text-alinering och video-kvalitet. Röd = bäst, Blå = näst bäst.

Av dessa kvalitativa resultat kommenterar författarna:

‘I segmenteringsbaserade VPBench visar ProPainter och COCOCO den sämsta prestationen över de flesta metoder, främst på grund av oförmågan att måla fullständigt maskerade objekt och den enskilda ryggens svårighet att balansera bakgrundsbevarande och förgrunds-generering.

‘I slumpmässiga mask-benchmark Davis visar ProPainter förbättring genom att utnyttja partiell bakgrunds-information. Men VideoPainter uppnår optimal prestanda över segmentering (standard och lång) och slumpmässiga masker genom sin dual-branch-arkitektur som effektivt kopplar isär bakgrundsbevarande och förgrunds-generering.’

Författarna presenterar sedan statiska exempel på kvalitativa tester, av vilka vi visar ett urval nedan. I alla fall hänvisar vi läsaren till projektwebbplatsen och YouTube-videon för bättre upplösning.

En jämförelse mot inpainting-metoder i tidigare ramverk.

En jämförelse mot inpainting-metoder i tidigare ramverk.

 

Klicka för att spela upp. Exempel som vi har sammanställt från ‘resultat’-videorna på projektwebbplatsen.

Med anledning av denna kvalitativa omgång för videoinpainting kommenterar författarna:

‘VideoPainter visar konsekvent exceptionella resultat i video-kohären, kvalitet och alinering med text-undertext. Noterbart är att ProPainter misslyckas med att generera fullständigt maskerade objekt eftersom den endast förlitar sig på bakgrunds-pixel-propagation istället för generering.

‘Medan COCOCO visar grundfunktionalitet, misslyckas den med att upprätthålla konsekvent ID i målade områden (inkonsekventa fartygsuppdykningar och plötsliga terrängförändringar) på grund av sin enskilda ryggs arkitektur som försöker balansera bakgrundsbevarande och förgrunds-generering.

‘Cog-Inp uppnår grundläggande inpainting-resultat; men dess blandningsoperations oförmåga att upptäcka mask-gränser leder till betydande artefakter.

‘Dessutom kan VideoPainter generera sammanhängande videor som överstiger en minut medan den upprätthåller ID-konsekvens genom vår ID-omprovning.’

Forskarna testade också VideoPainters förmåga att förbättra undertexter och uppnå förbättrade resultat med denna metod, och ställde systemet mot UniEdit, DiTCtrl och ReVideo.

Video-redigeringsresultat mot tre tidigare metoder.

Video-redigeringsresultat mot tre tidigare metoder.

Författarna kommenterar:

‘För både standard- och långa videor i VPBench uppnår VideoPainter överlägsen prestanda, till och med överträffande den slutliga ReVideo. Denna framgång kan tillskrivas dess dual-branch-arkitektur, som säkerställer utmärkt bakgrundsbevarande och förgrunds-genereringsförmåga, upprätthåller hög trohet i oredigerade områden medan redigerade områden nära överensstämmer med redigeringsanvisningarna, kompletterat med inpainting-områdes-ID-omprovning som upprätthåller ID-konsekvens i långa videor.’

Även om artikeln innehåller statiska kvalitativa exempel för denna metod, är de inte så upplysande, och vi hänvisar läsaren till de olika exemplen som sprids över de olika videor som publicerats för detta projekt.

Slutligen genomfördes en användarstudie, där trettio användare ombads att utvärdera femtio slumpmässigt valda generationer från VPBench- och redigerings-undergrupperna. Exemplen betonade bakgrundsbevarande, anpassning till prompt och allmän video-kvalitet.

Resultat från användarstudien för VideoPainter.

Resultat från användarstudien för VideoPainter.

Författarna påpekar:

‘VideoPainter överträffade betydligt befintliga baslinjer, uppnådde högre preferensnivåer över alla utvärderingskriterier i båda uppgifterna.’

De medger dock att kvaliteten på VideoPainters generationer beror på basmodellen, som kan ha svårt att hantera komplex rörelse och fysik; och de observerar att den också presterar dåligt med lågkvalitativa masker eller feljusterade undertexter.

Slutsats

VideoPainter verkar vara en värdefull tillägg till litteraturen. Typiskt för nyliga lösningar har den dock betydande beräkningskrav. Dessutom är många av de exempel som valts för presentation på projektwebbplatsen långt ifrån de bästa exemplen; det vore därför intressant att se detta ramverk ställt mot framtida bidrag och en bredare uppsättning tidigare metoder.

 

* Det är värt att nämna att ‘video-redigering’ i denna mening inte betyder ‘sammansättning av olika klipp i en sekvens’, som är den traditionella betydelsen av denna term; utan snarare direkt ändring eller modifiering av det inre innehållet i befintliga videoklipp, med hjälp av maskinlärningstekniker

Publicerad måndag, 10 mars 2025. Uppdaterad lördag, 25 juli 2026 för att ersätta video.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai