Andersons vinkel

Vejen til bedre AI-baseret videoediting

mm
Føj Unite.AI til dine foretrukne kilder på Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Video-/billedsynthesis-forskningssektoren udgiver jævnligt video-redigeringsarkitekturer, og i de sidste ni måneder er denne type udgivelser blevet endnu hyppigere. Det skal dog siges, at de fleste af dem kun repræsenterer inkrementelle fremskridt i relation til den nuværende tilstand, da de grundlæggende udfordringer er betydelige.

En ny samarbejdsprojekt mellem Kina og Japan har dog produceret nogle eksempler, der fortjener en nærmere undersøgelse af tilgangen, selv om det ikke nødvendigvis er et banebrydende arbejde.

I videoen nedenfor (fra projektets associerede webside, som kan belaste din browser) ser vi, at selv om systemets deepfaking-kapaciteter ikke findes i den nuværende konfiguration, gør systemet en fin indsats for at ændre kvindens identitet i billedet på en overbevisende og betydelig måde, baseret på en video-maske (nederst til venstre):

Klik for at afspille. Baseret på den semantiske segmenteringsmaske, der vises i nederste venstre hjørne, forvandles den oprindelige (øverste venstre) kvinde til en bemærkelsesværdigt anderledes identitet, selv om denne proces ikke opnår den identitetsudskiftning, der er angivet i prompten. Source: https://yxbian23.github.io/project/video-painter/ (Vær opmærksom på, at websiden på tidspunktet for skrivning havde en tendens til at kollapsere min browser). Vær venlig at se på kildevideoerne, hvis du kan få adgang til dem, for bedre opløsning og detaljer, eller se på eksemplerne i projektets oversigtsvideo på https://www.youtube.com/watch?v=HYzNfsD3A0s

Maskebaseret redigering af denne type er velkendt i statiske latent diffusion-modeller, der anvender værktøjer som ControlNet. Det er dog langt mere udfordrende at opretholde baggrundsconsistens i video, selv når maskeområder giver modellen kreativ fleksibilitet, som vist nedenfor:

Klik for at afspille. En ændring af art, med den nye VideoPainter-metode. Vær venlig at se på kildevideoerne, hvis du kan få adgang til dem, for bedre opløsning og detaljer, eller se på eksemplerne i projektets oversigtsvideo på https://www.youtube.com/watch?v=HYzNfsD3A0s

Forfatterne af det nye arbejde betragter deres metode i forhold til både Tencents eget BrushNet-arkitektur (som vi dækkede sidste år) og til ControlNet, der begge omhandler en dual-branch-arkitektur, der kan isolere forgrunds- og baggrunds-generering.

Det er dog en udfordring at anvende denne metode direkte på den meget produktive Diffusion Transformers (DiT)-tilgang forslagt af OpenAIs Sora, som forfatterne bemærker

‘[Direkte] anvendelse [af arkitekturen i BrushNet og ControlNet] på video-DiTs medfører flere udfordringer: [Først og fremmest, givet] Video DiTs robuste generative grundlag og store modelstørrelse, ville det være unødvendigt og komputationelt forbudt at duplikere den fulde/halv-storslåede Video DiT-baggrund som kontekst-encoder.

‘[Anden, i modsætning til] BrushNets ren konvolutionelle kontrol-branch, indeholder DiTs token i maskerede områder i forvejen baggrundsinformation på grund af global opmærksomhed, hvilket komplicerer forskellen mellem maskerede og umaskerede områder i DiT-baggrunde.

‘[Til sidst,] mangler ControlNet funktioninjektion på alle lag, hvilket hæmmer tæt baggrunds-kontrol for inpainting-opgaver.’

Derfor har forskerne udviklet en plug-and-play-tilgang i form af en dual-branch-ramme med titlen VideoPainter.

VideoPainter tilbyder en dual-branch video-inpainting-ramme, der forbedrer forudtrænede DiTs med en letvægts-kontekst-encoder. Denne encoder står kun for 6% af baggrundsparametrene, hvilket ifølge forfatterne gør tilgangen mere effektiv end konventionelle metoder.

Modellen foreslår tre nøgleinnovationer: en strømlinet to-lags kontekst-encoder til effektiv baggrunds-vejledning; en maskeselectivt funktionssammensætnings-system, der adskiller maskerede og umaskerede token; og en inpainting-områdes-ID-resampling-teknik, der opretholder identitets-konsistens på tværs af lange video-sekvenser.

Ved at fryse både den forudtrænede DiT og kontekst-encoderen, mens en ID-Adapter introduceres, sikrer VideoPainter, at inpainting-områdes-token fra tidligere klip består på tværs af en video, hvilket reducerer flimren og inkonsistens.

Rammen er også designet til plug-and-play-kompatibilitet, hvilket giver brugerne mulighed for at integrere den nærmest uden problemer i eksisterende video-genererings- og redigerings-workflows.

For at støtte arbejdet, der anvender CogVideo-5B-I2V som sin generative motor, har forfatterne kurateret, hvad de påstår er den største video-inpainting-dataset til dato. Titlen på denne samling er VPData, der består af over 390.000 klip, for en samlet video-varighed på over 886 timer. De har også udviklet en relateret benchmark-ramme med titlen VPBench.

Klik for at afspille. Fra projektets eksempler på websiden ser vi segmenterings-kapaciteterne, der er drevet af VPData-samlingen og VPBench-test-suiten. Vær venlig at se på kildevideoerne, hvis du kan få adgang til dem, for bedre opløsning og detaljer, eller se på eksemplerne i projektets oversigtsvideo på https://www.youtube.com/watch?v=HYzNfsD3A0s

Det nye arbejde har titlen VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control og kommer fra syv forfattere fra Tencent ARC Lab, The Chinese University of Hong Kong, The University of Tokyo og University of Macau.

Foruden den nævnte projekt-side har forfatterne også udgivet en mere tilgængelig YouTube-oversigt, samt en Hugging Face-side.

Metode

Dataindsamling-røret for VPData består af indsamlings-, annoterings-, splittings-, udvælgelses- og kapitel-tilføjelses-processen:

Schema for dataset-konstruktions-røret. Source: https://arxiv.org/pdf/2503.05639

Schema for dataset-konstruktions-røret. Source: https://arxiv.org/pdf/2503.05639

Kilde-samlinger, der blev anvendt til denne kompilation, kom fra Videvo og Pexels, med en initial høst på omkring 450.000 videoer.

Flere bidragende biblioteker og metoder bestod af forbehandlings-stadiet: Recognize Anything-rammen blev anvendt til at give åben-sæt video-tagging, med opgaven at identificere primære objekter; Grounding Dino blev anvendt til detektion af begrænsnings-bokse omkring de identificerede objekter; og Segment Anything Model 2 (SAM 2)-rammen blev anvendt til at raffinere disse grove valg til høj-kvalitets maske-segmenteringer.

For at håndtere scene-overgange og sikre konsistens i video-inpainting, anvender VideoPainter PySceneDetect til at identificere og segmentere klip ved naturlige afbrydelser, og undgå de disruptive skift, der ofte skyldes sporing af det samme objekt fra multiple vinkler. Klipene blev inddelt i 10-sekunders-intervaller, og noget, der var kortere end seks sekunder, blev kasseret.

For data-udvælgelse blev tre filter-kriterier anvendt: æstetisk kvalitet, vurderet med Laion-Aesthetic Score Predictor; bevægelses-styrke, målt via optisk flow ved hjælp af RAFT; og indholdssikkerhed, verificeret gennem Stable Diffusions Sikkerheds-tjekker.

En af de største begrænsninger i eksisterende video-segmenterings-datasets er manglen på detaljerede tekst-annoteringer, der er afgørende for at guide generative modeller:

Forskere understreger manglen på video-underskrifter i sammenlignelige samlinger.

Forskere understreger manglen på video-underskrifter i sammenlignelige samlinger.

Derfor inkorporerer VideoPainter-data-kureringen diverse førende vision-sprog-modeller, herunder CogVLM2 og Chat GPT-4o til at generere nøgle-ramme-baserede undertekster og detaljerede beskrivelser af maskerede områder.

VideoPainter forbedrer forudtrænede DiTs ved at introducere en brugervenlig letvægts-kontekst-encoder, der adskiller baggrunds-kontekst-ekstraktion fra forgrunds-generering, set til øverste højre i det illustrative schema nedenfor:

Konceptuel schema for VideoPainter. VideoPainters kontekst-encoder behandler støjende latente, ned-sampled masker og maskerede video-latente via VAE, og integrerer kun baggrunds-token i den forudtrænede DiT for at undgå tvetydighed. ID Resample-adapteren sikrer identitets-konsistens ved at konkatenerer maskerede områdes-token under træning og resample dem fra tidligere klip under slutning.

Konceptuel schema for VideoPainter. VideoPainters kontekst-encoder behandler støjende latente, ned-sampled masker og maskerede video-latente via VAE, og integrerer kun baggrunds-token i den forudtrænede DiT for at undgå tvetydighed. ID Resample-adapteren sikrer identitets-konsistens ved at konkatenerer maskerede områdes-token under træning og resample dem fra tidligere klip under slutning.

I stedet for at belaste baggrunden med redundant behandling, opererer denne encoder på en strømlinet input: en kombination af støjende latent, maskeret video-latent (ekstraheret via en variational autoencoder, eller VAE), og ned-sampled masker.

Den støjende latent giver generations-kontekst, og den maskerede video-latent er i overensstemmelse med DiTs eksisterende distribution, med målet at forbedre kompatibilitet.

I stedet for at duplikere store dele af modellen, hvilket ifølge forfatterne er sket i tidligere arbejder, integrerer VideoPainter kun de første to lag af DiT. Disse ekstraherede funktioner genindføres i den frosne DiT på en struktureret, gruppevis måde – tidlige-lags-funktioner informerer den første halvdel af modellen, mens senere funktioner raffinerer den anden halvdel.

Derudover sikrer en token-selektiv mekanisme, at kun baggrunds-relevante funktioner genindføres, og forhindrer forvirring mellem maskerede og umaskerede områder. Denne tilgang, som forfatterne hævder, giver VideoPainter mulighed for at opretholde høj trofasthed i baggrunds-bevarelse, mens forgrunds-inpainting-effektiviteten forbedres.

Forfatterne bemærker, at deres metode understøtter diverse stiliseringsmetoder, herunder den mest populære, Low Rank Adaptation (LoRA).

Data og tests

VideoPainter blev trænet ved hjælp af CogVideo-5B-I2V-modellen, samt dens tekst-til-video-ækvivalent. Den kuraterede VPData-samling blev anvendt i en opløsning på 480x720px, med en læringsrate på 1×10-5.

ID Resample-adapteren blev trænet i 2.000 trin, og kontekst-encoderen i 80.000 trin, begge ved hjælp af AdamW-optimerings-algoritmen. Træningen fandt sted i to faser ved hjælp af 64 NVIDIA V100-GPU’er (selv om artiklen ikke specificerer, om de havde 16GB eller 32GB RAM).

For benchmarking blev Davis anvendt for tilfældige masker, og forfatternes eget VPBench for segmenterings-baserede masker.

VPBench-datasettet indeholder objekter, dyr, mennesker, landskaber og diverse opgaver, og dækker fire handlinger: tilføj, fjern, ændr og byt. Samlingen indeholder 45 seks-sekunders-videoer og ni videoer, der i gennemsnit varer 30 sekunder.

Otte metrikker blev anvendt i processen. For maskeret områdes-bevarelse anvendtes Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); Structural Similarity Index (SSIM); og Mean Absolute Error (MAE).

For tekst-alignment anvendtes CLIP Similarity både til at evaluere semantisk afstand mellem klippets undertekst og dens faktiske opfattede indhold, og til at evaluere nøjagtighed af maskerede områder.

For at evaluere den generelle kvalitet af output-videoerne anvendtes Fréchet Video Distance (FVD).

For en kvantitativ sammenligning af video-inpainting satte forfatterne deres system op imod tidligere tilgange ProPainter, COCOCO og Cog-Inp (CogVideoX). Testen bestod i at inpainte den første ramme af en klip ved hjælp af billed-inpainting-modeller, og derefter anvende en billed-til-video (I2V)-baggrund til at propagere resultaterne i en latent blend-operation, i overensstemmelse med en metode foreslået af en 2023-artikel fra Israel.

Da projektets webside ikke er fuldstændigt funktionsdygtig på tidspunktet for skrivning, og da projektets associerede YouTube-video muligvis ikke viser alle eksemplerne på projektets side, er det ret svært at finde video-eksempler, der er meget specifikke for resultaterne i artiklen. Derfor vil vi vise delvise statiske resultater fra artiklen og afslutte artiklen med nogle ekstra video-eksempler, som vi har kunnet udtrække fra projektets side.

Kvantitativ sammenligning af VideoPainter vs. ProPainter, COCOCO og Cog-Inp på VPBench (segmenterings-masker) og Davis (tilfældige masker). Metrikker dækker maskeret områdes-bevarelse, tekst-alignment og video-kvalitet. Rød = bedst, Blå = anden bedst.

Kvantitativ sammenligning af VideoPainter vs. ProPainter, COCOCO og Cog-Inp på VPBench (segmenterings-masker) og Davis (tilfældige masker). Metrikker dækker maskeret områdes-bevarelse, tekst-alignment og video-kvalitet. Rød = bedst, Blå = anden bedst.

Om disse kvalitative resultater kommenterer forfatterne:

‘I segmenterings-baseret VPBench viser ProPainter og COCOCO den dårligste præstation på de fleste metrikker, primært på grund af deres manglende evne til at inpainte fuldstændigt maskerede objekter og den enkelt-baggrunds-arkitekturs svigt i at balancere baggrunds-bevarelse og forgrunds-generering.’

‘I random mask-benchmark Davis viser ProPainter forbedring ved at udnytte delvis baggrunds-information. VideoPainter opnår dog optimal præstation på tværs af både segmenterings-baserede og tilfældige masker takket være sin dual-branch-arkitektur, der effektivt adskiller baggrunds-bevarelse og forgrunds-generering.’

Forfatterne præsenterer derefter statiske eksempler på kvalitative tests, som vi viser nedenfor. I alle tilfælde henviser vi læseren til projektets side og YouTube-video for bedre opløsning.

En sammenligning med inpainting-metoder i tidligere rammer.

En sammenligning med inpainting-metoder i tidligere rammer.

 

Klik for at afspille. Eksempler samlet af os fra ‘resultater’-videoerne på projektets side.  

Om denne kvalitative runde for video-inpainting kommenterer forfatterne:

‘VideoPainter viser konsekvent exceptionelle resultater i video-kohærens, kvalitet og alignment med tekst-underskrift. Notabelt viser ProPainter sig ikke i stand til at generere fuldstændigt maskerede objekter, da den kun afhænger af baggrunds-pixel-propagation i stedet for generering.

‘COCOCO demonstrerer grundlæggende funktionalitet, men kan ikke opretholde konsistent ID i inpainted områder (inkonsistente fartøjers udseende og pludselige terrænændringer) på grund af sin enkelt-baggrunds-arkitektur, der forsøger at balancere baggrunds-bevarelse og forgrunds-generering.

‘Cog-Inp opnår grundlæggende inpainting-resultater; dog fører blending-operationens manglende evne til at detectere maske-grænser til betydelige artefakter.

‘Desuden kan VideoPainter generere kohærente videoer, der overstiger en minut, mens den opretholder ID-konsistens gennem vores ID-resampling.’

Forskere testede også VideoPainters evne til at forbedre undertekster og opnå forbedrede resultater ved denne metode, hvor de satte systemet op imod UniEdit, DiTCtrl og ReVideo.

Video-redigerings-resultater imod tre tidligere tilgange.

Video-redigerings-resultater imod tre tidligere tilgange.

Forfatterne kommenterer:

‘For både standard- og lange videoer i VPBench opnår VideoPainter overlegen præstation, selv om den overgår den end-to-end ReVideo. Denne succes kan tilskrives dens dual-branch-arkitektur, der sikrer fremragende baggrunds-bevarelse og forgrunds-genererings-kapaciteter, mens den opretholder høj trofasthed i ikke-redigerede områder, mens redigerede områder er tæt på redigerings-instruktionerne, suppleret med inpainting-områdes-ID-resampling, der opretholder ID-konsistens i lange videoer.’

Selv om artiklen viser statiske kvalitative eksempler for denne metrik, er de ikke oplysende, og vi henviser læseren til de forskellige eksempler, der er spredt over de forskellige videoer, der er offentliggjort for dette projekt.

Endelig blev der gennemført en menneske-studie, hvor 30 brugere blev bedt om at evaluere 50 tilfældigt valgte generationer fra VPBench- og redigerings-under-afsnittene. Eksemplerne fremhævede baggrunds-bevarelse, alignment til prompt og generel video-kvalitet.

Resultater fra bruger-studiet for VideoPainter.

Resultater fra bruger-studiet for VideoPainter.

Forfatterne påstår:

‘VideoPainter overgår væsentligt eksisterende baseline, og opnår højere præferencerater på tværs af alle evaluering-kriterier i begge opgaver.’

De indrømmer dog, at kvaliteten af VideoPainters generationer afhænger af grund-modellen, der kan have svigt med komplekse bevægelser og fysik; og de observerer, at den også fungerer dårligt med lav-kvalitets-masker eller misalignerede undertekster.

Konklusion

VideoPainter synes at være en værdig tilføjelse til litteraturen. Typisk for nyere løsninger har den dog betydelige beregningskrav. Desuden ligger mange af de valgte eksempler langt fra de bedste eksempler; det ville derfor være interessant at se denne ramme sat op imod fremtidige bidrag og en bredere række af tidligere tilgange.

 

* Det er værd at nævne, at ‘video-redigering’ i denne sammenhæng ikke betyder ‘at samle forskellige klip i en sekvens’, som er den traditionelle betydning af denne term; men snarere direkte at ændre eller på en eller anden måde modificere det indre indhold af eksisterende video-klip, ved hjælp af maskinlærings-teknikker

Offentliggjort mandag, 10. marts 2025. Opdateret lørdag, 25. juli 2026 for at erstatte video.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai