Andersons vinkel

Fjernelse af objekter fra video mere effektivt med maskinelÃĶring

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Nyt forskning fra Kina rapporterer om statens bedste resultater – samt en imponerende forbedring i effektivitet – for et nyt video inpainting-system, der kan fjernelse af objekter fra optagelser med stor dygtighed.

En hang-glider-harness bliver malede ud af den nye procedure. Se kildevideoen (indlejret i bunden af denne artikel) for bedre oplÃļsning og flere eksempler. Kilde: https://www.youtube.com/watch?v=N--qC3T2wc4

En hang-glider-harness bliver malede ud af den nye procedure. Se kildevideoen for bedre oplÃļsning og flere eksempler. Kilde: https://www.youtube.com/watch?v=N–qC3T2wc4

Metoden, der hedder End-to-End framework for Flow-Guided video Inpainting (E2FGVI), er ogsÃĨ i stand til at fjerne vandmÃĶrker og andre former for occlusion fra videoindhold.

E2FGVI beregner forudsigelser for indhold, der ligger bag occlusioner, hvilket muliggÃļr fjernelse af selv bemÃĶrkelsesvÃĶrdige og vanskelige vandmÃĶrker. Kilde: https://github.com/MCG-NKU/E2FGVI

E2FGVI beregner forudsigelser for indhold, der ligger bag occlusioner, hvilket muliggÃļr fjernelse af selv bemÃĶrkelsesvÃĶrdige og vanskelige vandmÃĶrker. Kilde: https://github.com/MCG-NKU/E2FGVI

(For at se flere eksempler i bedre oplÃļsning, se videoen)

Selvom modellen i den publicerede artikel var trÃĶnet pÃĨ 432px x 240px videoer (almindelige lav indtastestÃļrrelser, begrÃĶnset af tilgÃĶngelig GPU-plads vs. optimale batch-stÃļrrelser og andre faktorer), har forfatterne siden udgivet E2FGVI-HQ, der kan hÃĨndtere videoer i vilkÃĨrlig oplÃļsning.

Koden for den aktuelle version er tilgÃĶngelig pÃĨ GitHub, mens HQ-versionen, der blev udgivet sidste sÃļndag, kan downloades fra Google Drive og Baidu Disk.

Barnet bliver i billedet.

Barnet bliver i billedet.

E2FGVI kan behandle 432×240 video pÃĨ 0,12 sekunder per frame pÃĨ en Titan XP GPU (12GB VRAM), og forfatterne rapporterer, at systemet opererer femten gange hurtigere end tidligere statens bedste metoder baseret pÃĨ optical flow.

En tennisspiller forlader pladsen uventet.

En tennisspiller forlader pladsen uventet.

Testet pÃĨ standard datasets for denne undersektor af billedsynsforskning, var den nye metode i stand til at overgÃĨ rivaler i bÃĨde kvalitative og kvantitative evalueringer.

Test mod tidligere tilgange. Kilde: https://arxiv.org/pdf/2204.02663.pdf

Test mod tidligere tilgange. Kilde: https://arxiv.org/pdf/2204.02663.pdf

Den artikel hedder Towards An End-to-End Framework for Flow-Guided Video Inpainting, og er et samarbejde mellem fire forskere fra Nankai University, sammen med en forsker fra Hisilicon Technologies.

Hvad mangler i dette billede

Ud over dens ÃĨbenlyse anvendelser for visuelle effekter, er hÃļjkvalitets video inpainting pÃĨ vej til at blive en kernefunktion i nye AI-baserede billedsyns- og billedÃĶndrings-teknologier.

Dette er sÃĶrligt tilfÃĶldet for krop-ÃĶndrende modeapplikationer og andre rammer, der sÃļger at ‘slanke’ eller pÃĨ anden mÃĨde ÃĶndre scener i billeder og videoer. I sÃĨdanne tilfÃĶlde er det nÃļdvendigt at overbevisende ‘fyldte’ den ekstra baggrund, der bliver afslÃļret af syntesen.

Fra en ny artikel, er en krop-'omformnings'-algoritme opgaven at male den nyopdagede baggrund, nÃĨr en person bliver ÃĶndret i stÃļrrelse. Her er manglen reprÃĶsenteret af den rÃļde kontur, som den (i virkeligheden, se billedet til venstre) mere fyldige person tidligere havde besat. Basieret pÃĨ kildemateriale fra https://arxiv.org/pdf/2203.10496.pdf

Fra en ny artikel, er en krop-‘omformnings’-algoritme opgaven at male den nyopdagede baggrund, nÃĨr en person bliver ÃĶndret i stÃļrrelse. Her er manglen reprÃĶsenteret af den rÃļde kontur, som den (i virkeligheden, se billedet til venstre) mere fyldige person tidligere havde besat. Basieret pÃĨ kildemateriale fra https://arxiv.org/pdf/2203.10496.pdf

KohÃĶrent optisk flow

Optisk flow (OF) er blevet en kerne-teknologi i udviklingen af video-objekt-fjernelse. Ligesom en atlas, giver OF en enkelt kort over en tidssekvens. OF bruges ofte til at mÃĨle hastighed i computer vision-initiativer, og kan ogsÃĨ muliggÃļre temporalt konsistent inpainting, hvor den samlede sum af opgaven kan overvejes i en enkelt passering, i stedet for Disney-stil ‘per-frame’-opmÃĶrksomhed, der uundgÃĨeligt fÃļrer til temporalt ukontinuitet.

Video inpainting-metoder indtil nu har centreret sig om en tre-trinsproces: flow completion, hvor videoen grundlÃĶggende kortlÃĶgges til en diskret og udforskbar enhed; pixel propagation, hvor hullerne i ‘korrupte’ videoer fyldes med bidirectionally propagating pixels; og content hallucination (pixel ‘opfindelse’, der er kendt for de fleste af os fra deepfakes og tekst-til-billede-rammer som DALL-E-serien), hvor den estimerede ‘manglende’ indhold opfindes og indsÃĶttes i optagelserne.

Den centrale innovation i E2FGVI er at kombinere disse tre trin i et end-to-end-system, der eliminerer behovet for manuelle operationer pÃĨ indholdet eller processen.

Artiklen bemÃĶrker, at behovet for manuel indgriben krÃĶver, at ÃĶldre processer ikke tager fordel af en GPU, hvilket gÃļr dem ret tidskrÃĶvende. Fra artiklen*:

‘Tag DFVI som eksempel, fuldfÃļrer en video med stÃļrrelsen 432 × 240 fra DAVIS, der indeholder omkring 70 frames, krÃĶver omkring 4 minutter, hvilket er uacceptabelt i de fleste virkelige anvendelser. Ud over ovennÃĶvnte ulemper ignorerer kun brug af et forudtrÃĶnet billed inpainting-netvÃĶrk pÃĨ indholdshallucinations-stadiet indholdets relationer pÃĨ tvÃĶrs af temporale naboer, hvilket fÃļrer til inkonsistent genereret indhold i videoer.’

Ved at forene de tre trin i video inpainting, er E2FGVI i stand til at erstatte det andet trin, pixel propagation, med feature propagation. I de mere segmenterede processer i tidligere arbejder er funktioner ikke sÃĨ omfattende tilgÃĶngelige, fordi hvert trin er relativt hermetisk, og arbejdsgangen kun semi-automatiseret.

Derudover har forskerne udviklet en temporal focal transformer til indholdshallucinations-stadiet, der ikke kun tager hensyn til direkte naboer af pixels i den aktuelle ramme (dvs. hvad der sker i den del af ramen i den foregÃĨende eller nÃĶste billedsekvens), men ogsÃĨ fjerne naboer, der er mange billeder vÃĶk, og alligevel vil pÃĨvirke den samlede effekt af enhver operation, der udfÃļres pÃĨ videoen som helhed.

Arkitektur af E2FGVI.

Arkitektur af E2FGVI.

Den nye funktion-baserede centrale sektion af arbejdsgangen kan udnytte mere funktion-niveau-processer og lÃĶrbare sampling-offsets, mens projektets nye fokustransformer, ifÃļlge forfatterne, udvider stÃļrrelsen af fokus-vinduer ‘fra 2D til 3D’.

Tests og data

For at teste E2FGVI, evaluerede forskerne systemet mod to populÃĶre video-objekt-segmenterings-datasets: YouTube-VOS og DAVIS. YouTube-VOS indeholder 3741 trÃĶningsvideo-klip, 474 valideringsklip og 508 testklip, mens DAVIS indeholder 60 trÃĶningsvideo-klip og 90 testklip.

E2FGVI blev trÃĶnet pÃĨ YouTube-VOS og evaluering pÃĨ begge datasets. Under trÃĶning blev objektmasker (de grÃļnne omrÃĨder i billederne ovenfor, og den tilhÃļrende YouTube-video) genereret for at simulere video-gennemfÃļrelse.

For metrikkerne valgte forskerne Peak signal-til-stÃļj-forhold (PSNR), Strukturel lignende (SSIM), Video-baseret FrÃĐchet Inception Distance (VFID) og Flow Warping Error – sidstnÃĶvnte for at mÃĨle temporal stabilitet i den pÃĨvirkede video.

De tidligere arkitekturer, som systemet blev testet mod, var VINet, DFVI, LGTSM, CAP, FGVC, STTN og FuseFormer.

Fra den kvantitative resultatssektion af artiklen. Op og ned-pile viser, at hÃļjere eller lavere tal er bedre, henholdsvis. E2FGVI opnÃĨr de bedste score pÃĨ tvÃĶrs af brÃĶttet. Metoderne er evalueret ift. FuseFormer, selvom DFVI, VINet og FGVC ikke er end-to-end-systemer, hvilket gÃļr det umuligt at estimer deres FLOPs.

Fra den kvantitative resultatssektion af artiklen. Op og ned-pile viser, at hÃļjere eller lavere tal er bedre, henholdsvis. E2FGVI opnÃĨr de bedste score pÃĨ tvÃĶrs af brÃĶttet. Metoderne er evalueret ift. FuseFormer, selvom DFVI, VINet og FGVC ikke er end-to-end-systemer, hvilket gÃļr det umuligt at estimer deres FLOPs.

Ud over at opnÃĨ de bedste score mod alle konkurrerende systemer, gennemfÃļrte forskerne en kvalitativ brugerundersÃļgelse, hvor videoer, der var transformeret med fem reprÃĶsentative metoder, blev vist individuelt til tyve frivillige, der blev bedt om at bedÃļmme dem i forhold til visuel kvalitet.

Den lodrette akse reprÃĶsenterer procentdelen af deltagere, der foretrak E2FGVI-udgangen i forhold til visuel kvalitet.

Den lodrette akse reprÃĶsenterer procentdelen af deltagere, der foretrak E2FGVI-udgangen i forhold til visuel kvalitet.

Forfatterne bemÃĶrker, at pÃĨ trods af den enstemmige foretrÃĶkning for deres metode, er en af resultaterne, FGVC, ikke i overensstemmelse med de kvantitative resultater, og de foreslÃĨr, at dette indikerer, at E2FGVI muligvis genererer ‘mere visuelt behagelige resultater’.

I forhold til effektivitet bemÃĶrker forfatterne, at deres system kraftigt reducerer flydende punkt-operationer per sekund (FLOPs) og inferens-tid pÃĨ en enkelt Titan GPU pÃĨ DAVIS-datasettet, og observerer, at resultaterne viser, at E2FGVI kÃļrer x15 hurtigere end flow-baserede metoder.

De kommenterer:

‘[E2FGVI] har de laveste FLOPs i modsÃĶtning til alle andre metoder. Dette indikerer, at den foreslÃĨede metode er meget effektiv for video inpainting.’

*Min konvertering af forfatternes inline-citationer til hyperlinks.

 

FÃļrst publiceret 19. maj 2022.

Ændret tirsdag den 28. oktober 2025, for at fjerne fejlbehÃĶftet video-indlejring og ÃĶndre henvisninger til indlejret video i artiklens indhold.

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]