Andersons vinkel
Fjerning av objekter fra video mer effektivt med maskinlÃĶring

Ny forskning fra Kina rapporterer om statens fremherskende resultater â samt en imponerende forbedring i effektivitet â for et nytt videosystem for inpainting som kan fjerne objekter fra filmen med stor dyktighet.

En hanggliderens sele er malt ut med den nye prosedyren. Se kildevideoen for bedre opplÃļsning og flere eksempler. Kilde: https://www.youtube.com/watch?v=NâqC3T2wc4
Teknikken, kalt End-to-End-rammeverk for Flow-Guided video Inpainting (E2FGVI), er ogsÃĨ i stand til ÃĨ fjerne vannmerker og andre typer okklusjoner fra videoinnhold.

E2FGVI beregner prediksjoner for innhold som ligger bak okklusjoner, og muliggjÃļr fjerning av selv merkbare og vanskelige vannmerker. Kilde: https://github.com/MCG-NKU/E2FGVI
(For ÃĨ se flere eksempler i bedre opplÃļsning, se videoen)
Selv om modellen i den publiserte artikkelen ble trent pÃĨ videoer med 432px x 240px (vanligvis lave inndatastÃļrrelser, begrenset av tilgjengelig GPU-plass vs. optimale batch-stÃļrrelser og andre faktorer), har forfatterne siden lansert E2FGVI-HQ, som kan hÃĨndtere videoer i vilkÃĨrlig opplÃļsning.
Koden for den nÃĨvÃĶrende versjonen er tilgjengelig pÃĨ GitHub, mens HQ-versjonen, som ble lansert forrige sÃļndag, kan lastes ned fra Google Drive og Baidu Disk.

Barnet blir i bildet.
E2FGVI kan prosessere videoer med 432Ã240 opplÃļsning pÃĨ 0,12 sekunder per rame pÃĨ en Titan XP-GPU (12GB VRAM), og forfatterne rapporterer at systemet opererer femten ganger raskere enn tidligere statens fremherskende metoder basert pÃĨ optisk strÃļm.

En tennisspiller forlater bildet uventet.
Testet pÃĨ standarddatasett for denne undersektoren av bilde-synteseforskning, var den nye metoden i stand til ÃĨ overgÃĨ rivaler i bÃĨde kvalitative og kvantitative evalueringer.

Tester mot tidligere tilnÃĶrminger. Kilde: https://arxiv.org/pdf/2204.02663.pdf
Den artikkelen heter Towards An End-to-End Framework for Flow-Guided Video Inpainting, og er et samarbeid mellom fire forskere fra Nankai University, sammen med en forsker fra Hisilicon Technologies.
Hva mangler i dette bildet
Foruten de ÃĨpenbare anvendelsene for visuelle effekter, vil hÃļykvalitets video-inpainting bli en kjernedefinert funksjon for nye AI-baserte bilde-syntese- og bilde-endrings-teknologier.
Dette er sÃĶrlig tilfelle for kroppsendrings-motefunksjoner og andre rammeverk som sÃļker ÃĨ âslanke nedâ eller pÃĨ andre mÃĨter endre scener i bilder og videoer. I slike tilfeller er det nÃļdvendig ÃĨ overbevisende âfylle innâ den ekstra bakgrunnen som blir avdekket av syntesen.

Fra en nylig artikkel, er en kroppsendrings-algoritme oppgitt ÃĨ fylle inn den nyoppdagede bakgrunnen nÃĨr et emne er omskalert. Her er denne mangelen representert av den rÃļde konturen som den (i virkeligheten, se bildet til venstre) mer fyltige personen tidligere okkuperte. Basert pÃĨ kildemateriale fra https://arxiv.org/pdf/2203.10496.pdf
Kohorent optisk strÃļm
Optisk strÃļm (OF) har blitt en kjerneteknologi i utviklingen av video-objekt-fjerning. Lik en atlas, gir OF en enkelt kart over en tidssekvens. Ofte brukt til ÃĨ mÃĨle hastighet i datavisjons-initiativer, kan OF ogsÃĨ muliggjÃļre temporalt konsistent inpainting, hvor den samlede summen av oppgaven kan betraktes i ett enkelt pass, i stedet for Disney-stil âper-rameâ-oppmerksomhet, som uunngÃĨelig fÃļrer til temporalt ukontinuitet.
Video-inpainting-metoder til dags dato har sentrert seg rundt en tre-stegs prosess: strÃļm-fullfÃļring, hvor videoen i stor grad kartlegges ut i en diskret og utforskbart enhet; pixel-propagasjon, hvor hullene i âkorrupteâ videoer fylles inn ved ÃĨ propagere piksler i begge retninger; og innholdshallusinasjon (piksler âoppfinnâ som er kjent for de fleste av oss fra deepfakes og tekst-til-bilde-rammeverk som DALL-E-serien) hvor det estimerte âmanglendeâ innholdet oppfinner og setter inn i filmen.
Den sentrale innovasjonen i E2FGVI er ÃĨ kombinere disse tre stegene i ett end-to-end-system, og gjÃļre det unÃļdvendig ÃĨ utfÃļre manuelle operasjoner pÃĨ innholdet eller prosessen.

Artikkelen observerer at behovet for manuell inngripen krever at eldre prosesser ikke tar i bruk en GPU, og gjÃļr dem ganske tidskrevende. Fra artikkelen*:
âVed ÃĨ ta DFVI som et eksempel, fullfÃļrer en video med stÃļrrelsen 432 Ã 240 fra DAVIS, som inneholder omtrent 70 ramer, tar omtrent 4 minutter, noe som er uakseptabelt i de fleste virkelige applikasjoner. Foruten de ovennevnte ulemper, ignorerer bare bruk av et forhÃĨnds-trent bilde-inpainting-nettverk pÃĨ innholdshallusinasjons-stadiet innholdets relasjoner over tidsnÃĶre naboer, og fÃļrer til inkonsistente genererte innhold i videoer.â
Ved ÃĨ forene de tre stegene i video-inpainting, er E2FGVI i stand til ÃĨ erstatte det andre stadiet, piksel-propagasjon, med funksjons-propagasjon. I de mer segmenterte prosessene i tidligere arbeid, er funksjoner ikke like omfattende tilgjengelige, fordi hvert stadium er relativt hermetisk, og arbeidsflyten bare semi-automatisert.
I tillegg har forskerne utviklet en temporal fokus-transformator for innholdshallusinasjons-stadiet, som tar i betraktning ikke bare de direkte naboene av piksler i den nÃĨvÃĶrende ramen (dvs. hva som skjer i den delen av ramen i den foregÃĨende eller neste bildet), men ogsÃĨ de fjerne naboene som er mange ramer unna, og likevel vil pÃĨvirke den kohesive effekten av alle operasjoner som utfÃļres pÃĨ videoen som helhet.
Den nye funksjonsbaserte sentrale delen av arbeidsflyten er i stand til ÃĨ dra nytte av flere funksjonsnivÃĨprosesser og lÃĶrbare samplingsoffsett, mens prosjektets nye fokus-transformator, ifÃļlge forfatterne, utvider stÃļrrelsen pÃĨ fokus-vinduer âfra 2D til 3Dâ.
Tester og data
For ÃĨ teste E2FGVI, evaluerte forskerne systemet mot to populÃĶre video-objekt-segmenteringsdatasett: YouTube-VOS og DAVIS. YouTube-VOS har 3741 treningvideo-klipp, 474 valideringsklipp og 508 testklipp, mens DAVIS har 60 treningvideo-klipp og 90 testklipp.
E2FGVI ble trent pÃĨ YouTube-VOS og evaluert pÃĨ begge datasett. Under trening ble objektmasker (de grÃļnne omrÃĨdene i bildene ovenfor, og den tilhÃļrende YouTube-videoen) generert for ÃĨ simulere video-fullfÃļring.
For mÃĨlinger, adopterte forskerne Peak signal-til-stÃļy-forhold (PSNR), Strukturell likhet (SSIM), Video-basert FrÃĐchet-Inception-avstand (VFID) og Flow Warping-feil â den siste for ÃĨ mÃĨle temporalt stabilitet i den berÃļrte videoen.
De tidligere arkitekturer som systemet ble testet mot, var VINet, DFVI, LGTSM, CAP, FGVC, STTN og FuseFormer.

Fra den kvantitative resultatsjekken i artikkelen. Opp- og ned-piler indikerer at hÃļyere eller lavere tall er bedre, henholdsvis. E2FGVI oppnÃĨr de beste poengene over hele linjen. Metodene blir evaluert ifÃļlge FuseFormer, selv om DFVI, VINet og FGVC ikke er end-to-end-systemer, og det er umulig ÃĨ anslÃĨ deres FLOPs.
I tillegg til ÃĨ oppnÃĨ de beste poengene mot alle konkurranse-systemer, gjennomfÃļrte forskerne en kvalitativ bruker-undersÃļkelse, hvor videoer transformert med fem representative metoder ble vist individuelt til tyve frivillige, som ble bedt om ÃĨ vurdere dem i henhold til visuell kvalitet.

Den vertikale aksen representerer prosentandelen av deltakerne som foretrakk E2FGVI-utgangen i henhold til visuell kvalitet.
Forfatterne bemerker at til tross for den enstemmige preferansen for deres metode, er ett av resultater, FGVC, ikke reflekterer de kvantitative resultater, og de antyder at dette indikerer at E2FGVI mÃĨtte, spesielt, generere âmer visuelt behagelige resultaterâ.
I henhold til effektivitet bemerker forfatterne at deres system kraftig reduserer flytende punkt-operasjoner per sekund (FLOPs) og inferens-tid pÃĨ en enkelt Titan-GPU pÃĨ DAVIS-datasettet, og observerer at resultater viser at E2FGVI kjÃļrer 15 ganger raskere enn strÃļm-baserte metoder.
De kommenterer:
â[E2FGVI] har de laveste FLOPs i kontrast til alle andre metoder. Dette indikerer at den foreslÃĨtte metoden er svÃĶrt effektiv for video-inpainting.â
*Min konvertering av forfatternes inline-citater til lenker.
Â
FÃļrst publisert 19. mai 2022.
Endret tirsdag 28. oktober 2025, for ÃĨ fjerne feilaktig video-innlemming og endre referanser til innlemmet video i artikkelteksten.













