Andersons vinkel

Fjerning av objekter fra video mer effektivt med maskinlÃĶring

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Ny forskning fra Kina rapporterer om statens fremherskende resultater – samt en imponerende forbedring i effektivitet – for et nytt videosystem for inpainting som kan fjerne objekter fra filmen med stor dyktighet.

En hanggliderens sele er malt ut med den nye prosedyren. Se kildevideoen (innlemmet nedenfor i artikkelen) for bedre opplÃļsning og flere eksempler. Kilde: https://www.youtube.com/watch?v=N--qC3T2wc4

En hanggliderens sele er malt ut med den nye prosedyren. Se kildevideoen for bedre opplÃļsning og flere eksempler. Kilde: https://www.youtube.com/watch?v=N–qC3T2wc4

Teknikken, kalt End-to-End-rammeverk for Flow-Guided video Inpainting (E2FGVI), er ogsÃĨ i stand til ÃĨ fjerne vannmerker og andre typer okklusjoner fra videoinnhold.

E2FGVI beregner prediksjoner for innhold som ligger bak okklusjoner, og muliggjÃļr fjerning av selv merkbare og vanskelige vannmerker. Kilde: https://github.com/MCG-NKU/E2FGVI

E2FGVI beregner prediksjoner for innhold som ligger bak okklusjoner, og muliggjÃļr fjerning av selv merkbare og vanskelige vannmerker. Kilde: https://github.com/MCG-NKU/E2FGVI

(For ÃĨ se flere eksempler i bedre opplÃļsning, se videoen)

Selv om modellen i den publiserte artikkelen ble trent pÃĨ videoer med 432px x 240px (vanligvis lave inndatastÃļrrelser, begrenset av tilgjengelig GPU-plass vs. optimale batch-stÃļrrelser og andre faktorer), har forfatterne siden lansert E2FGVI-HQ, som kan hÃĨndtere videoer i vilkÃĨrlig opplÃļsning.

Koden for den nÃĨvÃĶrende versjonen er tilgjengelig pÃĨ GitHub, mens HQ-versjonen, som ble lansert forrige sÃļndag, kan lastes ned fra Google Drive og Baidu Disk.

Barnet blir i bildet.

Barnet blir i bildet.

E2FGVI kan prosessere videoer med 432×240 opplÃļsning pÃĨ 0,12 sekunder per rame pÃĨ en Titan XP-GPU (12GB VRAM), og forfatterne rapporterer at systemet opererer femten ganger raskere enn tidligere statens fremherskende metoder basert pÃĨ optisk strÃļm.

En tennisspiller forlater bildet uventet.

En tennisspiller forlater bildet uventet.

Testet pÃĨ standarddatasett for denne undersektoren av bilde-synteseforskning, var den nye metoden i stand til ÃĨ overgÃĨ rivaler i bÃĨde kvalitative og kvantitative evalueringer.

Tester mot tidligere tilnÃĶrminger. Kilde: https://arxiv.org/pdf/2204.02663.pdf

Tester mot tidligere tilnÃĶrminger. Kilde: https://arxiv.org/pdf/2204.02663.pdf

Den artikkelen heter Towards An End-to-End Framework for Flow-Guided Video Inpainting, og er et samarbeid mellom fire forskere fra Nankai University, sammen med en forsker fra Hisilicon Technologies.

Hva mangler i dette bildet

Foruten de ÃĨpenbare anvendelsene for visuelle effekter, vil hÃļykvalitets video-inpainting bli en kjernedefinert funksjon for nye AI-baserte bilde-syntese- og bilde-endrings-teknologier.

Dette er sÃĶrlig tilfelle for kroppsendrings-motefunksjoner og andre rammeverk som sÃļker ÃĨ ‘slanke ned’ eller pÃĨ andre mÃĨter endre scener i bilder og videoer. I slike tilfeller er det nÃļdvendig ÃĨ overbevisende ‘fylle inn’ den ekstra bakgrunnen som blir avdekket av syntesen.

Fra en nylig artikkel, er en kroppsendrings-algoritme oppgitt ÃĨ fylle inn den nyoppdagede bakgrunnen nÃĨr et emne er omskalert. Her er denne mangelen representert av den rÃļde konturen som den (i virkeligheten, se bildet til venstre) mer fyltige personen tidligere okkuperte. Basert pÃĨ kildemateriale fra https://arxiv.org/pdf/2203.10496.pdf

Fra en nylig artikkel, er en kroppsendrings-algoritme oppgitt ÃĨ fylle inn den nyoppdagede bakgrunnen nÃĨr et emne er omskalert. Her er denne mangelen representert av den rÃļde konturen som den (i virkeligheten, se bildet til venstre) mer fyltige personen tidligere okkuperte. Basert pÃĨ kildemateriale fra https://arxiv.org/pdf/2203.10496.pdf

Kohorent optisk strÃļm

Optisk strÃļm (OF) har blitt en kjerneteknologi i utviklingen av video-objekt-fjerning. Lik en atlas, gir OF en enkelt kart over en tidssekvens. Ofte brukt til ÃĨ mÃĨle hastighet i datavisjons-initiativer, kan OF ogsÃĨ muliggjÃļre temporalt konsistent inpainting, hvor den samlede summen av oppgaven kan betraktes i ett enkelt pass, i stedet for Disney-stil ‘per-rame’-oppmerksomhet, som uunngÃĨelig fÃļrer til temporalt ukontinuitet.

Video-inpainting-metoder til dags dato har sentrert seg rundt en tre-stegs prosess: strÃļm-fullfÃļring, hvor videoen i stor grad kartlegges ut i en diskret og utforskbart enhet; pixel-propagasjon, hvor hullene i ‘korrupte’ videoer fylles inn ved ÃĨ propagere piksler i begge retninger; og innholdshallusinasjon (piksler ‘oppfinn’ som er kjent for de fleste av oss fra deepfakes og tekst-til-bilde-rammeverk som DALL-E-serien) hvor det estimerte ‘manglende’ innholdet oppfinner og setter inn i filmen.

Den sentrale innovasjonen i E2FGVI er ÃĨ kombinere disse tre stegene i ett end-to-end-system, og gjÃļre det unÃļdvendig ÃĨ utfÃļre manuelle operasjoner pÃĨ innholdet eller prosessen.

Artikkelen observerer at behovet for manuell inngripen krever at eldre prosesser ikke tar i bruk en GPU, og gjÃļr dem ganske tidskrevende. Fra artikkelen*:

‘Ved ÃĨ ta DFVI som et eksempel, fullfÃļrer en video med stÃļrrelsen 432 × 240 fra DAVIS, som inneholder omtrent 70 ramer, tar omtrent 4 minutter, noe som er uakseptabelt i de fleste virkelige applikasjoner. Foruten de ovennevnte ulemper, ignorerer bare bruk av et forhÃĨnds-trent bilde-inpainting-nettverk pÃĨ innholdshallusinasjons-stadiet innholdets relasjoner over tidsnÃĶre naboer, og fÃļrer til inkonsistente genererte innhold i videoer.’

Ved ÃĨ forene de tre stegene i video-inpainting, er E2FGVI i stand til ÃĨ erstatte det andre stadiet, piksel-propagasjon, med funksjons-propagasjon. I de mer segmenterte prosessene i tidligere arbeid, er funksjoner ikke like omfattende tilgjengelige, fordi hvert stadium er relativt hermetisk, og arbeidsflyten bare semi-automatisert.

I tillegg har forskerne utviklet en temporal fokus-transformator for innholdshallusinasjons-stadiet, som tar i betraktning ikke bare de direkte naboene av piksler i den nÃĨvÃĶrende ramen (dvs. hva som skjer i den delen av ramen i den foregÃĨende eller neste bildet), men ogsÃĨ de fjerne naboene som er mange ramer unna, og likevel vil pÃĨvirke den kohesive effekten av alle operasjoner som utfÃļres pÃĨ videoen som helhet.

Arkitektur av E2FGVI.

Arkitektur av E2FGVI.

Den nye funksjonsbaserte sentrale delen av arbeidsflyten er i stand til ÃĨ dra nytte av flere funksjonsnivÃĨprosesser og lÃĶrbare samplingsoffsett, mens prosjektets nye fokus-transformator, ifÃļlge forfatterne, utvider stÃļrrelsen pÃĨ fokus-vinduer ‘fra 2D til 3D’.

Tester og data

For ÃĨ teste E2FGVI, evaluerte forskerne systemet mot to populÃĶre video-objekt-segmenteringsdatasett: YouTube-VOS og DAVIS. YouTube-VOS har 3741 treningvideo-klipp, 474 valideringsklipp og 508 testklipp, mens DAVIS har 60 treningvideo-klipp og 90 testklipp.

E2FGVI ble trent pÃĨ YouTube-VOS og evaluert pÃĨ begge datasett. Under trening ble objektmasker (de grÃļnne omrÃĨdene i bildene ovenfor, og den tilhÃļrende YouTube-videoen) generert for ÃĨ simulere video-fullfÃļring.

For mÃĨlinger, adopterte forskerne Peak signal-til-stÃļy-forhold (PSNR), Strukturell likhet (SSIM), Video-basert FrÃĐchet-Inception-avstand (VFID) og Flow Warping-feil – den siste for ÃĨ mÃĨle temporalt stabilitet i den berÃļrte videoen.

De tidligere arkitekturer som systemet ble testet mot, var VINet, DFVI, LGTSM, CAP, FGVC, STTN og FuseFormer.

Fra den kvantitative resultatsjekken i artikkelen. Opp- og ned-piler indikerer at hÃļyere eller lavere tall er bedre, henholdsvis. E2FGVI oppnÃĨr de beste poengene over hele linjen. Metodene blir evaluert ifÃļlge FuseFormer, selv om DFVI, VINet og FGVC ikke er end-to-end-systemer, og det er umulig ÃĨ anslÃĨ deres FLOPs.

Fra den kvantitative resultatsjekken i artikkelen. Opp- og ned-piler indikerer at hÃļyere eller lavere tall er bedre, henholdsvis. E2FGVI oppnÃĨr de beste poengene over hele linjen. Metodene blir evaluert ifÃļlge FuseFormer, selv om DFVI, VINet og FGVC ikke er end-to-end-systemer, og det er umulig ÃĨ anslÃĨ deres FLOPs.

I tillegg til ÃĨ oppnÃĨ de beste poengene mot alle konkurranse-systemer, gjennomfÃļrte forskerne en kvalitativ bruker-undersÃļkelse, hvor videoer transformert med fem representative metoder ble vist individuelt til tyve frivillige, som ble bedt om ÃĨ vurdere dem i henhold til visuell kvalitet.

Den vertikale aksen representerer prosentandelen av deltakerne som foretrakk E2FGVI-utgangen i henhold til visuell kvalitet.

Den vertikale aksen representerer prosentandelen av deltakerne som foretrakk E2FGVI-utgangen i henhold til visuell kvalitet.

Forfatterne bemerker at til tross for den enstemmige preferansen for deres metode, er ett av resultater, FGVC, ikke reflekterer de kvantitative resultater, og de antyder at dette indikerer at E2FGVI mÃĨtte, spesielt, generere ‘mer visuelt behagelige resultater’.

I henhold til effektivitet bemerker forfatterne at deres system kraftig reduserer flytende punkt-operasjoner per sekund (FLOPs) og inferens-tid pÃĨ en enkelt Titan-GPU pÃĨ DAVIS-datasettet, og observerer at resultater viser at E2FGVI kjÃļrer 15 ganger raskere enn strÃļm-baserte metoder.

De kommenterer:

‘[E2FGVI] har de laveste FLOPs i kontrast til alle andre metoder. Dette indikerer at den foreslÃĨtte metoden er svÃĶrt effektiv for video-inpainting.’

*Min konvertering av forfatternes inline-citater til lenker.

 

FÃļrst publisert 19. mai 2022.

Endret tirsdag 28. oktober 2025, for ÃĨ fjerne feilaktig video-innlemming og endre referanser til innlemmet video i artikkelteksten.

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]