Andersonin kulma

Esineiden ja henkilöiden poistaminen videosta tekoälyllä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

Ei, lapsi ei jää kuvassa, jos tekoälyllä on jotain sanottavaa.

 

Henkilöiden ja esineiden poistaminen kuvista ja videosta on suosittu tutkimuksen alue VFX-keskeisessä tekoälykirjallisuudessa, ja siinä on kasvava määrä omistautuneita tietoja ja kehyksiä, jotka ovat omistautuneet haasteen ottamiseen. Fudanin yliopiston suuren datan instituutin viimeisin, EffectErase, on “vaikutusherkkä” videon esineenpoistojärjestelmä, jonka kirjoittajat väittävät parantavan merkittävästi nykyisestä tilasta testeissä:

Kokoelma materiaalista projektin verkkosivuilta, EffectErase-menetelmän esimerkkejä (huomaa, että vaikka tarjoamme linkin, lähdeverkkosivu sisältää niin monta korkearesoluutioista ja ei-optimoituja autoplay-videota, että se voi vaikuttaa verkkoselaimesi vakauden. Liitetty YouTube-videota on helpompi ja täydellisempi viite, ja se on liitetty artikkelin loppuun). Lähde

Uusi työ käsitti puolittain uuden tietojoukon luomisen, joka käsittää lähes 350 alkuperäistä todellista ja syntetisoitua kohtausta (joka hyödyntää julkisia repositorioita*), joko kuvattu omistautuneilla laitteilla tai haettu ja uudelleenohjattu avoimeen lähdekoodiin perustuvaan Blender 3D-kehykseen.

Hybridi Video Object Removal (VOR) -tietojoukko muodostaa EffectErase -sovelluksen perustan, joka on rakennettu Wan2.1 -videogenerointijärjestelmän päälle. Järjestelmä määrittää myös kaksi uutta liittyvää vertailukohtaa: VOR Eval ja VOR Wild – vastaavasti näytteille ja ilman todellista arvoa.

(Vaikka paperilla on liittyvä projekti, se on melko kuormittunut useilla korkearesoluutioisilla videoilla, ja se on vaikea ladata; joten pyydän viittaamaan poimimiini katkelmiin liitetyssä videossa yläpuolella, jos projektin verkkosivu on vaikea käyttää)

Vertailu määrillisten arvojen välillä vertailukelpoisissa aiemmissa tietoja, uuden tarjouksen suhteen. Lähde - https://arxiv.org/pdf/2603.19224

Vertailu määrillisten arvojen välillä vertailukelpoisissa aiemmissa tietoja, uuden tarjouksen suhteen. Lähde

Tutkijat väittävät, että heidän lähestymistapansa tuottaa huipputason suorituskyvyn sekä määrällisissä mittareissa että laadullisissa tuloksissa, jotka on määritetty ihmisten tutkimuksessa.

He huomauttavat, että aiemmat työt eivät aina ole onnistuneet poistamaan esineiden liitännäisiä vaikutuksia, kuten varjoja ja heijastuksia, ja että heidän tietojoukkonsa on huolellisesti luotu korjaamaan tämän puutteen:

Esimerkkejä aiemmista lähestymistavoista, jotka eivät ole onnistuneet katsomaan esineen poistamista, sekundaarisia osoittimia, kuten varjoja ja heijastuksia.

Esimerkkejä aiemmista lähestymistavoista, jotka eivät ole onnistuneet katsomaan esineen poistamista, sekundaarisia osoittimia, kuten varjoja ja heijastuksia.

Uusi paperi on nimeltään EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing, ja se tulee neljältä tutkijalta Fudanin yliopiston tietojenkäsittely- ja tekoälytieteen tiedekunnasta.

Menetelmä

Hybridi VOR -tietojoukko suunniteltiin kattamaan riittävän laaja skaala skenaarioita, jotta se käsittäisi kaikki esineen poistamisen videosta aiheuttamat vaikutukset:

VOR-tietojoukon pareittaiset kehykset osoittavat, miten esineen poistaminen on laajennettava esineen näkyvän aiheuttaman vaikutuksen ulkopuolelle, esimerkkejä, jotka osoittavat peittämisen, varjon, valaistuksen siirtymisen, heijastuksen ja fyysisen muodonmuutoksen, jotka esitetään syötteenä (esine läsnä) sekä vastaavan puhdas tausta poiston jälkeen.

VOR-tietojoukon pareittaiset kehykset osoittavat, miten esineen poistaminen on laajennettava esineen näkyvän aiheuttaman vaikutuksen ulkopuolelle, esimerkkejä, jotka osoittavat peittämisen, varjon, valaistuksen siirtymisen, heijastuksen ja fyysisen muodonmuutoksen, jotka esitetään syötteenä (esine läsnä) sekä vastaavan puhdas tausta poiston jälkeen. Lisäesimerkkejä löytyy liitetystä videosta artikkelin lopusta.

Viisi edustavaa “häiriötyyppiä”, joita on käsiteltävä, määritellään kirjoittajien toimesta peittäminen, mukaan lukien erilaiset lasi- ja savupeittämiset; varjot; valaistus (esimerkiksi, kun esine, joka poistetaan, luo tai muuttaa valon kulkua); heijastus; ja muodonmuutos (esimerkiksi, käyttäjän jälki tyynyllä, joka ei pitäisi selviytyä henkilön poistamisesta).

VOR-tietojoukon rakennusputki, joka yhdistää Blenderillä generoituja synteettisiä kohtauksia todellisten tallenteiden kanssa, joissa synteettinen data on rakennettu kuratoiduista 3D-ympäristöistä, esineistä ja kamerareiteistä, ja todellisia kuvia, jotka on tallennettu eri kohtauksissa, ja jotka on täydennetty Ken Burns -liikkeellä. SAM2-segmentointi ja manuaalinen hienosäätö tuottavat pareittaiset etualan ja taustan videokolmoston ja vastaavat maskit.

VOR-tietojoukon rakennusputki, joka yhdistää Blenderillä generoituja synteettisiä kohtauksia todellisten tallenteiden kanssa, joissa synteettinen data on rakennettu kuratoiduista 3D-ympäristöistä, esineistä ja kamerareiteistä, ja todellisia kuvia, jotka on tallennettu eri kohtauksissa, ja jotka on täydennetty Ken Burns -liikkeellä. SAM2-segmentointi ja manuaalinen hienosäätö tuottavat pareittaiset etualan ja taustan videokolmoston ja vastaavat maskit.

Todellisille alkuperäisille tiedoille tutkijat käyttivät kiinteitä kameroiden tallentamaan “kyllä” ja “ei” -kohtauksia, jotka käsittivät laajan valikoiman ympäristöjä, päivän aikaa ja sääolosuhteita.

Synteettisille tiedoille useita näkökulmia renderöitiin, ja moniesinekohtauksia luotiin, joissa oli tarkoituksella monimutkaisia ja haastavia kameraliikkeitä, kuten ne, jotka voivat esiintyä todellisissa kuvissa; ja tutkijat huomauttavat, että tämä lähestymistapa on monimutkaisempi ja vaativampi kuin Remove Objects with Side Effects in Videos (ROSE) -tietojoukon vastaava lähestymistapa.

Lisäämällä liikkeen monimuotoisuutta Ken Burns -vaikutus sovellettiin kameran tallentamiin pareihin, lisäten hallittuja panoraamoja, zoomauksia ja lieviä käsin pidettyjä liikkeitä neljääntoista ennalta määritettyä sääntöä, viisi liikemallia otettiin näyteparista, samalla kun crop pidettiin alkuperäisen kehyksen sisällä.

Scala ja monimuotoisuus laajennettiin yhdistämällä synteettisiä esineitä useisiin kamerajärjestelmiin, Maskit generoitiin asettamalla manuaalisia pistekohtia avainkehyksiin, segmentointi eteni Segment Anything 2 (SAM2):n avulla, puhdistamalla ja hienosäätämällä tulokset, ja kokoamalla validoidut etualan, taustan ja maskin kolmoston koulutukseen.

Lopullinen kokoelma käsittää 145 tuntia videota 60 000 pareittaisen videon yli, sekä todellisia että synteettisiä, 366 esineen luokkaa 443 kohtauksessa.

EffectErase -verkko itse ottaa aineiston Variational Auto-Encoderin (VAE) kautta, ja latentoisen melunpoiston käsittelee Wan2.1. Tämän rungon päällä EffectErase toimii Removal-Insertion Joint Learning, joka kouluttaa molemmat tehtävät yhdessä samalla alueella; Task-Aware Region Guidance (TARG), joka käyttää esine- ja tehtävätokeneita ristiriitaisella huomiolla mallintamaan aikaa ja tilaa koskevia linkkejä esineiden ja niiden vaikutusten välillä, ja sallii tehtävän vaihtamisen; ja Effect Consistency Loss, joka kohdistaa vaikutusalueita poistamisen ja lisäämisen tehtävien yli:

EffectErase-kehyksen skeema. Koulutuksen aikana pareittaiset videot koodataan jaettaisiin latentoitilaan, yhdistetään melkuun ja prosessoidaan diffuusiomuodonmuodostimella, jota ohjataan tehtävänäköiseksi ristiriitaisella huomiolla, kun taas vaikutuksen johdonmukaisuuden tappio kohdistaa poistamisen ja lisäämisen alueita, jotta molemmat tehtävät keskittyvät samaan alueeseen.

EffectErase-kehyksen skeema. Koulutuksen aikana pareittaiset videot koodataan jaettaisiin latentoitilaan, yhdistetään melkuun ja prosessoidaan diffuusiomuodonmuodostimella, jota ohjataan tehtävänäköiseksi ristiriitaisella huomiolla, kun taas vaikutuksen johdonmukaisuuden tappio kohdistaa poistamisen ja lisäämisen alueita, jotta molemmat tehtävät keskittyvät samaan alueeseen.

Itse poistamis- ja lisäämistehtävät koulutetaan yhdessä, jaettua diffuusiopohjaista runkoa käyttäen, jotta malli oppii keskittymään samaan vaikuttavaan alueeseen ja rakenteellisiin vihjeisiin.

Videot, jotka sisältävät esineitä, tausta-vain videot ja maskit, koodataan latentoitilaan; melku lisätään diffuusiokoulutukseen, ja malli oppii palauttamaan puhdistetut edustukset tehtäväkohtaisen ohjauksen alaisena. Kevyt sovittimen avulla meluisat ominaisuudet yhdistetään poistamisen tai lisäämisen ehdolla, jotta molemmat tehtävät voivat jakaa valvontaa, pysyen kuitenkin ohjattavina.

Task-Aware Region Guidance luo tehtäväkohtaisen signaalin yhdistämällä kielen tokenit visuaalisten ominaisuuksien kanssa, jotka on poimittu etualan esineestä CLIP:n avulla, korvaamalla geneerisen esineen tokenin upotuksesta, joka on johdettu itse kuvan sisällöstä. Tämä yhdistetty edustus ruokitaan runkoon ristiriitaisen huomion kautta, jotta malli voi seurata, miten esine ja sen visuaaliset vaikutukset kehittyvät ajan ja tilan suhteen, ja mahdollistaakseen joustavan vaihtamisen poistamisen ja lisäämisen välillä.

Effect Consistency Loss pakottaa poistamisen ja lisäämisen prosessit keskittymään samaan muuttuneeseen alueeseen, koska molemmat tehtävät käsittelevät samaa esinettä ja sen visuaalista vaikutusta. Huomio-kartat kummastakin haarasta yhdistetään pehmeisiin alueen karttoihin, ja kohdistetaan eron kartan avulla, joka lasketaan esineen ja taustan videoiden avulla, jotta hienot muutokset, kuten valaistus ja varjot, säilytetään. Tämä lisätty tappio auttaa lisäämisen ohjaamista poistamisessa ja pitää molemmat tehtävät johdonmukaisina.

Tiedot ja testit

Tutkijat testasivat lähestymistapaansa useita täyttämismenetelmiä, videon täyttämismenetelmiä ja esineen poistamismenetelmiä vastaan: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; ja MiniMax-Remover.

Wan2.1:aa hienosäädettiin LoRA:n avulla†† VOR-tietojoukon avulla resoluutiolla 832x480px. 81 peräkkäistä kehystä (joka on WANin tehokas raja, jonka ylittäminen voi aiheuttaa virheitä) otettiin satunnaisesti koulutukseen, joka kesti 129 000 iteraatiota eräkoon 8:lla, kahdeksalla H100-grafiikkaprosessorilla, joista jokaisella oli 80 GB VRAM:ia. Opetusnopeus asetettiin 1×102:een, ja LoRA-arvo 256:aan.

ROSE-Benchmark -synthetic -kokoelma oli ainoa ulkoinen tietojoukko, jota testattiin; kaksi muuta olivat VOR-Eval, VOR -tietojoukon testijako; ja VOR-Wild, testijoukko, joka koostui 195:stä internetistä poimittuista dynaamisista videoista.

Mittareina käytettiin Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); ja Fréchet Video Distance (FVD). Lisäksi tehtiin käyttäjätutkimus 195:stä VOR-Wildista generoidusta videosta, ja 20 vapaaehtoisen keskimääräiset arviot otettiin huomioon.

Lisäksi kirjoittajat keksivät QScore -mittarin, joka hyödyntää Qwen-VL -monimodaalista mallia, arvioidakseen poistetun esineen videon laadun, jäännösmuodostumien tai ympäristön poistamisen osalta, kuten varjoja ja valaistusvaikutuksia:

Määrällinen vertailu ROSE- ja VOR-benchmarkissa, joissa näkyvät parhaat ja toiseksi parhaat tulokset lihavoituna ja alaviivattuna.

Määrällinen vertailu ROSE- ja VOR-benchmarkissa, joissa näkyvät parhaat ja toiseksi parhaat tulokset lihavoituna ja alaviivattuna.

Tutkijat huomauttavat, että heidän lähestymistapansa saavuttaa huipputason suorituskyvyn kaikissa tietojoissa ja arviointimittareissa. He saavuttavat parhaat tulokset videon laadun mittarilla FVD, joka osoittaa erinomaisen ajallisen sileän ja yhdenmukaisuuden generoituissa videoissa.

Johtopäätös

Katsaus vastaaviin projekteihin kirjallisuudessa osoittaa, että monet odottavat, että yleispätevät VFX-mallit pystyvät lopulta sisällyttämään tämänkaltaisen toiminnallisuuden yleiseen “työkalupakettiin”, joka on suunniteltu laajalle alueelle vaikutuksia, eikä vain tähän tiettyyn tehtävään.

Tutkijat toteavat, että heidän menetelmänsä voidaan sovittaa myös lisäämistehtäviin ilman lisäkoulutusta.

 

* Toivon, että kasvavien IP-provenienssiongelmien vuoksi kaikki tällaiset lähteet mainitaan; mutta jos uuden työn saatavilla olevat materiaalit mainitsevat 3D-mallien lähteen, en onnistunut löytämään tätä viittauksta.

Viittaus, joka on annettu, näyttää olevan yleinen selittävä teksti vuodelta 2013, jossa tietty VAE ei ole yksityiskohtaisesti kuvattu.

†† Otettu paperista, tämä on semanttisesti epäselvä kuvaus, koska hienosäätö ja LoRA ovat erilaisia prosesseja, joilla on erilaiset vaatimukset.

Julkaistu ensimmäisen kerran lauantaina 21. maaliskuuta 2026

Kirjailija tekoälystä, alan erikoismies ihmisen kuvien synteesistä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: [email protected]