Andersonin kulma

Esineiden poistaminen videosta tehokkaammin koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kiinalaisen tutkimuksen mukaan uusi videon korjausjärjestelmä pystyy poistamaan esineitä videosta tehokkaammin ja tarkemmin kuin aiemmat menetelmät.

Rihmankävijän varusteen poistaminen uudella menetelmällä. Katso lähdevideo (liitetty tämän artikkelin alkuun) paremman resoluution ja enemmän esimerkkejä varten. Lähde: https://www.youtube.com/watch?v=N--qC3T2wc4

Rihmankävijän varusteen poistaminen uudella menetelmällä. Katso lähdevideo paremman resoluution ja enemmän esimerkkejä varten. Lähde: https://www.youtube.com/watch?v=N–qC3T2wc4

Menetelmä, jota kutsutaan End-to-End-kehykseksi Flow-Guided-videon korjaamiseen (E2FGVI), pystyy myös poistamaan vesileimat ja muita tyyppisiä peittäviä kappaleita videomateriaalista.

E2FGVI laskee ennusteita sisällön osalle, joka piilottaa peittävät kappaleet, mahdollistaen jopa huomattavien ja vaikeiden vesileimojen poistamisen. Lähde: https://github.com/MCG-NKU/E2FGVI

E2FGVI laskee ennusteita sisällön osalle, joka piilottaa peittävät kappaleet, mahdollistaen jopa huomattavien ja vaikeiden vesileimojen poistamisen. Lähde: https://github.com/MCG-NKU/E2FGVI

(Katso lisää esimerkkejä paremmassa resoluutiossa tästä videosta)

Vaikka malli, josta julkaistu tutkimus kertoo, oli koulutettu 432px x 240px videomateriaalilla (yleensä matalat syötekooot, rajoitettu saatavilla olevan GPU-tilan vuoksi verrattuna optimaalisiin batch-kokoihin ja muihin tekijöihin), tutkijat ovat julkaissut E2FGVI-HQ:n, joka pystyy käsittelemään videoita mielivaltaisessa resoluutiossa.

Koodi nykyisestä versiosta on saatavilla GitHubissa, kun taas HQ-versio, joka julkaistiin viime sunnuntaina, voidaan ladata Google Drivesta ja Baidu Diskistä.

Lapsi pysyy kuvassa.

Lapsi pysyy kuvassa.

E2FGVI pystyy käsittelemään 432×240-videota 0,12 sekunnissa per ruutu Titan XP GPU:lla (12GB VRAM), ja tutkijat raportoivat, että järjestelmä toimii viisitoista kertaa nopeammin kuin aiemmat valtavirtamenetelmät, jotka perustuvat optiseen virtaukseen.

Tennispelaaja tekee odottamattoman poistumisen.

Tennispelaaja tekee odottamattoman poistumisen.

Testattuna standardidatavalokkareissa tälle alalle, uusi menetelmä pystyi ylittämään kilpailijansa sekä laadullisissa että määrällisissä arviointikierroksissa.

Testit aiempiin lähestymistapoihin. Lähde: https://arxiv.org/pdf/2204.02663.pdf

Testit aiempiin lähestymistapoihin. Lähde: https://arxiv.org/pdf/2204.02663.pdf

Tutkimusraportti on otsikoitu Kohti End-to-End-kehyksen Flow-Guided-videon korjaamiseen, ja se on yhteistyö neljän Nankai-yliopiston tutkijan ja yhden Hisilicon Technologiesin tutkijan välillä.

Mitä puuttuu tästä kuvasta

Lisäksi sen ilmeisten sovellusten visuaalisissa efekteissä, korkealaatuinen videon korjaus tulee olemaan tärkeä ominaisuus uusille AI-pohjaisille kuvansynteesi- ja kuvanmuokkausteknologioille.

Tämä on erityisesti tapauksessa kehonmuokkaussovelluksissa ja muiden kehyksien kohdalla, jotka pyrkivät “laimentamaan” tai muuten muokkaamaan kohtauksia kuvissa ja videoissa. Näissä tapauksissa on välttämätöntä “täyttää” taustaa, joka paljastuu synteesin seurauksena.

Viimeaikaisesta tutkimuksesta, kehon

Viimeaikaisesta tutkimuksesta, kehon “uudelleenmuokkaus”-algoritmi on tehtäväksi korjata uudelleen paljastunut tausta, kun aihe on kokoa muutettu. Tässä puutteena osoitetaan punainen kehys, jonka (todellinen, katso kuva vasemmalla) täysikasvuinen henkilö aiemmin käytti. Perustuu lähdeaineistoon https://arxiv.org/pdf/2203.10496.pdf

Koherentti optinen virtaus

Optinen virtaus (OF) on tullut olemaan keskeinen teknologia videon esineen poistamisessa. Kuin atlas, OF tarjoaa yksittäisen kartan aikajanan mukaisesti. Usein käytetty mittaamaan nopeutta tietokoneen näköhavainnoissa, OF voi myös mahdollistaa aikajanan mukaisen korjaamisen, jossa tehtävän kokonaisuuden summa voidaan käsitellä yhdessä kulkuessa, sen sijaan, että se tehtäisiin Disney-tyylisesti “ruutu kerrallaan”, mikä johtaa väistämättä aikajanan epäjatkuvuuteen.

Videon korjausmenetelmät ovat toistaiseksi keskittyneet kolmeen vaiheeseen: virtauskorjaus, jossa video on karttunut diskreettiin ja tutkittavaan kokonaisuuteen; pixelien eteneminen, jossa “vahingoittuneiden” videoiden rei’it täytetään bidirectionaalisesti etenevillä pikseleillä; ja sisisällön keksiminen (pikselien “keksiminen”, joka on tuttu useimmille meistä deepfake- ja teksti-kuvaksi-kehyksistä, kuten DALL-E-sarja), jossa arvioitu “puuttuva” sisältö keksitään ja lisätään videoon.

E2FGVI:n keskeinen innovaatio on yhdistää nämä kolme vaihetta loppuun asti, poistamalla tarpeen manuaalisille toimille sisällön tai prosessin kanssa.

Tutkimusraportti toteaa, että tarve manuaaliseen väliintuloon edellyttää, että vanhemmat prosessit eivät hyödy GPU:sta, mikä tekee niistä hyvin aikaa vieviä. Tutkimusraportista*:

‘Otan DFVI:n esimerkiksi, yhden videon korjaaminen, joka on 432 × 240 kokoinen DAVIS:sta, joka sisältää noin 70 ruutua, vaatii noin 4 minuuttia, mikä on vastaanottamaton useimmissa todellisissa sovelluksissa. Lisäksi edellä mainittujen huonojen puolien lisäksi, vain käyttäen esikoulutettua kuvankorjausverkkoa sisällön keksimisvaiheessa, joka jättää huomiotta sisällön suhteet aikataulisten naapureiden välillä, johtaa epäjohdonmukaisiin luoduissa videoissa.’

E2FGVI:n yhdistäessä videon korjaamisen kolme vaihetta, se pystyy korvaamaan toisen vaiheen, pikselien etenemisen, ominaisuuksien etenemisellä. Enemmän jaettujen prosessien aiemmissa töissä ominaisuuksia ei ole niin laajasti saatavilla, koska kunkin vaiheen on suhteellisen eristynyt, ja työnkulku on vain puolivaltainen.

Lisäksi tutkijat ovat keksineet aikajanan fokusoivan transformerin sisällön keksimisvaiheessa, joka ottaa huomioon ei vain suoran naapurin pikseleitä nykyisessä ruudussa (ts. mitä tapahtuu kyseisessä osassa ruutua edellisessä tai seuraavassa kuvassa), vaan myös kaukaiset naapurit, jotka ovat useita ruutuja etäällä, ja jotka kuitenkin vaikuttavat videon kokonaisvaikutukseen.

E2FGVI:n arkkitehtuuri.

E2FGVI:n arkkitehtuuri.

Uusi ominaisuusperustainen keskivaihe työnkulussa pystyy hyödyntämään enemmän ominaisuustasoisia prosesseja ja oppimalla näytteiden siirtymisiä, kun taas hankeen uusi fokusoiva transformer, tutkijoiden mukaan, laajentaa fokusoivien ikkunoiden kokoa “2D:stä 3D:hen”.

Testit ja data

E2FGVI:n testaamiseksi tutkijat arvioivat järjestelmää kahteen suositeltuun videon esineen erottamisen datatietokantaan: YouTube-VOS ja DAVIS. YouTube-VOS sisältää 3741 koulutusvideota, 474 validointivideota ja 508 testivideota, kun taas DAVIS sisältää 60 koulutusvideota ja 90 testivideota.

E2FGVI koulutettiin YouTube-VOS:lla ja arvioitiin molemmilla datatietokannoilla. Koulutuksen aikana esineen maskit (vihreät alueet yllä olevissa kuvissa ja liittyvä YouTube-video) luotiin simuloimaan videon korjausta.

Mittareina tutkijat käyttivät huippu-signaali-kohina-suhdetta (PSNR), rakenteellista samankaltaisuutta (SSIM), videopohjaista Fréchet Inception -etäisyyttä (VFID) ja virtausmuodon virhettä – jälkimmäinen mittaamaan aikajanan vakautta vaikuttavassa videossa.

Aiemmat arkkitehtuurit, joita järjestelmää vastaan testattiin, olivat VINet, DFVI, LGTSM, CAP, FGVC, STTN ja FuseFormer.

Tutkimusraportin määrällisten tulosten osio. Ylös- ja alaspäin osoittavat nuolet osoittavat, että korkeammat tai matalammat luvut ovat parempia. E2FGVI saavuttaa parhaat tulokset yleisesti. Menetelmät arvioidaan FuseFormerin mukaan, vaikka DFVI, VINet ja FGVC eivät ole loppuun asti järjestelmiä, mikä tekee heidän FLOPsensa arvioinnin mahdottomaksi.

Tutkimusraportin määrällisten tulosten osio. Ylös- ja alaspäin osoittavat nuolet osoittavat, että korkeammat tai matalammat luvut ovat parempia. E2FGVI saavuttaa parhaat tulokset yleisesti. Menetelmät arvioidaan FuseFormerin mukaan, vaikka DFVI, VINet ja FGVC eivät ole loppuun asti järjestelmiä, mikä tekee heidän FLOPsensa arvioinnin mahdottomaksi.

Lisäksi parhaiden tulosten saavuttamiseen kaikkia kilpailevia järjestelmiä vastaan, tutkijat suorittivat laadullisen käyttäjätutkimuksen, jossa viisi edustavaa menetelmää esitettiin yksittäin kahdellekymmenelle vapaaehtoiselle, jotka pyydettiin arvioimaan niitä visuaalisen laadun perusteella.

Pystyakseli edustaa prosenttia osallistujista, jotka suosivat E2FGVI:n tulosta visuaalisen laadun perusteella.

Pystyakseli edustaa prosenttia osallistujista, jotka suosivat E2FGVI:n tulosta visuaalisen laadun perusteella.

Tutkijat toteavat, että vaikka yksimielinen suosikki heidän menetelmänsä puolesta, yksi tuloksista, FGVC, ei heijasta määrällisiä tuloksia, ja he ehdottavat, että tämä osoittaa, että E2FGVI saattaa “luoda näyttävämpiä tuloksia”.

Tehokkuuden suhteen tutkijat toteavat, että heidän järjestelmänsä vähentää merkittävästi liukuvia pistekohtaisia operaatioita sekunnissa (FLOPs) ja inference-aikaa yhdellä Titan-GPU:lla DAVIS-datatiivistössä, ja havaitsevat, että tulokset osoittavat E2FGVI:n suorittavan 15 kertaa nopeammin kuin virtauspohjaiset menetelmät.

He kommentoivat:

‘[E2FGVI] pitää alhaisimman FLOPs- arvoa verrattuna kaikkiin muihin menetelmiin. Tämä osoittaa, että ehdotettu menetelmä on erittäin tehokas videon korjaamiseen.’

*Minun muutos tekijöiden sisäisistä viittauksista hyperlinkkeihin.

 

Julkaistu ensimmäisen kerran 19. toukokuuta 2022.

Muutettu tiistaina 28. lokakuuta 2025 poistamaan viallinen video-upotus ja muuttaa viittauksia upotettuun videoon artikkelin tekstissä.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai