Andersonin kulma

Tehostamalla AI-taustan poistoa ilman kalliita ihmisten merkintöjä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

Uusi tutkimus osoittaa, että AI voi poistaa ihmiset videosta ilman kalliiden ihmisten merkintöjä, parantaen laadun ja vakauden

 

Useimmat meistä ovat kokeneet “pudonneensa” taustasta yksinkertaisten tausta-alustus-/peittävien suotimien kautta videoneuvottelualustoilla – ja me saattaa havaita näiden järjestelmien rajoitukset, jotka on koulutettu useimmin videoneuvottelussa tavattaviin tapauksiin, eivätkä ne ole yleensä kestäviä mitään “odottamatonta” – tai jopa “ennustettavia” – esineitä, kuten sormia:

Tyypillinen esimerkki AI-koulutetusta etumoitusjärjestelmästä, joka leikkaa liian paljon alkuperäisestä kohteesta. Lähde - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

Tyypillinen esimerkki AI-koulutetusta etumoitusjärjestelmästä, joka leikkaa liian paljon alkuperäisestä kohteesta. Lähde

Helppo ratkaisu, josta on tullut yhä suositumpi vision kieli-malleja (VLM) vastaan, jotka eivät ole erityisesti koulutettu tällaisiin tehtäviin, on hienosäätää olemassaolevaa mallia tiedoilla, joita järjestelmä todennäköisesti kohtaa:

Kaksi suurta, tarkkaan merkittyä tietojoukkoa tukevat ratkaisut vuoden 2020 tutkimuksessa

Kaksi suurta, tarkkaan merkittyä tietojoukkoa tukevat ratkaisut vuoden 2020 tutkimuksessa ‘Real-Time High-Resolution Background Matting’. Lähde

Tällaiset tiedot on kuitenkin merkittävä kustannus ja ajan kulutus, ja lisäksi se johtaa erittäin spesifiseen ja ei-yleistyneeseen työkaluun, joka on kallis ja yleensä ei voida käyttää laajemmassa tehtävissä.

Kehittämällä “kohdennettuja” malleja tällaisiin tehtäviin on tällä hetkellä lyhin reitti tehokkaaseen päätelmään useissa eri aloissa, ei ainoastaan videon ja kuvan taustan poistossa (ts. etumoitus/taustan peittäminen). Tähän asti useat valvomattomat ratkaisut ovat vain siirtäneet ongelman toisaalle.

Viime aikoina, huolimatta AI-vahvistettujen suotimien lisääntymisestä alustoilla kuten Zoom, jälkimmäinen suosittelee edelleen vihreää taustaa parhaana ratkaisuna taustan poistamiseen – raskas ja jollain tavoin “ammattimainen” ratkaisu, joka saattaa tehdä meistä useimmat hieman epämukaviksi.

Poista se!

Viime aikoina mielenkiinto on kasvanut Segment Anything (SAM) -perheen käytölle automaattisen ja hienojakoisisen poiston tarjoamiseksi. Koska SAM kehitettiin alun perin merkintöjen avustamiseksi eikä tarjonnut teräviä reunuksia, jotka ovat hyväksyttyjä visuaalisten efektien putkistossa, sen oletusarvon reunat eivät sovellu haasteen ratkaisemiseen ilman apua:

Paina toistamaan, jos tarpeen. Esimerkki karkeista reunoista, jotka Segment Anything -malli luo – ihanteellinen merkinnöille, mutta ei tarpeeksi hyvä VFX-luopumiselle. Lähde 

Viimeksi Kiinasta on esitetty monimutkaisempi tapa käyttää SAM-malleja saavuttaa paremmat poistoprosessit – yhdistämällä perustavanlaatuinen seurantamalli kuten SAM siltasillan alueen ehdotukseen omistetuilla mattauspäillä. Tällä tavoin järjestelmä pystyy hienostamaan reunatilaa iteratiivisesti ja ratkaisemaan haastavia reunoja, kuten hiuksia liikkeessä:

Paina toistamaan, jos tarpeen. Tutkimuksen tukisivulta, liitetty video, joka osoittaa kirjoittajien menetelmän monimutkaisuuden. Lähde 

Olivatpa avainasemassa, uusi yhdistetty järjestelmä koulutetaan ainoastaan kuvilla, ei videoilla, eikä vaadi lisää ihmisten merkintöjä – perinteinen este edistymiselle tässä ja monissa muissa AI-aloissa.

Uuden menetelmän avulla saavutettuja hienojakoisia kuvan ja videon poistotuloksia, joissa on haastavia tapauksia, kuten hiukset, läpinäkyvyys ja liike, rinnakkain luonnonolosuhteissa, joissa menetelmä tuottaa - kirjoittajien mukaan - puhtaampia ja vakaampia tuloksia kuin aiemmat lähestymistavat. Lähde - https://www.unite.ai/the-download-more-labels-illusion-in-ai-research/

Uuden menetelmän avulla saavutettuja hienojakoisia kuvan ja videon poistotuloksia, joissa on haastavia tapauksia, kuten hiukset, läpinäkyvyys ja liike, rinnakkain luonnonolosuhteissa, joissa menetelmä tuottaa – kirjoittajien mukaan – puhtaampia ja vakaampia tuloksia kuin aiemmat lähestymistavat. Lähde

Kolme kokeellista mallia tuotettiin työlle, ja kirjoittajat väittävät uuden tilan taiteellisen suorituskyvyn tässä tehtävässä, säilyttäen samalla perusmallin korkeamman yleistymiskyvyn, mikä tarkoittaa, että menetelmä tuottaa monikäyttöisen mallin lisäominaisuuksilla, eikä erillistä työkalua, joka on kohdennettu yhteen tehtävään.

Kirjoittajat toteavat:

‘Kattavat kokeet osoittavat, että SAM2Matting saavuttaa tilan taiteellisen suorituskyvyn sekä kuvan että videon poistossa, ja videon poistoa arvioidaan tiukasti nollanpaikkaisessa tilassa.

‘Laajat luonnonolosuhteiden tulokset osoittavat myös vahvan yleistymiskyvyn avoimiin maailman tilanteisiin nopealla liikkeellä, monimutkaisilla taustoilla ja kohdekiinnityksillä (esim. mies ajaa polkupyörällä).

‘Lisäksi meidän poistokomponentit ovat kevyitä ja tehokkaita, mikä mahdollistaa SAM2.1-Tiny-variantin suorittamisen 40 FPS: llä 200-kehyksisessä 1080p-videossa alle 5 GB:n GPU-muistilla.’

Uusi tutkimus on nimeltään SAM2Matting: Yleistetty kuva- ja videon poisto, ja se tulee neljältä kirjoittajalta Fudanin yliopistosta ja Shanghain taloudellisesta yliopistosta. Työllä on GitHub-arkisto, joka kirjoitushetkellä on julkaissut eri varianttien tarkistuspisteet, inference-koodin ja interaktiivisen demon, ja koulutuskoodeja luvataan. Lisäksi on projektisivusto.

Menetelmä

Kirjoittajien menetelmä erottaa seurannan hienojakoisesta poistosta käyttämällä video-objektin segmentointi-seurantaa (VOS) -seurantaa, joka tuottaa ajallisesti yhdenmukaisen karkean maskin jokaiselle kehykselle, kun taas omistettu mattausputki hienostaa reunuksia:

Putken yleiskatsaus, jossa joustava viesti ja syötteenä oleva video syötetään video-objektin segmentointi-seurantaan, joka tuottaa karkean maskin, joka sitten hienostetaan ROI-havainnoijalla ja muunnetaan trimapiksi, ennen kuin progressiivinen moniaaltoinen ennustaja tuottaa lopullisen tarkkaan mattauskuvan.

Putken yleiskatsaus, jossa joustava viesti ja syötteenä oleva video syötetään video-objektin segmentointi-seurantaan, joka tuottaa karkean maskin, joka sitten hienostetaan alueen kiinnostuksen (ROI) -havainnoijalla ja muunnetaan trimapiksi, ennen kuin progressiivinen moniaaltoinen ennustaja tuottaa lopullisen tarkkaan mattauskuvan.

Alueen kiinnostuksen (ROI) -havainnointija tunnistaa alueet, joissa on hienojakoinen yksityiskohta tai puoliläpinäkyvyys, ja muuttaa ne trimapiksi (kolmen alueen maski, joka jakaa etumaisen, taustan ja epävarman alueen), joka ohjaa hienostusta, jonka jälkeen Progressiivinen Alfa -ennustaja tuottaa lopullisen mattauskuvan karkeasta tarkkaan usean asteikon kaskadin kautta

Perinteiset mattausjärjestelmät yleensä johtavat kiinnostuksen alueita yksinkertaisilla morfologisilla toiminnoilla tai suoraan uudelleenkäyttämällä maskia – lähestymistavat, jotka voivat joko ohittaa hienojakoiset yksityiskohdat tai sisältää alueita, jotka eivät vaadi hienostusta:

Vergleich standardimaskipohjaisen prosessoinnin kanssa, joka osoittaa, miten yksinkertaiset morfologiset toiminnot tuottavat karkeat, yhdenmukaiset reunat, jotka eivät huomioi hienoja rakenteita, kuten hiuksia ja läpinäkyvyyttä, mikä johtaa yksityiskohtien menetykseen lopullisessa mattauskuvassa.

Vergleich standardimaskipohjaisen prosessoinnin kanssa, joka osoittaa, miten yksinkertaiset morfologiset toiminnot tuottavat karkeat, yhdenmukaiset reunat, jotka eivät huomioi hienoja rakenteita, kuten hiuksia ja läpinäkyvyyttä, mikä johtaa yksityiskohtien menetykseen lopullisessa mattauskuvassa.

Komponentti

Toisin sanoen ehdotetun alueen kiinnostuksen (ROI) -havainnoinnin sijaan käsitellään tätä askelta pikselikohtaisena luokittelutehtävänä (ts. käsittely jokainen yksittäinen pikseli kuvassa erillisenä päätöksenä ja määrittely pikselin kuuluvan mattauskriittiseen alueeseen tai ei), joka integroi VOS-maskin, nykyisen kehyksen ja moniaaltoiset kuvapiirteet, jotta voidaan tarkemmin erottaa mattauskriittiset alueet.

Uudessa lähestymistavassa ennustettu ROI muunnetaan ensin pseudo-trimapiksi, joka erottaa varman etumaisen ja taustan epävarmoista alueista, käyttäen seurantamallin maskia tunnettujen alueiden määrittämiseksi ja ROI: n merkitsemiseksi epäselväksi, jotta myöhempi prosessointi voi keskittyä nimenomaan rajoille, joilla yksityiskohtien ratkaisu on tarpeen.

Hienostus käsitellään sitten Progressiivisella Alfa -ennustajalla, joka käsittää mattaamisen askelkohtaisena prosessina, joka siirtää välimuotoisia tuloksia karkeasta tarkempaan asteikkoon, jossa jokainen vaihe käyttää kuvaa, trimapia ja edellistä arviota tarkentamaan rakennetta ja palauttamaan hienojakoiset yksityiskohdat.

Lopullisessa vaiheessa korkein resoluutio ylösotetaan tuottamaan valmis mattauskuva, jolloin laajat muodot voidaan perustaa aikaisin, kun taas hienommat elementit, kuten hiukset ja läpinäkyvyys, ratkaistaan myöhemmissä kierroksissa.

Koulutuksen aikana kirjoittajat jäädyttivät VOS-seurantamallin, kun taas ainoastaan mattauskomponentteja koulutettiin laadukkailla kuvatiedoilla – sallien hienojakoiset yksityiskohdat tarkentaa ilman seurannan yhdenmukaisuuden heikentämistä. Valvonta sovellettiin kehykohtaisesti, alueiden kiinnostusta johdettiin alkuperäisestä alfa-mattauskuvasta ja käytettiin oppimisen ohjaamiseen, kun taas ROI-havainnointi koulutettiin tappioilla, jotka kannustivat tarkan reunan luokittelun ja vähensivät epäselviä artefakteja.

Alfa-arviointiin tappiot sovellettiin useiden asteiden yli edistääkseen yksityiskohtien parantamista, yhdessä lisärajoituksella, joka pyrki pitämään ennustetun mattauskuvan alkuperäisen maskin kanssa linjassa – auttaen rakenteen säilyttämistä ja estämään ontuvia tai murtuneita alueita lopullisesta tuloksesta.

Tiedot ja testit

Aluksi käytettiin kahdeksaa kuvan poistotietojoukkoa kokeissa: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; ja RefMatte; ja kehitettiin kolme varianttia ‘Sam2Matting’ -lähestymistavasta VOS-seurantaa varten, jotka käyttivät SAM2.1-Tiny; SAM2.1-Base+; ja käsitekeskeistä SAM3.

Seurantakomponentti jäädytettiin, ja vain mattauskomponentit optimoitiin. Kaikki versiot koulutettiin viisi epochia neljällä NVIDIA A6000 -näytönohjaimella, jokaisella 48 GB:n VRAM-jakautumalla. Batch-koko 32 käytettiin AdamW -optimoinnissa. Käytetyt mittarit olivat Keskinen Absoluuttinen Ero (MAD); Keskinen Neliökeskinen Virhe (MSE); Gradient (Grad); Yhteys (Conn); ja dtSSD (vain videon poistossa).

Määrälliset testit

Kirjoittajat aloittivat määrällisen testauksen uusista järjestelmistä kuvan poistossa käyttämällä vertailukohtia P3M-500-NP; AM-2K (‘GFM’ tuloksissa); MAM (‘Matte Anything’, tuloksissa); E2E-HIM; Lightweight; ja PPM-100 (‘MODNet’, tuloksissa):

Määrälliset tulokset kuvan poistotestien yli P3M-500-NP, AM-2K-testi ja PPM-100, joissa alempien arvojen osoittamaan paremman suorituskyvyn kaikissa mittareissa, ja parhaat, toiseksi parhaat ja kolmanneksi parhaat tulokset korostettu punaisella, oranssilla ja keltaisella vastaavasti.

Määrälliset tulokset kuvan poistotestien yli P3M-500-NP, AM-2K-testi ja PPM-100, joissa alempien arvojen osoittamaan paremman suorituskyvyn kaikissa mittareissa, ja parhaat, toiseksi parhaat ja kolmanneksi parhaat tulokset korostettu punaisella, oranssilla ja keltaisella vastaavasti. Katso lähdeartikkeli paremman resoluution vuoksi.

Näistä tuloksista tutkimus toteaa:

‘Kuten edellä näkyy, kaikki kolme SAM2Matting-varianttia ylittävät johdonmukaisesti aiemmat vertailukohtia eri mittareilla. Esimerkiksi SAM2.1-Tiny-variantti saavuttaa 11,48 alempaan MAD: iin verrattuna MAM: iin P3M-500-NP: ssä.’

Kirjoittajat väittävät, että tulokset osoittavat, että heidän lähestymistapansa saavuttaa paremman suorituskyvyn ydinkäsitteellisen suunnittelun kautta, eikä siitä, että datan kuraattori on korkea.

Videon poistossa SAM2Matting arvioitiin V-HIM60 ja VideoMatte nollanpaikkaisessa asetelussa videon koulutetuille järjestelmille MatAnyone2, MatAnyone, MaGGIe, FTP-VM, ja RVM, jolloin saavutettiin johdonmukaiset voitot sekä keskivertaisilla että haastavilla jakozilla.

Kaikissa vertailukohtina SAM2Matting -variantit saavuttavat alempia virheitä MAD: ssä, MSE: ssä, Grad: ssä, Conn: ssä ja dtSSD: ssä, ja SAM3 saavuttaa vahvimmat yleiset tulokset, kun taas alemmat dtSSD-arvot osoittavat stabiilimpaa kehyskohtaisen yhdenmukaisuuden:

Määrälliset tulokset videon poistotestien yli V-HIM60 ja VideoMatte, arvioitu nollanpaikkaisessa asetelussa, osoittaa alempia virheitä kaikissa mittareissa, ja parhaat, toiseksi parhaat ja kolmanneksi parhaat tulokset korostettu punaisella, oranssilla ja keltaisella vastaavasti.

Määrälliset tulokset videon poistotestien yli V-HIM60 ja VideoMatte, arvioitu nollanpaikkaisessa asetelussa, osoittaa alempia virheitä kaikissa mittareissa, ja parhaat, toiseksi parhaat ja kolmanneksi parhaat tulokset korostettu punaisella, oranssilla ja keltaisella vastaavasti.

Kirjoittajat väittävät, että nämä tulokset heijastavat erillistä suunnittelua, jossa VOS-seuranta säilyttää ajallisen rakenteen ja mattausmoduulit keskittyvät reunan yksityiskohtiin, mahdollistaen kuvan koulutettujen mallien ylittämään täysin valvottujen videolähestymistapojen.

Laadulliset testit

Ihmisen poistossa laadullisissa testeissä kirjoittajat totesivat, että Sam2Matting ylitti kilpailevat vertailukohtia:

Laadullinen vertailu ihmisen ja luonnonolosuhteiden videon poistossa, jossa SAM2Matting säilyttää hienot hiussuortuvat ja puoliläpinäkyvät alueet tarkemmin kuin RVM ja MatAnyone, tuottaen puhtaampia reunoja ja vähemmän puuttuvia rakenteita haastavilla alueilla.

Laadullinen vertailu ihmisen ja luonnonolosuhteiden videon poistossa, jossa SAM2Matting säilyttää hienot hiussuortuvat ja puoliläpinäkyvät alueet tarkemmin kuin RVM ja MatAnyone, tuottaen puhtaampia reunoja ja vähemmän puuttuvia rakenteita haastavilla alueilla.

Kuten alla näkyy, olemassa olevat videon poistojärjestelmät, kuten MatAnyone2 ja MaGGIe, jotka on koulutettu domeenispesifeille ja usein ihmiskeskeisille tietojoukoille, kamppailevat yleistämisen kanssa luonnonolosuhteissa, erityisesti kun ne käsittelevät nopeasti liikkuvia kohteita, kuten kasvavia juuria, puoliläpinäkyviä perhosia ja nopeasti tippuvaa vettä:

Laadullinen vertailu luonnonolosuhteiden videon poistossa, jossa SAM2Matting säilyttää hienot rakenteet ja ajallisen yhdenmukaisuuden tehokkaammin kuin MatAnyone2 ja MaGGIe, erityisesti ei-ihmiskohteille, nopealle liikkeelle ja puoliläpinäkyville elementeille, kuten veteen, lasiin ja hyönteisiin.

Laadullinen vertailu luonnonolosuhteiden videon poistossa, jossa SAM2Matting säilyttää hienot rakenteet ja ajallisen yhdenmukaisuuden tehokkaammin kuin MatAnyone2 ja MaGGIe, erityisesti ei-ihmiskohteille, nopealle liikkeelle ja puoliläpinäkyville elementeille, kuten veteen, lasiin ja hyönteisiin. Katso lähdeartikkeli paremman resoluution vuoksi.

Toisin sanoen SAM2Matting osoitti olevan kykeneväinen säilyttämään vakaan seurannan ja poistamaan hienot yksityiskohdat luotettavammin näissä haastavissa tilanteissa.

Lopuksi, kuten alla olevassa kuvassa näkyy, SAM2Matting käsitteli tehokkaasti kohteita, joissa oli kiinnitettyjä esineitä, kuten polkupyöriä ajavaa tai suksia pitävää henkilöä, samalla kun se tukahdutti lähellä olevia taustahäiriöitä, hyödyntäen aiemmin kuvattua mattaus-maskin rajoitetta.

Laadullinen vertailu jaksosta, jossa on kiinnitettyjä esineitä ja taustahäiriöitä, jossa SAM2Matting säilyttää rakenteita, kuten polkupyöriä, tarkemmin kuin MatAnyone2, samalla kun se ylläpitää puhtaampia silhuetteja kehyksissä.

Laadullinen vertailu jaksosta, jossa on kiinnitettyjä esineitä ja taustahäiriöitä, jossa SAM2Matting säilyttää rakenteita, kuten polkupyöriä, tarkemmin kuin MatAnyone2, samalla kun se ylläpitää puhtaampia silhuetteja kehyksissä.

Johtopäätös

Tutkimuksessa esitetyt saavutukset osoittavat, kuinka paljon poisto, yksi vanhimmista tehtävistä tietokoneavusteisessa näkemisessä, on edelleen ratkaisematta ja vastustaa yleistettyjä lähestymistapoja. Kuten monissa muissa visuaalisissa malleissa, ongelmana on, että poistomenetelmät pitävät kiinni domeenitiedosta sen sijaan, että sopeutuisivat helposti näkemättömiin ja tuntemattomiin kohteisiin; tämä tehtävä jännittää mallin yleistymiskyvyn ääripäätä.

Vaikka uusi työ on askel eteenpäin tästä riippuvuudesta, on edelleen pitkä matka edessä, kun otetaan huomioon se, kuinka laajasti tämä tehtävä on upotettu päivittäisiin elämään videoneuvotteluportaalien kautta.

 

Julkaistu ensimmäisen kerran maanantaina, 13. heinäkuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai