Andersons vinkel
Forbedring av AI-bakgrunnsfjerning uten dyrekostede menneskelige annotasjoner

Ny forskning viser at AI kan rense mennesker ut av video uten dyrekostede menneskelige annotasjoner, og forbedre kvalitet og stabilitet
De fleste av oss har opplevd å bli “droppet” ut av en bakgrunn gjennom enkle bakgrunnsendrings-/forklaringssfilter på videokonferanseplattformer – og vi kan ha lagt merke til begrensningene i slike systemer, som er trent på de vanligste typene hendelser som kan finnes i en videokonferanse, og som vanligvis ikke er robuste mot uventede hendelser – eller selv forutsigbare objekter, som fingre:

Et typisk eksempel på et AI-trent fremgrunnsextraheringssystem som kutter ut for mye av kildeemnet. Kilde
Den enkleste løsningen, og en som blir stadig mer populær i møte med visjonsspråkmodeller (VLM) som ikke er spesifikt trent for slike oppgaver, er å finjustere en eksisterende modell på data som sannsynligvis vil bli møtt av systemet:

To høyvolum, ekstremt annoterte datasett underbygger løsningene som tilbys i artikkelen fra 2020 ‘Real-Time High-Resolution Background Matting’. Kilde
Likevel må slik data annoteres, til en viss kostnad og med en viss tidskostnad, av mennesker; og i alle fall resulterer dette i et svært spesifikt og ikke-generalisert verktøy som koster mye penger, og som vanligvis ikke kan brukes til en bredere variasjon av oppgaver.
Likevel er utvikling av ‘targetede’ modeller av denne typen for tiden den korteste veien til effektiv inferens i en rekke domener, ikke bare video- og bilde-matting (dvs. bakgrunnsfjerning/fremgrunnsmatting). Hittil har mange av de uovervåkede løsningene som er tilbudt, mer eller mindre bare flyttet problemet rundt på tallerkenen.
Even nå, til tross for utbredelsen av AI-forbedrede filter på plattformer som Zoom, anbefaler sistnevnte fortsatt en grønn skjerm som den optimale løsningen for bakgrunnsfjerning – en tungvint og noe ‘profesjonell’ løsning som ville gjøre de fleste av oss litt selvbevisst.
Kutt det ut!
Nylig har interessen økt for å bruke Segment Anything (SAM)-familien for å gi automatisert og finmaskert extrahering. Ettersom SAM ble utviklet for å hjelpe annotering og ikke for å gi skarpe konturer i en visuell effektpipeline, er dens standardgrenser ikke egnet til å møte utfordringen, uassistent:
Klikk for å spille, hvis nødvendig. Et eksempel på de grove grensene som skapes av en Segment Anything-modell – ideelt for annotering, men ikke godt nok for VFX-drop-out. Kilde
En ny tilnærming fra Kina har foreslått en mer sofistikert måte å bruke SAM-modeller for å oppnå overlegen extrahering – ved å kombinere en grunnleggende tracker som SAM med en region-forslag-bro med dedikerte matting-hoder. På denne måten kan systemet finjustere kantdetaljer iterativt og løse utfordrende kanter, som hår i bevegelse:
Klikk for å spille, hvis nødvendig. Fra den tilhørende nettstedet som støtter den nye artikkelen, en sammenstilling av supplementære videoer, som demonstrerer sofistikeringen av forfatternes metode for extrahering. Kilde
Kritisk sett trenger den nye sammensatte systemet bare å trene på bilder, ikke på videoer, og krever ingen ekstra menneskelig annotering – den tradisjonelle hindringen mot fremgang i dette, og i andre AI-domenener.
Eksempler på finmaskert bilde- og video-matting som oppnås med den nye metoden, med utfordrende tilfeller som hår, gjennomsiktighet og bevegelse vist sammen med sekvenser i felten, hvor metoden produserer – ifølge forfatterne – renere, mer stabile resultater enn tidligere tilnærminger. Kilde
Med tre eksperimentelle modeller produsert for arbeidet, hevder forfatterne nytt state-of-the-art-resultat i denne oppgaven, samtidig som de beholder den høyere generaliseringskapasiteten til den underliggende modellen, noe som betyr at metoden produserer en all-purpose-modell med ekstra kapasiteter, i stedet for et isolert verktøy rettet mot en enkelt oppgave.
Forfatterne uttaler:
‘Omfattende eksperimenter viser at SAM2Matting oppnår state-of-the-art (SOTA) resultater på både bilde- og video-matting, med video-matting evaluert i en strengt zero-shot-måte.
‘Omfattende resultater i felten viser videre sin sterke generalisering til åpne verdenscenarioer med rask bevegelse, komplekse bakgrunner og måltilknytninger (f.eks. mann som sykler).
‘I tillegg er våre matting-komponenter lette og effektive, og muliggjør at SAM2.1-Tiny-varianten kan kjøre med 40 FPS på en 200-ramme 1080p-video ved å bruke mindre enn 5 GB GPU-minne.’
Den nye artikkelen har tittelen SAM2Matting: Generalisert bilde- og video-matting, og kommer fra fire forfattere fra Fudan University og Shanghai University of Finance and Economics. Arbeidet har et GitHub-repository, som på tidspunktet for skrivingen har sluppet ut kontrollpunkter for forskjellige varianter, inferenskode og en interaktiv demo, med en utgivelse av treningskode lovet. I tillegg finnes det et prosjektsted.
Metode
Forfatternes metode skiller sporing fra finmaskert extrahering ved å bruke en video-objekt-segmentering (VOS)-tracker for å produsere en tidskonsistent grov maske for hver ramme, mens en dedikert matting-pipeline finjusterer grenser:
Oversikt over pipeline, hvor en fleksibel prompt og inndata-video går inn i en video-objekt-segmentering-tracker for å produsere en grov maske, som finjusteres av en Region-of-Interest (ROI)-detektor og konverteres til en trimap før en progressiv multi-skala-prediktor genererer den endelige høydetaljerte matte.
En region-of-interest (ROI)-detektor identifiserer deretter regioner med finmaskert detalj eller semi-gjennomsiktighet, og konverterer disse til en trimap (en tre-region maske som deler fremgrunn, bakgrunn og usikre områder) som guider finjustering, etterfulgt av en Progressiv Alpha-Prediktor som genererer den endelige matte gjennom en grov-til-fine-kaskade over flere skalaer
Vanlige matting-systemer deriverer vanligvis regioner av interesse ved å bruke enkle morfologiske operasjoner, eller ved å gjenbruke masken direkte – tilnærminger som kan overse finmaskert detalj, eller inkludere områder som ikke trenger finjustering:
Sammenligning av standard mask-basert prosessering med grunn-truth-trimap, som viser hvordan enkle morfologiske operasjoner produserer grove, uniforme grenser som overse finstrukturer som hår og gjennomsiktighet, og fører til tap av detalj i den endelige matte.
Kompakt interesse
Omvendt behandler den foreslåtte Region-of-Interest-Detektor denne fasen som en pikselvis klassifiseringsoppgave (dvs. å behandle hver enkelt piksel i bildet som en separat beslutning, og tildele den en etikett basert på om den tilhører en matting-kritisk region eller ikke) som integrerer VOS-masken, den nåværende rammen og multi-skala-bilde-egenskaper, for å mer nøyaktig isolere matting-kritiske regioner.
I den nye tilnærmingen konverteres den predikerte ROI først til en pseudo-trimap som skiller defintive fremgrunn og bakgrunn fra usikre regioner, ved å bruke tracker-masken til å tildele kjente områder mens den markerer ROI som tvilsom, så at påfølgende prosessering kan fokusere eksplisitt på grenser hvor detalj må løses.
Finjustering håndteres deretter av en Progressiv Alpha-Prediktor som behandler matting som en trinnvis prosess, som passerer mellomliggende resultater fra grov til finere skalaer, med hver fase som bruker bildet, trimapen og den forrige estimat til å progressivt skarpe struktur og gjenopprette finmaskert detalj.
Ved den siste fasen er den høyeste oppløsningen oppskalert for å produsere den fullførte matte, og lar bredere former bli etablert tidlig mens finere elementer som hår og gjennomsiktighet løses i senere pass.
Under trening, frøs forfatterne VOS-trackeren, mens de kun trente matting-komponentene på høykvalitets bilde-data – og lot finmaskert detalj bli finjustert uten å degradere sporing-konsistens. Supervision ble deretter anvendt per ramme, med regioner av interesse avledet fra grunn-truth alpha-matte, og brukt til å guide læring, mens ROI-detektoren ble trent med tap som var designet for å fremme nøyaktig grense-klassifisering, og redusere hakketegn.
For alfa-estimering, ble tap anvendt over flere skalaer for å forbedre detalj, sammen med en ekstra begrensning som var designet for å holde den predikerte matte alignert med den opprinnelige masken – og hjalp til å bevare struktur, og å forhindre hule eller brutte regioner i den endelige utgangen.
Data og tester
Åtte bilde-matting-datasett ble brukt initialt for testene: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; og RefMatte; og tre varianter av ‘Sam2Matting’-tilnærmingen ble utviklet som VOS-tracker, henholdsvis ved å bruke SAM2.1-Tiny; SAM2.1-Base+; og den konsept-fokuserte SAM3.
Tracker-komponenten ble fryst, med bare matting-komponentene optimert. Alle versjoner ble trent i fem epoker over fire NVIDIA A6000 GPUs, hver med en VRAM-tilordning på 48GB. En batch-størrelse på 32 ble brukt, under AdamW-optimalisatoren. Metrikker som ble brukt, var Gjennomsnittlig absolutt differanse (MAD); Gjennomsnittlig kvadratisk feil (MSE); Gradient (Grad); Connectivity (Conn); og dtSSD (kun for video-matting).
Kvantitative tester
Forfatterne startet med kvantitative tester av de nye systemene på bilde-matting, ved å bruke benchmarkene P3M-500-NP; AM-2K (‘GFM’ i resultater); MAM (‘Matte Anything’, i resultater); E2E-HIM; Lightweight; og PPM-100 (‘MODNet’, i resultater):
Kvantitative resultater på bilde-matting-benchmark over P3M-500-NP, AM-2K-test og PPM-100, med lavere verdier som indikerer bedre resultat over alle metrikker, og beste, nest beste og tredje beste resultater fremhevet i rød, oransje og gul, henholdsvis. Vennligst se kildeartikkelen for bedre oppløsning.
Av disse resultater, sier artikkelen:
‘Som vist [ovenfor], utgjør alle tre varianter av SAM2Matting konsistent bedre enn tidligere baselinjer over forskjellige metrikker. For eksempel, oppnår SAM2.1-Tiny-varianten en 11,48 lavere MAD enn MAM på P3M-500-NP.’
Forfatterne hevder at resultater over hele linjen indikerer at deres tilnærming oppnår overlegen resultater gjennom den grunnleggende konseptuelle designen, og ikke på grunn av nivået av data-kurering.
For video-matting, ble SAM2Matting evaluert på V-HIM60 og VideoMatte i en zero-shot-innstillinger, mot video-trente systemer MatAnyone2, MatAnyone, MaGGIe, FTP-VM, og RVM, med konsistente gevinster rapportert over både medium og hard splitt.
Over alle benchmark, registrerer de tre variantene lavere feil på MAD, MSE, Grad, Conn og dtSSD, med SAM3 som oppnår de sterkeste samle-resultatene, mens de laveste dtSSD-verdiene tilsynelatende indikerer mer stabile ramme-til-ramme-konsistens:
Kvantitative resultater på video-matting-benchmark over V-HIM60 og VideoMatte, evaluert i en zero-shot-innstillinger, som viser lavere feil over alle metrikker, med beste, nest beste og tredje beste resultater fremhevet i rød, oransje og gul, henholdsvis.
Forfatterne hevder at disse resultatene reflekterer den koblete designen, hvor VOS-trackeren bevare tidsstrukturen og matting-modulene fokuserer på grensedetalj, og muliggjør at bilde-trente modeller overgår fullt overvåkede video-tilnærminger.
Kvalitative tester
For menneskelig matting i kvalitative tester, fant forfatterne at Sam2Matting overgikk konkurranse-baselinjer:
Kvalitativ sammenligning på menneskelig og i felten video-matting, hvor SAM2Matting bevare finhårende tråder og semi-gjennomsiktige regioner mer nøyaktig enn RVM og MatAnyone, og produserer renere grenser og færre manglende strukturer i utfordrende områder.
Som vist nedenfor, hadde eksisterende video-matting-systemer som MatAnyone2 og MaGGIe, som var trent på domene-spesifikke og ofte menneske-sentriske datasett, problemer med å generalisere til i felten-sekvenser, spesielt når de håndterer raskt bevegende subjekter som voksende røtter, semi-gjennomsiktige sommerfugler og raskt dryppende vann:

Kvalitativ sammenligning på i felten-sekvenser, hvor SAM2Matting bevare finstrukturer og tidskonsistens mer effektivt enn MatAnyone2 og MaGGIe, spesielt for ikke-menneskelige subjekter, rask bevegelse og semi-gjennomsiktige elementer som vann, glass og insekt-vinger. Vennligst se kildeartikkelen for bedre oppløsning.
Omvendt, viste SAM2Matting seg å være i stand til å bevare stabil sporing og å trekke ut finmaskert detalj mer pålitelig i disse utfordrende scenariene.
Til slutt, som vist i figuren nedenfor, håndterte SAM2Matting effektivt mål med festede objekter, som mennesker som sykler eller holder ski-staver, og undertrykte nærliggende bakgrunns-forstyrrelser, og nytt godt av den matte-mask-konsistens-begrensningen som ble beskrevet tidligere.

Kvalitativ sammenligning på sekvenser med festede objekter og bakgrunns-forstyrrelser, hvor SAM2Matting bevare strukturer som sykler og ski-staver mer nøyaktig enn MatAnyone2, og undertrykker nærliggende uro og holder renere silhuetter over rammer.
Konklusjon
Fremstillingene i den nye artikkelen demonstrerer hvorvidt extrahering, en av de eldste oppgavene i datavisjon, fortsatt er uløst og motstandsdyktig mot generaliserte tilnærminger. Som med mange andre visjon-baserte modeller, er problemet at extraheringsalgoritmer holder fast ved domenekunnskap i stedet for å tilpasse seg lett til ukjente og ukjente objekter; denne oppgaven belaster yttergrensene av en modells generaliserings-evne.
Mens det nye arbeidet er et skritt fremover fra denne avhengigheten, er det fortsatt langt igjen, når en ser på hvor mye denne oppgaven er integrert i våre daglige liv, gjennom video-portalene.
Først publisert mandag, 13. juli 2026












