Andersons hoek

Verbetering van AI-achtergrondverwijdering zonder dure menselijke annotatie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

Nieuw onderzoek toont aan dat AI schoon mensen uit video’s kan knippen zonder dure menselijke labeling, waardoor de kwaliteit en stabiliteit verbeteren

 

De meesten van ons zullen hebben meegemaakt dat ze uit een achtergrond zijn verwijderd door eenvoudige achtergrond-veranderende/verduisterende filters op videobelplatforms – en we zullen misschien hebben opgemerkt dat dergelijke systemen beperkingen hebben, die zijn getraind op de meest voorkomende soorten gevallen die waarschijnlijk in een videogesprek worden aangetroffen, en die meestal niet robuust zijn tegen onverwachte dingen – of zelfs tegen voorspelbare objecten, zoals vingers:

Een typisch voorbeeld van een AI-getraind voorgrondextractiesysteem dat te veel van het brononderwerp wegsnijdt. Bron - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

Een typisch voorbeeld van een AI-getraind voorgrondextractiesysteem dat te veel van het brononderwerp wegsnijdt. Bron

De eenvoudigste oplossing, en een die steeds populairder wordt in het licht van visuele taalmodellen (VLM’s) die niet specifiek voor dergelijke taken zijn getraind, is om een bestaand model te fine-tunen op gegevens die waarschijnlijk door het systeem worden gegenereerd:

Twee grote, zorgvuldig geannoteerde datasets vormen de basis voor de oplossingen die in het paper van 2020 'Real-Time High-Resolution Background Matting' worden aangeboden. Bron - https://arxiv.org/pdf/2012.07810

Twee grote, zorgvuldig geannoteerde datasets vormen de basis voor de oplossingen die in het paper van 2020 ‘Real-Time High-Resolution Background Matting’ worden aangeboden. Bron

Er is echter een nadeel: dergelijke gegevens moeten worden geannoteerd, tegen enige kosten en met enige tijdsverlies, door mensen; en bovendien resulteert dit in een zeer specifiek en niet-generaliseerd instrument dat veel geld kost en meestal niet voor een bredere variëteit aan taken kan worden gebruikt.

Desondanks is het ontwikkelen van ‘gerichte’ modellen van dit type momenteel de kortste weg naar effectieve inferentie in een verscheidenheid aan domeinen, niet alleen video- en beeldmatting (d.w.z. achtergrondverwijdering/voorgrondmatting). Tot nu toe hebben veel van de onbegeleide oplossingen die zijn aangeboden, het probleem eigenlijk alleen maar verplaatst.

Ook nu, ondanks de verspreiding van AI-geverbeterde filters in platforms zoals Zoom, beveelt Zoom nog steeds een groene scherm aan als de optimale oplossing voor achtergrondverwijdering – een omslachtige en enigszins ‘professionele’ oplossing die de meesten van ons misschien een beetje zelfbewust zou maken.

Knip het eruit!

Onlangs is de interesse toegenomen in het gebruik van de Segment Anything (SAM) familie om geautomatiseerde en fijne extractie te bieden. Aangezien SAM is ontwikkeld om annotatie te ondersteunen en niet om scherpe contouren te produceren die in een visuele effectenpijplijn worden geaccepteerd, zijn de standaardgrenzen van SAM niet geschikt om de uitdaging aan te gaan zonder hulp:

Klik om af te spelen, indien nodig. Een voorbeeld van de ruwe randen die worden gegenereerd door een Segment Anything-model – ideaal voor annotatie, maar niet goed genoeg voor VFX-drop-out. Bron 

Onlangs heeft een aanbod uit China een meer geavanceerde manier voorgesteld om SAM-modellen te gebruiken om superieure extractieprocessen te verkrijgen – door een basis tracker zoals SAM te koppelen aan een regiovoorstelbrug met speciale mattingkoppen. Op deze manier kan het systeem randdetails iteratief verfijnen en moeilijke randen oplossen, zoals haar in beweging:

Klik om af te spelen, indien nodig. Van de aanvullende site die het nieuwe paper ondersteunt, een combinatie van aanvullende video’s, die de geavanceerdheid van de methode van de auteurs voor extractie demonstreren. Bron 

Het nieuwe samengestelde systeem wordt alleen getraind op afbeeldingen, niet op video’s, en vereist geen additionele menselijke annotatie – de traditionele hindernis tegen vooruitgang in dit, en diverse andere AI-domeinen.

Voorbeelden van fijne afbeeldings- en videomating die zijn behaald met de nieuwe methode, met moeilijke gevallen zoals haar, transparantie en beweging, naast in-the-wild-sequenties, waar de methode - volgens de auteurs - schoonere, stabielere resultaten produceert dan eerdere benaderingen. Bron - https://arxiv.org/pdf/2606.27339

Voorbeelden van fijne afbeeldings- en videomating die zijn behaald met de nieuwe methode, met moeilijke gevallen zoals haar, transparantie en beweging, naast in-the-wild-sequenties, waar de methode – volgens de auteurs – schoonere, stabielere resultaten produceert dan eerdere benaderingen. Bron

Met drie experimentele modellen die voor het onderzoek zijn gemaakt, claimen de auteurs nieuwe staat-van-de-kunst-prestaties in deze taak, terwijl ze de hogere generalisatiecapaciteiten van het basismodel behouden, wat betekent dat de methode een allesomvattend model produceert met extra capaciteiten, in plaats van een geïsoleerd instrument dat is gericht op een enkele taak.

De auteurs verklaren:

‘Uitgebreide experimenten tonen aan dat SAM2Matting staat-van-de-kunst-prestaties (SOTA) bereikt op zowel afbeeldings- als videomating, met videomating die in een strikt zero-shot-manier wordt geëvalueerd.

‘Uitgebreide in-the-wild-resultaten demonstreren verder hun sterke generalisatie naar open-wereld-scenario’s met snelle beweging, complexe achtergronden en doelhechtingen (bijv. man die op een fiets rijdt).

‘Bovendien zijn onze mattingcomponenten licht en efficiënt, waardoor de SAM2.1-Tiny-variant kan draaien op 40 FPS op een 200-frame 1080p-video met minder dan 5GB GPU-geheugen.’

Het nieuwe paper heeft de titel SAM2Matting: Generalized Image and Video Matting en komt van vier auteurs van Fudan University en Shanghai University of Finance and Economics. Het werk heeft een GitHub-repository, die op het moment van schrijven checkpoints van verschillende varianten, inferencecode en een interactieve demo heeft vrijgegeven, met een release van trainingscode in het vooruitzicht. Bovendien is er een projectsite.

Methode

De methode van de auteurs scheidt tracking van fijne detailextractie door een video-object-segmentatie (VOS) tracker te gebruiken om een temporally consistent grove masker voor elke frame te produceren, terwijl een speciale mattingpijplijn randen verfijnt:

Overzicht van de pijplijn, waar een flexibele prompt en invoervideo in een video-object-segmentatie-tracker worden gevoerd om een grove masker te produceren, die wordt verfijnd door een ROI-detector en omgezet in een trimap voordat een progressieve multi-schaalpredictor de finale hoge-detaillenmatte genereert.

Overzicht van de pijplijn, waar een flexibele prompt en invoervideo in een video-object-segmentatie-tracker worden gevoerd om een grove masker te produceren, die wordt verfijnd door een Region-of-Interest (ROI) detector en omgezet in een trimap voordat een progressieve multi-schaalpredictor de finale hoge-detaillenmatte genereert.

Een regiovanbelang-detector (ROI-detector) identificeert vervolgens regio’s met fijne details of semi-transparantie, die worden omgezet in een trimap (een drie-regio-masker dat voorgrond, achtergrond en onzekere gebieden verdeelt) die verfijning gidst, waarna een Progressieve Alpha Predictor de finale matte genereert door een grof-tot-fijn-cascade over meerdere schalen

Conventionele matting-systemen gebruiken meestal regio’s van belang met behulp van eenvoudige morfologische operaties, of door de masker rechtstreeks opnieuw te gebruiken – benaderingen die fijne details kunnen missen, of gebieden kunnen omvatten die geen verfijning vereisen:

Vergelijking van standaard masker-gebaseerde verwerking met grondwaarheidstrimap, waaruit blijkt dat eenvoudige morfologische operaties grove, uniforme randen produceren die fijne structuren zoals haar en transparantie missen, waardoor detailverlies in de finale matte optreedt.

Vergelijking van standaard masker-gebaseerde verwerking met grondwaarheidstrimap, waaruit blijkt dat eenvoudige morfologische operaties grove, uniforme randen produceren die fijne structuren zoals haar en transparantie missen, waardoor detailverlies in de finale matte optreedt.

Samengestelde interest

Anders dan de voorgestelde Regiovanbelang-detector behandelt deze stap als een pixel-wijs classificatietaken (d.w.z. elke individuele pixel in de afbeelding als een afzonderlijke beslissing behandelen en hem een label toewijzen op basis van of het tot een matting-kritieke regio behoort of niet) die de VOS-masker, de huidige frame en multi-schaalafbeeldingsfuncties integreert, om matting-kritieke regio’s meer precies te isoleren.

In de nieuwe benadering wordt de voorspelde ROI eerst omgezet in een pseudo-trimap die definitieve voorgrond en achtergrond van onzekere regio’s scheidt, met behulp van de tracker-masker om bekende gebieden toe te wijzen en de ROI als twijfelachtig te markeren, zodat latere verwerking zich expliciet kan richten op randen waar detail moet worden opgelost.

Verfijning wordt vervolgens afgehandeld door een Progressieve Alpha Predictor die matting behandelt als een stapsgewijs proces, waarbij tussenresultaten van grof naar fijner schalen worden doorgegeven, waarbij elke fase de afbeelding, de trimap en de vorige schatting gebruikt om structuur progressief te scherpen en fijne details te herstellen.

In de laatste fase wordt de hoogste resolutie-uitvoer omhoog geschaald om de voltooide matte te produceren, waardoor brede vormen vroeg kunnen worden vastgesteld en fijnere elementen zoals haar en transparantie in latere passes kunnen worden opgelost.

Tijdens de training werden de auteurs de VOS-tracker bevroren, terwijl alleen de mattingcomponenten werden getraind op hoge-kwaliteitsafbeeldingsgegevens – waardoor fijne details konden worden verfijnd zonder de consistentie van de tracking te schaden. Supervisie werd vervolgens per frame toegepast, met regio’s van belang die werden afgeleid van de grondwaarheid alpha-matte, en die werden gebruikt om het leren te leiden, terwijl de ROI-detector werd getraind met verliezen die waren ontworpen om nauwkeurige randclassificatie te stimuleren en hakkerige artefacten te verminderen.

Voor alfa-schatting werden verliezen toegepast over meerdere schalen om detail progressief te verbeteren, naast een aanvullende beperking die was bedoeld om de voorspelde matte uit te lijnen met het oorspronkelijke masker – waardoor structuur werd behouden en holle of gebroken regio’s in de finale uitvoer werden voorkomen.

Gegevens en tests

Acht afbeeldingsmatting-datasets werden aanvankelijk gebruikt voor de proeven: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; en RefMatte; en drie varianten van de ‘Sam2Matting’-benadering werden ontwikkeld als VOS-trackers, respectievelijk gebruikmakend van SAM2.1-Tiny; SAM2.1-Base+; en het concept-georiënteerde SAM3.

De tracker-component werd bevroren, met alleen de mattingcomponenten geoptimaliseerd. Alle versies werden getraind voor vijf epochs over vier NVIDIA A6000 GPUs, elk met een VRAM-toewijzing van 48GB. Een batchgrootte van 32 werd gebruikt, onder de AdamW-optimizer. Metrics die werden gebruikt waren Mean Absolute Difference (MAD); Mean Squared Error (MSE); Gradient (Grad); Connectivity (Conn); en dtSSD (voor videomating alleen).

Kwantitatieve tests

De auteurs begonnen met kwantitatieve testing van de nieuwe systemen op afbeeldingsmatting, met behulp van de benchmarks P3M-500-NP; AM-2K (‘GFM’ in resultaten); MAM (‘Matte Anything’, in resultaten); E2E-HIM; Lightweight; en PPM-100 (‘MODNet’, in resultaten):

Kwantitatieve resultaten op afbeeldingsmatting-benchmarks over P3M-500-NP, AM-2K test, en PPM-100, met lagere waarden die betere prestaties aangeven over alle metrics, en beste, tweede beste en derde beste resultaten gemarkeerd in rood, oranje en geel respectievelijk.

Kwantitatieve resultaten op afbeeldingsmatting-benchmarks over P3M-500-NP, AM-2K test, en PPM-100, met lagere waarden die betere prestaties aangeven over alle metrics, en beste, tweede beste en derde beste resultaten gemarkeerd in rood, oranje en geel respectievelijk. Verwijzing naar bronpaper voor betere resolutie.

Van deze resultaten zegt het paper:

‘Zoals hierboven wordt getoond, presteren alle drie de varianten van SAM2Matting consistent beter dan eerdere baselines over verschillende metrics. Bijvoorbeeld bereikt de SAM2.1-Tiny-variant een 11,48 lagere MAD dan MAM op P3M-500-NP.’

De auteurs beweren dat de resultaten over het algemeen aantonen dat hun benadering superieure resultaten bereikt door de kernconceptuele ontwerp, en niet vanwege het niveau van gegevenscuratie.

Voor videomating werd SAM2Matting geëvalueerd op V-HIM60 en VideoMatte in een zero-shot-setting, tegen de video-getrainde systemen MatAnyone2, MatAnyone, MaGGIe, FTP-VM, en RVM, met consistente winsten gemeld over zowel medium als harde splits.

Over alle benchmarks behalen de drie varianten lagere fouten op MAD, MSE, Grad, Conn, en dtSSD, waarbij SAM3 de sterkste overall resultaten bereikt, terwijl de laagste dtSSD-waarden blijkbaar meer stabiele frame-tot-frame-consistentie aangeven:

Kwantitatieve resultaten op videomating-benchmarks over V-HIM60 en VideoMatte, geëvalueerd in een zero-shot-setting, met lagere fouten over alle metrics, en beste, tweede beste en derde beste resultaten gemarkeerd in rood, oranje en geel respectievelijk.

Kwantitatieve resultaten op videomating-benchmarks over V-HIM60 en VideoMatte, geëvalueerd in een zero-shot-setting, met lagere fouten over alle metrics, en beste, tweede beste en derde beste resultaten gemarkeerd in rood, oranje en geel respectievelijk.

De auteurs beweren dat deze resultaten het decoupled ontwerp weerspiegelen, waarbij de VOS-tracker de temporele structuur behoudt en de matting-modules zich richten op randdetails, waardoor image-getrainde modellen de volledig gesuperviseerde video-benaderingen kunnen overtreffen.

Kwalitatieve tests

Voor menselijke matting in kwalitatieve tests vonden de auteurs dat Sam2Matting de concurrerende baselines overtrof:

Kwalitatieve vergelijking op menselijke en in-the-wild-videomating, waar SAM2Matting fijne haarspelden en semi-transparante regio's nauwkeuriger behoudt dan RVM en MatAnyone, waardoor schoner randen en minder ontbrekende structuren in moeilijke gebieden worden gegenereerd.

Kwalitatieve vergelijking op menselijke en in-the-wild-videomating, waar SAM2Matting fijne haarspelden en semi-transparante regio’s nauwkeuriger behoudt dan RVM en MatAnyone, waardoor schoner randen en minder ontbrekende structuren in moeilijke gebieden worden gegenereerd.

Zoals hieronder wordt getoond, worstelen bestaande videomating-systemen zoals MatAnyone2 en MaGGIe, getraind op domeinspecifieke en vaak mensgerichte datasets, met het generaliseren naar in-the-wild-sequenties, vooral bij het verwerken van snel bewegende onderwerpen zoals groeiende wortels, semi-transparante vlinders en snel druppelend water:

Kwalitatieve vergelijking op in-the-wild-sequenties, waar SAM2Matting fijne structuren en temporele consistentie effectiever behoudt dan MatAnyone2 en MaGGIe, vooral voor niet-menselijke onderwerpen, snelle beweging en semi-transparante elementen zoals water, glas en insectenvleugels.

Kwalitatieve vergelijking op in-the-wild-sequenties, waar SAM2Matting fijne structuren en temporele consistentie effectiever behoudt dan MatAnyone2 en MaGGIe, vooral voor niet-menselijke onderwerpen, snelle beweging en semi-transparante elementen zoals water, glas en insectenvleugels. Verwijzing naar bronpaper voor betere resolutie.

Integendeel, SAM2Matting bleek in staat om stabiele tracking te behouden en fijne details betrouwbaarder te extraheren in deze moeilijke scenario’s.

Tenslotte, zoals wordt getoond in de onderstaande figuur, behandelde SAM2Matting effectief doelen met gehechte objecten, zoals mensen die op fietsen rijden of ski-stokken vasthouden, terwijl het nabijgelegen achtergrondrumoer onderdrukte, dankzij de matte-maskerconsistentiebeperking die eerder werd beschreven.

Kwalitatieve vergelijking op sequenties met gehechte objecten en achtergrondrumoer, waar SAM2Matting structuren zoals fietsen en ski-stokken nauwkeuriger behoudt dan MatAnyone2, terwijl het nabijgelegen rumoer onderdrukt en schoner silhouetten over frames behoudt.

Kwalitatieve vergelijking op sequenties met gehechte objecten en achtergrondrumoer, waar SAM2Matting structuren zoals fietsen en ski-stokken nauwkeuriger behoudt dan MatAnyone2, terwijl het nabijgelegen rumoer onderdrukt en schoner silhouetten over frames behoudt.

Conclusie

De prestaties die in het nieuwe paper worden beschreven, demonstreren de mate waarin extractie, een van de oudste taken in computerzicht, nog steeds onopgelost en resistent is tegen generaliseerde benaderingen. Net als bij veel andere visuele modellen, blijft het probleem dat extractie-algoritmes vasthouden aan domeinkennis in plaats van gemakkelijk aan te passen aan ongeziene en onbekende objecten; deze specifieke taak belast de uiterste grenzen van een models generalisatie.

Terwijl het nieuwe werk een stap vooruit is van die afhankelijkheid, is er nog een lange weg te gaan, gezien de mate waarin deze taak is ingebed in ons dagelijks leven, via videochatpoorten.

 

First published Monday, 13 juli 2026

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai