Andersonův úhel

Vylepšení odstraňování pozadí AI bez nákladného lidského označení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

Nový výzkum ukazuje, že AI může čistě odstranit lidi z videa bez drahého lidského označení, zlepšuje kvalitu a stabilitu

 

Většina z nás již zažila být “odstraněna” z pozadí prostřednictvím jednoduchých filtrů pro změnu pozadí na platformách pro videohovory – a možná jste si všimli omezení těchto systémů, které jsou trénovány na nejčastější typy případů, které se vyskytují ve video konferencích, a nejsou obvykle odolné vůči ničemu “neočekávanému” – nebo dokonce vůči předvídatelným objektům, jako jsou prsty:

Typický příklad systému extrakce popředí trénovaného pomocí AI, který odstraní příliš mnoho zdrojového subjektu. Zdroj - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

Typický příklad systému extrakce popředí trénovaného pomocí AI, který odstraní příliš mnoho zdrojového subjektu. Zdroj

Nejjednodušší řešení, které se stává stále populárnějším tváří v tvář modelům počítačového vidění, které nejsou speciálně trénovány pro tyto úkoly, je jemné ladění existujícího modelu na datech, která jsou pravděpodobně setkána systémem:

Dva datasets s vysokým objemem a excruciatingly-annotovanými daty jsou základem řešení nabízených v článku z roku 2020 'Real-Time High-Resolution Background Matting'. Zdroj - https://arxiv.org/pdf/2012.07810

Dva datasets s vysokým objemem a excruciatingly-annotovanými daty jsou základem řešení nabízených v článku z roku 2020 ‘Real-Time High-Resolution Background Matting’. Zdroj

Avšak taková data musí být označena, a to za určitou cenu a za určitou dobu, lidmi; a v každém případě to vede k velmi specifickému a negeneralizovanému nástroji, který stojí hodně peněz a nemůže být obvykle použit pro širší řadu úkolů.

Naproti tomu vývoj “cílených” modelů tohoto typu je目前 nejkratší cestou k efektivní inferenci v různých doménách, nejen ve video a obrazovém matování (tj. odstraňování pozadí/popředí). Do dneška většina nesupervizovaných řešení pouze posunula problém.

(…)

Cut It Out!

V poslední době rostl zájem o použití Segment Anything (SAM) pro automatizovanou a jemnou extrakci. SAM byl vyvinut pro pomoc při označení spíše než pro poskytování ostrých obrysů standardně akceptovaných ve vizuálních efektech, jeho výchozí hranice nejsou vhodné pro řešení této výzvy bez pomoci:

Klikněte pro přehrávání, pokud je to nutné. Příklad hrubých hranic vytvořených modelem Segment Anything – ideální pro označení, ale ne dostatečně dobré pro VFX dropout. Zdroj 

Nedávná nabídka z Číny navrhla sofistikovanější způsob použití modelů SAM pro získání lepší extrakce – spojením základního trackera, jako je SAM, s mostem pro návrh regionu s věnovanými hlavičkami pro matování. Tímto způsobem je systém schopen iterativně rafinovat detaily hranic a řešit náročné hrany, jako je vlas v pohybu:

Klikněte pro přehrávání, pokud je to nutné. Z webu, který podporuje nový článek, je soubor doplňkových videí, demonstrujících sofistikovanost autorů metody pro extrakci. Zdroj 

Klíčovým faktem je, že nový kompozitní systém se trénuje pouze na obrázcích, ne na videích, a nevyžaduje žádné další lidské označení – tradiční překážku pro pokrok v této a mnoha dalších oblastech AI.

Příklad jemné extrakce obrazu a videa pomocí nové metody, se složitými případy, jako je vlas, průhlednost a pohyb, spolu se sekvencemi z reálného světa, kde metoda produkuje – podle autorů – čistější a stabilnější výsledky než předchozí přístupy. Zdroj - https://www.unite.ai/the-download-more-labels-illusion-in-ai-research/

Příklad jemné extrakce obrazu a videa pomocí nové metody, se složitými případy, jako je vlas, průhlednost a pohyb, spolu se sekvencemi z reálného světa, kde metoda produkuje – podle autorů – čistější a stabilnější výsledky než předchozí přístupy. Zdroj

S třemi experimentálními modely vyvinutými pro tuto práci autoři tvrdí, že dosáhli nové špičkové výkony v této úloze, zatímco zachovali vyšší generalizační schopnosti základního modelu, což znamená, že metoda produkuje univerzální model s dalšími schopnostmi, spíše než specializovaný nástroj zaměřený na jeden úkol.

Autoři uvádějí:

‘Komplexní experimenty ukazují, že SAM2Matting dosahuje špičkové výkony (SOTA) na obou obrazovém a videomatování, s videomatováním hodnoceným v přísně nulovém režimu.

‘Široké výsledky z reálného světa dále demonstrují jeho silnou generalizaci na scénáře s rychlým pohybem, složitými pozadím a připojenými objekty (například člověk jedoucí na kole).

‘Kromě toho jsou naše matovací komponenty lehké a efektivní, což umožňuje variantě SAM2.1-Tiny běžet na 40 FPS na 200snímkové 1080p video pomocí méně než 5GB GPU paměti.’

Nový článek se jmenuje SAM2Matting: Generalizované obrazové a videomatování a pochází od čtyř autorů z Fudan University a Shanghai University of Finance and Economics. Práce má GitHub repozitář, který v době psaní tohoto článku uvolnil kontrolní body různých variant, kód pro inferenci a interaktivní demo, s uvolněním tréninkového kódu slíbeným. Kromě toho existuje webová stránka projektu.

Metoda

Autoři metody oddělují sledování od jemné extrakce pomocí video objektového segmentačního trackera pro produkci časově konzistentní hrubé masky pro každý snímek, zatímco specializovaná matovací pipeline rafinuje hranice:

Přehled pipeline, kde flexibilní prompt a vstupní video se zavádějí do video objektového segmentačního trackera pro produkci hrubé masky, která je rafinována detektorem ROI a převedena na trimap předtím, než прогресivní multi-škálový prediktor generuje konečnou jemnou masku.

Přehled pipeline, kde flexibilní prompt a vstupní video se zavádějí do video objektového segmentačního trackera pro produkci hrubé masky, která je rafinována detektorem ROI a převedena na trimap předtím, než прогресivní multi-škálový prediktor generuje konečnou jemnou masku.

Detektor ROI poté identifikuje oblasti s jemnými detaily nebo poloprůhledností, které se převádějí na trimap (tříoborovou masku rozdělující popředí, pozadí a nejistá území), která řídí rafinaci, po které прогресivní alfa prediktor generuje konečnou masku prostřednictvím hrubého na jemném kaskádového procesu přes několik škál

Tradiční matovací systémy obvykle odvozují oblasti zájmu pomocí jednoduchých morfologických operací, nebo přímo opakují masku – přístupy, které mohou buď přehlédnout jemné detaily, nebo zahrnout oblasti, které nevyžadují rafinaci:

Srovnání standardního maskového zpracování s ground-truth trimapy, ukazující, jak jednoduché morfologické operace produkují hrubé, uniformní hranice, které postrádají jemné struktury, jako je vlas a průhlednost, vedoucí ke ztrátě detailů v konečné masce.

Srovnání standardního maskového zpracování s ground-truth trimapy, ukazující, jak jednoduché morfologické operace produkují hrubé, uniformní hranice, které postrádají jemné struktury, jako je vlas a průhlednost, vedoucí ke ztrátě detailů v konečné masce.

Komplexní úrok

Naopak, navrhovaný detektor ROI místo toho zpracovává tento krok jako pixelovou klasifikační úlohu (tj. zpracovává každý jednotlivý pixel v obraze jako samostatné rozhodnutí a přiřazuje mu štítek na základě toho, zda patří do matoucího kritického regionu nebo ne), která integruje masku VOS, aktuální snímek a multi-škálové obrazové rysy, aby přesněji izolovala matoucí kritické regiony.

V novém přístupu se předpovězená ROI nejprve převádí na pseudo-trimap, která odděluje jisté popředí a pozadí od nejistých regionů, pomocí trackovací masky pro přiřazení známých oblastí, zatímco ROI se označuje jako nejistá, aby následné zpracování mohlo soustředit na hranice, kde je třeba vyřešit detaily.

Rafinace se poté provádí прогресivním alfa prediktorem, který zpracovává matování jako krok za krokem proces, předávající mezitímní výsledky z hrubých na jemnějších škálách, přičemž každá fáze používá obraz, trimap a předchozí odhad pro postupné zjemňování struktury a obnovení jemných detailů.

Na konečném stupni se nejvyšší rozlišení výstup zvyšuje, aby se produkovala dokončená maska, umožňující širokým tvarům být stanoveny brzy, zatímco jemnější prvky, jako je vlas a průhlednost, jsou řešeny v pozdějších průchodech.

Během tréninku autoři zmrazili VOS tracker, zatímco trénovali pouze matovací komponenty na vysoce kvalitních obrazových datech – umožňující jemné detaily být rafinovány bez degradace sledovací konzistence. Dozor se poté aplikoval na každou snímek, s oblastmi zájmu odvozenými z ground-truth alfa masky, a použity pro vedení učení, zatímco detektor ROI se trénoval se ztrátami navrženými pro přesnou klasifikaci hranic a snížení zubatých artefaktů.

Pro alfa odhad, byly použity ztráty napříč několika škálami pro postupné zlepšení detailů, spolu s dalšími omezeními určenými pro udržení předpovězené masky v souladu s původní maskou – pomáhající zachovat strukturu a předejít dutým nebo rozbitým regionům ve konečném výstupu.

Data a testy

Bylo použito osm obrazových matovacích datasets pro počáteční testy: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; a RefMatte; a tři varianty ‘Sam2Matting’ přístupu byly vyvinuty jako VOS trackery, resp. pomocí SAM2.1-Tiny; SAM2.1-Base+; a konceptem zaměřeným SAM3.

Tracker komponent byl zmrazen, s pouze matovacími komponenty optimalizovanými. Všechny verze byly trénovány po dobu pěti epoch napříč čtyřmi NVIDIA A6000 GPU, každá s alokací VRAM 48GB. Byla použita velikost batche 32, pod AdamW optimalizátorem. Použité metriky byly Průměrná absolutní odchylka (MAD); Průměrná čtvercová chyba (MSE); Gradient (Grad); Spojitost (Conn); a dtSSD (pouze pro videomatování).

Kvantitativní testy

Autoři začali kvantitativním testováním nových systémů na obrazovém matování, pomocí benchmarků P3M-500-NP; AM-2K (‘GFM’ ve výsledcích); MAM (‘Matte Anything’, ve výsledcích); E2E-HIM; Lightweight; a PPM-100 (‘MODNet’, ve výsledcích):

Kvantitativní výsledky na obrazovém matování benchmarků napříč P3M-500-NP, AM-2K test, a PPM-100, s nižšími hodnotami indikujícími lepší výkon napříč všemi metrikami, a nejlepší, druhý nejlepší a třetí nejlepší výsledky zvýrazněné červeně, oranžově a žlutě, resp.

Kvantitativní výsledky na obrazovém matování benchmarků napříč P3M-500-NP, AM-2K test, a PPM-100, s nižšími hodnotami indikujícími lepší výkon napříč všemi metrikami, a nejlepší, druhý nejlepší a třetí nejlepší výsledky zvýrazněné červeně, oranžově a žlutě, resp. Prosím, odkážete se na zdroj článku pro lepší rozlišení.

Z těchto výsledků článek uvádí:

‘Jak je vidět [výše], všechny tři varianty SAM2Matting konzistentně překonávají předchozí benchmarky napříč různými metrikami. Například varianta SAM2.1-Tiny dosahuje o 11,48 nižší MAD než MAM na P3M-500-NP.’

Autoři tvrdí, že výsledky napříč všemi benchmarky ukazují, že jejich přístup dosahuje lepší výsledky díky jádru konceptuálního designu, a ne kvůli úrovni datové kúry.

Pro videomatování byl SAM2Matting hodnocen na V-HIM60 a VideoMatte v nulovém režimu, proti video-trénovaným systémům MatAnyone2, MatAnyone, MaGGIe, FTP-VM, a RVM, s konzistentními zisky hlášenými napříč oběma středními a tvrdými rozděleními.

Po všech benchmarcích zaznamenaly tři varianty nižší chyby na MAD, MSE, Grad, Conn, a dtSSD, s SAM3 dosahujícím nejlepších celkových výsledků, zatímco nejnižší hodnoty dtSSD zřejmě indikují stabilnější rámcovou konzistenci:

Kvantitativní výsledky na videomatovacích benchmarcích napříč V-HIM60 a VideoMatte, hodnocených v nulovém režimu, ukazující nižší chyby napříč všemi metrikami, s nejlepšími, druhými nejlepšími a třetími nejlepšími výsledky zvýrazněnými červeně, oranžově a žlutě, resp.

Kvantitativní výsledky na videomatovacích benchmarcích napříč V-HIM60 a VideoMatte, hodnocených v nulovém režimu, ukazující nižší chyby napříč všemi metrikami, s nejlepšími, druhými nejlepšími a třetími nejlepšími výsledky zvýrazněnými červeně, oranžově a žlutě, resp.

Autoři tvrdí, že tyto výsledky odrážejí decoupled design, kde VOS tracker zachovává časovou strukturu a matovací moduly se soustředí na detaily hranic, umožňující obrazově trénovaným modelům překonat plně supervidované video přístupy.

Kvalitativní testy

Pro lidské matování v kvalitativních testech autoři zjistili, že Sam2Matting překonal konkurenční benchmarky:

Kvalitativní srovnání na lidském a v divočině videomatování, kde SAM2Matting zachovává jemné vlasové struktury a poloprůhledné regiony přesněji než RVM a MatAnyone, produkující čistější hranice a méně chybějících struktur v náročných oblastech.

Kvalitativní srovnání na lidském a v divočině videomatování, kde SAM2Matting zachovává jemné vlasové struktury a poloprůhledné regiony přesněji než RVM a MatAnyone, produkující čistější hranice a méně chybějících struktur v náročných oblastech.

Jako je vidět níže, existující video matovací systémy, jako je MatAnyone2 a MaGGIe, trénované na doménově specifických a často lidsky centrických datech, měly potíže s generalizací na v divočině sekvencích, zvláště při zpracování rychle se pohybujících subjektů, jako jsou rostoucí kořeny, poloprůhledné motýli a rychle kapající voda:

Kvalitativní srovnání na v divočině sekvencích, kde SAM2Matting zachovává jemné struktury a časovou konzistenci účinněji než MatAnyone2 a MaGGIe, zvláště pro nelidské subjekty, rychlý pohyb a poloprůhledné prvky, jako je voda, sklo a křídla hmyzu.

Kvalitativní srovnání na v divočině sekvencích, kde SAM2Matting zachovává jemné struktury a časovou konzistenci účinněji než MatAnyone2 a MaGGIe, zvláště pro nelidské subjekty, rychlý pohyb a poloprůhledné prvky, jako je voda, sklo a křídla hmyzu. Prosím, odkážete se na zdroj článku pro lepší rozlišení.

Naproti tomu SAM2Matting prokázal schopnost udržet stabilní sledování a extrahovat jemné detaily spolehlivěji, v těchto náročných scénářích.

Nakonec, jak je vidět na obrázku níže, SAM2Matting účinně zpracoval cíle s připojenými objekty, jako je člověk jedoucí na kole nebo držící lyžařské hole, zatímco potlačoval blízké pozadí rušení, bénéficiující z masky-maska konzistence omezení popsáno dříve.

Kvalitativní srovnání na sekvencích s připojenými objekty a pozadím rušení, kde SAM2Matting zachovává struktury, jako je kola a lyžařské hole, přesněji než MatAnyone2, zatímco potlačuje blízké pozadí rušení a udržuje čistší siluety napříč snímky.

Kvalitativní srovnání na sekvencích s připojenými objekty a pozadím rušení, kde SAM2Matting zachovává struktury, jako je kola a lyžařské hole, přesněji než MatAnyone2, zatímco potlačuje blízké pozadí rušení a udržuje čistší siluety napříč snímky.

Závěr

Úspěchy popsány v novém článku demonstrují rozsah, v jakém extrakce, jedna z nejstarších úkolů v počítačovém vidění, zůstává nevyřešená a odolná vůči generalizovaným přístupům. Jako u mnoha jiných vizuálních modelů, problémem je, že extrakční algoritmy lpí na doménovém vědomí místo aby se snadno přizpůsobily neviditelným a neznámým objektům; tento konkrétní úkol táhne vnější hranice generalizace modelu.

Zatímco nová práce je krokem vpřed od této závislosti, stále je ještě dlouhá cesta, kterou je třeba projít, uvážeme-li rozsah, v jakém je tento úkol zabudován do našeho denního života, prostřednictvím videohovorových portálů.

 

Poprvé publikováno v pondělí, 13. července 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai