Unghiul lui Anderson

Îmbunătățirea eliminării fundalului AI fără costisitoarele annotări umane

mm
Adaugă Unite.AI la sursele tale preferate pe Google
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

Noi cercetări arată că AI poate elimina curat oamenii din videoclipuri fără costisitoarele annotări umane, îmbunătățind calitatea și stabilitatea

 

Majoritatea dintre noi am experimentat “a fi eliminați” dintr-un fundal prin simple filtre de modificare a fundalului pe platforme de videoconferință – și am putea fi observat limitările unor astfel de sisteme, care sunt antrenate pe cele mai frecvente tipuri de cazuri care pot fi găsite într-o conferință video și nu sunt de obicei robuste la nimic “neobișnuit” – sau chiar la obiecte previzibile, cum ar fi degetele:

Un exemplu tipic al unui sistem de extragere a primului plan antrenat de AI, care taie prea mult din subiectul sursă. Sursă - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

Un exemplu tipic al unui sistem de extragere a primului plan antrenat de AI, care taie prea mult din subiectul sursă. Sursă

Cea mai ușoară soluție, și una care devine din ce în ce mai populară în fața modelelor de viziune și limbaj (VLM) care nu sunt special antrenate pentru astfel de sarcini, este de a refine un model existent pe date care sunt probabil să fie întâlnite de sistem:

Două seturi de date de înaltă calitate, extrem de annotate, stau la baza soluțiilor prezentate în lucrarea din 2020 'Real-Time High-Resolution Background Matting'. Sursă - https://arxiv.org/pdf/2012.07810

Două seturi de date de înaltă calitate, extrem de annotate, stau la baza soluțiilor prezentate în lucrarea din 2020 ‘Real-Time High-Resolution Background Matting’. Sursă

Cu toate acestea, astfel de date trebuie să fie annotate, la anumite cheltuieli și la un anumit cost de timp, de către oameni; și, în orice caz, aceasta duce la un instrument foarte specific și nu generalizat, care costă mult și nu poate fi de obicei utilizat pentru o varietate mai largă de sarcini.

În ciuda acestui fapt, dezvoltarea unor astfel de modele “țintite” este, în prezent, cea mai scurtă cale către inferența eficientă într-o varietate de domenii, nu numai în matting-ul de imagine și video (adică, eliminarea fundalului/crearea de măști de prim plan). Până în prezent, multe dintre soluțiile nesupervizate oferite au doar mutat problema pe altă parte.

Chiar și acum, în ciuda proliferării filtrelor îmbunătățite de AI pe platforme precum Zoom, ultima continuă să recomande un ecran verde ca soluție optimă pentru eliminarea fundalului – o soluție încărcătoare și puțin “profesională” care ne-ar face pe majoritatea dintre noi un pic stânjeniți.

Taie!

În ultima vreme, a crescut interesul pentru utilizarea familiei Segment Anything (SAM) pentru a oferi extragere automată și fină:

Apăsați pentru a reda, dacă este necesar. Un exemplu al granițelor brute create de un model Segment Anything – ideal pentru annotare, dar nu suficient de bun pentru pipeline-ul de efecte vizuale. Sursă 

O ofertă recentă din China a propus o modalitate mai sofisticată de utilizare a modelelor SAM pentru a obține procese de extragere superioare – prin combinarea unui tracker fundamental, cum ar fi SAM, cu un pod de propunere de regiune cu capete de matting dedicate. În acest fel, sistemul poate să rafineze detaliile marginilor în mod iterativ și să rezolve muchii dificile, cum ar fi părul în mișcare:

Apăsați pentru a reda, dacă este necesar. De pe site-ul auxiliar care susține noua lucrare, o amalgam de videoclipuri suplimentare, demonstrând sofisticarea metodei autorilor pentru extragere. Sursă 

În mod esențial, noul sistem compozit se antrenează doar pe imagini, nu pe videoclipuri, și nu necesită annotări umane suplimentare – obstacolul tradițional împotriva progresului în acest domeniu și în alte domenii de IA.

Exemple de matting fin de imagine și video realizate cu noua metodă, cu cazuri dificile, cum ar fi părul, transparența și mișcarea, prezentate alături de secvențe din viața reală, unde metoda produce – susțin autorii – rezultate mai curate și mai stabile decât abordările anterioare. Sursă - https://www.unite.ai/wp-content/uploads/2026/07/figure-1.jpg

Exemple de matting fin de imagine și video realizate cu noua metodă, cu cazuri dificile, cum ar fi părul, transparența și mișcarea, prezentate alături de secvențe din viața reală, unde metoda produce – susțin autorii – rezultate mai curate și mai stabile decât abordările anterioare. Sursă

Cu trei modele experimentale produse pentru această lucrare, autorii susțin că au obținut o nouă performanță de top în această sarcină, păstrând în același timp capacitățile de generalizare superioare ale modelului de bază, ceea ce înseamnă că metoda produce un model cu scop general, cu capacități suplimentare, și nu un instrument specializat pentru o singură sarcină.

Autorii afirmă:

‘Experimentele cuprinzătoare arată că SAM2Matting atinge performanța de top (SOTA) atât pe matting de imagine, cât și pe matting de video, cu matting de video evaluat într-un mod strict zero-shot.

‘Rezultatele extinse din viața reală demonstrează în continuare o puternică generalizare la scenarii deschise, cu mișcare rapidă, fundal complex și atașări de țintă (de exemplu, un bărbat care conduce o bicicletă).

‘Mai mult, componentele noastre de matting sunt ușoare și eficiente, permițând variantei SAM2.1-Tiny să ruleze la 40 FPS pe un videoclip de 200 de cadre 1080p, folosind mai puțin de 5 GB de memorie GPU.’

Noua lucrare se intitulează SAM2Matting: Matting generalizat de imagine și video și provine de la patru autori de la Universitatea Fudan și Universitatea de Finanțe și Economie din Shanghai. Lucrarea are un repository GitHub, care, la momentul scrierii, a lansat puncte de control ale diferitelor variante, cod de inferență și un demo interactiv, cu promisiunea lansării codului de antrenare. De asemenea, există un site proiect.

Metodă

Metoda autorilor separă urmărirea de extragerea detaliilor fine, utilizând un tracker de segmentare a obiectelor video (VOS) pentru a produce o mască grosieră temporar consistentă pentru fiecare cadru, în timp ce o conductă de matting dedicată rafinează granițele:

Prezentare generală a conductei, unde un prompt flexibil și un flux de intrare video alimentează un tracker de segmentare a obiectelor video pentru a produce o mască grosieră, care este rafinată de un detector de regiune de interes și transformată într-un trimap înainte de a genera un predictor multi-scară progresiv care produce măștile finale de înaltă definiție.

Prezentare generală a conductei, unde un prompt flexibil și un flux de intrare video alimentează un tracker de segmentare a obiectelor video pentru a produce o mască grosieră, care este rafinată de un detector de regiune de interes și transformată într-un trimap înainte de a genera un predictor multi-scară progresiv care produce măștile finale de înaltă definiție.

Un detector de regiune de interes identifică apoi regiunile cu detalii fine sau semi-transparente, transformându-le într-un trimap (o mască cu trei regiuni care împarte primul plan, fundal și zone incerte) care ghidă rafinarea, după care un predictor alfa progresiv generează măștile finale printr-o cascadă grosieră la fină pe multiple scale

Sistemele convenționale de matting derivă de obicei regiunile de interes utilizând operații morfologice simple, sau prin reutilizarea directă a măștii – abordări care pot să omită detaliile fine sau să includă zone care nu necesită rafinare:

Comparație între procesarea standard bazată pe mască și trimapuri reale, arătând cum operațiunile morfologice simple produc granițe grosiere și uniforme care ratează structuri fine, cum ar fi părul și transparența, ceea ce duce la pierderea detaliilor în măștile finale.

Comparație între procesarea standard bazată pe mască și trimapuri reale, arătând cum operațiunile morfologice simple produc granițe grosiere și uniforme care ratează structuri fine, cum ar fi părul și transparența, ceea ce duce la pierderea detaliilor în măștile finale.

dobândă compusă

În schimb, detectorul de regiune de interes propus tratează acest pas ca o sarcină de clasificare pixel cu pixel (adică, tratarea fiecărui pixel individual din imagine ca o decizie separată și atribuirea unei etichete pe baza apartenenței la o regiune critică de matting sau nu) care integrează masca VOS, cadrul curent și caracteristicile de imagine multi-scară, pentru a izola mai precis regiunile critice de matting.

În abordarea nouă, ROI-ul prezis este convertit mai întâi într-un pseudo-trimap care separă primul plan definit și fundalul de regiunile incerte, utilizând masca tracker pentru a atribui zone cunoscute, în timp ce ROI-ul este marcat ca ambiguu, astfel încât procesarea ulterioară să se concentreze în mod explicit pe granițele unde detaliile trebuie rezolvate.

Rafinarea este apoi gestionată de un predictor alfa progresiv care tratează mattingul ca o sarcină treptată, trecând rezultate intermediare de la scale grosiere la scale fine, cu fiecare etapă utilizând imaginea, trimapul și estimarea anterioară pentru a ascuți progresiv structura și a recupera detaliile fine.

La etapa finală, ieșirea cu cea mai înaltă rezoluție este interpolată pentru a produce măștile finale, permițând stabilirea formelor largi de la început, în timp ce elementele mai fine, cum ar fi părul și transparența, sunt rezolvate în treceri ulterioare.

În timpul antrenării, autorii au înghețat trackerul VOS, antrenând numai componentele de matting pe date de imagine de înaltă calitate – permițând detaliilor fine să fie rafinate fără a degrada consistența urmăririi. Supervizarea a fost aplicată pe cadru, cu regiunile de interes derivate din măștile alfa reale, și utilizate pentru a ghida învățarea, în timp ce detectorul ROI a fost antrenat cu pierderi concepute pentru a încuraja clasificarea precisă a granițelor și a reduce artefactele zgomotoase.

Pentru estimarea alfa, pierderile au fost aplicate pe multiple scale pentru a îmbunătăți progresiv detaliile, alături de o constrângere suplimentară destinată să mențină măștile prezise aliniate cu masca originală – ajutând la păstrarea structurii și la prevenirea regiunilor goale sau rupte în ieșirea finală.

Date și teste

Opt seturi de date de matting de imagine au fost utilizate inițial pentru testele de laborator:

Lucrarea I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; și RefMatte; și trei variante ale abordării ‘Sam2Matting’ au fost dezvoltate ca trackere VOS, utilizând respectiv SAM2.1-Tiny; SAM2.1-Base+; și conceptul focalizat SAM3.

Componenta tracker a fost înghețată, cu doar componentele de matting optimizate. Toate versiunile au fost antrenate timp de cinci epoci pe patru plăci grafice NVIDIA A6000, fiecare cu o alocare de 48GB VRAM. A fost utilizat un batch size de 32, sub optimizerul AdamW. Metricile utilizate au fost Diferența Medie Absolută (MAD); Eroarea Medie Pătratică (MSE); Gradient (Grad); Conectivitate (Conn); și dtSSD (numai pentru matting de video).

Teste cantitative

Autorii au început cu testele cantitative ale noilor sisteme pe matting de imagine, utilizând benchmark-urile P3M-500-NP; AM-2K (‘GFM’ în rezultate); MAM (‘Matte Anything’, în rezultate); E2E-HIM; Lightweight; și PPM-100 (‘MODNet’, în rezultate):

Rezultate cantitative pe benchmark-urile de matting de imagine, cu valori mai mici indicând o performanță mai bună pe toate metricile, și cele mai bune, a doua cea mai bună și a treia cea mai bună performanță evidențiate în roșu, portocaliu și galben, respectiv.

Rezultate cantitative pe benchmark-urile de matting de imagine, cu valori mai mici indicând o performanță mai bună pe toate metricile, și cele mai bune, a doua cea mai bună și a treia cea mai bună performanță evidențiate în roșu, portocaliu și galben, respectiv. Vă rugăm să consultați lucrarea sursă pentru o rezoluție mai bună.

Dintre aceste rezultate, lucrarea afirmă:

‘Așa cum se arată [mai sus], toate cele trei variante ale SAM2Matting depășesc în mod constant bazeline-urile anterioare pe diferite metrici. De exemplu, varianta SAM2.1-Tiny atinge o diferență medie absolută cu 11,48 mai mică decât MAM pe P3M-500-NP.’

Autorii mențin că rezultatele de pe tot parcursul indică faptul că abordarea lor atinge rezultate superioare prin designul conceptual de bază, și nu datorită nivelului de curățenie a datelor.

Pentru matting de video, SAM2Matting a fost evaluat pe V-HIM60 și VideoMatte într-un mod zero-shot, împotriva sistemelor video-antrenate MatAnyone2, MatAnyone, MaGGIe, FTP-VM, și RVM, cu câștiguri constante raportate pe ambele diviziuni medii și grele.

Pe toate benchmark-urile, cele trei variante înregistrează erori mai mici pe MAD, MSE, Grad, Conn și dtSSD, SAM3 atingând cele mai bune rezultate generale, în timp ce cele mai mici valori dtSSD par să indice o consistență mai stabilă de la cadru la cadru:

Rezultate cantitative pe benchmark-urile de matting de video, evaluate într-un mod zero-shot, arătând erori mai mici pe toate metricile, și cele mai bune, a doua cea mai bună și a treia cea mai bună performanță evidențiate în roșu, portocaliu și galben, respectiv.

Rezultate cantitative pe benchmark-urile de matting de video, evaluate într-un mod zero-shot, arătând erori mai mici pe toate metricile, și cele mai bune, a doua cea mai bună și a treia cea mai bună performanță evidențiate în roșu, portocaliu și galben, respectiv.

Autorii susțin că aceste rezultate reflectă designul decuplat, unde trackerul VOS păstrează structura temporală, iar modulele de matting se concentrează pe detaliile granițelor, permițând modelelor antrenate pe imagini să depășească abordările video complet supervizate.

Teste calitative

Pentru mattingul uman în testele calitative, autorii au constatat că Sam2Matting a depășit bazeline-urile competitive:

Comparație calitativă pe matting de video uman și în viața reală, unde SAM2Matting păstrează firele de păr fine și regiunile semi-transparente mai precis decât RVM și MatAnyone, producând granițe mai curate și mai puține structuri lipsă în zonele dificile.

Comparație calitativă pe matting de video uman și în viața reală, unde SAM2Matting păstrează firele de păr fine și regiunile semi-transparente mai precis decât RVM și MatAnyone, producând granițe mai curate și mai puține structuri lipsă în zonele dificile.

După cum se arată mai jos, sistemele existente de matting de video, cum ar fi MatAnyone2 și MaGGIe, antrenate pe seturi de date specifice domeniului și adesea umane, au avut dificultăți în a se generaliza la secvențe din viața reală, în special atunci când au avut de-a face cu subiecți în mișcare rapidă, cum ar fi rădăcini în creștere, fluturi semi-transparenti și apă care picură rapid:

Comparație calitativă pe secvențe din viața reală, unde SAM2Matting păstrează structuri fine și consistență temporală mai eficient decât MatAnyone2 și MaGGIe, în special pentru subiecți non-umani, mișcare rapidă și elemente semi-transparente, cum ar fi apa, sticlă și aripi de insecte.

Comparație calitativă pe secvențe din viața reală, unde SAM2Matting păstrează structuri fine și consistență temporală mai eficient decât MatAnyone2 și MaGGIe, în special pentru subiecți non-umani, mișcare rapidă și elemente semi-transparente, cum ar fi apa, sticlă și aripi de insecte. Vă rugăm să consultați lucrarea sursă pentru o rezoluție mai bună.

În schimb, SAM2Matting a demonstrat capacitatea de a menține o urmărire stabilă și de a extrage detaliile fine în mod mai fiabil în aceste scenarii dificile.

În final, după cum se arată în figura de mai jos, SAM2Matting a gestionat eficient țintele cu obiecte atașate, cum ar fi oameni care conduc biciclete sau țin schiuri, în timp ce suprima distragerile din fundal, beneficiind de constrângerile de consistență a măștii menționate anterior.

Comparație calitativă pe secvențe cu obiecte atașate și distrageri din fundal, unde SAM2Matting păstrează structuri, cum ar fi biciclete și schiuri, mai precis decât MatAnyone2, în timp ce suprimă zgomotul din jur și menține siluete mai curate pe tot parcursul cadrului.

Comparație calitativă pe secvențe cu obiecte atașate și distrageri din fundal, unde SAM2Matting păstrează structuri, cum ar fi biciclete și schiuri, mai precis decât MatAnyone2, în timp ce suprimă zgomotul din jur și menține siluete mai curate pe tot parcursul cadrului.

Concluzie

Realizările prezentate în noua lucrare demonstrează amploarea rămânerii neîncheiate a extragerii, una dintre cele mai vechi sarcini din viziunea computerizată, și rezistența la abordările generalizate. Ca și în cazul multor altor modele bazate pe viziune, problema rămâne aceea că algoritmii de extragere se agață de cunoștințele de domeniu în loc să se adapteze ușor la obiecte necunoscute și neașteptate; această sarcină specifică solicită limitele externe ale generalizării unui model.

În timp ce noua lucrare reprezintă un pas înainte față de această dependență, mai este un drum lung de parcurs, ținând cont de amploarea în care această sarcină este încorporată în viața noastră de zi cu zi, prin intermediul portalurilor de videoconferință.

 

Publicat pentru prima dată luni, 13 iulie 2026

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai