Η γωνία του Anderson

Βελτιώνοντας την Αφαίρεση Φόντου του AI Χωρίς την Ακριβή Ανθρώπινη Σημείωση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

Νέα έρευνα δείχνει ότι το AI μπορεί να αφαιρέσει καθαρά τους ανθρώπους από βίντεο χωρίς την ακριβή ανθρώπινη σημείωση, βελτιώνοντας την ποιότητα και τη σταθερότητα

 

Οι περισσότεροι από εμάς θα έχουν βιώσει το να “πεφτεί” από το φόντο μέσω απλών φίλτρων αλλαγής/απόκρυψης φόντου σε πλατφόρμες βίντεο-κονφεράνς – και μπορεί να έχουμε παρατηρήσει τις περιορισμούς τέτοιων συστημάτων, τα οποία εκπαιδεύονται στις πιο συχνές τύπους περιπτώσεων που είναι πιθανό να βρεθούν σε μια βίντεο-συνάντηση, και δεν είναι συνήθως ανθεκτικά σε τίποτα “απρόοπτο” – ή ακόμη και σε προβλέψιμα αντικείμενα, όπως δακτυλίους:

Ένα τυπικό παράδειγμα ενός συστήματος εξαγωγής προγρόντου που έχει εκπαιδευτεί από το AI και αποκοπεί πολύ από το αρχικό αντικείμενο. Πηγή - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

Ένα τυπικό παράδειγμα ενός συστήματος εξαγωγής προγρόντου που έχει εκπαιδευτεί από το AI και αποκοπεί πολύ από το αρχικό αντικείμενο. Πηγή

Η πιο εύκολη λύση, και μια που γίνεται όλο και πιο δημοφιλής μπροστά στις προοπτικές των μοντέλων οράματος-γλώσσας (VLMs) που δεν έχουν εκπαιδευτεί ειδικά για τέτοιους σκοπούς, είναι να παραμετροποιήσει ένα υπάρχον μοντέλο σε δεδομένα που είναι πιθανό να συναντήσει το σύστημα:

Δύο μεγάλου όγκου, εξαντλητικά σημειωμένα σύνολα δεδομένων υποστηρίζουν τις λύσεις που προσφέρονται στο έγγραφο του 2020 'Real-Time High-Resolution Background Matting'. Πηγή - https://arxiv.org/pdf/2012.07810

Δύο μεγάλου όγκου, εξαντλητικά σημειωμένα σύνολα δεδομένων υποστηρίζουν τις λύσεις που προσφέρονται στο έγγραφο του 2020 ‘Real-Time High-Resolution Background Matting’. Πηγή

Ωστόσο, τέτοια δεδομένα πρέπει να σημειωθούν, με κάποιο κόστος και με κάποια δαπάνη χρόνου, από ανθρώπους. Και σε κάθε περίπτωση, αυτό οδηγεί σε ένα πολύ συγκεκριμένο και μη γενικευμένο εργαλείο που κοστίζει πολλά χρήματα και δεν μπορεί συνήθως να χρησιμοποιηθεί για μια ευρύτερη ποικιλία εργασιών.

Παρά τούτο, η ανάπτυξη ‘στόχων’ μοντέλων αυτού του τύπου είναι目前 η συντομότερη οδός για την αποτελεσματική εύρεση σε eine ποικιλία τομέων, όχι μόνο σε βίντεο και εικόνα matting (δηλαδή, αφαίρεση φόντου/προγρόντου). Μέχρι τώρα, πολλές από τις ακαδημαϊκές λύσεις που έχουν προταθεί έχουν απλώς μετακινήσει το πρόβλημα.

Ακόμη και τώρα, παρά την εξάπλωση των φίλτρων AI-βελτιωμένων σε πλατφόρμες όπως το Zoom, το Zoom συνεχίζει να συνιστά ένα πράσινο οθόνη ως την ιδανική λύση για την αφαίρεση φόντου – μια δαπανηρή και κάπως ‘επαγγελματική’ λύση που θα μας κάνει vielleicht λίγο αυτοσυνειδητούς.

Αφαίρεσε το!

Τις τελευταίες ημέρες, αυξήθηκε το ενδιαφέρον για τη χρήση της οικογένειας Segment Anything (SAM) για να παρέχει αυτοματοποιημένη και λεπτομερή εξαγωγή.既然 το SAM αναπτύχθηκε για να βοηθήσει σημείωση και όχι για να παρέχει καθαρές περιγράμματα που να είναι αποδεκτά σε μια γραμμή οπτικών εφέ, τα προεπιλεγμένα σύνορά του δεν είναι κατάλληλα για να αντιμετωπίσουν την πρόκληση, χωρίς βοήθεια:

Πατήστε για αναπαραγωγή, εάν είναι απαραίτητο. Ένα παράδειγμα των χονδρών συνόρων που δημιουργούνται από ένα μοντέλο Segment Anything – ιδανικό για σημείωση, αλλά όχι αρκετά καλό για VFX drop-out. Πηγή 

Μια πρόσφατη προσφορά από την Κίνα έχει προτείνει έναν πιο περίπλοκο τρόπο χρήσης μοντέλων SAM για να αποκτήσει υπεροχή εξαγωγής – με την σύνδεση ενός θεμελιώδους tracker όπως το SAM με ένα γέφυρα προτάσεων περιοχής με αφορισμένα κεφάλια matting. Με αυτόν τον τρόπο, το σύστημα είναι σε θέση να βελτιώσει το λεπτομέρεια των συνόρων διαδοχικά και να επιλύσει προκλητικά σύνορα, όπως τα μαλλιά σε κίνηση:

Πατήστε για αναπαραγωγή, εάν είναι απαραίτητο. Από τον ιστότοπο που υποστηρίζει το νέο έγγραφο, ένα συνδυασμό συμπληρωματικών βίντεο, που αποδεικνύουν τη σοφία της μεθόδου των συγγραφέων για εξαγωγή. Πηγή 

Κρίσιμο, το νέο σύνθετο σύστημα εκπαιδεύεται μόνο σε εικόνες, όχι σε βίντεο, και δεν απαιτεί πρόσθετη ανθρώπινη σημείωση – την παραδοσιακή εμπόδιο ενάντια στην πρόοδο σε αυτόν και σε διάφορα άλλα πεδία του AI.

Παραδείγματα λεπτομερούς εικόνας και βίντεο matting που επιτυγχάνονται με τη νέα μέθοδο, με προκλητικές περιπτώσεις όπως τα μαλλιά, η διαφάνεια και η κίνηση που εμφανίζονται μαζί με ακολουθίες in-the-wild, όπου η μέθοδος παράγει – όπως ισχυρίζονται οι συγγραφείς – καθαρότερα, πιο σταθερά αποτελέσματα από προηγούμενες προσεγγίσεις. Πηγή - https://www.unite.ai/wp-content/uploads/2026/07/figure-1.jpg

Παραδείγματα λεπτομερούς εικόνας και βίντεο matting που επιτυγχάνονται με τη νέα μέθοδο, με προκλητικές περιπτώσεις όπως τα μαλλιά, η διαφάνεια και η κίνηση που εμφανίζονται μαζί με ακολουθίες in-the-wild, όπου η μέθοδος παράγει – όπως ισχυρίζονται οι συγγραφείς – καθαρότερα, πιο σταθερά αποτελέσματα από προηγούμενες προσεγγίσεις. Πηγή

Με τρία πειραματικά μοντέλα που παράχθηκαν για το έργο, οι συγγραφείς ισχυρίζονται νέα κορυφαία απόδοση σε αυτήν την εργασία, ενώ διατηρούν τις υψηλότερες ικανότητες γενίκευσης του βασικού μοντέλου, που σημαίνει ότι η μέθοδος παράγει ένα μοντέλο all-purpose με επιπλέον ικανότητες, 而 όχι ένα μοντέλο που στοχεύει σε μια seule εργασία.

Οι συγγραφείς δηλώνουν:

‘Περιεκτικές πειραματικές μελέτες δείχνουν ότι το SAM2Matting επιτυγχάνει κορυφαία απόδοση (SOTA) και σε εικόνα και σε βίντεο matting, με βίντεο matting που αξιολογείται σε μια αυστηρά zero-shot διαδικασία.

‘Εκτεταμένα αποτελέσματα in-the-wild επιβεβαιώνουν περαιτέρω την ισχυρή γενίκευση σε σεναριά open-world με γρήγορη κίνηση, σύνθετα φόντα και προσαρμοσμένες προεκτάσεις (π.χ. άνθρωπος που οδηγεί ποδήλατο).

‘Επιπλέον, τα στοιχεία matting μας είναι ελαφριά και αποτελεσματικά, επιτρέποντας στο SAM2.1-Tiny να τρέχει με 40 FPS σε ένα βίντεο 1080p 200 καρέ χρησιμοποιώντας λιγότερο από 5GB GPU μνήμης.’

Το νέο έγγραφο έχει τον τίτλο SAM2Matting: Γενικευμένη Εικόνα και Βίντεο Matting, και προέρχεται από τέσσερις συγγραφείς από το Πανεπιστήμιο Fudan και το Πανεπιστήμιο Οικονομικών και Οικονομικών του Σανγκάη. Το έργο έχει ένα GitHub αποθετήριο, το οποίο την ώρα της γραφής έχει κυκλοφορήσει σημεία διαφορετικών εκδόσεων, κώδικα inference, και μια διαδραστική επίδειξη, με την κυκλοφορία του κώδικα εκπαίδευσης υπό την υπόσχεση. Επιπλέον, υπάρχει ένας ιστότοπος έργου.

Μέθοδος

Η μέθοδος των συγγραφέων χωρίζει την παρακολούθηση από την εξαγωγή λεπτομερειών χρησιμοποιώντας ένα video object segmentation (VOS) tracker για να παράγει ένα χρονικά συνεπές χονδρό masque για κάθε καρέ, ενώ μια αφορισμένη διαδικασία matting βελτιώνει τα σύνορα:

Επισκόπηση της διαδικασίας, όπου μια ευέλικτη προτροπή και είσοδος βίντεο τροφοδοτούν ένα video object segmentation tracker για να παράγει ένα χονδρό masque, το οποίο βελτιώνεται από ένα Region-of-Interest (ROI) detector και μετατρέπεται σε trimap πριν από einen προοδευτικό multi-κλίμακα predictor που παράγει το τελικό υψηλής ανάλυσης matte. 

Επισκόπηση της διαδικασίας, όπου μια ευέλικτη προτροπή και είσοδος βίντεο τροφοδοτούν ένα video object segmentation tracker για να παράγει ένα χονδρό masque, το οποίο βελτιώνεται από ένα Region-of-Interest (ROI) detector και μετατρέπεται σε trimap πριν από einen προοδευτικό multi-κλίμακα predictor που παράγει το τελικό υψηλής ανάλυσης matte.

Ένας Region-of-Interest (ROI) detector αναγνωρίζει περιοχές με λεπτομέρεια ή ημιδιαφάνεια, μετατρέποντας αυτές σε trimap (ένα τρι-περιοχής masque που χωρίζει το προσκήνιο, το φόντο και τις αβέβαιες περιοχές) που οδηγεί τη βελτίωση, μετά από την οποία ένας Progressive Alpha Predictor παράγει το τελικό matte μέσω μιας διαδικασίας coarse-to-fine σε πολλαπλά επίπεδα

Συμβατικά συστήματα matting συνήθως παράγουν περιοχές ενδιαφέροντος χρησιμοποιώντας απλές μορφολογικές επιχειρήσεις, ή ανακτώντας απευθείας το masque – προσεγγίσεις που μπορούν είτε να παραβλέψουν λεπτομέρειες, είτε να περιλαμβάνουν περιοχές που δεν απαιτούν βελτίωση:

Σύγκριση της τυπικής επεξεργασίας με masque με trimaps ground-truth, δείχνοντας πώς οι απλές μορφολογικές επιχειρήσεις παράγουν χονδρά, ομοιόμορφα σύνορα που χάνουν λεπτές δομές όπως τα μαλλιά και η διαφάνεια, οδηγώντας σε απώλεια λεπτομερειών στο τελικό matte.

Σύγκριση της τυπικής επεξεργασίας με masque με trimaps ground-truth, δείχνοντας πώς οι απλές μορφολογικές επιχειρήσεις παράγουν χονδρά, ομοιόμορφα σύνορα που χάνουν λεπτές δομές όπως τα μαλλιά και η διαφάνεια, οδηγώντας σε απώλεια λεπτομερειών στο τελικό matte.

Σύνθετο Ενδιαφέρον

Αντίθετα, ο Region-of-Interest Detector που προτείνεται αντιμετωπίζει αυτό το βήμα ως μια εργασία ταξινόμησης pixel-προς-pixel (δηλαδή, αντιμετωπίζοντας κάθε ξεχωριστό pixel στην εικόνα ως μια ξεχωριστή απόφαση, και εκχωρώντας του μια ετικέτα με βάση το αν ανήκει σε μια περιοχή matting-κρίσιμη ή όχι) που ενσωματώνει το masque VOS, το τρέχον καρέ, και πολλαπλά επίπεδα χαρακτηριστικών εικόνας, για να απομονώσει πιο ακριβώς τις περιοχές matting-κρίσιμες.

Στην νέα προσέγγιση, το προβλεπόμενο ROI μετατρέπεται πρώτα σε ψευδές-trimap που χωρίζει το σίγουρο προσκήνιο και φόντο από αβέβαιες περιοχές, χρησιμοποιώντας το masque tracker για να εκχωρήσει γνωστές περιοχές ενώ σημειώνει το ROI ως αμφίβολη, ώστε η επόμενη επεξεργασία να μπορεί να επικεντρωθεί ρητά στα σύνορα όπου πρέπει να επιλυθεί η λεπτομέρεια.

Η βελτίωση χειρίζεται από έναν Progressive Alpha Predictor που αντιμετωπίζει το matting ως μια διαδοχική διαδικασία, περνώντας ενδιάμεσα αποτελέσματα από χονδρά σε λεπτότερα επίπεδα, με κάθε στάδιο να χρησιμοποιεί την εικόνα, το trimap, και την προηγούμενη εκτίμηση για να προοδευτικά να δίνει μορφή και να ανακτά λεπτές λεπτομέρειες.

Στο τελικό στάδιο, η υψηλότερη ανάλυση εξόδου είναι υπερ-δείγματος για να παράγει το ολοκληρωμένο matte, επιτρέποντας στους ευρείς σχηματισμούς να καθοριστούν νωρίς ενώ οι λεπτότερες δομές όπως τα μαλλιά και η διαφάνεια επιλύονται σε μεταγενέστερα πέρα.

Κατά την εκπαίδευση, οι συγγραφείς πάγωσαν τον VOS tracker, ενώ εκπαιδεύτηκαν μόνο τα στοιχεία matting σε υψηλής ποιότητας δεδομένα εικόνας – επιτρέποντας στις λεπτές λεπτομέρειες να βελτιωθούν χωρίς να υποβαθμίζουν τη συνεχή παρακολούθηση. Η εποπτεία εφαρμόστηκε ανά καρέ, με περιοχές ενδιαφέροντος που προέρχονται από το ground-truth alpha matte, και χρησιμοποιήθηκαν για να οδηγήσουν την μάθηση, ενώ ο Region-of-Interest Detector εκπαιδεύτηκε με απώλειες που σχεδιάστηκαν για να ενθαρρύνουν την ακριβή ταξινόμηση συνόρων, και να μειώσουν τις ακατάλληλες δομές.

Για αφαίρεση αλφάβητου, απώλειες εφαρμόστηκαν σε πολλαπλά επίπεδα για να βελτιώσουν σταδιακά τις λεπτομέρειες, μαζί με μια πρόσθετη περιορισμό που σχεδιάστηκε για να διατηρήσει το προβλεπόμενο matte συγχρονισμένο με το αρχικό masque – βοηθώντας να διατηρηθεί η δομή, και να αποφευχθούν κενά ή σπασμένα τμήματα στο τελικό αποτέλεσμα.

Δεδομένα και Δοκιμές

Οκτώ σύνολα δεδομένων matting εικόνας χρησιμοποιήθηκαν αρχικά για τις δοκιμές: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; και RefMatte; και τρεις παραλλαγές της προσέγγισης ‘Sam2Matting’ αναπτύχθηκαν ως VOS trackers, χρησιμοποιώντας αντίστοιχα SAM2.1-Tiny; SAM2.1-Base+; και την концепτού-εστιασμένη SAM3.

Το στοιχείο tracker ήταν παγωμένο, με μόνο τα στοιχεία matting να βελτιστοποιούνται. Όλες οι εκδόσεις εκπαιδεύτηκαν για πέντε epochs σε τέσσερις NVIDIA A6000 GPUs, κάθε μια με μια VRAM ανάθεση 48GB. Một μέγεθος batch 32 χρησιμοποιήθηκε, υπό τον AdamW βελτιστοποιητή. Οι μετρικές που χρησιμοποιήθηκαν ήταν Μέσος Απόλυτος Διαφορά (MAD); Μέσος Τετραγωνικός Σφάλμα (MSE); Gradient (Grad); Connectivity (Conn); και dtSSD (για matting βίντεο μόνο).

Ποσοτικές Δοκιμές

Οι συγγραφείς ξεκίνησαν με ποσοτικές δοκιμές του νέου συστήματος σε matting εικόνας, χρησιμοποιώντας τα βENCHMARKS P3M-500-NP; AM-2K (‘GFM’ στα αποτελέσματα); MAM (‘Matte Anything’, στα αποτελέσματα); E2E-HIM; Lightweight; και PPM-100 (‘MODNet’, στα αποτελέσματα):

Ποσοτικά αποτελέσματα σε matting εικόνας σε P3M-500-NP, AM-2K test, και PPM-100, με χαμηλότερες τιμές που δείχνουν καλύτερη απόδοση σε όλα τα μετρικά, και τα καλύτερα, δεύτερα καλύτερα, και τρίτα καλύτερα αποτελέσματα υπογραμμίζονται σε κόκκινο, πορτοκαλί, και κίτρινο, αντίστοιχα.

Ποσοτικά αποτελέσματα σε matting εικόνας σε P3M-500-NP, AM-2K test, και PPM-100, με χαμηλότερες τιμές που δείχνουν καλύτερη απόδοση σε όλα τα μετρικά, και τα καλύτερα, δεύτερα καλύτερα, και τρίτα καλύτερα αποτελέσματα υπογραμμίζονται σε κόκκινο, πορτοκαλί, και κίτρινο, αντίστοιχα. Παρακαλώ αναφερθείτε στο αρχικό έγγραφο για καλύτερη ανάλυση.

Από αυτά τα αποτελέσματα, το έγγραφο αναφέρει:

‘Όπως φαίνεται [πάνω], όλες οι τρεις παραλλαγές του SAM2Matting υπερβαίνουν συνεχώς τις προηγούμενες βάσεις σε διαφορετικά μετρικά. Για παράδειγμα, η παραλλαγή SAM2.1-Tiny επιτυγχάνει MAD 11.48 χαμηλότερη από MAM σε P3M-500-NP.’

Οι συγγραφείς διατηρούν ότι τα αποτελέσματα σε όλη τη γραμμή δείχνουν ότι η προσέγγισή τους επιτυγχάνει υπεροχή μέσω της βασικής концепτικής σχεδίασης, και όχι λόγω του επιπέδου των δεδομένων.

Για matting βίντεο, το SAM2Matting αξιολογήθηκε σε V-HIM60 και VideoMatte σε μια zero-shot ρύθμιση, ενάντια στα video-εκπαιδευμένα συστήματα MatAnyone2, MatAnyone, MaGGIe, FTP-VM, και RVM, με συνεχείς κέρδη που αναφέρονται σε cả μεσαία και khóρα διαχωριστικά.

Σε όλα τα βENCHMARKS, οι τρεις παραλλαγές καταγράφουν χαμηλότερα σφάλματα σε MAD, MSE, Grad, Conn, και dtSSD, με το SAM3 να επιτυγχάνει τα ισχυρότερα συνολικά αποτελέσματα, ενώ οι χαμηλότερες τιμές dtSSD φαίνεται να δείχνουν πιο σταθερή πιστότητα καρέ-προς-καρέ:

Ποσοτικά αποτελέσματα σε matting βίντεο σε V-HIM60 και VideoMatte, αξιολογημένα σε μια zero-shot ρύθμιση, δείχνοντας χαμηλότερα σφάλματα σε όλα τα μετρικά, με τα καλύτερα, δεύτερα καλύτερα, και τρίτα καλύτερα αποτελέσματα υπογραμμίζονται σε κόκκινο, πορτοκαλί, και κίτρινο, αντίστοιχα.

Ποσοτικά αποτελέσματα σε matting βίντεο σε V-HIM60 και VideoMatte, αξιολογημένα σε μια zero-shot ρύθμιση, δείχνοντας χαμηλότερα σφάλματα σε όλα τα μετρικά, με τα καλύτερα, δεύτερα καλύτερα, και τρίτα καλύτερα αποτελέσματα υπογραμμίζονται σε κόκκινο, πορτοκαλί, και κίτρινο, αντίστοιχα.

Οι συγγραφείς ισχυρίζονται ότι αυτά τα αποτελέσματα αντανακλούν τη διαχωρισμένη σχεδίαση, όπου ο VOS tracker διατηρεί τη χρονική δομή και τα στοιχεία matting εστιάζουν στη λεπτομέρεια των συνόρων, επιτρέποντας στα μοντέλα που έχουν εκπαιδευτεί σε εικόνες να υπερβούν πλήρως εποπτευμένα βίντεο-προσεγγίσεις.

Ποιότητας Δοκιμές

Για ανθρώπινη matting σε ποιότητας δοκιμές, οι συγγραφείς βρήκαν ότι το Sam2Matting υπερβαίνει τις ανταγωνιστικές βάσεις:

Ποιότητας σύγκριση σε matting ανθρώπων και in-the-wild βίντεο, όπου το SAM2Matting διατηρεί πιο ακριβώς τα λεπτά μαλλιά και τις ημιδιαφανείς περιοχές από το RVM και το MatAnyone, παράγοντας καθαρότερα σύνορα και λιγότερες λείπουν δομές σε προκλητικές περιοχές.

Ποιότητας σύγκριση σε matting ανθρώπων και in-the-wild βίντεο, όπου το SAM2Matting διατηρεί πιο ακριβώς τα λεπτά μαλλιά και τις ημιδιαφανείς περιοχές από το RVM και το MatAnyone, παράγοντας καθαρότερα σύνορα και λιγότερες λείπουν δομές σε προκλητικές περιοχές.

Όπως φαίνεται παρακάτω, τα υπάρχοντα συστήματα matting βίντεο όπως το MatAnyone2 και το MaGGIe, τα οποία έχουν εκπαιδευτεί σε domain-ειδικά και συχνά ανθρώπινα-κεντρικά σύνολα δεδομένων, δυσκολεύονται να γενικευθούν σε in-the-wild ακολουθίες, ιδιαίτερα όταν αντιμετωπίζουν γρήγορη κίνηση αντικειμένων όπως φυτά, ημιδιαφανείς πεταλούδες, και γρήγορα σταγόνες νερού:

Ποιότητας σύγκριση σε in-the-wild ακολουθίες, όπου το SAM2Matting διατηρεί πιο ακριβώς τις λεπτές δομές και τη χρονική συνεχή από το MatAnyone2 και το MaGGIe, ιδιαίτερα για μη-ανθρώπινα αντικείμενα, γρήγορη κίνηση, και ημιδιαφανείς στοιχεία όπως νερό, γυαλί, και φτερά εντόμων.

Ποιότητας σύγκριση σε in-the-wild ακολουθίες, όπου το SAM2Matting διατηρεί πιο ακριβώς τις λεπτές δομές και τη χρονική συνεχή από το MatAnyone2 και το MaGGIe, ιδιαίτερα για μη-ανθρώπινα αντικείμενα, γρήγορη κίνηση, και ημιδιαφανείς στοιχεία όπως νερό, γυαλί, και φτερά εντόμων. Παρακαλώ αναφερθείτε στο αρχικό έγγραφο για καλύτερη ανάλυση.

Αντίθετα, το SAM2Matting αποδείχθηκε ικανό να διατηρήσει σταθερή παρακολούθηση, και να εξάγει λεπτές λεπτομέρειες πιο αξιόπιστα, σε αυτές τις προκλητικές περιπτώσεις.

Τέλος, όπως φαίνεται στο παρακάτω σχήμα, το SAM2Matting χειρίζεται αποτελεσματικά αντικείμενα με προσαρτημένα αντικείμενα, όπως άνθρωποι που οδηγούν ποδήλατα ή κρατούν σκι, ενώ καταστέλλει κοντινές παρεμβολές φόντου, ωφελούμενο από τον περιορισμό συνεχή-ματ που περιγράφηκε νωρίτερα.

Ποιότητας σύγκριση σε ακολουθίες με προσαρτημένα αντικείμενα και παρεμβολές φόντου, όπου το SAM2Matting διατηρεί δομές όπως ποδήλατα και σκι πιο ακριβώς από το MatAnyone2, ενώ καταστέλλει κοντινές παρεμβολές και διατηρεί καθαρότερα σιλουέτες σε όλα τα καρέ.

Ποιότητας σύγκριση σε ακολουθίες με προσαρτημένα αντικείμενα και παρεμβολές φόντου, όπου το SAM2Matting διατηρεί δομές όπως ποδήλατα και σκι πιο ακριβώς από το MatAnyone2, ενώ καταστέλλει κοντινές παρεμβολές και διατηρεί καθαρότερα σιλουέτες σε όλα τα καρέ.

Συμπέρασμα

Οι επιτεύξεις που περιγράφονται στο νέο έγγραφο δείχνουν το βαθμό στον οποίο η εξαγωγή, μια από τις παλαιότερες εργασίες στην οπτική, παραμένει ανεπίλυτη και ανθεκτική σε γενικευμένες προσεγγίσεις. Όπως και με πολλά άλλα μοντέλα οράματος, το πρόβλημα παραμένει ότι οι αλγόριθμοι εξαγωγής κολλούν σε γνώσεις domain αντί να προσαρμόζονται εύκολα σε απρόβλεπτα και άγνωστα αντικείμενα. Αυτή η εργασία είναι ένα βήμα προς τα εμπρός από αυτήν την εξάρτηση, αλλά υπάρχει ακόμη ένας μακρύς δρόμος να διανυθεί, λαμβάνοντας υπόψη το βαθμό στον οποίο αυτή η εργασία είναι ενσωματωμένη στην καθημερινή μας ζωή, μέσω πυλών βίντεο-συνάντησης.

 

Πρώτη δημοσίευση Δευτέρα, 13 Ιουλίου 2026

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai