Μοντέλα και πλατφόρμες AI

TinySAM : Βελτιώνοντας τα Όρια για το Μοντέλο Segment Anything

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η ανίχνευση αντικειμένων είναι ένα θεμελιώδες και κρίσιμο πεδίο στη σύγχρονη όραση υπολογιστή. Παίζει一个 ζωτικό ρόλο σε εφαρμογές που απαιτούν εκτεταμένα οπτικά στοιχεία, όπως η τοποθεσία και η αναγνώριση αντικειμένων, και απαιτεί πραγματικό χρόνο, γρήγορη και ακριβή διαίρεση. Αυτή η σημασία έχει κάνει την ανίχνευση αντικειμένων ένα συνεχώς热 topic έρευνας, με σημαντική εργασία που έχει γίνει σε περιοχές όπως η διαίρεση στιγμιότυπου, η σεμαντική διαίρεση και η πανοπτική διαίρεση.

Με την εξέλιξη της ανίχνευσης αντικειμένων, το Μοντέλο Segment Anything (SAM) έχει αναδυθεί ως ένα εξαιρετικό εργαλείο, που παρουσιάζει εξαιρετικές ικανότητες διαίρεσης και γρήγορα υιοθετείται σε διάφορες εφαρμογές όρασης υπολογιστή. Πλαίσια που χρησιμοποιούν μια προ-εκπαιδευμένη αρχιτεκτονική SAM έχουν επιτύχει εντυπωσιακή απόδοση σε καθήκοντα όρασης. Ωστόσο, παρά τις ικανοτήτων και της υψηλής ακρίβειας στη διαίρεση, η σύνθετη και βαρέα αρχιτεκτονική του SAM απαιτεί σημαντική υπολογιστική δύναμη, εμποδίζοντας την εφαρμογή του σε συσκευές με περιορισμένες υπολογιστικές δυνατότητες.

Για να αντιμετωπιστούν οι υπολογιστικές προκλήσεις του SAM, ερευνητές έχουν αναπτύξει το Tiny Segment Anything Model (TinySAM), το οποίο διατηρεί την απόδοση zero-shot του αρχικού πλαισίου ενώ είναι πιο ελαφρύ. Το TinySAM χρησιμοποιεί μια πλήρη-στάδιο μεθοδολογία εξαγωγής γνώσεων με online hard prompts για να δημιουργήσει ένα πιο αποτελεσματικό μοντέλο μαθητή. Η μετα-εκπαίδευση ποσοτικοποίηση που προσαρμόζεται σε καθήκοντα διαίρεσης που μπορούν να προβλεφθούν περαιτέρω μειώνει τις υπολογιστικές απαιτήσεις. Επιπλέον, η σχεδίαση του TinySAM στοχεύει στην ιεραρχική διαίρεση,几乎 διπλασιάζοντας την ταχύτητα συλλογής χωρίς να επηρεάζει την απόδοση.

Αυτό το άρθρο διερευνά το πλάισιο TinySAM, εξετάζοντας τις θεμελιώδεις αρχές, την αρχιτεκτονική και την απόδοση σε σύγκριση με άλλα πλαισια διαίρεσης. Ας εξετάσουμε αυτές τις πτυχές με περισσότερες λεπτομέρειες.

TinySAM : Αποτελεσματικό Μοντέλο Segment Anything

Το Μοντέλο Segment Anything έχει συμβάλλει στην ταχεία πρόοδο πολλών εφαρμογών όρασης υπολογιστή λόγω των αξιοσημείωτων ικανοτήτων διαίρεσης που συνδυάζονται με ένα τεράστιο σύνολο δεδομένων που περιλαμβάνει πάνω από 11 εκατομμύρια εικόνες και πάνω από 1 δισεκατομμύριο μάσκες εικόνων. Λόγω των εξαιρετικών επιδόσεων σε καθήκοντα διαίρεσης αντικειμένων με αυθαίρετες κατηγορίες και σχήματα, χρησιμεύει ως βάση για πλαισια που εκτελούν καθήκοντα όπως η επεξεργασία εικόνων, η ανίχνευση αντικειμένων, η όραση 3D και πολλά άλλα. Επιπλέον, το Μοντέλο Segment Anything προσφέρει επίσης αξιοσημείωτη απόδοση zero-shot που έχει ωφελήσει ευαίσθητες βιομηχανίες που εργάζονται με περιορισμένα δεδομένα, συμπεριλαμβανομένων των ιατρικών ερευνών και των ιατρικών εικόνων.

Αν και δεν μπορείτε να αμφισβητήσετε τις αξιοσημείωτες ικανότητες διαίρεσης που προσφέρει το Μοντέλο Segment Anything σε eine loạt καθηκόντων όρασης, έχει το μειονέκτημα της σύνθετης αρχιτεκτονικής υπερφόρτωσης, υψηλών υπολογιστικών απαιτήσεων και σημαντικών λειτουργικών κοστών. Για ένα σύστημα που εκτελείται σε một σύγχρονο GPU, ο χρόνος συλλογής του μοντέλου SAM μπορεί να φτάσει μέχρι 2 δευτερόλεπτα για μια εικόνα 1024×1024. Ως αποτέλεσμα, είναι ένα πολύ δύσκολο καθήκον να εφαρμόσετε εφαρμογές SAM σε συσκευές με περιορισμένες υπολογιστικές δυνατότητες. Για να υπερβείτε αυτό το εμπόδιο, πρόσφατες εργασίες όπως το MobileSAM και το FastSAM έχουν προσπαθήσει να αναπτύξουν ένα μοντέλο SAM με μεγαλύτερη υπολογιστική αποτελεσματικότητα. Το πλάισιο MobileSAM προσπαθεί να αντικαταστήσει τον βαρύ συνιστώσα στην κωδικοποίηση εικόνας με την αρχιτεκτονική του TinyViT, ενώ το μοντέλο FastSAM μεταφέρει το καθήκον διαίρεσης σε ένα καθήκον διαίρεσης στιγμιότυπου με μόνο μια κατηγορία με το μοντέλο YoloV8. Αν και αυτές οι μεθόδους κατάφεραν να επιτύχουν κάποιο επίπεδο επιτυχίας όσον αφορά τη μείωση των υπολογιστικών απαιτήσεων, δεν μπόρεσαν να διατηρήσουν την απόδοση, ιδιαίτερα σε καθήκοντα zero-shot.

Το TinySAM ή το Tiny Segment Anything Model είναι μια προσπάθεια να μειώσει τις υπολογιστικές απαιτήσεις του τρέχοντος μοντέλου SAM χωρίς να επηρεάσει την απόδοση στα καθήκοντα zero-shot. Επιπλέον, το πλάισιο TinySAM προτείνει να εφαρμόσει μια πλήρη-στάδιο μεθοδολογία εξαγωγής γνώσεων στην αρχιτεκτονική του, με σκοπό να βελτιώσει την ικανότητα του συμπαγούς μοντέλου μαθητή. Το πλάισιο TinySAM αποσταξυμονίζει το μοντέλο μαθητή σε μια ολοκληρωμένη διαδικασία υπό την εποπτεία του δασκάλου από διαφορετικά στάδια. Για να ενισχύσει την απόδοση περαιτέρω, το πλάισιο επιτρέπει τη διαδικασία εξαγωγής να προσεγγίσει περισσότερο τα δύσκολα παραδείγματα εφαρμόζοντας μια επιπλέον στρατηγική δειγματοληψίας online hard prompts. Επιπλέον, για να μειώσει τις υπολογιστικές κοστώσεις, το πλάισιο TinySAM εκθέτει τα καθήκοντα διαίρεσης που μπορούν να προβλεφθούν σε στοιχεία ποσοτικοποίησης μετά την εκπαίδευση.

Η κύρια υπολογιστική απαίτηση του Μοντέλου Segment Anything οφείλεται στο ότι το μοντέλο παράγει τεράστιες μάσκες από τα σημεία της πλέγματος για να διαχωρίσει όλα τα αντικείμενα στην εικόνα. Για να υπερβείτε την υπολογιστική απαίτηση αυτής της στρατηγικής διαίρεσης, το πλάισιο TinySAM χρησιμοποιεί μια ιεραρχική στρατηγική διαίρεσης που几乎 διπλασιάζει την ταχύτητα συλλογής χωρίς να επηρεάζει την απόδοση. Με αυτές τις μεθόδους που εφαρμόζονται στην αρχιτεκτονική του, το πλάισιο TinySAM προσφέρει σημαντική μείωση των υπολογιστικών απαιτήσεων και ορίζει νέα όρια για αποτελεσματικά καθήκοντα διαίρεσης.

TinySAM : Αρχιτεκτονική και Μεθοδολογία

Πριν μιλήσουμε για την αρχιτεκτονική και τη μεθοδολογία του πλαισίου TinySAM, είναι σημαντικό να εξετάσουμε πρώτα τον προκάτοχό του, το πλάισιο SAM. Από την εισαγωγή του, το Μοντέλο Segment Anything έχει παρουσιάσει αξιοσημείωτη απόδοση, ευελιξία και γενίκευση σε μια σειρά καθηκόντων όρασης και ανίχνευσης αντικειμένων.

Στην καρδιά του, το μοντέλο SAM αποτελείται από τρία υποδίκτυα: τον κωδικοποιητή προβλήματος, τον κωδικοποιητή εικόνας και τον αποκωδικοποιητή μάσκας. Ο κύριος στόχος του κωδικοποιητή προβλήματος είναι να κωδικοποιήσει τις αυθαίρετες μάσκες, τις εισαγωγές σημείων και κουτιών, και τις ελεύθερες μορφές κειμένου με πληροφορίες θέσης. Ο κωδικοποιητής εικόνας είναι ένα βαρύ δίκτυο μετασχηματισμού όρασης που εξάγει την είσοδο εικόνας σε ενσωματώσεις. Το μοντέλο χρησιμοποιεί διαφορετικά δίκτυα για την επεξεργασία των γεωμετρικών και των κειμένων προβλημάτων. Τέλος, ο αποκωδικοποιητής μάσκας περιέχει einen διπλό μετασχηματισμό που λαμβάνει την έξοδο του προβλήματος και του κωδικοποιητή εικόνας για να παράγει την τελική πρόβλεψη μάσκας. Με το σύνολο δεδομένων, το πλάισιο SAM παρουσιάζει αξιοσημείωτη υψηλή ποιότητα διαίρεσης για αντικείμενα ανεξάρτητα από το σχήμα και την κατηγορία. Επιπλέον, το Μοντέλο Segment Anything παρουσιάζει αξιοσημείωτη απόδοση και αποτελεσματικότητα σε καθήκοντα όρασης zero-shot, συμπεριλαμβανομένων της ανίχνευσης αντικειμένων, της ανίχνευσης ακμής, της πρόβλεψης μάσκας κειμένου και της διαίρεσης στιγμιότυπου. Λόγω των υψηλής ποιότητας ικανοτήτων διαίρεσης και της ευέλικτης προσφοράς προβλημάτων, τα πλαισια SAM αποτελούν τη βάση για εφαρμογές όρασης. Με αυτό που έχει कहθεί, δεν μπορείτε να αγνοήσετε την υψηλή υπολογιστική απαίτηση της παραδοσιακής αρχιτεκτονικής SAM με ένα lớn αριθμό παραμέτρων, καθιστώντας το σχεδόν αδύνατο για τους développers να εφαρμόσουν εφαρμογές SAM σε συσκευές με περιορισμένες πόρους.

Εξαγωγή Γνώσεων

Η εξαγωγή γνώσεων είναι μια σημαντική προσέγγιση για την ενίσχυση της απόδοσης των συμπαγών δικτύων κατά τη διάρκεια της εκπαίδευσης. Η μεθοδολογία εξαγωγής γνώσεων που χρησιμοποιεί την έξοδο του δασκάλου για την εποπτεία της εκπαίδευσης του ελαφριού μοντέλου μαθητή. Η μεθοδολογία εξαγωγής γνώσεων μπορεί να χωριστεί σε δύο υποκατηγορίες: εξαγωγή για μεσολαβικά χαρακτηριστικά και εξαγωγή για εξόδους δικτύου, με την πλειονότητα της έρευνας να επικεντρώνεται σε καθήκοντα ταξινόμησης εικόνων.

Όπως έχει αναφερθεί, η ακόλουθη εικόνα παρουσιάζει τη γενική αρχιτεκτονική του πλαισίου TinySAM μαζί με την επισκόπηση της απόδοσης σε καθήκοντα διαίρεσης στιγμιότυπου zero-shot.

Στο πρώτο στάδιο, το πλάισιο TinySAM εφαρμόζει εξαγωγή γνώσεων που σχεδιάζεται ειδικά για το πλάισιο SAM, και για να ενεργοποιήσει τη διαδικασία εξαγωγής περαιτέρω, το μοντέλο χρησιμοποιεί μια στρατηγική δειγματοληψίας online hard prompts για να εξαγάγει τη δύσκολη γνώση στο μοντέλο μαθητή από το δασκάλο. Στο δεύτερο στάδιο, το πλάισιο TinySAM προσαρμόζει τη μεθοδολογία ποσοτικοποίησης μετά την εκπαίδευση σε καθήκοντα διαίρεσης που μπορούν να προβλεφθούν και την εφαρμόζει στο ελαφρύ μοντέλο μαθητή. Τέλος, το μοντέλο εφαρμόζει την ιεραρχική στρατηγική διαίρεσης που σχεδιάζεται για καθήκοντα διαίρεσης, με αποτέλεσμα να διπλασιάζει την ταχύτητα συλλογής με αμελητέα απώλεια ακρίβειας.

Πλήρης-Στάδιο Εξαγωγή Γνώσεων

Όπως đã αναφερθεί, το Μοντέλο Segment Anything αποτελείται από τρία υποδίκτυα στην καρδιά του: τον κωδικοποιητή προβλήματος, τον κωδικοποιητή εικόνας και τον αποκωδικοποιητή μάσκας, με τον κωδικοποιητή εικόνας να είναι ένα βαρύ δίκτυο μετασχηματισμού όρασης με υψηλές υπολογιστικές απαιτήσεις. Για να αντιμετωπιστούν αυτό το ζήτημα, το πλάισιο MobileSAM αντικατέστησε τον μετασχηματισμό όρασης με ένα TinyViT, αν και η αντικατάσταση δεν ήταν αποτελεσματική λόγω της σημαντικής απώλειας απόδοσης. Για να διασφαλιστεί ότι δεν θα υπάρξει απώλεια απόδοσης, το πλάισιο TinySAM εφαρμόζει μια πλήρης-στάδιο μεθοδολογία εξαγωγής γνώσεων που οδηγεί το ελαφρύ κωδικοποιητή εικόνας από το επίπεδο μάθησης στο πολλαπλό επίπεδο γνώσεων. Επιπλέον, το πλάισιο TinySAM εισάγει πολλές απώλειες εξαγωγής κατά τη διάρκεια διαφορετικών σταδίων, όπως φαίνεται στην ακόλουθη εικόνα.

Ποσοτικοποίηση

Η ποσοτικοποίηση μοντέλου είναι μια δημοφιλής προσέγγιση στα πλαισια όρασης υπολογιστή και χρησιμοποιείται για την συμπίεση του μοντέλου με την ποσοτικοποίηση βαρών ή ενεργειών από υψηλότερη σε χαμηλότερη ζώνη σε μια προσπάθεια να μειώσει την υπολογιστική复잡κότητα και τις απαιτήσεις αποθήκευσης χωρίς να επηρεάσει σημαντικά την ποιότητα της έξοδου.

Ο κύριος στόχος της ποσοτικοποίησης στο TinySAM είναι να προβάλει τον πлаваτικό πίνακα σε πίνακα ακέραιων με τη χρήση ενός συντελεστή κλίμακας, με το μέτρο για τη μέτρηση της απόστασης μεταξύ του πίνακα πολλαπλασιασμού και του ποσοτικοποιημένου πίνακα να παίζει einen κρίσιμο ρόλο για την βελτιστοποίηση του συντελεστή κλίμακας.

Ιεραρχική Διαίρεση

Το Μοντέλο Segment Anything προτείνει να χρησιμοποιήσει einen αυτόματο γεννήτορα μάσκας που δειγματοληψίες σημεία ως πλέγμα για να διαχωρίσει όλα τα αντικείμενα στην εικόνα. Ωστόσο, έχει υποδειχθεί ότι η χρήση πυκνού πλέγματος σημείων οδηγεί σε υπερ-λεπτές αποδόσεις διαίρεσης και η διαδικασία απαιτεί τεράστιες υπολογιστικές απαιτήσεις και incurs υψηλά λειτουργικά κόστη. Επιπλέον, σε μια πλευρά,太多 δειγματοληψίες σημείων για ένα πλήρες αντικείμενο μπορεί να οδηγήσει σε διαφορετικά τμήματα του αντικειμένου να διαχωριστούν λανθασμένα ως ξεχωριστές μάσκες, ενώ στην άλλη πλευρά, ο χρόνος κόστους της λειτουργίας everything είναι κυρίως λόγω του ότι ο κωδικοποιητής εικόνας έχει συρρικνωθεί σημαντικά. Για να μειώσετε το λειτουργικό κόστος της λειτουργίας everything, το πλάισιο TinySAM χρησιμοποιεί μια ιεραρχική προσέγγιση γεννήτορα μάσκας, με τη διαφορά στη στρατηγική με το αρχικό πλάισιο SAM να φαίνεται στην ακόλουθη εικόνα.

Διαφορετικά από την προσέγγιση που εφαρμόζεται στο αρχικό πλάισιο SAM, το μοντέλο TinySAM χρησιμοποιεί μόνο 25% σημεία σε κάθε πλευρά, χρησιμοποιώντας έτσι μόνο 1/16 των διαθέσιμων σημείων στην αρχική ρύθμιση. Το μοντέλο στη συνέχεια συλλογεί τον αποκωδικοποιητή μάσκας και τον κωδικοποιητή προβλήματος με αυτά τα σημεία και λαμβάνει την έξοδο. Το μοντέλο στη συνέχεια φιλτράρει κάποιες μάσκες με εμπιστοσύνη που υπερβαίνει einen ορισμένο κατώτατο όριο και μάσκες τις αντίστοιχες θέσεις ως περιοχές για πιθανές τελικές προβλέψεις.既然 το μοντέλο θεωρεί αυτές τις περιοχές ως αποτέλεσμα διαίρεσης στιγμιότυπου με υψηλή εμπιστοσύνη, δεν έχει ανάγκη να γεννήσει σημεία προβλήματος. Η στρατηγική όχι μόνο βοηθά στην αποφυγή υπερ-λεπτής διαίρεσης του αντικειμένου, αλλά επίσης βοηθά στην μείωση των λειτουργικών κοστών και των υπολογιστικών απαιτήσεων σημαντικά. Το πλάισιο στη συνέχεια συνδυάζει και επεξεργάζεται τα αποτελέσματα αυτών των δύο γύρων για να λάβει τις τελικές μάσκες.

TinySAM : Πειράματα και Αποτελέσματα

Για να επιταχύνουν τη διαδικασία εξαγωγής, το πλάισιο TinySAM υπολογίζει και αποθηκεύει τις ενσωματώσεις εικόνας από το δασκάλο σε προκαταρκτικό στάδιο, λόγω του οποίου δεν είναι απαραίτητο για το μοντέλο να υπολογίσει τον βαρύ κωδικοποιητή εικόνας του δασκάλου επανειλημμένα κατά τη διάρκεια της εκπαίδευσης. Για την ποσοτικοποίηση μετά την εκπαίδευση, το πλάισιο TinySAM ποσοτικοποιεί όλα τα στρώματα πολλαπλασιασμού πίνακα, τα στρώματα σύγκλισης, τα στρώματα αποσύνδεσης και τα στρώματα γραμμικά, με το μοντέλο να χρησιμοποιεί κανόνες κλίμακας ανά канάλι για τα στρώματα σύγκλισης και αποσύνδεσης. Για τα στρώματα πολλαπλασιασμού πίνακα, το μοντέλο εφαρμόζει κανόνες κλίμακας ανά κεφαλή, ενώ για τα στρώματα γραμμικά, το μοντέλο εφαρμόζει κανόνες κλίμακας ανά γραμμή. Το μοντέλο επίσης διεξάγει αξιολόγηση σε καθήκοντα όρασης zero-shot.

Για καθήκοντα διαίρεσης στιγμιότυπου σε μια ρύθμιση zero-shot, το πλάισιο TinySAM ακολουθεί τις πειραματικές ρυθμίσεις του προκατόχου του, του Μοντέλου Segment Anything, και χρησιμοποιεί αποτελέσματα ανίχνευσης αντικειμένων του πλαισίου Vision Transformer Det-H ή VitDet-H για διαίρεση στιγμιότυπου. Όπως φαίνεται στην ακόλουθη εικόνα, το πλάισιο TinySAM υπερβαίνει τις υπάρχουσες μεθόδους όσον αφορά την ακρίβεια διαίρεσης στιγμιότυπου και το σκορ FLOPs.

Επιπλέον, η ποιοτική απόδοση του μοντέλου TinySAM παρουσιάζεται στην ακόλουθη εικόνα για διαίρεση στιγμιότυπου zero-shot, με το πράσινο κουτί να αντιπροσωπεύει τα κουτιά προβλήματος.

Όσον αφορά την αξιολόγηση μάσκας zero-shot, το μοντέλο TinySAM υπερβαίνει σημαντικά το πλάισιο MobileSAM σε διάφορα σύνολα δεδομένων και παρέχει σημαντικά καλύτερα αποτελέσματα όταν χρησιμοποιούνται λιγότερα σημεία ως προβλήματα από το πλάισιο.

Επιπλέον, ο ακόλουθος πίνακας συνοψίζει τα αποτελέσματα της επιτάχυνσης και της μείωσης των υπολογιστικών απαιτήσεων που επιτυγχάνονται ως αποτέλεσμα της στρατηγικής ιεραρχικής λειτουργίας everything. Το μοντέλο εφαρμόζει τον ίδιο βαθμό σταθερότητας και κατώτατο όριο με διαφορετικές στρατηγικές για μια δίκαιη σύγκριση, και τα αποτελέσματα συνοψίζονται παρακάτω.

Τελικές Σκέψεις

Σε αυτό το άρθρο, abbiamo μιλήσει για το TinySAM, ένα προτεινόμενο πλάισιο που推η την όρια για την διαίρεση οποιουδήποτε αντικειμένου, και αποκτά ένα αποτελεσματικό μοντέλο αρχιτεκτονικής με λιγότερες υπολογιστικές απαιτήσεις και απόδοση ισάξια με το αρχικό πλάισιο SAM. Το TinySAM ή το Tiny Segment Anything Model διατηρεί και παρέχει την απόδοση zero-shot του αρχικού πλαισίου. Το πλάισιο TinySAM εφαρμόζει πρώτα μια πλήρης-στάδιο μεθοδολογία εξαγωγής γνώσεων που χρησιμοποιεί online hard prompts για να εξαγάγει ένα ελαφρύ μοντέλο μαθητή. Το πλάισιο TinySAM στη συνέχεια προσαρμόζει την ποσοτικοποίηση μετά την εκπαίδευση σε καθήκοντα διαίρεσης που μπορούν να προβλεφθούν, που βοηθά περαιτέρω στη μείωση των υπολογιστικών απαιτήσεων. Επιπλέον, το πλάισιο επίσης στοχεύει στην ιεραρχική διαίρεση που几乎 διπλασιάζει την ταχύτητα συλλογής χωρίς να επηρεάσει την απόδοση.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.