Μοντέλα και πλατφόρμες AI
EfficientViT: Μνήμη Εфикаστική Οπτική Μετασχηματίστης για Υψηλής Ανάλυσης Υπολογιστική Όραση

Λόγω της υψηλής ικανότητας του μοντέλου, τα μοντέλα μετασχηματιστών όρασης έχουν απολαύσει μεγάλη επιτυχία τις τελευταίες φορές. Παρά την απόδοσή τους, τα μοντέλα μετασχηματιστών όρασης έχουν ένα σημαντικό ελάττωμα: η αξιοσημείωτη υπολογιστική τους ικανότητα έρχεται με υψηλό υπολογιστικό κόστος, και είναι ο λόγος για τον οποίο οι μετασχηματίστές όρασης δεν είναι η πρώτη επιλογή για εφαρμογές σε πραγματικό χρόνο. Για να αντιμετωπίσουν αυτό το ζήτημα, μια ομάδα αναπτυξιακών создала τον EfficientViT, μια οικογένεια ταχύτητας μετασχηματιστών όρασης.
Κατά την εργασία στον EfficientViT, οι αναπτυξιακοί παρατήρησαν ότι η ταχύτητα των τρεχόντων μοντέλων μετασχηματιστών συχνά περιορίζεται από ανεφάρμοστες μεθόδους μνήμης, ιδιαίτερα τις στοιχειομετρικές συναρτήσεις και την αναδιαμόρφωση του τανυστή στο δίκτυο Αυτο-Προσοχής. Για να αντιμετωπίσουν αυτές τις ανεφάρμοστες μεθόδους μνήμης, οι αναπτυξιακοί του EfficientViT έχουν εργαστεί σε ένα νέο δομικό στοιχείο χρησιμοποιώντας μια διάταξη σάντουιτς, δηλαδή το μοντέλο EfficientViT χρησιμοποιεί ένα μόνο δίκτυο Αυτο-Προσοχής μεταξύ των αποτελεσματικών στρωμάτων FFN που βοηθούν στην βελτίωση της μνήμης και στην ενίσχυση της συνολικής επικοινωνίας του καναλιού. Επιπλέον, το μοντέλο ανακαλύπτει ότι οι χάρτες προσοχής συχνά έχουν υψηλή ομοιότητα μεταξύ των κεφαλών, οδηγώντας σε υπολογιστική κόπωση. Για να αντιμετωπίσουν το ζήτημα της κόπωσης, το μοντέλο EfficientViT παρουσιάζει ένα κασκαντίζον module προσοχής που τροφοδοτεί τις κεφαλές προσοχής με διαφορετικές διαιρέσεις του πλήρους χαρακτηριστικού. Η μέθοδος δεν μόνο βοηθά στην экономία υπολογιστικών κόστων, αλλά και βελτιώνει την ποικιλία προσοχής του μοντέλου.
Περιεκτικές πειραματικές μελέτες που διεξήχθησαν στο μοντέλο EfficientViT σε διάφορες σενάρια δείχνουν ότι το EfficientViT υπερέχει των υφιστάμενων αποτελεσματικών μοντέλων για υπολογιστική όραση, ενώ επιτυγχάνει μια καλή ισορροπία μεταξύ ακρίβειας και ταχύτητας. Έτσι, ας πάρουμε μια πιο sâuμένη ματιά και εξετάσουμε το μοντέλο EfficientViT σε λίγο περισσότερο βάθος.
Εισαγωγή στους Μετασχηματιστές Όρασης και τον EfficientViT
Οι μετασχηματίστές όρασης παραμένουν ένα από τα πιο δημοφιλή πλαίσια στη βιομηχανία υπολογιστικής όρασης, επειδή προσφέρουν υπεροχή απόδοση και υψηλή υπολογιστική ικανότητα. Ωστόσο, με την συνεχώς βελτιωμένη ακρίβεια και απόδοση των μοντέλων μετασχηματιστών όρασης, τα λειτουργικά κόστη και η υπολογιστική υπερβολή αυξάνονται επίσης. Για παράδειγμα, τα τρέχοντα μοντέλα που είναι γνωστά για την παροχή staat-of-the-art απόδοσης σε σύνολα δεδομένων ImageNet όπως SwinV2 και V-MoE χρησιμοποιούν 3B και 14,7B παραμέτρους, αντίστοιχα. Το μέγεθος αυτών των μοντέλων, σε συνδυασμό με τα υπολογιστικά κόστη και τις απαιτήσεις, τα κάνει πρακτικά ακατάλληλα για εφαρμογές σε πραγματικό χρόνο.
Το μοντέλο EfficientNet στοχεύει να εξετάσει πώς να αυξήσει την απόδοση των μοντέλων μετασχηματιστών όρασης και να βρει τις αρχές που εμπλέκονται στη σχεδίαση αποτελεσματικών και αποτελεσματικών αρχιτεκτονικών μετασχηματιστών. Το μοντέλο EfficientViT βασίζεται σε υφιστάμενα πλαίσια μετασχηματιστών όρασης όπως Swim και DeiT και αναλύει τρεις απαραίτητες παράμετρους που επηρεάζουν την ταχύτητα των μοντέλων, συμπεριλαμβανομένης της υπολογιστικής κόπωσης, της πρόσβασης μνήμης και της χρήσης παραμέτρων. Επιπλέον, το μοντέλο παρατηρεί ότι η ταχύτητα των μοντέλων μετασχηματιστών όρασης είναι περιορισμένη από την πρόσβαση μνήμης, που σημαίνει ότι η πλήρης αξιοποίηση της υπολογιστικής ισχύος σε CPU/GPU είναι περιορισμένη από την καθυστέρηση πρόσβασης μνήμης, που έχει αρνητική επίδραση στην ταχύτητα εκτέλεσης των μετασχηματιστών. Οι στοιχειομετρικές συναρτήσεις και η αναδιαμόρφωση του τανυστή στο δίκτυο Αυτο-Προσοχής είναι οι πιο ανεφάρμοστες μεθόδους. Το μοντέλο επίσης παρατηρεί κάποια κόπωση στις χάρτες προσοχής ως αποτέλεσμα της τάσης των κεφαλών να μάθουν παρόμοιες γραμμικές προβολές.
Το μοντέλο είναι το τελικό αποτέλεσμα των ευρημάτων κατά τη διάρκεια της έρευνας για τον EfficientViT. Το μοντέλο διαθέτει ένα νέο δομικό στοιχείο με διάταξη σάντουιτς που εφαρμόζει ένα μόνο δίκτυο Αυτο-Προσοχής μεταξύ των στρωμάτων FFN. Η προσέγγιση δεν μόνο μειώνει τον χρόνο εκτέλεσης των μεθόδων πρόσβασης μνήμης, αλλά και κάνει τη διαδικασία πιο αποτελεσματική, επιτρέποντας περισσότερα στρώματα FFN να διευκολύνουν την επικοινωνία μεταξύ των καναλιών. Το μοντέλο επίσης χρησιμοποιεί ένα νέο module κασκαντίζον προσοχής που στοχεύει να κάνει τις υπολογιστικές διαδικασίες πιο αποτελεσματικές, μειώνοντας την υπολογιστική κόπωση και αυξάνοντας την ποικιλία προσοχής του μοντέλου. Τέλος, το μοντέλο επεκτείνει το πλάτος του καναλιού των κρίσιμων στοιχείων του δικτύου, ενώ συρρικνώνει το πλάτος του καναλιού των μη σημαντικών στοιχείων για να ανακατανείμει τις παραμέτρους του μοντέλου.

Όπως φαίνεται στην παραπάνω εικόνα, το πλαίσιο EfficientViT εκτελείται καλύτερα από τα τρέχοντα μοντέλα CNN και ViT όσον αφορά την ακρίβεια και την ταχύτητα. Αλλά πώς κατάφερε το πλαίσιο EfficientViT να υπερέχει των τρεχόντων μοντέλων; Ας το ανακαλύψουμε.
EfficientViT: Βελτιώνοντας την Αποτελεσματικότητα των Μετασχηματιστών Όρασης
Το μοντέλο EfficientViT στοχεύει να βελτιώσει την αποτελεσματικότητα των υφιστάμενων μοντέλων μετασχηματιστών όρασης από τρεις οπτικές γωνίες,
- Υπολογιστική Κόπωση.
- Πρόσβαση Μνήμης.
- Χρήση Παραμέτρων.
Το μοντέλο στοχεύει να ανακαλύψει πώς οι παραπάνω παράμετροι επηρεάζουν την αποτελεσματικότητα των μοντέλων μετασχηματιστών όρασης και πώς να τις λύσει για να επιτύχει καλύτερα αποτελέσματα με μεγαλύτερη αποτελεσματικότητα. Ας μιλήσουμε για αυτές τις παραμέτρους σε μεγαλύτερο βάθος.
Πρόσβαση Μνήμης και Αποτελεσματικότητα
Μια από τις βασικές παράμετρους που επηρεάζουν την ταχύτητα του μοντέλου είναι η πρόσβαση μνήμης ή MAO. Όπως φαίνεται στην εικόνα παρακάτω, διάφορες λειτουργίες στο μετασχηματιστή, συμπεριλαμβανομένων των στοιχειομετρικών προσθέσεων, της κανονικοποίησης και της συχνής αναδιαμόρφωσης, είναι ανεφάρμοστες μεθόδους μνήμης, επειδή απαιτούν πρόσβαση σε διάφορες μονάδες μνήμης, που είναι μια χρονοβόρα διαδικασία.

Αν και υπάρχουν κάποιες υφιστάμενες μεθόδους που μπορούν να απλοποιήσουν τις τυπικές υπολογιστικές διαδικασίες αυτο-προσοχής, όπως η χαμηλής τάξης προσέγγιση και η σπαρτική προσοχή, συχνά προσφέρουν περιορισμένη επιτάχυνση και μειώνουν την ακρίβεια.
Από την άλλη πλευρά, το πλαίσιο EfficientViT στοχεύει να μειώσει το κόστος πρόσβασης μνήμης μειώνοντας τον αριθμό των ανεφάρμοστων μεθόδων μνήμης στο μοντέλο. Το μοντέλο κλιμακώνει το DeiT-T και το Swin-T σε μικρότερα υποδίκτυα με υψηλότερη ταχύτητα inference 1,25X και 1,5X, και συγκρίνει την απόδοση των υποδικτύων με τις αναλογίες των στρωμάτων MHSA. Όπως φαίνεται στην εικόνα παρακάτω, όταν εφαρμοστεί, η προσέγγιση αυξάνει την ακρίβεια των στρωμάτων MHSA κατά περίπου 20 έως 40%.

Υπολογιστική Αποτελεσματικότητα
Τα στρώματα MHSA τείνουν να ενσωματώνουν την είσοδο ακολουθίας σε πολλαπλά υποχώματα ή κεφαλές και υπολογίζουν τους χάρτες προσοχής ατομικά, μια προσέγγιση που είναι γνωστή ότι αυξάνει την απόδοση. Ωστόσο, οι χάρτες προσοχής δεν είναι υπολογιστικά φθηνοί, και για να εξετάσουν τους υπολογιστικούς κόστους, το μοντέλο EfficientViT εξετάζει πώς να μειώσει την κόπωση προσοχής σε μικρότερα μοντέλα ViT. Το μοντέλο μετράει την μέγιστη ομοιότητα cosine κάθε κεφαλής και των υπόλοιπων κεφαλών σε κάθε μπλοκ με την εκπαίδευση των μοντέλων DeiT-T και Swim-T με 1,25 φορές επιτάχυνση. Όπως φαίνεται στην εικόνα παρακάτω, υπάρχει υψηλός αριθμός ομοιότητας μεταξύ των κεφαλών προσοχής, που υποδηλώνει ότι το μοντέλο υποφέρει από υπολογιστική κόπωση επειδή πολλές κεφαλές τείνουν να μάθουν παρόμοιες προβολές του πλήρους χαρακτηριστικού.

Για να ενθαρρύνουν τις κεφαλές να μάθουν διαφορετικά μοτίβα, το μοντέλο εφαρμόζει μια直관τική λύση στην οποία κάθε κεφαλή τροφοδοτείται μόνο με ένα μέρος του πλήρους χαρακτηριστικού, μια τεχνική που μοιάζει με την ιδέα της ομαδικής σύγκλισης. Το μοντέλο εκπαιδεύει τα διαφορετικά аспέκτα των μοντέλων με τροποποιημένα στρώματα MHSA.
Αποτελεσματικότητα Παραμέτρων
Τα τυπικά μοντέλα ViT κληρονομούν τις στρατηγικές σχεδιασμού τους, όπως η χρήση ισοδύναμου πλάτους για προβολές, η ρύθμιση του αναλογικού λόγου στο 4 στο FFN και η αύξηση των κεφαλών στα στάδια από NLP μετασχηματιστές. Οι ρυθμίσεις αυτών των στοιχείων πρέπει να σχεδιαστούν προσεκτικά για ελαφριά μοντέλα. Το μοντέλο EfficientViT εφαρμόζει την τεχνική Taylor για να βρει τα απαραίτητα στοιχεία στα στρώματα Swim-T και DeiT-T αυτόματα και εξετάζει τις αρχές της χρήσης παραμέτρων. Σε ορισμένα περιορισμένα πόρους, οι μεθόδους κλάδευσης αφαιρούν τις μη σημαντικές διαδικασίες και διατηρούν τις κρίσιμες για να εξασφαλίσουν την υψηλότερη δυνατή ακρίβεια. Η εικόνα παρακάτω συγκρίνει το λόγο των καναλιών με τις είσοδους ενσωματώσεων πριν και μετά την κλάδευση στο πλαίσιο Swin-T. Παρατηρήθηκε ότι: Ακρίβεια βάσης: 79,1%; ακρίβεια κλάδευσης: 76,5%.

Η παραπάνω εικόνα δείχνει ότι τα δύο πρώτα στάδια του μοντέλου διατηρούν περισσότερες διαστάσεις, ενώ τα δύο τελευταία στάδια διατηρούν πολύ λιγότερες διαστάσεις. Μπορεί να σημαίνει ότι μια τυπική διαμόρφωση καναλιού που διπλασιάζει το πλάτος του καναλιού μετά από κάθε στάδιο ή χρησιμοποιεί ισοδύναμο πλάτος για όλα τα μπλοκ, μπορεί να οδηγήσει σε σημαντική κόπωση στα τελευταία μπλοκ.
Αποτελεσματικός Μετασχηματίστης Όρασης: Αρχιτεκτονική
Βασισμένοι στις γνώσεις που αποκτήθηκαν κατά την ανάλυση, οι αναπτυξιακοί εργάστηκαν στην δημιουργία ενός νέου ιεραρχικού μοντέλου που προσφέρει γρήγορη inference, το μοντέλο EfficientViT. Ας δούμε μια πιο λεπτομερή ματιά στην αρχιτεκτονική του μοντέλου EfficientViT. Η εικόνα παρακάτω δίνει μια γενική ιδέα για το μοντέλο EfficientViT.
Δομικά Στοιχεία του Μοντέλου EfficientViT
Το δομικό στοιχείο για το πιο αποτελεσματικό δίκτυο μετασχηματιστών όρασης εμφανίζεται στην εικόνα παρακάτω.

Το μοντέλο αποτελείται από ένα κασκαντίζον module προσοχής, μια διάταξη σάντουιτς και μια στρατηγική ανακατανομής παραμέτρων που στοχεύουν στην βελτίωση της αποτελεσματικότητας του μοντέλου σε υπολογιστική, μνήμη και παραμέτρους, αντίστοιχα. Ας μιλήσουμε για αυτές τις παραμέτρους σε μεγαλύτερο βάθος.
Διάταξη Σάντουιτς
Το μοντέλο χρησιμοποιεί μια νέα διάταξη σάντουιτς για να δημιουργήσει ένα πιο αποτελεσματικό και αποτελεσματικό μπλοκ μνήμης για το μοντέλο. Η διάταξη σάντουιτς χρησιμοποιεί λιγότερες μεθόδους πρόσβασης μνήμης και χρησιμοποιεί περισσότερες μεθόδους FFN για επικοινωνία καναλιών. Για να seja πιο συγκεκριμένος, το μοντέλο εφαρμόζει ένα μόνο στρώμα αυτο-προσοχής για χωρική ανάμιξη που είναι σάντουιτς μεταξύ των στρωμάτων FFN. Η σχεδίαση δεν μόνο μειώνει τον χρόνο εκτέλεσης των μεθόδων πρόσβασης μνήμης, αλλά και επιτρέπει αποτελεσματική επικοινωνία μεταξύ των καναλιών μέσα στο δίκτυο χάρη στην χρήση των στρωμάτων FFN. Το μοντέλο επίσης εφαρμόζει ένα επιπλέον στρώμα δια互одействίας πριν από κάθε στρώμα FFN χρησιμοποιώντας DWConv ή Deceptive Convolution και αυξάνει την ικανότητα του μοντέλου εισάγοντας την επαγωγική προκατάληψη της τοπικής δομικής πληροφορίας.
Κασκαντίζον Προσοχή
Ένα από τα основικά προβλήματα των στρωμάτων MHSA είναι η κόπωση στις κεφαλές προσοχής, που κάνει τις υπολογιστικές διαδικασίες λιγότερο αποτελεσματικές. Για να λύσει αυτό το ζήτημα, το μοντέλο προτείνει την κασκαντίζον προσοχή για μετασχηματιστές όρασης, ένα νέο module προσοχής που εμπνέεται από τις ομαδικές σύγκλισεις στα αποτελεσματικά CNN. Σε αυτήν την προσέγγιση, το μοντέλο τροφοδοτεί τις κεφαλές με διαφορετικά τμήματα του πλήρους χαρακτηριστικού και διασπάει την υπολογιστική προσοχής ρητά μεταξύ των κεφαλών. Η διαίρεση των χαρακτηριστικών αντί να τροφοδοτεί τις κεφαλές με το πλήρες χαρακτηριστικό экономεί υπολογιστικές διαδικασίες και κάνει τη διαδικασία πιο αποτελεσματική, και το μοντέλο συνεχίζει να εργάζεται για την βελτίωση της ακρίβειας και της ικανότητας ακόμη περισσότερο, ενθαρρύνοντας τα στρώματα να μάθουν προβολές σε χαρακτηριστικά με πλουσιότερη πληροφορία.

Ανακατανομή Παραμέτρων
Για να βελτιώσει την αποτελεσματικότητα των παραμέτρων, το μοντέλο ανακατανέμει τις παραμέτρους στο δίκτυο επεκτείνοντας το πλάτος του καναλιού των κρίσιμων στοιχείων ενώ συρρικνώνει το πλάτος του καναλιού των μη σημαντικών στοιχείων. Βασισμένοι στην ανάλυση Taylor, το μοντέλο ρυθμίζει μικρές διαστάσεις καναλιού για προβολές σε κάθε κεφαλή κατά τη διάρκεια κάθε στάδιου ή επιτρέπει τις προβολές να έχουν την ίδια διάσταση με την είσοδο. Ο αναλογικός λόγος του στρώματος FFN μειώνεται σε 2 από 4 για να βοηθήσει στην ανακατανομή παραμέτρων. Η προτεινόμενη στρατηγική ανακατανομής που εφαρμόζει το μοντέλο EfficientViT, ανακατανέμει περισσότερα κανάλια στα σημαντικά στοιχεία για να επιτρέψει να μάθουν αναπαραστάσεις σε υψηλότερο διαστατικό χώρο καλύτερα, που ελαχιστοποιεί την απώλεια πληροφορίας χαρακτηριστικών. Επιπλέον, για να επιταχύνει τη διαδικασία inference και να βελτιώσει την αποτελεσματικότητα του μοντέλου ακόμη περισσότερο, το μοντέλο αφαιρεί αυτόματα τις κόπωσης παραμέτρων στα μη σημαντικά στοιχεία.

Η επισκόπηση του μοντέλου EfficientViT μπορεί να εξηγηθεί στην παραπάνω εικόνα, όπου τα μέρη:
- Αρχιτεκτονική του EfficientViT,
- Μπλοκ διάταξης σάντουιτς,
- Κασκαντίζον προσοχή.
EfficientViT: Αρχιτεκτονικές Δικτύου

Η παραπάνω εικόνα συνοψίζει την αρχιτεκτονική του μοντέλου EfficientViT. Το μοντέλο εισάγει μια επικαλυπτόμενη ενσωμάτωση patch [20,80] που ενσωματώνει 16×16 patches σε διαστάσεις C1 που αυξάνει την ικανότητα του μοντέλου να εκτελεί καλά στη学习 της χαμηλής οπτικής αναπαράστασης. Η αρχιτεκτονική του μοντέλου αποτελείται από τρία στάδια, όπου κάθε στάδιο στοιβάζει τα προτεινόμενα δομικά στοιχεία του μοντέλου EfficientViT, και ο αριθμός των tokens σε κάθε στάδιο (2× υποδείγματος της ανάλυσης) μειώνεται κατά 4X. Για να κάνει την υποδείγματος πιο αποτελεσματική, το μοντέλο προτείνει ένα μπλοκ υποδείγματος που έχει επίσης την προτεινόμενη διάταξη σάντουιτς με την εξαίρεση ότι ένα ανεστραμμένο残 block αντικαθιστά το στρώμα προσοχής για να μειώσει την απώλεια πληροφορίας κατά τη δειγματοληψία. Επιπλέον, αντί για την τυπική LayerNorm(LN), το μοντέλο χρησιμοποιεί BatchNorm(BN) επειδή το BN μπορεί να ενσωματωθεί στα προηγούμενα γραμμικά ή συζυγικά στρώματα, που του δίνει ένα πλεονέκτημα εκτέλεσης έναντι του LN.
Οικογένεια Μοντέλων EfficientViT
Η οικογένεια μοντέλων EfficientViT αποτελείται από 6 μοντέλα με διαφορετικά βάθη και πλάτος, και ένας καθορισμένος αριθμός κεφαλών ανατείνεται σε κάθε στάδιο. Τα μοντέλα χρησιμοποιούν λιγότερα μπλοκ στα αρχικά στάδια σε σύγκριση με τα τελικά στάδια, μια διαδικασία που μοιάζει με αυτή που ακολουθεί το πλαίσιο MobileNetV3, επειδή η διαδικασία της πρώιμης επεξεργασίας με μεγαλύτερες ανάλυσεις είναι χρονοβόρα. Το πλάτος αυξάνεται στα στάδια με ένα μικρό παράγοντα για να μειώσει την κόπωση στα τελευταία στάδια. Ο πίνακας που ακολουθεί παρέχει τις αρχιτεκτονικές λεπτομέρειες της οικογένειας μοντέλων EfficientViT, όπου C, L και H αναφέρονται στο πλάτος, το βάθος και τον αριθμό κεφαλών στο συγκεκριμένο στάδιο.

EfficientViT: Υλοποίηση Μοντέλου και Αποτελέσματα
Το μοντέλο EfficientViT έχει συνολικό μέγεθος batch 2.048, είναι κατασκευασμένο με Timm και PyTorch, εκπαιδεύεται από την αρχή για 300 επαναλήψεις χρησιμοποιώντας 8 Nvidia (NVDA ) V100 GPUs, χρησιμοποιεί einen Scheduler学习 ρυθμού cosine, einen AdamW optimizer και διεξάγει πειράματα ταξινόμησης εικόνων στο ImageNet-1K. Οι είσοδοι εικόνων είναι τυχαία κομμένες και αναδιαμορφωμένες σε ανάλυση 224×224. Για τα πειράματα που αφορούν την ταξινόμηση εικόνων, το μοντέλο EfficientViT fined-tunes το μοντέλο για 300 επαναλήψεις και χρησιμοποιεί AdamW optimizer με μέγεθος batch 256. Το μοντέλο χρησιμοποιεί RetineNet για ανίχνευση αντικειμένων στο COCO και συνεχίζει να εκπαιδεύει τα μοντέλα για 12 επιπλέον επαναλήψεις με τις ίδιες ρυθμίσεις.
Αποτελέσματα στο ImageNet
Για να αναλύσει την απόδοση του EfficientViT, συγκρίνεται με τα τρέχοντα μοντέλα ViT και CNN στο σύνολο δεδομένων ImageNet. Τα αποτελέσματα από τη σύγκριση αναφέρονται στην παρακάτω εικόνα. Όπως φαίνεται, η οικογένεια μοντέλων EfficientViT υπερέχει των τρεχόντων μοντέλων σε meisten περιπτώσεις και επιτυγχάνει μια ιδανική ισορροπία μεταξύ ταχύτητας και ακρίβειας.

Σύγκριση με Αποτελεσματικά CNN και Efficient ViTs
Το μοντέλο συγκρίνεται πρώτα με τα αποτελεσματικά CNN όπως EfficientNet και τα τυπικά CNN όπως MobileNets. Όπως φαίνεται, όταν συγκρίνεται με τα μοντέλα MobileNet, τα μοντέλα EfficientViT επιτύγχάνουν καλύτερη ακρίβεια top-1, ενώ τρέχουν 3,0X και 2,5X ταχύτερα σε Intel (INTC ) CPU και V100 GPU, αντίστοιχα.

Η παραπάνω εικόνα συγκρίνει την απόδοση του μοντέλου EfficientViT με τα μοντέλα ViT μεγάλης κλίμακας που τρέχουν στο σύνολο δεδομένων ImageNet-1K.
Καταstromη Ταξινόμηση Εικόνων
Το μοντέλο EfficientViT εφαρμόζεται σε διάφορες εργασίες για να μελετήσει την ικανότητα μεταφοράς του μοντέλου, και η παρακάτω εικόνα συνοψίζει τα αποτελέσματα του πειράματος. Όπως φαίνεται, το μοντέλο EfficientViT-M5 επιτυγχάνει καλύτερα ή παρόμοια αποτελέσματα σε όλα τα σύνολα δεδομένων, ενώ διατηρεί υψηλότερη ταχύτητα. Η μόνη εξαίρεση είναι το σύνολο δεδομένων Cars, όπου το μοντέλο EfficientViT δεν επιτυγχάνει στην ακρίβεια.

Ανίχνευση Αντικειμένων
Για να αναλύσει την ικανότητα ανίχνευσης αντικειμένων του EfficientViT, συγκρίνεται με τα αποτελεσματικά μοντέλα στο task ανίχνευσης αντικειμένων COCO, και η παρακάτω εικόνα συνοψίζει τα αποτελέσματα της σύγκρισης.

Τελικές Σκέψεις
Σε αυτό το άρθρο, μιλήσαμε για τον EfficientViT, μια οικογένεια ταχύτητας μετασχηματιστών όρασης που χρησιμοποιούν κασκαντίζον προσοχή και προσφέρουν αποτελεσματικές μεθόδους μνήμης. Περιεκτικές πειραματικές μελέτες που διεξήχθησαν για να αναλύσουν την απόδοση του EfficientViT έχουν δείξει υποσχόμενες αποτελέσματα, καθώς το μοντέλο EfficientViT υπερέχει των τρεχόντων μοντέλων CNN και μετασχηματιστών όρασης σε meisten περιπτώσεις. Επίσης, προσπαθήσαμε να παρέχουμε μια ανάλυση των παραγόντων που επηρεάζουν την ταχύτητα inference των μετασχηματιστών όρασης.












