Μοντέλα και πλατφόρμες AI

YOLO-World: Αναγνώριση Αντικειμένων σε Εchtzeit με Ανοιχτή Λεξική

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η αναγνώριση αντικειμένων έχει sido μια θεμελιώδης πρόκληση στην βιομηχανία της υπολογιστικής όρασης, με εφαρμογές στην ρομποτική, την κατανόηση εικόνων, τα αυτόνομα οχήματα και την αναγνώριση εικόνων. Τα τελευταία χρόνια, η πρωτοποριακή εργασία στο AI, ιδιαίτερα μέσω των βαθιών νευρωνικών δικτύων, έχει προωθήσει σημαντικά την αναγνώριση αντικειμένων. Ωστόσο, αυτά τα μοντέλα έχουν einen περιορισμένο λεξιλόγιο, περιορισμένο στην αναγνώριση αντικειμένων εντός των 80 κατηγοριών του συνόλου δεδομένων COCO. Αυτός ο περιορισμός προέρχεται από τη διαδικασία εκπαίδευσης, όπου οι ανιχνευτές αντικειμένων εκπαιδεύονται να αναγνωρίζουν μόνο συγκεκριμένες κατηγορίες, περιοριζοντας έτσι την εφαρμοσιμότητά τους.

Για να υπερβούμε αυτό, εισαγάγουμε το YOLO-World, μια καινοτόμο προσέγγιση που στοχεύει στην ενίσχυση του πλαισίου YOLO (You Only Look Once) με ικανότητες ανοιχτής λεξικής ανίχνευσης. Αυτό επιτυγχάνεται με την προ-εκπαίδευση του πλαισίου σε μεγάλης κλίμακας συνόλου δεδομένων και την εφαρμογή μιας προσεγγίσεως μοντέλου όρασης-γλώσσας. Συγκεκριμένα, το YOLO-World χρησιμοποιεί ένα Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) και region-text contrastive loss για να διευκολύνει την αλληλεπίδραση μεταξύ γλωσσικών και οπτικών πληροφοριών. Μέσω του RepVL-PAN και του region-text contrastive loss, το YOLO-World μπορεί να αναγνωρίσει ακριβώς και αποτελεσματικά ένα ευρύ φάσμα αντικειμένων σε ένα zero-shot ρύθμιση, δείχνοντας εξαιρετική απόδοση σε ανοιχτή λεξική διαίρεση και αναγνώριση αντικειμένων.

Το άρθρο αυτό έχει ως στόχο να παρέχει μια πλήρη κατανόηση των τεχνικών θεμελίων του YOLO-World, της αρχιτεκτονικής του μοντέλου, της διαδικασίας εκπαίδευσης και των εφαρμογών. Ας μπουν στο θέμα.

YOLO-World: Αναγνώριση Αντικειμένων σε Εchtzeit με Ανοιχτή Λεξική

Το YOLO ή You Only Look Once είναι μια από τις πιο δημοφιλείς μεθόδους για την αναγνώριση αντικειμένων στην υπολογιστική όραση. Φημισμένο για την ταχύτητά του και την αποτελεσματικότητά του, η εισαγωγή του μηχανισμού YOLO έχει επαναπροσδιορίσει τον τρόπο με τον οποίο οι μηχανές ερμηνεύουν και αναγνωρίζουν συγκεκριμένα αντικείμενα σε εικόνες και βίντεο σε πραγματικό χρόνο. Τα παραδοσιακά πλαισιαία αναγνώρισης αντικειμένων εφαρμόζουν μια δι-βήματη προσέγγιση αναγνώρισης αντικειμένων: στο πρώτο βήμα, το πλαισιο προτείνει περιοχές που μπορεί να περιέχουν το αντικείμενο, και το πλαισιο ταξινομεί το αντικείμενο στο επόμενο βήμα. Το πλαισιο YOLO, από την άλλη πλευρά, ενσωματώνει αυτά τα δύο βήματα σε ένα ενιαίο νευρωνικό μοντέλο, μια προσέγγιση που επιτρέπει στο πλαισιο να κοιτάξει την εικόνα μόνο μια φορά για να προβλέψει το αντικείμενο και τη θέση του στην εικόνα, και έτσι, το όνομα YOLO ή You Only Look Once.

Επιπλέον, το πλαισιο YOLO αντιμετωπίζει την αναγνώριση αντικειμένων ως ένα πρόβλημα παλινδρόμησης, και προβλέπει τις πιθανότητες κατηγοριών και τα ορθογώνια πλαίσια απευθείας από την πλήρη εικόνα σε μια seule ματιά. Η εφαρμογή αυτής της μεθόδου не μόνο αυξάνει την ταχύτητα της διαδικασίας ανίχνευσης, αλλά cũng ενισχύει την ικανότητα του μοντέλου να γενικεύσει από σύνθετα και ποικίλα δεδομένα, καθιστώντας το μια κατάλληλη επιλογή για εφαρμογές που λειτουργούν σε πραγματικό χρόνο, όπως η αυτόνομη οδήγηση, η ανίχνευση ταχύτητας ή η αναγνώριση πινακίδων.

Συνεχίζοντας, τα πρόσφατα αναπτυγμένα μοντέλα όρασης-γλώσσας χρησιμοποιούν αποσταγμένα γλωσσικά γνώσεις από γλωσσικούς κωδικοποιητές για να αντιμετωπίσουν την ανοιχτή λεξική ανίχνευση. Αν και αυτά τα πλαισιαία εκτελούν καλύτερα από τα παραδοσιακά μοντέλα αναγνώρισης αντικειμένων στην ανοιχτή λεξική ανίχνευση, vẫn έχουν περιορισμένη εφαρμοσιμότητα λόγω της σπανιότητας των δεδομένων εκπαίδευσης με περιορισμένη ποικιλία λεξιλογίου. Επιπλέον, τα επιλεγμένα πλαισιαία εκπαιδεύουν ανοιχτή λεξική ανιχνευτές σε κλίμακα, και κατηγοριοποιούν τους ανιχνευτές εκπαίδευσης σε επίπεδο περιοχής. Ωστόσο, η προσέγγιση vẫn παλεύει στην ανίχνευση αντικειμένων σε πραγματικό χρόνο λόγω δύο основних λόγων: σύνθετης διαδικασίας ανάπτυξης για περιφερειακές συσκευές, και βαριών απαιτήσεων υπολογισμού.

Το πλαισιο YOLO-World στοχεύει να επιτύχει υψηλά αποτελεσματική ανοιχτή λεξική ανίχνευση αντικειμένων, και να εξερευνήσει την可能性 μεγάλης κλίμακας προ-εκπαίδευσης για να ενισχύσει την αποτελεσματικότητα των παραδοσιακών ανιχνευτών YOLO για ανοιχτή λεξική ανίχνευση. Αντιθέτως με τις προηγούμενες εργασίες στην αναγνώριση αντικειμένων, το πλαισιο YOLO-World παρουσιάζει εξαιρετική αποτελεσματικότητα με υψηλές ταχύτητες συλλογής, και μπορεί να αναπτυχθεί σε εφαρμογές με ευκολία.

Το πλαισιο YOLO-World ακολουθεί την παραδοσιακή αρχιτεκτονική YOLO, και κωδικοποιεί τις εισαγωγικές κείμενες χρησιμοποιώντας τις ικανότητες ενός προ-εκπαιδευμένου κωδικοποιητή CLIP. Επιπλέον, το πλαισιο YOLO-World περιλαμβάνει ένα Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) στοιχείο στην αρχιτεκτονική του για να συνδέσει τις οπτικές και γλωσσικές λειτουργίες για ενισχυμένες οπτικές-σεμαντικές αναπαραστάσεις.

Κατά τη διάρκεια της φάσης συλλογής, το πλαισιο YOLO-World αφαιρεί τον κωδικοποιητή κειμένου, και επανα-παραμετρώνει τις ετικέτες κειμένου σε βάρη του RepVL-PAN, οδηγώντας σε αποτελεσματική ανάπτυξη. Το πλαισιο επίσης περιλαμβάνει region-text contrastive learning στην αρχιτεκτονική του για να μελετήσει μεθόδους προ-εκπαίδευσης για τους παραδοσιακούς ανιχνευτές YOLO. Η μέθοδος region-text contrastive learning ενοποιεί δεδομένα εικόνας-κειμένου, δεδομένα ερμηνείας, και δεδομένα ανίχνευσης σε ζευγάρια περιοχής-κειμένου.

YOLO-World : Μέθοδος και Αρχιτεκτονική

Ζευγάρια Περιοχής-Κειμένου

Παραδοσιακά, τα πλαισιαία αναγνώρισης αντικειμένων, συμπεριλαμβανομένης της οικογένειας ανιχνευτών YOLO, εκπαιδεύονται χρησιμοποιώντας αναnotations που περιέχουν ετικέτες κατηγοριών και ορθογώνια πλαίσια. Σε αντίθεση, το πλαισιο YOLO-World αναδιαμορφώνει τις αναnotations ως ζευγάρια περιοχής-κειμένου, όπου το κείμενο μπορεί να είναι η περιγραφή του αντικείμενου, ουσιαστικά φράσεις, ή όνομα κατηγορίας.

Αρχιτεκτονική Μοντέλου

Στην καρδιά του, το μοντέλο YOLO-World αποτελείται από einen κωδικοποιητή κειμένου, einen ανιχνευτή YOLO, και το στοιχείο Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN), όπως φαίνεται στην ακόλουθη εικόνα.

Για μια εισαγωγική κείμενο, ο κωδικοποιητής κειμένου κωδικοποιεί το κείμενο σε ετικέτες κειμένου, ακολουθούμενο από την εξαγωγή πολλαπλών κλιμάκων χαρακτηριστικών από την εισαγωγική εικόνα από τον ανιχνευτή YOLO. Το στοιχείο Re-parameterizable Vision-Language Path Aggregation Network (RepVL-PAN) THEN εκμεταλλεύεται την δια-τροπικότητα σύντηξη μεταξύ των ετικετών κειμένου και των χαρακτηριστικών για να ενισχύσει τις οπτικές-σεμαντικές αναπαραστάσεις.

Ανιχνευτής YOLO

Το μοντέλο YOLO-World είναι χτισμένο πάνω στην υπάρχουσα αρχιτεκτονική YOLOv8 που περιέχει einen Darknet backbone ως κωδικοποιητή εικόνας, einen κεφαλή για ετικέτες αντικειμένων και παλινδρόμηση ορθογώνιων πλαίσίων, και einen Path Aggression Network για πυραμίδες χαρακτηριστικών πολλαπλών κλιμάκων.

Κωδικοποιητής Κειμένου

Για μια δεδομένη κείμενο, το μοντέλο YOLO-World εξάγει τις αντίστοιχες ετικέτες κειμένου υιοθετώντας einen προ-εκπαιδευμένο CLIP Transformer κωδικοποιητή κειμένου με έναν συγκεκριμένο αριθμό ουσιαστικών και διαστάσεων ετικετών. Ο основικός λόγος για τον οποίο το πλαισιο YOLO-World υιοθετεί einen κωδικοποιητή CLIP είναι ότι προσφέρει καλύτερη οπτική-σεματική απόδοση για τη σύνδεση κειμένων με οπτικά αντικείμενα, υπερβαίνοντας σημαντικά τους παραδοσιακούς κωδικοποιητές κειμένου μόνο.

Κεφαλή Contrastive Κειμένου

Η αποσύνδεση κεφαλής είναι ένα στοιχείο που χρησιμοποιείται από προηγούμενα μοντέλα αναγνώρισης αντικειμένων, και το πλαισιο YOLO-World υιοθετεί eine αποσύνδεση κεφαλής με dual 3×3 convolutions για να παλινδρομήσει ετικέτες αντικειμένων και ορθογώνια πλαίσια για einen συγκεκριμένο αριθμό αντικειμένων.

Εκπαίδευση Λεξιλογίου Online

Κατά τη διάρκεια της φάσης εκπαίδευσης, το μοντέλο YOLO-World κατασκευάζει einen online λεξιλόγιο για κάθε δείγμα mosaic που αποτελείται από 4 εικόνες. Το μοντέλο δειγματοληψίας όλων των θετικών ουσιαστικών που περιλαμβάνονται στις εικόνες mosaic, και δειγματοληψίας κάποιων αρνητικών ουσιαστικών τυχαία από το αντίστοιχο σύνολο δεδομένων.

Εκτίμηση Λεξιλογίου Offline

Κατά τη διάρκεια της φάσης συλλογής, το μοντέλο YOLO-World παρουσιάζει eine στρατηγική prompt-then-detect με offline λεξιλόγιο για να ενισχύσει την αποτελεσματικότητα του μοντέλου. Ο χρήστης πρώτα ορίζει eine σειρά προσαρμοσμένων prompts που μπορεί να περιλαμβάνουν κατηγορίες ή ακόμη και περιγραφές.

Re-parameterizable Vision-Language Path Aggregation Network (RevVL-PAN)

Η ακόλουθη εικόνα εικονογραφεί την δομή του προτεινόμενου Re-parameterizable Vision-Language Path Aggregation Network που ακολουθεί τις δια-τροπικές διαδρομές για να καθορίσει την πυραμίδα χαρακτηριστικών με πολλαπλές κλίμακες.

Για να ενισχύσει την αλληλεπίδραση μεταξύ κειμένου και οπτικών χαρακτηριστικών, το μοντέλο YOLO-World προτείνει eine Image-Pooling Attention και eine Text-guided CSPLayer με τον τελικό στόχο της βελτίωσης των οπτικών-σεμαντικών αναπαραστάσεων για ανοιχτή λεξική ικανότητα.

Σχέδια Προ-Εκπαίδευσης

Το μοντέλο YOLO-World ακολουθεί δύο основικές схемές προ-εκπαίδευσης: Μάθηση από Region-Text Contrastive Loss και Ψευδώνυμα με Δεδομένα Εικόνας-Κειμένου. Για την πρώτη схέμα προ-εκπαίδευσης, το μοντέλο εξάγει προβλέψεις αντικειμένων μαζί με αναnotations για eine δεδομένη κείμενο και δείγματα mosaic.

YOLO-World : Αποτελέσματα

Μόλις το μοντέλο YOLO-World έχει προ-εκπαιδευτεί, αξιολογείται απευθείας στο σύνολο δεδομένων LVIS σε eine zero-shot ρύθμιση, με το σύνολο δεδομένων LVIS να περιλαμβάνει πάνω από 1200 κατηγορίες, σημαντικά περισσότερες από τα σύνολα δεδομένων που χρησιμοποιούνται από τα υπάρχοντα πλαισιαία για τον έλεγχο της απόδοσης τους στην ανοιχτή λεξική ανίχνευση.

Τελικές Σκέψεις

Σε αυτό το άρθρο, abbiamo μιλήσει για το YOLO-World, eine καινοτόμο προσέγγιση που στοχεύει στην ενίσχυση των ικανοτήτων του πλαισίου YOLO με ανοιχτή λεξική ανίχνευση, προ-εκπαιδεύοντας το πλαισιο σε μεγάλης κλίμακας συνόλου δεδομένων και εφαρμόζοντας eine προσέγγιση μοντέλου όρασης-γλώσσας. Για να seja πιο συγκεκριμένος, το πλαισιο YOLO-World προτείνει να εφαρμόσει einen Re-parameterizable Vision Language Path Aggregation Network (RepVL-PAN) μαζί με region-text contrastive loss για να διευκολύνει την αλληλεπίδραση μεταξύ γλωσσικών και οπτικών πληροφοριών.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.