Μοντέλα και πλατφόρμες AI

Osprey: Κατανόηση Pixel-Level με Οπτική Εργασία με τον Osprey

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Με την πρόσφατη βελτίωση των μεθόδων οπτικής εργασίας, τα Πολυμεταβλητά Μεγάλης Γλώσσας Μοντέλα (MLLMs) έχουν δείξει αξιοσημείωτες γενικής χρήσης οπτικές-γλωσσικές ικανότητες. Αυτές οι ικανότητες τα καθιστούν βασικά στοιχεία για τους σύγχρονους γενικής χρήσης οπτικούς βοηθούς. Τα πρόσφατα μοντέλα, συμπεριλαμβανομένων των MiniGPT-4, LLaVA, InstructBLIP και άλλων, παρουσιάζουν εντυπωσιακές οπτικές ικανότητες και ικανότητες ακολουθίας οδηγιών. Αν και η πλειοψηφία τους βασίζεται σε ζευγάρια εικόνας-κειμένου για την ευθυγράμμιση οπτικής-γλώσσας σε επίπεδο εικόνας, λειτουργούν καλά σε αυτό το domaine. Ωστόσο, η εξάρτησή τους από την κατανόηση σε επίπεδο κουτιού και εικόνας είναι ο основной λόγος για τον οποίο τα MLLMs δεν μπορούν να αναπαραγάγουν την απόδοσή τους σε εργασίες ευθυγράμμισης οπτικής-γλώσσας σε επίπεδο pixel. Επιπλέον, η περιορισμένη διαθεσιμότητα δεδομένων οδηγιών με μάσκα για εκπαίδευση θέτει προκλήσεις στην περαιτέρω βελτίωση των MLLMs.

Ο Osprey είναι μια μέθοδος εκπαίδευσης οδηγιών με μάσκα με основικό στόχο την επέκταση των MLLMs. Ενσωματώνει λεπτομερείς περιοχές με μάσκα στις οδηγίες γλώσσας για να επιτύχει κατανόηση οπτικής-γλώσσας σε επίπεδο pixel. Για να το επιτύχει, το πλαίσιο του Osprey δημιουργεί ένα σύνολο δεδομένων περιοχής-κειμένου με πάνω από 700 χιλιάδες δείγματα. Εισάγει αναπαράσταση pixel-level σε Μεγάλες Γλώσσες Μοντέλα (LLMs) για να σχεδιάσει ένα μοντέλο οπτικής-γλώσσας. Το πλαίσιο του Osprey υιοθετεί ένα μοντέλο CLIP με βάση το CNN ως κωδικοποιητή οράσεως και ενσωματώνει einen εξαγωγέα οπτικών με μάσκα στη δομή του. Αυτό επιτρέπει την ακριβή εξαγωγή οπτικών χαρακτηριστικών με μάσκα από υψηλής ανάλυσης εισαγωγή.

Σε αυτό το άρθρο, θα συζητήσουμε το πλαίσιο του Osprey και θα εμβαθύνουμε στη δομή του. Θα εξετάσουμε επίσης το σύνολο δεδομένων περιοχής-κειμένου με πάνω από 700 χιλιάδες δείγματα και θα συγκρίνουμε την απόδοσή του σε διάφορες εργασίες κατανόησης περιοχής. Έτσι, ας ξεκινήσουμε.

Osprey: Κατανόηση Pixel-Level με Οπτική Εργασία

Τα Πολυμεταβλητά Μεγάλης Γλώσσας Μοντέλα όπως τα MiniGPT-4, Otter, Qwen-LV, InstructBLIP και άλλα είναι οι πρωτοπόροι στην ανάπτυξη γενικής χρήσης οπτικών βοηθών και είναι γνωστά για τις εξαιρετικές πολυμεταβλητές και οπτικές γεννητικές ικανότητές τους. Ωστόσο, τα Πολυμεταβλητά Μεγάλης Γλώσσας Μοντέλα αντιμετωπίζουν μια σημαντική πρόκληση, καθώς παρέχουν μη ικανοποιητικά αποτελέσματα σε εργασίες κατανόησης εικόνας σε επίπεδο pixel, όπως η λεζάντα, η ταξινόμηση περιοχής και ο συλλογισμός. Ένας από τους основικούς λόγους της κακής απόδοσης σε εργασίες κατανόησης εικόνας σε επίπεδο pixel είναι η έλλειψη ευθυγράμμισης σε επίπεδο περιοχής. Τα πρόσφατα MLLMs όπως το GPT4RoI, Shikra και άλλα στοχεύουν να ενεργοποιήσουν την κατανόηση σε επίπεδο περιοχής σε μοντέλα οπτικής-γλώσσας, επεξεργαζόμενα περιοχές που ορίζονται από κουτί και αξιοποιώντας την οπτική εργασία με χωρικές χαρακτηριστικές σε επίπεδο αντικειμένου.

Αν και η προσέγγιση για την ενεργοποίηση της κατανόησης σε επίπεδο περιοχής μπορεί να βελτιώσει την απόδοση, η χρήση σπαρμένων κουτιών ως εισαγωγής περιοχής αναφοράς μπορεί να εισαγάγει μη σχετικές χαρακτηριστικές φόντου, οδηγώντας σε ανακριβή ευθυγράμμιση ζευγαρίων οπτικής-γλώσσας για οπτική εργασία σε μεγάλες γλώσσες μοντέλα. Κατά τη διάρκεια της διαδικασίας συλλογισμού, η εισαγωγή κουτιού-επίπεδου μπορεί να μην είναι σε θέση να ανιχνεύσει και να αναπαραστήσει το αντικείμενο με ακρίβεια, οδηγώντας σε σεμαντική απόκλιση, όπως φαίνεται στην ακόλουθη εικόνα.

Σε σύγκριση, η χρήση λεπτομερών μασκών αντί για χοντρές περιοχές-κουτί ως εισαγωγής αναφοράς μπορεί να αντιπροσωπεύσει αντικείμενα με μεγαλύτερη ακρίβεια. Το πρόσφατα αναπτυγμένο SAM ή Μοντέλο Segment Anything εκπαιδεύεται σε δισεκατομμύρια υψηλής ποιότητας μασκών, παρουσιάζει αξιοσημείωτη ποιότητα τομής σε αντικείμενα zero-shot και υποστηρίζει τη χρήση σημείων ή απλών κουτιών ως προτύπων. Ωστόσο, το πλαίσιο του SAM δεν μπορεί να παράγει πρωτεύοντες σεμαντικούς etiquettes, ούτε μπορεί να παρέχει λεπτομερείς σεμαντικές λεζάντες και χαρακτηριστικά. Ως αποτέλεσμα, τα υπάρχοντα μοντέλα лишονται εγγενών πολυμεταβλητών λεπτομερών πληροφοριών και έχουν περιορισμένη κατανόηση των σκηνών στον πραγματικό κόσμο.

Για να αντιμετωπιστούν οι προκλήσεις που αντιμετωπίζουν τα υπάρχοντα MLLMs, ο Osprey, μια νέα μέθοδος εκπαίδευσης οδηγιών με μάσκα, στοχεύει στην επέκταση των ικανοτήτων των πολυμεταβλητών μεγάλων γλώσσας μοντέλων για κατανόηση σε επίπεδο pixel. Το πλαίσιο του Osprey εισάγει einen εξαγωγέα οπτικών με μάσκα που καταγράφει οπτικά χαρακτηριστικά με μάσκα με ποικίλη granularità. Το πλαίσιο στη συνέχεια διασπάει τα οπτικά χαρακτηριστικά με τις οδηγίες γλώσσας για να παράγει την εισαγωγική ακολουθία για το μεγάλο γλώσσας μοντέλο και αξιοποιεί την αρχιτεκτονική CLIP με βάση το CNN για να διευκολύνει τη χρήση υψηλής ανάλυσης εισαγωγής. Λόγω της σχεδίασης και της αρχιτεκτονικής του, το πλαίσιο του Osprey είναι σε θέση να επιτύχει κατανόηση σε επίπεδο pixel για περιοχές αντικειμένου και μερών, και παρέχει λεπτομερείς χαρακτηριστικά αντικειμένων μαζί με την πρωτεύουσα κατηγορία αντικειμένου και βελτιωμένες περιγραφές σύνθετων σκηνών.

Αξιοποιώντας τις ικανότητες της οπτικής εργασίας, το πλαίσιο του Osprey ενεργοποιεί νέες ικανότητες πέρα από την κατανόηση σε επίπεδο εικόνας και κουτιού των σκηνών, καθώς το πλαίσιο του Osprey μπορεί να παράγει κατανόηση σε επίπεδο pixel χρησιμοποιώντας μάσκες χωρίς κατηγορία από off-the-shelf SAMs. Επιπλέον, ο Osprey παρουσιάζει αξιοσημείωτες ικανότητες σε εργασίες ταξινόμησης αντικειμένων αναφοράς, αναγνώρισης ανοιχτής λεξικής, περιγραφής σε επίπεδο περιοχής και λεπτομερών περιγραφών περιοχής.

Osprey: Μεθοδολογία και Αρχιτεκτονική

Η ακόλουθη εικόνα δείχνει την επισκόπηση της αρχιτεκτονικής του πλαισίου του Osprey, αποτελούμενη από ένα μεγάλο γλώσσας μοντέλο, einen εξαγωγέα οπτικών με μάσκα και einen κωδικοποιητή οράσεως σε επίπεδο εικόνας.

Για μια δεδομένη εικόνα, την εισαγωγή γλώσσας και τις περιοχές-μάσκα αναφοράς, το πλαίσιο εκτελεί μετατροπή και tokenization για να παράγει ενσωματώσεις πριν από την αποστολή των ενσωματωμένων ακολουθιών γλώσσας και των διασπάσεων χαρακτηριστικών με μάσκα στο μεγάλο γλώσσας μοντέλο για να λάβει κατανόηση σε επίπεδο pixel.

Κωδικοποιητής CLIP με βάση το CNN

Ο κωδικοποιητής οράσεως που χρησιμοποιείται σε πολλά πολυμεταβλητά μεγάλα γλώσσας μοντέλα είναι το ViT-με βάση το μοντέλο CLIP. Ως αποτέλεσμα, το πλαίσιο υιοθετεί μια ανάλυση εικόνας 224×224 pixels ή 336 x 336 pixels. Ωστόσο, η χρήση του ViT-με βάση το μοντέλο CLIP κάνει δύσκολο για το μοντέλο να επιτύχει κατανόηση εικόνας σε επίπεδο pixel, ένα πρόβλημα που ενισχύεται περαιτέρω σε μικρές περιοχές. Επιπλέον, η υπολογιστική υπερφόρτωση που συνδέεται με την αρχιτεκτονική ViT εμποδίζει τη δυνατότητα αύξησης της ανάλυσης εισαγωγής εικόνας.

Για να αντιμετωπιστούν οι προκλήσεις, το πλαίσιο του Osprey υλοποιεί einen κωδικοποιητή CLIP με βάση το CNN ως κωδικοποιητή οράσεως στη δομή του. Παραδοσιακά, τα μοντέλα CLIP με βάση το CNN έχουν δείξει αξιοσημείωτες γενικές ικανότητες σε διάφορες αναλύσεις εισαγωγής όταν συγκρίνονται με τα μοντέλα CLIP με βάση το ViT. Η υλοποίηση ενός κωδικοποιητή CLIP με βάση το CNN δημιουργεί χώρο για γρήγορη συλλογή και αποτελεσματική εκπαίδευση χωρίς να επηρεάζει την απόδοση του μοντέλου. Επιπλέον, ένας κωδικοποιητής CLIP με βάση το CNN είναι ικανός να παράγει πολλαπλά χαρακτηριστικά χαρτών που το πλαίσιο χρησιμοποιεί trực tiếp για εξαγωγή χαρακτηριστικών σε κάθε περιοχή αντικειμένου.

Εξαγωγέας Οπτικών με Μάσκα

Σε αντίθεση με τα υπάρχοντα μοντέλα που χρησιμοποιούν σπάνιες περιοχές-κουτί ως εισαγωγή αναφοράς, το πλαίσιο του Osprey χρησιμοποιεί λεπτομερείς περιοχές-μάσκα για να υλοποιήσει αναπαραστάσεις αντικειμένων. Το μοντέλο του Osprey χρησιμοποιεί einen εξαγωγέα οπτικών με μάσκα για να καταγράψει χαρακτηριστικά pixel-level μέσα σε κάθε περιοχή αντικειμένου. Ο εξαγωγέας οπτικών με μάσκα κωδικοποιεί χαρακτηριστικά οράσεως σε επίπεδο μάσκας και συλλέγει επίσης τις χωρικές πληροφορίες θέσης κάθε περιοχής.

Για να το υλοποιήσει, ο Osprey χρησιμοποιεί πρώτα τα πολλαπλά επίπεδα χαρακτηριστικών εικόνας που παράγονται από τον κωδικοποιητή οράσεως για να υλοποιήσει την оперασία pool με μάσκα και για κάθε επίπεδο χαρακτηριστικών, το πλαίσιο συλλέγει όλα τα χαρακτηριστικά που βρίσκονται μέσα στη μάσκα. Το μοντέλο στη συνέχεια κωδικοποιεί τα χαρακτηριστικά σε διάφορα επίπεδα, περνώντας κάθε χαρακτηριστικό через einen γραμμικό προβολικό слой που παράγει ενσωματώσεις περιοχής-επίπεδου και συνδυάζει πολλαπλά χαρακτηριστικά με τη διεξαγωγή einer σύγκρισης. Το μοντέλο στη συνέχεια χρησιμοποιεί einen MLP слой για να παράγει το οπτικό token με μάσκα. Επιπλέον, ο Osprey διατηρεί τη χωρική γεωμετρία της περιοχής αντικειμένου, κωδικοποιώντας τη σχέση θέσης pixel-level με την υλοποίηση einer δυαδικής μάσκας για κάθε περιοχή αντικειμένου. Στο τέλος, ο Osprey περιλαμβάνει το οπτικό token με μάσκα και τα αντίστοιχα χωρικά tokens για κάθε ενσωμάτωση περιοχής-μάσκας.

Tokenization LLM

Όπως αναφέρθηκε νωρίτερα, το μοντέλο εξάγει τις ενσωματώσεις εικόνας-επίπεδου μιας εικόνας, εισάγωντας την σε einen προ-εκπαιδευμένο κωδικοποιητή οράσεως με βάση το CNN. Για πληροφορίες γλώσσας, το μοντέλο πρώτα χρησιμοποιεί pre-εκπαιδευμένους tokenizers LLM για να tokenize ακολουθίες κειμένου και στη συνέχεια προβάλλει αυτές τις tokenized ακολουθίες κειμένου σε ενσωματώσεις κειμένου. Για περιοχές-μάσκα, το μοντέλο ορίζει einen ειδικό token ως αναπλήρωμα και στη συνέχεια αντικαθιστά με einen χωρικό token μαζί με einen token με μάσκα. Όταν το μοντέλο αναφέρεται σε μια περιοχή αντικειμένου στο κείμενο εισαγωγής, προσαρτά το αναπλήρωμα μετά από το όνομα της περιοχής, επιτρέποντας στις περιοχές-μάσκα να αναμιχθούν με κείμενο καλά, οδηγώντας σε πλήρεις προτάσεις χωρίς το tokenization χώρο. Επιπλέον, εκτός από τις οδηγίες χρήστη, το μοντέλο περιλαμβάνει également einen πρόθεμα-πρόθεμα, einen ειδικό token που χρησιμεύει ως αναπλήρωμα, ο οποίος στη συνέχεια αντικαθιστά με την ενσωμάτωση εικόνας-επίπεδου του κωδικοποιητή οράσεως. Τέλος, το πλαίσιο διασπάει τα tokens οπτικών-περιοχής και εικόνας μαζί με tokens κειμένου και τα εισάγει στο μεγάλο γλώσσας μοντέλο για να κατανοήσει τις οδηγίες χρήστη και την εικόνα με διαφορετικές περιοχές στο αντικείμενο.

Osprey: Τρία-Στάδιο Εκπαιδευτική Διαδικασία

Το πλαίσιο του Osprey υλοποιεί μια εκπαιδευτική διαδικασία τριών σταδίων, στην οποία κάθε σταδιο εκπαιδευτικής διαδικασίας είναι εποπτευμένο από την ελαχιστοποίηση της απώλειας προβλέψεως επόμενου token.

Στάδιο 1: Εκπαίδευση Ευθυγράμμισης Εικόνας-Κειμένου

Στο πρώτο σταδιο, το πλαίσιο του Osprey υλοποιεί τον κωδικοποιητή CLIP με βάση το CNN για να εκπαιδεύσει τα χαρακτηριστικά εικόνας-επίπεδου και τον συνδετή γλώσσας-εικόνας για να εκπαιδεύσει το μοντέλο για ευθυγράμμιση εικόνας-κειμένου. Στο πρώτο σταδιο, το πλαίσιο χρησιμοποιεί τρία στοιχεία: einen προ-εκπαιδευμένο μεγάλο γλώσσας μοντέλο, einen προ-εκπαιδευμένο κωδικοποιητή οράσεως και einen projector εικόνας-επίπεδου. Το πλαίσιο επίσης υλοποιεί einen MLP слой για να χρησιμεύσει ως ο συνδετή γλώσσας-εικόνας που βοηθά στην ενίσχυση των πολυμεταβλητών γεννητικών ικανοτήτων του Osprey.

Στάδιο 2: Προ-Εκπαίδευση Ευθυγράμμισης Μάσκας-Κειμένου

Στο δεύτερο σταδιο, ο Osprey φορτώνει τα βάρη που εκπαιδεύτηκαν στο πρώτο σταδιο και υλοποιεί τον εξαγωγέα οπτικών με μάσκα για να καταγράψει χαρακτηριστικά περιοχής-περιοχής. Στο δεύτερο σταδιο, το πλαίσιο εκπαιδεύει μόνο τον εξαγωγέα οπτικών με μάσκα για να ευθυγραμμίσει ενσωματώσεις γλώσσας με χαρακτηριστικά περιοχής-μάσκας. Επιπλέον, το μοντέλο συλλέγει ζευγάρια μασκών-κειμένου και σύντομο κείμενο από δεδομένα περιοχής-επίπεδου και δεδομένα αντικειμένου-επίπεδου και τα μετατρέπει σε δεδομένα οδηγιών-ακολουθίας για να εκπαιδεύσει περαιτέρω το μοντέλο.

Στάδιο 3: Τελική Εργασία-Εκπαίδευση

Στο τρίτο και τελευταίο σταδιο, το μοντέλο σταθεροποιεί τα βάρη του κωδικοποιητή οράσεως και εκπαιδεύει το μεγάλο γλώσσας μοντέλο, τον εξαγωγέα χαρακτηριστικών περιοχής-μάσκας και τον projector εικόνας-επίπεδου. Ο основικός στόχος της εκπαίδευσης στο τρίτο σταδιο είναι να επεκτείνει την ικανότητα του μοντέλου να ακολουθεί οδηγίες χρήστη με ακρίβεια και να εκτελεί εργασίες κατανόησης περιοχής-περιοχής σε επίπεδο pixel.

Μετά την υλοποίηση των τριών σταδίων εκπαίδευσης, το πλαίσιο του Osprey είναι ικανό να κατανοήσει σύνθετες σκηνές που ορίζονται από οδηγίες χρήστη και με βάση περιοχές-περιοχής σε επίπεδο pixel.

Osprey: Πειραματικά Αποτελέσματα

Για να αξιολογήσει την απόδοση του, οι dévelopπεurs του Osprey διεξάγουν eine σειρά πειραμάτων για να δείξουν τις ικανότητες του μοντέλου σε εργασίες ταξινόμησης, αναγνώρισης περιοχής-περιοχής και σύνθετων περιγραφών.

Ανοιχτή Λεξική Τομής

Ο основικός στόχος της ανοιχτής λεξικής τομής είναι να παράγει αναγνώριση περιοχής-μάσκας και την αντίστοιχη κατηγορία ρητά. Για να επιτύχει ανοιχτή λεξική τομή, ο Osprey πρώτα χρησιμοποιεί μια εισαγωγή κειμένου, ακολουθούμενη από την υλοποίηση των ground-truth περιοχών-μάσκας για inference μοντέλου για να αξιολογήσει την απόδοση του μοντέλου σε εργασίες αναγνώρισης ανοιχτής λεξικής. Με βάση την απάντηση που παράγεται από το πολυμεταβλητό μεγάλο γλώσσας μοντέλο, ο Osprey υπολογίζει τη σεμαντική ομοιότητα μεταξύ της λεξικής λίστας και της εξόδου κάθε dataset. Η ακόλουθη εικόνα συγκρίνει τον Osprey με τα state-of-the-art πολυμεταβλητά μεγάλα γλώσσας μοντέλα.

Όπως μπορεί να παρατηρηθεί, το πλαίσιο του Osprey υπερβαίνει τα υπάρχοντα μοντέλα με σημαντική διαφορά και στα δύο dataset Cityscapes και ADE20K-150. Τα αποτελέσματα δείχνουν την ικανότητα του Osprey να υπερβαίνει τις υπάρχουσες προσεγγίσεις και να επιτυγχάνει ροβούστα κατανόηση και αναγνώριση σε λεπτομερείς περιοχές αντικειμένου.

Ταξινόμηση Αντικειμένου Αναφοράς

Στην εργασία ταξινόμησης αντικειμένου αναφοράς, το μοντέλο πρέπει να ταξινομήσει το αντικείμενο μέσα σε μια συγκεκριμένη περιοχή μιας εικόνας. Για να αξιολογήσει την ικανότητα ταξινόμησής του, το πλαίσιο του Osprey χρησιμοποιεί δύο μετρικές σεμαντικής συναφής, συμπεριλαμβανομένων του Seμαντικού IoU ή S-IoU και του Seμαντικού Ομοιότητας ή SS. Ο Seμαντικός IoU αντιπροσωπεύει την επικάλυψη των λέξεων μεταξύ των ground-truth και των προβλεπόμενων ετικετών, ενώ η σεμαντική ομοιότητα μετράει την ομοιότητα μεταξύ των προβλεπόμενων και ground-truth ετικετών σε ένα σεμαντικό χώρο. Η ακόλουθη εικόνα δείχνει την απόδοση του Osprey στην εργασία ταξινόμησης αντικειμένου αναφοράς όταν συγκρίνεται με μοντέλα που χρησιμοποιούν προσεγγίσεις σε επίπεδο κουτιού και εικόνας.

Λεπτομερής Περιγραφή Περιοχής

Στην εργασία λεπτομερούς περιγραφής περιοχής, το μοντέλο αξιολογεί την απόδοση του σε ικανότητες ακολουθίας οδηγιών και λεπτομερών περιγραφών περιοχής μαζί με άλλες προσεγγίσεις σε επίπεδο περιοχής. Το μοντέλο τυχαία επιλέγει μια εισαγωγή inference από μια λίστα προκαθορισμένων εισαγωγών και χρησιμοποιεί το πλαίσιο LLM GPT-4 για να μετρήσει την ποιότητα της απάντησης που παράγεται από το μοντέλο σε σχέση με τις εισαγωγές περιοχής αναφοράς. Χρησιμοποιώντας την πipeline γεννήτριας οδηγιών, το μοντέλο γεννάει ερωτήσεις και ζητάει απαντήσεις από το GPT-4, μετά από τις οποίες το LLM αξιολογεί την ορθότητα της σεμαντικής και την ακρίβεια της κατανόησης αναφοράς. Η ακόλουθη πίνακας δείχνει την απόδοση του Osprey σε σχέση με τα state-of-the-art μοντέλα στην εργασία λεπτομερούς περιγραφής περιοχής.

Περιοχή-Επίπεδο Λεζάντα

Το πλαίσιο του Osprey υπερβαίνει επίσης τις υπάρχουσες προσεγγίσεις στην εργασία περιοχής-επίπεδου λεζάντας, με τα αποτελέσματα να περιέχονται στην ακόλουθη εικόνα.

Τελικές Σκέψεις

Σε αυτό το άρθρο, συζητήσαμε τον Osprey, μια μέθοδο εκπαίδευσης οδηγιών με μάσκα με основικό στόχο την επέκταση των MLLMs, ενσωματώνοντας λεπτομερείς περιοχές-μάσκα στις οδηγίες γλώσσας για να επιτύχει κατανόηση οπτικής-γλώσσας σε επίπεδο pixel. Για να επιτύχει τον στόχο του, το πλαίσιο του Osprey δημιουργεί ένα σύνολο δεδομένων περιοχής-κειμένου με πάνω από 700 χιλιάδες δείγματα και εισάγει αναπαράσταση pixel-level σε LLM για να σχεδιάσει ένα μοντέλο οπτικής-γλώσσας. Το πλαίσιο του Osprey στοχεύει στην ενίσχυση των MLLMs για κατανόηση σε επίπεδο pixel και, υλοποιώντας einen κωδικοποιητή CLIP με βάση το CNN και einen εξαγωγέα οπτικών με μάσκα, ο Osprey αποκτά την ικανότητα να κατανοήσει εικόνες σε επίπεδο περιοχής-περιοχής και αντικειμένου.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.