Μοντέλα και πλατφόρμες AI
Mini-Gemini: Βελτιώνοντας τα Πολυ-Μοντέλα Γλωσσικών Μοντέλων Όρασης
Οι προόδους στα μεγάλα γλωσσικά μοντέλα έχουν επιταχύνει σημαντικά την ανάπτυξη της φυσικής επεξεργασίας γλωσσών, ή NLP. Η εισαγωγή του πλαισίου μετασχηματιστή αποδείχθηκε ότι ήταν ένα ορόσημο, διευκολύνοντας την ανάπτυξη μιας νέας σειράς γλωσσικών μοντέλων, συμπεριλαμβανομένων των OPT και BERT, τα οποία εμφανίζουν βαθιά γλωσσική κατανόηση. Επιπλέον, η δημιουργία των GPT, ή Γενητικών Προ-εκπαιδευμένων Μετασχηματιστών μοντέλων, εισήγαγε ένα νέο παράδειγμα με αυτο-αναγωγική μοντελοποίηση και καθιέρωσε một ισχυρό μέθοδο για γλωσσική πρόβλεψη και γενεσιουργό. Η έλευση γλωσσικών μοντέλων όπως GPT-4, ChatGPT, Mixtral, LLaMA και άλλα έχει επιταχύνει περαιτέρω την εξέλιξη, με κάθε μοντέλο να επιδεικνύει βελτιωμένη απόδοση σε εργασίες που涉ρούν複잡η γλωσσική επεξεργασία. Μεταξύ των υφιστάμενων μεθόδων, η εκπαίδευση οδηγιών έχει αναδυθεί ως κλειδί τεχνική για την εξευγενισμένη έξοδο των προ-εκπαιδευμένων μεγάλων γλωσσικών μοντέλων, και η ενσωμάτωση αυτών των μοντέλων με ειδικά εργαλεία για οπτικές εργασίες έχει υπογραμμίσει την προσαρμοστικότητά τους και άνοιξε πόρτες για μελλοντικές εφαρμογές. Αυτές οι εφαρμογές εκτείνονται πολύ πέρα από την παραδοσιακή κειμενο-βασισμένη επεξεργασία των LLMs για να περιλαμβάνουν πολυ-μοντέλα αλληλεπιδράσεις.
Επιπλέον, η σύγκλιση της φυσικής επεξεργασίας γλωσσών και μοντέλων οπτικής έχει δώσει ζωή στα VLMs, ή Γλωσσικά Μοντέλα Όρασης, τα οποία συνδυάζουν γλωσσικά και οπτικά μοντέλα για να επιτύχουν δια-μοντέλα κατανόηση και ικανότητες συλλογισμού. Η ενσωμάτωση και η εμφάνιση οπτικών και γλωσσικών μοντέλων έχουν παίξει κρίσιμο ρόλο στην προώθηση εργασιών που απαιτούν και γλωσσική επεξεργασία και οπτική κατανόηση. Η εμφάνιση επαναστατικών μοντέλων όπως CLIP έχει περαιτέρω γεφυρώσει το χάσμα μεταξύ οπτικών εργασιών και γλωσσικών μοντέλων, αποδεικνύοντας τη δυνατότητα και τη πρακτικότητα των δια-μοντέλων εφαρμογών. Περισσότερα πρόσφατα πλαισια όπως LLaMA και BLIP χρησιμοποιούν εξειδικευμένα δεδομένα οδηγιών για να δημιουργήσουν αποτελεσματικές στρατηγικές που αποδεικνύουν τις ισχυρές ικανότητες του μοντέλου. Επιπλέον, η συνδυασμός μεγάλων γλωσσικών μοντέλων με εικόνες εξόδου είναι ο στόχος πρόσφατων πολυ-μοντέλων ερευνών, με πρόσφατες μεθόδους που μπορούν να παρακάμψουν την άμεση γενεσιουργό χρησιμοποιώντας την προσέγγιση ανάκτησης εικόνων για να παράγουν εικόνες εξόδου και διακεκομμένα κείμενα.

Με αυτά τα δεδομένα, και παρά την ταχεία πρόοδο των γλωσσικών μοντέλων όρασης που διευκολύνουν τη βασική συλλογιστική και οπτική διάλογο, vẫn υπάρχει ένα σημαντικό χάσμα απόδοσης μεταξύ προηγμένων μοντέλων όπως GPT-4 και γλωσσικών μοντέλων όρασης. Το Mini-Gemini είναι μια προσπάθεια να στενέψει το χάσμα που υπάρχει μεταξύ γλωσσικών μοντέλων όρασης και πιο προηγμένων μοντέλων με την εκμετάλλευση του δυναμικού των VLMs για καλύτερη απόδοση από τρεις πλευρές: VLM-οδηγούμενη γενεσιουργό, υψηλής ποιότητας δεδομένα και υψηλής ανάλυσης οπτικά σύμβολα. Για να βελτιώσει τα οπτικά σύμβολα, το πλαισίο Mini-Gemini προτείνει να χρησιμοποιήσει einen επιπλέον οπτικό κωδικοποιητή για υψηλής ανάλυσης αναθεώρηση χωρίς αύξηση του αριθμού οπτικών συμβόλων. Το πλαισίο Mini-Gemini κατασκευάζει επίσης ένα υψηλής ποιότητας σύνολο δεδομένων σε μια προσπάθεια να προωθήσει την ακριβή κατανόηση εικόνων και γενεσιουργό συλλογισμού. Συνολικά, το πλαισίο Mini-Gemini προσπαθεί να εκμεταλλευτεί το δυναμικό των γλωσσικών μοντέλων όρασης και να ενδυναμώσει τα υφιστάμενα πλαισια με οπτική συλλογιστική, κατανόηση και γενεσιουργό ικανότητες ταυτόχρονα. Αυτό το άρθρο έχει ως στόχο να καλύψει το πλαισίο Mini-Gemini σε βάθος, και εξετάζουμε το μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου μαζί με τη σύγκρισή του με πλαισια κατάσταση τέχνης. Έτσι, ας ξεκινήσουμε.
Mini-Gemini: Βελτιώνοντας τα Πολυ-Μοντέλα Γλωσσικών Μοντέλων Όρασης
Με τα χρόνια, τα μεγάλα γλωσσικά μοντέλα έχουν εξελιχθεί, και τώρα διαθέτουν αξιοσημείωτες πολυ-μοντέλες ικανότητες, και γίνονται ένα απαραίτητο μέρος των τρεχουσών γλωσσικών μοντέλων όρασης. Ωστόσο, υπάρχει ένα χάσμα μεταξύ της πολυ-μοντέλων απόδοσης των μεγάλων γλωσσικών μοντέλων και γλωσσικών μοντέλων όρασης με πρόσφατη έρευνα που ψάχνει για τρόπους να συνδυάσει την όραση με μεγάλα γλωσσικά μοντέλα χρησιμοποιώντας εικόνες και βίντεο. Για οπτικές εργασίες, η ανάλυση εικόνας είναι ένα κρίσιμο στοιχείο για να περιγράψει το περιβάλλον με ελάχιστες οπτικές ψευδαισθήσεις. Για να γεφυρώσει το χάσμα, οι ερευνητές αναπτύσσουν μοντέλα για να βελτιώσουν την οπτική κατανόηση στα τρέχοντα γλωσσικά μοντέλα όρασης, και δύο από τις πιο κοινοί προσεγγίσεις είναι: αύξηση της ανάλυσης και αύξηση του αριθμού οπτικών συμβόλων. Αν και η αύξηση του αριθμού οπτικών συμβόλων με υψηλής ανάλυσης εικόνες βελτιώνει την οπτική κατανόηση, η βελτίωση συχνά συνοδεύεται με αυξημένες υπολογιστικές απαιτήσεις και συνδεδεμένα έξοδα, ιδιαίτερα όταν επεξεργάζονται πολλές εικόνες. Επιπλέον, οι ικανότητες των υφιστάμενων μοντέλων, η ποιότητα των υφιστάμενων δεδομένων και η εφαρμοσιμότητα παραμένουν ανεπαρκείς για μια επιταχυνόμενη διαδικασία ανάπτυξης, αφήνοντας τους ερευνητές με την ερώτηση, “πώς να επιταχύνουν την ανάπτυξη γλωσσικών μοντέλων όρασης με αποδεκτά έξοδα”;
Το πλαισίο Mini-Gemini είναι μια προσπάθεια να απαντήσει στην ερώτηση, καθώς προσπαθεί να εξερευνήσει το δυναμικό των γλωσσικών μοντέλων όρασης από τρεις πλευρές: VLM-οδηγούμενη γενεσιουργό ή επεκτάσεις εφαρμογών, υψηλής ποιότητας δεδομένα και υψηλής ανάλυσης οπτικά σύμβολα. Πρώτα, το πλαισίο Mini-Gemini υλοποιεί μια αρχιτεκτονική ConvNet για να παράγει υψηλής ανάλυσης υποψήφιους αποτελεσματικά, βελτιώνοντας τα οπτικά λεπτομέρειες ενώ διατηρεί τον αριθμό οπτικών συμβόλων για το μεγάλο γλωσσικό μοντέλο. Το πλαισίο Mini-Gemini συνδυάζει δημόσια διαθέσιμα υψηλής ποιότητας σύνολα δεδομένων σε μια προσπάθεια να βελτιώσει την ποιότητα των δεδομένων και ενσωματώνει αυτές τις βελτιώσεις με πλαισια κατάσταση τέχνης και γενεσιουργά μοντέλα με μια προσπάθεια να βελτιώσει την απόδοση των VLMs και να βελτιώσει την εμπειρία του χρήστη. Η πολύπλευρη στρατηγική που υλοποιείται από το πλαισίο Mini-Gemini του επιτρέπει να εξερευνήσει κρυφές ικανότητες γλωσσικών μοντέλων όρασης και επιτύχει σημαντικές προόδους με φανερές περιορισμένες πόρους.

Γενικά, το πλαισίο Mini-Gemini απασχολεί ένα οποιοδήποτε σε οποιοδήποτε παράδειγμα, καθώς είναι ικανό να χειρίζεται τόσο κείμενο όσο και εικόνες ως είσοδο και έξοδο. Συγκεκριμένα, το πλαισίο Mini-Gemini εισάγει μια αποτελεσματική διαδικασία για την ενίσχυση οπτικών συμβόλων για εικόνες εισόδου και διαθέτει ένα σύστημα διπλού κωδικοποιητή που αποτελείται από δύο κωδικοποιητές: ο πρώτος κωδικοποιητής είναι για υψηλής ανάλυσης εικόνες, ενώ ο δεύτερος κωδικοποιητής είναι για χαμηλής ποιότητας οπτική ενσωμάτωση. Κατά τη διάρκεια της εκτίμησης, οι κωδικοποιητές λειτουργούν σε ένα μηχανισμό προσοχής, όπου ο κωδικοποιητής χαμηλής ανάλυσης παράγει οπτικές ερωτήσεις, ενώ ο κωδικοποιητής υψηλής ανάλυσης παρέχει κλειδιά και τιμές για αναφορά. Για να αυξήσει την ποιότητα των δεδομένων, το πλαισίο Mini-Gemini συλλέγει και παράγει περισσότερα δεδομένα με βάση δημόσιους πόρους, συμπεριλαμβανομένων οδηγιών, δεδομένων σχετικών με τη γενεσιουργό και υψηλής ανάλυσης απαντήσεων, με την αύξηση του αριθμού και της ποιότητας να βελτιώνει την συνολική απόδοση και τις ικανότητες του μοντέλου.
Mini-Gemini : Μεθοδολογία και Αρχιτεκτονική
Στην καρδιά του, το πλαισίο Mini-Gemini είναι концепτουαλικά απλό και αποτελείται από τρία компонента.
- Το πλαισίο απασχολεί διπλούς οπτικούς κωδικοποιητές για να παρέχει χαμηλής ανάλυσης οπτικές ενσωματώσεις και υψηλής ανάλυσης υποψήφιους.
- Το πλαισίο προτείνει να υλοποιήσει εξόρυξη πληροφοριών σε επίπεδο patch μεταξύ χαμηλής ανάλυσης οπτικών ερωτήσεων και υψηλής ανάλυσης περιοχών.
- Το πλαισίο Mini-Gemini χρησιμοποιεί ένα μεγάλο γλωσσικό μοντέλο για να συνδυάσει κείμενο με εικόνες για cả γενεσιουργό και κατανόηση ταυτόχρονα.
Διπλοί Οπτικοί Κωδικοποιητές
Το πλαισίο Mini-Gemini μπορεί να επεξεργαστεί τόσο κείμενο όσο και εικόνες εισόδου, με την επιλογή να τις χειρίζεται είτε ξεχωριστά είτε σε συνδυασμό. Όπως φαίνεται στην επόμενη εικόνα, το πλαισίο Mini-Gemini ξεκινά τη διαδικασία χρησιμοποιώντας διπλή.interpolate για να παράγει μια χαμηλής ανάλυσης εικόνα από την αντίστοιχη υψηλής ανάλυσης εικόνα.

Το πλαισίο επεξεργάζεται αυτές τις εικόνες και τις κωδικοποιεί σε μια πολλαπλή οπτική ενσωμάτωση σε δύο παράλληλες οπτικές ροές. Περισσότερο συγκεκριμένα, το πλαισίο Mini-Gemini διατηρεί την παραδοσιακή διαδικασία για τις ροές χαμηλής ανάλυσης και απασχολεί einen CLIP-προεκπαιδευμένο Οπτικό Μετασχηματιστή για να κωδικοποιήσει τις οπτικές ενσωματώσεις, διευκολύνοντας το μοντέλο να διατηρήσει τη μακρά σχέση μεταξύ οπτικών patch για τις επόμενες αλληλεπιδράσεις στα μεγάλα γλωσσικά μοντέλα. Για τις ροές υψηλής ανάλυσης, το πλαισίο Mini-Gemini υιοθετεί τον κωδικοποιητή CNN ή τον κωδικοποιητή Convolutional Neural Networks για την προσαρμοστική και αποτελεσματική επεξεργασία υψηλής ανάλυσης εικόνας.
Εξόρυξη Πληροφοριών σε Επίπεδο Patch
Με τους διπλούς οπτικούς κωδικοποιητές να παράγουν τις ενσωματώσεις χαμηλής ανάλυσης και τα χαρακτηριστικά υψηλής ανάλυσης, το πλαισίο Mini-Gemini προτείνει να υλοποιήσει εξόρυξη πληροφοριών σε επίπεδο patch με στόχο να επεκτείνει το δυναμικό των γλωσσικών μοντέλων όρασης με ενισχυμένα οπτικά σύμβολα. Για να διατηρήσει τον αριθμό οπτικών συμβόλων για αποτελεσματικότητα στα μεγάλα γλωσσικά μοντέλα, το πλαισίο Mini-Gemini λαμβάνει τις ενσωματώσεις χαμηλής ανάλυσης ως ερώτηση και προσπαθεί να ανακτήσει σχετικές οπτικές ενδείξεις από τα υποψήφια υψηλής ανάλυσης, με το πλαισίο να λαμβάνει το χαρακτηριστικό υψηλής ανάλυσης ως κλειδί και τιμή.

Όπως φαίνεται στην παραπάνω εικόνα, η формуλή ενσωματώνει τη διαδικασία της βελτίωσης και της σύνθεσης οπτικών ενδείξεων, η οποία οδηγεί στη γενεσιουργό προηγμένων οπτικών συμβόλων για την επόμενη επεξεργασία του μεγάλου γλωσσικού μοντέλου. Η διαδικασία διασφαλίζει ότι το πλαισίο είναι ικανό να περιορίσει την εξόρυξη για κάθε ερώτηση στην αντίστοιχη υπο-περιοχή του χαρακτηριστικού υψηλής ανάλυσης, με τον πixel-πληθικό αριθμό χαρακτηριστικών, οδηγώντας σε αυξημένη αποτελεσματικότητα. Λόγω αυτής της σχεδίασης, το πλαισίο Mini-Gemini είναι ικανό να εξάγει τα χαρακτηριστικά υψηλής ανάλυσης χωρίς να αυξήσει τον αριθμό οπτικών συμβόλων και να διατηρήσει μια ισορροπία μεταξύ υπολογιστικής εφικτότητας και πλούτου λεπτομερειών.
Γενεσιουργό Κειμένου και Εικόνας
Το πλαισίο Mini-Gemini συνδυάζει τα οπτικά σύμβολα και τα σύμβολα κειμένου εισόδου ως είσοδο στα μεγάλα γλωσσικά μοντέλα για αυτο-αναγωγική γενεσιουργό. Αντιθέτως με τα παραδοσιακά γλωσσικά μοντέλα όρασης, το πλαισίο Mini-Gemini υποστηρίζει μόνο κείμενο καθώς και κείμενο-εικόνα γενεσιουργό ως είσοδο και έξοδο, δηλαδή οποιοδήποτε σε οποιοδήποτε συλλογισμό, και είναι το αποτέλεσμα αυτής της εξαιρετικής εικόνας-κειμένου κατανόησης και συλλογιστικής ικανότητας, το Mini-Gemini είναι ικανό να παράγει υψηλής ποιότητας εικόνες. Αντιθέτως με πρόσφατες εργασίες που επικεντρώνονται στο χάσμα τομέα μεταξύ κειμένου ενσωματώσεων της γενεσιουργούς και μεγάλων γλωσσικών μοντέλων, το πλαισίο Mini-Gemini προσπαθεί να βελτιώσει το χάσμα στον τομέα των γλωσσικών οδηγιών μεταφράζοντας τις οδηγίες χρήστη σε υψηλής ποιότητας οδηγίες που παράγουν контекст-релέβαντ εικόνες σε μοντέλα διασποράς. Επιπλέον, για μια καλύτερη κατανόηση της εξειδικευμένης εκπαίδευσης και της δια-μοντέλων ευθυγράμμισης, το πλαισίο Mini-Gemini συλλέγει δείγματα από δημόσια διαθέσιμα υψηλής ποιότητας σύνολα δεδομένων και χρησιμοποιεί το πλαισίο GPT-4 turbo για να κατασκευάσει ένα σύνολο δεδομένων 13K για να υποστηρίξει την γενεσιουργό εικόνας.

Mini-Gemini : Πειράματα και Αποτελέσματα
Για να αξιολογήσει την απόδοσή του, το πλαισίο Mini-Gemini υλοποιείται με το προ-εκπαιδευμένο πλαισίο ConvNext-L για τον κωδικοποιητή υψηλής ανάλυσης και με einen CLIP-προεκπαιδευμένο Οπτικό Μετασχηματιστή για τον κωδικοποιητή χαμηλής ανάλυσης. Για να διασφαλίσει την αποτελεσματικότητα της εκπαίδευσης, το πλαισίο Mini-Gemini διατηρεί τους δύο οπτικούς κωδικοποιητές σταθερούς και βελτιώνει τους.projectors της εξόρυξης πληροφοριών σε όλα τα στάδια και βελτιώνει το μεγάλο γλωσσικό μοντέλο κατά τη διάρκεια της εκπαίδευσης οδηγιών.

Ο παρακάτω πίνακας συγκρίνει την απόδοση του πλαισίου Mini-Gemini με τα μοντέλα κατάσταση τέχνης σε διάφορες ρυθμίσεις και λαμβάνει επίσης υπόψη ιδιωτικά μοντέλα. Όπως φαίνεται, το Mini-Gemini υπερέχει των υφιστάμενων πλαισίων σε ένα ευρύ φάσμα μεγάλων γλωσσικών μοντέλων σταθερά σε κανονική ανάλυση και αποδεικνύει υπεροχή απόδοση όταν ρυθμίζεται με το Gemma-2B στην κατηγορία των αποτελεσματικών μοντέλων. Επιπλέον, όταν χρησιμοποιούνται μεγαλύτερα μεγάλα γλωσσικά μοντέλα, η κλιμακωσιμότητα του πλαισίου Mini-Gemini είναι φανερή.

Για να αξιολογήσει την απόδοσή του σε υψηλής ανάλυσης και επεκτάσεις οπτικών συμβόλων, τα πειράματα πραγματοποιούνται με μέγεθος εισόδου 672 για τον κωδικοποιητή χαμηλής ανάλυσης και 1536 για τον οπτικό κωδικοποιητή. Όπως αναφέρθηκε νωρίτερα, ο κύριος σκοπός του κωδικοποιητή υψηλής ανάλυσης είναι να προσφέρει υψηλής ανάλυσης υποψήφια πληροφορίες. Όπως φαίνεται, το πλαισίο Mini-Gemini παρέχει υπεροχή απόδοση όταν συγκρίνεται με τα μοντέλα κατάσταση τέχνης.

Επιπλέον, για να αξιολογήσει την οπτική κατανόηση του πλαισίου Mini-Gemini σε πραγματικές ρυθμίσεις, οι développers εφαρμόζουν το μοντέλο σε eine ποικιλία συλλογιστικών και κατανόησης εργασιών όπως φαίνεται στην επόμενη εικόνα. Όπως φαίνεται, το πλαισίο Mini-Gemini είναι ικανό να λύσει ένα ευρύ φάσμα σύνθετων εργασιών χάρη στην υλοποίηση της εξόρυξης πληροφοριών σε επίπεδο patch και υψηλής ποιότητας δεδομένων. Αλλά αυτό που είναι πιο εντυπωσιακό είναι το γεγονός ότι το πλαισίο Mini-Gemini αποδεικνύει μια έντονη προσθήκη λεπτομερειών που εκτείνεται πέρα από την απλή αναγνώριση ικανότητα και περιγράφει περίπλοκα στοιχεία με λεπτομέρεια.


Η επόμενη εικόνα παρέχει μια綜合τική αξιολόγηση των γενεσιουργών ικανοτήτων του πλαισίου Mini-Gemini.

Όταν συγκρίνεται με πρόσφατα μοντέλα όπως ChatIllusion και AnyGPT, το πλαισίο Mini-Gemini αποδεικνύει ισχυρότερη πολυ-μοντέλα κατανόηση ικανότητα, επιτρέποντάς του να παράγει κείμενο σε εικόνα λεζάντες που συμφωνούν με τις οδηγίες εισόδου καλύτερα και οδηγεί σε εικόνα σε κείμενο απαντήσεις με ισχυρότερη εννοιολογική ομοιότητα. Αυτό που είναι πιο εντυπωσιακό είναι το γεγονός ότι το πλαισίο Mini-Gemini αποδεικνύει αξιοσημείωτη ικανότητα στην παραγωγή υψηλής ποιότητας περιεχομένου χρησιμοποιώντας πολυ-μοντέλα ανθρώπινες οδηγίες μόνο με κειμενική εκπαίδευση δεδομένων, μια ικανότητα που αποδεικνύει την ισχυρή σημασιολογική ερμηνεία και εικόνας-κειμένου ευθυγράμμισης ικανότητες του Mini-Gemini.

Τελικές Σκέψεις
Σε αυτό το άρθρο, μιλήσαμε για το Mini-Gemini, ένα δυνατό και ροϊκό πλαισίο για πολυ-μοντέλα γλωσσικών μοντέλων όρασης. Ο κύριος στόχος του πλαισίου Mini-Gemini είναι να εκμεταλλευτεί το κρυφό δυναμικό των γλωσσικών μοντέλων όρασης χρησιμοποιώντας υψηλής ποιότητας δεδομένα, στρατηγική σχεδίαση του πλαισίου και επεκτάσεις λειτουργικής εμβέλειας. Το Mini-Gemini είναι μια προσπάθεια να στενέψει το χάσμα που υπάρχει μεταξύ γλωσσικών μοντέλων όρασης και πιο προηγμένων μοντέλων με την εκμετάλλευση του δυναμικού των VLMs για καλύτερη απόδοση από τρεις πλευρές: VLM-οδηγούμενη γενεσιουργό, υψηλής ποιότητας δεδομένα και υψηλής ανάλυσης οπτικά σύμβολα. Για να βελτιώσει τα οπτικά σύμβολα, το πλαισίο Mini-Gemini προτείνει να χρησιμοποιήσει einen επιπλέον οπτικό κωδικοποιητή για υψηλής ανάλυσης αναθεώρηση χωρίς αύξηση του αριθμού οπτικών συμβόλων. Το πλαισίο Mini-Gemini κατασκευάζει επίσης ένα υψηλής ποιότητας σύνολο δεδομένων σε μια προσπάθεια να προωθήσει την ακριβή κατανόηση εικόνων και γενεσιουργό συλλογισμού. Συνολικά, το πλαισίο Mini-Gemini προσπαθεί να εκμεταλλευτεί το δυναμικό των γλωσσικών μοντέλων όρασης και να ενδυναμώσει τα υφιστάμενα πλαισια με οπτική συλλογιστική, κατανόηση και γενεσιουργό ικανότητες ταυτόχρονα.












