Μοντέλα και πλατφόρμες AI
Φέρρετ: ΥπερIOR Απόδοση στις Αναφορές και Εναρμονίσεις Κατανομής
Η ενεργοποίηση της χωρικής κατανόησης στα μοντέλα μάθησης γλώσσας-οράματος παραμένει μια βασική πρόκληση έρευνας. Αυτή η κατανόηση υποστηρίζει δύο κρίσιμες ικανότητες: την εναρμονίωση και την αναφορά. Η αναφορά επιτρέπει στο μοντέλο να ερμηνεύσει με ακρίβεια τη σημασιολογία συγκεκριμένων περιοχών, ενώ η εναρμονίωση αφορά τη χρήση σημασιολογικών περιγραφών για την τοποθεσία αυτών των περιοχών.
Οι dévelopπεurs έχουν εισαγάγει το Φέρρετ, ένα Πολυμορφικό Μεγάλο Γλωσσικό Μοντέλο (MLLM), ικανό να κατανοήσει χωρικές αναφορές σε οποιαδήποτε λεπτότητα ή σχήμα σε μια εικόνα και να εναρμονίσει ανοιχτές λεξικές περιγραφές με ακρίβεια. Το Φέρρετ χρησιμοποιεί μια νέα υβριδική αναπαράσταση που συνδυάζει συνεχείς οπτικές λειτουργίες με διακριτές συντεταγμένες για να αναπαραστήσει περιοχές εικόνας. Ο χωρικά-ευαίσθητος οπτικός δειγματολήπτης του χειρίζεται τη μεταβλητή σπανιότητα σε σχήματα, επιτρέποντάς του να επεξεργαστεί ποικίλες εισόδους περιοχών όπως ελεύθερες μορφές, ορθογώνιες περιοχές και σημεία.
Η προσέγγιση του Φέρρετ του επιτρέπει να ξεχωρίσει στις κλασικές εναρμονίσεις και αναφορές και να υπερβεί άλλα MLLM στις τοποθεσιών-απαιτούμενες και περιοχών-βασισμένες πολυμορφικές επικοινωνίες. Αυτό το άρθρο διεισδύει στην αρχιτεκτονική και τη μεθοδολογία του Φέρρετ, υπογραμμίζοντας την εντυπωσιακή του απόδοση σε διάφορες πολυμορφικές γλωσσικές εργασίες. Ας εξερευνήσουμε αυτό περαιτέρω.
Φέρρετ: ΥπερIOR Απόδοση στις Αναφορές και Εναρμονίσεις Κατανομής
Η αναφορά σε ένα μοντέλο είναι μια ικανότητα που επιτρέπει στο μοντέλο να κατανοήσει τη σημασιολογία συγκεκριμένων περιοχών με ακρίβεια, ενώ η εναρμονίωση κάνει απαραίτητο για το μοντέλο να χρησιμοποιήσει τις δεδομένες σημασιολογικές περιγραφές για να τοποθετήσει τις περιοχές. Αν και μπορεί να διαφέρουν στις αντίστοιχες εργασίες, και η αναφορά και η εναρμονίωση έχουν την ίδια θεμελιώδη έννοια: ευθυγράμμιση χωρικής σημασιολογίας και πληροφοριών. Ωστόσο, παρά το γεγονός ότι μοιράζονται την ίδια έννοια, τα υπάρχοντα μοντέλα μαθαίνουν την εναρμονίωση και την αναφορά ατομικά. Αν και η μέθοδος λειτουργεί, θέτει ένα εμπόδιο στην επίτευξη ανθρώπινων ικανοτήτων,既然 τα ανθρώπινα όντα μπορούν να μαθαίνουν από μια εργασία και να εφαρμόσουν τις γνώσεις σε άλλες εργασίες ομαλά και να ενσωματώσουν τις ικανότητες εναρμονίσης/αναφοράς με το λόγο και την καθημερινή συνομιλία. Το πλαίσιο Φέρρετ λαμβάνει έμπνευση από το παραπάνω αναφερθέν κενό στα υπάρχοντα πλαίσια MLLM και μελετά τρεις κύριες ερωτήσεις:
- Πώς να ενοποιήσετε τις ικανότητες εναρμονίσης και αναφοράς στο πλαίσιο, και πώς θα επωφεληθούν η μια από την άλλη;
- Οι άνθρωποι χρησιμοποιούν ποικίλους τύπους περιοχών όπως κουτί, σημείο, σβήσιμο, ελεύθερες μορφές για αναφορά; Πώς να αναπαραστήσετε αυτές τις ποικίλες περιοχές;
- Πώς να κάνετε την εναρμονίωση και την αναφορά να ακολουθούν οδηγίες, να είναι ανθεκτικές και ανοιχτές-λεξικές, που είναι κρίσιμες για τις πρακτικές και πραγματικές εφαρμογές τους;
Το πλαίσιο Φέρρετ είναι ένα νέο αναφορά και εναρμονίωση Πολυμορφικό Μεγάλο Γλωσσικό Μοντέλο που επιχειρεί να στοχεύσει αυτές τις ερωτήσεις. Το πλαίσιο Φέρρετ επιλέγει ένα Πολυμορφικό Μεγάλο Γλωσσικό Μοντέλο ως βάση του, λόγω των εξαιρετικών παγκόσμιων οπτικών και γλωσσικών κατανόησης ικανοτήτων. Επιπλέον, για να ενοποιήσει τις ικανότητες εναρμονίσης και αναφοράς, το πλαίσιο Φέρρετ αντιπροσωπεύει τις συντεταγμένες των περιοχών σε φυσική γλώσσα αριθμητική μορφή. Ωστόσο, στην πράξη, είναι αναποτελεσματικό να χρησιμοποιηθούν συντεταγμένες για να αναπαραστήσουν ποικίλες σχήματα περιοχών όπως σβήσιμα, γραμμές ή σύνθετα πολύγωνα, καθώς αυτά τα σχήματα είναι κρίσιμα για την ενίσχυση της ακρίβειας και της ανθρώπινης-μοντέλου αλληλεπίδρασης. Για να αντιμετωπίσουν αυτό το πρόβλημα, το πλαίσιο Φέρρετ χρησιμοποιεί einen χωρικά-ευαίσθητο οπτικό δειγματολήπτη που αποκτά τις οπτικές περιοχές για περιοχές ανεξάρτητα από το σχήμα, διαπραγματευόμενο με τη μεταβλητή σπανιότητα σε αυτά τα σχήματα. Το πλαίσιο συνδυάζει τις συνεχείς οπτικές λειτουργίες με διακριτές συντεταγμένες για να αναπαραστήσει τις οπτικές περιοχές στην είσοδο, οδηγώντας στη δημιουργία μιας υβριδικής αναπαράστασης περιοχής στο Φέρρετ.
Το πλαίσιο Φέρρετ εφαρμόζει τις παραπάνω μεθόδους για να επιλύσει εισόδους που αναμιγνύουν ελεύθερο κείμενο με αναφερόμενες περιοχές και είναι σε θέση να γεννήσει ομαλά τις συντεταγμένες για κάθε εναρμονίσιμο αντικείμενο με την παραγωγή κειμένου για να εναρμονίσει τα αναφερόμενα αντικείμενα στην έξοδο. Κάνοντας così, το Φέρρετ είναι το πρώτο πλαίσιο που επεξεργάζεται ελεύθερες μορφές εισόδου περιοχών σε Πολυμορφικά Μεγάλα Γλωσσικά Μοντέλα. Επιπλέον, το πλαίσιο Φέρρετ απορροφά εξαιρετικές ανοιχτές-λεξικές ικανότητες χωρικής τοποθεσίας και κατανόησης, επιτρέποντάς του να επιτύχει υπεροχή απόδοση όταν αξιολογείται σε συμβατικές εναρμονίσεις και αναφορές.
Προχωρώντας, το πλαίσιο Φέρρετ λαμβάνει έμπνευση από τρία υπάρχοντα πλαίσια AI, συμπεριλαμβανομένων των Πολυμορφικών Μεγάλων Γλωσσικών Μοντέλων, MLLM για Αναφορά και Εναρμονίωση, και Ενοποίηση Εναρμονίσης και VL Κατανόησης.
Η εισαγωγή των Μεγάλων Γλωσσικών Μοντέλων, συμπεριλαμβανομένων των GPT, DALL-E, PaLM, LLaMA, και BLOOM, έχει αλλάξει το τοπίο στην έρευνα NLP, οδηγώντας σε σημαντικές προόδους των πολυμορφικών γλωσσικών μοντέλων. Τα προηγούμενα πολυμορφικά γλωσσικά μοντέλα εστιάζονταν κυρίως στην μεγάλη κλίμακα εικόνα-κείμενο γεννήτρια με κάποια αξιοσημείωτα παραδείγματα όπως PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3, και PaLI-X. Ωστόσο, από τότε που το πλαίσιο Flamingo πέτυχε την αποτελεσματική ενοποίηση των LLM με ένα προ-εκπαιδευμένο CLIP εικόνας κωδικοποιητή μέσω δια-κλειδωμένων μπλοκ προσοχής, οδηγώντας σε αξιοσημείωτες πολυμορφικές ικανότητες few-shot μάθησης. Η τρέχουσα έρευνα ψάχνει για τρόπους να χρησιμοποιήσει προ-εκπαιδευμένα μεγάλα γλωσσικά μοντέλα για οπτική οδηγία-συντονισμό με αξιοσημείωτα παραδείγματα όπως MiniGPT-4, Otter, InstructBLIP και άλλα. Τι περισσότερο είναι ότι πρόσφατα μοντέλα όπως Emu και GILL έχουν δείξει αξιοσημείωτη επιτυχία στην χρήση MLLM για γεννήτρια εικόνας και ανάκτηση εικόνας. Το πλαίσιο Φέρρετ αναφέρεται επίσης σε προηγούμενη έρευνα που εστιάζει στην ενοποίηση κειμένου και ορθογώνιου εξόδου για Μοντέλα Γλώσσας-Όρασης.
Φέρρετ: Μεθοδολογία και Αρχιτεκτονική
Υβριδικές-Περιοχικές Αναπαραστάσεις
Σημείο, κουτί και ελεύθερες μορφές είναι οι τρεις κυρίαρχες μορφές που ένα γλωσσικό μοντέλο χρησιμοποιεί όταν αναφέρεται σε συγκεκριμένες περιοχές. Από τη μια πλευρά, το σημείο και το κουτί μπορούν να αναπαρασταθούν με ακρίβεια από συντεταγμένες, χαρτογραφώντας ελεύθερες μορφές είναι ένα chút πιο δύσκολο, καθώς οι ελεύθερες μορφές είναι ποικίλες. Όντας ποικίλες, οι ελεύθερες μορφές μπορούν να περιλαμβάνουν eine ευρεία ποικιλία περιοχών, συμπεριλαμβανομένων μασκών, πολυγώνων και σβησιμάτων. Η χρήση συντεταγμένων για να αναπαραστήσει ελεύθερες μορφές είναι μια σύνθετη εργασία που εμποδίζει την ικανότητα του μοντέλου να μάθει να καθιερώσει μια συσχέτιση μεταξύ των περιοχών και των αντίστοιχων συντεταγμένων. Επιπλέον, η χρήση συντεταγμένων για ελεύθερες μορφές είναι υπολογιστικά εκτεταμένη και ασαφής.
Για να αντιμετωπίσουν αυτό το πρόβλημα και να γενικεύσουν σε όλες τις τρεις μορφές, το πλαίσιο Φέρρετ προτείνει μια υβριδική περιοχική αναπαράσταση που συνδυάζει συνεχείς οπτικές λειτουργίες με διακριτές συντεταγμένες για να αναπαραστήσει μια συγκεκριμένη περιοχή.

Για συνεχείς οπτικές λειτουργίες, για μια δεδομένη περιοχή, το πλαίσιο Φέρρετ κατασκευάζει πρώτα μια 2D δυαδική μάσκα του ίδιου μεγέθους με την εικόνα και σημειώνει μια τιμή 1 μέσα στην στοχευμένη περιοχή, ενώ αναθέτει μια τιμή 0 έξω από την περιοχή. Το μοντέλο εξάγει τη δυαδική μάσκα μαζί με την εξαγμένη οπτική χαρτογραφία και στη συνέχεια την στέλνει στον χωρικά-ευαίσθητο οπτικό δειγματολήπτη.
Αρχιτεκτονική
Η αρχιτεκτονική του μοντέλου Φέρρετ αποτελείται από τρεις κύριους компоненты
- Έναν κωδικοποιητή εικόνας για την εξαγωγή εικόνας-εμφυτευμάτων.
- Έναν χωρικά-ευαίσθητο οπτικό δειγματολήπτη για την εξαγωγή περιφερειακών συνεχών λειτουργιών.
- Ένα Μεγάλο Γλωσσικό Μοντέλο για να μοντελοποιήσει κείμενο, εικόνα και περιοχή-χαρακτηριστικά ομαλά.

Η εικόνα πρώτα τροφοδοτείται στον προ-εκπαιδευμένο οπτικό κωδικοποιητή για την εξαγωγή εικόνας-εμφυτευμάτων. Για εισόδους κειμένου, το πλαίσιο πρώτα χρησιμοποιεί einen προ-εκπαιδευμένο LLM κωδικοποιητή για να κωδικοποιήσει την κειμενική ακολουθία και στη συνέχεια προβάλλει αυτά τα tokens σε κείμενο-εμφυτεύματα. Για αναφερόμενες περιοχές, το Φέρρετ προσθέτει einen ειδικό token και τις συντεταγμένες ως αναπλήρωμα για συνεχείς λειτουργίες μετά το όνομα της περιοχής. Αν το όνομα της περιοχής είναι άγνωστο ή είναι σύνθετο για περιγραφή λόγω της ένταξης πολλών αντικειμένων, το πλαίσιο χρησιμοποιεί απλά την περιοχή ή το όνομα της περιοχής.
Ένα από τα κύρια προβλήματα που αντιμετωπίζουν οι αναφερόμενες περιοχές είναι ότι το σχήμα τους μπορεί να είναι πολύ μεταβλητό, σημαίνοντας ότι possono να έχουν διαφορετικά σχήματα και δεν περιορίζονται μόνο σε ορθογώνιες περιοχές ή σημεία. Οι αναφερόμενες περιοχές με ιδιόρρυθμα σχήματα δεν possono να επεξεργαστούν με παραδοσιακές μεθόδους όπως η επεξεργασία Grid-με βάση την προσοχή ή τις τεχνικές συσπάθισης. Για να αντιμετωπίσουν αυτό το πρόβλημα, το πλαίσιο Φέρρετ προτείνει einen χωρικά-ευαίσθητο οπτικό δειγματολήπτη. Για μια δεδομένη εξαγμένη οπτική χαρτογραφία με μια δυαδική μάσκα περιοχής, το μοντέλο Φέρρετ πρώτα τυχαία δειγματοληψία N αριθμός σημείων μέσα στη δυαδική μάσκα περιοχής.
Για κάθε μεμονωμένο σημείο, το μοντέλο αποκτά την λειτουργία του με την εκτέλεση της διخطής διαδικασίας. Τα N σημεία στη συνέχεια τροφοδοτούνται σε μια σειρά από μπλοκ, με κάθε ένα από αυτά να περνάει από τρεις διαφορετικές φάσεις: δειγματοληψία, συλλογή και συσπάθισης. Στη φάση δειγματοληψίας, ένας σταθερός αριθμός σημείων δειγματοληψίας από N αριθμό διαθέσιμων σημείων χρησιμοποιώντας τον αλγόριθμο FPS ή Farthest Point Sampling που εγγυάται επαρκή κάλυψη. Στη δεύτερη φάση, για κάθε δείγμα σημείο, το πλαίσιο αναζητά τα k πλησιέστερα γειτονικά σημεία από το πλήθος των διαθέσιμων N σημείων. Για κάθε ομάδα, το μοντέλο στη συνέχεια συνδυάζει τις λειτουργίες του δείγματος σημείου με τις λειτουργίες των γειτονικών σημείων. Στην τελική φάση, το πλαίσιο Φέρρετ διεξάγει μια μέγιστη συσπάθισης για να συνδυάσει τις k γειτονικές λειτουργίες σε μια λειτουργία για να αναπαραστήσει το δείγμα σημείο. Εκτελώντας αυτά τα τρία βήματα, το πλαίσιο Φέρρετ μένει με λιγότερα σημεία αλλά με χώρο λειτουργιών με υψηλότερη πυκνότητα, καθώς δεν μόνο ενσωματώνει τις λειτουργίες των τοπικών γειτόνων αλλά και τις σχετικές θέσεις τους.
GPT-Βοηθούμενη Οπτική Δεδομένων Γεννήτρια
Η διάλογος-οδηγία-συντονισμός Δεδομένων είναι κρίσιμης σημασίας για τα Πολυμορφικά Μεγάλα Γλωσσικά Μοντέλα, καθώς δεν μόνο βοηθούν στην μετατροπή των υφιστάμενων συνόλων δεδομένων με προτύπου, αλλά cũng βοηθούν το μοντέλο να κατανοήσει την ανθρώπινη πρόθεση και να γεννήσει μια κατάλληλη απάντηση. Η πλειοψηφία των MLLM χρησιμοποιεί μια μέθοδο few-shot-πρόσκλησης για να αποκτήσει οπτική οδηγία-συντονισμό δεδομένων, όπου το μοντέλο παρέχει κειμενική περιγραφή των σκηνών στην εικόνα μαζί με ανθρώπινες-σημειωμένες διαλόγους ως few-shot-παραδείγματα. Ωστόσο, οι υπάρχουσες μεθόδους οδηγίας-συντονισμού εστιάζουν κυρίως στην περιγραφή της ολόκληρης εικόνας χωρίς να καθορίζουν χωρικές-σχετικές πληροφορίες ρητά. Το πλαίσιο Φέρρετ τονίζει την περιοχή-βασισμένη γνώση για να συλλέξει αναφορά και εναρμονίωση οδηγία-συντονισμό δεδομένων σε τρία βήματα.
- Επιπλέον της χρήσης παγκόσμιων legend και αντικειμένων, το πλαίσιο παρέχει συμβολική σκηνική περιγραφή που περιγράφει τη φυσική σχέση μεταξύ των περιοχών-legend και αντικειμένων, καθώς και τις συντεταγμένες τους.
- Για ανθρώπινες-σημειωμένες διαλόγους, το πλαίσιο προσθέτει συντεταγμένες μετά από εναρμονίσιμα αντικείμενα ή περιοχές είτε στην είσοδο είτε στην έξοδο είτε και στα δύο, με τους διαλόγους να εστιάζουν κυρίως σε συγκεκριμένες περιοχές που βοηθούν στην πρόσκληση του γλωσσικού μοντέλου να ακολουθήσει παρόμοιους ρυθμούς για τη νέα διάλογο-γεννήτρια.
- Μπορεί να είναι δυνατό ότι ο διάλογος που παράγεται από το πλαίσιο μπορεί να μην ακολουθήσει τις κανόνες και τα πρότυπα όπως καθορίζονται από τα few-shot-παραδείγματα και τα συστήματος-πρόσκλησης. Για να αντιμετωπίσουν αυτό το πρόβλημα, το πλαίσιο χρησιμοποιεί ξανά ένα γλωσσικό μοντέλο για να βελτιώσει τους διαλόγους που παράγονται από το μοντέλο αρχικά.
Χωρική Αρνητική Ορυκτολογία
Προηγούμενη έρευνα έχει δείξει ότι τα πολυμορφικά μεγάλα γλωσσικά μοντέλα έχουν υψηλή πιθανότητα να ονειροφανταστούν όταν απαντούν σε ερωτήσεις Ναι ή Όχι. Για να διασφαλιστεί ότι το μοντέλο Φέρρετ δεν ονειροφανταστεί σε παρόμοιες συνθήκες, το πλαίσιο χρησιμοποιεί μια χωρική-αρνητική ορυκτολογία με Image-Conditioned Κατηγορία-Τοποθεσία και Semantics-Conditioned Κατηγορία-Τοποθεσία. Και οι δύο μεθόδους ζητούν από το μοντέλο να τοποθετήσει συγκεκριμένες κατηγορίες αντικειμένων που επιτρέπουν στο μοντέλο να αναγνωρίσει την απουσία ορισμένων αντικειμένων στην εικόνα.
Φέρρετ: Αποτελέσματα και Πειραματισμός
Για να αναλύσει την απόδοσή του, το πλαίσιο Φέρρετ αξιολογείται σε συμβατικές εναρμονίσεις και αναφορές-βελτιώσεις μετά από αυτό το πλαίσιο αξιολογείται σε μια πιο σύνθετη πολυμορφική συνομιλία-εργασία και δοκιμάζει τις αναφορά-και-εναρμονίωση ικανότητές του.

Η ικανότητα του μοντέλου να κατανοήσει την αναφορά αξιολογείται από το πόσο ακριβώς το μοντέλο μπορεί να κατανοήσει τη σημασιολογία της αναφερόμενης περιοχής, όταν μια αναφερόμενη περιοχή στην εικόνα ή η ερώτηση. Για να μετρήσει την ακρίβεια του μοντέλου, τα αντικείμενα, τα πιο βασικά σημασιολογικά, θεωρούνται πρώτα, καθώς είναι не μόνο θεμελιώδη αλλά και εύκολα να οριστούν. Για να μιμηθούν την ανθρώπινη-ποικιλία, το πλαίσιο αντικαθιστά τη θέση του αντικειμένου μέσα στην εικόνα με μια ελεύθερη μορφή, ένα κουτί και ένα σημείο. Για μια ελεύθερη μορφή, το μοντέλο τυχαία γεννάει γραμμές μέσα στο Ground Truth αντικείμενο για προσομοίωση. Για ένα κουτί, το πλαίσιο Φέρρετ χρησιμοποιεί το ground truth-ορθογώνιο κουτί που παρέχεται από το LVIS-συνιστώσα. Τέλος, για ένα σημείο, το μοντέλο τυχαία δειγματοληψία ένα σημείο μέσα στο ground truth-αντικείμενο που είναι επίσης κοντά στα όρια του ground truth-αντικειμένου. Τα αποτελέσματα στις τρεις τύπους αναφοράς παρουσιάζονται στην ακόλουθη εικόνα.

Το πλαίσιο Φέρρετ δείχνει αξιοσημείωτη απόδοση σε αναφορικές συνομιλίες-εργασίες, ανοίγοντας το δρόμο για την ενσωμάτωση με διαφορετικές οπτικές μάθησης-εργασίες, ιδιαίτερα αυτές με εναρμονίσεις-εξόδους. Για να αξιολογήσει την εναρμονίση-ικανότητά του, το πλαίσιο Φέρρετ πρώτα υποβάλλεται σε βελτιώσεις οπτικής εναρμονίσης με ένα γεννητικό παράδειγμα. Το πλαίσιο αξιολογεί στη συνέχεια την ικανότητά του σε εναρμονίσεις-λεζάντες-εργασίες για να μετρήσει την ευθυγράμμιση μεταξύ των περιοχών και των λέξεων.
Στις οπτικές εναρμονίσεις-εργασίες, το πλαίσιο στοχεύει να εναρμονίσει γλωσσικές ερωτήσεις σε ευθυγραμμισμένες περιοχές της εικόνας, και όπως μπορεί να φανεί στην ακόλουθη εικόνα, το πλαίσιο Φέρρετ δείχνει αξιοσημείωτη απόδοση σε όλα τα βελτιστοποιημένα-παράδειγματα, και η απόδοση είναι συγκρίσιμη με αυτή που επιτυγχάνεται από εξειδικευμένες μεθόδους-συντονισμού.

Για τις εναρμονίσεις-λεζάντες-εργασίες, το μοντέλο πρέπει να γεννήσει μια λεζάντα και στη συνέχεια να εναρμονίσει τις γεννημένες ουσιαστικές φράσεις σε περιοχές εικόνας. Η τελική πρόβλεψη του μοντέλου αποτελείται από τρεις συνιστώσες: οπτικές περιοχές ως κουτιά, κείμενο-λεζάντες και εναρμονίσεις-ευθυγραμμίσεις μεταξύ κουτιών και λέξεων. Τα αποτελέσματα παρουσιάζονται στην ακόλουθη εικόνα, και όπως μπορεί να φανεί, το πλαίσιο παραδίδει απόδοση συγκρίσιμη με τις μεθόδους-κράτους-της-τέχνης.

Τέλος, η πολυμορφική συνομιλία είναι μια από τις πιο επιθυμητές ικανότητες σε ένα MLLM, και τα υπάρχοντα MLLM αξιολογούν κυρίως λεπτομερείς περιγραφές, συνομιλία και σύνθετο λόγο με το γλωσσικό μοντέλο ως κριτή. Ωστόσο, поскольку δεν υπάρχει σύνολο δεδομένων που αξιολογεί την πολυμορφική συνομιλία με υποχρεωτικές αναφορές ή εναρμονίσεις-ενέργειες, αφήνει ένα κενό. Για να γεφυρώσει αυτό το κενό, το πλαίσιο Φέρρετ καλύπτει τρεις περιοχή-βασισμένες ερωτήσεις για να αξιολογήσει τις αναφορά-και-εναρμονίωση ικανότητές του σε πολυμορφικές συνομιλίες-εργασίες. Τα αποτελέσματα παρουσιάζονται στην ακόλουθη εικόνα.

Τέλος, το πλαίσιο Φέρρετ συγκρίνεται απευθείας με το κράτους-της-τέχνης GPT-πλαίσιο, και τα αποτελέσματα παρουσιάζονται παρακάτω.

Τελικές Σκέψεις
Σε αυτό το άρθρο, έχουμε μιλήσει για το Φέρρετ, ένα πολυμορφικό μεγάλο γλωσσικό μοντέλο που δείχνει αξιοσημείωτη εναρμονίση και αναφορά-ικανότητες. Το πλαίσιο Φέρρετ μπορεί να αναφερθεί σε περιοχές εικόνας ανεξάρτητα από το σχήμα, και μπορεί να εναρμονίσει κείμενο που προβλέπεται από το μοντέλο αυτόματα. Το Φέρρετ χρησιμοποιεί einen χωρικά-ευαίσθητο οπτικό δειγματολήπτη ικανό να χειρίζεται τη μεταβλητή σπανιότητα που εμφανίζεται από διαφορετικά σχήματα για να εξαγάγει τις συνεχείς λειτουργίες των ποικίλων περιοχών. Ως αποτέλεσμα, το πλαίσιο Φέρρετ μπορεί να εισάγει ποικίλες περιοχές-εισόδους, συμπεριλαμβανομένων ελεύθερων μορφών, ορθογώνιων περιοχών και σημείων.












