Μοντέλα και πλατφόρμες AI
LLaVA-UHD: Αποτελεσματική Ανίχνευση Εικόνων σε Οποιοδήποτε Αναλογία και Υψηλή Ανάλυση
Η πρόσφατη πρόοδος και εξέλιξη των Μεγάλων Μοντέλων Γλώσσας έχει καταγράψει σημαντική αύξηση στις ικανότητες συλλογισμού, κατανόησης και αλληλεπίδρασης οπτικής-γλώσσας. Τα σύγχρονα πλαίσια επιτυγχάνουν αυτό το αποτέλεσμα προβάλλοντας οπτικά σήματα στα Μεγάλα Μοντέλα Γλώσσας για να τα κάνουν ικανά να ερμηνεύουν οπτικά τον κόσμο, μια ποικιλία σεναρίων που βασίζονται σε στρατηγικές οπτικής κωδικοποίησης. Ωστόσο, οι εικόνες του πραγματικού κόσμου δεν περιέχουν μόνο μια ευρεία γκάμα σεναρίων, αλλά επίσης ποικίλλουν σημαντικά σε όρους ανάλυσης και αναλογίας, δημιουργώντας σημαντικές προκλήσεις για τα Μεγάλα Μοντέλα Γλώσσας σε διάφορους τομείς και εργασίες. Για να αντιμετωπιστούν οι σημαντικές διακυμάνσεις που προκαλούνται από τις εικόνες του πραγματικού κόσμου, τα σύγχρονα μεγάλα μοντέλα γλώσσας ανιχνεύουν εικόνες σε χαμηλή ανάλυση, π.χ. 224×224, και σε σταθερή αναλογία, π.χ. 1:1. Αν και η συμβιβαστική λύση να παραμείνει σε χαμηλή ανάλυση και σταθερή αναλογία αυξάνει την γενικευσιμότητα του Μεγάλου Μοντέλου Γλώσσας σε εφαρμογές του πραγματικού κόσμου, συχνά οδηγεί σε πολύ θολές εικόνες και σε σοβαρή παραμόρφωση σχήματος. Η συμβιβαστική λύση επηρεάζει σημαντικά τις ικανότητες των μεγάλων μοντέλων πολλαπλών modalities ή LMMs, ιδίως εκείνων που είναι βελτιστοποιημένα για λεπτομερείς εργασίες, συμπεριλαμβανομένης της οπτικής αναγνώρισης χαρακτήρων και της κατανόησης μικρών αντικειμένων. Επιπλέον, поскольку η ανάλυση και η αναλογία προκαθοριστούν, τα μοντέλα μπορούν μόνο να κάνουν τις καλύτερες εκτιμήσεις για τις θολές εικόνες, οδηγώντας σε hallουcinations του μοντέλου, μια κατάσταση στην οποία το μοντέλο παράγει κειμενικές απαντήσεις που δεν βασίζονται στα γεγονότα στις εικόνες.
Σε αυτό το άρθρο, θα μιλήσουμε για το LLaVA-UHD, μια καινοτόμο προσέγγιση που πρώτα λαμβάνει τα πλαίσια LLaVA-1.5 και GPT-4V ως αντιπροσωπευτικά παραδείγματα και προσπαθεί να αποκαλύψει τις συστηματικές ελαττώματα που είναι εδραιωμένα στην στρατηγική οπτικής κωδικοποίησης. Το πλαίσιο LLaVA-UHD, ένα μοντέλο πολλαπλών modalities, είναι μια προσπάθεια να αντιμετωπιστούν οι προκλήσεις. Το πλαίσιο LLaVA-UHD μπορεί να ανιχνεύσει εικόνες σε υψηλή ανάλυση καθώς και σε οποιαδήποτε αναλογία. Το πλαίσιο LLaVA-UHD είναι δομημένο γύρω από τρία βασικά στοιχεία. Πρώτον, μια στρατηγική μερικής κωδικοποίησης εικόνων που διαιρεί εικόνες σε μικρότερα, μεταβλητά μεγέθη, για να αυξήσει την αποδοτικότητα και να επεκτείνει την κωδικοποίηση. Δεύτερον, ένα μοντέλο συμπίεσης που συμπιέζει τους οπτικούς συμβολισμούς που παράγονται από τους οπτικούς κωδικοποιητές. Τέλος, ένα σχήμα που οργανώνει τους συμβολισμούς των εικόνων για τα μεγάλα μοντέλα γλώσσας. Οι綜合 πειράματα δείχνουν ότι το πλαίσιο LLaVA-UHD μπορεί να υπερβεί τα καλύτερα μεγάλα μοντέλα γλώσσας σε 9 διαγωνισμούς. Επιπλέον, χρησιμοποιώντας μόνο το 94% της υπολογιστικής δύναμης, το πλαίσιο LLaVA-UHD μπορεί να υποστηρίξει εικόνες με 6 φορές μεγαλύτερη ανάλυση, π.χ. 672×1088.
LLaVA-UHD: Αποτελεσματική Ανίχνευση Εικόνων σε Οποιοδήποτε Αναλογία και Υψηλή Ανάλυση
Ο συλλογισμός, η κατανόηση και η αλληλεπίδραση οπτικής-γλώσσας έχουν καταγράψει σημαντική πρόοδο, κυρίως λόγω της πρόσφατης ώθησης για τα Μεγάλα Μοντέλα Γλώσσας. Σε σύγχρονα πλαίσια, το ίδιο επιτυγχάνεται με την προβολή οπτικών σημάτων στα Μεγάλα Μοντέλα Γλώσσας για να τα κάνουν ικανά να ερμηνεύουν οπτικά τον κόσμο, μια ποικιλία σεναρίων που βασίζονται σε στρατηγικές οπτικής κωδικοποίησης. Η διαφορά σε σενάριο αντικατοπτρίζει μια στενή κάλυψη των Μεγάλων Μοντέλων Γλώσσας σε διάφορους τομείς και εργασίες, ενώ η διαφορά σε ανάλυση και αναλογία αποκαλύπτει τις μεγάλες διακυμάνσεις εντός των εικόνων του πραγματικού κόσμου, οι οποίες είναι δύσκολο να χειριστούν. Σε αντίθεση με την μικρή κλίμακα που μειώνει τις διακυμάνσεις, τα μοντέλα μετά το BERT αντιμετωπίζουν τη σημασία από την χαμηλή ανάλυση (π.χ. για το LLaVA-UHD είναι 224×224) των εικόνων με μια σταθερή αναλογία, 1:1, για να δώσουν εικόνες του πραγματικού κόσμου. Αν και η συμβιβαστική λύση να παραμείνει σε χαμηλή ανάλυση και σταθερή αναλογία είναι χρήσιμη για την εξασφάλιση της γενικευσιμότητας του Μεγάλου Μοντέλου Γλώσσας σε εφαρμογές του πραγματικού κόσμου, συχνά οδηγεί σε πολύ θολές εικόνες και σε σοβαρή παραμόρφωση σχήματος. Η συμβιβαστική λύση επηρεάζει σημαντικά τις ικανότητες των μεγάλων μοντέλων πολλαπλών modalities ή LMMs, ιδίως εκείνων που είναι βελτιστοποιημένα για λεπτομερείς εργασίες, συμπεριλαμβανομένης της οπτικής αναγνώρισης χαρακτήρων και της κατανόησης μικρών αντικειμένων. Επειδή η ανάλυση και η αναλογία προκαθοριστούν, τα μοντέλα μπορούν μόνο να κάνουν τις καλύτερες εκτιμήσεις για τις θολές εικόνες, οδηγώντας σε hallουcinations του μοντέλου, μια κατάσταση στην οποία το μοντέλο παράγει κειμενικές απαντήσεις που δεν βασίζονται στα γεγονότα στις εικόνες.
Υπάρχουν δύο основные λόγοι για τους οποίους τα βασικά μοντέλα LMMs δεν μπορούν να ανιχνεύσουν εικόνες με υψηλή ανάλυση και ποικίλες αναλογίες. Πρώτον, поскольку οι οπτικοί κωδικοποιητές προ-εκπαιδεύονται σε σταθερές αναλογίες, είναι δύσκολο για το μοντέλο και τον κωδικοποιητή να αντιμετωπίσουν εικόνες με διαφορετικές αναλογίες και ανάλυση, επηρεάζοντας σημαντικά την προσαρμοστικότητα του μοντέλου. Δεύτερον, η κωδικοποίηση εικόνων υψηλής ανάλυσης απευθείας με τη χρήση οπτικών μετασχηματιστών συνδέεται με σημαντικό υπολογιστικό κόστος σε σχέση με το μέγεθος των εικόνων. Επιπλέον, το κόστος υπολογισμού μπορεί να είναι σημαντικά υψηλότερο για το Μεγάλο Μοντέλο Γλώσσας να επεξεργαστεί ένα lớn αριθμό οπτικών συμβολισμών για εικόνες υψηλής ανάλυσης, επηρεάζοντας σημαντικά την συνολική αποδοτικότητα του μοντέλου. Για να αντιμετωπιστούν αυτές οι προκλήσεις, το LLaVA-UHD, ένα μεγάλο μοντέλο πολλαπλών modalities που ανιχνεύει εικόνες υψηλής ανάλυσης και οποιασδήποτε αναλογίας, λαμβάνει τα πλαίσια LLaVA-1.5 και GPT-4V ως αντιπροσωπευτικά παραδείγματα και προσπαθεί να αποκαλύψει τα συστηματικά ελαττώματα που είναι εδραιωμένα στην στρατηγική οπτικής κωδικοποίησης.
Η παραπάνω εικόνα αντικατοπτρίζει τα πειραματικά αποτελέσματα του GPT-4V στην αναγνώριση του αριθμού των αντικειμένων σε μια εικόνα. Στο κέντρο του, το πλαίσιο LLaVA-UHD έχει τρία στοιχεία. Πρώτον, μια στρατηγική μερικής κωδικοποίησης εικόνων που διαιρεί εικόνες σε μικρότερα, μεταβλητά μεγέθη, για να αυξήσει την αποδοτικότητα και να επεκτείνει την κωδικοποίηση. Σε αντίθεση με τα πρόσφατα LLMs που ταιριάζουν εικόνες σε vài σταθερές αναλογίες, τα μεταβλητά μεγέθη που παράγονται από το LLaVA-UHD επιτρέπουν πλήρη προσαρμοστικότητα στις εικόνες υψηλής ανάλυσης χωρίς να παραμορφώνουν σχήματα, να μετετρέπει ή να γεμίζουν. Δεύτερον, το μοντέλο συμπιέζει τους οπτικούς συμβολισμούς με ένα στρώμα συμπίεσης σε μέτριο μέγεθος, μειώνοντας σημαντικά τον υπολογισμό για τα LLMs. Τέλος, το μοντέλο οργανώνει τους συμπιεσμένους συμβολισμούς σε ένα σχήμα για να ενημερώσει τις θέσεις των εικόνων στο Μεγάλο Μοντέλο Γλώσσας.
LLaVA-UHD: Μεθοδολογία και Αρχιτεκτονική
Βασισμένα στις γνώσεις από κάποια πιλοτικά πειράματα για τη μελέτη των υφιστάμενων πλαισίων, συμπεριλαμβανομένων των GPT-4V και LLaVA-1.5, το πλαίσιο LLaVA-UHD εφαρμόζει μια τρι-στιβάδα αρχιτεκτονική όπως φαίνεται στην ακόλουθη εικόνα.

Πρώτον, μια στρατηγική μερικής κωδικοποίησης εικόνων που διαιρεί εικόνες σε μικρότερα, μεταβλητά μεγέθη, για να αυξήσει την αποδοτικότητα και να επεκτείνει την κωδικοποίηση. Δεύτερον, ένα στρώμα συμπίεσης που συμπιέζει τους οπτικούς συμβολισμούς που παράγονται από τους οπτικούς κωδικοποιητές. Τέλος, ένα σχήμα που οργανώνει τους συμβολισμούς των εικόνων για τα μεγάλα μοντέλα γλώσσας. Ας δούμε πιο λεπτομερώς αυτά τα στοιχεία.
Μερική Οπτική Κωδικοποίηση
Μια κοινή προσέγγιση για την αντιμετώπιση εικόνων υψηλής ανάλυσης με διαφορετική αναλογία είναι να.interpolate τις θέσεις των οπτικών μετασχηματιστών ή ViT στο στόχο για άμεση κωδικοποίηση ως ένα σύνολο. Ωστόσο, η εφαρμογή αυτής της προσέγγισης συχνά συνοδεύεται με υψηλό υπολογιστικό κόστος και προβλήματα εκτός του συνόλου που οδηγούν σε περαιτέρω υποβάθμιση της απόδοσης. Για να αντιμετωπίσουμε αυτή την πρόκληση, το πλαίσιο LLaVA-UHD παρουσιάζει μια μερική οπτική κωδικοποίηση που διαιρεί εικόνες σε μικρότερα, μεταβλητά μεγέθη, όπου το σχήμα κάθε μεγέθους είναι πολύ κοντά στο πρότυπο προ-εκπαίδευσης του οπτικού μετασχηματιστή. Λόγω της χρήσης μεταβλητών μεγεθών, το LLaVA-UHD μπορεί να επιτύχει πλήρη προσαρμοστικότητα στις εικόνες υψηλής ανάλυσης χωρίς να εφαρμόζει οποιαδήποτε παραμόρφωση σχήματος ή γεμίσματος. Επιπλέον, ο основικός στόχος της στρατηγικής μερικής κωδικοποίησης εικόνων είναι να καθορίσει μια διαίρεση εικόνων υψηλής ανάλυσης με ελάχιστες αλλαγές στις αναλογίες κάθε μεγέθους. Για μια δεδομένη εικόνα με μια bestimmμένη ανάλυση (πλάτος, ύψος) και einen οπτικό μετασχηματιστή προ-εκπαιδευμένο σε μια άλλη ανάλυση, το LLaVA-UHD πρώτα καθορίζει τον ιδανικό υπολογισμό, δηλαδή τον αριθμό των μεγεθών που απαιτούνται για την επεξεργασία της εικόνας. Το πλαίσιο στη συνέχεια factorizes τον αριθμό των μεγεθών σε στήλες και γραμμές. Το πλαίσιο στη συνέχεια ορίζει μια συνάρτηση βαθμού για να μετρήσει την απόκλιση από το πρότυπο προ-εκπαίδευσης του οπτικού μετασχηματιστή. Θεωρητικά, το LLaVA-UHD μπορεί να αποδείξει ότι η στρατηγική διαίρεσης που εφαρμόζεται στη αρχιτεκτονική του εγγυάται ελάχιστες αναμενόμενες αλλαγές και μέτριες χειρότερες αλλαγές σε σχέση με το πρότυπο προ-εκπαίδευσης για κάθε μέγεθος.
Επιπλέον, η πλειοψηφία των υφιστάμενων LLMs εφαρμόζει μια στατική ανάλυση για την κωδικοποίηση των εικόνων, μια προσέγγιση που αποτρέπει την πλήρη προσαρμοστικότητα του μοντέλου στις εικόνες υψηλής ανάλυσης, поскольку έχουν πρόσβαση μόνο σε vài προκαθορισμένες σταθερές αναλογίες. Επιπλέον, η στατική ανάλυση των μεγεθών βλάπτει την απόδοση, την αποδοτικότητα και την ορθότητα του μοντέλου, поскольку προκαλεί παραμόρφωση σχήματος, μετετρέπει ή γεμίζει. Για να αντιμετωπίσουμε αυτό το ζήτημα, το LLaVA-UHD προτείνει να κωδικοποιήσει τα μεγέθη των εικόνων σε αναλογία όπως καθορίζεται από τη στρατηγική διαίρεσης. Για να seja πιο συγκεκριμένο, το LLaVA-UHD πρώτα μετετρέπει την αρχική εικόνα αναλογικά σύμφωνα με την αναλογία, ώστε ο αριθμός των patches να ταιριάζει στο προ-εκπαιδευτικό προϋπολογισμό, δηλαδή τον αριθμό των position embeddings στη σειρά του οπτικού μετασχηματιστή, στο μέγιστο. Το LLaVA-UHD στη συνέχεια μετετρέπει τη προ-εκπαιδευμένη 1D σειρά position embeddings του οπτικού μετασχηματιστή σε μορφή 2D σύμφωνα με το πρότυπο προ-εκπαίδευσης.
Στρώμα Συμπίεσης
Ένα κοινό πρόβλημα που αντιμετωπίζουν τα LLMs κατά την επεξεργασία εικόνων υψηλής ανάλυσης είναι ότι ο αριθμός των οπτικών συμβολισμών που πρέπει να επεξεργαστούν είναι σημαντικά υψηλότερος (για αναφορά, το LLaVA-1.5 παράγει περίπου 3500 οπτικούς συμβολισμούς κατά την επεξεργασία μιας εικόνας με ανάλυση 672×1008), αντιπροσωπεύοντας einen μεγάλο μέρος των υπολογιστικών πόρων και του κόστους. Για να αντιμετωπίσουμε αυτή την πρόκληση, το LLaVA-UHD εφαρμόζει ένα κοινό στρώμα resampler για να συμπιέσει τους οπτικούς συμβολισμούς κάθε μεγέθους εικόνας. Το μοντέλο στη συνέχεια εφαρμόζει ένα σύνολο query vectors μέσω cross-attention για να resample την έξοδο των οπτικών συμβολισμών από τους οπτικούς κωδικοποιητές σε ένα χαμηλότερο αριθμό. Σε σύγκριση με τις προβληματικές στρατηγικές Multilayer Perceptron-based οπτικής προβολής, η προσέγγιση perceiver resampler που εφαρμόζεται από το LLaVA-UHD μπορεί να διατηρήσει einen προσιτό αλλά σταθερό αριθμό οπτικών συμβολισμών, ανεξάρτητα από την ανάλυση της εικόνας, καθιστώντας το LLaVA-UHD πιο συμβατό με την επεξεργασία και κατανόηση εικόνων υψηλής ανάλυσης. Για να το δούμε με ένα παράδειγμα, το LLaVA-UDH παράγει τον ίδιο αριθμό συμβολισμών κατά την κωδικοποίηση μιας εικόνας με ανάλυση 672×1008 όσο και το LLaVA-1.5 κατά την κωδικοποίηση μιας εικόνας με ανάλυση 336×336, σχεδόν 6 φορές πιο αποτελεσματικά από τον ανταγωνιστή του.
Σχήμα για τα Μεγέθη των Εικόνων
Είναι αναγκαίο να ενημερωθεί το Μεγάλο Μοντέλο Γλώσσας για την χωρική οργάνωση των μεγεθών των εικόνων, поскольку η διαίρεση των εικόνων είναι δυναμική σε διάφορες εικόνες. Το LLaVA-UHD σχεδιάζει και εφαρμόζει ένα σχήμα που χρησιμοποιεί δύο ειδικούς συμβολισμούς για να ενημερώσει το LLM για τη σχετική θέση των μεγεθών των εικόνων. Υπό αυτό το σχήμα, το LLaVA-UHD χρησιμοποιεί “,” για να分割 τις αναπαραστάσεις των μεγεθών σε μια σειρά, και τις διαφορετικές σειρές χωρίζονται χρησιμοποιώντας einen “n”.
LLaVA-UDH: Πειράματα και Αποτελέσματα
Το LLaVA-UHD αξιολογείται ενάντια σε 9 δημοφιλείς διαγωνισμούς, συμπεριλαμβανομένων γενικών οπτικών ερωτήσεων, οπτικών ερωτήσεων με βάση χαρακτήρες, διαγωνισμών hallουcinations και綜合 διαγωνισμών. Επιπλέον, το LLaVA-UHD συγκρίνεται με ισχυρά baselines, συμπεριλαμβανομένων LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2, και άλλα.
Η απόδοση του LLaVA-UHD σε 9 δημοφιλείς διαγωνισμούς συνοψίζεται και συγκρίνεται με δημοφιλείς διαγωνισμούς στον παρακάτω πίνακα.

Βασισμένα στα παραπάνω αποτελέσματα, μπορεί να συναχθεί ότι το LLaVA-UHD μπορεί να υπερβεί τα ισχυρά baselines μοντέλα σε δημοφιλείς διαγωνισμούς, συμπεριλαμβανομένων ισχυρών baselines που έχουν εκπαιδευτεί σε ένα σημαντικά μεγαλύτερο σύνολο δεδομένων, καθώς και να υπερβεί τα LLMs που απαιτούν σημαντικά περισσότερη υπολογιστική δύναμη, όπως Fuyu-8B, Monkey, και άλλα. Δεύτερον, τα αποτελέσματα δείχνουν επίσης ότι το LLaVA-UHD επιτύχει σημαντικά καλύτερα αποτελέσματα από την αρχιτεκτονική LLaVA-1.5, και σε ένα σημείο όπου η LLaVA-1.5 υποστηρίζει μια σταθερή ανάλυση 336×336, το LLaVA-UHD υποστηρίζει εικόνες με ανάλυση 672×1088 και οποιαδήποτε αναλογία, και τον ίδιο αριθμό οπτικών συμβολισμών.


Τελικές Σκέψεις
Σε αυτό το άρθρο, μιλήσαμε για το LLaVA-UHD, μια καινοτόμο προσέγγιση που πρώτα λαμβάνει τα πλαίσια LLaVA-1.5 και GPT-4V ως αντιπροσωπευτικά παραδείγματα και προσπαθεί να αποκαλύψει τα συστηματικά ελαττώματα που είναι εδραιωμένα στην στρατηγική οπτικής κωδικοποίησης. Το LLaVA-UHD, ένα μοντέλο πολλαπλών modalities, είναι μια προσπάθεια να αντιμετωπιστούν οι προκλήσεις. Το LLaVA-UHD μπορεί να ανιχνεύσει εικόνες σε υψηλή ανάλυση καθώς και σε οποιαδήποτε αναλογία. Το LLaVA-UHD είναι δομημένο γύρω από τρία βασικά στοιχεία. Πρώτον, μια στρατηγική μερικής κωδικοποίησης εικόνων που διαιρεί εικόνες σε μικρότερα, μεταβλητά μεγέθη, για να αυξήσει την αποδοτικότητα και να επεκτείνει την κωδικοποίηση. Δεύτερον, ένα στρώμα συμπίεσης που συμπιέζει τους οπτικούς συμβολισμούς που παράγονται από τους οπτικούς κωδικοποιητές. Τέλος, ένα σχήμα που οργανώνει τους συμβολισμούς των εικόνων για τα μεγάλα μοντέλα γλώσσας.綜合 πειράματα δείχνουν ότι το LLaVA-UHD μπορεί να υπερβεί τα καλύτερα μεγάλα μοντέλα γλώσσας σε 9 διαγωνισμούς. Επιπλέον, χρησιμοποιώντας μόνο το 94% της υπολογιστικής δύναμης, το LLaVA-UHD μπορεί να υποστηρίξει εικόνες με 6 φορές μεγαλύτερη ανάλυση, π.χ. 672×1088.












