Μοντέλα και πλατφόρμες AI
Οδηγούμενη από τις οδηγίες Επεξεργασία Εικόνας μέσω Πολυμεσικών Μεγάλων Γλωσσικών Μοντέλων
Τα εργαλεία οπτικού σχεδιασμού και τα μοντέλα οράσεως γλώσσας έχουν ευρεία εφαρμογή στη βιομηχανία πολυμέσων.尽管 υπήρξαν σημαντικές προόδους τα τελευταία χρόνια, μια στερεή κατανόηση αυτών των εργαλείων είναι ακόμη απαραίτητη για τη λειτουργία τους. Για να βελτιωθεί η προσβασιμότητα και ο έλεγχος, η βιομηχανία πολυμέσων υιοθετεί ολοένα και περισσότερο τεχνικές επεξεργασίας εικόνας με οδηγίες ή κείμενο. Αυτές οι τεχνικές χρησιμοποιούν φυσική γλώσσα εντολές αντί για παραδοσιακές περιφερειακές μάσκες ή περίπλοκες περιγραφές, επιτρέποντας πιο ευέλικτη και ελεγχόμενη επεξεργασία εικόνας. Ωστόσο, οι μεθόδοι με οδηγίες συχνά παρέχουν σύντομες οδηγίες που μπορεί να είναι δύσκολο για τα υπάρχοντα μοντέλα να τις κατανοήσουν και να τις εκτελέσουν πλήρως. Επιπλέον, τα μοντέλα διάχυσης, γνωστά για την ικανότητά τους να δημιουργούν πραγματικές εικόνες, είναι σε μεγάλη ζήτηση στον τομέα της επεξεργασίας εικόνας.
Περισσότερο, Πολυμεσικά Μεγάλα Γλωσσικά Μοντέλα (MLLMs) έχουν δείξει εντυπωσιακή απόδοση σε εργασίες που涉ρούν την οπτική-γλωσσική απόκριση και την δια-τροπική κατανόηση. Η MLLM Οδηγούμενη Επεξεργασία Εικόνας (MGIE) είναι μια μελέτη που εμπνέεται από τα MLLMs και αξιολογεί τις ικανότητές τους και αναλύει πώς υποστηρίζουν την επεξεργασία μέσω κειμένου ή οδηγιών. Αυτή η προσέγγιση涉ρούν την εκμάθηση για να παρέχουν σαφείς οδηγίες και να εξάγουν εκφραστικές οδηγίες. Το μοντέλο επεξεργασίας MGIE κατανοεί τις οπτικές πληροφορίες και εκτελεί επεξεργασία μέσω εκπαίδευσης από άκρο σε άκρο. Σε αυτό το άρθρο, θα εμβαθύνουμε sâu στην MGIE, αξιολογώντας την επίδρασή της στην παγκόσμια βελτίωση εικόνας, τις τροποποιήσεις τύπου Photoshop και την τοπική επεξεργασία. Θα συζητήσουμε επίσης τη σημασία της MGIE στις εργασίες επεξεργασίας εικόνας με οδηγίες που βασίζονται σε εκφραστικές οδηγίες. Ας ξεκινήσουμε την εξερεύνησή μας.
MLLM Οδηγούμενη Επεξεργασία Εικόνας ή MGIE: Μια Εισαγωγή
Τα Πολυμεσικά Μεγάλα Γλωσσικά Μοντέλα και τα Μοντέλα Διάχυσης είναι δύο από τα πιο διαδεδομένα πλαίσια AI και ML που χρησιμοποιούνται σήμερα, λόγω των εξαιρετικών γεννητικών ικανοτήτων τους. Από τη μια πλευρά, υπάρχουν τα Μοντέλα Διάχυσης, γνωστά για την παραγωγή εξαιρετικά πραγματικών και οπτικά ελκυστικών εικόνων, ενώ από την άλλη πλευρά, υπάρχουν τα Πολυμεσικά Μεγάλα Γλωσσικά Μοντέλα, που είναι διάσημα για την εξαιρετική τους ικανότητα να παράγουν eine ποικιλία περιεχομένου, συμπεριλαμβανομένου κειμένου, γλώσσας, ομιλίας και εικόνων/βίντεο.
Τα Μοντέλα Διάχυσης ανταλλάσσουν τους λατινικούς χάρτες για να thực hiện οπτική επεξεργασία που αντανακλά την αλλαγή του στόχου της εισαγωγής, και μπορούν επίσης να χρησιμοποιήσουν μια οδηγούμενη μάσκα για να επεξεργαστούν một συγκεκριμένη περιοχή της εικόνας. Nhưng ο κύριος λόγος για τον οποίο τα Μοντέλα Διάχυσης χρησιμοποιούνται ευρέως για εφαρμογές πολυμέσων είναι ότι αντί να βασίζονται σε περίπλοκες περιγραφές ή περιφερειακές μάσκες, τα Μοντέλα Διάχυσης χρησιμοποιούν οδηγούμενη επεξεργασία που επιτρέπει στους χρήστες να εκφράσουν πώς να επεξεργαστούν την εικόνα απευθείας χρησιμοποιώντας κείμενο εντολές ή οδηγίες. Καινούργια, τα Μεγάλα Γλωσσικά Μοντέλα δεν χρειάζονται εισαγωγή, καθώς έχουν δείξει σημαντικές προόδους σε eine ποικιλία γλωσσικών εργασιών, συμπεριλαμβανομένης της περίληψης κειμένου, της μηχανικής μετάφρασης, της γεννήσεως κειμένου και της απάντησης σε ερωτήσεις. Τα LLMs εκπαιδεύονται συνήθως σε ένα μεγάλο και διαφορετικό σύνολο δεδομένων εκπαίδευσης, που τους παρέχει οπτική δημιουργικότητα και γνώση, επιτρέποντάς τους να thựcίσουν verschiedene οπτικές-γλωσσικές εργασίες. Κτίζοντας πάνω στα LLMs, τα MLLMs ή τα Πολυμεσικά Μεγάλα Γλωσσικά Μοντέλα μπορούν να χρησιμοποιήσουν εικόνες ως φυσικές εισαγωγές και να παρέχουν κατάλληλες οπτικά-γλωσσικές απαντήσεις.
Με αυτά τα δεδομένα, αν και τα Μοντέλα Διάχυσης και τα πλαίσια MLLM χρησιμοποιούνται ευρέως για εργασίες επεξεργασίας εικόνας, υπάρχουν κάποια προβλήματα οδηγίας με τις κειμενικές οδηγίες που επηρεάζουν την συνολική απόδοση, οδηγώντας στην ανάπτυξη της MGIE ή της MLLM Οδηγούμενης Επεξεργασίας Εικόνας, ενός AI-ενεργοποιημένου πλαισίου που αποτελείται από ένα μοντέλο διάχυσης και ένα MLLM, όπως φαίνεται στην ακόλουθη εικόνα.
Σε αυτό το πλαίσιο, το μοντέλο διάχυσης εκπαιδεύεται από άκρο σε άκρο για να thựcίσουν επεξεργασία εικόνας με λατινική φαντασία του προορισμού, ενώ το πλαίσιο MLLM μαθαίνει να προβλέπει ακριβείς εκφραστικές οδηγίες. Μαζί, το μοντέλο διάχυσης και το πλαίσιο MLLM επωφελούνται από την εγγενή οπτική παράγωγη, επιτρέποντάς τους να αντιμετωπίσουν αμφίβολες ανθρώπινες εντολές, οδηγώντας σε πραγματική επεξεργασία εικόνας, όπως φαίνεται στην ακόλουθη εικόνα.
Το πλαίσιο MGIE αντλεί βαριά έμπνευση από δύο υπάρχουσες προσεγγίσεις: Οδηγούμενη Επεξεργασία Εικόνας και Μοντέλα Μεγάλης Γλώσσας Οράσεως.
Η οδηγούμενη επεξεργασία εικόνας μπορεί να βελτιώσει σημαντικά την προσβασιμότητα και τον έλεγχο της οπτικής επεξεργασίας, ακολουθώντας τις ανθρώπινες εντολές. Υπάρχουν δύο κύρια πλαίσια που χρησιμοποιούνται για την οδηγούμενη επεξεργασία εικόνας: τα πλαίσια GAN και τα Μοντέλα Διάχυσης. Τα GAN ή τα Αντιθετικά Γραφικά Δίκτυα είναι ικανά να αλλάξουν εικόνες, αλλά είναι είτε περιορισμένα σε συγκεκριμένα домένια είτε παράγουν μη πραγματικές αποτελέσματα. Από την άλλη πλευρά, τα μοντέλα διάχυσης με μεγάλης κλίμακας εκπαίδευση μπορούν να ελέγξουν τους δια-τροπικούς χάρτες προσοχής για να επιτύχουν επεξεργασία εικόνας και μετασχηματισμό. Η οδηγούμενη επεξεργασία λειτουργεί λαμβάνοντας απευθείας εντολές ως εισαγωγή, συχνά không περιορισμένες σε περιφερειακές μάσκες και περίπλοκες περιγραφές. Ωστόσο, υπάρχει μια πιθανότητα ότι οι παρεχόμενες οδηγίες είναι είτε αμφίβολες είτε δεν είναι αρκετά ακριβείς για να ακολουθήσουν οδηγίες για εργασίες επεξεργασίας.
Τα Μοντέλα Μεγάλης Γλώσσας Οράσεως είναι διάσημα για τις γεννητικές και γενικευτικές ικανότητές τους σε verschiedene εργασίες, και συχνά έχουν μια ροβούστα γλωσσική κατανόηση, και μπορούν να παράγουν εκτελέσιμους προγράμματα ή ψευδο-κώδικα. Αυτή η ικανότητα των μεγάλων γλωσσικών μοντέλων επιτρέπει στα MLLMs να αντιλαμβάνονται εικόνες και να παρέχουν κατάλληλες οπτικά-γλωσσικές απαντήσεις χρησιμοποιώντας οπτική συσχετισμένη με την οδηγία, με πρόσφατα μοντέλα που υιοθετούν MLLMs για να παράγουν εικόνες που σχετίζονται με το chat ή την εισαγωγή κειμένου. Ωστόσο, αυτό που διακρίνει την MGIE από τα MLLMs ή τα VLLMs είναι ότι ενώ τα τελευταία μπορούν να παράγουν εικόνες που διαφέρουν από τις εισαγωγές από την αρχή, η MGIE αξιοποιεί τις ικανότητες των MLLMs για να βελτιώσει τις ικανότητες επεξεργασίας εικόνας με τις παραγώμενες οδηγίες.
MGIE: Αρχιτεκτονική και Μεθοδολογία
Παραδοσιακά, τα μεγάλα γλωσσικά μοντέλα έχουν χρησιμοποιηθεί για γεννητικές εργασίες επεξεργασίας φυσικής γλώσσας. Αλλά από τότε που τα MLLMs έγιναν mainstream, τα LLMs ενδυναμώθηκαν με την ικανότητα να παρέχουν λογικές απαντήσεις, αντιλαμβανόμενες εικόνες εισαγωγής. Συμβατικά, ένα Πολυμεσικό Μεγάλο Γλωσσικό Μοντέλο αρχικοποιείται από ένα προ-εκπαιδευμένο LLM, και περιέχει einen οπτικό κωδικοποιητή και einen προσαρμογέα για να εξάγει τις οπτικές λειτουργίες και να τις προβάλει στη γλωσσική τροπικότητα, αντίστοιχα. Λόγω αυτού, το πλαίσιο MLLM είναι ικανό να αντιλαμβάνεται οπτικές εισαγωγές, αν και η έξοδος είναι ακόμη περιορισμένη στο κείμενο.
Το προτεινόμενο πλαίσιο MGIE στοχεύει να επιλύσει αυτό το ζήτημα και να διευκολύνει ένα MLLM να επεξεργαστεί μια εισαγωγή εικόνας σε μια έξοδο εικόνας με βάση τις δοθείσες κειμενικές οδηγίες. Για να το επιτύχει, το πλαίσιο MGIE στεγάζει ένα MLLM και εκπαιδεύεται για να εξάγει συντομές και εκφραστικές κειμενικές οδηγίες. Επιπλέον, το πλαίσιο MGIE προσθέτει ειδικές οπτικές λειτουργίες στη δομή του για να γεφυρώσει το χάσμα μεταξύ οράσεως και γλωσσικής τροπικότητας, και υιοθετεί το edit head για τη μετασχηματισμό των τροπικοτήτων. Αυτές οι τροπικότητες χρησιμεύουν ως η λατινική οπτική φαντασία από το Πολυμεσικό Μεγάλο Γλωσσικό Μοντέλο, και οδηγούν το μοντέλο διάχυσης για να επιτύχει τις εργασίες επεξεργασίας. Το πλαίσιο MGIE είναι τότε ικανό να thựcίσουν οπτικές εργασίες για λογική επεξεργασία εικόνας.
Συντομη και Εκφραστική Οδηγία
Παραδοσιακά, τα Πολυμεσικά Μεγάλα Γλωσσικά Μοντέλα μπορούν να προσφέρουν οπτικά-σχετικές απαντήσεις με την δια-τροπική αντίληψη λόγω οδηγίας και συσχετίσεως. Για να επεξεργαστούν εικόνες, το πλαίσιο MGIE χρησιμοποιεί μια κειμενική προτροπή ως την πρωταρχική γλωσσική εισαγωγή με την εικόνα, και εξάγει μια λεπτομερή εξήγηση για την οδηγία επεξεργασίας. Ωστόσο, αυτές οι εξηγήσεις μπορεί να είναι συχνά πολύ εκτενείς ή να περιέχουν επαναλαμβανόμενες περιγραφές, οδηγώντας σε λανθασμένες προθέσεις,迫 το MGIE να εφαρμόσει einen προ-εκπαιδευμένο συνόψιμο για να λάβει συντομές αφηγήσεις, επιτρέποντας στο MLLM να παράγει συντομές εξόδους. Το πλαίσιο αντιμετωπίζει την συντομή και την εκφραστική οδηγία ως μια εκφραστική οδηγία, και εφαρμόζει την απώλεια του cross-entropy για να εκπαιδεύσει το πολυμεσικό μεγάλο γλωσσικό μοντέλο χρησιμοποιώντας διδασκαλία.
Η χρήση μιας εκφραστικής οδηγίας παρέχει μια πιο συγκεκριμένη ιδέα σε σύγκριση με την κειμενική οδηγία, καθώς γεφυρώνει το χάσμα για λογική επεξεργασία εικόνας, ενισχύοντας την αποτελεσματικότητα του πλαισίου. Επιπλέον, το πλαίσιο MGIE κατά τη διάρκεια της περιόδου συλλογής εξάγει συντομές και εκφραστικές οδηγίες αντί να παράγει εκτενείς αφηγήσεις και να βασίζεται σε εξωτερική σύνοψη. Λόγω αυτού, το πλαίσιο MGIE είναι ικανό να πιάσει την οπτική φαντασία των οδηγιών επεξεργασίας, αλλά είναι ακόμη περιορισμένο στη γλωσσική τροπικότητα. Για να υπερβεί αυτό το εμπόδιο, το μοντέλο MGIE προσθέτει έναν ορισμένο αριθμό οπτικών λειτουργιών μετά την εκφραστική οδηγία με εκπαιδεύσιμες λέξεις-εμφωλευμένες, επιτρέποντας στο MLLM να τις παράγει χρησιμοποιώντας το LM ή το Γλωσσικό Μοντέλο.
Επεξεργασία Εικόνας με Λατινική Φαντασία
Στο επόμενο βήμα, το πλαίσιο MGIE υιοθετεί το edit head για να μετασχηματίσει την οδηγία εικόνας σε πραγματική οπτική οδηγία. Το edit head είναι ένα μοντέλο ακολουθίας-σε-ακολουθία που βοηθά στην χαρτογράφηση των οπτικών λειτουργιών από το MLLM στα σημαντικά λατινικά σημασιολογικά ως οδηγία επεξεργασίας. Για να seja πιο συγκεκριμένο, η μετασχηματισμός πάνω στις λέξεις-εμφωλευμένες μπορεί να ερμηνευτεί ως γενική αναπαράσταση στη οπτική τροπικότητα, και χρησιμοποιεί einen συνειδητό οπτικό συνθετικό για τις οδηγίες επεξεργασίας. Επιπλέον, για να οδηγήσει την επεξεργασία εικόνας με οπτική φαντασία, το πλαίσιο MGIE ενσωματώνει ένα λατινικό μοντέλο διάχυσης στη δομή του, που περιλαμβάνει einen αυτο-κωδικοποιητή και αντιμετωπίζει την απόσπαση θορύβου στη λατινική περιοχή. Ο κύριος στόχος του λατινικού μοντέλου διάχυσης είναι να παράγει το λατινικό στόχο από τη διατήρηση της λατινικής εισαγωγής και να ακολουθήσει την οδηγία επεξεργασίας. Η διαδικασία διάχυσης προσθέτει θόρυβο στο λατινικό στόχο σε τακτά χρονικά διαστήματα και το επίπεδο θορύβου αυξάνεται με κάθε βήμα.
Μάθηση της MGIE
Το ακόλουθο σχήμα συνοψίζει τον αλγόριθμο της διαδικασίας μάθησης του προτεινόμενου πλαισίου MGIE.
Όπως μπορεί να παρατηρηθεί, το MLLM μαθαίνει να εξάγει συντομές και εκφραστικές κειμενικές οδηγίες χρησιμοποιώντας την απώλεια οδηγίας. Χρησιμοποιώντας την οπτική φαντασία από τις οδηγίες εικόνας, το πλαίσιο μετασχηματίζει την τροπικότητα του edit head, και οδηγεί το λατινικό μοντέλο διάχυσης για να συνθέσει την αποτέλεσμα εικόνας, και εφαρμόζει την απώλεια επεξεργασίας για εκπαίδευση διάχυσης. Τέλος, το πλαίσιο παγώνει την πλειοψηφία των βαρών, οδηγώντας σε αποτελεσματική εκπαίδευση από άκρο σε άκρο.
MGIE: Αποτελέσματα και Αξιολόγηση
Το πλαίσιο MGIE χρησιμοποιεί το σύνολο δεδομένων IPr2Pr ως την πρωταρχική προ-εκπαίδευση, και περιέχει πάνω από 1 εκατομμύριο CLIP-φιλτραρισμένα δεδομένα με οδηγίες που εξάγονται από το μοντέλο GPT-3, και ένα μοντέλο Prompt-to-Prompt για να συνθέσει τις εικόνες. Επιπλέον, το πλαίσιο MGIE αντιμετωπίζει το πλαίσιο InsPix2Pix, που είναι βασισμένο στο CLIP κειμενικό κωδικοποιητή με ένα μοντέλο διάχυσης, ως την βάση για εργασίες επεξεργασίας εικόνας με οδηγίες. Επιπλέον, το μοντέλο MGIE λαμβάνει επίσης υπόψη ένα μοντέλο LLM-οδηγούμενης επεξεργασίας εικόνας που υιοθετείται για εκφραστικές οδηγίες από εισαγωγές-μόνο, αλλά χωρίς οπτική αντίληψη.
Ποσοτική Ανάλυση
Το ακόλουθο σχήμα συνοψίζει τα αποτελέσματα επεξεργασίας σε μια ρύθμιση zero-shot με τα μοντέλα που εκπαιδεύονται μόνο στο σύνολο δεδομένων IPr2Pr. Για τα δεδομένα GIER και EVR που涉ρούν τροποποιήσεις τύπου Photoshop, οι εκφραστικές οδηγίες μπορούν να αποκαλύψουν συγκεκριμένα στόχους αντί για αμφίβολες εντολές, επιτρέποντας τα αποτελέσματα επεξεργασίας να μοιάζουν με τις οδηγίες επεξεργασίας καλύτερα.
Αν και και τα LGIE και τα MGIE εκπαιδεύονται στα ίδια δεδομένα με το μοντέλο InsPix2Pix, μπορούν να προσφέρουν λεπτομερείς εξηγήσεις μέσω της μάθησης με το μεγάλο γλωσσικό μοντέλο, αλλά ακόμη το LGIE είναι περιορισμένο σε μια seule τροπικότητα. Επιπλέον, το πλαίσιο MGIE μπορεί να προσφέρει μια σημαντική βελτίωση απόδοσης, καθώς έχει πρόσβαση σε εικόνες και μπορεί να τις χρησιμοποιήσει για να εξάγει σαφείς οδηγίες.
Για να αξιολογήσει την απόδοση στις εργασίες επεξεργασίας εικόνας με οδηγίες για συγκεκριμένους σκοπούς, οι développeurs έχουν tinh chỉnh几个 μοντέλα σε κάθε σύνολο δεδομένων, όπως συνοψίζεται στο ακόλουθο πίνακα.
Όπως μπορεί να παρατηρηθεί, μετά την προσαρμογή των εργασιών επεξεργασίας τύπου Photoshop για EVR και GIER, τα μοντέλα δείχνουν μια βελτίωση απόδοσης. Ωστόσο, είναι αξιοσημείωτο ότι, поскольку η tinh chỉnh κάνει τις εκφραστικές οδηγίες πιο domain-ειδικές, το πλαίσιο MGIE μαρτυρά μια μεγάλη βελτίωση απόδοσης, καθώς μαθαίνει επίσης domain-σχετικές οδηγίες, επιτρέποντας στο μοντέλο διάχυσης να δείξει συγκεκριμένα επεξεργασμένα σκηνικά από το tinh chỉnh μεγάλο γλωσσικό μοντέλο, ωφελούμενο και από την τοπική τροποποίηση και την τοπική βελτίωση. Επιπλέον, поскольку η οπτικά-γλωσσική οδηγία είναι πιο συσχετισμένη με τους προορισμούς επεξεργασίας, το πλαίσιο MGIE προσφέρει καλύτερα αποτελέσματα σταθερά σε σύγκριση με το LGIE.
Το ακόλουθο σχήμα δείχνει το σκορ CLIP-S μεταξύ των εισαγωγών ή των πραγματικών εικόνων και των εκφραστικών οδηγιών. Ένα υψηλότερο σκορ CLIP δείχνει τη συσχέτιση των οδηγιών με την πηγή επεξεργασίας, και όπως μπορεί να παρατηρηθεί, το MGIE έχει ένα υψηλότερο σκορ CLIP σε σύγκριση με το LGIE μοντέλο και στις εισαγωγές και στις εξόδους εικόνας.
Ποιοτική Ανάλυση
Το ακόλουθο σχήμα συνοψίζει την ποιοτική ανάλυση του πλαισίου MGIE.
Όπως γνωρίζουμε, το πλαίσιο LGIE είναι περιορισμένο σε μια seule τροπικότητα λόγω της γλώσσας, και έχει μια seule γλωσσική αντίληψη, και είναι ευάλωτο σε λανθασμένες ή μη σχετικές εξηγήσεις για την επεξεργασία εικόνας. Ωστόσο, το πλαίσιο MGIE είναι πολυμεσικό, και με πρόσβαση σε εικόνες, ολοκληρώνει τις εργασίες επεξεργασίας, και παρέχει σαφείς οπτικές φαντασίες που συσχετίζονται με τον στόχο πολύ καλά.
Τελικές Σκέψεις
Σε αυτό το άρθρο, abbiamo μιλήσει για την MGIE ή την MLLM Οδηγούμενη Επεξεργασία Εικόνας, μια μελέτη που εμπνέεται από τα MLLMs και αξιολογεί τις ικανότητές τους και αναλύει πώς υποστηρίζουν την επεξεργασία μέσω κειμένου ή οδηγιών, μαθαίνοντας να παρέχουν σαφείς οδηγίες και να εξάγουν εκφραστικές οδηγίες. Το μοντέλο επεξεργασίας MGIE κατανοεί τις οπτικές πληροφορίες και εκτελεί επεξεργασία μέσω εκπαίδευσης από άκρο σε άκρο. Αντί για αμφίβολες και σύντομες οδηγίες, το πλαίσιο MGIE παράγει σαφείς οπτικά-γλωσσικές οδηγίες που οδηγούν σε λογική επεξεργασία εικόνας.












