Μοντέλα και πλατφόρμες AI
InstructIR: Ανάκτηση Υψηλής Ποιότητας Εικόνων με Ανθρώπινες Οδηγίες
Μια εικόνα μπορεί να μεταφέρει πολλά, αλλά μπορεί επίσης να είναι ελαττωματική λόγω προβλημάτων όπως θόλωση κίνησης, ομίχλη, θόρυβος και χαμηλή δυναμική εμβέλεια. Αυτά τα προβλήματα, που ονομάζονται ελαττώματα σε χαμηλού επιπέδου όραση υπολογιστή, peuvent να προκύψουν από δυσχερείς περιβαλλοντικές συνθήκες όπως η ζέστη ή η βροχή, ή από τις περιορισμούς της κάμερας. Η ανάκτηση εικόνων αντιπροσωπεύει μια βασική πρόκληση στην όραση υπολογιστή, που αποσκοπεί στην ανάκτηση μιας εικόνας υψηλής ποιότητας από μια που παρουσιάζει τέτοια ελαττώματα. Η ανάκτηση εικόνων είναι複雑η, επειδή μπορεί να υπάρχουν πολλές λύσεις για την ανάκτηση οποιασδήποτε εικόνας. Ορισμένες προσεγγίσεις στοχεύουν σε συγκεκριμένα ελαττώματα, όπως την μείωση του θορύβου ή την αφαίρεση της θόλωση ή της ομίχλης.
Ενώ αυτές οι μέθοδοι μπορούν να δώσουν καλά αποτελέσματα για συγκεκριμένα προβλήματα, συχνά δυσκολεύονται να γενικευθούν σε διαφορετικά είδη ελαττωμάτων. Πολλά πλαίσια χρησιμοποιούν ένα γενικό νευρωνικό δίκτυο για eine ευρεία γκάμα εργασιών ανάκτησης εικόνων, αλλά αυτά τα δίκτυα εκπαιδεύονται ξεχωριστά. Η ανάγκη για διαφορετικά μοντέλα για κάθε είδος ελαττώματος καθιστά αυτήν την προσέγγιση υπολογιστικά εκμεταλλεύσιμη και χρονοβόρα, οδηγώντας σε εστίαση στα μοντέλα ανάκτησης All-In-One. Αυτά τα μοντέλα χρησιμοποιούν ένα μονό, βαθύ τυφλό μοντέλο ανάκτησης εικόνων για να αντιμετωπίσουν διαφορετικά είδη και επίπεδα ελαττωμάτων, συχνά χρησιμοποιώντας προωθήσεις ή διανύσματα οδηγιών που σχετίζονται με την ελάττωση για να βελτιώσουν την απόδοση. Αν και τα μοντέλα All-In-One συνήθως δείχνουν υποσχόμενα αποτελέσματα, vẫn αντιμετωπίζουν προκλήσεις με αντίστροφες προβλήματα.
Το InstructIR αντιπροσωπεύει μια πρωτοποριακή προσέγγιση στο πεδίο, όντας το πρώτο πλαίσιο ανάκτησης εικόνων που σχεδιάστηκε για να οδηγήσει το μοντέλο ανάκτησης μέσω ανθρώπινων οδηγιών. Μπορεί να επεξεργαστεί φυσικές γλώσσες για να ανακτήσει εικόνες υψηλής ποιότητας από ελαττωματικές, λαμβάνοντας υπόψη διαφορετικά είδη ελαττωμάτων. Το InstructIR θέτει ένα νέο πρότυπο απόδοσης για eine ευρεία γκάμα εργασιών ανάκτησης εικόνων, συμπεριλαμβανομένων deraining, denoising, dehazing, deblurring και ενίσχυσης εικόνων χαμηλού φωτισμού.
Αυτό το άρθρο αποσκοπεί να καλύψει το πλαίσιο InstructIR σε βάθος, και εξετάζουμε τη μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου μαζί με τη σύγκρισή του με τα καλύτερα μοντέλα ανάκτησης εικόνων και βίντεο. Έτσι, ας ξεκινήσουμε.
InstructIR: Ανάκτηση Υψηλής Ποιότητας Εικόνων
Η ανάκτηση εικόνων είναι ένα βασικό πρόβλημα στην όραση υπολογιστή, поскольку αποσκοπεί στην ανάκτηση μιας εικόνας υψηλής ποιότητας από μια που παρουσιάζει ελαττώματα. Σε χαμηλού επιπέδου όραση υπολογιστή, τα ελαττώματα είναι ένας όρος που χρησιμοποιείται για να αντιπροσωπεύσει άσχημες επιπτώσεις που παρατηρούνται σε μια εικόνα, όπως θόλωση κίνησης, ομίχλη, θόρυβος, χαμηλή δυναμική εμβέλεια και άλλα. Ο λόγος για τον οποίο η ανάκτηση εικόνων είναι μια複雑η αντίστροφη πρόκληση είναι ότι μπορεί να υπάρχουν πολλές λύσεις για την ανάκτηση οποιασδήποτε εικόνας. Ορισμένα πλαίσια εστιάζουν σε συγκεκριμένα ελαττώματα, όπως την μείωση του θορύβου ή την αφαίρεση της θόλωση ή της ομίχλης.
Σύγχρονες μεθόδους μάθησης με βάση τα νευρωνικά δίκτυα έχουν δείξει ισχυρότερη και πιο συνεπή απόδοση σε σύγκριση με τις παραδοσιακές μεθόδους ανάκτησης εικόνων. Αυτά τα μοντέλα ανάκτησης εικόνων προτείνουν να χρησιμοποιούν νευρωνικά δίκτυα με βάση τους μετασχηματιστές και τα συν볼ικά νευρωνικά δίκτυα. Αυτά τα μοντέλα μπορούν να εκπαιδευτούν ανεξάρτητα για διαφορετικές εργασίες ανάκτησης εικόνων και έχουν επίσης τη δυνατότητα να συλλάβουν τοπικές και γлобικές αλληλεπιδράσεις χαρακτηριστικών και να τις ενισχύσουν, οδηγώντας σε ικανοποιητική και συνεπή απόδοση. Αν και ορισμένα από αυτά τα μοντέλα μπορεί να δώσουν καλά αποτελέσματα για συγκεκριμένα ελαττώματα, συχνά δεν γενικεύονται καλά σε διαφορετικά είδη ελαττωμάτων. Επιπλέον, ενώ πολλά υπάρχοντα πλαίσια χρησιμοποιούν το ίδιο νευρωνικό δίκτυο για πολλές εργασίες ανάκτησης εικόνων, κάθε νευρωνική διατύπωση εκπαιδεύεται ξεχωριστά. Έτσι, είναι σαφές ότι η χρήση ενός ξεχωριστού νευρωνικού μοντέλου για κάθε είδος ελαττώματος είναι ακατόρθωτη και χρονοβόρα, οδηγώντας σε εστίαση στα μοντέλα ανάκτησης All-In-One.
Τα μοντέλα All-In-One ή πολλαπλή ελάττωση ή πολλαπλή εργασία ανάκτησης εικόνων κερδίζουν δημοτικότητα στο πεδίο της όρασης υπολογιστή, поскольку είναι ικανά να ανακτήσουν πολλαπλά είδη και επίπεδα ελαττωμάτων σε μια εικόνα χωρίς την ανάγκη εκπαίδευσης των μοντέλων ανεξάρτητα για κάθε ελάττωση. Τα μοντέλα All-In-One ανάκτησης εικόνων χρησιμοποιούν ένα μονό, βαθύ τυφλό μοντέλο ανάκτησης εικόνων για να αντιμετωπίσουν διαφορετικά είδη και επίπεδα ελαττωμάτων. Διαφορετικά μοντέλα All-In-One εφαρμόζουν διαφορετικές προσεγγίσεις για να οδηγήσουν το τυφλό μοντέλο να ανακτήσει την ελαττωματική εικόνα, για παράδειγμα, ένα βοηθητικό μοντέλο για την ταξινόμηση της ελάττωσης ή πολλαπλά διανύσματα οδηγιών για να βοηθήσουν το μοντέλο να ανακτήσει διαφορετικά είδη ελαττωμάτων σε μια εικόνα.
Με αυτά τα δεδομένα, φτάνουμε στην κειμενο-βασισμένη χειραφέτηση εικόνων, поскольку έχει εφαρμοστεί από πολλά πλαίσια τα τελευταία χρόνια για γεννήτρια εικόνων κειμένου και εργασίες επεξεργασίας εικόνων με βάση το κείμενο. Αυτά τα μοντέλα χρησιμοποιούν κειμενικές προωθήσεις για να περιγράψουν ενέργειες ή εικόνες, μαζί με μοντέλα διαχύσεως για να γεννήσουν τις αντίστοιχες εικόνες. Η κύρια έμπνευση για το πλαίσιο InstructIR είναι το πλαίσιο InstructPix2Pix, το οποίο επιτρέπει στο μοντέλο να επεξεργάζεται την εικόνα χρησιμοποιώντας οδηγίες χρήστη που οδηγούν το μοντέλο σε ποια ενέργεια να εκτελέσει, αντί για κειμενικές ετικέτες, περιγραφές ή λεζάντες της εισαγωγικής εικόνας. Έτσι, οι χρήστες μπορούν να χρησιμοποιούν φυσικό γραπτό κείμενο για να οδηγήσουν το μοντέλο σε ποια ενέργεια να εκτελέσει, χωρίς την ανάγκη να παρέχουν δείγματα εικόνων ή πρόσθετες περιγραφές εικόνων.
Βασισμένοι σε αυτές τις βασικές αρχές, το πλαίσιο InstructIR είναι το πρώτο μοντέλο όρασης υπολογιστή που χρησιμοποιεί ανθρώπινες οδηγίες για να επιτύχει ανάκτηση εικόνων και να λύσει αντίστροφα προβλήματα. Για φυσικές γλώσσες, το μοντέλο InstructIR μπορεί να ανακτήσει εικόνες υψηλής ποιότητας από τις ελαττωματικές τους και να λάβει υπόψη πολλαπλά είδη ελαττωμάτων. Το πλαίσιο InstructIR είναι ικανό να παραδώσει απόδοση κατάσταση-of-the-τέχνη σε eine ευρεία γκάμα εργασιών ανάκτησης εικόνων, συμπεριλαμβανομένων deraining, denoising, dehazing, deblurring και ενίσχυσης εικόνων χαμηλού φωτισμού. Σε αντίθεση με τις υπάρχουσες εργασίες που επιτύχουν ανάκτηση εικόνων χρησιμοποιώντας εκμαθημένες οδηγίες ή προωθήσεις, το πλαίσιο InstructIR χρησιμοποιεί ακατέργαστες προωθήσεις χρήστη σε κείμενο. Το πλαίσιο InstructIR είναι ικανό να γενικευτεί στην ανάκτηση εικόνων χρησιμοποιώντας ανθρώπινες οδηγίες, και το μονό μοντέλο All-In-One που εφαρμόζεται από το InstructIR καλύπτει περισσότερες εργασίες ανάκτησης από τα προηγούμενα μοντέλα. Η ακόλουθη εικόνα δείχνει τα διαφορετικά δείγματα ανάκτησης του πλαισίου InstructIR.

InstructIR : Μέθοδος και Αρχιτεκτονική
Στην καρδιά του, το πλαίσιο InstructIR αποτελείται από einen κωδικοποιητή κειμένου και ένα μοντέλο εικόνας. Το μοντέλο χρησιμοποιεί το πλαίσιο NAFNet, ένα αποτελεσματικό μοντέλο ανάκτησης εικόνων που ακολουθεί μια αρχιτεκτονική U-Net ως μοντέλο εικόνας. Επιπλέον, το μοντέλο εφαρμόζει τεχνικές δρομολόγησης εργασιών για να μάθει πολλές εργασίες χρησιμοποιώντας ένα μονό μοντέλο επιτυχώς. Η ακόλουθη εικόνα δείχνει την προσέγγιση εκπαίδευσης και αξιολόγησης για το πλαίσιο InstructIR.

Εμπνευσμένοι από το μοντέλο InstructPix2Pix, το πλαίσιο InstructIR υιοθετεί ανθρώπινες οδηγίες ως μηχανισμό ελέγχου, поскольку δεν υπάρχει ανάγκη για τον χρήστη να παρέχει πρόσθετη πληροφορία. Αυτές οι οδηγίες προσφέρουν einen εκφραστικό και σαφή τρόπο να αλληλεπιδράσουν, επιτρέποντας στους χρήστες να δείξουν την ακριβή θέση και τύπο ελάττωσης στην εικόνα. Επιπλέον, χρησιμοποιώντας προωθήσεις χρήστη αντί για σταθερές προωθήσεις που σχετίζονται με την ελάττωση, ενισχύει την χρηστικότητα και τις εφαρμογές του μοντέλου, поскольку μπορεί επίσης να χρησιμοποιηθεί από χρήστες που δεν έχουν την απαιτούμενη εξειδίκευση. Για να εξοπλιστεί το πλαίσιο InstructIR με την ικανότητα να κατανοήσει διαφορετικές προωθήσεις, το μοντέλο χρησιμοποιεί το GPT-4, ένα μεγάλο μοντέλο γλώσσας για να δημιουργήσει διαφορετικές αιτήσεις, με ασαφείς και αμφίβολες προωθήσεις που αφαιρούνται μετά από einen φιλτράρισμα.
Κωδικοποιητής Κειμένου
Ο κωδικοποιητής κειμένου χρησιμοποιείται από μοντέλα γλώσσας για να χαρτογραφήσει τις προωθήσεις χρήστη σε eine εμβέλεια κειμένου ή eine σταθερή διαστατική αναπαράσταση. Παραδοσιακά, ο κωδικοποιητής κειμένου ενός μοντέλου CLIP είναι ένας κρίσιμος компонент για την κειμενο-βασισμένη γεννήτρια εικόνων και μοντέλα επεξεργασίας εικόνων με βάση το κείμενο για να κωδικοποιήσει τις προωθήσεις χρήστη, поскольку το πλαίσιο CLIP excels σε οπτικές προωθήσεις. Ωστόσο, η πλειονότητα των προωθήσεων χρήστη για την ελάττωση περιέχει λίγο έως κανένα οπτικό περιεχόμενο, καθιστώντας τους μεγάλους κωδικοποιητές CLIP άχρηστους για τέτοιες εργασίες, поскольку θα εμποδίσουν την αποτελεσματικότητα σημαντικά. Για να αντιμετωπίσουμε αυτό το πρόβλημα, το πλαίσιο InstructIR επιλέγει einen κωδικοποιητή προτάσεων που έχει εκπαιδευτεί για να κωδικοποιήσει προτάσεις σε einen σημαντικό χώρο εμβέλειας. Οι κωδικοποιητές προτάσεων έχουν εκπαιδευτεί σε εκατομμύρια παραδείγματα και είναι συμπαγείς και αποτελεσματικοί σε σύγκριση με τους παραδοσιακούς κωδικοποιητές CLIP, ενώ έχουν την ικανότητα να κωδικοποιήσουν τις σημασιολογικές των διαφορετικών προωθήσεων χρήστη.
Οδηγίες Κειμένου
Μια σημαντική πτυχή του πλαισίου InstructIR είναι η εφαρμογή της κωδικοποιημένης οδηγίας ως μηχανισμού ελέγχου για το μοντέλο εικόνας. Βασισμένοι σε αυτήν την ιδέα και εμπνευσμένοι από την δρομολόγηση εργασιών για πολλές εργασίες, το πλαίσιο InstructIR προτείνει einen Μπλοκ Κατασκευής Οδηγιών ή ICB για να ενεργοποιήσει μετασχηματισμούς εργασιών εντός του μοντέλου. Η παραδοσιακή δρομολόγηση εργασιών εφαρμόζει εργασίες-ειδικές δυαδικές μάσκες σε χαρακτηριστικά καναλιών. Ωστόσο, поскольку το πλαίσιο InstructIR δεν γνωρίζει την ελάττωση, αυτή η τεχνική δεν εφαρμόζεται απευθείας. Επιπλέον, για τις χαρακτηριστικές εικόνας και τις κωδικοποιημένες οδηγίες, το πλαίσιο InstructIR εφαρμόζει δρομολόγηση εργασιών και παράγει την μάσκα χρησιμοποιώντας einen γραμμικό-επίπεδο ενεργοποιημένο με την Σιγμοειδή συνάρτηση για να παράγει einen σύνολο βαρών που εξαρτώνται από τις εμβέλειες κειμένου, οπότε λαμβάνουμε einen c-διαστατική δυαδική μάσκα καναλιού. Το μοντέλο ενισχύει περαιτέρω τις συνθηκικές χαρακτηριστικές χρησιμοποιώντας einen Μπλοκ NAF και χρησιμοποιεί το Μπλοκ NAF και το Μπλοκ Οδηγίας για να συνθηκικεύσει τις χαρακτηριστικές και στο μπλοκ κωδικοποιητή και στο μπλοκ αποκωδικοποιητή.

Αν και το πλαίσιο InstructIR δεν συνθηκικεύει τις νευρωνικές φίλτρες ρητά, η μάσκα διευκολύνει το μοντέλο να επιλέξει τα κανάλια που είναι πιο σχετικά με βάση την οδηγία εικόνας και την πληροφορία.
InstructIR: Εφαρμογή και Αποτελέσματα
Το μοντέλο InstructIR είναι εκπαιδεύσιμο από άκρη σε άκρη, και το μοντέλο εικόνας δεν χρειάζεται προ-εκπαίδευση. Μόνο οι προβολές εμβέλειας κειμένου και ο κεφαλός ταξινόμησης χρειάζονται εκπαίδευση. Ο κωδικοποιητής κειμένου αρχικοποιείται χρησιμοποιώντας einen κωδικοποιητή BGE, einen κωδικοποιητή BERT-όμοιο που έχει εκπαιδευτεί σε ένα τεράστιο σύνολο εποπτευόμενων και ανεπόπτητων δεδομένων για γενικό σκοπό κωδικοποίηση προτάσεων. Το πλαίσιο InstructIR χρησιμοποιεί το μοντέλο NAFNet ως μοντέλο εικόνας, και η αρχιτεκτονική του NAFNet αποτελείται από einen 4-επίπεδο κωδικοποιητή-αποκωδικοποιητή με διαφορετικό αριθμό μπλοκ σε κάθε επίπεδο. Το μοντέλο προσθέτει επίσης 4 μεσαία μπλοκ μεταξύ του κωδικοποιητή και του αποκωδικοποιητή για να ενισχύσει περαιτέρω τις χαρακτηριστικές. Επιπλέον, αντί να συνδέσει για τις συνδέσεις skip, ο αποκωδικοποιητής εφαρμόζει πρόσθεση, και το μοντέλο InstructIR εφαρμόζει μόνο το Μπλοκ Οδηγίας για δρομολόγηση εργασιών μόνο στο κωδικοποιητή και τον αποκωδικοποιητή. Συνεχίζοντας, το μοντέλο InstructIR βελτιστοποιείται χρησιμοποιώντας την απώλεια μεταξύ της ανακτημένης εικόνας και της καθαρής εικόνας, και η απώλεια εντροπίας χρησιμοποιείται για τον κεφαλό ταξινόμησης της οδηγίας κειμένου. Το μοντέλο InstructIR χρησιμοποιεί τον βελτιστοποιητή AdamW με μέγεθος δείγματος 32 καιlearning ρυθμό 5e-4 για σχεδόν 500 επωχή, και εφαρμόζει επίσης την εκπαίδευση ρυθμού cosine annealing.既然 το μοντέλο εικόνας στο πλαίσιο InstructIR αποτελείται μόνο από 16 εκατομμύρια παραμέτρους, και υπάρχουν μόνο 100 χιλιάδες εκμαθημένες παραμέτρους προβολής κειμένου, το πλαίσιο InstructIR μπορεί να εκπαιδευτεί εύκολα σε τυπικούς GPU, μειώνοντας ainsi τους υπολογιστικούς κόστους και αυξάνοντας την εφαρμοσιμότητα.
Αποτελέσματα Πολλαπλών Ελαττωμάτων
Για πολλαπλά ελαττώματα και εργασίες ανάκτησης, το πλαίσιο InstructIR ορίζει δύο αρχικές ρυθμίσεις:
- 3D για τρία-ελαττωματικά μοντέλα για την αντιμετώπιση προβλημάτων ελαττωμάτων όπως dehazing, denoising και deraining.
- 5D για πέντε-ελαττωματικά μοντέλα για την αντιμετώπιση προβλημάτων ελαττωμάτων όπως image denoising, low light enhancements, dehazing, denoising και deraining.
Η απόδοση των μοντέλων 5D παρουσιάζεται στον ακόλουθο πίνακα και συγκρίνεται με τα καλύτερα μοντέλα ανάκτησης εικόνων και All-In-One.

Όπως μπορεί να παρατηρηθεί, το πλαίσιο InstructIR με ένα απλό μοντέλο εικόνας και μόνο 16 εκατομμύρια παραμέτρους μπορεί να αντιμετωπίσουν πέντε διαφορετικές εργασίες ανάκτησης εικόνων επιτυχώς χάρη στις οδηγίες-βασισμένες οδηγίες, και να παράγει ανταγωνιστικά αποτελέσματα. Η ακόλουθη εικόνα δείχνει την απόδοση του πλαισίου σε μοντέλα 3D, και τα αποτελέσματα είναι συγκρίσιμα με τα παραπάνω αποτελέσματα.

Το κύριο χαρακτηριστικό του πλαισίου InstructIR είναι η οδηγία-βασισμένη ανάκτηση εικόνων, και η ακόλουθη εικόνα δείχνει τις απίστευτες ικανότητες του μοντέλου InstructIR να κατανοήσει eine ευρεία γκάμα οδηγιών για eine δεδομένη εργασία. Επίσης, για μια αντίθετη οδηγία, το μοντέλο InstructIR εκτελεί μια ταυτότητα που δεν είναι αναγκαία.

Τελικές Σκέψεις
Η ανάκτηση εικόνων είναι ένα βασικό πρόβλημα στην όραση υπολογιστή, поскольку αποσκοπεί στην ανάκτηση μιας εικόνας υψηλής ποιότητας από μια που παρουσιάζει ελαττώματα. Σε χαμηλού επιπέδου όραση υπολογιστή, τα ελαττώματα είναι ένας όρος που χρησιμοποιείται για να αντιπροσωπεύσει άσχημες επιπτώσεις που παρατηρούνται σε μια εικόνα, όπως θόλωση κίνησης, ομίχλη, θόρυβος, χαμηλή δυναμική εμβέλεια και άλλα. Σε αυτό το άρθρο, abbiamo μιλήσει για το InstructIR, το πρώτο πλαίσιο ανάκτησης εικόνων που αποσκοπεί στην οδηγία του μοντέλου ανάκτησης εικόνων χρησιμοποιώντας ανθρώπινες οδηγίες. Για φυσικές γλώσσες, το μοντέλο InstructIR μπορεί να ανακτήσει εικόνες υψηλής ποιότητας από τις ελαττωματικές τους και να λάβει υπόψη πολλαπλά είδη ελαττωμάτων. Το πλαίσιο InstructIR είναι ικανό να παραδώσει απόδοση κατάσταση-of-the-τέχνη σε eine ευρεία γκάμα εργασιών ανάκτησης εικόνων, συμπεριλαμβανομένων deraining, denoising, dehazing, deblurring και ενίσχυσης εικόνων χαμηλού φωτισμού.












