Μοντέλα και πλατφόρμες AI
AnomalyGPT: Αναίρεση Βιομηχανικών Αναμαρτησιών με LVLMs
Πρόσφατα, τα Μεγάλα Μοντέλα Οπτικής Γλώσσας (LVLMs) όπως το LLava και το MiniGPT-4 έχουν αποδείξει την ικανότητα να κατανοούν εικόνες και να επιτύχουν υψηλή ακρίβεια και αποδοτικότητα σε διάφορες οπτικές εργασίες. Ενώ τα LVLMs excelling στο αναγνώριση κοινών αντικειμένων λόγω των εκτεταμένων συνόλων δεδομένων εκπαίδευσης, τους λείπει συγκεκριμένη γνώση τομέα και έχουν μια περιορισμένη κατανόηση των τοπικών λεπτομερειών εντός των εικόνων. Αυτό περιορίζει την αποτελεσματικότητά τους στις εργασίες Ανίχνευσης Βιομηχανικών Αναμαρτησιών (IAD). Από την άλλη πλευρά, τα υπάρχοντα πλαίσια IAD μπορούν μόνο να αναγνωρίσουν τις πηγές των αναμαρτησιών και απαιτούν χειροκίνητες ρυθμίσεις ορίων για να διακρίνουν μεταξύ κανονικών και αναμαρτηστικών δειγμάτων,限制οντας έτσι την πρακτική εφαρμογή τους.
Ο πρωταρχικός σκοπός ενός πλαισίου IAD είναι να ανιχνεύσει και να τοποθετήσει αναμαρτήσεις σε βιομηχανικές σκηνές και εικόνες προϊόντων. Ωστόσο, λόγω της απρόβλεπτης και σπανιότητας των δειγμάτων εικόνων του πραγματικού κόσμου, τα μοντέλα εκπαιδεύονται συνήθως μόνο με κανονικά δεδομένα. Διακρίνουν αναμαρτηστικά δείγματα από κανονικά με βάση τις αποκλίσεις από τα τυπικά δείγματα. Hiện, τα πλαίσια IAD και τα μοντέλα παρέχουν κυρίως βαθμολογίες αναμαρτησιών για τα δείγματα δοκιμής. Επιπλέον, η διάκριση μεταξύ κανονικών και αναμαρτηστικών περιπτώσεων για κάθε κατηγορία αντικειμένων απαιτεί τη χειροκίνητη ορίωση ορίων, καθιστώντας τα ακατάλληλα για πραγματικές εφαρμογές.

Για να εξερευνήσετε τη χρήση και την εφαρμογή των Μεγάλων Μοντέλων Οπτικής Γλώσσας για την αντιμετώπιση των προκλήσεων που θέτουν τα πλαίσια IAD, το AnomalyGPT, μια νέα προσέγγιση IAD βασισμένη σε LVLM, εισήχθη. Το AnomalyGPT μπορεί να ανιχνεύσει και να τοποθετήσει αναμαρτήσεις χωρίς τη χρειότητα χειροκίνητων ορίων. Επιπλέον, το AnomalyGPT μπορεί επίσης να παρέχει σχετικές πληροφορίες για την εικόνα για να αλληλεπιδράσει διαδραστικά με τους χρήστες, επιτρέποντάς τους να κάνουν ερωτήσεις με βάση την αναμαρτησία ή τις συγκεκριμένες ανάγκες τους.
Βιομηχανική Ανίχνευση Αναμαρτησιών και Μεγάλα Μοντέλα Οπτικής Γλώσσας
Τα υπάρχοντα πλαίσια IAD μπορούν να κατηγοριοποιηθούν σε δύο κατηγορίες.
- Ανίχνευση Αναμαρτησιών με βάση την Ανακατασκευή.
- Ανίχνευση Αναμαρτησιών με βάση την Εμφωλευμένη Παρουσίαση.
Σε ένα πλαίσιο Ανίχνευσης Αναμαρτησιών με βάση την Ανακατασκευή, ο πρωταρχικός σκοπός είναι να ανακατασκευάσει δείγματα αναμαρτησιών στα αντίστοιχα κανονικά αντίγραφα δειγμάτων, και να ανιχνεύσει αναμαρτήσεις με τον υπολογισμό του σφάλματος ανακατασκευής. SCADN, RIAD, AnoDDPM, και InTra χρησιμοποιούν διαφορετικά πλαίσια ανακατασκευής που κυμαίνονται από Δικτυακά Ανταγωνιστικά Μοντέλα (GAN) και αυτο-κωδικοποιητές, σε μοντέλα διαχύσεως και μετασχηματιστές.
Από την άλλη πλευρά, σε ένα πλαίσιο Ανίχνευσης Αναμαρτησιών με βάση την Εμφωλευμένη Παρουσίαση, ο πρωταρχικός σκοπός είναι να επικεντρωθεί στην μοντελοποίηση της εμφωλευμένης παρουσίας των κανονικών δεδομένων. Μέθοδοι όπως το PatchSSVD προσπαθούν να βρουν μια υπερσφαίρα που μπορεί να περιβάλλει στενά τα κανονικά δείγματα, ενώ πλαίσια όπως το PyramidFlow και το Cfl προβάλλουν τα κανονικά δείγματα σε μια κανονική κατανομή χρησιμοποιώντας ροές κανονικοποίησης. Τα πλαίσια CFA και PatchCore έχουν καθιερώσει μια μνήμη κανονικών δειγμάτων από εμφωλευμένες παρουσιάσεις, και χρησιμοποιούν την απόσταση μεταξύ της εμφωλευμένης παρουσίας του δείγματος δοκιμής και της κανονικής εμφωλευμένης παρουσίας για να ανιχνεύσουν αναμαρτήσεις.
Και οι δύο αυτές μέθοδοι ακολουθούν το «ένα αντίτυπο ένα μοντέλο», ένα παράδειγμα μάθησης που απαιτεί μεγάλο αριθμό κανονικών δειγμάτων για να μάθει τις κατανομές κάθε κατηγορίας αντικειμένων. Η απαίτηση για μεγάλο αριθμό κανονικών δειγμάτων καθιστά το ακατάλληλο για νέες κατηγορίες αντικειμένων, και με περιορισμένες εφαρμογές σε δυναμικά περιβάλλοντα προϊόντων. Από την άλλη πλευρά, το πλαίσιο AnomalyGPT χρησιμοποιεί ένα παράδειγμα μάθησης στο контέκστ για κατηγορίες αντικειμένων, επιτρέποντάς του να ενεργοποιήσει παρεμβολή μόνο με λίγα κανονικά δείγματα.
Προχωρώντας, έχουμε τα Μεγάλα Μοντέλα Οπτικής Γλώσσας ή LVLMs. LLMs ή Μεγάλα Μοντέλα Γλώσσας έχουν απολαύσει τεράστια επιτυχία στη βιομηχανία NLP, και τώρα εξερευνώνται για τις εφαρμογές τους σε οπτικές εργασίες. Το πλαίσιο BLIP-2 χρησιμοποιεί το Q-former για να εισαγάγει οπτικά χαρακτηριστικά από τον Μετασχηματιστή Όρασης στο μοντέλο Flan-T5. Επιπλέον, το πλαίσιο MiniGPT συνδέει το τμήμα εικόνας του πλαισίου BLIP-2 και το μοντέλο Vicuna με ένα γραμμικό στρώμα, και πραγματοποιεί μια δι-σταδιακή διαδικασία συνειρμού χρησιμοποιώντας δεδομένα εικόνας-κειμένου. Αυτές οι προσεγγίσεις δείχνουν ότι τα πλαίσια LLM μπορεί να έχουν κάποιες εφαρμογές για οπτικές εργασίες. Ωστόσο, αυτά τα μοντέλα έχουν εκπαιδευτεί σε γενικά δεδομένα, και τους λείπει η απαιτούμενη εξειδίκευση τομέα για ευρεία εφαρμογή.
Πώς Λειτουργεί το AnomalyGPT;
Το AnomalyGPT στην κεντρική του είναι ένα καινοτόμο διαλογικό μοντέλο IAD μεγάλης οπτικής γλώσσας που σχεδιάστηκε κυρίως για την ανίχνευση βιομηχανικών αναμαρτησιών και την τοποθέτησή τους χρησιμοποιώντας εικόνες. Το πλαίσιο AnomalyGPT χρησιμοποιεί ένα LLM και ένα προ-εκπαιδευμένο κωδικοποιητή εικόνας για να ευθυγραμμίσει εικόνες με τις αντίστοιχες περιγραφές κειμένου χρησιμοποιώντας δεδομένα αναμαρτησιών. Το μοντέλο εισάγει ένα μοντέλο αποκωδικοποιητή, και ένα μοντέλο μάθησης προώθησης για να βελτιώσει την απόδοση των συστημάτων IAD, και να επιτύχει εξομάλυνση σε επίπεδο pixel.
Αρχιτεκτονική Μοντέλου

Η παραπάνω εικόνα απεικονίζει την αρχιτεκτονική του AnomalyGPT. Το μοντέλο πρώτα περνά την εικόνα ερώτησης στο παγωμένο κωδικοποιητή εικόνας. Το μοντέλο στη συνέχεια εξάγει χαρακτηριστικά σε επίπεδο patch από τα μεσοδιαστήματα, και τα εισάγει σε einen αποκωδικοποιητή εικόνας για να υπολογίσει την ομοιότητα τους με αναμαρτηστικά και κανονικά κείμενα για να λάβει τα αποτελέσματα για την τοποθέτηση. Το μοντέλο προώθησης στη συνέχεια μετατρέπει αυτά τα αποτελέσματα σε εμφωλευμένες παρουσιάσεις που είναι κατάλληλες για να χρησιμοποιηθούν ως εισαγωγές στο LLM μαζί με τις εισαγωγές κειμένου του χρήστη. Το μοντέλο LLM στη συνέχεια χρησιμοποιεί τις εμφωλευμένες παρουσιάσεις, τις εισαγωγές εικόνας, και τις εισαγωγές κειμένου του χρήστη για να ανιχνεύσει αναμαρτήσεις, να τοποθετήσει την τοποθεσία τους, και να δημιουργήσει τελικές απαντήσεις για τον χρήστη.
Αποκωδικοποιητής
Για να επιτύχει εξομάλυνση σε επίπεδο pixel, το μοντέλο AnomalyGPT αναπτύσσει einen αποκωδικοποιητή εικόνας με βάση την αντιστοίχιση χαρακτηριστικών που υποστηρίζει τόσο τα πλαίσια IAD με λίγα δείγματα όσο και τα ακαδημαϊκά πλαίσια IAD. Η σχεδίαση του αποκωδικοποιητή που χρησιμοποιείται στο AnomalyGPT εμπνέεται από τα πλαίσια WinCLIP, PatchCore, και APRIL-GAN. Το μοντέλο διαιρεί τον κωδικοποιητή εικόνας σε 4 στάδια, και εξάγει τα μεσοδιαστήματα σε επίπεδο patch από κάθε στάδιο.
Ωστόσο, αυτά τα μεσοδιαστήματα δεν έχουν περάσει από την τελική ευθυγράμμιση εικόνας-κειμένου, και δεν μπορούν να συγκριθούν直接 με χαρακτηριστικά. Για να αντιμετωπίσουν αυτό το πρόβλημα, το μοντέλο AnomalyGPT εισάγει επιπλέον στρώματα για να προβάλει τα μεσοδιαστήματα, και να τα ευθυγραμμίσει με χαρακτηριστικά κειμένου που αντιπροσωπεύουν κανονικές και αναμαρτηστικές σημασίες.
Μοντέλο Προώθησης
Το πλαίσιο AnomalyGPT εισάγει ένα μοντέλο προώθησης που προσπαθεί να μετατρέψει το αποτέλεσμα της τοποθέτησης σε εμφωλευμένες παρουσιάσεις για να εκμεταλλευτεί τις λεπτομερείς σημασίες από εικόνες, και επίσης να διατηρεί τη σημασιολογική συνέπεια μεταξύ των εξόδων του αποκωδικοποιητή και του LLM. Επιπλέον, το μοντέλο ενσωματώνει μαθητέες εμφωλευμένες παρουσιάσεις, μη σχετικές με τις εξόδους του αποκωδικοποιητή, στο μοντέλο προώθησης για να παρέχει πρόσθετη πληροφορία για την εργασία IAD. Τέλος, το μοντέλο εισάγει τις εμφωλευμένες παρουσιάσεις και τις αρχικές πληροφορίες εικόνας στο LLM.
Το μοντέλο προώθησης αποτελείται από μαθητέες βασικές εμφωλευμένες παρουσιάσεις, και ένα συνελικτικό νευρωνικό δίκτυο. Το δίκτυο μετατρέπει το αποτέλεσμα της τοποθέτησης σε εμφωλευμένες παρουσιάσεις, και σχηματίζει ένα σύνολο εμφωλευμένων παρουσιάσεων που στη συνέχεια συνδυάζονται με τις εμφωλευμένες παρουσιάσεις εικόνας στο LLM.
Σίμωση Αναμαρτησιών
Το μοντέλο AnomalyGPT υιοθετεί τη μέθοδο NSA για να.simulate αναμαρτηστικά δεδομένα. Η μέθοδος NSA χρησιμοποιεί την τεχνική Cut-paste χρησιμοποιώντας τη μέθοδο επεξεργασίας εικόνας Poisson για να ανακουφίσει τη διακοπή που εισάγεται από το κόλληση τμημάτων εικόνας. Cut-paste είναι μια κοινή τεχνική στα πλαίσια IAD για τη δημιουργία προσομοιωμένων αναμαρτηστικών εικόνων.
Η τεχνική Cut-paste περιλαμβάνει το κόψιμο ενός μπλοκ περιοχής από μια εικόνα τυχαία, και το κόλληση σε μια τυχαία θέση σε μια άλλη εικόνα, δημιουργώντας έτσι ένα τμήμα προσομοιωμένων αναμαρτησιών. Αυτά τα προσομοιωμένα αναμαρτηστικά δείγματα μπορούν να βελτιώσουν την απόδοση των μοντέλων IAD, αλλά υπάρχει ένα μειονέκτημα, καθώς μπορούν συχνά να παράγουν ευδιάκριτες διακοπές. Η μέθοδος επεξεργασίας εικόνας Poisson στοχεύει να κλωνοποιήσει ένα αντικείμενο από μια εικόνα σε μια άλλη, λύνοντας τις μερικές διαφορικές εξισώσεις Poisson.

Η παραπάνω εικόνα απεικονίζει την σύγκριση μεταξύ Poisson και Cut-paste επεξεργασίας εικόνας. Όπως φαίνεται, υπάρχουν ορατές διακοπές στη μέθοδο Cut-paste, ενώ τα αποτελέσματα από την επεξεργασία Poisson φαίνονται πιο φυσικά.
Περιεχόμενο Ερωτήσεων και Απαντήσεων
Για να διεξαγάγει την εκπαίδευση προώθησης στο Μεγάλο Μοντέλο Οπτικής Γλώσσας, το μοντέλο AnomalyGPT γεννάει μια αντίστοιχη ερώτηση κειμένου με βάση την εικόνα αναμαρτησίας. Κάθε ερώτηση αποτελείται από δύο κύρια μέρη. Το πρώτο μέρος της ερώτησης αποτελείται από μια περιγραφή της εικόνας εισαγωγής που παρέχει πληροφορίες για τα αντικείμενα που υπάρχουν στην εικόνα μαζί με τις αναμενόμενες ιδιότητές τους. Το δεύτερο μέρος της ερώτησης είναι να ανιχνεύσει την παρουσία αναμαρτησιών μέσα στο αντικείμενο, ή να ελέγξει αν υπάρχει αναμαρτησία στην εικόνα.
Το LLM πρώτα απαντά στην ερώτηση αν υπάρχει αναμαρτησία στην εικόνα; Αν το μοντέλο ανιχνεύσει αναμαρτήσεις, συνεχίζει να καθορίζει την τοποθεσία και τον αριθμό των αναμαρτηστικών περιοχών. Το μοντέλο διαιρεί την εικόνα σε ένα πλέγμα 3×3 από διαφορετικές περιοχές για να επιτρέψει στο LLM να δείξει την θέση των αναμαρτησιών λεκτικά, όπως φαίνεται στην παρακάτω εικόνα.

Το μοντέλο LLM τροφοδοτείται με γνώσεις για την είσοδο με βασικές γνώσεις για την είσοδο που βοηθούν την κατανόηση των στοιχείων της εικόνας.
Δεδομένα και Μέτρα Αξιολόγησης
Το μοντέλο διεξάγει τους πειραματισμούς του κυρίως στα δεδομένα VisA και MVTec-AD. Το σύνολο δεδομένων MVTech-AD αποτελείται από 3629 εικόνες για εκπαίδευση, και 1725 εικόνες για δοκιμή που χωρίζονται σε 15 διαφορετικές κατηγορίες, καθιστώντας το ένα από τα πιο δημοφιλή σύνολα δεδομένων για τα πλαίσια IAD. Οι εικόνες εκπαίδευσης έχουν μόνο κανονικές εικόνες, ενώ οι εικόνες δοκιμής έχουν και κανονικές και αναμαρτηστικές εικόνες. Από την άλλη πλευρά, το σύνολο δεδομένων VisA αποτελείται από 9621 κανονικές εικόνες, και σχεδόν 1200 αναμαρτηστικές εικόνες που χωρίζονται σε 12 διαφορετικές κατηγορίες.
Συνεχίζοντας, όπως και τα υπάρχοντα πλαίσια IAD, το μοντέλο AnomalyGPT χρησιμοποιεί την AUC ή την Εμβαδόν Κάτω από την Καμπύλη Χαρακτηριστικών Λήψης ως μέτρο αξιολόγησης, με AUC σε επίπεδο pixel και εικόνας για να αξιολογήσει την απόδοση της τοποθέτησης αναμαρτησιών, και την ανίχνευση αναμαρτησιών, αντίστοιχα. Ωστόσο, το μοντέλο χρησιμοποιεί επίσης την ακρίβεια σε επίπεδο εικόνας για να αξιολογήσει την απόδοση της προτεινόμενης προσέγγισης, επειδή αυτή επιτρέπει να καθορίσει την παρουσία αναμαρτησιών χωρίς την απαίτηση για χειροκίνητη ορίωση ορίων.
Αποτελέσματα
Ποσοτικά Αποτελέσματα
Ανίχνευση Βιομηχανικών Αναμαρτησιών με Λίγα Δείγματα
Το μοντέλο AnomalyGPT συγκρίνει τα αποτελέσματά του με προηγούμενα πλαίσια ανίχνευσης αναμαρτησιών με λίγα δείγματα, συμπεριλαμβανομένων των PaDiM, SPADE, WinCLIP, και PatchCore ως βάση.

Η παραπάνω εικόνα συγκρίνει τα αποτελέσματα του μοντέλου AnomalyGPT σε σύγκριση με τα πλαίσια ανίχνευσης αναμαρτησιών με λίγα δείγματα. Σε cả τα δύο σύνολα δεδομένων, η μέθοδος που ακολουθεί το AnomalyGPT υπερέχει τις προσεγγίσεις που ακολουθούν τα προηγούμενα μοντέλα σε όρους AUC σε επίπεδο εικόνας, και επίσης επιστρέφει καλή ακρίβεια.
Ανίχνευση Βιομηχανικών Αναμαρτησιών χωρίς Εποπτεία
Σε ένα περιβάλλον εκπαίδευσης χωρίς εποπτεία με ένα μεγάλο αριθμό κανονικών δειγμάτων, το AnomalyGPT εκπαιδεύει ένα μοντέλο σε δείγματα που λαμβάνονται από όλες τις κατηγορίες σε ένα σύνολο δεδομένων. Οι開発τές του AnomalyGPT έχουν επιλέξει το πλαίσιο UniAD επειδή έχει εκπαιδευτεί στο ίδιο σύνολο και θα χρησιμεύσει ως βάση για σύγκριση. Επιπλέον, το μοντέλο συγκρίνει επίσης με τα πλαίσια JNLD και PaDim χρησιμοποιώντας το ίδιο ενοποιημένο σύνολο.

Η παραπάνω εικόνα συγκρίνει την απόδοση του AnomalyGPT σε σύγκριση με άλλα πλαίσια.
Ποιοτικά Αποτελέσματα

Η παραπάνω εικόνα απεικονίζει την απόδοση του μοντέλου AnomalyGPT στην ανίχνευση αναμαρτησιών χωρίς εποπτεία, ενώ η εικόνα που ακολουθεί δείχνει την απόδοση του μοντέλου στην ανίχνευση αναμαρτησιών με ένα δείγμα.

Το μοντέλο AnomalyGPT είναι ικανό να δείξει την παρουσία αναμαρτησιών, να σημειώσει την τοποθεσία τους, και να παρέχει αποτελέσματα τοποθέτησης σε επίπεδο pixel. Όταν το μοντέλο είναι σε μια διαδικασία μάθησης με ένα δείγμα, η απόδοση της τοποθέτησης του μοντέλου είναι ελαφρώς χαμηλότερη σε σύγκριση με την ανίχνευση αναμαρτησιών χωρίς εποπτεία λόγω της απουσίας εκπαίδευσης.
Συμπέρασμα
Το AnomalyGPT είναι ένα καινοτόμο διαλογικό μοντέλο ανίχνευσης αναμαρτησιών-οπτικής γλώσσας που σχεδιάστηκε για να εκμεταλλευτεί τις δυνατότητες των μεγάλων μοντέλων οπτικής γλώσσας. Μπορεί nicht μόνο να ανιχνεύσει αναμαρτήσεις σε μια εικόνα, αλλά και να καθορίσει την ακριβή τους τοποθεσία. Επιπλέον, το AnomalyGPT διευκολύνει διαλογικές συνομιλίες που επικεντρώνονται στην ανίχνευση αναμαρτησιών και παρουσιάζει εξαιρετική απόδοση στη μάθηση με λίγα δείγματα. Το AnomalyGPT διεισδύει στις πιθανές εφαρμογές των LVLMs στην ανίχνευση αναμαρτησιών, εισάγοντας νέες ιδέες και δυνατότητες για τη βιομηχανία IAD.












