Η γωνία του Anderson

Χρήση της Συμπίεσης JPEG για Βελτίωση της Εκπαίδευσης των Νευρωνικών Δικτύων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

Μια νέα έρευνα από τον Καναδά έχει προτείνει ένα πλαίσιο που εισάγει σκόπιμα τη συμπίεση JPEG στη διαδικασία εκπαίδευσης ενός νευρωνικού δικτύου και καταφέρνει να λάβει καλύτερα αποτελέσματα – και καλύτερη αντοχή σε επιθετικές επιθέσεις.

Αυτή είναι μια相当 ριζοσπαστική ιδέα,既然 η τρέχουσα γενική σοφία είναι ότι τα αρτεφάκτα JPEG, τα οποία είναι βελτιστοποιημένα για ανθρώπινη προβολή και όχι για μηχανική μάθηση, έχουν γενικά μια επιζήμια επίδραση στα νευρωνικά δίκτυα που εκπαιδεύονται με δεδομένα JPEG.

Ένα παράδειγμα της διαφοράς στη σαφήνεια μεταξύ εικόνων JPEG που συμπιέζονται σε διαφορετικές τιμές απώλειας (υψηλότερη απώλεια επιτρέπει μικρότερο μέγεθος αρχείου, με το κόστος της διασάφισης και της ζώνης χρωματικών γραδίων, μεταξύ άλλων τύπων αρτεφάκτων). Πηγή: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Ένα παράδειγμα της διαφοράς στη σαφήνεια μεταξύ εικόνων JPEG που συμπιέζονται σε διαφορετικές τιμές απώλειας (υψηλότερη απώλεια επιτρέπει μικρότερο μέγεθος αρχείου, με το κόστος της διασάφισης και της ζώνης χρωματικών γραδίων, μεταξύ άλλων τύπων αρτεφάκτων). Πηγή: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Μια έκθεση του 2022 από το Πανεπιστήμιο του Μέριλαντ και την Facebook AI υποστήριξε ότι η συμπίεση JPEG “προκαλεί σημαντική επιβάρυνση απόδοσης” στην εκπαίδευση των νευρωνικών δικτύων, παρά την πρώτερη εργασία που ισχυρίστηκε ότι τα νευρωνικά δίκτυα είναι σχετικά ανθεκτικά στα αρτεφάκτα συμπίεσης εικόνας.

Ένα χρόνο πριν από αυτό, μια νέα σκέψη είχε εμφανιστεί στη βιβλιογραφία: ότι η συμπίεση JPEG θα μπορούσε να αξιοποιηθεί για βελτιωμένα αποτελέσματα στην εκπαίδευση μοντέλων.

Ωστόσο, αν και οι συγγραφείς του εγγράφου κατάφεραν να λάβουν βελτιωμένα αποτελέσματα στην εκπαίδευση εικόνων JPEG διαφορετικής ποιότητας, το μοντέλο που πρότειναν ήταν τόσο σύνθετο και βαρύ που δεν ήταν πρακτικό. Επιπλέον, η χρήση των προεπιλογών JPEG (quantization) αποδείχθηκε ένα εμπόδιο στην αποτελεσματικότητα της εκπαίδευσης.

Ένα μεταγενέστερο έργο (2023’s JPEG Compliant Compression for DNN Vision) πειραματίστηκε με ένα σύστημα που έλαβε ελαφρώς καλύτερα αποτελέσματα από εικόνες JPEG που συμπιέζονται με τη χρήση eines παγωμένου βαθύ νευρωνικού δικτύου (DNN) μοντέλου. Ωστόσο, η παγίωση μερών του μοντέλου κατά την εκπαίδευση έχει την τάση να μειώνει την ευελιξία του μοντέλου, καθώς και την ευρύτερη αντοχή του σε νέες δεδομένες.

JPEG-DL

Αντίθετα, η νέα εργασία, με τίτλο JPEG Inspired Deep Learning, προσφέρει μια πολύ απλούστερη αρχιτεκτονική, η οποία μπορεί ακόμη και να επιβληθεί σε υφιστάμενα μοντέλα.

Οι ερευνητές, από το Πανεπιστήμιο του Γουότερλου, δηλώνουν:

‘Τα αποτελέσματα δείχνουν ότι το JPEG-DL υπερέχει σημαντικά και συνεχώς τον τυπικό DL σε διάφορες αρχιτεκτονικές DNN, με μια αμελητέα αύξηση της复雑ότητας του μοντέλου.

Συγκεκριμένα, το JPEG-DL βελτιώνει την ακρίβεια ταξινόμησης έως και 20,9% σε ορισμένες λεπτομερείς εργασίες ταξινόμησης, ενώ προστίθεται μόνο 128 εκπαιδεύσιμες παραμέτρους στη διαδικασία DL. Επιπλέον, η υπεροχή του JPEG-DL έναντι του τυπικού DL επιδεικνύεται από την αυξημένη αντοχή των εκμαθημένων μοντέλων και τη μείωση του μεγέθους των αρχείων εικόνας.’

Οι συγγραφείς υποστηρίζουν ότι ένας βέλτιστος βαθμός συμπίεσης JPEG μπορεί να βοηθήσει ένα νευρωνικό δίκτυο να διακρίνει το κεντρικό αντικείμενο/των μιας εικόνας. Στο παρακάτω παράδειγμα, βλέπουμε τα αποτελέσματα της βάσης (αριστερά) που συγχέουν το πουλί με το φόντο όταν οι χαρακτηριστικές λαμβάνονται από το νευρωνικό δίκτυο. Αντίθετα, το JPEG-DL (δεξιά) καταφέρνει να διακρίνει και να περιγράφει το αντικείμενο της φωτογραφίας.

Δοκιμές ενάντια σε μεθόδους βάσης για το JPEG-DL. Πηγή: https://arxiv.org/pdf/2410.07081

Δοκιμές ενάντια σε μεθόδους βάσης για το JPEG-DL. Πηγή: https://arxiv.org/pdf/2410.07081

‘Αυτό το φαινόμενο,’ εξηγούν, ‘που ονομάζεται “συμπίεση βοηθά” στο έγγραφο του 2021, δικαιολογείται από το γεγονός ότι η συμπίεση μπορεί να αφαιρέσει θόρυβο και ενοχλητικά χαρακτηριστικά φόντου, και έτσι να υπογραμμίσει το κύριο αντικείμενο μιας εικόνας, το οποίο βοηθά τα DNN να κάνουν καλύτερες προβλέψεις.’

Μέθοδος

Το JPEG-DL εισάγει einen διαφορίσιμο soft quantizer, ο οποίος αντικαθιστά την μη διαφορίσιμη quantization λειτουργία σε μια τυπική διαδικασία βελτιστοποίησης JPEG.

Αυτό επιτρέπει την gradient-based βελτιστοποίηση των εικόνων. Αυτό δεν είναι δυνατό σε συμβατική κωδικοποίηση JPEG, η οποία χρησιμοποιεί einen uniform quantizer με μια στρογγυλοποίηση που προσεγγίζει τον πλησιέστερο συντελεστή.

Η διαφορίσιμη схηματική του JPEG-DL επιτρέπει την κοινή βελτιστοποίηση τόσο των παραμέτρων του μοντέλου εκπαίδευσης όσο και της quantization (συμπίεσης) JPEG. Κοινή βελτιστοποίηση σημαίνει ότι και το μοντέλο και τα δεδομένα εκπαίδευσης προσαρμόζονται ομαδικά στην διαδικασία end-to-end, και δεν χρειάζεται παγίωση στρωμάτων.

Ουσιαστικά, το σύστημα προσαρμόζει τη συμπίεση JPEG ενός (ακατέργαστου) συνόλου δεδομένων για να ταιριάζει στη λογική της διαδικασίας γενίκευσης.

Σχέδιο για το JPEG-DL.

Σχέδιο για το JPEG-DL.

Μπορεί κανείς να υποθέσει ότι τα ακατέργαστα δεδομένα θα ήταν το ιδανικό έδαφος για εκπαίδευση: αφού οι εικόνες είναι πλήρως αποσυμπιεζμένες σε ένα κατάλληλο πλήρες χρωματικό χώρο όταν τρέχουν σε δόσεις: τι διαφορά κάνει η αρχική μορφή;

Λοιπόν,既然 η συμπίεση JPEG είναι βελτιστοποιημένη για ανθρώπινη προβολή, απορρίπτει περιοχές λεπτομέρειας ή χρώματος με τρόπο που συμφωνεί με αυτόν τον στόχο. Σε μια εικόνα μιας λίμνης κάτω από einen γαλάζιο ουρανό, αυξημένες επιπέδα συμπίεσης θα εφαρμοστούν στον ουρανό, επειδή δεν περιέχει keine “απαραίτητες” λεπτομέρειες.

Αντίθετα, ένα νευρωνικό δίκτυο λείπει των ιδιόμορφων φίλτρων που μας επιτρέπουν να εστιάσει στο κεντρικό αντικείμενο. Αντίθετα, είναι πιθανό να θεωρήσει οποιαδήποτε ζώνη αρτεφάκτων στον ουρανό ως έγκυρα δεδομένα που πρέπει να ενσωματωθούν στο latent space του.

Αν και ένας άνθρωπος θα απορρίψει τη ζώνη στον ουρανό, σε μια εικόνα που συμπιέζεται πολύ (αριστερά), ένα νευρωνικό δίκτυο δεν έχει ιδέα ότι αυτό το περιεχόμενο πρέπει να απορριφθεί, και θα χρειαστεί μια εικόνα υψηλότερης ποιότητας (δεξιά). Πηγή: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Αν και ένας άνθρωπος θα απορρίψει τη ζώνη στον ουρανό, σε μια εικόνα που συμπιέζεται πολύ (αριστερά), ένα νευρωνικό δίκτυο δεν έχει ιδέα ότι αυτό το περιεχόμενο πρέπει να απορριφθεί, και θα χρειαστεί μια εικόνα υψηλότερης ποιότητας (δεξιά). Πηγή: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Επομένως, ένας βαθμός συμπίεσης JPEG είναι απίθανο να ταιριάζει σε ολόκληρο το περιεχόμενο ενός συνόλου δεδομένων εκπαίδευσης, εκτός αν αντιπροσωπεύει ένα πολύ συγκεκριμένο domaine. Εικόνες πλήθους θα απαιτούν πολύ λιγότερη συμπίεση από μια στενή εστίαση σε ένα πουλί, για παράδειγμα.

Οι συγγραφείς παρατηρούν ότι εκείνοι που δεν είναι εξοικειωμένοι με τις προκλήσεις της quantization, αλλά που είναι εξοικειωμένοι με τις βασικές αρχές της transformers αρχιτεκτονικής, μπορούν να θεωρήσουν αυτές τις διαδικασίες ως eine ‘attention operation’, ευρύτερα.

Δεδομένα και Δοκιμές

Το JPEG-DL αξιολογήθηκε ενάντια σε αρχιτεκτονικές transformer-based και convolutional νευρωνικά δίκτυα (CNNs). Οι αρχιτεκτονικές που χρησιμοποιήθηκαν ήταν EfficientFormer-L1: ResNet: VGG: MobileNet: και ShuffleNet.

Οι εκδόσεις ResNet που χρησιμοποιήθηκαν ήταν συγκεκριμένες για το CIFAR σύνολο δεδομένων: ResNet32, ResNet56 και ResNet110. VGG8 και VGG13 επιλέχθηκαν για τις δοκιμές VGG-based.

Για τα CNN, η μεθοδολογία εκπαίδευσης προήλθε από το έργο του 2020 Contrastive Representation Distillation (CRD). Για το EfficientFormer-L1 (transformer-based), η μεθοδολογία εκπαίδευσης από το έργο του 2023 Initializing Models with Larger Ones χρησιμοποιήθηκε.

Για τις λεπτομερείς εργασίες που εμφανίζονται στις δοκιμές, τέσσερα σύνολα δεδομένων χρησιμοποιήθηκαν: Stanford Dogs: το Λουλούδια του Πανεπιστημίου της Οξφόρδης: CUB-200-2011 (Πουλιά CalTech): και Πets (‘Γάτες και Σκύλοι’, μια συνεργασία μεταξύ του Πανεπιστημίου της Οξφόρδης και της Ινδίας).

Για τις λεπτομερείς εργασίες στα CNN, οι συγγραφείς χρησιμοποίησαν PreAct ResNet-18 και DenseNet-BC. Για το EfficientFormer-L1, η μεθοδολογία που περιγράφηκε στο προαναφερθέν Initializing Models With Larger Ones χρησιμοποιήθηκε.

Σε όλες τις δοκιμές CIFAR-100 και τις λεπτομερείς εργασίες, οι διάφορες μεγεθύνσεις των Discrete Cosine Transform (DCT) συχνοτήτων στην προσέγγιση συμπίεσης JPEG χειρίστηκαν με τον Adam βελτιστοποιητή, για να προσαρμόσουν την ταχύτητα εκμάθησης για το στρώμα JPEG σε όλα τα μοντέλα που δοκιμάστηκαν.

Στις δοκιμές για το ImageNet-1K, σε όλες τις πειραματικές διαδικασίες, οι συγγραφείς χρησιμοποίησαν PyTorch, με SqueezeNet, ResNet-18 και ResNet-34 ως τα βασικά μοντέλα.

Για την αξιολόγηση της βελτιστοποίησης του στρώματος JPEG, οι ερευνητές χρησιμοποίησαν Stochastic Gradient Descent (SGD) αντί του Adam, για πιο σταθερή απόδοση. Ωστόσο, για τις δοκιμές ImageNet-1K, η μεθοδολογία από το έγγραφο του 2019 Learned Step Size Quantization χρησιμοποιήθηκε.

Πάνω από την ακρίβεια επαλήθευσης για την βάση και το JPEG-DL στο CIFAR-100, με τυποποιημένες και μέσες αποκλίσεις που υπολογίζονται από τρεις εκτελέσεις. Κάτω, η ακρίβεια επαλήθευσης για διάφορες λεπτομερείς εργασίες ταξινόμησης εικόνας, σε διάφορες αρχιτεκτονικές μοντέλων, επίσης, υπολογισμένες από τρεις εκτελέσεις.

Πάνω από την ακρίβεια επαλήθευσης για την βάση και το JPEG-DL στο CIFAR-100, με τυποποιημένες και μέσες αποκλίσεις που υπολογίζονται από τρεις εκτελέσεις. Κάτω, η ακρίβεια επαλήθευσης για διάφορες λεπτομερείς εργασίες ταξινόμησης εικόνας, σε διάφορες αρχιτεκτονικές μοντέλων, επίσης, υπολογισμένες από τρεις εκτελέσεις.

Σχολιάζοντας την πρώτη σειρά αποτελεσμάτων που απεικονίζονται παραπάνω, οι συγγραφείς δηλώνουν:

‘Σε όλα τα επτά μοντέλα που δοκιμάστηκαν για το CIFAR-100, το JPEG-DL παρέχει συνεχώς βελτιώσεις, με κέρδη έως και 1,53% στην ακρίβεια επαλήθευσης. Σε τις λεπτομερείς εργασίες, το JPEG-DL προσφέρει μια σημαντική αύξηση απόδοσης, με βελτιώσεις έως και 20,90% σε όλα τα σύνολα δεδομένων με δύο διαφορετικά μοντέλα.’

Τα αποτελέσματα για τις δοκιμές ImageNet-1K εμφανίζονται παρακάτω:

Αποτελέσματα ακρίβειας επαλήθευσης για το ImageNet σε διάφορες αρχιτεκτονικές.

Αποτελέσματα ακρίβειας επαλήθευσης για το ImageNet σε διάφορες αρχιτεκτονικές.

Εδώ το έγγραφο αναφέρει:

‘Με μια αμελητέα αύξηση της phứcικότητας (προσθέτοντας 128 παραμέτρους), το JPEG-DL επιτυγχάνει μια αύξηση της ακρίβειας επαλήθευσης 0,31% για το SqueezeNetV1.1 σε σύγκριση με την βάση που χρησιμοποιεί μια seule στρογγυλοποίηση.

‘Αυξάνοντας τον αριθμό των στρογγυλοποιήσεων σε πέντε, παρατηρούμε μια επιπλέον βελτίωση της ακρίβειας 0,20%, οδηγώντας σε μια συνολική αύξηση της ακρίβειας 0,51% σε σύγκριση με την βάση.’

Οι ερευνητές επίσης δοκιμάστηκαν το σύστημα χρησιμοποιώντας δεδομένα που έχουν υποστεί επιθέσεις adversarial με τις προσεγγίσεις Fast Gradient Signed Method (FGSM) και Projected Gradient Descent (PGD).

Οι επιθέσεις διεξήχθησαν στο CIFAR-100 σε δύο από τα μοντέλα:

Αποτελέσματα δοκιμών για το JPEG-DL, ενάντια σε δύο τυπικές αρχιτεκτονικές επιθέσεων.

Αποτελέσματα δοκιμών για το JPEG-DL, ενάντια σε δύο τυπικές αρχιτεκτονικές επιθέσεων.

Οι συγγραφείς δηλώνουν:

‘Τα μοντέλα JPEG-DL βελτιώνουν σημαντικά την αντοχή στις επιθέσεις, με βελτιώσεις έως και 15% για το FGSM και 6% για το PGD.’

Επιπλέον, όπως απεικονίζεται νωρίτερα στο άρθρο, οι συγγραφείς διεξήγαγαν μια σύγκριση των εξαγόμεων χαρτών χαρακτηριστικών χρησιμοποιώντας GradCAM++ – ένα πλαίσιο που μπορεί να υπογραμμίσει τα εξαγόμενα χαρακτηριστικά με οπτικό τρόπο.

Εικονογράφηση GradCAM++ για την ταξινόμηση εικόνας βάσης και JPEG-DL, με εξαγόμενα χαρακτηριστικά που υπογραμμίζονται.

Εικονογράφηση GradCAM++ για την ταξινόμηση εικόνας βάσης και JPEG-DL, με εξαγόμενα χαρακτηριστικά που υπογραμμίζονται.

Το έγγραφο σημειώνει ότι το JPEG-DL παράγει ένα βελτιωμένο αποτέλεσμα, και ότι σε μια περίπτωση ήταν ακόμη και σε θέση να ταξινομήσει μια εικόνα που η βάση απέτυχε να αναγνωρίσει. Σχετικά με την προηγουμένως απεικονισμένη εικόνα με τα πουλιά, οι συγγραφείς δηλώνουν:

‘Είναι φανερό ότι οι χάρτες χαρακτηριστικών από το μοντέλο JPEG-DL δείχνουν σημαντικά καλύτερη αντίθεση μεταξύ των πληροφοριών του προσώπου (του πουλιού) και του φόντου σε σύγκριση με τους χάρτες χαρακτηριστικών που παράγονται από το μοντέλο βάσης.

‘Συγκεκριμένα, το αντικείμενο του προσώπου στους χάρτες χαρακτηριστικών του JPEG-DL είναι περικυκλωμένο από ένα καλά καθορισμένο περίγραμμα, καθιστώντας το οπτικά διακρινόμενο από το φόντο.

‘Αντίθετα, οι χάρτες χαρακτηριστικών του μοντέλου βάσης δείχνουν μια πιο ομοιόμορφη δομή, όπου το πρόσωπο περιέχει υψηλότερη ενέργεια σε χαμηλές συχνότητες, προκαλώντας το να συγχωνεύεται ομαλά με το φόντο.’

Συμπέρασμα

Το JPEG-DL προορίζεται για χρήση σε καταστάσεις όπου τα ακατέργαστα δεδομένα είναι διαθέσιμα – αλλά θα ήταν πιο ενδιαφέρον να δούμε αν κάποια από τις αρχές που παρουσιάζονται σε αυτό το έργο θα μπορούσαν να εφαρμοστούν σε συμβατική εκπαίδευση συνόλου δεδομένων, όπου το περιεχόμενο μπορεί να είναι χαμηλότερης ποιότητας (όπως συχνά συμβαίνει με datasets που έχουν συλλεχθεί από το διαδίκτυο).

Ως προς τώρα, αυτό παραμένει σε μεγάλο βαθμό ένα πρόβλημα αναnotation, αν και έχει αντιμετωπιστεί σε αναγνώριση εικόνας με βάση την κυκλοφορία και αλλού.

 

Πρώτη δημοσίευση Πέμπτη, 10 Οκτωβρίου 2024

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai