Η γωνία του Anderson

Καλύτερη Απόδοση Μηχανικής Μάθησης Μέσω Εικόνας με Βάση CNN

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Google Research έχει προτείνει eine νέα μέθοδο για τη βελτίωση της αποτελεσματικότητας και της ακρίβειας των διαδικασιών εκπαίδευσης της μηχανικής όρασης με βάση εικόνας, βελτιώνοντας τον τρόπο με τον οποίο οι εικόνες σε ένα σύνολο δεδομένων μειώνονται στη φάση προεπεξεργασίας.

Στην έρευνα Μάθηση για την αναδιάταξη εικόνων για εργασίες μηχανικής όρασης, οι ερευνητές Hossein Talebi και Peyman Milanfar χρησιμοποιούν ένα CNN για τη δημιουργία μιας νέας υβριδικής αρχιτεκτονικής αναδιάταξης εικόνων που προκαλεί μια αξιοσημείωτη βελτίωση των αποτελεσμάτων αναγνώρισης που λαμβάνονται από τέσσερα δημοφιλή σύνολα δεδομένων μηχανικής όρασης.

Το προτεινόμενο κοινό πλαίσιο για αναγνώριση και αναδιάταξη. Πηγή: https://arxiv.org/pdf/2103.09950.pdf

Το προτεινόμενο κοινό πλαίσιο για αναγνώριση και αναδιάταξη. Πηγή: https://arxiv.org/pdf/2103.09950.pdf

Η έρευνα παρατηρεί ότι οι μεθόδοι αναδιάταξης/μεγέθυνσης που χρησιμοποιούνται目前 στις αυτοματοποιημένες διαδικασίες μηχανικής μάθησης είναιหลาย δεκαετίες πίσω, και συχνά χρησιμοποιούν μόνο βασικές μεθόδοι μεγέθυνσης bilinear, bicubic και nearest neighbor – μεθόδοι που αντιμετωπίζουν όλα τα pixel χωρίς διακρίσεις.

Αντίθετα, η προτεινόμενη μέθοδος αυξάνει τα δεδομένα εικόνας μέσω ενός CNN και ενσωματώνει αυτή την είσοδο στις αναδιαταγμένες εικόνες που θα περάσουν τελικά από την αρχιτεκτονική του μοντέλου.

Περιορισμοί Εικόνας στην Εκπαίδευση AI

Για να εκπαιδεύσετε ένα μοντέλο που ασχολείται με εικόνες, ένα πλαίσιο μηχανικής μάθησης θα περιλαμβάνει μια φάση προεπεξεργασίας, όπου μια ποικιλία εικόνων διαφορετικών μεγεθών, χώρων χρωμάτων και ανάλυσεων (που θα συμβάλλουν στο σύνολο δεδομένων εκπαίδευσης) θα μειωθούν συστηματικά και θα αναταγθούν σε σταθερές διαστάσεις και ένα σταθερό, ενιαίο φορμά.

Γενικά, αυτό θα περιλαμβάνει κάποια συμβιβασμό γύρω από το φορμά PNG, όπου θα καθοριστεί ένας συμβιβασμός μεταξύ χρόνου επεξεργασίας/πόρων, μεγέθους αρχείου και ποιότητας εικόνας.

Στις περισσότερες περιπτώσεις, οι τελικές διαστάσεις της επεξεργασμένης εικόνας είναι πολύ μικρές. Παρακάτω βλέπουμε ένα παράδειγμα της εικόνας 80×80 pixel, στην οποία έχουν δημιουργηθεί κάποια από τα πρώτα σύνολα δεδομένων deepfakes που έχουν δημιουργηθεί:

Αυτή είναι η εικόνα 80x80 pixel, στην οποία έχουν δημιουργηθεί κάποια από τα πρώτα σύνολα δεδομένων deepfakes.

Επειδή τα πρόσωπα (και άλλα πιθανά αντικείμενα) σπάνια ταιριάζουν στο απαιτούμενο τετράγωνο λόγο, μαύρες μπάρες μπορεί να προστεθούν (ή να επιτρέπεται η απόρριψη χώρου) για να ομογενοποιηθούν οι εικόνες, μειώνοντας περαιτέρω τα πραγματικά χρησιμοποιημένα δεδομένα εικόνας:

Εδώ το πρόσωπο έχει εξαχθεί από một μεγαλύτερη περιοχή εικόνας μέχρι να μειωθεί οικονομικά για να περιλαμβάνει όλη την περιοχή του προσώπου. Ωστόσο, όπως φαίνεται στα αριστερά, ένα μεγάλο μέρος της υπόλοιπης περιοχής δεν θα χρησιμοποιηθεί κατά την εκπαίδευση, προσθέτοντας μεγαλύτερο βάρος στην σημασία της ποιότητας της εικόνας των μειωμένων δεδομένων.

Εδώ το πρόσωπο έχει εξαχθεί από μια μεγαλύτερη περιοχή εικόνας μέχρι να μειωθεί οικονομικά για να περιλαμβάνει όλη την περιοχή του προσώπου. Ωστόσο, όπως φαίνεται στα δεξιά, ένα μεγάλο μέρος της υπόλοιπης περιοχής δεν θα χρησιμοποιηθεί κατά την εκπαίδευση, προσθέτοντας μεγαλύτερο βάρος στην σημασία της ποιότητας της εικόνας των μειωμένων δεδομένων.

Όπως οι ικανότητες των GPU έχουν βελτιωθεί τα τελευταία χρόνια, με τις νέες γενιές καρτών NVIDIA που εξοπλίζονται με αυξανόμενες ποσότητες βίντεο-RAM (VRAM), τα μέσα μεγέθη εικόνων που συμβάλλουν στην εκπαίδευση αρχίζουν να αυξάνονται, αν και τα 224×224 pixel παραμένουν ακόμη khá τυπικά (για παράδειγμα, είναι το μέγεθος του ResNet-50 dataset).

Μια μη μειωμένη εικόνα 224x244 pixel.

Μια μη μειωμένη εικόνα 224×244 pixel.

Προσαρμογή Δοσολόγησης στο VRAM

Ο λόγος για τον οποίο οι εικόνες πρέπει να είναι όλες του ίδιου μεγέθους είναι ότι η κατηφόρεια gradient, η μέθοδος με την οποία το μοντέλο βελτιώνεται με τον καιρό, απαιτεί ομοιόμορφα δεδομένα εκπαίδευσης.

Ο λόγος για τον οποίο οι εικόνες πρέπει να είναι τόσο μικρές είναι ότι πρέπει να φορτωθούν (πλήρως αποσυμπιεσμένες) στο VRAM κατά την εκπαίδευση σε μικρές δόσεις, συνήθως μεταξύ 6-24 εικόνων ανά δόση. Λίγες εικόνες ανά δόση, και δεν υπάρχει αρκετό υλικό ομάδας για να γενικευθεί καλά, εκτός από την επέκταση του χρόνου εκπαίδευσης; πολλές, και το μοντέλο μπορεί να αποτύχει να αποκτήσει τις απαραίτητες ιδιότητες και λεπτομέρειες (δείτε παρακάτω).

Αυτή η ‘ζωντανή φόρτωση’ τμήμα της αρχιτεκτονικής εκπαίδευσης ονομάζεται λατινική περιοχή. Αυτό είναι το σημείο όπου τα χαρακτηριστικά εξάγονται επανειλημμένα από τα ίδια δεδομένα (δηλαδή τις ίδιες εικόνες) μέχρι το μοντέλο να έχει συγκλίνει σε μια κατάσταση όπου έχει όλες τις γενικευμένες γνώσεις που χρειάζεται για να thựcεί μετασχηματισμούς σε μεταγενέστερα, μη είδικα δεδομένα του ίδιου τύπου.

Αυτή η διαδικασία γενικά διαρκεί ημέρες, αν και μπορεί να διαρκέσει ακόμη και ένα μήνα ή περισσότερο συνεχούς και απαραίτητου υψηλού όγκου 24/7 σκέψης για να επιτύχει χρήσιμη γενίκευση. Οι αύξεις του μεγέθους VRAM είναι μόνο χρήσιμες μέχρι ένα σημείο, поскольку ακόμη και μικρές αυξήσεις της ανάλυσης εικόνας μπορούν να έχουν einen порядку-μεγέθους επίδραση στην επεξεργασία ικανότητας, και σχετικές επιπτώσεις στην ακρίβεια που μπορεί να μην είναι πάντα ευνοϊκές.

Η χρήση μεγαλύτερης ικανότητας VRAM για να φιλοξενήσει μεγαλύτερες δόσεις είναι επίσης ένα μεικτό ευλογία, поскольку οι μεγαλύτερες ταχύτητες εκπαίδευσης που λαμβάνονται από αυτό είναι πιθανό να αντισταθμιστούν από λιγότερο ακριβή αποτελέσματα.

Επομένως,既然 η αρχιτεκτονική εκπαίδευσης είναι τόσο περιορισμένη, οτιδήποτε μπορεί να επηρεάσει μια βελτίωση μέσα στα υπάρχοντα όρια του πipelines είναι ένα αξιοσημείωτο επίτευγμα.

Πώς η Υπεροχή της Μείωσης Βοηθά

Η τελική ποιότητα μιας εικόνας που θα περιλαμβάνεται σε ένα σύνολο δεδομένων εκπαίδευσης έχει αποδειχθεί ότι έχει μια βελτιωτική επίδραση στο αποτέλεσμα της εκπαίδευσης, ιδιαίτερα σε εργασίες αναγνώρισης αντικειμένων. Το 2018 ερευνητές από το Ινστιτούτο Max Planck για τα Ευφυή Συστήματα υποστήριξαν ότι η επιλογή μεθόδου δειγματοληψίας έχει αξιοσημείωτη επίδραση στην απόδοση και τα αποτελέσματα της εκπαίδευσης.

Επιπλέον, προηγούμενη εργασία από την Google (συγγραμμένη από τους συγγραφείς της νέας έρευνας) έχει βρει ότι η ακρίβεια ταξινόμησης μπορεί να βελτιωθεί με τη διατήρηση του ελέγχου των αρτεφάκτων συμπίεσης στις εικόνες του συνόλου δεδομένων.

Η αρχιτεκτονική CNN για τον προτεινόμενο αλγόριθμο μείωσης της Google Research.

Η αρχιτεκτονική CNN για τον προτεινόμενο αλγόριθμο μείωσης της Google Research.

Το μοντέλο CNN που κατασκευάστηκε στην νέα μεθοδολογία συνδυάζει την αναδιάταξη bilinear με μια λειτουργία ‘skip connection’ που μπορεί να ενσωματώσει την έξοδο από το εκπαιδευμένο δίκτυο στην αναδιαταγμένη εικόνα.

Αντίθετα με μια τυπική αρχιτεκτονική κωδικοποιητή/αποκωδικοποιητή, η νέα πρόταση μπορεί να ενεργήσει όχι μόνο ως feed-forward βότσαλο, αλλά και ως αντίστροφο βότσαλο για αύξηση σε οποιοδήποτε στόχο μέγεθος και/ή λόγο. Επιπλέον, η ‘τυπική’ μέθοδος δειγματοληψίας μπορεί να αντικατασταθεί με οποιαδήποτε άλλη κατάλληλη παραδοσιακή μέθοδο, όπως η Lanczos.

Λεπτομέρειες Υψηλής Συχνότητας

Η νέα μέθοδος παράγει εικόνες που φαίνεται να ‘ψήνονται’ κλειδιά χαρακτηριστικά (που θα αναγνωριστούν τελικά από τη διαδικασία εκπαίδευσης)直接 στην πηγή εικόνας. Σε αισθητικές όρους, τα αποτελέσματα είναι μη συμβατικά:

Η νέα μέθοδος εφαρμοσμένη σε τέσσερα δίκτυα – Inception V2; DenseNet-121; ResNet-50; και MobileNet-V2. Τα αποτελέσματα της μεθόδου μείωσης εικόνας της Google Research παράγουν εικόνες με φανερή συσσώρευση pixel, προβλέποντας τα κλειδιά χαρακτηριστικά που θα αναγνωριστούν κατά τη διαδικασία εκπαίδευσης.

Η νέα μέθοδος εφαρμοσμένη σε τέσσερα δίκτυα – Inception V2; DenseNet-121; ResNet-50; και MobileNet-V2. Τα αποτελέσματα της μεθόδου μείωσης εικόνας της Google Research παράγουν εικόνες με φανερή συσσώρευση pixel, προβλέποντας τα κλειδιά χαρακτηριστικά που θα αναγνωριστούν κατά τη διαδικασία εκπαίδευσης.

Οι ερευνητές σημειώνουν ότι αυτές οι αρχικές πειραματικές μελέτες είναι αποκλειστικά βελτιωμένες για εργασίες αναγνώρισης εικόνας, και ότι στις δοκιμές το CNN-ενεργοποιημένο ‘learned resizer’ τους ήταν σε θέση να επιτύχει βελτιωμένα ποσοστά σφάλματος σε τέτοιες εργασίες. Οι ερευνητές σκοπεύουν στο μέλλον να εφαρμόσουν τη μέθοδο σε άλλους τύπους εφαρμογών μηχανικής όρασης με βάση εικόνας.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai