Μοντέλα και πλατφόρμες AI

Υψηλής Πrecision Σημαντική Επεξεργασία Εικόνας με EditGAN

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Γεννητικές Αντισταθμιστικές Δίκτυα ή GANs έχουν απολαύσει νέες εφαρμογές στη βιομηχανία επεξεργασίας εικόνας. Για τους τελευταίους μήνες, το EditGAN κερδίζει δημοτικότητα στη βιομηχανία AI/ML επειδή είναι μια καινοτόμος μέθοδος για υψηλής ακρίβειας και υψηλής ποιότητας σημασιολογική επεξεργασία εικόνας. 

Θα μιλήσουμε για το μοντέλο EditGAN σε λεπτομέρειες και θα σας πούμε γιατί μπορεί να αποδειχθεί ένα ορόσημο στη βιομηχανία σημασιολογικής επεξεργασίας εικόνας.

Έτσι, ας ξεκινήσουμε. Αλλά πριν να μάθουμε τι είναι το EditGAN, είναι σημαντικό για μας να κατανοήσουμε τη σημασία του EditGAN και γιατί είναι ένα σημαντικό βήμα προς τα εμπρός. 

Γιατί EditGAN;

Αν και οι παραδοσιακές αρχιτεκτονικές GAN έχουν βοηθήσει τη βιομηχανία επεξεργασίας εικόνας που βασίζεται σε AI να προχωρήσει σημαντικά, υπάρχουν κάποια μεγάλα προβλήματα με την κατασκευή μιας αρχιτεκτονικής GAN από την αρχή. 

  1. Κατά τη διάρκεια της φάσης εκπαίδευσης, μια αρχιτεκτονική GAN απαιτεί μεγάλη ποσότητα ετικετών δεδομένων με σημασιολογικές αναnotations. 
  2. Είναι ικανές να παρέχουν μόνο υψηλό επίπεδο ελέγχου. 
  3. Και συχνά, απλά.interpolate μεταξύ εικόνων. 

Μπορεί να παρατηρηθεί ότι αν και οι παραδοσιακές αρχιτεκτονικές GAN κάνουν τη δουλειά, δεν είναι αποτελεσματικές για ευρεία κλίμακα ανάπτυξη. Η κατώτερη αποτελεσματικότητα των παραδοσιακών αρχιτεκτονικών GAN είναι ο λόγος για τον οποίο εισαχθηκε το EditGAN από την NVIDIA (NVDA ) το 2022. 

Το EditGAN προτείνεται να είναι μια αποτελεσματική μέθοδος για υψηλής ακρίβειας και υψηλής ποιότητας σημασιολογική επεξεργασία εικόνας με τη δυνατότητα να επιτρέπει στους χρήστες να επεξεργάζονται εικόνες τροποποιώντας τις υψηλά λεπτομερείς μάσκες τμηματοποίησης μιας εικόνας. Ένας από τους λόγους για τους οποίους το EditGAN είναι μια κλιμακωτή μέθοδος για εργασίες επεξεργασίας εικόνας είναι η αρχιτεκτονική του. 

Το μοντέλο EditGAN είναι κατασκευασμένο σε ένα πλαίσιο GAN που μοντελοποιεί εικόνες και τις σημασιολογικές τμηματοποιήσεις τους από κοινού, και απαιτεί μόνο μια χούφτα ετικετών ή αναnotations δεδομένων εκπαίδευσης. Οι développers του EditGAN έχουν προσπαθήσει να ενσωματώσουν μια εικόνα στο latent χώρο του GAN για να τροποποιήσουν αποτελεσματικά την εικόνα πραγματοποιώντας условιακό λανθάνων κώδικα βελτιστοποίησης σύμφωνα με την επεξεργασία τμηματοποίησης. Επιπλέον, για να amortize την βελτιστοποίηση, το μοντέλο προσπαθεί να βρει “διορθωτικά διανύσματα” στο latent χώρο που πραγματοποιούν τις διορθώσεις. 

Η αρχιτεκτονική του πλαισίου EditGAN επιτρέπει στο μοντέλο να μάθει ένα αυθαίρετο αριθμό διορθωτικών διανυσμάτων που μπορούν να εφαρμοστούν trực tiếp σε άλλες εικόνες με υψηλή ταχύτητα και αποτελεσματικότητα. Επιπλέον, τα πειραματικά αποτελέσματα δείχνουν ότι το EditGAN μπορεί να επεξεργαστεί εικόνες με ένα ποτέ見 level λεπτομέρειας ενώ διατηρεί την ποιότητα της εικόνας στο μέγιστο. 

Για να συνοψίσουμε γιατί χρειαζόμαστε το EditGAN, είναι το πρώτο GAN-βασισμένο πλαίσιο επεξεργασίας εικόνας που προσφέρει

  1. Πολύ υψηλής ακρίβειας επεξεργασία. 
  2. Μπορεί να εργαστεί με μια χούφτα ετικετών δεδομένων. 
  3. Μπορεί να αναπτυχθεί αποτελεσματικά σε πραγματικές συνθήκες. 
  4. Επιτρέπει την σύνθεση για πολλαπλές διορθώσεις ταυτόχρονα. 
  5. Εργάζεται σε GAN-γεννημένες, πραγματικές ενσωματωμένες και ακόμη εκτός домένης εικόνες. 

Υψηλής Πrecision Σημαντική Επεξεργασία Εικόνας με EditGAN 

Το StyleGAN2, ένα state-of-the-art GAN πλαίσιο για σύνθεση εικόνας, είναι το πρωτεύον συνθετικό στοιχείο του EditGAN. Το StyleGAN2 πλαίσιο χαρτογραφεί λανθάνων κώδικες που drawn από μια πηγή multivariate κανονικής κατανομής, και χαρτογραφεί τους σε πραγματικές εικόνες. 

Το StyleGAN2 είναι ένα βαθύ γεννητικό μοντέλο που έχει εκπαιδευτεί να συνθέσει εικόνες της υψηλότερης ποιότητας δυνατής μαζί με την απόκτηση μιας σημασιολογικής κατανόησης των εικόνων που μοντελοποιούνται. 

Τμηματοποίηση Εκπαίδευσης και Σύλλογη

Το μοντέλο EditGAN ενσωματώνει μια εικόνα στο latent χώρο του GAN χρησιμοποιώντας βελτιστοποίηση, και einen encoder για να πραγματοποιήσει τμηματοποίηση σε μια νέα εικόνα, και εκπαίδευση του κλάδου τμηματοποίησης. Το πλαίσιο EditGAN συνεχίζει να κατασκευάζεται σε προηγούμενες εργασίες, και εκπαιδεύει einen encoder για να ενσωματώσει τις εικόνες στο latent χώρο. Ο πρωτεύων στόχος εδώ είναι να εκπαιδεύσει τον encoder που αποτελείται από τυπικά pixel-wise L2 και LPIPS κατασκευαστικές απώλειες χρησιμοποιώντας δείγματα από GAN, και πραγματικά δεδομένα εκπαίδευσης. Επιπλέον, το μοντέλο επίσης ρυθμίζει τον encoder ρητά χρησιμοποιώντας τους λανθάνων κώδικες όταν εργάζεται με τα δείγματα GAN. 

Αποτέλεσμα, το μοντέλο ενσωματώνει τις ετικετές εικόνες από το σύνολο δεδομένων που ετικετώνεται με σημασιολογική τμηματοποίηση στο latent χώρο, και χρησιμοποιεί cross entropy απώλεια για να εκπαιδεύσει τον κλάδο τμηματοποίησης του γεννήτορα. 

Χρήση Τμηματοποίησης Επεξεργασίας για να Βρείτε Σημασιολογία στο Latent Χώρο

Ο πρωτεύων στόχος του EditGAN είναι να εκμεταλλευτεί την κοινή κατανομή σημασιολογικών τμηματοποιήσεων και εικόνων για υψηλής ακρίβειας επεξεργασία εικόνας. Ας πούμε ότι έχουμε μια εικόνα x που πρέπει να επεξεργαστεί, έτσι το μοντέλο ενσωματώνει την εικόνα στο latent χώρο του EditGAN ή χρησιμοποιεί τα δείγματα εικόνας από το μοντέλο itu. Ο κλάδος τμηματοποίησης τότε γεννά y ή την αντίστοιχη τμηματοποίηση κυρίως επειδή και οι RGB εικόνες & τμηματοποιήσεις μοιράζονται τους ίδιους λανθάνων κώδικες w. Οι développers μπορούν τότε να χρησιμοποιήσουν οποιοδήποτε εργαλείο ετικέτας ή ψηφιακής ζωγραφικής για να τροποποιήσουν την τμηματοποίηση & να την επεξεργαστούν χειροκίνητα σύμφωνα με τις απαιτήσεις τους. 

Διάφορες Τρόποι Επεξεργασίας κατά τη διάρκεια Σύλλογης

Οι λανθάνων διανύσματα επεξεργασίας που λαμβάνονται χρησιμοποιώντας βελτιστοποίηση μπορούν να περιγραφούν ως σημασιολογικά σημαντικά, και συχνά είναι disentangled με διαφορετικά χαρακτηριστικά. Έτσι, για να επεξεργαστεί μια νέα εικόνα, το μοντέλο μπορεί να ενσωματώσει την εικόνα στο latent χώρο, και να πραγματοποιήσει τις ίδιες επεξεεργασίες που το μοντέλο μάθει προηγουμένως, χωρίς να πραγματοποιήσει την βελτιστοποίηση από την αρχή. Θα ήταν ασφαλές να πούμε ότι τα διανύσματα επεξεργασίας που το μοντέλο μάθει amortize την βελτιστοποίηση που ήταν απαραίτητη για να επεξεργαστεί την εικόνα αρχικά. 

Είναι αξιοσημείωτο ότι οι développers ακόμη δεν έχουν τελειοποιήσει την αποσύνδεση, και τα διανύσματα επεξεργασίας δεν επιστρέφουν πάντα τα καλύτερα αποτελέσματα όταν χρησιμοποιούνται σε άλλες εικόνες. Ωστόσο, το πρόβλημα μπορεί να ξεπεραστεί αφαιρώντας τα διανύσματα επεξεργασίας από άλλα μέρη της εικόνας πραγματοποιώντας quelques επιπλέον βήματα βελτιστοποίησης κατά τη διάρκεια του χρόνου δοκιμής. 

Βασισμένοι στις τρέχουσες γνώσεις μας, το πλαίσιο EditGAN μπορεί να χρησιμοποιηθεί για να επεξεργαστεί εικόνες σε τρεις διαφορετικές τρόπους. 

  • Επεξεργασία σε Πραγματικό Χρόνο με Διανύσματα Επεξεργασίας

Για εικόνες που είναι τοπικές, και disentangled, το μοντέλο επεξεργάζεται τις εικόνες εφαρμόζοντας διανύσματα επεξεργασίας που μάθει προηγουμένως με διαφορετικά scales, και manipulates τις εικόνες σε διαδραστικούς ρυθμούς. 

  • Χρήση Αυτο-Επιβεβλημένης Βελτίωσης για Διανύσματα-Βασισμένη Επεξεργασία

Για επεξεργασία τοπικών εικόνων που δεν είναι disentangled τέλεια με άλλα μέρη της εικόνας, το μοντέλο αρχικοποιεί την επεξεργασία της εικόνας χρησιμοποιώντας διανύσματα επεξεργασίας που μάθει προηγουμένως, και αφαιρεί τα διανύσματα επεξεργασίας πραγματοποιώντας quelques επιπλέον βήματα βελτιστοποίησης κατά τη διάρκεια του χρόνου δοκιμής. 

  • Βελτιστοποίηση-Βασισμένη Επεξεργασία

Για να πραγματοποιήσει μεγάλης κλίμακας & εικόνα-ειδικές διορθώσεις, το μοντέλο πραγματοποιεί βελτιστοποίηση από την αρχή επειδή τα διανύσματα επεξεργασίας δεν μπορούν να χρησιμοποιηθούν για να πραγματοποιήσουν αυτές τις μεταφορές σε άλλες εικόνες. 

Εφαρμογή

Το πλαίσιο EditGAN αξιολογείται σε εικόνες που διασκορπίζονται σε τέσσερις διαφορετικές κατηγορίες: Αυτοκίνητα, Πουλιά, Γάτες, και Πρόσωπα. Ο κλάδος τμηματοποίησης του μοντέλου εκπαιδεύεται χρησιμοποιώντας εικόνα-μάσκα ζευγάρια 16, 30, 30, 16 ως ετικετών δεδομένων εκπαίδευσης για Αυτοκίνητα, Πουλιά, Γάτες, και Πρόσωπα αντίστοιχα. Όταν η εικόνα πρέπει να επεξεργαστεί αποκλειστικά χρησιμοποιώντας βελτιστοποίηση, ή όταν το μοντέλο προσπαθεί να μάθει τα διανύσματα επεξεργασίας, το μοντέλο πραγματοποιεί 100 βήματα βελτιστοποίησης χρησιμοποιώντας τον βελτιστοποιητή Adam. 

Για το σύνολο δεδομένων Γάτας, Αυτοκινήτου, και Προσώπου, το μοντέλο χρησιμοποιεί πραγματικές εικόνες από το σύνολο δοκιμής του DatasetGAN που δεν χρησιμοποιήθηκαν για την εκπαίδευση του πλαισίου GAN για την πραγματοποίηση της λειτουργίας επεξεργασίας. Αυτές οι εικόνες ενσωματώνονται απευθείας στο latent χώρο του EditGAN χρησιμοποιώντας βελτιστοποίηση και κωδικοποίηση. Για την κατηγορία Πουλιά, η επεξεργασία δείχνεται σε GAN-γεννημένες εικόνες. 

Αποτελέσματα

Ποιοτικά Αποτελέσματα

Εντός-Δομής Αποτελέσματα

Η παραπάνω εικόνα δείχνει την απόδοση του πλαισίου EditGAN όταν εφαρμόζει τα προηγουμένως μάθει διανύσματα επεξεργασίας σε νέες εικόνες, και βελτιώνει τις εικόνες χρησιμοποιώντας 30 βήματα βελτιστοποίησης. Αυτές οι λειτουργίες επεξεργασίας που πραγματοποιούνται από το πλαίσιο EditGAN είναι disentangled για όλες τις κατηγορίες, και διατηρούν την συνολική ποιότητα των εικόνων. Συγκρίνοντας τα αποτελέσματα του EditGAN και άλλων πλαισίων, θα μπορούσε να παρατηρηθεί ότι το πλαίσιο EditGAN υπερέχει των άλλων μεθόδων στην πραγματοποίηση υψηλής ακρίβειας και σύνθετων διορθώσεων ενώ διατηρεί την ταυτότητα του θέματος, και την ποιότητα της εικόνας ταυτόχρονα. 

Τι είναι αξιοσημείωτο είναι ότι το πλαίσιο EditGAN μπορεί να πραγματοποιήσει极 υψηλής ακρίβειας διορθώσεις όπως η διεύρυνση των ματιών, ή η επεξεργασία των ροδών των τροχών σε ένα αυτοκίνητο. Επιπλέον, το EditGAN μπορεί επίσης να χρησιμοποιηθεί για να επεξεργαστεί τις σημασιολογικές частини αντικειμένων που έχουν μόνο λίγα pixels, ή μπορεί να χρησιμοποιηθεί για να πραγματοποιήσει μεγάλης κλίμακας τροποποιήσεις σε μια εικόνα. Είναι αξιοσημείωτο ότι οι λειτουργίες επεξεργασίας του πλαισίου EditGAN είναι ικανές να γεννήσουν εικόνες που δεν εμφανίζονται στο σύνολο δεδομένων εκπαίδευσης του GAN. 

Εκτός-Δομής Αποτελέσματα

Για να αξιολογήσει την απόδοση του EditGAN εκτός-δομής, το πλαίσιο έχει δοκιμαστεί στο σύνολο δεδομένων MetFaces. Το μοντέλο EditGAN χρησιμοποιεί εντός-δομής πραγματικές εικόνες προσώπου για να δημιουργήσει διανύσματα επεξεργασίας. Το μοντέλο τότε ενσωματώνει τις εικόνες MetFaces που είναι εκτός-δομής χρησιμοποιώντας μια διαδικασία 100-βημάτων βελτιστοποίησης, και εφαρμόζει τα διανύσματα επεξεργασίας μέσω μιας διαδικασίας 30-βημάτων αυτο-επιβεβλημένης βελτίωσης. Τα αποτελέσματα μπορούν να δουν στην παρακάτω εικόνα. 

Ποσοτικά Αποτελέσματα

Για να μετρήσει την ικανότητα επεξεργασίας εικόνας του EditGAN ποσοτικά, το μοντέλο χρησιμοποιεί ένα πρότυπο διόρθωσης χαμόγελου που εισαγωγεί για πρώτη φορά από το MaskGAN. Πρόσωπα που περιέχουν ουδέτερη έκφραση αντικαθίστανται με χαμογελαστά πρόσωπα, και η απόδοση μετράται σε τρεις παραμέτρους. 

  • Σημασιολογική Ορθότητα

Το μοντέλο χρησιμοποιεί einen προ-εκπαιδευμένο ταξινομητή ιδιοτήτων χαμόγελου για να μετρήσει αν τα πρόσωπα στις εικόνες δείχνουν χαμογελαστές εκφράσεις μετά την επεξεργασία. 

  • Ποιότητα Εικόνας σε Επίπεδο Κατανομής

Η απόσταση Kernel Inception ή KID και η απόσταση Frechet Inception ή FID υπολογίζονται μεταξύ του συνόλου δεδομένων δοκιμής CelebA & 400 επεξεργασμένων εικόνων δοκιμής. 

  • Διατήρηση Ταυτότητας

Η ικανότητα του μοντέλου να διατηρεί την ταυτότητα των θεμάτων όταν επεξεργάζεται την εικόνα μετράται χρησιμοποιώντας einen προ-εκπαιδευμένο δίκτυο εξαγωγής χαρακτηριστικών ArcFace. 

Η παραπάνω πίνακας συγκρίνει την απόδοση του πλαισίου EditGAN με άλλες μεθόδους-βάση στο πρότυπο διόρθωσης χαμόγελου. Η μέθοδος που ακολουθεί το EditGAN για να παραδώσει τέτοια υψηλά αποτελέσματα είναι συγκριμένη σε τρεις διαφορετικές μεθόδους-βάση: 

  • MaskGAN

Το MaskGAN λαμβάνει μη-χαμογελαστές εικόνες μαζί με τις σημασιολογικές αναnotations τους, και μια στόχευση χαμογελαστή αναnotation ως είσοδο. Είναι αξιοσημείωτο ότι σε σύγκριση με το EditGAN, το MaskGAN απαιτεί μεγάλη ποσότητα ετικετών δεδομένων. 

  • Τοπική Επεξεργασία

Το EditGAN επίσης συγκρίνει την απόδοση του με την τοπική επεξεργασία, μια μέθοδο που χρησιμοποιείται για να κλUSTER GAN χαρακτηριστικά για να εφαρμόσει τοπική επεξεργασία, και είναι εξαρτημένη από εικόνες-αναφορά. 

  • InterFaceGAN

Όπως και το EditGAN, το InterFaceGAN επίσης προσπαθεί να βρει διανύσματα επεξεργασίας στο latent χώρο του μοντέλου. Ωστόσο, σε αντίθεση με το EditGAN, το InterFaceGAN μοντέλο χρησιμοποιεί μεγάλη ποσότητα ετικετών δεδομένων, βοηθητικά χαρακτηριστικά, και δεν έχει την ίδια λεπτή ακρίβεια. 

  • StyleGAN2Distillation

Αυτή η μέθοδος δημιουργεί μια εναλλακτική προσέγγιση που δεν απαιτεί πραγματικές εικόνες-ενσωματώσεις, και αντίθετα χρησιμοποιεί ένα μοντέλο διανυσμάτων-επεξεργασίας για να δημιουργήσει ένα σύνολο δεδομένων εκπαίδευσης. 

Περιορισμοί

Επειδή το EditGAN είναι βασισμένο στο πλαίσιο GAN, έχει την ίδια περιορισμό όπως και οποιοδήποτε άλλο μοντέλο GAN: μπορεί να εργαστεί μόνο με εικόνες που μπορούν να μοντελοποιηθούν από το GAN. Η περιορισμός του EditGAN να εργαστεί με εικόνες που μοντελοποιούνται από το GAN είναι ο κύριος λόγος για τον οποίο είναι δύσκολο να εφαρμοστεί το EditGAN σε διαφορετικές συνθήκες. Ωστόσο, είναι αξιοσημείωτο ότι οι υψηλής ακρίβειας διορθώσεις του EditGAN μπορούν να μεταφερθούν εύκολα σε άλλες εικόνες χρησιμοποιώντας διανύσματα επεξεργασίας. 

Συμπέρασμα

Ένας από τους κύριους λόγους για τους οποίους το GAN δεν είναι ένα βιομηχανικό πρότυπο στη βιομηχανία επεξεργασίας εικόνας είναι λόγω της περιορισμένης πρακτικότητας. Τα πλαισιά GAN συνήθως απαιτούν μεγάλη ποσότητα ετικετών δεδομένων εκπαίδευσης, και δεν επιστρέφουν πάντα υψηλή αποτελεσματικότητα & ακρίβεια. 

Το EditGAN προσπαθεί να αντιμετωπίσει τα προβλήματα που παρουσιάζονται από τα παραδοσιακά πλαισιά GAN, και προσπαθεί να παρουσιαστεί ως μια αποτελεσματική μέθοδος για υψηλής ποιότητας και υψηλής ακρίβειας σημασιολογική επεξεργασία εικόνας. Τα αποτελέσματα μέχρι τώρα έχουν δείξει ότι το EditGAN πραγματικά προσφέρει αυτό που ισχυρίζεται, και ήδη εκτελεί καλύτερα από κάποιες τρέχουσες βιομηχανικές μεθόδους & μοντέλα. 

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.