Η γωνία του Anderson
Η Συνθετική Εικόνα Έχει Υιοθετήσει Ένα Ελαττωματικό Μέτρο, Κατάλογράφουν οι Ερευνητές

Το 2021 ήταν ένα έτος απαράμιλλης πρόοδου και ταχύτατου ρυθμού δημοσίευσης στον τομέα της συνθετικής εικόνας, προσφέροντας μια ροή νέων καινοτομιών και βελτιώσεων στις τεχνολογίες που είναι ικανές να αναπαράγουν ανθρώπινες προσωπικότητες μέσω νευρωνικής απόδοσης, deepfakes και μιας σειράς νέων προσεγγίσεων.
Ωστόσο, ερευνητές από τη Γερμανία ισχυρίζονται τώρα ότι το πρότυπο που χρησιμοποιείται για να κρίνει αυτόματα την πραγματικότητα των συνθετικών εικόνων είναι θανασίμως ελαττωματικό και ότι οι εκατοντάδες, ακόμη και χιλιάδες ερευνητές σε όλο τον κόσμο που βασίζονται σε αυτό για να μειώσουν το κόστος των ακριβών ανθρώπινων αποτελεσμάτων αξιολόγησης μπορεί να πηγαίνουν σε một τυφλό δρόμο.
Για να αποδείξουν πώς το πρότυπο, Fréchet Inception Distance (FID), δεν ανταποκρίνεται στα ανθρώπινα πρότυπα για την αξιολόγηση εικόνων, οι ερευνητές αναπτύχθηκαν τα δικά τους GANs, βελτιστοποιημένα για FID (τώρα ένα κοινό μέτρο). Βρήκαν ότι το FID ακολουθεί τις δικές του εμμονές, βασισμένες σε υποκείμενο κώδικα με ένα πολύ διαφορετικό αντικείμενο από εκείνο της συνθετικής εικόνας, και ότι συχνά αποτυγχάνει να επιτύχει ένα ‘ανθρώπινο’ πρότυπο διακρίσεων:

FID scores (lower is better) for images generated by various models using standard datasets and architectures. The researchers of the new paper pose the question ‘Would you agree with these rankings?’. Source: https://openreview.net/pdf?id=mLG96UpmbYz
Επιπλέον της δήλωσης ότι το FID δεν είναι κατάλληλο για την προκαθορισμένη του εργασία, το έγγραφο προτείνει επίσης ότι ‘πρόδηλες’ θεραπείες, όπως η αντικατάσταση του εσωτερικού κινητήρα με ανταγωνιστικούς κινητήρες, θα ανταλλάξουν απλώς ένα σύνολο προκαταλήψεων με ένα άλλο. Οι συγγραφείς προτείνουν ότι τώρα πέφτει σε νέες ερευνητικές πρωτοβουλίες να αναπτύξουν καλύτερα μέτρα για να αξιολογήσουν την ‘αυθεντικότητα’ στις συνθετικά παραγμένες φωτογραφίες.
Το έγγραφο έχει τον τίτλο Internalized Biases in Fréchet Inception Distance και προέρχεται από τον Steffen Jung στο Max Planck Institute for Informatics at Saarland και την Margret Keuper, Καθηγήτρια για την Οπτική Υπολογιστική στο Πανεπιστήμιο του Siegen.
Η Αναζήτηση ενός Συστήματος Βαθμολόγησης για τη Συνθετική Εικόνα
Όπως σημειώνει η νέα έρευνα, η πρόοδος στα πλαίσια της συνθετικής εικόνας, όπως τα GANs και οι αρχιτεκτονικές κωδικοποιητή/αποκωδικοποιητή, έχει ξεπεράσει τις μεθόδους με τις οποίες τα αποτελέσματα αυτών των συστημάτων μπορούν να αξιολογηθούν. Εκτός από το ότι είναι ακριβές και επομένως δύσκολο να κλιμακωθούν, η αξιολόγηση των αποτελεσμάτων αυτών των συστημάτων από τους ανθρώπους δεν προσφέρει μια εμπειρική και αναπαραγώγιμη μέθοδο αξιολόγησης.
Επομένως, μια σειρά από πλαισιακά μέτρα έχουν εμφανιστεί, συμπεριλαμβανομένου του Inception Score (IS), που παρουσιάστηκε στο έγγραφο Improved Techniques for Training GANs, που συνυπογράφτηκε από τον εφευρέτη του GAN, Ian Goodfellow.
Η αποποίηση της IS ως ένα ευρέως εφαρμοστέο μέτρο για πολλά δίκτυα GAN το 2018 οδήγησε στην ευρεία υιοθέτηση του FID στη κοινότητα της συνθετικής εικόνας. Ωστόσο, όπως και το Inception Score, το FID βασίζεται στο δίκτυο ταξινόμησης εικόνων Inception v3 (IV3) της Google.
Οι συγγραφείς του νέου εγγράφου υποστηρίζουν ότι το Fréchet Inception Distance μεταφέρει βλαβερές προκαταλήψεις στο IV3, οδηγώντας σε αξιόπιστες ταξινομήσεις της ποιότητας της εικόνας.
Fréchet Inception Distance
Το FID συγκρίνει πώς οι λειτουργίες διανέμονται σε όλη τη βάση δεδομένων εκπαίδευσης που χρησιμοποιείται για να δημιουργηθεί ένα μοντέλο GAN (ή παρόμοια λειτουργικότητα) και τα αποτελέσματα αυτού του συστήματος.
Επομένως, αν ένα πλαίσιο GAN εκπαιδευτεί σε 10.000 εικόνες (για παράδειγμα) διασημοτήτων, το FID συγκρίνει τις πρωτότυπες (πραγματικές) εικόνες με τις ψευδείς εικόνες που παράγονται από το GAN. Το χαμηλότερο το σκορ FID, το κοντινότερο το GAN έχει φτάσει σε ‘φωτογραφική’ εικόνα, σύμφωνα με τα κριτήρια του FID.

Από το έγγραφο, αποτελέσματα ενός GAN που εκπαιδεύτηκε σε FFHQ64, ένα υποσύνολο του πολύ δημοφιλούς συνόλου δεδομένων FFHQ της NVIDIA. Εδώ, αν και το σκορ FID είναι ένα θαυμάσιο χαμηλό 5,38, τα αποτελέσματα δεν είναι ευχάριστα ή πειστικά για τον μέσο άνθρωπο.
Το πρόβλημα, οι συγγραφείς υποστηρίζουν, είναι ότι το Inception v3, των οποίων οι υποθέσεις ενεργοποιούν το Fréchet Inception Distance, δεν κοιτάζει στα σωστά μέρη – τουλάχιστον, όχι όταν λαμβάνει υπόψη την εργασία που έχει ανατεθεί.
Το Inception V3 εκπαιδεύεται στο ImageNet object recognition challenge, μια εργασία που είναι αμφισβητήσιμη με τον τρόπο που έχουν εξελιχθεί οι στόχοι της συνθετικής εικόνας τα τελευταία χρόνια. Το IV3 προκαλεί τη ρομποτικότητα ενός μοντέλου με την εκτέλεση δεδομένων: το στρέφει τυχαία, το κόβει σε μια τυχαία κλίμακα μεταξύ 8-100%, αλλάζει το λόγο διαστάσεων (σε einen εύρος από 3/4 έως 4/3) και τυχαία εγχέει χρωματικές παραμορφώσεις που σχετίζονται με τη φωτεινότητα, τη χρωματική饱和度 και την αντίθεση.
Οι ερευνητές της Γερμανίας έχουν βρει ότι το IV3 έχει μια τάση να ευνοεί την εξαγωγή ακμών και υφών,而 όχι χρωματικών και εντατικών πληροφοριών, οι οποίες θα ήταν πιο σημαντικές δείκτες αυθεντικότητας για συνθετικές εικόνες και ότι ο αρχικός σκοπός του ανίχνευσης αντικειμένων έχει επομένως ανατεθεί σε μια ακατάλληλη εργασία. Οι συγγραφείς δηλώνουν*:
‘[Inception v3] έχει μια προκατάληψη προς την εξαγωγή χαρακτηριστικών που βασίζονται σε άκρες και υφές,而 όχι χρωματικές και εντατικές πληροφορίες. Αυτό συμφωνεί με την πipeline αυγουσίας που εισάγει χρωματικές παραμορφώσεις, αλλά διατηρεί υψηλής συχνότητας πληροφορίες άθικτες (σε αντίθεση με, για παράδειγμα, αυγουσίας με Gaussian blur).
‘Συμφωνα με αυτό, το FID κληρονομεί αυτή τη προκατάληψη. Όταν χρησιμοποιείται ως μέτρο κατάταξης, γεννητικά μοντέλα που αναπαράγουν υφές καλά μπορεί να προτιμώνται από μοντέλα που αναπαράγουν χρωματικές διανομές καλά. ‘
Δεδομένα και Μέθοδος
Για να δοκιμάσουν την υπόθεσή τους, οι συγγραφείς εκπαίδευσαν δύο αρχιτεκτονικές GAN, DCGAN και SNGAN, στο συνόλο δεδομένων ανθρώπινων προσώπων FFHQ της NVIDIA, υποδειγματοποιημένο σε 642 ανάλυση εικόνας, με το παραγόμενο συνόλο δεδομένων που ονομάζεται FFHQ64.
Τρεις διαδικασίες εκπαίδευσης GAN πραγματοποιήθηκαν: GAN G+D, ένα τυπικό δίκτυο με βάση τον διακρίβυ; GAN FID|G+D, όπου το FID λειτουργεί ως πρόσθετος διακρίβυ; και GAN FID|G, όπου το GAN είναι εξ ολοκλήρου ενεργοποιημένο από το ρολόι FID.
Τεχνικά, οι συγγραφείς σημειώνουν, η απώλεια FID θα σταθεροποιήσει την εκπαίδευση και θα μπορούσε ακόμη και να αντικαταστήσει πλήρως τον διακρίβυ (όπως κάνει στο #3, GAN FID|G), ενώ παράγει ανθρώπινα ευχάριστα αποτελέσματα.
Στην πράξη, τα αποτελέσματα είναι κάπως διαφορετικά, με – οι συγγραφείς υποθέτουν – τα μοντέλα FID να ‘υπερ-προσαρμόζονται’ στα λάθος μέτρα. Οι ερευνητές σημειώνουν:
‘Υποθέτουμε ότι ο γεννήτορας μαθαίνει να παράγει ακατάλληλα χαρακτηριστικά για να ταιριάζει με την κατανομή των δεδομένων εκπαίδευσης. Αυτή η παρατήρηση γίνεται πιο σοβαρή στην περίπτωση [GAN FID|G]. Εδώ, παρατηρούμε ότι η λείπουσα διακρίβυ οδηγεί σε χωρικά ασυνεχείς διανομές χαρακτηριστικών. Για παράδειγμα [SNGAN FID|G] προσθέτει κυρίως單ο mắt και ευθυγραμμίζει χαρακτηριστικά προσώπου με έναν απειλητικό τρόπο.’
Οι συγγραφείς συμπεραίνουν*:
‘Ενώ οι ανθρώπινοι ανανεωτές θα προτιμούσαν σίγουρα εικόνες που παράγονται από SNGAN D+G hơn από SNGAN FID|G (σε περιπτώσεις όπου η πιστότητα των δεδομένων προτιμάται από την τέχνη), βλέπουμε ότι αυτό δεν αντικατοπτρίζεται από το FID. Επομένως, το FID δεν είναι ευθυγραμμισμένο με την ανθρώπινη αντίληψη. ‘
‘Υποστηρίζουμε ότι τα διακριτικά χαρακτηριστικά που παρέχονται από δίκτυα ταξινόμησης εικόνων δεν είναι đủ για να παρέχουν τη βάση ενός σημαντικού μέτρου.’
Δεν Υπάρχουν Ευκόλες Εναλλακτικές
Οι συγγραφείς cũng βρήκαν ότι η αντικατάσταση του Inception V3 με έναν παρόμοιο κινητήρα δεν έλυσε το πρόβλημα. Σε αντικατάσταση του IV3 με ‘μια εκτεταμένη επιλογή διαφορετικών δικτύων ταξινόμησης’, τα οποία δοκιμάστηκαν ενάντια στο ImageNet-C (ένα υποσύνολο του ImageNet που σχεδιάστηκε για να μετρήσει τις συνήθως παραγόμενες διακροτήσεις και παραμορφώσεις στις εικόνες εξόδου από τα πλαίσια της συνθετικής εικόνας), οι ερευνητές δεν μπόρεσαν να βελτιώσουν σημαντικά τα αποτελέσματά τους:
‘[Προκαταλήψεις] που υπάρχουν στο Inception v3 είναι επίσης ευρέως παρόντες σε άλλα δίκτυα ταξινόμησης. Επιπλέον, βλέπουμε ότι διαφορετικά δίκτυα θα παράγουν διαφορετικές κατάταξεις μεταξύ των τύπων διακροτήσεων.’
Οι συγγραφείς συμπεραίνουν το έγγραφο με την ελπίδα ότι η συνεχιζόμενη έρευνα θα αναπτύξει ένα ‘ανθρώπινα-ευθυγραμμισμένο και αμερόληπτο μέτρο’ ικανό να ενεργοποιήσει μια πιο δίκαιη κατάταξη για αρχιτεκτονικές γεννητριών εικόνας.
* Authors’ emphasis.
Πρώτη δημοσίευση 20ης Δεκεμβρίου 2021, 1 μ.μ. GMT+2.













