Η γωνία του Anderson

Εξαγωγή Δεδομένων Εκπαίδευσης από Μοντέλα Stable Diffusion που έχουν Υποβληθεί σε Λεπτοβελτίωση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Examples of training images (below), extracted from a trained model (above). Source: https://arxiv.org/pdf/2410.03039

Νέα έρευνα από τις Ηνωμένες Πολιτείες παρουσιάζει μια μέθοδο για την εξαγωγή σημαντικών τμημάτων δεδομένων εκπαίδευσης από μοντέλα που έχουν υποβληθεί σε λεπτοβελτίωση.

Αυτό θα μπορούσε να παρέχει νομικά στοιχεία σε περιπτώσεις όπου ο стиль ενός καλλιτέχνη έχει αντιγραφεί ή όπου προστατευόμενα από πνευματικά δικαιώματα εικόνες έχουν χρησιμοποιηθεί για την εκπαίδευση γενετικών μοντέλων για δημόσιες προσωπικότητες, προστατευμένα πρόσωπα ή άλλα περιεχόμενα.

Από το νέο έγγραφο: οι αρχικές εικόνες εκπαίδευσης εμφανίζονται στη σειρά πάνω, και οι εξαγμένες εικόνες απεικονίζονται στη σειρά κάτω. Πηγή: https://arxiv.org/pdf/2410.03039

Από το νέο έγγραφο: οι αρχικές εικόνες εκπαίδευσης εμφανίζονται στη σειρά πάνω, και οι εξαγμένες εικόνες απεικονίζονται στη σειρά κάτω. Πηγή: https://arxiv.org/pdf/2410.03039

Τέτοια μοντέλα είναι ευρέως και ελεύθερα διαθέσιμα στο διαδίκτυο, κυρίως μέσω των τεράστιων αρχείων που έχουν συνεισφέρει οι χρήστες στο civit.ai, και, σε μικρότερο βαθμό, στη πλατφόρμα αποθετηρίου Hugging Face.

Το νέο μοντέλο που αναπτύχθηκε από τους ερευνητές ονομάζεται FineXtract, και οι συγγραφείς ισχυρίζονται ότι επιτυγχάνει αποτελέσματα state-of-the-art σε αυτήν την εργασία.

Το έγγραφο παρατηρεί:

‘[Το πλαίσιο μας] αντιμετωπίζει αποτελεσματικά την πρόκληση της εξαγωγής δεδομένων λεπτοβελτίωσης από δημόσια διαθέσιμες σημεία ελέγχου DM. Με την αξιοποίηση της μετάβασης από τις προ-εκπαιδευμένες διανομές DM στις διανομές δεδομένων λεπτοβελτίωσης, ο FineXtract οδηγεί με ακρίβεια τη διαδικασία γεννήσεων προς τις περιοχές υψηλής πιθανότητας της διανομής δεδομένων λεπτοβελτίωσης, επιτρέποντας την επιτυχημένη εξαγωγή δεδομένων.’

Δεξιά, η αρχική εικόνα που χρησιμοποιήθηκε στην εκπαίδευση. Δεύτερη από δεξιά, η εικόνα που εξαγεται μέσω του FineXtract. Οι άλλες στήλες αντιπροσωπεύουν προηγούμενες μεθόδους.

Δεξιά, η αρχική εικόνα που χρησιμοποιήθηκε στην εκπαίδευση. Δεύτερη από δεξιά, η εικόνα που εξαγεται μέσω του FineXtract. Οι άλλες στήλες αντιπροσωπεύουν προηγούμενες μεθόδους. Παρακαλούμε αναφερθείτε στο πηγή έγγραφο για καλύτερη ανάλυση.

Γιατί έχει σημασία

Τα πρωτότυπα εκπαιδευμένα μοντέλα για συστήματα γεννήσεων εικόνων από κείμενο όπως το Stable Diffusion και το Flux μπορούν να κατεβάσουν και να υποβληθούν σε λεπτοβελτίωση από τους τελικούς χρήστες, χρησιμοποιώντας τεχνικές όπως η υλοποίηση DreamBooth του 2022.

Εύκολη ακόμη, ο χρήστης μπορεί να δημιουργήσει ένα πολύ μικρότερο LoRA μοντέλο που είναι σχεδόν τόσο αποτελεσματικό όσο ένα πλήρως υποβεβλημένο σε λεπτοβελτίωση μοντέλο.

Ένα παράδειγμα εκπαιδευμένου LORA, που προσφέρεται για ελεύθερο κατέβασμα στην πολύ δημοφιλή ιστοσελίδα Civitai. Τέτοιο μοντέλο μπορεί να δημιουργηθεί σε οποιοδήποτε διάστημα από λίγα λεπτά έως vài ώρες, από ενθουσιώδεις που χρησιμοποιούν τοπικά εγκατεστημένο ανοιχτό λογισμικό – και διαδικτυακά, μέσω κάποιων πιο ανεκτικών συστημάτων εκπαίδευσης API.

Ένα παράδειγμα εκπαιδευμένου LORA, που προσφέρεται για ελεύθερο κατέβασμα στην πολύ δημοφιλή ιστοσελίδα Civitai. Τέτοιο μοντέλο μπορεί να δημιουργηθεί σε οποιοδήποτε διάστημα από λίγα λεπτά έως vài ώρες, από ενθουσιώδεις που χρησιμοποιούν τοπικά εγκατεστημένο ανοιχτό λογισμικό – και διαδικτυακά, μέσω κάποιων πιο ανεκτικών συστημάτων εκπαίδευσης API. Πηγή: civitai.com

Από το 2022, είναι εύκολο να δημιουργηθούν checkpoints και LoRAs που είναι ειδικά για ταυτότητα, παρέχοντας μόνο một μικρό (μέσο 5-50) αριθμό εικόνων με λεζάντα, και εκπαιδεύοντας το checkpoint (ή LoRA) τοπικά, σε ένα ανοιχτό πλαίσιο όπως το Kohya ss, ή χρησιμοποιώντας διαδικτυακά υπηρεσίες.

Αυτή η μέθοδος deepfaking έχει αποκτήσει δυσφήμηση στα μέσα ενημέρωσης τα τελευταία χρόνια. Πολλοί καλλιτέχνες έχουν επίσης δει το έργο τους να έχει ενσωματωθεί σε γενετικά μοντέλα που αναπαράγουν το στυλ τους. Η διαμάχη γύρω από αυτά τα ζητήματα έχει συσσωρευθεί τα τελευταία 18 μήνες.

Η ευκολία με την οποία οι χρήστες μπορούν να δημιουργήσουν συστήματα AI που αναπαράγουν το έργο πραγματικών καλλιτεχνών έχει προκαλέσει θόρυβο και ποικίλες εκστρατείες τα τελευταία δύο χρόνια. Πηγή: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Η ευκολία με την οποία οι χρήστες μπορούν να δημιουργήσουν συστήματα AI που αναπαράγουν το έργο πραγματικών καλλιτεχνών έχει προκαλέσει θόρυβο και ποικίλες εκστρατείες τα τελευταία δύο χρόνια. Πηγή: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Είναι δύσκολο να αποδειχθεί ποίες εικόνες χρησιμοποιήθηκαν σε ένα checkpoint λεπτοβελτίωσης ή σε ένα LoRA, поскольку η διαδικασία γενίκευσης ‘αφαίρεσε’ την ταυτότητα από τα μικρά σύνολα δεδομένων εκπαίδευσης, και δεν είναι πιθανό να αναπαράγει παραδείγματα από τα δεδομένα εκπαίδευσης (εκτός από την περίπτωση υπερ-προσαρμογής, όπου μπορεί να θεωρηθεί ότι η εκπαίδευση απέτυχε).

Εδώ είναι όπου ο FineXtract μπαίνει στη σκηνή. Συγκρίνοντας την κατάσταση του ‘πρότυπου’ μοντέλου διαχύσεως που ο χρήστης κατέβασε με το μοντέλο που δημιούργησε αργότερα μέσω λεπτοβελτίωσης ή LoRA, οι ερευνητές έχουν能够 να δημιουργήσουν πολύ ακριβείς ανακατασκευές των δεδομένων εκπαίδευσης.

Αν και ο FineXtract έχει μπορέσει να αναπαράγει μόνο το 20% των δεδομένων από μια λεπτοβελτίωση, αυτό είναι περισσότερο από ό,τι συνήθως χρειάζεται για να παρέχει στοιχεία ότι ο χρήστης είχε χρησιμοποιήσει πνευματικά δικαιώματα ή άλλα προστατευμένα ή απαγορευμένα υλικά στην παραγωγή ενός γενετικού μοντέλου. Σε hầu hết των παραδειγμάτων, η εξαγμένη εικόνα είναι εξαιρετικά κοντά στο γνωστό υλικό πηγής.

Ενώ οι λεζάντες είναι απαραίτητες για την εξαγωγή των εικόνων πηγής, αυτό δεν είναι ένα σημαντικό εμπόδιο για δύο λόγους: α) ο ανεβάζων γενικά θέλει να διευκολύνει τη χρήση του μοντέλου μεταξύ μιας κοινότητας και θα παρέχει συνήθως κατάλληλες παραδείγματα προτροπής, και β) δεν είναι τόσο δύσκολο, οι ερευνητές βρήκαν, να εξαγάγουν τους κρίσιμους όρους τυφλά, από το μοντέλο λεπτοβελτίωσης:

Τα βασικά κλειδιά μπορούν συνήθως να εξαχθούν τυφλά από το μοντέλο λεπτοβελτίωσης χρησιμοποιώντας μια επίθεση L2-PGD για 1000 επαναλήψεις, από μια τυχαία προτροπή.

Τα βασικά κλειδιά μπορούν συνήθως να εξαχθούν τυφλά από το μοντέλο λεπτοβελτίωσης χρησιμοποιώντας μια επίθεση L2-PGD για 1000 επαναλήψεις, από μια τυχαία προτροπή.

Οι χρήστες συχνά αποφεύγουν να κάνουν τα σύνολα δεδομένων εκπαίδευσής τους διαθέσιμα μαζί με το ‘μαύρο κουτί’-στιλ εκπαιδευμένο μοντέλο. Για την έρευνα, οι συγγραφείς συνεργάστηκαν με ενθουσιώδεις μηχανικής μάθησης που πραγματικά παρείχαν τα σύνολα δεδομένων.

Το νέο έγγραφο έχει τον τίτλο Αποκαλύπτοντας το Αόρατο: Οδηγώντας Προσαρμοσμένα Μοντέλα Διαχύσεως για την Εξαγωγή Δεδομένων Εκπαίδευσης, και προέρχεται από τρεις ερευνητές από τα πανεπιστήμια Carnegie Mellon και Purdue.

Μέθοδος

Ο ‘επιτιθέμενος’ (σε αυτήν την περίπτωση, το σύστημα FineXtract) συγκρίνει τις εκτιμώμενες διανομές δεδομένων σε suốt το πρωτότυπο και το μοντέλο λεπτοβελτίωσης, σε μια διαδικασία που οι συγγραφείς ονομάζουν ‘οδηγία μοντέλου’.

Μέσω της 'οδηγίας μοντέλου', που αναπτύχθηκε από τους ερευνητές του νέου εγγράφου, οι χαρακτηριστικές λεπτοβελτίωσης μπορούν να χαρτογραφηθούν, επιτρέποντας την εξαγωγή των δεδομένων εκπαίδευσης.

Μέσω της ‘οδηγίας μοντέλου’, που αναπτύχθηκε από τους ερευνητές του νέου εγγράφου, οι χαρακτηριστικές λεπτοβελτίωσης μπορούν να χαρτογραφηθούν, επιτρέποντας την εξαγωγή των δεδομένων εκπαίδευσης.

Οι συγγραφείς εξηγούν:

‘Κατά τη διαδικασία λεπτοβελτίωσης, τα [μοντέλα διαχύσεως] προοδευτικά μετατοπίζουν τη μάθησή τους διανομή από τη διανομή των προ-εκπαιδευμένων DMs προς τη διανομή δεδομένων λεπτοβελτίωσης.

‘Έτσι, παραμετρικά προσεγγίζουμε τη [μάθηση] διανομή του μοντέλου λεπτοβελτίωσης.’

Με αυτόν τον τρόπο, το άθροισμα της διαφοράς μεταξύ του πυρήνα και του μοντέλου λεπτοβελτίωσης παρέχει την οδηγία της διαδικασίας.

Οι συγγραφείς σχολιάζουν περαιτέρω:

‘Με την οδηγία μοντέλου, μπορούμε να προσομοιώσουμε ένα “ψευδο-”[αποστεγαστικό], το οποίο μπορεί να χρησιμοποιηθεί για να οδηγήσει τη διαδικασία δειγματοληψίας προς την περιοχή υψηλής πιθανότητας της διανομής δεδομένων λεπτοβελτίωσης.’

Η οδηγία βασίζεται εν μέρει σε μια διαδικασία θορύβωσης που αλλάζει με τον χρόνο, παρόμοια με την εξόντωση Εξόντωση Εννοιών από Μοντέλα Διαχύσεως του 2023.

Η πρόβλεψη αποστεγαστικού που λαμβάνεται επίσης παρέχει μια πιθανή Οδηγία Κατηγοριοποίησης (CFG) κλίμακα. Αυτό είναι σημαντικό, поскольку η CFG επηρεάζει σημαντικά την ποιότητα εικόνας και την πιστότητα στην κείμενο-προτροπή του χρήστη.

Για να βελτιώσει την ακρίβεια των εξαγμένων εικόνων, ο FineXtract βασίζεται στη διακεκριμένη συνεργασία Εξαγωγή Δεδομένων Εκπαίδευσης από Μοντέλα Διαχύσεως του 2023. Η μέθοδος που χρησιμοποιείται είναι να υπολογίσει τη συσχέτιση κάθε ζευγαριού γεννημένων εικόνων, με βάση einen κατώτατο όριο που ορίζεται από το Αυτο-Επιβλεπόμενο Περιγραφέα (SSCD) σκορ.

Με αυτόν τον τρόπο, ο αλγόριθμος συστάδευσης βοηθά τον FineXtract να αναγνωρίσει το υποσύνολο των εξαγμένων εικόνων που συμφωνούν με τα δεδομένα εκπαίδευσης.

Σε αυτήν την περίπτωση, οι ερευνητές συνεργάστηκαν με χρήστες που είχαν κάνει τα δεδομένα διαθέσιμα. Μπορούσε να ειπωθεί ότι, απουσία τέτοιων δεδομένων, θα ήταν αδύνατο να αποδειχθεί ότι οποιαδήποτε συγκεκριμένη γεννημένη εικόνα χρησιμοποιήθηκε στην εκπαίδευση στο πρωτότυπο. Ωστόσο, είναι τώρα σχετικά εύκολο να αντιστοιχίσετε ανεβαμένες εικόνες είτε με ζωντανές εικόνες στο διαδίκτυο είτε με εικόνες που είναι επίσης σε γνωστά και δημοσιευμένα σύνολα δεδομένων, με βάση μόνο το περιεχόμενο εικόνας.

Δεδομένα και Τεστ

Για να δοκιμάσουν τον FineXtract, οι συγγραφείς διεξήγαγαν πειράματα σε few-shot μοντέλα λεπτοβελτίωσης σε δύο κοινές περιπτώσεις λεπτοβελτίωσης, εντός του πλαισίου του έργου: στίλους τέχνης και γεννήτρια αντικειμένων (η τελευταία περιλαμβάνει αποτελεσματικά αντικείμενα με βάση το πρόσωπο).

Εξέλεξαν τυχαία 20 καλλιτέχνες (κάθε ένας με 10 εικόνες) από το σύνολο δεδομένων WikiArt, και 30 αντικείμενα (κάθε ένα με 5-6 εικόνες) από το σύνολο δεδομένων DreamBooth, για να αντιμετωπίσουν αυτές τις περιπτώσεις.

Το DreamBooth και το LoRA ήταν οι μεθόδους λεπτοβελτίωσης που στοχεύθηκαν, και το Stable Diffusion V1/.4 χρησιμοποιήθηκε για τα τεστ.

Εάν ο αλγόριθμος συστάδευσης επέστρεφε keine αποτελέσματα μετά από τριάντα δευτερόλεπτα, το κατώτατο όριο τροποποιήθηκε μέχρι να επιστραφούν εικόνες.

Οι δύο μετρήσεις που χρησιμοποιήθηκαν για τις γεννημένες εικόνες ήταν η Μέση Ομοιότητα (AS) υπό τον SSCD, και η Μέση Πιθανότητα Εξαγωγής (A-ESR) – ένας δείκτης που είναι γενικά σύμφωνος με προηγούμενες εργασίες, όπου ένα σκορ 0,7 αντιπροσωπεύει το ελάχιστο για να δηλώσει μια πλήρη εξαγωγή δεδομένων εκπαίδευσης.

Καθώς οι προηγούμενες προσεγγίσεις έχουν χρησιμοποιήσει είτε άμεση γεννήτρια κειμένου-εικόνας είτε CFG, οι ερευνητές συνέκριναν τον FineXtract με αυτές τις δύο μεθόδους.

Αποτελέσματα για τις συγκρίσεις του FineXtract με τις δύο πιο δημοφιλείς προηγούμενες μεθόδους.

Αποτελέσματα για τις συγκρίσεις του FineXtract με τις δύο πιο δημοφιλείς προηγούμενες μεθόδους.

Οι συγγραφείς σχολιάζουν:

‘Τα [αποτελέσματα] δείχνουν μια σημαντική υπεροχή του FineXtract έναντι των προηγούμενων μεθόδων, με μια βελτίωση περίπου 0,02 έως 0,05 στην AS και एक διπλασιασμό της A-ESR στις περισσότερες περιπτώσεις.’

Για να δοκιμάσουν την ικανότητα της μεθόδου να γενικεύσει σε νέα δεδομένα, οι ερευνητές διεξήγαγαν ένα επιπλέον τεστ, χρησιμοποιώντας το Stable Diffusion (V1.4), το Stable Diffusion XL, και το AltDiffusion.

Ο FineXtract εφαρμόστηκε σε eine σειρά μοντέλων διαχύσεως. Για το σύνολο δεδομένων WikiArt, το τεστ επικεντρώθηκε σε τέσσερις κατηγορίες στο WikiArt.

Ο FineXtract εφαρμόστηκε σε eine σειρά μοντέλων διαχύσεως. Για το σύνολο δεδομένων WikiArt, το τεστ επικεντρώθηκε σε τέσσερις κατηγορίες στο WikiArt.

Όπως φαίνεται από τα αποτελέσματα που εμφανίζονται παραπάνω, ο FineXtract ήταν σε θέση να επιτύχει μια βελτίωση έναντι των προηγούμενων μεθόδων και σε αυτό το ευρύτερο τεστ.

Μια ποιοτική σύγκριση των εξαγμένων αποτελεσμάτων από τον FineXtract και τις προηγούμενες προσεγγίσεις. Παρακαλούμε αναφερθείτε στο πηγή έγγραφο για καλύτερη ανάλυση.

Μια ποιοτική σύγκριση των εξαγμένων αποτελεσμάτων από τον FineXtract και τις προηγούμενες προσεγγίσεις. Παρακαλούμε αναφερθείτε στο πηγή έγγραφο για καλύτερη ανάλυση.

Οι συγγραφείς παρατηρούν ότι όταν αυξάνεται ο αριθμός εικόνων που χρησιμοποιούνται στο σύνολο δεδομένων για ένα μοντέλο λεπτοβελτίωσης, ο αλγόριθμος συστάδευσης χρειάζεται να τρέχει για μεγαλύτερο χρονικό διάστημα για να παραμείνει αποτελεσματικός.

Επιπλέον, παρατηρούν ότι μια ποικιλία μεθόδων έχουν αναπτυχθεί τα τελευταία χρόνια για να εμποδίσουν这一 είδους εξαγωγή, υπό την αιγίδα της προστασίας της ιδιωτικής ζωής. Έτσι, έτρεξαν τον FineXtract έναντι δεδομένων που έχουν aumented με τις μεθόδους Cutout και RandAugment.

Μια ποιοτική σύγκριση των εξαγμένων αποτελεσμάτων από τον FineXtract και τις προηγούμενες προσεγγίσεις. Παρακαλούμε αναφερθείτε στο πηγή έγγραφο για καλύτερη ανάλυση.

Η απόδοση του FineXtract έναντι εικόνων που προστατεύονται από Cutout και RandAugment.

Ενώ οι συγγραφείς παραδέχονται ότι τα δύο συστήματα προστασίας λειτουργούν khá καλά στην απόκρυψη των πηγών δεδομένων εκπαίδευσης, σημειώνουν ότι αυτό γίνεται με το κόστος μιας πτώσης στην ποιότητα εξόδου τόσο σοβαρής που την καθιστά άχρηστη:

Εικόνες που παράγονται με το Stable Diffusion V1.4, λεπτοβελτιστοποιημένο με μέτρα άμυνας – τα οποία μειώνουν δραστικά την ποιότητα εικόνας.

Εικόνες που παράγονται με το Stable Diffusion V1.4, λεπτοβελτιστοποιημένο με μέτρα άμυνας – τα οποία μειώνουν δραστικά την ποιότητα εικόνας. Παρακαλούμε αναφερθείτε στο πηγή έγγραφο για καλύτερη ανάλυση.

Το έγγραφο καταλήγει:

‘Οι πειραματικές μας μελέτες αποδεικνύουν τη robustness της μεθόδου μας σε διάφορα σύνολα δεδομένων και πραγματικά checkpoints, υπογραμμίζοντας τους κινδύνους διαρροής δεδομένων και παρέχοντας ισχυρά στοιχεία για παραβιάσεις πνευματικών δικαιωμάτων.’

Συμπέρασμα

Το 2024 αποδείχθηκε το έτος που το ενδιαφέρον των εταιρειών για ‘καθαρά’ δεδομένα εκπαίδευσης αυξήθηκε σημαντικά, αντιμετωπίζοντας τη συνεχιζόμενη κάλυψη των μέσων ενημέρωσης για την ικανότητα του AI να αντικαταστήσει τους ανθρώπους, και την προοπτική νομικής προστασίας των γενετικών μοντέλων που είναι τόσο πρόθυμες να εκμεταλλευτούν.

Είναι εύκολο να ισχυριστούν ότι τα δεδομένα εκπαίδευσής σας είναι καθαρά, αλλά γίνεται επίσης πιο εύκολο για παρόμοιες τεχνολογίες να αποδείξουν ότι δεν είναι – όπως η Runway ML, η Stability.ai και η MidJourney (μεταξύ άλλων) έχουν καταλήξει τις τελευταίες ημέρες.

Εργασίες όπως ο FineXtract είναι ορατά σημάδια του απόλυτου τέλους της ‘αγριας δύσης’ εποχής του AI, όπου ακόμη και η φαινομενικά αποκρυπτογραφημένη φύση ενός εκπαιδευμένου.latent χώρου θα μπορούσε ναถχθεί υπόψη.

 

* Για το λόγο της ευκολίας, θα υποθέσουμε ‘λεπτοβελτίωση και LoRA’, όπου είναι απαραίτητο.

Πρώτη δημοσίευση Δευτέρα, 7 Οκτωβρίου 2024

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]