Η γωνία του Anderson

Η ‘Ασυνάρτητη Γλώσσα’ που Μπορεί να Υπονομεύσει τα Συστήματα Ελέγχου της Συνθέσης Εικόνων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
DALL-E 2: 'a man in a state of exaspenttausacion' . https://labs.openai.com/s/PHCrZh2i5FC2N814U8pbxuug

Νέα έρευνα από το Πανεπιστήμιο Κολούμπια υποδηλώνει ότι τα μέτρα ασφαλείας που εμποδίζουν τα μοντέλα σύνθεσης εικόνων όπως το DALL-E 2, Imagen και Parti από την παραγωγή βλαβερών ή αμφισβητούμενων εικόνων είναι ευάλωτα σε einen είδος επιθετικής επίθεσης που涉ίζει ‘συνθετικές’ λέξεις.

Ο συγγραφέας έχει αναπτύξει δύο προσεγγίσεις που μπορούν να παρακαμπτίσουν τα μέτρα ελέγχου περιεχομένου σε ένα σύστημα σύνθεσης εικόνων και έχει διαπιστώσει ότι είναι αξιοπρόσεκτα ανθεκτικά ακόμη και σε διαφορετικές αρχιτεκτονικές, υποδεικνύοντας ότι η αδυναμία είναι περισσότερο από системική και μπορεί να βασίζεται σε κάποιους από τους πιο θεμελιώδεις κανόνες της σύνθεσης κειμένου-εικόνας.

Η πρώτη, και η ισχυρότερη από τις δύο, ονομάζεται μακαρωνική προώθηση. Ο όρος ‘μακαρωνική’ αρχικά αναφέρεται σε einen μείγμα πολλών γλωσσών, όπως το Εσπεράντο ή το Unwinese. Ίσως το πιο πολιτιστικά διαδεδομένο παράδειγμα θα ήταν το Ουρντού-Αγγλικά, ένα είδος ‘μεικτής γλωσσικής’ που είναι κοινό στο Πακιστάν, το οποίο συνδυάζει ελεύθερα Αγγλικά ουσιαστικά και Ουρντού επιθήματα.

Συνθετική μακαρωνική προώθηση στο DALL-E 2. Πηγή: https://arxiv.org/pdf/2208.04135.pdf

Συνθετική μακαρωνική προώθηση στο DALL-E 2. Πηγή: https://arxiv.org/pdf/2208.04135.pdf

Σε κάποια από τα παραπάνω παραδείγματα, τμήματα ορθών λέξεων έχουν κολληθεί μαζί, χρησιμοποιώντας τα Αγγλικά ως ‘σκαφίδι’. Άλλα παραδείγματα στο έγγραφο χρησιμοποιούν πολλές γλώσσες σε μια seule προώθηση.

Το σύστημα θα απαντήσει με έναν σημασιολογικά σημαντικό τρόπο λόγω της σχετικής έλλειψης επιμέλειας στις πηγές του ιστότοπου στις οποίες το σύστημα εκπαιδεύτηκε. Такие πηγές θα έχουν συχνά έρθει πλήρεις με πολυγλωσσικές ετικέτες (δηλαδή από σύνολα δεδομένων που δεν σχεδιάστηκαν ειδικά για μια εργασία σύνθεσης εικόνων), και κάθε λέξη που καταναλώνεται, σε οποιαδήποτε γλώσσα, θα γίνει ένα ‘token’· αλλά επίσης τμήματα αυτών των λέξεων θα γίνουν ‘subwords’ ή κλασματικά tokens. Στην επεξεργασία φυσικής γλώσσας (NLP), αυτό το είδος ‘stemming’ βοηθά να διακρίνει την ετυμολογία μακρύτερων παραγώγων λέξεων που μπορεί να προκύψουν σε μετασχηματιστικές επιχειρήσεις, αλλά επίσης δημιουργεί einen τεράστιο λεξικό ‘Λεγκο’ που ‘δημιουργική’ προώθηση μπορεί να εκμεταλλευτεί.

Μονογλωσσικές λέξεις-πορτομάντο也是 αποτελεσματικές στην απόκτηση εικόνων μέσω έμμεσης ή μη προσανατολισμένης γλώσσας, με πολύ παρόμοια αποτελέσματα που μπορούν να επιτευχθούν σε διαφορετικές αρχιτεκτονικές, όπως DALL-E 2 και DALL-E Mini (Craiyon).

Μονογλωσσικές λέξεις-πορτομάντο επίσης αποτελεσματικές στην απόκτηση εικόνων μέσω έμμεσης ή μη προσανατολισμένης γλώσσας, με πολύ παρόμοια αποτελέσματα που μπορούν να επιτευχθούν σε διαφορετικές αρχιτεκτονικές, όπως DALL-E 2 και DALL-E Mini (Craiyon).

Στην δεύτερη προσεγγίση, που ονομάζεται ευκαιριακή προώθηση, κάποιες από τις συνδεδεμένες λέξεις είναι παρόμοιες σε τόνο με την πιο νεανική τάση του ‘λατινικού σχολείου’ παρουσιάζεται στο Μοντι Πάιθονς: Η Ζωή του Μπράιαν (1979).

Δεν είναι αστείο – ψευδολάτιν μπορεί να επιτύχει μια σημαντική απάντηση από το DALL-E 2.

Δεν είναι αστείο – ψευδολάτιν μπορεί να επιτύχει μια σημαντική απάντηση από το DALL-E 2.

Ο συγγραφέας αναφέρει:

‘Μια φανερή ανησυχία με αυτή τη μέθοδο είναι η παρακάμψη των φίλτρων περιεχομένου με βάση μαυρισμένες προωθήσεις. Σε принцип, η μακαρωνική προώθηση θα μπορούσε να παρέχει έναν εύκολο και φαινομενικά αξιόπιστο τρόπο να παρακαμπτίσουν τέτοια φίλτρα για να παραγάγουν βλαβερά, αμφισβητούμενα, παράνομα ή αλλιώς ευαίσθητο περιεχόμενο, συμπεριλαμβανομένων βίαιων, μισαλλόδοξων, ρατσιστικών, σεξιστικών ή πορνογραφικών εικόνων, και ίσως εικόνων που παραβιάζουν πνευματικά δικαιώματα ή απεικονίζουν πραγματικά άτομα.

‘Οι εταιρείες που προσφέρουν υπηρεσίες σύνθεσης εικόνων έχουν βάλει πολλή φροντίδα για να αποτρέψουν την παραγωγή τέτοιων εξόδων σύμφωνα με την πολιτική περιεχομένου τους. Συνεπώς, η μακαρωνική προώθηση θα πρέπει να ερευνήθεί συστηματικά ως απειλή για τα πρωτόκολλα ασφαλείας που χρησιμοποιούνται για την εμπορική σύνθεση εικόνων.’

Ο συγγραφέας προτείνει έναν αριθμό λύσεων για αυτή την ευαλωτότητα, κάποιες από τις οποίες παραδέχεται ότι θα μπορούσαν να θεωρηθούν υπερ-περιοριστικές.

Η πρώτη πιθανή λύση είναι η πιο ακριβή: να επιμεληθούν πιο προσεκτικά τις πηγές εκπαίδευσης, με περισσότερη ανθρώπινη και λιγότερη αλγοριθμική επιτήρηση. Ωστόσο, το έγγραφο παραδέχεται ότι αυτό δεν θα εμπόδιζε το σύστημα σύνθεσης εικόνων από τη δημιουργία μιας αμφισβητούμενης σύνδεσης μεταξύ δύο εννοιών εικόνων που από μόνες τους είναι δυνητικά αθώες.

Δεύτερον, το έγγραφο προτείνει ότι τα συστήματα σύνθεσης εικόνων θα μπορούσαν να τρέξουν την πραγματική έξοδό τους μέσω ενός συστήματος φίλτρων, intercepting οποιαδήποτε προβληματικές συνδέσεις πριν τις παρουσιάσουν στον χρήστη. Είναι πιθανό ότι το DALL-E 2 λειτουργεί ένα τέτοιο φίλτρο, αν και η OpenAI δεν έχει αποκαλύψει ακριβώς πώς λειτουργεί η διαδικασία ελέγχου περιεχομένου του DALL-E 2.

Τέλος, ο συγγραφέας εξετάζει την πιθανότητα ενός ‘λεξικού λευκού καταλόγου’, το οποίο θα επιτρέψει μόνο εγκεκριμένες και ελεγμένες λέξεις να ανακτήσουν και να αποδώσουν έννοιες, αλλά παραδέχεται ότι αυτό θα μπορούσε να αντιπροσωπεύσει μια υπερβολικά αυστηρή περιορισμό στην उपयσιμότητα του συστήματος.

Αν και ο ερευνητής πειραματίστηκε μόνο με πέντε γλώσσες (Αγγλικά, Γερμανικά, Γαλλικά, Ισπανικά και Ιταλικά) στη δημιουργία προωθήσεων, πιστεύει ότι αυτό το είδος ‘επιθετικής επίθεσης’ θα μπορούσε να γίνει ακόμη πιο ‘κρυπτικό’ και δύσκολο να αποτρέψει, επεκτείνοντας τον αριθμό των γλωσσών, δεδομένου ότι υπερκλίμακες μοντέλα όπως το DALL-E 2 εκπαιδεύονται σε πολλές γλώσσες (αφού είναι πιο εύκολο να χρησιμοποιηθούν ελαφρώς φιλτραρισμένες ή ‘ακατέργαστες’ εισόδους παρά να θεωρηθούν οι τεράστιες δαπάνες για την επιμέλεια τους, και επειδή η πρόσθετη διαστατικότητα είναι πιθανό να αυξήσει την उपयσιμότητα του συστήματος).

Το έγγραφο έχει τον τίτλο Επιθετικές Επιθέσεις στη Σύνθεση Εικόνων με Συνθετικές Λέξεις και προέρχεται από τον Raphaël Millièρε στο Πανεπιστήμιο Κολούμπια.

Κρυπτική Γλώσσα στο DALL-E 2

Έχει προταθεί παλαιότερα ότι η ανοησία που το DALL-E 2 εξοδεύει κάθε φορά που προσπαθεί να απεικονίσει γραπτή γλώσσα θα μπορούσε να είναι ένα ‘κρυφό λεξιλόγιο’. Ωστόσο, η προηγούμενη έρευνα σε αυτή τη μυστηριώδη γλώσσα δεν έχει προσφέρει κανέναν τρόπο να αναπτύξει nonce chains που μπορούν να καλέσουν συγκεκριμένες εικόνες.

Από την προηγούμενη έρευνα, το έγγραφο αναφέρει:

‘[Αυτό] δεν προσφέρει einen αξιόπιστο μέθοδο να βρει nonce chains που προκαλούν συγκεκριμένες εικόνες. Τα περισσότερα από τα ανοησιά текст που περιλαμβάνονται από το DALL-E 2 στις εικόνες δεν φαίνεται να είναι αναξιόπιστο συνδεδεμένα με συγκεκριμένες οπτικές έννοιες όταν μεταγράφονται και χρησιμοποιούνται ως προώθηση. Αυτό περιορίζει την εγκυρότητα αυτής της προσέγγισης ως τρόπο να παρακαμπτίσουν τον έλεγχο βλαβερών ή αμφισβητούμενων περιεχομένων· ως τέτοιο, δεν είναι ένας ιδιαίτερα ανησυχητικός κίνδυνος για την κακοποίηση των μοντέλων σύνθεσης εικόνων με οδηγία κειμένου.’

Αντίθετα, οι δύο μέθοδοι του συγγραφέα αναπτύσσονται ως μέσα με τα οποία η ανοησία μπορεί να καλέσει συσχετιζόμενη και σημαντική εικόνα, παρακάμπτοντας την συμβατική ετυμολογία που αναπτύσσεται σε μηχανική προώθηση.

Με τον τρόπο του παραδείγματος, ο συγγραφέας εξετάζει την λέξη για ‘πουλιά’ στις πέντε γλώσσες που είναι στο πεδίο του εγγράφου: Vögel στα Γερμανικά, uccelli στα Ιταλικά, oiseaux στα Γαλλικά, και pájaros στα Ισπανικά.

Με την byte-pair encoding (BPE) tokenization που χρησιμοποιείται από την εφαρμογή του CLIP που είναι ενσωματωμένο στο DALL-E 2, οι λέξεις tokenize σε μη-τονικές Αγγλικά, και μπορούν να ‘δημιουργηθούν’ για να σχηματίσουν nonce λέξεις που φαίνονται ανοησίες για μας, αλλά διατηρούν το κολλημένο σημασιολογικό τους νόημα για το DALL-E 2, επιτρέποντας στο σύστημα να εκφράσει την αντιλαμβανόμενη πρόθεση:

Στο παραπάνω παράδειγμα, δύο από τις ‘ξένες’ λέξεις για πουλί κολλήθηκαν μαζί σε μια ανοησία. Χάρη στο κλασματικό βάρος των sub-words, το νόημα διατηρείται.

Ο συγγραφέας τονίζει ότι σημαντικά αποτελέσματα μπορούν να επιτευχθούν χωρίς να ακολουθούν τα όρια της υπο-λεξικής διαίρεσης, πιθανότατα επειδή το DALL-E 2 (η πρωταρχική μελέτη του εγγράφου) έχει γενικευθεί αρκετά για να αφήσει τα όρια των sub-words να θολώσουν χωρίς να καταστρέφουν το νόημά τους.

Για να αποδείξει περαιτέρω τις προσεγγίσεις που αναπτύχθηκαν, το έγγραφο προσφέρει παραδείγματα μακαρωνικής προώθησης σε διαφορετικά πεδία, χρησιμοποιώντας τον κατάλογο των token λέξεων που εικονίζεται παρακάτω (με ανοησίες-υβριδικές λέξεις στο δεξί μέρος).

Ο συγγραφέας αναφέρει ότι τα ακόλουθα παραδείγματα από το DALL-E 2 δεν είναι ‘επιλεγμένα’:

Λεξιλόγιο

Το έγγραφο επίσης παρατηρεί ότι πολλά από αυτά τα παραδείγματα λειτουργούν εξίσου καλά, ή τουλάχιστον πολύ παρόμοια, και στις DALL-E 2 και DALL-E Mini (τώρα Craiyon), και ότι αυτό είναι आश्चαρωτικό,既然 το DALL-E 2 είναι ένα μοντέλο διάχυσης και το DALL-E Mini δεν είναι; τα δύο συστήματα εκπαιδεύονται σε διαφορετικά σύνολα δεδομένων; και το DALL-E Mini χρησιμοποιεί einen BART tokenizer αντί του CLIP tokenizer που ευνοείται από το DALL-E 2.

Πολύ παρόμοια αποτελέσματα από το DALL-E Mini, σε σύγκριση με την προηγούμενη εικόνα, η οποία παρουσίασε αποτελέσματα από την ίδια 'ανοησία' εισαγωγή από το DALL-E 2.

Πολύ παρόμοια αποτελέσματα από το DALL-E Mini, σε σύγκριση με την προηγούμενη εικόνα, η οποία παρουσίασε αποτελέσματα από την ίδια ‘ανοησία’ εισαγωγή από το DALL-E 2.

Όπως φαίνεται στην πρώτη από τις εικόνες παραπάνω, η μακαρωνική προώθηση μπορεί επίσης να συναρμολογηθεί σε συντακτικά σωστές προτάσεις για να γεννήσει πιο σύνθετες σκηνές. Ωστόσο, αυτό απαιτεί την χρήση των Αγγλικών ως ‘σκαφίδι’ για να συναρμολογήσει τις έννοιες, καθιστώντας την διαδικασία πιο πιθανή να intercepted από τυπικά συστήματα φίλτρων σε ένα σύστημα σύνθεσης εικόνων.

Το έγγραφο παρατηρεί ότι η λεξική υβριδισμός, το ‘κολλήσιμο’ των λέξεων για να καλέσει συσχετιζόμενη περιεχόμενο από ένα σύστημα σύνθεσης εικόνων, μπορεί επίσης να επιτευχθεί σε μια seule γλώσσα, με την χρήση λέξεων-πορτομάντο.

Ευκαιριακή Προώθηση

Η ‘ευκαιριακή προώθηση’ προσεγγίση που παρουσιάζεται στο έγγραφο εξαρτάται από την ‘ευκαιριακή’ απάντηση του συστήματος με λέξεις που δεν βασίζονται αυστηρά σε sub-words ή sub-tokens ή μερικά κοινά ετικέτα.

Ένας τύπος ευκαιριακής προώθησης είναι το ψευδολάτιν, το οποίο μπορεί, μεταξύ άλλων χρήσεων, να γεννήσει εικόνες φανταστικών φαρμάκων, ακόμη και χωρίς καμία προδιαγραφή ότι το DALL-E 2 θα πρέπει να ανακτήσει την έννοια του ‘φαρμάκου’:

Η ευκαιριακή προώθηση λειτουργεί επίσης ιδιαίτερα καλά με ανοησίες που σχετίζονται με γεωγραφικές τοποθεσίες, και λειτουργεί αρκετά αξιόπιστα σε διαφορετικές αρχιτεκτονικές, όπως DALL-E 2 και DALL-E Mini:

Οι λέξεις που χρησιμοποιούνται για αυτές τις προωθήσεις στο DALL-E 2 και DALL-E Mini είναι redolent των πραγματικών ονομάτων, αλλά είναι από μόνες τους ανοησίες. Παρόλα αυτά, τα συστήματα έχουν 'πιάσει το κλίμα' των λέξεων.

Οι λέξεις που χρησιμοποιούνται για αυτές τις προωθήσεις στο DALL-E 2 και DALL-E Mini είναι redolent των πραγματικών ονομάτων, αλλά είναι από μόνες τους ανοησίες. Παρόλα αυτά, τα συστήματα έχουν ‘πιάσει το κλίμα’ των λέξεων.

Φαίνεται να υπάρχει κάποια διασταύρωση μεταξύ μακαρωνικής και ευκαιριακής προώθησης. Το έγγραφο αναφέρει:

‘Φαίνεται ότι οι διαφορές στις πηγές δεδομένων, το μέγεθος του μοντέλου και η αρχιτεκτονική του μοντέλου μπορεί να κάνουν τα μοντέλα να αναλύουν προωθήσεις σαν voiscellpajaraux και eidelucertlagarzard σε είτε ‘μακαρωνικό’ είτε ‘ευκαιριακό’ τρόπο, ακόμη και όταν αυτά τα μοντέλα έχουν αποδειχθεί ότι είναι ανταποκρικά σε cả τις δύο μεθόδους προώθησης.’

Το έγγραφο ολοκληρώνεται:

‘Ενώ διάφορες ιδιότητες αυτών των μοντέλων – συμπεριλαμβανομένων του μεγέθους, της αρχιτεκτονικής, της διαδικασίας tokenization και των πηγών δεδομένων – μπορεί να επηρεάσουν την ευαλωτότητά τους σε επιθετικές επιθέσεις με βάση το κείμενο, οι προκαταρκτικές ενδείξεις που συζητήθηκαν σε αυτό το έργο υποδηλώνουν ότι κάποιες από αυτές τις επιθέσεις μπορεί να λειτουργήσουν κάπως αξιόπιστα σε διαφορετικά μοντέλα.’

Ο μεγαλύτερος εμπόδιο για την πειραματική έρευνα γύρω από αυτές τις μεθόδους είναι ο κίνδυνος να σημαδευτούν και να απαγορευτούν από το σύστημα. Το DALL-E 2 απαιτεί einen συνδεδεμένο αριθμό τηλεφώνου για κάθε λογαριασμό χρήστη, περιορίζοντας τον αριθμό των ‘ψεύτικων’ λογαριασμών που θα χρειαζόταν για να δοκιμάσει πραγματικά τα όρια αυτού του είδους της λεξικής επίθεσης, σε σχέση με την υπονόμευση των υφιστάμενων μεθόδων ελέγχου. Τώρα, η πρωταρχική ασφάλεια του DALL-E 2 παραμένει η ευστάθεια της πρόσβασης.

 

Πρώτη δημοσίευση 9η Αυγούστου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai