Μοντέλα και πλατφόρμες AI

Αλγόριθμος TextFooler Αποτυγχάνει τον NLP AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Όσο εντυπωσιακά και να έχουν γίνει οι αλγόριθμοι επεξεργασίας φυσικής γλώσσας και τα συστήματα τα τελευταία χρόνια, παραμένουν ακόμη ευάλωτοι σε ένα είδος εκμετάλλευσης γνωστό ως “αντιπαλικό παράδειγμα”. Τα αντιπαλικά παραδείγματα είναι προσεκτικά σχεδιασμένες φράσεις που μπορούν να προκαλέσουν σε ένα σύστημα NLP να συμπεριφερθεί με απροσδόκητο και μη επιθυμητό τρόπο. Τα προγράμματα AI μπορούν να προγραμματιστούν να συμπεριφερθούν με αυτά τα παράξενα παραδείγματα, και ως αποτέλεσμα, οι ερευνητές AI προσπαθούν να σχεδιάσουν τρόπους για να προστατεύσουν από τις επιπτώσεις των αντιπαλικών παραδειγμάτων.

Πρόσφατα, μια ομάδα ερευνητών από το Πανεπιστήμιο του Χονγκ Κονγκ και την Υπηρεσία Επιστήμης, Τεχνολογίας και Έρευνας της Σιγκαπούρης συνεργάστηκαν για να δημιουργήσουν einen αλγόριθμο που αποδεικνύει τον κίνδυνο των αντιπαλικών παραδειγμάτων. Όπως ανέφερε το Wired, ο αλγόριθμος ονομάστηκε TextFooler από την ερευνητική ομάδα και λειτουργεί με τη λεπτή αλλαγή τμημάτων μιας πρότασης, επηρεάζοντας τον τρόπο με τον οποίο ένας ταξινομητής NLP μπορεί να ερμηνεύσει την πρόταση. Για παράδειγμα, ο αλγόριθμος μετέτρεψε μια πρόταση σε μια άλλη παρόμοια πρόταση και η πρόταση εισήχθη σε einen ταξινομητή που σχεδιάστηκε για να καθορίσει αν μια κριτική ήταν αρνητική ή θετική. Η αρχική πρόταση ήταν:

“Οι χαρακτήρες, που ανήκουν σε απίστευτα συνθετικά καταστάσεις, είναι πλήρως απομακρυσμένοι από την πραγματικότητα.”

Μετατράπηκε σε αυτή την πρόταση:

“Οι χαρακτήρες, που ανήκουν σε απίστευτα σχεδιασμένα περιβάλλοντα, είναι πλήρως απομακρυσμένοι από την πραγματικότητα.”

Αυτές οι λεπτές αλλαγές προκάλεσαν τον ταξινομητή κειμένου να ταξινομήσει την κριτική ως θετική αντί για αρνητική. Η ερευνητική ομάδα έκανε το ίδιο πείραμα (ανταλλάσσοντας ορισμένα λόγια με συνώνυμα) σε διάφορα σύνολα δεδομένων και αλγόριθμους ταξινόμησης κειμένου. Η ερευνητική ομάδα αναφέρει ότι μπόρεσαν να μειώσουν την ακρίβεια ταξινόμησης ενός αλγορίθμου στο 10%, από το 90%. Αυτό συμβαίνει παρά το γεγονός ότι οι άνθρωποι που διάβασαν αυτές τις προτάσεις θα τις ερμηνεύσουν με τον ίδιο τρόπο.

Αυτά τα αποτελέσματα είναι ανησυχητικά σε μια εποχή όπου οι αλγόριθμοι NLP και το AI χρησιμοποιούνται όλο και περισσότερο, και για σημαντικές εργασίες όπως η αξιολόγηση ιατρικών αιτημάτων ή η ανάλυση νομικών εγγράφων. Δεν είναι γνωστό πόσο μεγάλος κίνδυνος για τους τρέχοντες αλγόριθμους αντιπροσωπεύουν τα αντιπαλικά παραδείγματα. Οι ερευνητικές ομάδες σε όλο τον κόσμο προσπαθούν ακόμη να καθορίσουν πόσο μεγάλη επίδραση μπορούν να έχουν. Πρόσφατα, μια αναφορά που δημοσιεύθηκε από την ομάδα Stanford Human-Centered AI πρότεινε ότι τα αντιπαλικά παραδείγματα μπορούν να εξαπατήσουν τους αλγόριθμους AI και να χρησιμοποιηθούν για να διαπράξουν φορολογικές απάτες.

Υπάρχουν ορισμένα όρια στη πρόσφατη μελέτη. Για παράδειγμα, ο Sameer Singh, επίκουρος καθηγητής επιστήμης υπολογιστών στο UC Irvine, σημείωσε ότι η αντιπαλική μέθοδος που χρησιμοποιήθηκε ήταν αποτελεσματική, αλλά βασίζεται σε κάποια γνώση της αρχιτεκτονικής του AI. Το AI πρέπει να εξεταστεί επανειλημμένα μέχρι να βρεθεί μια αποτελεσματική ομάδα λέξεων, και τέτοιες επαναλαμβανόμενες επιθέσεις μπορεί να ανιχνευτούν από προγράμματα ασφαλείας. Ο Singh και οι συνεργάτες του έχουν κάνει τη δική τους έρευνα sobre το θέμα και βρήκαν ότι προηγμένα συστήματα όπως τα αλγόριθμοι OpenAI μπορούν να παράγουν ρατσιστικό, επιζήμιο κείμενο όταν προτρεπόύνται με ορισμένες προκαλούμενες φράσεις.

Τα αντιπαλικά παραδείγματα είναι επίσης ένα πιθανό πρόβλημα όταν ασχολούμαστε με οπτικά δεδομένα όπως φωτογραφίες ή βίντεο. Ένα διάσημο παράδειγμα αφορά την εφαρμογή ορισμένων λεπτών ψηφιακών μετασχηματισμών σε μια εικόνα γατιού, προκαλώντας τον ταξινομητή εικόνας να ερμηνεύσει ως οθόνη ή επιτραπέζιο υπολογιστή. Σε ένα άλλο παράδειγμα, η έρευνα που έγινε από τον καθηγητή Dawn Song του UC Berkeley βρήκε ότι τα αντιπαλικά παραδείγματα μπορούν να χρησιμοποιηθούν για να αλλάξουν τον τρόπο με τον οποίο τα συστήματα όρασης υπολογιστή αντιλαμβάνονται τα οδικά σημάδια, το οποίο θα μπορούσε να είναι επικίνδυνο για τα αυτόνομα οχήματα.

Η έρευνα όπως αυτή που έγινε από την ομάδα του Χονγκ Κονγκ-Σιγκαπούρης μπορεί να βοηθήσει τους μηχανικούς AI να κατανοήσουν καλύτερα ποια είδη ευαλωτότητας έχουν οι αλγόριθμοι AI και να σχεδιάσουν τρόπους για να προστατεύσουν από αυτές τις ευαλωτότητες. Για παράδειγμα, οι ταξινομητές συνόλου μπορούν να χρησιμοποιηθούν για να μειώσουν την πιθανότητα ότι ένα αντιπαλικό παράδειγμα θα μπορέσει να εξαπατήσει το σύστημα όρασης υπολογιστή. Με αυτή τη τεχνική, χρησιμοποιούνταιหลาย ταξινομητές και γίνονται μικρές μετασχηματίσεις στην είσοδο εικόνας. Η πλειοψηφία των ταξινομητών θα ανιχνεύσει συνήθως аспектς του πραγματικού περιεχομένου της εικόνας, τα οποία στη συνέχεια συναθροίζονται. Το αποτέλεσμα είναι ότι ακόμη και αν κάποιοι από τους ταξινομητές εξαπατηθούν, οι περισσότεροι δεν θα εξαπατηθούν και η εικόνα θα ταξινομηθεί σωστά.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.