Μοντέλα και πλατφόρμες AI
Παραγωγή παραφράσεων χρησιμοποιώντας βαθιά ενισχυμένη μάθηση – Ηγέτες σκέψης

Όταν γράφουμε ή μιλάμε, όλους μας έχει καμιά στιγμή παρατηρήσει αν υπάρχει καλύτερος τρόπος για να μεταφέρουμε μια ιδέα στους άλλους. Ποια λόγια πρέπει να χρησιμοποιήσουμε; Πώς πρέπει να δομήσουμε τη σκέψη; Πώς είναι πιθανό να ανταποκριθούν; Στο Phrasee, περνάμε πολύ χρόνο σκεπτόμενοι για τη γλώσσα – τι λειτουργεί και τι όχι.
Φανταστείτε ότι γράφετε το θέμα ενός email που θα σταλεί σε 10 εκατομμύρια άτομα στη λίστα σας, προωθώντας 20% έκπτωση σε ένα καινούριο, πολυτελές laptop.
Ποια γραμμή θα επιλέγατε;
- Μπορείτε τώρα να πάρете μια επιπλέον 20% έκπτωση στην επόμενη παραγγελία σας
- Ετοιμαστείτε – μια επιπλέον 20% έκπτωση
Ενώ μεταφέρουν την ίδια πληροφορία, η μια πέτυχε σχεδόν 15% υψηλότερο ποσοστό ανοίγματος από την άλλη (και ποντάρω ότι δεν μπορείτε να νικήσετε το μοντέλο μας στην πρόβλεψη ποια είναι η σωστή).
Ενώ η γλώσσα μπορεί συχνά να ελεγχθεί μέσω A/B testing ή multi-armed bandits, η αυτόματη παραγωγή παραφράσεων παραμένει ένα πολύ δύσκολο ερευνητικό πρόβλημα.
Δύο προτάσεις θεωρούνται παραφράσεις η μια της άλλης αν μοιράζονται την ίδια σημασία και μπορούν να χρησιμοποιηθούν ανταλλακτικά. Ένα άλλο σημαντικό πράγμα που συχνά λαμβάνεται ως δεδομένο είναι αν μια πρόταση που παράγεται από μηχανή είναι ευφάνταστη.
Σε αντίθεση με την επιτηρημένη μάθηση, τα παράγοντα της Ενισχυμένης Μάθησης (RL) μαθαίνουν μέσω της αλληλεπίδρασης με το περιβάλλον τους και της παρατήρησης των ανταμοιβών που λαμβάνουν ως αποτέλεσμα. Αυτή η κάπως νюανσική διαφορά έχει τεράστιες επιπτώσεις για το πώς λειτουργούν οι αλγόριθμοι και πώς εκπαιδεύονται τα μοντέλα. Η Βαθιά Ενισχυμένη Μάθηση χρησιμοποιεί νευρωνικά δίκτυα ως προσεγγιστική συνάρτηση για να επιτρέψει στον παράγοντα να μάθει πώς να ξεπεράσει τους ανθρώπους σε σύνθετα περιβάλλοντα όπως Go, Atari και StarCraft II.
Παρά τη συγκεκριμένη επιτυχία, η ενισχυμένη μάθηση δεν έχει εφαρμοστεί ευρέως σε προβλήματα του πραγματικού κόσμου, συμπεριλαμβανομένης της επεξεργασίας φυσικής γλώσσας (NLP).
Στο πλαίσιο της διπλωματικής εργασίας μου στη Επιστήμη Δεδομένων, αποδεικνύουμε πώς η Βαθιά Ενισχυμένη Μάθηση μπορεί να χρησιμοποιηθεί για να ξεπεράσει τις μεθόδους επιτηρημένης μάθησης στην αυτόματη παραγωγή παραφράσεων του εισαγόμενου κειμένου. Το πρόβλημα της παραγωγής της καλύτερης παραφράσης μπορεί να θεωρηθεί ως η εύρεση της σειράς των λέξεων που μεγιστοποιεί τη σημασιολογική ομοιότητα μεταξύ των προτάσεων ενώ διατηρεί την ευφάνταστη έξοδο. Οι παράγοντες της RL είναι καλά προσαρμοσμένοι για να βρουν το καλύτερο σύνολο ενεργειών για να επιτύχουν την μέγιστη αναμενόμενη ανταμοιβή σε περιβάλλοντα ελέγχου.
Σε αντίθεση με τα περισσότερα προβλήματα της μηχανικής μάθησης, το μεγαλύτερο πρόβλημα στις περισσότερες εφαρμογές της Γεννήτριας Φυσικής Γλώσσας (NLG) δεν βρίσκεται στη μοντελοποίηση αλλά μάλλον στην αξιολόγηση. Ενώ η αξιολόγηση από ανθρώπους θεωρείται目前 το χρυσωρό πρότυπο στην αξιολόγηση της NLG, υποφέρει από σημαντικά μειονεκτήματα, συμπεριλαμβανομένης της υψηλής τιμής, του χρόνου, της δυσκολίας της ρύθμισης και της έλλειψης αναπαραγωγιμότητας μεταξύ πειραμάτων και συνόλων δεδομένων (Han, 2016). Ως αποτέλεσμα, οι ερευνητές έχουν αναζητήσει για χρόνια αυτόματα μετρικά που είναι απλά, γενικευμένα και αντανακλούν την κρίση των ανθρώπων (Papineni et al., 2002).
Τα πιο συνήθη αυτόματα μεθόδους αξιολόγησης για την αξιολόγηση των αυτόματα παραγόμενων legendων εικόνων συνοψίζονται παρακάτω με τα πλεονεκτήματα και τα μειονεκτήματά τους:

Παραγωγή Παραφράσεων χρησιμοποιώντας τη Διαδικασία Ενισχυμένης Μάθησης
Αναπτύξαμε ένα σύστημα με το όνομα ParaPhrasee που παράγει υψηλής ποιότητας παραφράσεις. Το σύστημα αποτελείται από πολλά βήματα για να εφαρμόσει την ενισχυμένη μάθηση με έναν υπολογιστικά αποτελεσματικό τρόπο. Ένας σύντομος περίληψη της υψηλού επιπέδου διαδικασίας παρουσιάζεται παρακάτω με περισσότερες λεπτομέρειες που περιέχονται στη διπλωματική εργασία.

Δεδομένα
Υπάρχουν πολλά σύνολα δεδομένων παραφράσεων που χρησιμοποιούνται στην έρευνα, συμπεριλαμβανομένων: του Microsoft Paraphrase corpus (MSFT ), του διαγωνισμού Semantic Text Similarity του ACL, Quora Duplicate Questions και Twitter Shared Links. Έχουμε επιλέξει MS-COCO λόγω του μεγέθους, της καθαρότητας και της χρήσης του ως αναφορά για δύο αξιοσημείωτες εργασίες παραγωγής παραφράσεων. Το MS-COCO περιέχει 120k εικόνες κοινών σκηνών με 5 legend εικόνων ανά εικόνα που παρέχονται από 5 διαφορετικούς ανθρώπινους annotators.
Ενώ είναι πρωτίστως σχεδιασμένο για έρευνα υπολογιστικής όρασης, οι legend εικόνων τείνουν να έχουν υψηλή σημασιολογική ομοιότητα και είναι ενδιαφέρουσες παραφράσεις. Δεδομένου ότι οι legend εικόνων παρέχονται από διαφορετικά άτομα, τείνουν να έχουν μικρές παραλλαγές στις λεπτομέρειες που παρέχονται στη σκηνή, επομένως οι παραγόμενοι προτάσεις τείνουν να ονειροπολούν λεπτομέρειες.

Επιτηρημένο Μοντέλο
Ενώ η ενισχυμένη μάθηση έχει βελτιωθεί σημαντικά σε όρους δειγματοληψίας, χρόνων εκπαίδευσης και γενικά beste πρακτικών, η εκπαίδευση μοντέλων RL από την αρχή είναι ακόμη σχετικά πολύ αργή και ασταθής (Arulkumaran et al., 2017). Ως αποτέλεσμα, αντί να εκπαιδεύσουμε από την αρχή, πρώτα εκπαιδεύουμε ένα επιτηρημένο μοντέλο και στη συνέχεια το βελτιστοποιούμε χρησιμοποιώντας RL.
Χρησιμοποιούμε ένα Encoder-Decoder μοντέλο και αξιολογούμε την απόδοση πολλών βασικών επιτηρημένων μοντέλων. Όταν βελτιστοποιούμε το μοντέλο χρησιμοποιώντας RL, βελτιστοποιούμε μόνο το δίκτυο αποκωδικοποιητή και θεωρούμε το δίκτυο κωδικοποιητή ως στατικό. Ως αποτέλεσμα, εξετάζουμε δύο κύρια πλαίσια:
- Εκπαίδευση του επιτηρημένου μοντέλου από την αρχή χρησιμοποιώντας ένα τυπικό/βανίλια encoder decoder με GRUs
- Χρήση προ-εκπαιδευμένων μοντέλων sentence embedding για τον κωδικοποιητή, συμπεριλαμβανομένων: pooled word embeddings (GloVe), InferSent και BERT
Τα επιτηρημένα μοντέλα τείνουν να έχουν παρόμοια απόδοση σε όλα τα μοντέλα, με το BERT και το βανίλια encoder-decoder να επιτύχουν την καλύτερη απόδοση.

Ενώ η απόδοση τείνει να είναι λογική, υπάρχουν τρεις κοινοί πηγές σφαλμάτων: stuttering, παραγωγή τμημάτων προτάσεων και ονειροπόληση. Αυτά είναι τα κύρια προβλήματα που η χρήση της RL στοχεύει να λύσει.

Μοντέλο Ενισχυμένης Μάθησης
Η υλοποίηση αλγορίθμων RL είναι πολύ δύσκολη, ιδιαίτερα όταν δεν ξέρετε αν το πρόβλημα μπορεί να λυθεί. Υπάρχουν προβλήματα στην υλοποίηση του περιβάλλοντος σας, των παραγόντων σας, των υπερπαραμέτρων σας, της συνάρτησης ανταμοιβής σας ή μιας συνδυασμού όλων των ανωτέρω! Αυτά τα προβλήματα επιδεινώνονται όταν κάνετε βαθιά ενισχυμένη μάθηση, καθώς έχετε την πρόσθετη πολυπλοκότητα της αντιμετώπισης νευρωνικών δικτύων.
Όπως και με όλους τους τρόπους αντιμετώπισης, είναι απαραίτητο να ξεκινήσετε απλά. Υλοποιήσαμε παραλλαγές δύο καλά κατανοητών περιβαλλόντων RL (CartPole και FrozenLake) για να δοκιμάσουμε αλγορίθμους RL και να βρούμε μια επαναλαμβανόμενη στρατηγική για τη μεταφορά γνώσεων από το επιτηρημένο μοντέλο.
Βρήκαμε ότι η χρήση ενός Actor-Critic αλγορίθμου ξεπέρασε το REINFORCE σε αυτά τα περιβάλλοντα. Όσον αφορά τη μεταφορά γνώσεων στο μοντέλο actor-critic, βρήκαμε ότι η αρχικοποίηση των βαρών του actor με το εκπαιδευμένο επιτηρημένο μοντέλο και η προ-εκπαίδευση του κριτή επέτυχε την καλύτερη απόδοση. Βρήκαμε ότι ήταν δύσκολο να γενικεύσουμε σοφιστικούς προσεγγίσεις αποστασιοποίησης πολιτικής σε νέα περιβάλλοντα, καθώς εισάγουν πολλές νέες υπερπαραμέτρους που απαιτούν ρύθμιση για να λειτουργήσουν.
Υποστηριζόμενοι από αυτές τις εντυπώσεις, στη συνέχεια στρέφουμε την προσοχή μας στην ανάπτυξη μιας προσέγγισης για την εργασία παραγωγής παραφράσεων. Πρώτα πρέπει να δημιουργήσουμε ένα περιβάλλον.

Το περιβάλλον μας επιτρέπει να ελέγξουμε εύκολα την επίδραση της χρήσης διαφορετικών μετρικών αξιολόγησης ως συνάρτησης ανταμοιβής.
Στη συνέχεια, ορίσαμε τον παράγοντα, δεδομένων των πολλών πλεονεκτημάτων του, χρησιμοποιήσαμε μια αρχιτεκτονική actor-critic. Ο actor χρησιμοποιείται για την επιλογή της επόμενης λέξης στη σειρά και έχει τις βαρές του αρχικοποιημένες χρησιμοποιώντας το επιτηρημένο μοντέλο. Ο κριτής παρέχει μια εκτίμηση της αναμενόμενης ανταμοιβής που είναι πιθανό να λάβει μια κατάσταση για να βοηθήσει τον actor να μάθει.
Σχεδιασμός της Σωστής Συνάρτησης Ανταμοιβής
Το πιο σημαντικό συστατικό του σχεδιασμού ενός συστήματος RL είναι η συνάρτηση ανταμοιβής, καθώς αυτό είναι αυτό που ο παράγοντας RL προσπαθεί να βελτιστοποιήσει. Εάν η συνάρτηση ανταμοιβής είναι λανθασμένη, τότε τα αποτελέσματα θα υποφέρουν, ακόμη και αν κάθε άλλο μέρος του συστήματος λειτουργεί!
Ένα κλασικό παράδειγμα αυτού είναι CoastRunners, όπου οι ερευνητές του OpenAI ορίσαν την συνάρτηση ανταμοιβής ως την μεγιστοποίηση του συνολικού σκορ, αντί να κερδίσουν τον αγώνα. Το αποτέλεσμα αυτού είναι ο παράγοντας να ανακαλύψει einen βρόχο όπου μπορεί να πάρει το υψηλότερο σκορ, χτυπώντας turbos χωρίς να ολοκληρώσει ποτέ τον αγώνα.
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Δεδομένου ότι η αξιολόγηση της ποιότητας των παραφράσεων είναι ένα ανεπίλυτο πρόβλημα, ο σχεδιασμός μιας συνάρτησης ανταμοιβής που αυτόματα να συλλαμβάνει αυτό το αντικείμενο είναι ακόμη πιο δύσκολο. Οι περισσότερες πτυχές της γλώσσας δεν αποσυνθέτουν ωραία σε γραμμικά μετρικά και είναι εξαρτημένες από την εργασία (Novikova et al., 2017).
Ο παράγοντας RL συχνά ανακαλύπτει μια ενδιαφέρουσα στρατηγική για να μεγιστοποιήσει τις ανταμοιβές, η οποία εκμεταλλεύεται τις αδυναμίες στη μετρική αξιολόγησης, αντί να παράγει υψηλής ποιότητας κείμενο. Αυτό τείνει να οδηγήσει σε κακή απόδοση σε μετρικά που ο παράγοντας δεν βελτιστοποιεί άμεσα.
Εξετάζουμε τρεις κύριες προσεγγίσεις:
- Μετρήσεις επικάλυψης λέξεων
Κοινά μετρικά αξιολόγησης NLP λαμβάνουν υπόψη το ποσοστό επικάλυψης λέξεων μεταξύ της παραγόμενης παραφράσης και της πρότασης αξιολόγησης. Όσο μεγαλύτερη η επικάλυψη, τόσο μεγαλύτερη η ανταμοιβή. Η πρόκληση με τις προσεγγίσεις στο επίπεδο λέξης είναι ότι ο παράγοντας περιλαμβάνει太 πολλές λέξεις σύνδεσης, όπως “a είναι σε” και δεν υπάρχει μέτρο ευφάνταστης.
- Μετρήσεις ομοιότητας και ευφάνταστης πρότασης
Οι κύριες ιδιότητες μιας παραγόμενης παραφράσης είναι ότι πρέπει να είναι ευφάνταστη και σημασιολογικά παρόμοια με την είσοδο πρότασης. Ως αποτέλεσμα, προσπαθούμε να βαθμολογήσουμε αυτές τις ιδιότητες ξεχωριστά και στη συνέχεια να τις συνδυάσουμε. Για τη σημασιολογική ομοιότητα, χρησιμοποιούμε την ομοιότητα cosine μεταξύ sentence embeddings από προ-εκπαιδευμένα μοντέλα, συμπεριλαμβανομένων BERT. Για την ευφάνταστη, χρησιμοποιούμε μια βαθμολογία που βασίζεται στην perplexity μιας πρότασης από GPT-2. Όσο μεγαλύτερη η ομοιότητα cosine και η βαθμολογία ευφάνταστης, τόσο μεγαλύτερη η ανταμοιβή.
Δοκιμάσαμε πολλές διαφορετικές συνδυασμούς μοντέλων sentence embedding και μοντέλων ευφάνταστης και ενώ η απόδοση ήταν λογική, το κύριο πρόβλημα που αντιμετώπισε ο παράγοντας ήταν ότι δεν ισορροπούσε αρκετά τη σημασιολογική ομοιότητα με την ευφάνταστη. Για hầu hết τις ρυθμίσεις, ο παράγοντας προτίμησε την ευφάνταστη, οδηγώντας στην αφαίρεση λεπτομερειών και την majority των οντοτήτων να τοποθετηθούν “στο κέντρο” κάτι ή να μεταφερθούν “σε ένα τραπέζι” ή “πλευρά του δρόμου”.
Η多-αντικειμενική ενισχυμένη μάθηση είναι ένα ανοιχτό ερευνητικό ερώτημα και είναι πολύ δύσκολο σε αυτή την περίπτωση.

- Χρήση ενός ανταγωνιστικού μοντέλου ως συνάρτησης ανταμοιβής
Δεδομένου ότι οι άνθρωποι θεωρούνται το χρυσωρό πρότυπο στην αξιολόγηση, εκπαιδεύουμε ένα ξεχωριστό μοντέλο που ονομάζεται discriminator για να προβλέψει εάν δύο προτάσεις είναι παραφράσεις η μια της άλλης (παρόμοια με τον τρόπο που ένας άνθρωπος θα αξιολογούσε). Ο στόχος του μοντέλου RL είναι τότε να πείσει αυτό το μοντέλο ότι η παραγόμενη πρόταση είναι μια παραφράση της εισαγωγής. Ο discriminator παράγει μια βαθμολογία για το πόσο πιθανό είναι οι δύο προτάσεις να είναι παραφράσεις η μια της άλλης, η οποία χρησιμοποιείται ως ανταμοιβή για να εκπαιδεύσει τον παράγοντα.
Κάθε 5.000 догματίζουμε, ο discriminator μας λέει ποια παραφράση προέρχεται από το σύνολο δεδομένων και ποια ήταν παραγόμενη, ώστε να μπορεί να βελτιωθεί στις μελλοντικές догματίζεις. Η διαδικασία συνεχίζεται για πολλά γύρους, με τον παράγοντα να προσπαθεί να πείσει τον discriminator και τον discriminator να προσπαθεί να διαφοροποιήσει τις παραγόμενες παραφράσεις από τις αξιολογήσεις παραφράσεων από το σύνολο δεδομένων.
Μετά από πολλά γύρους εκπαίδευσης, ο παράγοντας παράγει παραφράσεις που ξεπερνούν τα επιτηρημένα μοντέλα και τις άλλες συνάρτησης ανταμοιβής.

Συμπέρασμα και Περιορισμοί
Οι ανταγωνιστικές προσεγγίσεις (συμπεριλαμβανομένης της αυτο-παιχνιδιού για παιχνίδια) παρέχουν μια εξαιρετικά υποσχόμενη προσέγγιση για την εκπαίδευση αλγορίθμων RL για να ξεπεράσουν την απόδοση των ανθρώπων σε ορισμένες εργασίες χωρίς να ορίζουν μια ρητή συνάρτηση ανταμοιβής.
Ενώ η RL ήταν σε θέση να ξεπεράσει την επιτηρημένη μάθηση σε αυτή την περίπτωση, η ποσότητα της πρόσθετης επιβάρυνσης σε όρους κώδικα, υπολογισμού και πολυπλοκότητας δεν αξίζει την απόδοση που κερδίζεται για τις περισσότερες εφαρμογές. Η RL είναι καλύτερα να αφήνεται σε καταστάσεις όπου η επιτηρημένη μάθηση δεν μπορεί να εφαρμοστεί εύκολα και μια συνάρτηση ανταμοιβής είναι εύκολο να οριστεί (όπως τα παιχνίδια Atari). Οι προσεγγίσεις και οι αλγόριθμοι είναι πολύ πιο ώριμοι στην επιτηρημένη μάθηση και το σήμα λάθους είναι πολύ ισχυρότερο, το οποίο οδηγεί σε πολύ ταχύτερη και πιο σταθερή εκπαίδευση.
Ένα άλλο σημείο που πρέπει να ληφθεί υπόψη είναι ότι, όπως και με άλλες νευρωνικές προσεγγίσεις, ο παράγοντας μπορεί να αποτύχει πολύ δραματικά σε περιπτώσεις όπου η είσοδος είναι διαφορετική από τις εισόδους που έχει δει προηγουμένως, απαιτώντας einen πρόσθετο στρώμα ελέγχου για εφαρμογές παραγωγής.
Η έκρηξη του ενδιαφέροντος για τις προσεγγίσεις RL και οι προόδους της υπολογιστικής υποδομής τα τελευταία χρόνια θα ξεκλειδώσουν τεράστιες ευκαιρίες για την εφαρμογή της RL στη βιομηχανία, ιδιαίτερα μέσα στην NLP.












