Η γωνία του Anderson

Μοντέλα Γραπτής Συγγραφής Βασισμένα σε AI Συχνά ‘Αντιγράφουν και Επικολλάν’ Δεδομένα Πηγής

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ο Αμερικανός δραματουργός και επιχειρηματίας Wilson Mizner αναφέρεται συχνά ως ο πιο διάσημος που είπε ‘Όταν κλέβεις από έναν συγγραφέα, είναι πλαγιαρισμός· αν κλέβεις από πολλούς, είναι έρευνα’.

Ομοίως, η υπόθεση γύρω από τη νέα γενιά των συστημάτων δημιουργικής γραπτής συγγραφής βασισμένων σε AI είναι ότι τα τεράστια ποσά δεδομένων που ταΐζονται σε αυτά στη φάση εκπαίδευσης έχουν οδηγήσει σε μια πραγματική αφαίρεση υψηλού επιπέδου εννοιών και ιδεών· ότι αυτά τα συστήματα έχουν στη διάθεσή τους τη διηθημένη σοφία χιλιάδων συντελεστών συγγραφέων, από την οποία το AI μπορεί να διαμορφώσει καινοτόμες και πρωτότυπες γραπτές εργασίες· και ότι όσοι χρησιμοποιούν τέτοια συστήματα μπορούν να είναι βέβαιοι ότι δεν συμμετέχουν ακούσια σε πλαγιαρισμό-με-μεσάζοντα.

Αυτή η υπόθεση αμφισβητείται από μια νέα μελέτη από一个 ερευνητικό συνδικάτο (συμπεριλαμβανομένων των τμημάτων ερευνών AI της Facebook και της Microsoft ), η οποία έχει διαπιστώσει ότι τα μοντέλα γλωσσικής γεννήτριας μάθησης με μηχανή όπως η σειρά GPT ‘σποραδικά αντιγράφουν ακόμη και πολύ μακρές περικοπές’ στο υποτιθέμενο πρωτότυπο αποτέλεσμα, χωρίς αναφορά.

Σε ορισμένες περιπτώσεις, οι συγγραφείς σημειώνουν, το GPT-2 θα διπλασιάσει πάνω από 1.000 λέξεις από το σύνολο εκπαίδευσης στο αποτέλεσμα.

Η μελέτη έχει τον τίτλο Πόσο ανταποκρίνουν τα μοντέλα γλωσσικής γεννήτριας από τα δεδομένα εκπαίδευσής τους; Αξιολόγηση γλωσσικής καινοτομίας στη γεννήτρια κειμένου χρησιμοποιώντας RAVEN, και είναι μια συνεργασία μεταξύ του Πανεπιστημίου Johns Hopkins, της Microsoft Research, του Πανεπιστημίου της Νέας Υόρκης και της Facebook AI Research.

RAVEN

Η μελέτη χρησιμοποιεί μια νέα προσέγγιση που ονομάζεται RAVEN (RAtingVErbalNovelty), ένα ακρωνύμιο που έχει υποστεί μια διασκεδαστική τορτούρα για να αντικατοπτρίσει τον πουλί-κακό της κλασικής ποίησης:

‘Αυτό το ακρωνύμιο αναφέρεται στο “Το Κοράκι” του Edgar Allan Poe, όπου ο αφηγητής συναντά ένα μυστηριώδες κοράκι που επαναλαμβάνει συνεχώς, “Ποτέ ξανά!” Ο αφηγητής δεν μπορεί να πει αν το κοράκι απλώς επαναλαμβάνει κάτι που άκουσε ένας άνθρωπος να λέει, ή αν κατασκευάζει τις δικές του φράσεις (ίσως συνδυάζοντας ποτέ και ξανά)—την ίδια βασική αμφιβολία που η μελέτη μας αντιμετωπίζει.’

Τα ευρήματα από τη νέα μελέτη έρχονται στο контέκστ της μεγάλης αύξησης των συστημάτων AI-συγγραφής περιεχομένου που επιδιώκουν να αντικαταστήσουν ‘απλές’ εργασίες επεξεργασίας, και ακόμη να γράψουν πλήρη περιεχόμενο. Ένα τέτοιο σύστημα έλαβε 21 εκατομμύρια δολάρια σε χρηματοδότηση σειράς A την περασμένη εβδομάδα.

Οι ερευνητές σημειώνουν ότι ‘το GPT-2 đôiες φορές διπλασιάζει περικοπές εκπαίδευσης που είναι πάνω από 1.000 λέξεις μακρές. (η έμφαση τους), και ότι τα συστήματα γλωσσικής γεννήτριας προωθούν γλωσσικά λάθη στα δεδομένα πηγής.

Τα μοντέλα γλωσσικής γεννήτριας που μελετήθηκαν υπό το RAVEN ήταν η σειρά GPT μέχρι το GPT-2 (οι συγγραφείς δεν είχαν πρόσβαση εκείνη την εποχή στο GPT-3), ένα Transformer, Transformer-XL, και ένα LSTM.

Νοβελτί

Η μελέτη σημειώνει ότι το GPT-2 δημιουργεί Bush 2-στυλ επιρρήματα όπως ‘Ελβετοποιήθηκε’, και παραγωγές όπως ‘IKEA-νότητα’, δημιουργώντας τέτοιες νέες λέξεις (δεν εμφανίζονται στα δεδομένα εκπαίδευσης του GPT-2) με γλωσσικές αρχές που προέρχονται από υψηλότερες διαστάσεις που καθορίστηκαν κατά την εκπαίδευση.

Τα αποτελέσματα δείχνουν επίσης ότι ‘74% των προτάσεων που παράγονται από το Transformer-XL έχουν μια συντακτική δομή που δεν έχει καμία πρόταση εκπαίδευσης’, υποδεικνύοντας, όπως λένε οι συγγραφείς, ‘τα νευρωνικά γλωσσικά μοντέλα δεν απλώς θυμάται· αντίθετα, χρησιμοποιούν παραγωγικές διαδικασίες που τους επιτρέπουν να συνδυάζουν οικείες частини με νέους τρόπους.’

Έτσι, τεχνικά, η γενίκευση και η αφαίρεση πρέπει να παράγουν καινοτόμο και πρωτότυπο κείμενο.

Η Δублиοποίηση Δεδομένων Μπορεί Να Είναι Το Πρόβλημα

Η μελέτη θεωρεί ότι οι μακρές και λέξη-προς-λέξη ερμηνείες που παράγονται από τα συστήματα NLG θα μπορούσαν να γίνουν ‘ψημένα’ ολόκληρα στο μοντέλο AI επειδή το αρχικό κείμενο πηγής επαναλαμβάνεται πολλές φορές σε σύνολα δεδομένων που δεν έχουν αποδεδομηθεί επαρκώς.

Αν και μια άλλη ερευνητική εργασία έχει βρει ότι η πλήρης δублиοποίηση κειμένου μπορεί να συμβεί ακόμη και αν το κείμενο πηγής εμφανίζεται μόνο μια φορά στο σύνολο δεδομένων, οι συγγραφείς σημειώνουν ότι η εργασία έχει διαφορετικές концептуαλές αρχιτεκτονικές από τα συνηθισμένα συστήματα AI-συγγραφής περιεχομένου.

Οι συγγραφείς επίσης παρατηρούν ότι η αλλαγή του компонέντος αποκωδικοποίησης στα συστήματα γλωσσικής γεννήτριας θα μπορούσε να αυξήσει τη νοβελτί, αλλά βρήκαν σε δοκιμές ότι αυτό συμβαίνει με το κόστος της ποιότητας του αποτελέσματος.

Πρόσθετα προβλήματα προκύπτουν καθώς τα σύνολα δεδομένων που τροφοδοτούν τους αλγόριθμους δημιουργίας περιεχομένου γίνονται όλο και μεγαλύτερα. Εκτός από το να επιβαρύνουν τα προβλήματα γύρω από τη δυνατότητα και τη βιωσιμότητα της προεπεξεργασίας δεδομένων, καθώς και την ποιότητα και την αποδεδομημένη δεδομένων, πολλά βασικά λάθη παραμένουν στα δεδομένα πηγής, τα οποία στη συνέχεια προωθούνται στο περιεχόμενο που παράγεται από το AI.

Οι συγγραφείς σημειώνουν*:

‘Οι πρόσφατες αυξήσεις των μεγεθών των συνόλων εκπαίδευσης κάνουν ιδιαίτερα κρίσιμο να ελέγχουμε τη νοβελτί γιατί η έκταση αυτών των συνόλων εκπαίδευσης μπορεί να σπάσει τις εννοίες μας για το τι μπορεί να αναμενθεί να συμβεί φυσικά. Για παράδειγμα, κάποια αξιοσημείωτη εργασία στη γλώσσα αποκτηση βασίζεται στην υπόθεση ότι τα κανονικά ρήματα της παρελθοντικής χρόνου των ανώμαλων ρημάτων (π.χ. becomed, teached) δεν εμφανίζονται στην εμπειρία του μαθητή, οπότε αν ο μαθητής παράγει τέτοιες λέξεις, πρέπει να είναι καινοτόμες για τον μαθητή.

‘Ωστόσο, αποδείχθηκε ότι, για όλα τα 92 βασικά ανώμαλα ρήματα στην αγγλική γλώσσα, η λανθασμένη κανονική μορφή εμφανίζεται στο σύνολο εκπαίδευσης του GPT-2.’

Περισσότερη Κύρωση Δεδομένων Χρειάζεται

Η μελέτη υποστηρίζει ότι πρέπει να δοθεί περισσότερη προσοχή στη νοβελτί στη διαμόρφωση των συστημάτων γλωσσικής γεννήτριας, με ιδιαίτερη έμφαση στην εξασφάλιση ότι το ‘κρατημένο’ τμήμα δοκιμής των δεδομένων (το τμήμα των δεδομένων πηγής που κρατείται για τη δοκιμή του πώς το τελικό αλγόριθμο έχει αξιολογήσει το κύριο σώμα των δεδομένων εκπαίδευσης) είναι κατάλληλο για την εργασία.

‘Στη μηχανική μάθηση, είναι κρίσιμο να αξιολογούμε τα μοντέλα σε ένα κρατημένο σύνολο δοκιμής. Λόγω της ανοιχτής φύσης της γεννήτριας κειμένου, το κείμενο που παράγεται από το μοντέλο μπορεί να αντιγραφεί από το σύνολο εκπαίδευσης, σε αυτή την περίπτωση δεν είναι κρατημένο—έτσι η χρήση αυτών των δεδομένων για την αξιολόγηση του μοντέλου (π.χ. για συνάφεια ή γραμματικότητα) δεν είναι έγκυρη.’

Οι συγγραφείς επίσης υποστηρίζουν ότι περισσότερη προσοχή χρειάζεται και στην παραγωγή των μοντέλων γλωσσικής γεννήτριας λόγω του Εφέ Eliza, ενός συνδρόμου που αναγνωρίστηκε το 1966 και που ανέφερε ‘τη διαθεσιμότητα των ανθρώπων να διαβάζουν πολύ περισσότερη κατανόηση από ό,τι δικαιολογείται σε συμβολοσειρές—ειδικά λέξεις—συνδυασμένες από υπολογιστές’.

 

* Η μετατροπή μου των εσωτερικών αναφορών σε υπερσυνδέσμους

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai