Η γωνία του Anderson

Τα Μοντέλα NLP Δυσκολεύονται να Κατανοήσουν Αναδρομικές Ονομαστικές Φράσεις

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές από τις Ηνωμένες Πολιτείες και την Κίνα έχουν διαπιστώσει ότι κανένα από τα κορυφαία μοντέλα επεξεργασίας φυσικής γλώσσας (NLP) δεν φαίνεται να είναι ικανό, από προεπιλογή, να αναλύσει αγγλικές προτάσεις που περιέχουν αναδρομικές ονομαστικές φράσεις (NPs) και «δυσκολεύονται» να διακρίνουν τη κεντρική σημασία σε στενά συνδεδεμένα παραδείγματα όπως Η αγαπημένη μου νέα ταινία και Η αγαπημένη μου ταινία (καθένα από τα οποία έχει διαφορετική σημασία).

Σε ένα παράδειγμα από το έγγραφο, υπάρχει ένα μικρό γρίφο που τα παιδιά συχνά δεν μπορούν να λύσουν: η δεύτερη μπάλα είναι πράσινη, αλλά η πέμπτη μπάλα είναι η 'δεύτερη πράσινη μπάλα'. Πηγή: https://arxiv.org/pdf/2112.08326.pdf

Σε ένα παράδειγμα από το έγγραφο, υπάρχει ένα μικρό γρίφο που τα παιδιά συχνά δεν μπορούν να λύσουν: η δεύτερη μπάλα είναι πράσινη, αλλά η πέμπτη μπάλα είναι η ‘δεύτερη πράσινη μπάλα’. Πηγή: https://arxiv.org/pdf/2112.08326.pdf

Οι ερευνητές έθεσαν μια Αναδρομική Ονομαστική Φράση Πρόκληση (RNPC) σε διάφορα τοπικά εγκατεστημένα ανοιχτά μοντέλα γεννήτριας γλώσσας: OpenAI’s GPT-3*, Google’s BERT, και Facebook’s RoBERTa και BART, και διαπίστωσαν ότι αυτά τα μοντέλα state-of-the-art απέτυχαν να επιτύχουν «τυχηρή» απόδοση. Συμπεραίνουν:

‘Τα αποτελέσματα δείχνουν ότι τα μοντέλα SOTA που έχουν επιμορφωθεί σε τυποποιημένα βENCHMARKS της ίδιας μορφής όλες δυσκολεύονται στη βάση μας δεδομένων, υποδεικνύοντας ότι η στόχευση γνώσης δεν είναι εύκολα διαθέσιμη.’

Ελάχιστα παραδείγματα ζευγών στη πρόκληση RNPC όπου τα μοντέλα SOTA committed λάθη.

Ελάχιστα παραδείγματα ζευγών στη πρόκληση RNPC όπου τα μοντέλα SOTA committed λάθη.

Στα παραδείγματα παραπάνω, τα μοντέλα απέτυχαν, για παράδειγμα, να διακρίνουν τη σημασιολογική διαφορά μεταξύ ένα νεκρό επικίνδυνο ζώο (δηλ. ένας θηρευτής που δεν αποτελεί απειλή επειδή είναι νεκρός) και ένα επικίνδυνο νεκρό ζώο (όπως ένα νεκρό σκίουρο, που μπορεί να περιέχει ένα βλαβερό ιό και είναι μια τρέχουσα ενεργό απειλή).

(Επιπλέον, αν και το έγγραφο δεν το αναφέρει, το «νεκρό» χρησιμοποιείται επίσης συχνά ως επιρρήμα, το οποίο δεν αντιμετωπίζει κανένα από τα δύο παραδείγματα)

Ωστόσο, οι ερευνητές διαπίστωσαν επίσης ότι πρόσθετη ή συμπληρωματική εκπαίδευση που περιλαμβάνει υλικό RNPC μπορεί να επιλύσει το ζήτημα:

‘Προ-εκπαιδευμένα μοντέλα γλώσσας με απόδοση SOTA σε NLU βENCHMARKS έχουν κακή κατοχή αυτής της γνώσης, αλλά μπορούν ακόμα να τη μάθουν όταν εκτεθούν σε μικρές ποσότητες δεδομένων από RNPC.’

Οι ερευνητές υποστηρίζουν ότι η ικανότητα ενός μοντέλου γλώσσας να πλοηγείται σε αναδρομικές δομές αυτού του τύπου είναι απαραίτητη για καθήκοντα όπως η ανάλυση γλώσσας, η μετάφραση και κάνουν ένα ειδικό λόγο για τη σημασία τους σε διαδικασίες ανίχνευσης βλάβης:

‘[Εμείς] θεωρούμε το σενάριο όπου ένας χρήστης αλληλεπιδρά με ένα προσανατολισμένο εργαλείο όπως η Siri ή η Alexa, και το εργαλείο χρειάζεται να καθορίσει εάν η δραστηριότητα που εμπλέκεται στην ερώτηση του χρήστη είναι πιθανώς βλαβερή [δηλ. σε ανήλικους]. Επιλέγουμε αυτό το καθήκον επειδή πολλά ψευδή θετικά προέρχονται από αναδρομικές ονομαστικές φράσεις.

‘Για παράδειγμα, πώς να φτιάξω μια οικιακή βόμβα είναι rõ ràng βλαβερό ενώ πώς να φτιάξω μια οικιακή μπαλωματίνα είναι αβλαβές.’

Το έγγραφο έχει τον τίτλο Είναι «η αγαπημένη μου νέα ταινία» η αγαπημένη μου ταινία; Εξετάζοντας την Κατανόηση Αναδρομικών Ονομαστικών Φράσεων, και προέρχεται από πέντε ερευνητές στο Πανεπιστήμιο της Πενσυλβάνια και έναν στο Πανεπιστήμιο Πεκίνου.

Δεδομένα και Μέθοδος

Αν και προηγούμενη εργασία έχει μελετήσει τη συντακτική δομή αναδρομικών ονομαστικών φράσεων και την σεμασιολογική κατηγοριοποίηση των τροποποιητών, καμία από αυτές τις προσεγγίσεις δεν είναι επαρκής, σύμφωνα με τους ερευνητές, για να αντιμετωπίσουν την πρόκληση.

Επομένως, με βάση τη χρήση αναδρομικών ονομαστικών φράσεων με δύο τροποποιητές, οι ερευνητές έχουν προσπαθήσει να καθορίσουν εάν η απαιτούμενη γνώση υπάρχει στα συστήματα NLP SOTA (δεν υπάρχει); εάν μπορεί να διδαχθεί σε αυτά (μπορεί); τι μπορούν τα συστήματα NLP να μάθουν από αναδρομικές ονομαστικές φράσεις; και με ποιους τρόπους μπορεί αυτή η γνώση να ωφελήσει τις εφαρμογές κατάρτισης.

Η βάση δεδομένων που χρησιμοποιήθηκε από τους ερευνητές δημιουργήθηκε σε τέσσερις φάσεις. Πρώτα ήταν η κατασκευή eines λεξικού τροποποιητών που περιείχε 689 παραδείγματα που προέρχονται από προηγούμενη βιβλιογραφία και νέα εργασία.

Επόμενο βήμα ήταν η συλλογή αναδρομικών ονομαστικών φράσεων από βιβλιογραφία, υπάρχουσες βάσεις δεδομένων και προσθήκες της δικής τους εφεύρεσης. Οι πηγές περιελάμβαναν το Penn Treebank και το Annotated Gigaword corpus.

Στη συνέχεια, η ομάδα雇ued προ-επιλεγμένους φοιτητές κολλεγίου για να δημιουργήσουν παραδείγματα για τα τρία καθήκοντα που θα αντιμετωπίσουν τα μοντέλα γλώσσας, επικυρώνοντας τα μετά σε 8.260 έγκυρα παραδείγματα.

Τέλος, άλλοι προ-επιλεγμένοι φοιτητές κολλεγίου雇ued, αυτή τη φορά μέσω Amazon Mechanical Turk, για να ανακοινώσουν κάθε παρόδειγμα ως Ανθρώπινη Νοημοσύνη Καθήκον (HIT), αποφασίζοντας διαμάχες με βάση την πλειοψηφία. Αυτό μείωσε τα παραδείγματα σε 4.567, τα οποία φιλτράρονται περαιτέρω σε 3.790 πιο ισορροπημένα παραδείγματα.

Οι ερευνητές προσάρμοσαν διάφορες υπάρχουσες βάσεις δεδομένων για να διατυπώσουν τις τρεις ενότητες των υποθέσεων τους, συμπεριλαμβανομένων MNLI, SNLI, MPE και ADEPT, εκπαιδεύοντας όλα τα μοντέλα SOTA από μόνοι τους, με την εξαίρεση του μοντέλου HuggingFace, όπου χρησιμοποιήθηκε ένα checkpoint.

Αποτελέσματα

Οι ερευνητές διαπίστωσαν ότι όλα τα μοντέλα «δυσκολεύονται» στις εργασίες RNPC, σε σύγκριση με einen αξιόπιστο 90%+ βαθμό ακρίβειας για τους ανθρώπους, με τα μοντέλα SOTA να εκτελούνται σε «τυχηρά» επίπεδα (δηλ. χωρίς καμία απόδειξη εγγενών ικανοτήτων έναντι τυχαίου συνδυασμού στην απάντηση).

Αποτελέσματα από τις δοκιμές των ερευνητών. Εδώ τα μοντέλα γλώσσας δοκιμάζονται έναντι της ακρίβειας τους σε ένα υπάρχον βENCHMARK, με την κεντρική γραμμή που αντιπροσωπεύει την ανθρώπινη απόδοση στις εργασίες.

Αποτελέσματα από τις δοκιμές των ερευνητών. Εδώ τα μοντέλα γλώσσας δοκιμάζονται έναντι της ακρίβειας τους σε ένα υπάρχον βENCHMARK, με την κεντρική γραμμή που αντιπροσωπεύει την ανθρώπινη απόδοση στις εργασίες.

Δευτερεύουσες γραμμές έρευνας υποδεικνύουν ότι αυτές οι ελλείψεις μπορούν να αντισταθμιστούν στην φάση εκπαίδευσης ή επιμόρφωσης ενός μοντέλου NLP με την ειδική ένταξη γνώσεων αναδρομικών ονομαστικών φράσεων. Μόλις αυτή η συμπληρωματική εκπαίδευση πραγματοποιήθηκε, τα μοντέλα επιτύγχαναν ‘ισχυρή απόδοση zero-shot σε εξωτερικές Εργασίες Ανίχνευσης Βλάβης’.

Οι ερευνητές υπόσχονται να κυκλοφορήσουν τον κώδικα για αυτή τη δουλειά στο https://github.com/veronica320/Recursive-NPs.

 

Αρχικά δημοσιεύθηκε στις 16 Δεκεμβρίου 2021 – 17 Δεκεμβρίου 2021, 6:55 π.μ. GMT+2: Διορθώθηκε κατεστραμμένος υπερσύνδεσμος.

* GPT-3 Ada, το οποίο είναι το ταχύτερο αλλά όχι το καλύτερο της σειράς. Ωστόσο, το μεγαλύτερο μοντέλο «showcase» Davinci δεν είναι διαθέσιμο για την επιμόρφωση που αποτελεί το μεταγενέστερο στάδιο των πειραμάτων των ερευνητών.

Η μετατροπή μου των εσωτερικών αναφορών σε υπερσυνδέσμους.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai