Η γωνία του Anderson

Τα Ελαττώματα του Amazon Mechanical Turk Μπορεί να Απειλήσουν τα Συστήματα Γεννήσεων Φυσικής Γλώσσας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια νέα μελέτη από το Πανεπιστήμιο του Μασαχουσέτης στο Άμχερστ έχει αντιπαραθέσει δασκάλους αγγλικών με εργαζόμενους σε crowdsourcing στο Amazon Mechanical Turk για την αξιολόγηση της παραγωγής Συστημάτων Γεννήσεων Φυσικής Γλώσσας (NLG), καταλήγοντας στο συμπέρασμα ότι οι χαλαρές προδιαγραφές και το “παίγνιο” των εργασιών μεταξύ των εργαζομένων του AMT μπορεί να εμποδίζουν την ανάπτυξη του τομέα.

Η μελέτη καταλήγει σε μια σειρά από καταδικαστικές συμπεράσματα σχετικά με το βαθμό στον οποίο η “βιομηχανικής κλίμακας” φθηνή εξαγωγή των ανοιχτών εργασιών αξιολόγησης NLG μπορεί να οδηγήσει σε κατώτερα αποτελέσματα και αλγόριθμους σε αυτόν τον τομέα.

Οι ερευνητές συνέταξαν επίσης μια λίστα με 45 έγγραφα για την ανοιχτή γεννήτρια κειμένου όπου η έρευνα είχε χρησιμοποιήσει το AMT και διαπίστωσαν ότι “η πλειοψηφία” δεν ανέφερε κρίσιμες λεπτομέρειες σχετικά με τη χρήση της υπηρεσίας crowd του Amazon, καθιστώντας δύσκολο να αναπαραχθούν τα ευρήματα των ερευνών.

Εργασία σε Συνθήκες Sweat-Shop

Η μελέτη επιτίθεται τόσο στη φύση sweat-shop του Amazon Mechanical Turk όσο και στα (πιθανότατα περιορισμένα από το προϋπολογισμό) ακαδημαϊκά έργα που δίνουν επιπλέον credence στο AMT χρησιμοποιώντας (και αναφέροντας) το ως έγκυρο και σταθερό ερευνητικό πόρο. Οι συγγραφείς σημειώνουν:

‘Ενώ το AMT είναι μια βολική και προσιτή λύση, παρατηρούμε ότι η υψηλή διακύμανση μεταξύ των εργαζομένων, η κακή βαθμονόμηση και οι εργασίες που απαιτούν σκέψη possono οδηγήσουν τους ερευνητές σε παραπλανητικά επιστημονικά συμπεράσματα (π.χ. ότι το κείμενο γραμμένο από άνθρωπο είναι “χειρότερο” από το GPT-2).’

Η μελέτη κατηγορεί το παιχνίδι και όχι τους παίκτες, με τους ερευνητές να παρατηρούν:

‘Οι εργαζόμενοι συχνά πληρώνονται λιγότερο για την εργασία τους, το οποίο βλάπτει και την ποιότητα της έρευνας και, πιο σημαντικά, την ικανότητα των εργαζομένων να κερδίζουν ένα επαρκές εισόδημα.’

Το έγγραφο, με τίτλο Οι Κίνδυνοι της Χρήσης του Mechanical Turk για την Αξιολόγηση της Ανοιχτής Γεννήτριας Κειμένου, καταλήγει επίσης στο συμπέρασμα ότι ‘εξειδικευμένοι αξιολογητές’ όπως δάσκαλοι γλωσσών και γλωσσολόγοι πρέπει να χρησιμοποιηθούν για την αξιολόγηση της ανοιχτής τεχνητής NLG, ακόμη και αν το AMT είναι φθηνότερο.

Δοκιμαστικές Εργασίες

Συγκρίνοντας την απόδοση του AMT με λιγότερο περιορισμένους, εξειδικευμένους αναγνώστες, οι ερευνητές δαπάνησαν 144 δολάρια για τις υπηρεσίες του AMT που χρησιμοποιήθηκαν στις δοκιμαστικές εργασίες (αν και πολύ περισσότερα δαπανήθηκαν για ‘μη χρησιμοποιήσιμα’ αποτελέσματα – δείτε παρακάτω), απαιτώντας από τυχαίους ‘Τούρκους’ να αξιολογήσουν ένα από τα 200 κείμενα, χωρισμένα μεταξύ ανθρώπινου περιεχομένου και τεχνητά γεννημένων κειμένων.

Η ανάθεση σε επαγγελματίες δασκάλους της ίδιας εργασίας κόστισε 187,50 δολάρια και επιβεβαίωσε την ανώτερη απόδοση τους (σε σύγκριση με τους εργαζόμενους του AMT) με την πρόσληψη ελευθέρων επαγγελματιών του Upwork για να αναπαραγάγουν τις εργασίες με επιπλέον 262,50 δολάρια.

Κάθε εργασία αποτελούνταν από τέσσερις κριτήρια αξιολόγησης: γραμματική (‘Πόσο γραμματικά σωστό είναι το κείμενο του θραύσματος της ιστορίας?’); συνάφεια (‘Πόσο καλά ταιριάζουν οι προτάσεις στο θράυσμα της ιστορίας?’); ευχαρίστηση (‘Πόσο απολαύσιμο είναι το θράυσμα της ιστορίας?’); και σχετικότητα (‘Πόσο σχετικό είναι το θράυσμα της ιστορίας με την πρόκληση?’).

Γεννήτρια Κειμένου

Για να ληφθούν NLG υλικό για τις δοκιμές, οι ερευνητές χρησιμοποίησαν το dataset Hierarchical Neural Story Generation του Facebook AI Research του 2018, το οποίο αποτελείται από 303.358 αγγλικές ιστορίες που συντάχθηκαν από χρήστες στο πολύ δημοφιλές (15 εκατ+ χρήστες) r/writingprompts subreddit, όπου οι ιστορίες των συνδρομητών ‘σπείρονται’ από μονόασες προτάσεις ‘προκλήσεις’ με παρόμοιο τρόπο με τις τρέχουσες πρακτικές στη γεννήτρια κειμένου-εικόνας – και, φυσικά, στην ανοιχτή γεννήτρια φυσικής γλώσσας συστήματα.

200 προκλήσεις από το dataset επιλέχθηκαν τυχαία και πέρασαν από ένα μεσαίου μεγέθους μοντέλο GPT-2 χρησιμοποιώντας τη βιβλιοθήκη Hugging-Face Transformers. Έτσι, δύο σύνολα αποτελεσμάτων λήφθηκαν από τις ίδιες προκλήσεις: τα ανθρώπινα γραπτά δοκίμια από τους χρήστες του Reddit και τα κείμενα GPT-2.

Για να αποφευχθεί η ίδια αξιολόγηση των ίδιων ιστοριών από τους ίδιους εργαζόμενους του AMT, ζητήθηκαν τρεις αξιολογήσεις εργαζομένων του AMT ανά παράδειγμα. Μαζί με πειράματα σχετικά με τις ικανότητες της αγγλικής γλώσσας των εργαζομένων (δείτε το τέλος του άρθρου) και με την εξαίρεση αποτελεσμάτων από εργαζόμενους με χαμηλή προσπάθεια (δείτε ‘Σύντομο Χρόνο’ παρακάτω), αυτό αυξήθηκε το συνολικό έξοδο για το AMT σε περίπου 1.500 δολάρια.
Για να δημιουργηθεί ένα ισόπεδο πεδίο, όλες οι δοκιμές διεξήχθησαν τις καθημερινές μεταξύ 11:00-11:30 π.μ. PST.

Αποτελέσματα και Συμπεράσματα

Η εκτεταμένη μελέτη καλύπτει πολλά θέματα, αλλά τα βασικά σημεία είναι τα ακόλουθα:

Σύντομος Χρόνος

Η μελέτη διαπίστωσε ότι ο επίσημος μέσος όρος χρόνου εργασίας του Amazon που αναφέρεται σε 360 δευτερόλεπτα κατέβηκε σε πραγματικό χρόνο εργασίας μόνο 22 δευτερόλεπτα και μέσο χρόνο εργασίας μόνο 13 δευτερόλεπτα – ένα τέταρτο του χρόνου που πήρε ο γρηγορότερος δάσκαλος αγγλικών να αναπαραγάγει την εργασία.

Από την 2η μέρα της μελέτης: οι μεμονωμένοι εργαζόμενοι (σε πορτοκαλί) πέρασαν σημαντικά λιγότερο χρόνο αξιολογώντας κάθε εργασία από τους καλώς αμειβόμενους δασκάλους και (αργότερα) τους ακόμη καλύτερα αμειβόμενους εργαζόμενους του Upwork. Πηγή: https://arxiv.org/pdf/2109.06835.pdf

Από την 2η μέρα της μελέτης: οι μεμονωμένοι εργαζόμενοι (σε πορτοκαλί) πέρασαν σημαντικά λιγότερο χρόνο αξιολογώντας κάθε εργασία από τους καλώς αμειβόμενους δασκάλους και (αργότερα) τους ακόμη καλύτερα αμειβόμενους εργαζόμενους του Upwork. Πηγή: https://arxiv.org/pdf/2109.06835.pdf

Από τότε που το AMT δεν επιβάλλει κανένα όριο στα ανθρώπινα εργασιακά καθήκοντα (HITs) που μπορεί να αναλάβει ένας εργαζόμενος, έχουν εμφανιστεί ‘μεγάλες μπαταρίες’ του AMT, με (κερδοφόρες) φήμες για την ολοκλήρωση υψηλών αριθμών εργασιών ανά πείραμα. Για να ανταποκριθούν στις αποδεκτές εργασίες από τον ίδιο εργαζόμενο, οι ερευνητές μετρούσαν τον χρόνο μεταξύ συνεχόμενων υποβεβλημένων HITs, συγκρίνοντας την έναρξη και το τέλος κάθε HIT. Με αυτόν τον τρόπο, η ελλειπή μεταξύ του αναφερόμενου WorkTimeInSeconds του AMT και του πραγματικού χρόνου που διατέθηκε στην εργασία ήρθε στο φως.

Από τότε που τέτοια εργασία δεν μπορεί να ολοκληρωθεί σε αυτούς τους μειωμένους χρόνους, οι ερευνητές είχαν να αντιμετωπίσουν:

‘Καθώς είναι αδύνατο να διαβάσει προσεκτικά ένα κείμενο μήκους παραγράφου και να αξιολογήσει όλες τις ιδιότητες σε τόσο λίγο χρόνο, μετράμε την επίδραση στα μέσα ποσοστά όταν φιλτράρουμε τους εργαζόμενους που δαπανήουν πολύ λίγο χρόνο ανά HIT…Συγκεκριμένα, αφαιρούμε τις κρίσεις από εργαζόμενους που έχουν μέσο χρόνο κάτω από 40 δευτερόλεπτα (που είναι ένα χαμηλό όριο) και βρισκόμαστε ότι κατά μέσο όρο περίπου το 42% των αξιολογήσεων μας φιλτράρεται (μεταξύ 20%-72% σε όλα τα πειράματα).’

Η μελέτη υποστηρίζει ότι η αναφορά του πραγματικού χρόνου εργασίας στο AMT είναι ‘ένα σημαντικό ζήτημα’ που συνήθως παραβλέπεται από τους ερευνητές που χρησιμοποιούν τις υπηρεσίες.

Χειροκρότημα Απαραίτητο

Τα ευρήματα υποδηλώνουν επίσης ότι οι εργαζόμενοι του AMT δεν μπορούν να διακρίνουν με συνέπεια μεταξύ κειμένου γραμμένου από άνθρωπο και κειμένου γραμμένου από μηχανή, εκτός εάν βλέπουν και τα δύο κείμενα πλάι-πλάι, το οποίο θα έθετε σε κίνδυνο μια τυπική σκηνή αξιολόγησης (όπου ο αναγνώστης πρέπει να μπορεί να κάνει μια κρίση με βάση ένα μόνο δείγμα κειμένου, ‘πραγματικό’ ή τεχνητά γεννημένο).

Ανεπίσημη Αποδοχή Χαμηλής Ποιότητας Τεχνητού Κειμένου

Οι εργαζόμενοι του AMT αξιολόγησαν συνεχώς το χαμηλής ποιότητας τεχνητό κείμενο GPT-based σε ίσο επίπεδο με υψηλότερης ποιότητας, συνεκτικό κείμενο γραμμένο από ανθρώπους, σε αντίθεση με τους δασκάλους αγγλικών, οι οποίοι μπορούσαν εύκολα να διακρίνουν τη διαφορά στην ποιότητα.

Χωρίς Χρόνο Προετοιμασίας, Μηδέν Πλαίσιο

Η είσοδος στη σωστή νοοτροπία για μια τέτοια αφηρημένη εργασία όπως η αξιολόγηση της αυθεντικότητας δεν έρχεται φυσικά; οι δάσκαλοι αγγλικών χρειάζονταν 20 εργασίες για να βαθμονομήσουν τις ευαισθησίες τους στο περιβάλλον αξιολόγησης, ενώ οι εργαζόμενοι του AMT δεν είχαν καθόλου ‘χρόνο προετοιμασίας’.

Παιχνίδι στο Σύστημα

Η μελέτη υποστηρίζει ότι ο συνολικός χρόνος που δαπανήθηκε από τους εργαζόμενους του AMT σε μεμονωμένες εργασίες είναι φουσκωμένος από εργαζόμενους που δέχονται πολλές εργασίες ταυτόχρονα και τρέχουν τις εργασίες σε διαφορετικές καρτέλες του προγράμματος περιήγησης, αντί να επικεντρώνονται σε μια εργασία για τη διατηρούμενη διάρκεια της εργασίας.

Χώρα Προέλευσης Είναι Σημαντική

Οι προεπιλεγμένες ρυθμίσεις του AMT δεν φιλτράρουν τους εργαζόμενους με βάση τη χώρα προέλευσης, και η μελέτη σημειώνει πρώην εργασία που υποδηλώνει ότι οι εργαζόμενοι του AMT χρησιμοποιούν VPN για να εργαστούν γύρω από γεωγραφικές περιορισμοί, επιτρέποντας σε μη μητρικές ομιλητές να παρουσιάζονται ως μητρικές ομιλήτριες (σε ένα σύστημα που, ίσως rather naively, ισοδυναμεί μια εργαζόμενη με τη μητρική γλώσσα με τη γεωγραφική τοποθεσία με βάση το IP).

Έτσι, οι ερευνητές ξανατρέξαν τις δοκιμαστικές εργασίες στο AMT με φίλτρα που περιόριζαν τους πιθανούς λήπτες σε μη-αγγλόφωνες χώρες, βρίσκοντας ότι ‘εργαζόμενοι από μη αγγλόφωνες χώρες αξιολόγησαν τη συνάφεια, τη σχετικότητα και τη γραμματική…σημαντικά χαμηλότερα από τους ισοδύναμους εργαζόμενους από αγγλόφωνες χώρες’.

Η μελέτη καταλήγει:

‘[Εξειδικευμένοι αξιολογητές] όπως γλωσσολόγοι ή δάσκαλοι γλωσσών πρέπει να χρησιμοποιηθούν όποτε είναι δυνατόν, καθώς έχουν ήδη εκπαιδευτεί να αξιολογούν γραπτό κείμενο, και δεν είναι πολύ πιο ακριβό…’.

 

Δημοσιεύθηκε 16η Σεπτεμβρίου 2021Ενημερώθηκε 18η Δεκεμβρίου 2021: Προστέθηκαν ετικέτες

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai