Η γωνία του Anderson
Δημιουργώντας Τεχνικούς Μηχανικούς Turk Με Προεκπαιδευμένα Μοντέλα Γλώσσας

Ένα μεγάλο μέρος της ανάπτυξης των συστημάτων машинικής μάθησης εξαρτάται από την επισήμανση των δεδομένων, όπου εκατοντάδες, ακόμη και χιλιάδες ερωτήσεις (όπως Είναι αυτή η εικόνα μια γάτα; και Είναι αυτό το κείμενο επιθετικό;) πρέπει να επιλυθούν για να αναπτυχθούν εξουσιοδοτημένα σύνολα δεδομένων στα οποία θα εκπαιδευτούν τα συστήματα AI.
Αν και όλοι συνεισφέρουμε σε αυτό το proceso σε κάποιο σημείο, η πλειοψηφία αυτών των εργασιών επισήμανσης πραγματοποιείται για χρήματα από ανθρώπινους εργαζόμενους σε πλαίσια όπως το Amazon Mechanical Turk, όπου οι αναλυτές ολοκληρώνουν μικρές εργασίες ταξινόμησης σε μια οικονομία κομμάτων.
Η ανάπτυξη μοντέλων θα ήταν φθηνότερη αν τα προεκπαιδευμένα μοντέλα γλώσσας (PLMs) μπορούσαν να αναλάβουν ορισμένες από τις πιο βασικές Εργασίες Ανθρώπινης Νοημοσύνης (HITs) που πραγματοποιούνται σήμερα σε πλαίσια όπως το AMT και παρόμοια πλαίσια.
Πρόσφατη έρευνα από τη Γερμανία και την Huawei προτείνει αυτό, στο έγγραφο LMTurk: Few-Shot Learners as Crowdsourcing Workers.
Μοντέλα Γλώσσας που Εκτελούν Few-Shot Learning
Οι συγγραφείς προτείνουν ότι τα απλούστερα στρώματα εργασιών που στοχεύουν συνήθως (ανθρώπινους) Turk εργαζόμενους είναι ανάλογα με το few-shot learning, όπου ένα αυτόματο πλαίσιο πρέπει να αποφασίσει μια mini-εργασία με βάση ένα μικρό αριθμό παραδειγμάτων που του δίνονται.
Εργασίες για Μέσης Εμβέλειας, Ημι-Εκτελεστές Μοντέλα Γλώσσας
Εκτός από την мотίβα να μειώσουν το κόστος των ανθρώπων στο βρόχο, οι ερευνητές προτείνουν ότι η χρήση “μέσης εμβέλειας” PLMs ως πραγματικά Μηχανικών Turk παρέχει χρήσιμη εργασία για αυτά τα “επίπεδα” συστήματα, τα οποία είναι όλο και περισσότερο υποβεβλημένα από τα επικεφαλής, υπερκλίμακα και ακριβά μοντέλα γλώσσας όπως το GPT-3, τα οποία είναι πολύ ακριβά και υπερ-προδιαγραφμένα για τέτοιες εργασίες.
Μέθοδος
Οι συγγραφείς προτείνουν το LMTurk (Language Model ως μηχανικός Turk), σε μια ροή εργασίας όπου η είσοδος από αυτό το αυτόματο HIT παρέχει ετικέτες για ένα μεσαίο μοντέλο NLP.
Δεδομένα και Αρχιτεκτονική
Το LMTurk αξιολογήθηκε σε πέντε σύνολα δεδομένων: δύο από το Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); και Corpus of Linguistic Acceptability (CoLA).
Αποτελέσματα
Το πρότζεκτ LMTurk τρέχει διαφορετικά μοντέλα ενάντια σε πολλά συγκεκριμένα υπο-τομείς του NLP, ώστε τα σύνθετα αποτελέσματα των πειραμάτων των ερευνητών να μην είναι εύκολο να μειωθούν σε εμπειρικά στοιχεία που το LMTurk προσφέρει σε mình μια βιώσιμη προσέγγιση για την επαναχρησιμοποίηση ιστορικών, ανθρώπινων-προελεύσεων few shot learning σενάριων.
Ωστόσο, για τους σκοπούς της αξιολόγησης, οι συγγραφείς συγκρίνουν τη μέθοδο τους με δύο προηγούμενες εργασίες: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference από Γερμανούς ερευνητές Timo Schick και Hinrich Schutze; και αποτελέσματα από Prompt-Based Auto, που παρουσιάζονται στο Making Pre-trained Language Models Better Few-shot Learners από Gao, Chen και Fisch (αντίστοιχα από το Princeton και το MIT).
Σύντομα, το LMTurk προσφέρει μια σχετικά υποσχόμενη γραμμή ερευνών για ερευνητές που αναζητούν να ενσωματώσουν και να ενθρονίσουν gold-ετικετες ανθρώπινης-προελεύσεων δεδομένων σε εξελισσόμενα, μεσαίας πολυπλοκότητας μοντέλα γλώσσας όπου αυτόματα συστήματα αντικαθιστούν την ανθρώπινη είσοδο.
Όπως και με την tương đối μικρή ποσότητα προηγούμενης εργασίας σε αυτό το πεδίο, η κεντρική концепция βασίζεται στην αμεταβλητότητα των αρχικών ανθρώπινων δεδομένων και την υπόθεση ότι χρονικοί παράγοντες – οι οποίοι μπορούν να αντιπροσωπεύουν σημαντικά εμπόδια στην ανάπτυξη του NLP – δεν θα απαιτήσουν περαιτέρω ανθρώπινη παρέμβαση καθώς η αυτοματοποιημένη σειρά εξελίσσεται.
Πρωτοεκδόθηκε 30η Δεκεμβρίου 2022












