Angolo di Anderson
Le Carenze di Amazon Mechanical Turk Potrebbero Minacciare i Sistemi di Generazione del Linguaggio Naturale

Uno studio recente dell’Università del Massachusetts Amherst ha confrontato insegnanti di inglese con lavoratori di Amazon Mechanical Turk nella valutazione della produzione di sistemi di generazione del linguaggio naturale (NLG), concludendo che gli standard laschi e il “gioco” di compiti preziosi tra i lavoratori di AMT potrebbero ostacolare lo sviluppo del settore.
La relazione giunge a una serie di conclusioni critiche sull’estensione della quale l’esternalizzazione a basso costo di compiti di valutazione di NLG aperti potrebbe portare a risultati e algoritmi inferiori in questo settore.
Gli ricercatori hanno anche compilato un elenco di 45 saggi su generazione di testo aperto dove la ricerca aveva utilizzato AMT, e hanno scoperto che “la stragrande maggioranza” non ha segnalato dettagli critici sull’uso del servizio di folla di Amazon, rendendo difficile riprodurre i risultati dei saggi.
Lavoro in Condizioni di Sfruttamento
La relazione critica sia la natura di sfruttamento di Amazon Mechanical Turk, sia i progetti accademici (probabilmente vincolati dal budget) che stanno dando ad AMT ulteriore credibilità utilizzandolo e citandolo come risorsa di ricerca valida e coerente. Gli autori notano:
‘Sebbene AMT sia una soluzione conveniente e economica, osserviamo che la grande varianza tra i lavoratori, la scarsa calibrazione e i compiti cognitivamente impegnativi possono portare i ricercatori a trarre conclusioni scientifiche fuorvianti (ad esempio, che il testo scritto da esseri umani è “peggiore” di quello generato da GPT-2).’
La relazione incolpa il sistema piuttosto che i giocatori, con i ricercatori che osservano:
‘I lavoratori della folla sono frequentemente sottopagati per il loro lavoro, il che danneggia sia la qualità della ricerca, sia, più importante, la capacità di questi lavoratori di guadagnare un reddito adeguato.’
Il documento, intitolato I Pericoli dell’Uso di Mechanical Turk per Valutare la Generazione di Testo Aperto, conclude inoltre che ‘valutatori esperti’ come insegnanti di lingua e linguisti dovrebbero essere utilizzati per valutare il contenuto di NLG aperto, anche se AMT è più economico.
Compiti di Test
Nel confrontare le prestazioni di AMT con lettori esperti meno vincolati dal tempo, i ricercatori hanno speso 144 dollari per i servizi di AMT utilizzati effettivamente nei test di confronto (sebbene molto di più sia stato speso per risultati “non utilizzabili” – vedi sotto), richiedendo a “Turks” casuali di valutare uno dei 200 testi, divisi tra contenuto di testo creato dall’uomo e testo generato artificialmente.
Assegnare ai docenti professionisti lo stesso lavoro è costato 187,50 dollari, e confermando la loro prestazione superiore (rispetto ai lavoratori di AMT) assumendo freelancer di Upwork per replicare i compiti è costato ulteriori 262,50 dollari.
Ogni compito consisteva in quattro criteri di valutazione: grammatica (‘Quanto è grammaticalmente corretto il testo del frammento di storia?’); coerenza (‘Quanto bene si adattano le frasi del frammento di storia?’); piacevolezza (‘Quanto ti piace il frammento di storia?’); e pertinenza (‘Quanto è pertinente il frammento di storia rispetto al prompt?’).
Generazione dei Testi
Per ottenere materiale di NLG per i test, i ricercatori hanno utilizzato il dataset di Facebook AI Research del 2018 Generazione di Storie Neurali Gerarchiche dataset, che comprende 303.358 storie in lingua inglese composte da utenti del subreddit r/writingprompts, dove le storie degli iscritti sono ‘seminate’ da promemoria in una sola frase in un modo simile alle attuali pratiche di generazione di testo-immagine – e, naturalmente, nella generazione di linguaggio naturale aperto sistemi.
200 promemoria dal dataset sono stati selezionati casualmente e passati attraverso un modello GPT-2 di dimensioni medie utilizzando la libreria Hugging-Face Transformers library. Così due set di risultati sono stati ottenuti dagli stessi promemoria: i saggi discorsivi scritti dagli utenti di Reddit e i testi generati da GPT-2.
Per evitare che gli stessi lavoratori di AMT giudichino la stessa storia più volte, sono stati richiesti tre giudizi di lavoratori di AMT per ogni esempio. Insieme con gli esperimenti riguardanti le capacità linguistiche inglesi dei lavoratori (vedi fine dell’articolo) e scontando i risultati dei lavoratori con scarso impegno (vedi ‘Short Time’ di seguito), ciò ha aumentato la spesa totale su AMT a circa 1.500 dollari.
Per creare un terreno di gioco equo, tutti i test sono stati condotti nei giorni feriali tra le 11:00-11:30 PST.
Risultati e Conclusioni
Lo studio copre un sacco di terreno, ma i punti chiave sono i seguenti:
Tempo Breve
Il documento ha scoperto che un tempo di attività medio segnalato da Amazon di 360 secondi si è ridotto a un tempo di lavoro reale di soli 22 secondi, e un tempo di lavoro mediano di solo 13 secondi – un quarto del tempo impiegato dall’insegnante di inglese più veloce che ripeteva il compito.

Dal giorno 2 dello studio: i lavoratori individuali (in arancione) hanno trascorso notevolmente meno tempo valutando ogni compito rispetto agli insegnanti meglio pagati, e (in seguito) ai contrattisti di Upwork ancora meglio pagati. Fonte: https://arxiv.org/pdf/2109.06835.pdf
Dal momento che AMT non impone alcun limite ai compiti di intelligenza umana (HIT) che un lavoratore individuale può accettare, sono emersi “big hitter” di AMT, con reputazioni (profittevoli) per completare un alto numero di compiti per esperimento. Al fine di compensare per i risultati accettati dallo stesso lavoratore, i ricercatori hanno misurato il tempo tra HIT consecutivi presentati, confrontando l’inizio e la fine di ogni HIT. In questo modo, la carenza tra il tempo di lavoro segnalato da AMT e il tempo effettivamente speso sul compito è emersa.
Dal momento che un tale lavoro non può essere eseguito in questi tempi ridotti, i ricercatori hanno dovuto compensare per questo:
‘Poiché è impossibile leggere attentamente un paragrafo di storia e valutare tutte e quattro le proprietà in soli 13 secondi, misuriamo l’impatto sui giudizi medi quando si filtrano i lavoratori che spendono troppo poco tempo per HIT…In particolare, rimuoviamo i giudizi dei lavoratori il cui tempo mediano è inferiore a 40 secondi (che è una bassa barra), e scopriamo che in media circa il 42% delle nostre valutazioni vengono filtrate (variando dal 20% al 72% in tutti gli esperimenti).’
Il documento sostiene che il tempo di lavoro reale non segnalato in AMT è ‘un problema importante’ generalmente trascurato dai ricercatori che utilizzano i servizi.
Guida Necessaria
I risultati suggeriscono inoltre che i lavoratori di AMT non possono distinguere in modo affidabile tra testo scritto da un essere umano e testo scritto da una macchina, a meno che non vedano entrambi i testi affiancati, il che comprometterebbe efficacemente uno scenario di valutazione tipico (dove il lettore dovrebbe essere in grado di prendere una decisione basata su un singolo campione di testo, ‘reale’ o generato artificialmente).
Accettazione Casuale di Testo Artificiale di Bassa Qualità
I lavoratori di AMT hanno valutato costantemente il testo artificiale di bassa qualità basato su GPT su un piano di parità con testo di alta qualità e coerente scritto da esseri umani, in contrasto con gli insegnanti di inglese, che sono stati in grado di distinguere facilmente la differenza di qualità.
Nessun Tempo di Preparazione, Nessun Contesto
Entrare nel giusto stato d’animo per un compito così astratto come la valutazione dell’autenticità non viene naturalmente; gli insegnanti di inglese hanno richiesto 20 compiti per calibrare le loro sensibilità all’ambiente di valutazione, mentre i lavoratori di AMT di solito non ricevono alcun “tempo di orientamento” affatto, abbassando la qualità del loro input.
Barare il Sistema
La relazione sostiene che il tempo totale che i lavoratori di AMT trascorrono in compiti individuali è gonfiato dai lavoratori che accettano più compiti contemporaneamente e li eseguono in schede diverse del browser, invece di concentrarsi su un compito per la durata del compito registrata.
Il Paese di Origine è Importante
Le impostazioni predefinite di AMT non filtrano i lavoratori per paese di origine, e la relazione nota lavori precedenti che indicano che i lavoratori di AMT utilizzano VPN per lavorare intorno alle restrizioni geografiche, consentendo ai non madrelingua di presentarsi come madrelingua (in un sistema che, forse ingenuamente, equipara la lingua madre di un lavoratore con la sua posizione geografica basata sull’IP).
Quindi i ricercatori hanno ripetuto i test di valutazione su AMT con filtri che limitano i potenziali partecipanti ai non-paesi di lingua inglese, scoprendo che ‘i lavoratori di non-paesi di lingua inglese hanno valutato la coerenza, la pertinenza e la grammatica…significativamente più basso di lavoratori identicamente qualificati di paesi di lingua inglese’.
La relazione conclude:
‘[Valutatori esperti] come linguisti o insegnanti di lingua dovrebbero essere utilizzati ogni volta che possibile, poiché sono già stati addestrati a valutare testi scritti, e non è molto più costoso…’.
Pubblicato il 16 settembre 2021 – Aggiornato il 18 dicembre 2021: aggiunti tag












