Andersons Blickwinkel

Die Mängel von Amazon Mechanical Turk könnten Natural Language Generation-Systeme gefährden

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Eine neue Studie der University of Massachusetts Amherst hat englische Lehrer gegenüber Crowdsourced-Arbeitern bei Amazon Mechanical Turk bei der Bewertung von Natural Language Generation (NLG)-Systemen ausgetragen und festgestellt, dass laxere Standards und das “Gaming” von begehrten Aufgaben unter AMT-Arbeitern die Entwicklung des Sektors behindern könnten.

Der Bericht kommt zu einer Reihe von vernichtenden Schlussfolgerungen über das Ausmaß, in dem die “industrielle” billige Auslagerung von offenen NLG-Evaluierungsaufgaben zu schlechten Ergebnissen und Algorithmen in diesem Sektor führen könnte.

Die Forscher haben auch eine Liste von 45 Artikeln über offene Textgenerierung zusammengestellt, bei denen die Forschung die Verwendung von AMT genutzt hat, und festgestellt, dass “die überwiegende Mehrheit” wichtige Details über die Verwendung von Amazon’s Crowdservice nicht berichtet hat, was es schwierig macht, die Ergebnisse der Artikel zu reproduzieren.

Schwarze Arbeit

Der Bericht kritisiert sowohl die Ausbeutung von Arbeitern bei Amazon Mechanical Turk als auch die (wahrscheinlich budgetbeschränkten) akademischen Projekte, die AMT zusätzliche Glaubwürdigkeit verleihen, indem sie es als gültige und konsistente Forschungsressource nutzen und zitieren. Die Autoren bemerken:

‘Während AMT eine bequeme und erschwingliche Lösung ist, stellen wir fest, dass eine hohe Varianz zwischen Arbeitern, schlechte Kalibrierung und kognitiv anspruchsvolle Aufgaben Forscher dazu bringen können, irreführende wissenschaftliche Schlussfolgerungen zu ziehen (z.B., dass menschlich geschriebener Text “schlechter” ist als GPT-2).’

Der Bericht beschuldigt das System und nicht die Spieler, da die Forscher feststellen:

‘[Crowd]-Arbeiter werden häufig unterbezahlt für ihre Arbeit, was die Qualität der Forschung schädigt und wichtiger noch, die Fähigkeit dieser Crowd-Arbeiter, ein angemessenes Einkommen zu verdienen.’

Der Artikel, betitelt Die Gefahren der Verwendung von Mechanical Turk zur Bewertung offener Textgenerierung, kommt zu dem Schluss, dass “Experten-Bewerter” wie Sprachlehrer und Linguisten verwendet werden sollten, um offene künstliche NLG-Inhalte zu bewerten, auch wenn AMT billiger ist.

Testaufgaben

Bei der Vergleichsbewertung von AMT mit weniger zeitbeschränkten, experten Lesern haben die Forscher 144 Dollar für die tatsächlich verwendeten AMT-Dienste ausgegeben (obwohl viel mehr für “nicht verwendbare” Ergebnisse ausgegeben wurde – siehe unten), um zufällige “Turks” zu bewerten, einen von 200 Texten, aufgeteilt zwischen menschlich erstelltem Textinhalt und künstlich generiertem Text.

Die Beauftragung professioneller Lehrer mit der gleichen Arbeit kostete 187,50 Dollar, und ihre überlegene Leistung (im Vergleich zu AMT-Arbeitern) wurde durch die Anstellung von Upwork-Freelancern bestätigt, um die Aufgaben zu wiederholen, was zusätzliche 262,50 Dollar kostete.

Jede Aufgabe bestand aus vier Bewertungskriterien: Grammatik (‘Wie grammatisch korrekt ist der Text des Story-Fragments?’); Kohärenz (‘Wie gut passen die Sätze im Story-Fragment zusammen?’); Sympathie (‘Wie angenehm finden Sie das Story-Fragment?’); und Relevanz (‘Wie relevant ist das Story-Fragment zum Prompt?’).

Erzeugung der Texte

Um NLG-Material für die Tests zu erhalten, haben die Forscher das 2018er Hierarchical Neural Story GenerationDataset von Facebook AI Research verwendet, das 303.358 englische Geschichten von Benutzern der sehr beliebten (15 Mio.+ Benutzer) r/WritingPrompts-Subreddit umfasst, bei dem die Geschichten der Benutzer durch einzelne Satz-“Prompts” “gesät” werden, ähnlich wie bei aktuellen Praktiken in Text-zu-Bild-Generierung – und natürlich in offenen Natural Language Generation Systemen.

200 Prompts aus dem Dataset wurden zufällig ausgewählt und durch ein mittelgroßes GPT-2-Modell unter Verwendung der Hugging-Face-Transformers-Bibliothek geleitet. So wurden zwei Sätze von Ergebnissen aus den gleichen Prompts erhalten: die menschlich geschriebenen diskursiven Essays von Reddit-Benutzern und GPT-2-erzeugte Texte.

Um zu verhindern, dass die gleichen AMT-Arbeiter die gleiche Geschichte mehrmals bewerten, wurden drei AMT-Arbeiter-Bewertungen pro Beispiel angefordert. Zusammen mit Experimenten zu den englischen Sprachfähigkeiten der Arbeiter (siehe Ende des Artikels) und unter Berücksichtigung von Ergebnissen von Arbeitern mit geringem Aufwand (siehe “Kurze Zeit” unten) erhöhte sich der Gesamtaufwand für AMT auf etwa 1.500 US-Dollar.

Um ein Level Playing Field zu schaffen, wurden alle Tests an Wochentagen zwischen 11:00 und 11:30 Uhr PST durchgeführt.

Ergebnisse und Schlussfolgerungen

Die umfassende Studie deckt viel Boden ab, aber die wichtigsten Punkte sind wie folgt:

Kurze Zeit

Der Artikel fand heraus, dass eine offiziell von Amazon gemeldete durchschnittliche Aufgabenzeit von 360 Sekunden auf eine reale Arbeitszeit von nur 22 Sekunden und eine Median-Arbeitszeit von nur 13 Sekunden herabgesetzt wurde – ein Viertel der Zeit, die der schnellste englische Lehrer für die Wiederholung der Aufgabe benötigte.

Vom zweiten Tag der Studie: Die einzelnen Arbeiter (in Orange) verbrachten deutlich weniger Zeit mit der Bewertung jeder Aufgabe als die besser bezahlten Lehrer und (später) die noch besser bezahlten Upwork-Vertragspartner. Quelle: https://arxiv.org/pdf/2109.06835.pdf

Vom zweiten Tag der Studie: Die einzelnen Arbeiter (in Orange) verbrachten deutlich weniger Zeit mit der Bewertung jeder Aufgabe als die besser bezahlten Lehrer und (später) die noch besser bezahlten Upwork-Vertragspartner. Quelle: https://arxiv.org/pdf/2109.06835.pdf

Da AMT keine Grenzen für die Human Intelligence Tasks (HITs) setzt, die ein einzelner Arbeiter übernehmen kann, sind AMT-“Big-Hitter” aufgetaucht, die für die Fertigstellung hoher Aufgabenanzahlen pro Experiment bekannt sind. Um die Zeit zwischen aufeinanderfolgenden übermittelten HITs zu kompensieren, haben die Forscher die Zeit zwischen Start- und Endzeit jeder HIT gemessen und verglichen. Auf diese Weise kam der Unterschied zwischen AMT’s gemeldeter WorkTimeInSeconds und der tatsächlichen Zeit, die für die Aufgabe aufgewendet wurde, in den Blick.

Da eine solche Arbeit in diesen reduzierten Zeiträumen nicht geleistet werden kann, mussten die Forscher dies kompensieren:

‘Da es unmöglich ist, einen absatzlangen Text sorgfältig zu lesen und alle vier Eigenschaften in nur 13 Sekunden zu bewerten, messen wir die Auswirkungen auf die Durchschnittsbewertungen, wenn wir Arbeiter filtern, die zu wenig Zeit pro HIT verbringen… Insbesondere entfernen wir Bewertungen von Arbeitern, deren Medianzeit unter 40 Sekunden liegt (was eine niedrige Latte ist), und finden, dass im Durchschnitt etwa 42% unserer Bewertungen gefiltert werden (zwischen 20% und 72% über alle Experimente hinweg).’

Der Artikel behauptet, dass die falsch gemeldete tatsächliche Arbeitszeit in AMT ein “großes Problem” ist, das normalerweise von Forschern, die die Dienste nutzen, übersehen wird.

Handholding erforderlich

Die Ergebnisse deuten weiter darauf hin, dass AMT-Arbeiter nicht zuverlässig zwischen Texten unterscheiden können, die von Menschen oder Maschinen geschrieben wurden, es sei denn, sie sehen beide Texte nebeneinander, was eine typische Bewertungssituation (in der der Leser in der Lage sein sollte, ein Urteil auf der Grundlage eines einzelnen Textbeispiels zu fällen, “echt” oder künstlich generiert) effektiv kompromittieren würde.

Kasuelle Akzeptanz von minderwertigem künstlichem Text

AMT-Arbeiter bewerteten konsistent minderwertigen GPT-basierten künstlichen Text auf dem gleichen Niveau wie höherwertigen, kohärenten Text, der von Menschen geschrieben wurde, im Gegensatz zu den englischen Lehrern, die leicht in der Lage waren, den Unterschied in der Qualität zu erkennen.

Keine Vorbereitungszeit, kein Kontext

Das Einnehmen der richtigen Einstellung für eine solche abstrakte Aufgabe wie die Bewertung von Authentizität kommt nicht natürlich; englische Lehrer benötigten 20 Aufgaben, um ihre Sensibilität für die Bewertungsumgebung zu kalibrieren, während AMT-Arbeiter typischerweise keine “Orientierungszeit” hatten, was die Qualität ihrer Eingaben verringerte.

Das System ausnutzen

Der Bericht behauptet, dass die Gesamtarbeitszeit, die AMT-Arbeiter für einzelne Aufgaben aufwenden, durch Arbeiter, die mehrere Aufgaben gleichzeitig annehmen und diese in verschiedenen Browser-Registerkarten durchlaufen, anstatt sich auf eine Aufgabe für die aufgezeichnete Aufgabenzeit zu konzentrieren, aufgebläht wird.

Herstellerland ist wichtig

Die Standard-Einstellungen von AMT filtern Arbeiter nicht nach Herstellerland, und der Bericht verweist auf vorherige Arbeiten, die darauf hinweisen, dass AMT-Arbeiter VPNs nutzen, um geografische Einschränkungen zu umgehen, und sich als Muttersprachler ausgeben (in einem System, das vielleicht ein bisschen naiv die Muttersprache eines Arbeiters mit seiner IP-basierten geografischen Lage gleichsetzt).

Die Forscher haben die Bewertungstests auf AMT mit Filtern wiederholt, die potenzielle Teilnehmer auf nicht-englischsprachige Länder beschränkten, und festgestellt, dass ‘Arbeiter aus nicht-englischsprachigen Ländern Kohärenz, Relevanz und Grammatik… signifikant niedriger bewerteten als identisch qualifizierte Arbeiter aus englischsprachigen Ländern’.

Der Bericht schließt:

‘[Experten]-Bewerter wie Linguisten oder Sprachlehrer sollten wann immer möglich verwendet werden, da sie bereits ausgebildet sind, geschriebenen Text zu bewerten, und es ist nicht viel teurer…’.

 

Veröffentlicht am 16. September 2021Aktualisiert am 18. Dezember 2021: Tags hinzugefügt

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai