Andersonův úhel
Nedostatky Amazon Mechanical Turk mohou ohrozit systémy generace přirozeného jazyka

Nová studie z University of Massachusetts Amherst postavila anglické učitele proti pracovníkům z crowdfundové platformy Amazon Mechanical Turk při hodnocení výstupu systémů generace přirozeného jazyka (NLG), a dospěla k závěru, že laxní standardy a “herní” přístup k úkolům mezi pracovníky AMT mohou brzdit rozvoj tohoto odvětví.
Studie dospěla k několika kritickým závěrům ohledně rozsahu, v jakém “industriální” levné outsourcing otevřených úkolů NLG může vést k nižším výsledkům a algoritmům v tomto odvětví.
Vědci také sestavili seznam 45 článků o generaci otevřeného textu, ve kterých výzkumníci využili AMT, a zjistili, že “velká většina” z nich nezveřejnila kritické detaily o využití služby Amazon, což znesnadňuje reprodukovat výsledky článků.
Pracovní podmínky
Studie kritizuje jak samotnou platformu Amazon Mechanical Turk, tak akademické projekty, které AMT využívají a citují jako validní a konzistentní zdroj, pravděpodobně kvůli omezením rozpočtu. Autoři studie poznamenávají:
‘Ačkoli je AMT pohodlným a dostupným řešením, jsme si vědomi, že vysoká variabilita mezi pracovníky, špatná kalibrace a kognitivně náročné úkoly mohou vést výzkumníky k mylným vědeckým závěrům (například, že text napsaný člověkem je “horší” než GPT-2).’
Studie viní systém, nikoli hráče, a autoři studie poznamenávají:
‘Pracovníci jsou často podpláceni za svou práci, což poškozuje kvalitu výzkumu a především možnost těchto pracovníků vydělat si důstojný život.’
Článek The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation dále dospívá k závěru, že “expertní hodnotitelé” jako učitelé jazyka a lingvisté by měli být využiti k hodnocení otevřeného umělého obsahu NLG, i když je AMT levnější.
Testovací úkoly
Při srovnání výkonu AMT s méně časově omezenými, experty, výzkumníci utratili 144 dolarů za služby AMT, které byly skutečně použity v porovnávacích testech (i když mnohem více bylo utraceno za “nepoužitelné” výsledky – viz níže), a vyžadovali náhodné “Turky”, aby vyhodnotili jeden z 200 textů, rozdělených mezi lidsky vytvořený text a umělý text.
Úkolem profesionálních učitelů bylo vyhodnotit stejnou práci za 187,50 dolarů, a potvrzení jejich lepšího výkonu (ve srovnání s pracovníky AMT) hiring freelancery z Upworku k replikaci úkolů stálo dalších 262,50 dolarů.
Každý úkol se skládal ze čtyř hodnoticích kritérií: gramatika (‘Jak gramaticky správný je text příběhu?’); soudržnost (‘Jak dobře se věty v příběhu slučují?’); oblíbenost (‘Jak příjemný je příběh?’); a relevance (‘Jak relevantní je příběh k zadání?’).
Generování textů
Pro získání materiálu NLG pro testy výzkumníci využili dataset Hierarchical Neural Story Generation od Facebook AI Research z roku 2018, který se skládá z 303 358 anglických příběhů vytvořených uživateli na subredditu r/WritingPrompts, kde příběhy uživatelů jsou “osevní” jednoduchými větami – podobně jako současné postupy v text-to-image generaci – a samozřejmě v otevřených systémech generace přirozeného jazyka systémů.
200 příběhů z datasetu bylo náhodně vybráno a prošlo modelem GPT-2 pomocí knihovny Hugging-Face Transformers. Takto byly získány dva sady výsledků z stejného zadání: lidsky psané eseje z Redditu a texty generované GPT-2.
Aby se zabránilo tomu, že stejní pracovníci AMT vyhodnotí stejný příběh vícekrát, bylo vyžádáno tři hodnocení od pracovníků AMT pro každý příklad. Spolu s experimenty týkajícími se anglických jazykových schopností pracovníků (viz konec článku) a vyřazením výsledků od pracovníků s nízkou úsilím (viz “Short Time” níže), to zvýšilo celkové výdaje na AMT na přibližně 1 500 dolarů.
Aby se vytvořila rovná hra, všechny testy byly provedeny v pracovních dnech mezi 11:00 a 11:30 PST.
Výsledky a závěry
Rozsáhlá studie pokrývá mnoho témat, ale hlavní body jsou následující:
Short Time
Studie zjistila, že oficiálně hlášený průměrný čas úkolu 360 sekund se ve skutečnosti rovnal pracovnímu času pouhých 22 sekund, a medián pracovní doby byl pouhých 13 sekund – čtvrtina času, který strávil nejrychlejší anglický učitel při replikaci úkolu.

Z druhého dne studie: jednotliví pracovníci (v oranžové) strávili mnohem méně času vyhodnocením každého úkolu než lépe placení učitelé, a (později) ještě lépe placení kontraktori z Upworku. Zdroj: https://arxiv.org/pdf/2109.06835.pdf
Pokud AMT neklade žádný limit na počet úkolů, které může jeden pracovník přijmout, objevili se “velcí hráči” AMT, kteří mají (ziskové) reputace za dokončení vysokého počtu úkolů za experiment. Aby se kompenzovalo za přijaté úkoly stejným pracovníkem, výzkumníci měřili čas mezi po sobě jdoucími úkolami, srovnávali start a konec každého úkolu. Takto se nedostatek mezi hlášeným WorkTimeInSeconds a skutečným časem stráveným na úkolu stal zřejmým.
Pоскольку taková práce nemůže být provedena v těchto zkrácených časových rámcích, výzkumníci museli kompenzovat to:
‘Je nemožné pečlivě přečíst odstavcový příběh a vyhodnotit všechny čtyři vlastnosti za pouhých 13 sekund, měříme dopad na průměrná hodnocení, když filtrování pracovníků, kteří stráví příliš málo času na úkol… Konkrétně, odstraňujeme hodnocení od pracovníků, jejichž medián času je pod 40 sekundami (což je nízká laťka), a zjistíme, že v průměru asi 42% našich hodnocení je filtrováno (rozmezí 20-72% napříč všemi experimenty).’
Studie tvrdí, že chybně hlášený skutečný pracovní čas v AMT je “velkým problémem”, který je obvykle přehlížen výzkumníky, kteří využívají tyto služby.
Potřebujete vedení
Zjištění dále naznačují, že pracovníci AMT nemohou spolehlivě rozlišit mezi textem napsaným člověkem a textem napsaným strojem, pokud nevidí oba texty vedle sebe, což by efektivní kompromisoval typický scénář hodnocení (kde by čtenář měl být schopen učinit rozhodnutí na základě jediného vzorku textu, “skutečného” nebo uměle vytvořeného).
Přijetí nízkokvalitního umělého textu
Pracovníci AMT konzistentně hodnotili nízkokvalitní umělý text založený na GPT-2 na stejné úrovni jako vyšší kvalitní, soudržný text napsaný lidmi, na rozdíl od anglických učitelů, kteří snadno rozlišovali rozdíl v kvalitě.
Žádná přípravná doba, nulový kontext
Vstup do správné mysli pro tak abstraktní úkol, jako je hodnocení autenticity, nepřichází přirozeně; anglickým učitelům bylo zapotřebí 20 úkolů, aby se přizpůsobili hodnotícímu prostředí, zatímco pracovníci AMT obvykle nedostávají žádnou “orientační dobu” vůbec, což snižuje kvalitu jejich vstupu.
Herní systém
Studie tvrdí, že celkový čas, který pracovníci AMT stráví na jednotlivých úkolech, je zanášen pracovníky, kteří přijímají více úkolů současně a procházejí úkoly v různých záložkách prohlížeče, místo aby se soustředili na jeden úkol po zaznamenanou dobu úkolu.
Země původu je důležitá
Výchozí nastavení AMT nefiltruje pracovníky podle země původu, a studie zmiňuje předchozí práci, která naznačuje, že pracovníci AMT využívají VPN k obcházení geografických omezení, což umožňuje nenativním mluvčím představovat se jako rodilí anglicky mluvící (v systému, který perhaps rather naivně, rovná se mateřskému jazyku pracovníka s jeho IP-based geografickou polohou).
Takže výzkumníci znovu spustili hodnocení testů na AMT s filtry, které omezují potenciální pracovníky na ne-anglicky mluvící země, a zjistili, že ‘pracovníci z neanglicky mluvících zemí hodnotili soudržnost, relevanci a gramatiku… významně nižší než identicky kvalifikovaní pracovníci z anglicky mluvících zemí’.
Studie uzavírá:
‘[Expert] hodnotitelé, jako jsou lingvisté nebo učitelé jazyka, by měli být využiti, kdykoli je to možné, protože již byli vyškoleni k hodnocení psaného textu, a není to mnohem dražší…’.
Publikováno 16. září 2021 – Aktualizováno 18. prosince 2021: Přidány značky












