Kąt Andersona

Wady Amazon Mechanical Turk mogą zagrażać systemom generacji języka naturalnego

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badanie przeprowadzone przez Uniwersytet Massachusetts Amherst zestawiło nauczycieli angielskiego z pracownikami z Crowdsourced z Amazon Mechanical Turk w ocenie wyników systemów generacji języka naturalnego (NLG), dochodząc do wniosku, że luźne standardy i “gry” z cenionymi zadaniami wśród pracowników AMT mogą utrudniać rozwój tego sektora.

Raport dochodzi do szeregu krytycznych wniosków dotyczących stopnia, w jakim “przemysłowa” tania zewnętrzna ocena zadań NLG może prowadzić do gorszych wyników i algorytmów w tym sektorze.

Badacze również skompilowali listę 45 prac na temat generacji tekstu, w których badanie wykorzystywało AMT, i stwierdzili, że “znaczna większość” nie zgłaszała istotnych szczegółów dotyczących wykorzystania usługi tłumu Amazon, co utrudniało odtworzenie wyników prac.

Praca w warunkach podobnych do pracy w sweat-shopie

Raport krytykuje zarówno warunki pracy w Amazon Mechanical Turk, jak i (prawdopodobnie ograniczone budżetem) projekty akademickie, które nadają AMT dodatkową wiarygodność, używając go jako ważnego i spójnego źródła badań. Autorzy zauważają:

‘Chociaż AMT jest wygodnym i tanim rozwiązaniem, obserwujemy, że duża zmienność między pracownikami, słaba kalibracja i wymagające zadania poznawcze mogą prowadzić badaczy do mylących wniosków naukowych (np. że tekst napisany przez człowieka jest „gorszy” niż GPT-2)’

Raport obwinia system, a nie graczy, zauważając:

‘Pracownicy są często niedopłacani za swoją pracę, co szkodzi jakości badań oraz, co ważniejsze, możliwości zarobkowania przez tych pracowników’

Praca pt, zatytułowana Zagrożenia związane z wykorzystaniem Mechanical Turk do oceny generacji tekstu, dochodzi do wniosku, że ‘eksperci, tacy jak nauczyciele języka angielskiego i lingwiści, powinni być używani do oceny otwartych sztucznych treści NLG, nawet jeśli AMT jest tańszy.

Zadania testowe

Porównując wyniki AMT z mniej ograniczonymi czasowo, ekspertami czytelnikami, badacze wydali 144 dolarów na usługi AMT wykorzystane w testach porównawczych (chociaż znacznie więcej zostało wydane na “nie nadające się do użycia” wyniki – zobacz poniżej), wymagając od losowych “Turków”, aby ocenili jeden z 200 tekstów, podzielonych na treści napisane przez ludzi i sztucznie wygenerowane.

Wyznaczenie profesjonalnych nauczycieli do tej samej pracy kosztowało 187,50 dolarów, a potwierdzenie ich lepszych wyników (w porównaniu z pracownikami AMT) poprzez zatrudnienie freelancerów z Upwork do powtórzenia zadań kosztowało dodatkowe 262,50 dolarów.

Każde zadanie składało się z czterech kryteriów oceny: gramatyki (‘Jak poprawna gramatycznie jest treść fragmentu historii?’); spójności (‘Jak dobrze zdania w fragmencie historii pasują do siebie?’); lubiania (‘Jak przyjemny jest fragment historii?’); i istotności (‘Jak istotny jest fragment historii w stosunku do podpowiedzi?’).

Generowanie tekstów

Aby uzyskać materiał NLG do testów, badacze wykorzystali zestaw danych Facebook AI Research’s 2018 Hierarchical Neural Story Generation zestaw danych, który składa się z 303 358 angielskich historii napisanych przez użytkowników w bardzo popularnym (15 milionów + użytkowników) r/WritingPrompts subreddit, gdzie historie użytkowników są “zasiane” przez jednowyrazowe “podpowiedzi” w podobny sposób do bieżących praktyk w generacji tekstu do obrazu – i, oczywiście, w otwartych systemach generacji języka naturalnego systemach.

200 podpowiedzi z zestawu danych zostało wybranych losowo i przekazanych przez średniej wielkości model GPT-2 przy użyciu biblioteki Hugging-Face Transformers biblioteki. W ten sposób uzyskano dwa zestawy wyników z tych samych podpowiedzi: eseje dyskursywne napisane przez użytkowników Reddit i teksty wygenerowane przez GPT-2.

Aby uniknąć sytuacji, w której ci sami pracownicy AMT oceniają ten sam tekst wielokrotnie, pobrano trzy oceny pracowników AMT na przykład. Wraz z eksperymentami dotyczącymi umiejętności językowych pracowników (zobacz koniec artykułu) i wykluczaniem wyników z niskim wysiłkiem pracowników (zobacz “Krótki czas” poniżej), zwiększyło to całkowity wydatek na AMT do około 1 500 dolarów.

Aby stworzyć równą szansę, wszystkie testy przeprowadzono w dni robocze między 11:00 a 11:30 czasu PST.

Wyniki i wnioski

Rozległe badanie obejmuje wiele obszarów, ale kluczowe punkty to:

Krótki czas

Praca wykazała, że oficjalnie zgłoszony przez Amazon średni czas zadania wynoszący 360 sekund sprowadza się do rzeczywistego czasu pracy wynoszącego tylko 22 sekundy, a medianę czasu pracy wynoszącą tylko 13 sekund – jedną czwartą czasu potrzebnego przez najbardziej efektywnego nauczyciela angielskiego do powtórzenia zadania.

Z dnia 2. badania: poszczególni pracownicy (na pomarańczowo) spędzali znacznie mniej czasu na ocenianiu każdego zadania niż lepiej opłacani nauczyciele, a (później) jeszcze lepiej opłacani kontrahenci z Upwork. Źródło: https://arxiv.org/pdf/2109.06835.pdf

Z dnia 2. badania: poszczególni pracownicy (na pomarańczowo) spędzali znacznie mniej czasu na ocenianiu każdego zadania niż lepiej opłacani nauczyciele, a (później) jeszcze lepiej opłacani kontrahenci z Upwork. Źródło: https://arxiv.org/pdf/2109.06835.pdf

Ponieważ AMT nie nakłada ograniczeń na zadania, które może wykonać jeden pracownik, pojawiły się “gwiazdy” AMT, które mają (opłacalne) renomę za wykonywanie dużej liczby zadań na eksperyment. Aby zrekompensować zaakceptowane zadania przez tego samego pracownika, badacze zmierzyli czas między kolejno zgłoszonymi zadaniami, porównując czas rozpoczęcia i zakończenia każdego zadania. W ten sposób niedobór między zgłoszonym przez AMT WorkTimeInSeconds a rzeczywistym czasem spędzonym na zadaniu wszedł w światło.

Ponieważ takiej pracy nie można wykonać w tak zmniejszonych ramach czasowych, badacze musieli zrekompensować to:

‘Ponieważ nie można starannie przeczytać paragrafu i ocenić wszystkie cztery właściwości w ciągu zaledwie 13 sekund, mierzymy wpływ na średnie oceny, gdy filtrowane są oceny pracowników, którzy spędzają zbyt mało czasu na zadaniu… Konkretnie, usuwamy oceny pracowników, których mediana czasu jest poniżej 40 sekund (co jest niską poprzeczką), i stwierdzamy, że średnio około 42% naszych ocen jest filtrowanych (waha się od 20% do 72% we wszystkich eksperymentach)’

Praca twierdzi, że błędnie zgłoszony rzeczywisty czas pracy w AMT jest “poważnym problemem” zwykle pomijanym przez badaczy, którzy wykorzystują te usługi.

Wymagana pomoc

Wyniki sugerują ponadto, że pracownicy AMT nie mogą niezawodnie odróżnić tekstu napisanego przez człowieka od tekstu napisanego przez maszynę, chyba że zobaczą oba teksty obok siebie, co skutecznie podważyłoby typową sytuację oceny (gdzie czytelnik powinien być w stanie podjąć decyzję na podstawie jednego przykładu tekstu, “rzeczywistego” lub sztucznie wygenerowanego).

Łatwe przyjęcie niskiej jakości sztucznego tekstu

Pracownicy AMT konsekwentnie oceniali niskiej jakości sztuczny tekst oparty na GPT na równi z lepszym, spójnym tekstem napisanym przez ludzi, w przeciwieństwie do nauczycieli angielskiego, którzy łatwo mogli odróżnić różnicę w jakości.

Brak czasu przygotowawczego, zero kontekstu

Wejście w odpowiednią postawę do tak abstrakcyjnego zadania, jak ocena autentyczności, nie przychodzi naturalnie; nauczyciele angielskiego wymagali 20 zadań, aby skalibrować swoje wrażliwości na środowisko oceny, podczas gdy pracownicy AMT zwykle nie mają “czasu orientacyjnego” w ogóle, co obniża jakość ich danych wejściowych.

Gra w system

Raport utrzymuje, że całkowity czas, jaki pracownicy AMT spędzają na poszczególnych zadaniach, jest zawyżany przez pracowników, którzy przyjmują wiele zadań jednocześnie i przechodzą przez zadania w różnych zakładkach na swoich przeglądarkach, zamiast koncentrować się na jednym zadaniu przez zarejestrowany czas trwania zadania.

Kraj pochodzenia jest istotny

Domyślne ustawienia AMT nie filtrowują pracowników według kraju pochodzenia, a raport zauważa wcześniejsze prace wskazujące, że pracownicy AMT używają VPN, aby obejść ograniczenia geograficzne, umożliwiając nie-rodzimym mówcom przedstawienie się jako rodowitych angielskich mówców (w systemie, który, być może dość naiwnie, utożsamia język ojczysty pracownika z jego położeniem geograficznym opartym na IP).

Badacze ponownie przeprowadzili testy oceny na AMT z filtrami, które ograniczały potencjalnych wykonawców do nie-angielskojęzycznych krajów, stwierdzając, że ‘pracownicy z nie-angielskojęzycznych krajów oceniali spójność, istotność i gramatykę… znacznie niższe niż identycznie wykwalifikowani pracownicy z angielskojęzycznych krajów’.

Raport kończy się:

‘[Eksperci] tacy jak lingwiści lub nauczyciele języka angielskiego powinni być używani, gdy tylko jest to możliwe, ponieważ już zostali przeszkoleni w ocenie napisanego tekstu, i nie jest to znacznie droższe…’

 

Opublikowano 16 września 2021Zaktualizowano 18 grudnia 2021: Dodano tagi

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai