Unghiul lui Anderson

Lipsurile sistemelor de generare a limbajului natural pot fi amenințate de deficiențele Amazon Mechanical Turk

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă studiu de la Universitatea din Massachusetts Amherst a comparat profesorii de engleză cu lucrătorii din sursele crowdsourcing de la Amazon Mechanical Turk în evaluarea rezultatelor sistemelor de generare a limbajului natural (NLG), concluzionând că standardele laxate și “jocul” sarcinilor apreciate printre lucrătorii AMT ar putea împiedica dezvoltarea sectorului.

Raportul ajunge la o serie de concluzii devastatoare cu privire la măsura în care externalizarea la scară industrială a sarcinilor de evaluare a textului deschis NLG ar putea duce la rezultate și algoritmi inferiori în acest sector.

Cercetătorii au compilat, de asemenea, o listă de 45 de articole despre generarea de text deschis, în care cercetarea a utilizat AMT, și au constatat că “majoritatea covârșitoare” nu a raportat detalii critice despre utilizarea serviciului de crowd al Amazon, făcând dificilă reproducerea rezultatelor articolelor.

Muncă în condiții de atelier de lucru

Raportul critică atât natura de atelier de lucru a Amazon Mechanical Turk, cât și proiectele academice (probabil limitate de buget) care acordă AMT o credibilitate suplimentară prin utilizarea și citarea acestuia ca resursă de cercetare validă și constantă. Autorii notează:

‘În timp ce AMT este o soluție convenabilă și accesibilă, observăm că variația ridicată între lucrători, calibrarea slabă și sarcinile solicitante din punct de vedere cognitiv pot determina cercetătorii să tragă concluzii științifice înșelătoare (de exemplu, că textul scris de oameni este „mai rău” decât cel generat de GPT-2).’

Raportul învinovățește sistemul, nu jucătorii, cercetătorii observând:

‘[Lucrătorii din crowd] sunt adesea plătiți sub minim pentru munca lor, ceea ce afectează atât calitatea cercetării, cât și, mai important, capacitatea acestor lucrători de a câștiga un venit adecvat.’

Articolul științific, intitulat Pericolele utilizării Mechanical Turk pentru evaluarea generării de text deschis, conchide, de asemenea, că ‘evaluatori experți’ precum profesorii de limbă și lingviștii ar trebui să fie utilizați pentru a evalua conținutul artificial NLG deschis, chiar dacă AMT este mai ieftin.

Sarcini de testare

În comparația performanței AMT cu cititorii experți mai puțin limitați de timp, cercetătorii au cheltuit 144 de dolari pentru serviciile AMT utilizate în efectuarea testelor (deși mult mai mult a fost cheltuit pentru rezultate “neutilizabile” – a se vedea mai jos), solicitând “turcilor” aleatori să evalueze unul dintre 200 de texte, împărțite între conținutul textului creat de oameni și textul generat artificial.

Însărcinarea profesorilor cu aceeași muncă a costat 187,50 de dolari, confirmând performanța lor superioară (în comparație cu lucrătorii AMT) prin angajarea de freelanceri Upwork pentru a replica sarcinile, ceea ce a costat în plus 262,50 de dolari.

Fiecare sarcină a constat în patru criterii de evaluare: gramatică (‘Cât de corectă gramatical este fraza textului?’); coerență (‘Cât de bine se potrivesc propozițiile din fragmentul de poveste?’); plăcere (‘Cât de plăcută este fragmentul de poveste?’); și relevanță (‘Cât de relevantă este fragmentul de poveste pentru prompt?’).

Generarea textelor

Pentru a obține materialul NLG pentru testele, cercetătorii au utilizat setul de date Generarea ierarhică a poveștilor neuronale din 2018 de la Facebook AI Research, care cuprinde 303.358 de povești în limba engleză compuse de utilizatori pe subredditul r/writingprompts, unde poveștile subscrise sunt “însămânțate” de propuneri unice într-un mod similar cu practicile actuale de generare de imagini din text – și, desigur, în sistemele de generare a limbajului natural deschis.

200 de propuneri din setul de date au fost selectate aleatoriu și trecute printr-un model GPT-2 de dimensiuni medii, utilizând biblioteca Hugging-Face Transformers library. Astfel, s-au obținut două seturi de rezultate din aceleași propuneri: eseuri discursive scrise de oameni de la utilizatorii Reddit și texte generate de GPT-2.

Pentru a preveni ca aceiași lucrători AMT să evalueze aceeași poveste de mai multe ori, au fost solicitate trei judecăți ale lucrătorilor AMT pentru fiecare exemplu. Împreună cu experimentele referitoare la capacitățile lingvistice ale lucrătorilor (a se vedea sfârșitul articolului) și discountând rezultatele de la lucrătorii cu efort scăzut (a se vedea ‘Timp scurt’ mai jos), acest lucru a crescut cheltuielile totale pentru AMT la aproximativ 1.500 de dolari.

Pentru a crea un teren de joc echitabil, toate testele au fost efectuate în zilele de lucru, între orele 11:00-11:30 PST.

Rezultate și concluzii

Studiul vast acoperă mult teren, dar punctele cheie sunt următoarele:

Timp scurt

Articolul a constatat că timpul mediu de lucru raportat oficial de Amazon de 360 de secunde s-a dovedit a fi un timp de lucru real de doar 22 de secunde, iar timpul mediu de lucru a fost de doar 13 secunde – un sfert din timpul luat de cel mai rapid profesor de engleză care a replicat sarcina.

Din ziua 2 a studiului: lucrătorii individuali (în portocaliu) au petrecut mult mai puțin timp evaluând fiecare sarcină decât profesorii mai bine plătiți și (mai târziu) contractanții Upwork și mai bine plătiți. Sursă: https://arxiv.org/pdf/2109.06835.pdf

Din ziua 2 a studiului: lucrătorii individuali (în portocaliu) au petrecut mult mai puțin timp evaluând fiecare sarcină decât profesorii mai bine plătiți și (mai târziu) contractanții Upwork și mai bine plătiți. Sursă: https://arxiv.org/pdf/2109.06835.pdf

Deoarece AMT nu impune nicio limită pentru sarcinile de inteligență umană (HIT) pe care un lucrător individual le poate prelua, “campionii” AMT au apărut, cu reputații profitabile pentru finalizarea unui număr mare de sarcini pe experiment. Pentru a compensa pentru sarcinile acceptate de același lucrător, cercetătorii au măsurat timpul dintre sarcinile HIT consecutive, comparând începutul și sfârșitul fiecărei sarcini HIT. În acest fel, lipsa dintre timpul de lucru raportat de AMT și timpul real petrecut pe sarcină a devenit evident.

Deoarece o astfel de muncă nu poate fi realizată în aceste intervale de timp reduse, cercetătorii au trebuit să compenseze pentru acest lucru:

‘Deoarece este imposibil să citiți cu atenție un paragraf de poveste și să evaluați toate cele patru proprietăți în doar 13 secunde, măsurăm impactul asupra ratingurilor medii atunci când filtrați lucrătorii care petrec prea puțin timp pe HIT… În mod specific, eliminăm judecățile lucrătorilor ale căror timp mediu este sub 40s (care este o bară scăzută), și găsim că, în medie, aproximativ 42% din ratingurile noastre sunt eliminate (variază între 20%-72% în toate experimentele).’

Articolul susține că timpul de lucru real raportat în AMT este “o problemă majoră” de obicei neglijată de cercetătorii care utilizează serviciile.

Îndrumare necesară

Rezultatele sugerează, de asemenea, că lucrătorii AMT nu pot distinge în mod fiabil între textul scris de oameni și textul scris de mașini, cu excepția cazului în care văd ambele texte una lângă alta, ceea ce ar compromite o scenă de evaluare tipică (în care cititorul ar trebui să poată face o judecată pe baza unui singur exemplar de text, “real” sau generat artificial).

Aceptarea casuală a textului artificial de calitate scăzută

Lucrătorii AMT au evaluat constant textul artificial de calitate scăzută GPT pe picior de egalitate cu textul coerent de calitate superioară scris de oameni, în contrast cu profesorii de engleză, care au putut distinge ușor diferența de calitate.

Fără timp de pregătire, zero context

Intrarea în starea de spirit corectă pentru o astfel de sarcină abstractă, cum ar fi evaluarea autenticității, nu vine în mod natural; profesorii de engleză au necesitat 20 de sarcini pentru a-și calibra sensibilitățile față de mediul de evaluare, în timp ce lucrătorii AMT nu primesc, de obicei, niciun “timp de orientare”.

Manipularea sistemului

Raportul susține că timpul total petrecut de lucrătorii AMT pe sarcini individuale este inflatat de lucrătorii care acceptă multiple sarcini simultan și rulează sarcinile în diferite file ale browserului, în loc de a se concentra pe o singură sarcin pentru durata înregistrată a sarcinii.

Țara de origine este importantă

Setările implicite ale AMT nu filtrează lucrătorii după țara de origine, iar raportul notează lucrări anterioare care indică faptul că lucrătorii AMT utilizează VPN-uri pentru a ocoli restricțiile geografice, permițând vorbitorilor non-nativi să se prezinte ca vorbitori nativi (într-un sistem care, poate în mod naiv, echivalează limba maternă a unui lucrător cu locația sa geografică pe baza IP-ului).

Prin urmare, cercetătorii au reexecutat testele de evaluare pe AMT cu filtre care limitează potențialii participanți la țări non-engleză, descoperind că ‘lucrătorii din țări non-engleză au evaluat coerența, relevanța și gramatica… semnificativ mai mică decât lucrătorii identic calificați din țări vorbitoare de engleză’.

Raportul concluzionează:

‘[Evaluatorii] experți, cum ar fi lingviștii sau profesorii de limbă, ar trebui să fie utilizați ori de câte ori este posibil, deoarece aceștia au fost deja instruiți să evalueze textul scris, și nu este mult mai scump…’.

 

Publicat pe 16 septembrie 2021Actualizat pe 18 decembrie 2021: Adăugate etichete

workers from English-speaking countries’. Raportul concluzionează: ‘[Evaluatori] experți, cum ar fi lingviștii sau profesorii de limbă, ar trebui să fie utilizați ori de câte ori este posibil, deoarece aceștia au fost deja instruiți să evalueze textul scris, și nu este mult mai scump…’. Publicat pe 16 septembrie 2021 – Actualizat pe 18 decembrie 2021: Adăugate etichete.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai