Unghiul lui Anderson
Crearea de Turci Mecanici Artificiali cu Modele de Limbaj Preantrenate

O parte semnificativă a dezvoltării sistemelor de învățare automată depinde de etichetarea datelor, unde sute, chiar mii de întrebări (cum ar fi Este această imagine a unui pisic? și Este acest text ofensator?) trebuie rezolvate pentru a dezvolta seturi de date autoritative pe care sistemele de inteligență artificială vor fi antrenate.
Deși noi toți contribuim la acest proces la un moment dat, majoritatea acestor sarcini de etichetare sunt efectuate pentru bani de către lucrători umani în cadrul unor platforme precum Amazon Mechanical Turk, unde annotatorii completează sarcini minore de clasificare într-o economie de tip piece-work.
Dezvoltarea modelului ar fi mai ieftină dacă modelele de limbaj preantrenate (PLM) ar putea să îndeplinească ele însele unele dintre sarcinile mai simple de inteligență umană (HIT) care sunt în prezent externalizate la AMT și platforme similare.
Cercetări recente din Germania și Huawei propun acest lucru, în articolul LMTurk: Învățători cu few-shot ca lucrători de crowdsourcing.
Modele de limbaj care efectuează învățarea few-shot
Autorii sugerează că straturile mai simple de sarcini care sunt de obicei îndreptate către (lucrători umani) Turk sunt analoge învățării few-shot, unde un cadru automatizat trebuie să decidă o mini-sarcină pe baza unui număr mic de exemple oferite acestuia.
Ei propun, prin urmare, că sistemele de inteligență artificială pot învăța eficient din modelele de limbaj preantrenate existente care au fost inițial antrenate de lucrători de crowdsourcing – că cunoașterea de bază transmisă de la oameni la mașini a fost deja realizată, și că acolo unde această cunoaștere este relativ imutabilă sau empirică într-un anumit fel, cadrul automatizat de model de limbaj poate să îndeplinească aceste sarcini de la sine.
‘Ideea noastră de bază este că, pentru o sarcină de NLP T, tratăm învățătorii few-shot ca lucrători non-experți, asemănători cu lucrătorii de crowdsourcing care anotează resurse pentru tehnologia limbajului uman. Suntem inspirați de faptul că putem considera un lucrător de crowdsourcing ca un tip de învățător few-shot.’
Implicațiile includ posibilitatea ca multe dintre adevărurile de bază pe care sistemele de inteligență artificială ale viitorului depind de ele să fi fost derivate de la oameni cu mulți ani înainte, și ulterior tratate ca informații prevalidate și exploatabile care nu mai necesită intervenție umană.
Locuri de muncă pentru modele de limbaj semi-performante de nivel mediu
Pe lângă motivarea de a reduce costul oamenilor din buclă, cercetătorii sugerează că utilizarea modelelor de limbaj preantrenate de nivel mediu ca adevărați Turci mecanici oferă un scop util pentru aceste sisteme “care au rămas în urmă”, care sunt din ce în ce mai mult umbrite de modele de limbaj cu scală largă și costisitoare, cum ar fi GPT-3, care sunt prea scumpe și supradimensionate pentru astfel de sarcini.
‘Scopul nostru în acest articol este să concepem metode care să facă uz mai eficient de învățătorii few-shot actuali. Acest lucru este crucial, deoarece un număr tot mai mare de învățători few-shot gigantici sunt antrenați; cum să îi utilizăm eficient este, prin urmare, o întrebare importantă. În special, dorim o alternativă la modelele uriașe greu de implementat.’
‘În același timp, dorim să profităm pe deplin de punctele forte ale PLM-urilor: Versatilitatea lor asigură o aplicabilitate largă în sarcini; stocul vast de cunoaștere despre limbaj și lume (învățat în preantrenare) se manifestă în eficiența învățării few-shot, reducând consumul de muncă și timp în anotarea datelor.’
Până în prezent, autorii argumentează că, în domeniul NLP, învățătorii few-shot au fost tratați ca etape interstițiale de abandon pe drumul către sisteme de limbaj natural de nivel înalt, care sunt mult mai intensive din punct de vedere al resurselor, și că un astfel de lucru a fost realizat în mod abstract și fără a lua în considerare utilitatea posibilă a acestor sisteme.
Metodă
Autorii oferă LMTurk (Model de limbaj ca turc mecanic), într-un flux de lucru în care intrarea din acest HIT automatizat oferă etichete pentru un model NLP de nivel mediu.

Un model de bază conceptual pentru LMTurk. Sursă: https://arxiv.org/pdf/2112.07522.pdf
Această primă iterație se bazează pe date “aur” etichetate de către oameni, unde “turcii” din carne și oase au anotat etichete pentru un număr limitat de sarcini, și etichetele au fost evaluate bine, fie prin supraveghere umană directă, fie prin votul de consens. Implicația pentru acest schema este că ramurile sau dezvoltările din acest punct de plecare bazat pe oameni nu ar putea necesita intrări umane suplimentare pe viitor.
Deși autorii sugerează experimente ulterioare cu modele hibride (unde intrarea umană ar fi prezentă, dar mult redusă), ei nu au, în scopul cercetării lor, comparat modelele LMTurk cu rezultate echivalente din partea lucrătorilor umani, considerând că datele etichetate “aur” sunt ele însele “intrări umane”.
Modelul de limbaj preantrenat destinat să efectueze operațiuni de tip Turk a fost adaptat pentru sarcină prin P-Tuning, o metodă publicată de cercetători din China în 2021, care a propus încorporări de prompt continuă antrenabile pentru a îmbunătăți performanța modelului GPT-3 pe sarcini de înțelegere a limbajului natural (NLU).
![P-Tuning încearcă să îmbunătățească puterea predictivă a unui model de tip GPT și aparența înțelegerii conceptuale a limbajului, prin încorporarea de pseudo-prompturi încorporate. În acest caz, întrebarea de start este 'Capitala Marii Britanii este un [x]'.](https://www.unite.ai/wp-content/uploads/2021/12/p-tuning.jpg)
P-Tuning încearcă să îmbunătățească puterea predictivă a unui model de tip GPT și aparența înțelegerii conceptuale a limbajului, prin încorporarea de pseudo-prompturi încorporate. Sursă: https://arxiv.org/pdf/2103.10385.pdf
Date și Arhitectură
LMTurk a fost evaluat pe cinci seturi de date: două din Stanford Sentiment Treebank; Corpusul de știri AG; Recunoașterea implicării textuale (RTE); și Corpusul de acceptabilitate lingvistică (CoLA).
Pentru modelul său mai mare, LMTurk utilizează modelul de limbaj preantrenat disponibil public ALBERT-XXLarge-v2 (AXLV2) ca model sursă pentru conversie într-un Turk automatizat. Modelul are 223 de milioane de parametri (în comparație cu 175 de miliarde de parametri din GPT-3). AXLV2, observă autorii, s-a dovedit a fi capabil să depășească modele de scară mai mare, cum ar fi BERT-Large cu 334M parametri.
Pentru un model mai agil, ușor și destinat pentru implementare pe margine, proiectul utilizează TinyBERT-General-4L-312D (TBG), care are 14,5 milioane de parametri, cu o performanță comparabilă cu BERT-base (care are 110 milioane de parametri).
Antrenarea cu prompt a avut loc pe PyTorch și HuggingFace pentru AXLV2, pe 100 de pași de lot, cu o dimensiune a lotului de 13, pe o rată de învățare de 5e-4, utilizând decădere liniară. Fiecare experiment a fost inițiat cu trei semințe aleatorii diferite.
Rezultate
Proiectul LMTurk rulează diverse modele împotriva atât de multor subsectoare specifice de NLP, încât rezultatele complexe ale experimentelor cercetătorilor nu sunt ușor de redus la dovezi empirice care să arate că LMTurk oferă în sine o abordare viabilă pentru reutilizarea scenariilor de învățare few-shot istorice, de origine umană.
Cu toate acestea, în scopul evaluării, autorii compară metoda lor cu două lucrări anterioare: Exploatând întrebările de tip Cloze pentru clasificarea textului few-shot și inferența limbajului natural de către cercetătorii germani Timo Schick și Hinrich Schutze; și rezultatele din Prompt-Based Auto, prezentate în Crearea unor modele de limbaj preantrenate mai bune pentru învățarea few-shot de Gao, Chen și Fisch (din Princeton și MIT).

Rezultatele experimentelor LMTurk, cercetătorii raportând o ‘performanță comparabilă’.
În sinteză, LMTurk oferă o linie de cercetare relativ promițătoare pentru cercetătorii care caută să încorporeze și să închidă date etichetate “aur” de origine umană în modele de limbaj de complexitate medie, evoluate, unde sistemele automate înlocuiesc intrările umane.
La fel ca și în cazul cantității mici de lucrări anterioare în acest domeniu, conceptul central se bazează pe imutabilitatea datelor umane originale și pe presupunerea că factorii temporali – care pot reprezenta obstacole semnificative pentru dezvoltarea NLP – nu vor necesita intervenție umană suplimentară pe măsură ce linia de mașini evoluează.
Publicat inițial pe 30 decembrie 2022












