Andersonův úhel
Vytvoření umělých mechanických Turků s předtrénovanými jazykovými modely

Velká část vývoje systémů strojového učení závisí na označení dat, kde musí být zodpovězeny stovky, ba dokonce tisíce otázek (jako například Je toto obrázek kočky? a Je tento text urážlivý?), aby se vytvořily autoritativní datové sady, na kterých budou systémy umělé inteligence trénovány.
Ačkoli my všichni přispíváme k tomuto procesu někdy, většina těchto úkolů označení je prováděna za peníze lidskými pracovníky v rámci systémů, jako je Amazon Mechanical Turk, kde anotátoři dokončují malé úkoly klasifikace v ekonomice na základě kusové práce.
Vývoj modelů by byl levnější, kdyby předtrénované jazykové modely (PLM) mohly samy o sobě provádět některé z více základních úkolů lidské inteligence (HIT), které jsou目前 crowdsourcovány na AMT a podobných platformách.
Nedávný výzkum z Německa a Huawei navrhuje toto, v článku LMTurk: Few-Shot Learners jako crowdsourcing pracovníci.
Jazykové modely provádějící few-shot učení
Autoři navrhují, že jednodušší úkoly, které jsou obvykle zaměřeny na (lidské) Turky, jsou analogické k few-shot učení, kde automatizovaný rámec musí rozhodnout o mini-úkolu na základě malého počtu příkladů, které mu byly dány.
Navrhují, že systémy umělé inteligence mohou efektivně učit z existujících PLM, které byly původně trénovány crowworkery – že základní znalosti, které byly předány z lidí do strojů, byly již účinně provedeny, a že tam, kde je tato znalost relativně neměnná nebo empirická, automatizované rámce jazykových modelů mohou potenciálně provádět tyto úkoly samy o sobě.
‘Naše základní myšlenka je, že pro úkol NLP T, zacházíme s few-shot learners jako s neexpertními pracovníky, podobnými crowworkery, kteří anotují zdroje pro lidskou jazykovou technologii. Jsme inspirováni tím, že můžeme crowworkera považovat za typ few-shot learnera.’
Implikace zahrnují možnost, že mnoho z ground truth, na kterých budou záviset systémy umělé inteligence budoucnosti, bude odvozeno od lidí již několik let dříve, a poté bude považováno za předvalidované a využitelné informace, které již nevyžadují lidskou intervenci.
Práce pro mid-range, semi-performantní jazykové modely
Kromě motivace snížit náklady na lidskou intervenci navrhují výzkumníci, že použití “mid-range” PLM jako skutečných Mechanical Turků poskytuje užitečnou práci pro tyto “also ran” systémy, které jsou stále více zastíněny hlavními, hyperskalními a nákladnými jazykovými modely, jako je GPT-3, které jsou příliš drahé a nadměrně dimenzované pro takové úkoly.
‘Naším cílem v tomto článku je navrhnout metody, které využijí současné few-shot learners efektivněji. To je důležité, protože je trénováno stále více gigantických few-shot learners; jak je efektivně využít, je tak důležité. Konkrétně chceme alternativu k obtížně nasaditelným velkým modelům.
‘Současně chceme využít plných sil PLM: Jejich všestrannost zajišťuje širokou aplikovatelnost napříč úkoly; jejich obrovský sklad znalostí o jazyce a světě (naučený během předtrénování) se projevuje v datech efektivity few-shot learners, snižuje pracovní a časovou spotřebu při anotaci dat.’
Do současnosti argumentují autoři, že few-shot learners v NLP byly považovány za odstranitelné mezistupně na cestě k vyšším úrovním systémů přirozeného jazyka, které jsou mnohem více náročné na zdroje, a že taková práce byla provedena abstraktně a bez ohledu na možnou užitečnost těchto systémů.
Metoda
Autoři nabízejí LMTurk (Language Model jako Mechanical Turk), v pracovním postupu, kde vstup z tohoto automatizovaného HIT poskytuje značky pro mid-level NLP model.

Základní konceptový model pro LMTurk. Zdroj: https://arxiv.org/pdf/2112.07522.pdf
Tato první iterace závisí na few-shot lidsky označených “zlatých” datech, kde lidské Turci označili značky pro omezený počet úkolů, a značky byly dobře ohodnoceny, buď prostřednictvím přímé lidské kontroly nebo prostřednictvím konsensuálního hlasování. Implikace pro tento schema je, že odbočky nebo vývoj z tohoto lidsky založeného startovního bodu nemusí vyžadovat další lidskou intervenci na cestě.
Ačkoli autoři navrhují další experimenty s pozdějšími hybridními modely (kde by lidská intervence byla přítomna, ale výrazně snížena), nezahrnuli do svého výzkumu srovnání LMTurk modelů s ekvivalentními výsledky z lidsky generovaných HIT pracovníků, s ohledem na to, že zlatě označená data jsou sama o sobě “lidská intervence”.
PLM navržen pro provedení Turk operací byl přizpůsoben pro úkol pomocí P-Tuning, metody publikované výzkumníky z Číny v roce 2021, která navrhla trénovatelné kontinuální prompt embeddings pro zlepšení výkonu GPT-3-style modelů na úkolech přirozeného jazykového porozumění (NLU).
![P-Tuning se snaží prohloubit předpovědní sílu GPT-style modelu a jeho zdání konceptuálního porozumění jazyka, integrujícího embedded pseudo-prompt. V tomto případě je startovací dotaz 'Hlavní město Británie je [x]'.](https://www.unite.ai/wp-content/uploads/2021/12/p-tuning.jpg)
P-Tuning se snaží prohloubit předpovědní sílu GPT-style modelu a jeho zdání konceptuálního porozumění jazyka, integrujícího embedded pseudo-prompt. V tomto případě je startovací dotaz ‘Hlavní město Británie je [x]’. Zdroj: https://arxiv.org/pdf/2103.10385.pdf
Data a architektura
LMTurk byl vyhodnocen na pěti datech: dvou z Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); a Corpus of Linguistic Acceptability (CoLA).
Pro svůj větší model LMTurk používá veřejně dostupný PLM ALBERT-XXLarge-v2 (AXLV2) jako zdroj modelu pro konverzi na automatizovaného Turka. Model má 223 milionů parametrů (oproti 175 miliardám parametrů v GPT-3). AXLV2, autoři pozorují, prokázal se jako schopný překonat výkon větších modelů, jako je 334M BERT-Large.
Pro více agilní, lehký a edge-deployable model projekt používá TinyBERT-General-4L-312D (TBG), který má 14,5 milionu parametrů s výkonem srovnatelným s BERT-base (který má 110 milionů parametrů).
Prompt-enabled trénování proběhlo na PyTorch a HuggingFace pro AXLV2 po 100 dávkách kroků při dávkové velikosti 13, při learning rate 5e-4, s lineárním poklesem. Každý experiment byl zahájen se třemi různými náhodnými semeny.
Výsledky
Projekt LMTurk běží různé modely proti mnoha konkrétním sub-sektorům NLP, takže komplexní výsledky experimentů výzkumníků nejsou snadno redukovatelné na empirické důkazy, že LMTurk nabízí sám o sobě životaschopný přístup k opětovnému použití historických, lidsky pocházejících HIT-style few shot learning scénářů.
Však pro vyhodnocovací účely autoři srovnávají svou metodu se dvěma předchozími pracemi: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference od německých výzkumníků Timo Schicka a Hinricha Schütze; a výsledky z Prompt-Based Auto, uvedené v Making Pre-trained Language Models Better Few-shot Learners od Gao, Chen a Fisch (z Princetonu a MIT).

Výsledky z experimentů LMTurk, s výzkumníky hlásajícími ‘srovnatelný’ výkon.
Stručně řečeno, LMTurk nabízí relativně slibnou linii dotazů pro výzkumníky, kteří hledají zabudovat a zvěčnit zlatě označená lidsky pocházející data do evolučních, mid-komplexních jazykových modelů, kde automatizované systémy nahrazují lidskou intervenci.
Jako u relativně malého množství předchozích prací v tomto oboru, centrální koncept závisí na neměnnosti původních lidských dat a na předpokladu, že časové faktory – které mohou představovat významné překážky pro vývoj NLP – nebudou vyžadovat další lidskou intervenci, jak se bude linie strojů vyvíjet.
Originálně publikováno 30. prosince 2022












