Andersonův úhel

Vytvoření umělých mechanických Turků s předtrénovanými jazykovými modely

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velká část vývoje systémů strojového učení závisí na označení dat, kde musí být zodpovězeny stovky, ba dokonce tisíce otázek (jako například Je toto obrázek kočky? a Je tento text urážlivý?), aby se vytvořily autoritativní datové sady, na kterých budou systémy umělé inteligence trénovány.

Ačkoli my všichni přispíváme k tomuto procesu někdy, většina těchto úkolů označení je prováděna za peníze lidskými pracovníky v rámci systémů, jako je Amazon Mechanical Turk, kde anotátoři dokončují malé úkoly klasifikace v ekonomice na základě kusové práce.

Vývoj modelů by byl levnější, kdyby předtrénované jazykové modely (PLM) mohly samy o sobě provádět některé z více základních úkolů lidské inteligence (HIT), které jsou目前 crowdsourcovány na AMT a podobných platformách.

Nedávný výzkum z Německa a Huawei navrhuje toto, v článku LMTurk: Few-Shot Learners jako crowdsourcing pracovníci.

Jazykové modely provádějící few-shot učení

Autoři navrhují, že jednodušší úkoly, které jsou obvykle zaměřeny na (lidské) Turky, jsou analogické k few-shot učení, kde automatizovaný rámec musí rozhodnout o mini-úkolu na základě malého počtu příkladů, které mu byly dány.

Navrhují, že systémy umělé inteligence mohou efektivně učit z existujících PLM, které byly původně trénovány crowworkery – že základní znalosti, které byly předány z lidí do strojů, byly již účinně provedeny, a že tam, kde je tato znalost relativně neměnná nebo empirická, automatizované rámce jazykových modelů mohou potenciálně provádět tyto úkoly samy o sobě.

‘Naše základní myšlenka je, že pro úkol NLP T, zacházíme s few-shot learners jako s neexpertními pracovníky, podobnými crowworkery, kteří anotují zdroje pro lidskou jazykovou technologii. Jsme inspirováni tím, že můžeme crowworkera považovat za typ few-shot learnera.’

Implikace zahrnují možnost, že mnoho z ground truth, na kterých budou záviset systémy umělé inteligence budoucnosti, bude odvozeno od lidí již několik let dříve, a poté bude považováno za předvalidované a využitelné informace, které již nevyžadují lidskou intervenci.

Práce pro mid-range, semi-performantní jazykové modely

Kromě motivace snížit náklady na lidskou intervenci navrhují výzkumníci, že použití “mid-range” PLM jako skutečných Mechanical Turků poskytuje užitečnou práci pro tyto “also ran” systémy, které jsou stále více zastíněny hlavními, hyperskalními a nákladnými jazykovými modely, jako je GPT-3, které jsou příliš drahé a nadměrně dimenzované pro takové úkoly.

‘Naším cílem v tomto článku je navrhnout metody, které využijí současné few-shot learners efektivněji. To je důležité, protože je trénováno stále více gigantických few-shot learners; jak je efektivně využít, je tak důležité. Konkrétně chceme alternativu k obtížně nasaditelným velkým modelům.

‘Současně chceme využít plných sil PLM: Jejich všestrannost zajišťuje širokou aplikovatelnost napříč úkoly; jejich obrovský sklad znalostí o jazyce a světě (naučený během předtrénování) se projevuje v datech efektivity few-shot learners, snižuje pracovní a časovou spotřebu při anotaci dat.’

Do současnosti argumentují autoři, že few-shot learners v NLP byly považovány za odstranitelné mezistupně na cestě k vyšším úrovním systémů přirozeného jazyka, které jsou mnohem více náročné na zdroje, a že taková práce byla provedena abstraktně a bez ohledu na možnou užitečnost těchto systémů.

Metoda

Autoři nabízejí LMTurk (Language Model jako Mechanical Turk), v pracovním postupu, kde vstup z tohoto automatizovaného HIT poskytuje značky pro mid-level NLP model.

Základní konceptový model pro LMTurk. Zdroj: https://arxiv.org/pdf/2112.07522.pdf

Základní konceptový model pro LMTurk. Zdroj: https://arxiv.org/pdf/2112.07522.pdf

Tato první iterace závisí na few-shot lidsky označených “zlatých” datech, kde lidské Turci označili značky pro omezený počet úkolů, a značky byly dobře ohodnoceny, buď prostřednictvím přímé lidské kontroly nebo prostřednictvím konsensuálního hlasování. Implikace pro tento schema je, že odbočky nebo vývoj z tohoto lidsky založeného startovního bodu nemusí vyžadovat další lidskou intervenci na cestě.

Ačkoli autoři navrhují další experimenty s pozdějšími hybridními modely (kde by lidská intervence byla přítomna, ale výrazně snížena), nezahrnuli do svého výzkumu srovnání LMTurk modelů s ekvivalentními výsledky z lidsky generovaných HIT pracovníků, s ohledem na to, že zlatě označená data jsou sama o sobě “lidská intervence”.

PLM navržen pro provedení Turk operací byl přizpůsoben pro úkol pomocí P-Tuning, metody publikované výzkumníky z Číny v roce 2021, která navrhla trénovatelné kontinuální prompt embeddings pro zlepšení výkonu GPT-3-style modelů na úkolech přirozeného jazykového porozumění (NLU).

P-Tuning se snaží prohloubit předpovědní sílu GPT-style modelu a jeho zdání konceptuálního porozumění jazyka, integrujícího embedded pseudo-prompt. V tomto případě je startovací dotaz 'Hlavní město Británie je [x]'.

P-Tuning se snaží prohloubit předpovědní sílu GPT-style modelu a jeho zdání konceptuálního porozumění jazyka, integrujícího embedded pseudo-prompt. V tomto případě je startovací dotaz ‘Hlavní město Británie je [x]’. Zdroj: https://arxiv.org/pdf/2103.10385.pdf

Data a architektura

LMTurk byl vyhodnocen na pěti datech: dvou z Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); a Corpus of Linguistic Acceptability (CoLA).

Pro svůj větší model LMTurk používá veřejně dostupný PLM ALBERT-XXLarge-v2 (AXLV2) jako zdroj modelu pro konverzi na automatizovaného Turka. Model má 223 milionů parametrů (oproti 175 miliardám parametrů v GPT-3). AXLV2, autoři pozorují, prokázal se jako schopný překonat výkon větších modelů, jako je 334M BERT-Large.

Pro více agilní, lehký a edge-deployable model projekt používá TinyBERT-General-4L-312D (TBG), který má 14,5 milionu parametrů s výkonem srovnatelným s BERT-base (který má 110 milionů parametrů).

Prompt-enabled trénování proběhlo na PyTorch a HuggingFace pro AXLV2 po 100 dávkách kroků při dávkové velikosti 13, při learning rate 5e-4, s lineárním poklesem. Každý experiment byl zahájen se třemi různými náhodnými semeny.

Výsledky

Projekt LMTurk běží různé modely proti mnoha konkrétním sub-sektorům NLP, takže komplexní výsledky experimentů výzkumníků nejsou snadno redukovatelné na empirické důkazy, že LMTurk nabízí sám o sobě životaschopný přístup k opětovnému použití historických, lidsky pocházejících HIT-style few shot learning scénářů.

Však pro vyhodnocovací účely autoři srovnávají svou metodu se dvěma předchozími pracemi: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference od německých výzkumníků Timo Schicka a Hinricha Schütze; a výsledky z Prompt-Based Auto, uvedené v Making Pre-trained Language Models Better Few-shot Learners od Gao, Chen a Fisch (z Princetonu a MIT).

Výsledky z experimentů LMTurk, s výzkumníky hlásajícími 'srovnatelný' výkon.

Výsledky z experimentů LMTurk, s výzkumníky hlásajícími ‘srovnatelný’ výkon.

Stručně řečeno, LMTurk nabízí relativně slibnou linii dotazů pro výzkumníky, kteří hledají zabudovat a zvěčnit zlatě označená lidsky pocházející data do evolučních, mid-komplexních jazykových modelů, kde automatizované systémy nahrazují lidskou intervenci.

Jako u relativně malého množství předchozích prací v tomto oboru, centrální koncept závisí na neměnnosti původních lidských dat a na předpokladu, že časové faktory – které mohou představovat významné překážky pro vývoj NLP – nebudou vyžadovat další lidskou intervenci, jak se bude linie strojů vyvíjet.

 

Originálně publikováno 30. prosince 2022

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]