Andersons vinkel

Oprettelse af kunstige mekaniske tyrker med forudtrænede sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

En stor del af udviklingen af maskinelæringssystemer afhænger af mærkning af data, hvor hundredvis, ja endda tusindvis af spørgsmål (såsom Er dette et billede af en kat? og Er denne tekst krænket?) skal afgøres for at udvikle autoritative datasæt, som AI-systemer vil blive trænet på.

Selvom vi alle bidrager til denne proces på et eller andet tidspunkt, udføres de fleste af disse mærkningsopgaver for penge af menneskelige arbejdere på rammer som Amazon Mechanical Turk, hvor annotatorer udfører mindre klassificeringsopgaver i en stykkedelsøkonomi.

Modellens udvikling ville være billigere, hvis forudtrænede sprogmodeller (PLM’er) kunne påtage sig nogle af de mere grundlæggende menneskelige intelligensopgaver (HIT’er), som i øjeblikket crowdsources på AMT og lignende platforme.

Nylig forskning fra Tyskland og Huawei foreslår dette i artiklen LMTurk: Few-Shot Learners som Crowdsourcing Workers.

Sprogmodeller, der udfører few-shot-læring

Forfatterne foreslår, at de enklere lag af opgaver, der normalt er rettet mod (menneskelige) tyrker, er analoge med few-shot-læring, hvor et automatiseret rammeværk skal træffe en mini-opgave baseret på et lille antal eksempler, der er givet til det.

De foreslår derfor, at AI-systemer kan lære effektivt fra eksisterende PLM’er, der oprindeligt blev trænet af crowdworkers – at den kerneviden, der er overført fra mennesker til maskiner, effektivt er blevet udført allerede, og at hvor sådan viden er relativt uforanderlig eller empirisk på en eller anden måde, automatiserede sprogmodellrammer potentielt kan udføre disse opgaver selv.

‘Vores grundlæggende idé er, at for en NLP-opgave T, behandler vi few-shot-lærere som ikke-ekspertarbejdere, der ligner crowdsourcing-arbejdere, der annoterer ressourcer for menneskesprogsteknologi. Vi er inspireret af, at vi kan betragte en crowdsourcing-arbejder som en type few-shot-lærer.’

Konsekvenserne omfatter muligheden for, at mange af de sandheder, som fremtidens AI-systemer afhænger af, vil være blevet afledt fra mennesker mange år tidligere, og derefter behandles som forvalideret og udnyttelig information, der ikke længere kræver menneskelig indgriben.

Job for mid-range, semi-performante sprogmodeller

Ud over motivationen til at reducere omkostningerne ved mennesker i løkken, foreslår forskerne, at brugen af ‘mid-range’ PLM’er som sand mekaniske tyrker giver nyttig arbejde for disse ‘også løbende’ systemer, der stadig mere overskygges af overskriftsfanger, hyperskala og dyre sprogmodeller som GPT-3, der er for dyre og overudstyrede til sådanne opgaver.

‘Vores mål i denne artikel er at udvikle metoder, der gør mere effektivt brug af nuværende few-shot-lærere. Dette er afgørende, fordi der er stadig flere enorme few-shot-lærere, der trænes; hvordan man bruger dem effektivt er således et vigtigt spørgsmål. I særdeleshed ønsker vi en alternativ løsning til svært at installere enorme modeller.

‘Samtidig ønsker vi at udnytte PLM’ernes styrker fuldt ud: Deres fleksibilitet sikrer bred anvendelighed på tværs af opgaver; deres enorme viden om sprog og verden ( tilegnet under forudtræning) manifestere sig i dataeffektiviteten af few-shot-lærere, hvilket reducerer arbejdskraft og tidsforbrug i dataannotering.’

Indtil nu har forfatterne argumenteret for, at few-shot-lærere i NLP er blevet behandlet som bortkastede mellemstadier på vej til højt niveau naturlige sprogsystemer, der er langt mere ressourcekrævende, og at sådant arbejde er blevet udført abstrakt og uden hensyn til den mulige nytte af disse systemer.

Metode

Forfatterne tilbyder LMTurk (Sprogmodel som mekanisk tyrk), i en arbejdsgang, hvor input fra denne automatiserede HIT giver mærker til en midterniveau NLP-model.

En grundlæggende konceptmodel for LMTurk. Kilde: https://arxiv.org/pdf/2112.07522.pdf

En grundlæggende konceptmodel for LMTurk. Kilde: https://arxiv.org/pdf/2112.07522.pdf

Dette første iteration afhænger af few-shot menneskeligt mærkede ‘guld’ data, hvor kød-tyrker har annoteret mærker for et begrænset antal opgaver, og mærkerne er blevet vurderet godt, enten via direkte menneskelig oversigt eller gennem konsensusafstemning. Konsekvensen for dette schema er, at grene eller udviklinger fra dette menneskeligt grundlag ikke behøver yderligere menneskelig input længere fremme.

Selvom forfatterne foreslår yderligere eksperimenter med senere hybridmodeller (hvor menneskelig input vil være til stede, men kraftigt reduceret), gjorde de det ikke, for formålet med deres forskning, at pit LMTurk-modeller mod tilsvarende resultater fra menneskeligt genererede HIT-arbejdere, da de mente, at de guldmærkede data i sig selv er ‘menneskelig input’.

PLM’en, der er designet til at udføre tyrk-operationer, blev tilpasset til opgaven ved P-Tuning, en metode offentliggjort af forskere fra Kina i 2021, som foreslog trænelige kontinuerte prompt-embeddings for at forbedre præstationsniveauet af GPT-3-lignende modeller på naturligt sprogforståelsesopgaver (NLU).

P-Tuning forsøger at dykke GPT-lignende modellers prædictionskraft og deres tilsyneladende konceptuelle forståelse af sprog, ved at inkorporere indlejrede pseudo-prompts. I dette tilfælde er startspørgsmålet 'Hovedstaden i Storbritannien er en [x]'

P-Tuning forsøger at dykke GPT-lignende modellers prædictionskraft og deres tilsyneladende konceptuelle forståelse af sprog, ved at inkorporere indlejrede pseudo-prompts. I dette tilfælde er startspørgsmålet ‘Hovedstaden i Storbritannien er en [x]'”. Kilde: https://arxiv.org/pdf/2103.10385.pdf

Data og arkitektur

LMTurk blev evaluueret på fem datasæt: to fra Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); og Corpus of Linguistic Acceptability (CoLA).

For sin større model bruger LMTurk den offentligt tilgængelige PLM ALBERT-XXLarge-v2 (AXLV2) som kilde til omdannelse til en automatiseret tyrk. Modellen har 223 millioner parametre (i modsætning til 175 milliarder parametre i GPT-3). AXLV2, observerer forfatterne, har vist sig i stand til at overgå større skala modeller som 334M BERT-Large.

For en mere agil, letvægts- og edge-udfyldelig model bruger projektet TinyBERT-General-4L-312D (TBG), der har 14,5 millioner parametre med en præstation, der er sammenlignelig med BERT-base (der har 110 millioner parametre).

Prompt-aktiveret træning fandt sted på PyTorch og HuggingFace til AXLV2 over 100 batch-trin med en batch-størrelse på 13, på en læringsrate på 5e-4, med lineær nedgang. Hver eksperiment blev startet med tre forskellige tilfældige frø.

Resultater

LMTurk-projektet kører diverse modeller mod så mange specifikke undersektorer af NLP, at de komplekse resultater af forskernes eksperimenter ikke er lette at reducere til empirisk bevis for, at LMTurk i sig selv tilbyder en brugbar tilgang til genbrug af historisk, menneskeligt oprindelse few-shot-læringsscenarier.

Men til evalueringens formål sammenligner forfatterne deres metode med to tidligere arbejder: Udnyttelse af luknings-spørgsmål til few-shot-tekstklassifikation og naturligt sprog-inferens af tyske forskere Timo Schick og Hinrich Schutze; og resultater fra Prompt-Based Auto, præsenteret i Gør forudtrænede sprogmodeller bedre few-shot-lærere af Gao, Chen og Fisch (fra Princeton og MIT).

Resultater fra LMTurk-eksperimenterne, hvor forskerne rapporterer 'sammenlignelige' resultater.

Resultater fra LMTurk-eksperimenterne, hvor forskerne rapporterer ‘sammenlignelige’ resultater.

I korthed tilbyder LMTurk en relativt lovende linje af undersøgelser for forskere, der søger at indlejre og fastholde guldmærkede menneskeligt oprindelige data i udviklende, midt-kompleksitetssprogmodeller, hvor automatiserede systemer erstatter menneskelig input.

Som med den relativt lille mængde tidligere arbejde på dette felt, afhænger den centrale koncept af, at de oprindelige menneskelige data er uforanderlige, og antagelsen af, at tidsfaktorer – som kan repræsentere betydelige hindringer for NLP-udvikling – ikke vil kræve yderligere menneskelig indgriben, når maskin-linjen udvikler sig.

 

Originalt publiceret 30. december 2022

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]