Andersons vinkel

Skapande av artificiella mekaniska turkar med förtränade språkmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En stor del av utvecklingen av maskinlärningssystem beror på märkning av data, där hundratals, till och med tusentals frågor (såsom Är detta en bild av en katt? och Är denna text stötande?) måste lösas för att utveckla auktoritativa datamängder som AI-system kommer att tränas på.

Även om vi alla bidrar till denna process vid någon tidpunkt, utförs de flesta av dessa märkningsuppgifter för pengar av mänskliga arbetare i ramverk som Amazon Mechanical Turk, där annotatorer slutför mindre klassificeringsuppgifter i en styckearbetsekonomi.

Modellutveckling skulle vara billigare om förtränade språkmodeller (PLM) kunde själva utföra några av de mer grundläggande mänskliga intelligensuppgifterna (HIT) som för närvarande crowdsourcas på AMT och liknande plattformar.

Nylig forskning från Tyskland och Huawei föreslår detta, i artikeln LMTurk: Few-Shot Learners som crowdsourcing-arbetare.

Språkmodeller som utför few-shot-lärande

Författarna föreslår att de enklare uppgifter som vanligtvis riktas mot (mänskliga) Turk-arbetare är analogiska med few-shot-lärande, där ett automatiserat ramverk måste fatta ett mini-beslut baserat på ett litet antal exempel som ges till det.

De föreslår därför att AI-system kan lära sig effektivt från befintliga PLM som ursprungligen tränades av crowdworkers – att den grundläggande kunskapen som överförs från människor till maskiner har i princip redan skett, och att där sådan kunskap är relativt oföränderlig eller empirisk på något sätt, kan automatiserade språkmodellramverk potentiellt utföra dessa uppgifter själva.

‘Vår grundläggande idé är att, för en NLP-uppgift T, behandla few-shot-lärande som icke-experter, liknande crowdsourcing-arbetare som annoterar resurser för mänsklig språkteknologi. Vi inspireras av det faktum att vi kan se en crowdsourcing-arbetare som en typ av few-shot-lärande.’

Konsekvenserna inkluderar möjligheten att många av de sanningar som AI-system i framtiden förlitar sig på kommer att ha härletts från människor för flera år sedan, och därefter behandlats som förvaliderad och utnyttjbar information som inte längre kräver mänskligt ingripande.

Jobb för medelstora, semiperformerande språkmodeller

Förutom motivationen att minska kostnaderna för mänskligt ingripande, föreslår forskarna att användning av “medelstora” PLM som riktiga mekaniska turkar erbjuder användbart arbete för dessa “även-ran”-system, som alltmer hamnar i skuggan av rubrikskapande, hyperskala och dyra språkmodeller som GPT-3, som är för dyra och överutrustade för sådana uppgifter.

‘Vårt mål i denna artikel är att utveckla metoder som gör mer effektivt användande av nuvarande few-shot-lärande. Detta är avgörande eftersom ett ökande antal gigantiska few-shot-lärande tränas; hur man använder dem effektivt är alltså en viktig fråga. I synnerhet vill vi ha ett alternativ till svåra att distribuera stora modeller.

‘Samtidigt vill vi ta fullständig nytta av PLM: s styrkor: Deras mångsidighet säkerställer bred tillämpbarhet över uppgifter; deras enorma kunskapslager om språk och världen (lärt under förträning) manifest i dataeffektiviteten hos few-shot-lärande, vilket minskar arbete och tidsåtgång i dataannotering.’

Hittills har few-shot-lärande i NLP behandlats som engångsstadier på vägen till högnivåspråksystem som är mycket mer resurskrävande, och att ett sådant arbete har utförts abstrakt och utan hänsyn till den möjliga nyttan av dessa system.

Metod

Författarna erbjuder LMTurk (Language Model som mekanisk Turk), i en arbetsflöde där indata från denna automatiserade HIT tillhandahåller etiketter för en medelnivå NLP-modell.

En grundläggande konceptmodell för LMTurk. Källa: https://arxiv.org/pdf/2112.07522.pdf

En grundläggande konceptmodell för LMTurk. Källa: https://arxiv.org/pdf/2112.07522.pdf

Denna första iteration förlitar sig på few-shot mänskligt märkta “guld”-data, där kött- och blod-turkar har annoterat etiketter för ett begränsat antal uppgifter, och etiketterna har poängsatts väl, antingen via direkt mänsklig tillsyn eller genom konsensusröstning. Implikationen för detta schema är att grenar eller utvecklingar från denna mänskligt grundade startpunkt kanske inte behöver ytterligare mänskligt ingripande längre fram.

Även om författarna föreslår ytterligare experiment med senare hybridmodeller (där mänskligt ingripande skulle vara närvarande, men kraftigt minskat), gjorde de inte, för ändamålet med sin forskning, LMTurk-modeller mot motsvarande resultat från mänskligt genererade HIT-arbetare, med tanke på att de guld-märkta datan i sig är “mänskligt ingripande”.

PLM som utformades för att utföra Turk-åtgärder anpassades för uppgiften med P-Tuning, en metod publicerad av forskare från Kina 2021, som föreslog tränbara kontinuerliga prompt-inkapslingar för att förbättra prestandan hos GPT-3-liknande modeller på naturligt språkförståelse (NLU)-uppgifter.

P-Tuning försöker fördjupa en GPT-liknande modells prediktiva kraft och dess utseende av konceptuell förståelse av språk, genom att inkorporera inkapslade pseudo-prompt. I detta fall är startfrågan 'Storbritanniens huvudstad är en [x]'

P-Tuning försöker fördjupa en GPT-liknande modells prediktiva kraft och dess utseende av konceptuell förståelse av språk, genom att inkorporera inkapslade pseudo-prompt. I detta fall är startfrågan ‘Storbritanniens huvudstad är en [x]'”. Källa: https://arxiv.org/pdf/2103.10385.pdf

Data och arkitektur

LMTurk utvärderades på fem datamängder: två från Stanford Sentiment Treebank; AG: s Nyhetskorpus; Erkännande av textuell implikation (RTE); och Korpus av lingvistisk acceptabilitet (CoLA).

För sin större modell använder LMTurk den offentligt tillgängliga PLM ALBERT-XXLarge-v2 (AXLV2) som källmodell för omvandling till en automatiserad Turk. Modellen har 223 miljoner parametrar (i jämförelse med 175 miljarder parametrar i GPT-3). AXLV2, observerar författarna, har visat sig kunna överträffa högre skala-modeller som 334M BERT-Large.

För en mer smidig, lätt och edge-distribuerbar modell använder projektet TinyBERT-General-4L-312D (TBG), som har 14,5 miljoner parametrar med prestanda jämförbar med BERT-base (som har 110 miljoner parametrar).

Prompt-aktiverad utbildning ägde rum på PyTorch och HuggingFace för AXLV2 under 100 batch-steg med en batch-storlek på 13, med en inlärningshastighet på 5e-4, med linjär nedgång. Varje experiment startades med tre olika slumpmässiga frön.

Resultat

LMTurk-projektet kör olika modeller mot så många specifika undersektorer av NLP att resultaten från forskarnas experiment inte är lätta att reducera till empirisk bevisning för att LMTurk i sig erbjuder en livskraftig ansats för återanvändning av historiska, mänskligt ursprungliga HIT-liknande few-shot-lärandescenarier.

Men för utvärderingsändamål jämför författarna sin metod med två tidigare arbeten: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference av tyska forskare Timo Schick och Hinrich Schutze; och resultat från Prompt-Based Auto, presenterat i Making Pre-trained Language Models Better Few-shot Learners av Gao, Chen och Fisch (från Princeton och MIT).

Resultat från LMTurk-experimenten, med forskarna som rapporterar 'jämförbar' prestanda.

Resultat från LMTurk-experimenten, med forskarna som rapporterar ‘jämförbar’ prestanda.

I korthet erbjuder LMTurk en relativt lovande ansats för forskare som söker att infoga och förankra guld-märkt, mänskligt ursprunglig data i utvecklande, medelkomplexa språkmodeller där automatiserade system står i för mänskligt ingripande.

Som med den relativt lilla mängden tidigare arbete i detta område, bygger den centrala konceptet på oföränderligheten hos den ursprungliga mänskliga datan, och antagandet att tidsfaktorer – som kan representera betydande hinder för NLP-utveckling – inte kommer att kräva ytterligare mänskligt ingripande när den maskinbaserade linjen utvecklas.

 

Ursprungligen publicerad den 30 december 2022

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]