Andersons vinkel
Opprettelse av en GPT-liknende språkmodell for ett enkelt spørsmål

Forskere fra Kina har utviklet en økonomisk metode for å opprette GPT-3-liknende språkbehandlingsystemer samtidig som de unngår de stadig mer hemmende kostnadene av tid og penger som er involvert i å trene opp store datamengder – en voksende trend som ellers truer med å til slutt å gjøre dette området av AI til FAANG-spillere og høynivå-investorer.
Den foreslåtte rammen kalles Oppgave-drevet språkmodellering (TLM). I stedet for å trene en stor og kompleks modell på en enorm korpus av milliarder av ord og tusenvis av merker og klasser, trener TLM en mye mindre modell som faktisk inkorporerer et spørsmål direkte inn i modellen.

Venstre, en typisk hyperskala-tilnærming til store språkmodeller; høyre, TLMs slanke metode for å utforske en stor språkkorpus på en per-tema- eller per-spørsmål-basis. Kilde: https://arxiv.org/pdf/2111.04130.pdf
Effektivt, produseres en unik NLP-algoritme eller modell for å svare på ett enkelt spørsmål, i stedet for å opprette en enorm og ustyrlig generell språkmodell som kan svare på en bredere variasjon av spørsmål.
I testing av TLM, fant forskerne ut at den nye tilnærmingen oppnår resultater som er lignende eller bedre enn forhånds-trente språkmodeller som RoBERTa-Large, og hyperskala NLP-systemer som OpenAIs GPT-3, Googles TRILLION Parameter Switch Transformer Modell, Koreas HyperClover, AI21 Labs’ Jurassic 1, og Microsofts Megatron-Turing NLG 530B.
I prøver av TLM over åtte klassifiseringsdatasett over fire domener, fant forfatterne også ut at systemet reduserer antall trening-FLOPs (flytende punktoperasjoner per sekund) som kreves med to størrelsesordener. Forskerne håper at TLM kan ‘demokratisere’ et område som blir stadig mer elitistisk, med NLP-modeller så store at de ikke realistisk kan installeres lokalt, og i stedet sitter, i tilfelle GPT-3, bak dyre og begrensede API-er fra OpenAI og Microsoft Azure.
Forfatterne påstår at reduksjon av treningstid med to størrelsesordener reduserer treningkostnaden over 1 000 GPU-er for en dag til bare 8 GPU-er over 48 timer.
Den nye rapporten har tittelen NLP fra scratch uten stor-skala-forhånds-trening: En enkel og effektiv ramme, og kommer fra tre forskere ved Tsinghua-universitetet i Beijing, og en forsker fra Kina-basert AI-utviklingsselskap Recurrent AI, Inc.
Ubetalelige svar
Kostnaden av å trene effektive, all-purpose språkmodeller blir stadig mer karakterisert som en potensiell ‘termisk grense’ på hvor langt performant og nøyaktig NLP kan bli spredt i kulturen.

Statistikk over veksten av aspekter i NLP-modellarkitekturer, fra en rapport fra 2020 av A121 Labs. Kilde: https://arxiv.org/pdf/2004.08900.pdf
I 2019 beregnet en forsker at det kostet 61 440 USD å trene XLNet-modellen (som ble rapportert å slå BERT i NLP-oppdrag på den tiden) over 2,5 dager på 512 kjerne over 64 enheter, mens GPT-3 estimeres å ha kostet 12 millioner dollar å trene – 200 ganger mer enn kostnaden av å trene forgjengeren, GPT-2 (selv om nyere om-estimater hevder at det kan bli trent nå for bare 4 600 000 dollar på de lavest prisete sky-GPU-ene).
Undermengder av data basert på spørsmålsbehov
I stedet søker den nye arkitekturen å frembringe nøyaktige klassifiseringer, merker og generalisering ved å bruke et spørsmål som en slags filter for å definere en undermengde av informasjon fra en stor språkdatabasen som vil bli trent, sammen med spørsmålet, for å gi svar på et begrenset tema.
Forfatterne påstår:
‘TLM er motivert av to nøkkelideer. Først, mennesker behersker en oppgave ved å bruke bare en liten del av verdens kunnskap (f.eks. studenter trenger bare å gjennomgå noen kapitler, blant alle bøker i verden, for å plugga til en eksamen). ‘
‘Vi hypotetiserer at det finnes mye redundans i den store korpusen for en bestemt oppgave. Andre, trening på overvåket merket data er mye mer dataeffektiv for nedstrøms-ytelse enn å optimere språkmodell-målet på umerkede data. Basert på disse motivasjonene, bruker TLM oppgave-data som spørsmål for å hente en liten undermengde av den generelle korpusen. Dette følges av å sammen optimere et overvåket oppgave-mål og et språkmodell-mål ved å bruke både den hentede dataen og oppgave-dataen.’
Foruten å gjøre svært effektive NLP-modell-trening tilgjengelig, ser forfatterne en rekke fordeler med å bruke oppgave-drevne NLP-modeller. For det første kan forskerne nyte større fleksibilitet, med tilpassede strategier for sekvenslengde, tokenisering, hyperparameter-justering og data-representasjoner.
Forskerne forutser også utviklingen av hybrid fremtidige systemer som handler av begrensede forhånds-trening av en PLM (som ikke forventes i den nåværende implementeringen) mot større variasjon og generalisering mot treningstider. De betrakter systemet som et skritt fremover for fremme av in-domain null-skudd generalisering metoder.
Testing og resultater
TLM ble testet på klassifiseringsutfordringer i åtte oppgaver over fire domener – biomedisinsk vitenskap, nyheter, anmeldelser og datavitenskap. Oppgavene ble delt inn i høy-resurs og lav-resurs-kategorier. Høy-resurs oppgaver inkluderte over 5 000 oppgave-data, som AGNews og RCT, blant andre; lav-resurs oppgaver inkluderte ChemProt og ACL-ARC, samt HyperPartisan nyhetsdeteksjonsdataset.
Forskerne utviklet to treningssett med tittelen Corpus-BERT og Corpus-RoBERTa, den siste ti ganger større enn den første. Eksperimentene sammenlignet generelle forhånds-trente språkmodeller BERT (fra Google ) og RoBERTA (fra Facebook ) med den nye arkitekturen.
Artikkelen observerer at selv om TLM er en generell metode, og burde være mer begrenset i omfang og anvendelighet enn bredere og høyere-volum state-of-the-art-modeller, er det i stand til å utføre nær domain-adaptiv fein-justering metoder.

Resultater fra sammenligning av TLMs ytelse mot BERT- og RoBERTA-baserte sett. Resultatene viser en gjennomsnittlig F1-poeng over tre forskjellige trenings-skalaer, og viser antall parametre, total trening-komputasjon (FLOPs) og størrelse på treningskorpus.
Forfatterne konkluderer at TLM er i stand til å oppnå resultater som er sammenlignbare eller bedre enn PLM-er, med en betydelig reduksjon i FLOPs som kreves, og som bare krever 1/16 av treningskorpusen. Over medium og stor skala, kan TLM åpenbart forbedre ytelsen med 0,59 og 0,24 poeng i gjennomsnitt, mens reduksjon av treningsdata-størrelse med to størrelsesordener.
‘Disse resultatene bekrefter at TLM er svært nøyaktig og mye mer effektiv enn PLM-er. I tillegg får TLM flere fordeler i effektivitet på en større skala. Dette indikerer at større PLM-er kan ha blitt trenet for å lagre mer generell kunnskap som ikke er nyttig for en bestemt oppgave.”












