Andersons vinkel

Oprettelse af en GPT-lignende sprogmodel til ét enkelt spørgsmål

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere fra Kina har udviklet en økonomisk metode til at oprette GPT-3-lignende naturligsprogsbehandlings-systemer, samtidig med at de undgår de stadig mere forbudte omkostninger af tid og penge, der er involveret i træning af store datamængder – en voksende trend, der ellers truer med at til sidst begrænse dette område af kunstig intelligens til FAANG-spillere og højt niveau investorer.

Den foreslåede ramme kaldes Task-Driven Language Modeling (TLM). I stedet for at træne et enormt og komplekst model på en enorm mængde af milliarder af ord og tusinder af mærker og klasser, træner TLM en langt mindre model, der faktisk inkorporerer et spørgsmål direkte i modellen.

Venstre, en typisk hyperskala-tilgang til store sprogmodeller; højre, TLM's slanke metode til at udforske en stor sprogkorpus på en per-emne- eller per-spørgsmålsbasis. Kilde: https://arxiv.org/pdf/2111.04130.pdf

Venstre, en typisk hyperskala-tilgang til store sprogmodeller; højre, TLM’s slanke metode til at udforske en stor sprogkorpus på en per-emne- eller per-spørgsmålsbasis. Kilde: https://arxiv.org/pdf/2111.04130.pdf

Effektivt, oprettes en unik NLP-algoritme eller model for at besvare ét enkelt spørgsmål, i stedet for at oprette en enorm og ustyrlig generel sprogmodel, der kan besvare en bredere variation af spørgsmål.

Ved at teste TLM, fandt forskerne, at den nye tilgang opnår resultater, der er lignende eller bedre end Pretrained Language Models som RoBERTa-Large, og hyperskala-NLP-systemer som OpenAI’s GPT-3, Google’s TRILLION Parameter Switch Transformer Model, Koreas HyperClover, AI21 Labs’ Jurassic 1, og Microsofts Megatron-Turing NLG 530B.

I forsøg med TLM over otte klassifikationsdatasetter over fire domæner, fandt forfatterne desuden, at systemet reducerer trænings-FLOPs (flydende punktoperationer per sekund) krævet af to størrelsesordener. Forskerne håber, at TLM kan ‘demokratisere’ et område, der bliver mere og mere elitært, med NLP-modeller, der er så store, at de ikke realistisk kan installeres lokalt, og i stedet sidder bag dyre og begrænsede API’er fra OpenAI og Microsoft Azure.

Forfatterne oplyser, at reduktion af træningstiden med to størrelsesordener reducerer træningsomkostningerne over 1.000 GPU’er i én dag til kun 8 GPU’er over 48 timer.

Den nye rapport er titlen NLP Fra Scratch Uden Storskalatræning: En Simpel og Effektiv Ramme, og kommer fra tre forskere ved Tsinghua Universitet i Beijing, og en forsker fra Kina-baseret AI-udviklingsselskab Recurrent AI, Inc.

Ubetalelige Svar

Kosten for at træne effektive, almindelige sprogmodeller er mere og mere karakteriseret som en potentiel ‘termisk grænse’ for, hvor langt performant og præcis NLP kan blive udbredt i kulturen.

Statistik over væksten af aspekter i NLP-modelarkitekturer, fra en rapport fra 2020 af A121 Labs. Kilde: https://arxiv.org/pdf/2004.08900.pdf

Statistik over væksten af aspekter i NLP-modelarkitekturer, fra en rapport fra 2020 af A121 Labs. Kilde: https://arxiv.org/pdf/2004.08900.pdf

I 2019 beregnede en forsker , at det koster 61.440 USD at træne XLNet-modellen (rapporteret på det tidspunkt at slå BERT i NLP-opgaver) over 2,5 dage på 512 kerner på 64 enheder, mens GPT-3 estimeres at have kostet 12 millioner USD at træne – 200 gange omkostningerne ved at træne dens forgænger, GPT-2 (selvom nyere omestimeringer hævder, at det kunne være trænet nu for kun 4.600.000 USD på de billigste cloud-GPU’er).

Undermængder af Data baseret på Spørgsmålsbehov

I stedet søger den nye foreslåede arkitektur at udlede præcise klassifikationer, mærker og generalisering ved at bruge et spørgsmål som en slags filter til at definere en undermængde af information fra en stor sprogdatabase, der vil blive trænet sammen med spørgsmålet for at give svar på et begrænset emne.

Forfatterne oplyser:

‘TLM er motiveret af to nøgleideer. Først, mennesker behersker en opgave ved at bruge kun en lille del af verdens viden (f.eks. studerende behøver kun at gennemgå et par kapitler blandt alle bøger i verden for at lære til en eksamen). 

‘Vi formoder, at der er meget redundant i den store korpus for en specifik opgave. Anden, træning på overvåget mærket data er langt mere dataeffektiv for downstream-præstation end optimering af sprogmodel-objektivet på umærket data.  Baseret på disse motivationer, bruger TLM opgave-data som forespørgsler til at hente en lille undermængde af den generelle korpus.  Dette følges af fælles optimering af et overvåget opgave-objektiv og et sprogmodel-objektiv ved hjælp af både det hentede data og opgave-data.’

Ud over at gøre meget effektiv NLP-modeltræning billig, ser forfatterne en række fordele ved at bruge task-driven NLP-modeller. For det første kan forskere nyde større fleksibilitet, med brugervenlige strategier for sekvenslængde, tokenisering, hyperparameter-justering og datarepræsentationer.

Forskerne forudser også udviklingen af hybrid-fremtidssystemer, der handler af begrænset præ-træning af en PLM (som ellers ikke forventes i den nuværende implementering) mod større fleksibilitet og generalisering mod træningstider. De betragter systemet som et skridt fremad for fremme af in-domain zero-shot generalisering metoder.

Test og Resultater

TLM blev testet på klassifikationsudfordringer i otte opgaver over fire domæner – biomedicinsk videnskab, nyheder, anmeldelser og datalogi. Opgaverne blev inddelt i højresurs- og lavresurs-kategorier. Højresurs-opgaver inkluderede over 5.000 opgavedata, såsom AGNews og RCT, blandt andre; lavresurs-opgaver inkluderede ChemProt og ACL-ARC, samt HyperPartisan nyhedsdetektionsdataset.

Forskerne udviklede to træningssæt med titlerne Corpus-BERT og Corpus-RoBERTa, sidstnævnte ti gange større end den første. Eksperimenterne sammenlignede generelle Pretrained Language Models BERT (fra Google) og RoBERTA (fra Facebook ) med den nye arkitektur.

Artiklen observerer, at selvom TLM er en generel metode, og burde være mere begrænset i omfang og anvendelighed end bredere og højere-volumen state-of-the-art-modeller, er det i stand til at præstere tæt på domain-adaptiv finjustering metoder.

Resultater fra sammenligning af TLM's præstation med BERT- og RoBERTa-baserede sæt. Resultaterne viser en gennemsnitlig F1-score over tre forskellige træningsskalaer og viser antallet af parametre, total træningskomputering (FLOPs) og størrelsen af træningskorpus.

Resultater fra sammenligning af TLM’s præstation med BERT- og RoBERTa-baserede sæt.

Forfatterne konkluderer, at TLM er i stand til at opnå resultater, der er sammenlignelige eller bedre end PLM’er, med en betydelig reduktion i FLOPs krævet, og kun kræver 1/16 af træningskorpus. Over medium og store skalaer kan TLM åbenbart forbedre præstationen med 0,59 og 0,24 point i gennemsnit, mens træningsdatastørrelsen reduceres med to størrelsesordener.

‘Disse resultater bekræfter, at TLM er meget præcis og langt mere effektiv end PLM’er. Desuden opnår TLM flere fordele i effektivitet på en større skala. Dette indikerer, at større PLM’er måske er blevet trænet til at gemme mere generel viden, der ikke er nyttig for en specifik opgave.’

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai