Andersons vinkel

Skapande av en GPT-liknande språkmodell för en enda fråga

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från Kina har utvecklat en ekonomisk metod för att skapa GPT-3-liknande system för naturlig språkbehandling medan de undviker den alltmer förbjudande kostnaden för tid och pengar som krävs för att träna stora datamängder – en växande trend som annars hotar att förpassa denna sektor av AI till FAANG-spelare och högnivåinvestorer.

Den föreslagna ramen kallas Uppgiftsdriven språkmodellering (TLM). Istället för att träna en stor och komplex modell på en enorm mängd text och tusentals etiketter och klasser, tränar TLM en mycket mindre modell som faktiskt inkorporerar en fråga direkt i modellen.

Till vänster, en typisk hyperskalemetod för stora språkmodeller; till höger, TLM:s smalningsmetod för att utforska en stor språkdatabas på en per-ämne- eller per-frågebasis. Källa: https://arxiv.org/pdf/2111.04130.pdf

Till vänster, en typisk hyperskalemetod för stora språkmodeller; till höger, TLM:s smalningsmetod för att utforska en stor språkdatabas på en per-ämne- eller per-frågebasis. Källa: https://arxiv.org/pdf/2111.04130.pdf

Effektivt, skapas en unik NLP-algoritm eller modell för att besvara en enda fråga, istället för att skapa en enorm och otymplig allmän språkmodell som kan besvara en bredare variation av frågor.

Vid testning av TLM fann forskarna att den nya metoden uppnår resultat som är lika bra eller bättre än förtränade språkmodeller som RoBERTa-Large och hyperskale NLP-system som OpenAI:s GPT-3, Googles TRILLION Parameter Switch Transformer Modell, Koreas HyperClover, AI21 Labs Jurassic 1 och Microsofts Megatron-Turing NLG 530B.

I tester av TLM över åtta klassificeringsuppgifter i fyra domäner fann författarna dessutom att systemet minskar antalet flyttalsoperationer per sekund (flyttalsoperationer per sekund) som krävs med två storleksordningar. Forskarna hoppas att TLM kan “demokratisera” en sektor som blir alltmer elitistisk, med NLP-modeller som är så stora att de inte realistiskt kan installeras lokalt och istället finns bakom de dyra och begränsade API:erna från OpenAI och Microsoft Azure.

Författarna påstår att minskningen av tränningstiden med två storleksordningar minskar träningskostnaden över 1 000 GPU:er under en dag till bara 8 GPU:er under 48 timmar.

Den nya rapporten har titeln NLP från scratch utan storskalig förträning: En enkel och effektiv ram och kommer från tre forskare vid Tsinghua University i Peking och en forskare från Kina-baserat AI-utvecklingsföretag Recurrent AI, Inc.

Oförmånlighet att betala för svar

Kostnaden för att träna effektiva, allmänna språkmodeller blir alltmer en potentiell “termisk gräns” för hur långt presterande och exakta NLP kan bli spridd i kulturen.

Statistik över tillväxten av aspekter i NLP-modellarkitektur, från en rapport från 2020 av A121 Labs. Källa: https://arxiv.org/pdf/2004.08900.pdf

Statistik över tillväxten av aspekter i NLP-modellarkitektur, från en rapport från 2020 av A121 Labs. Källa: https://arxiv.org/pdf/2004.08900.pdf

År 2019 beräknade en forskare att det kostar 61 440 USD att träna XLNet-modellen (som rapporterades slå BERT i NLP-uppgifter) under 2,5 dagar på 512 kärnor över 64 enheter, medan GPT-3 beräknas ha kostat 12 miljoner dollar att träna – 200 gånger mer än kostnaden för att träna dess föregångare, GPT-2 (även om senare omberäkningar hävdar att det kan tränas nu för bara 4 600 000 dollar på de billigaste moln-GPU:erna).

Undermängder av data baserat på frågebegrepp

Istället söker den nya föreslagna arkitekturen efter att erhålla exakta klassificeringar, etiketter och generaliseringar genom att använda en fråga som en sorts filter för att definiera en undermängd av information från en stor språkdatabas som kommer att tränas tillsammans med frågan för att ge svar på ett begränsat ämne.

Författarna påstår:

‘TLM är motiverad av två nyckelidéer. Först, så mästerar människor en uppgift genom att använda bara en liten del av världens kunskap (t.ex. studenter behöver bara repetera ett fåtal kapitel, bland alla böcker i världen, för att plugga inför en tentamen). ‘

‘Vi hypotetiserar att det finns mycket redundans i den stora mängden data för en specifik uppgift. Andra, att träning på övervakad etiketterad data är mycket mer dataeffektiv för nedströmsprestanda än att optimera språkmodellmålet på oetiketterad data. Baserat på dessa motivationer använder TLM uppgiftsdata som frågor för att hämta en liten undermängd av den allmänna mängden. Detta följs av att gemensamt optimera ett övervakat uppgiftsmål och ett språkmodellmål med hjälp av både den hämtade datan och uppgiftsdatan.’

Förutom att göra högeffektiv NLP-modellträning tillgänglig, ser författarna flera fördelar med att använda uppgiftsdrivna NLP-modeller. En av dem är att forskare kan njuta av större flexibilitet, med anpassade strategier för sekvenslängd, tokenisering, hyperparametrarjustering och datarepresentationer.

Forskarna förutser också utvecklingen av hybridframtida system som handlar om att avväga begränsad förträning av en PLM (som inte förväntas i den nuvarande implementeringen) mot större flexibilitet och generalisering mot tränningstider. De anser att systemet är ett steg framåt för utvecklingen av inom-domän nollskottsgeneraliseringsmetoder.

Testning och resultat

TLM testades på klassificeringsutmaningar i åtta uppgifter över fyra domäner – biomedicinsk vetenskap, nyheter, recensioner och datavetenskap. Uppgifterna delades in i hög-resurs- och låg-resurskategorier. Hög-resursuppgifter inkluderade över 5 000 uppgiftsdata, som AGNews och RCT, bland andra; låg-resursuppgifter inkluderade ChemProt och ACL-ARC, samt HyperPartisan nyhetsdetektionsdatabasen.

Forskarna utvecklade två träningsuppsättningar med titlarna Corpus-BERT och Corpus-RoBERTa, den senare tio gånger större än den första. Experimenten jämförde allmänna förtränade språkmodeller BERT (från Google ) och RoBERTA (från Facebook ) med den nya arkitekturen.

Artikeln observerar att även om TLM är en allmän metod och bör vara mer begränsad i omfattning och tillämpbarhet än bredare och högvolymsmodeller, kan den prestera nära domänanpassad finjustering.

Resultat från jämförelse av TLM:s prestanda mot BERT- och RoBERTa-baserade uppsättningar. Resultaten listar en genomsnittlig F1-poäng över tre olika tränings skalor och listar antalet parametrar, total träningsberäkning (FLOPs) och storlek på träningskorpus.

Resultat från jämförelse av TLM:s prestanda mot BERT- och RoBERTa-baserade uppsättningar. Resultaten listar en genomsnittlig F1-poäng över tre olika tränings skalor och listar antalet parametrar, total träningsberäkning (FLOPs) och storlek på träningskorpus.

Författarna slutsats är att TLM kan uppnå resultat som är jämförbara eller bättre än PLM, med en betydande minskning av FLOPs som behövs och kräver bara 1/16 av träningskorpusen. Över medelstora och stora skalor kan TLM förbättra prestandan med 0,59 och 0,24 poäng i genomsnitt, samtidigt som träningsdatans storlek minskas med två storleksordningar.

‘Dessa resultat bekräftar att TLM är högt exakt och mycket mer effektivt än PLM. Dessutom vinner TLM fler fördelar i effektivitet i större skala. Detta tyder på att större PLM kan ha tränats för att lagra mer allmän kunskap som inte är användbar för en specifik uppgift.’

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai