AI-modeller og platforme
GLM-130B: En åben bipersonlig forudtrænet model

GLM-130B-rammen er en bipersonlig forudtrænet stor sprogmodel med over 130 milliarder parametre, der kan generere tekstoutput i både engelsk og kinesisk. GLM-130B-rammen er et forsøg på at åbne en sprogmodel i en skala på over 100 milliarder parametre og diskutere, hvordan rammer af så stor skala kan forudtrænes, da det i øjeblikket ofte er forbundet med problemer som divergens og tabsspidser.
I denne artikel vil vi tale om GLM-130B-rammen, der forsøger at udvikle en metode til at effektivt forudtræne store sprogmodeller med hundredvis af milliarder parametre. Vi vil dykke dybere i GLM-130B-rammens virkemåde og arkitektur samt træningsprocessen og designvalg, der ikke kun hjælper med at øge effektiviteten, men også stabiliteten. De første eksperimenter, der er udført for at teste GLM-130B-rammens virkemåde på en bred vifte af engelske benchmarks, resulterede i, at GLM-130B-modellen overgik den nuværende tilstand af kunst GPT-3-rammen med en betydelig margin. Så lad os begynde og udforske, hvordan GLM-130B-rammen leverer så konsekvente, præcise og stabile resultater.
En introduktion til GLM-130B-rammen
Store sprogmodeller, der kan fungere i few-shot- og zero-shot-indstillinger, især dem med over 100 milliarder parametre, præsenterer attraktive skala love, hvoraf GPT-3-rammen er en af de bedst performende rammer, der leverer betydelige ydelsesforbedringer over sin forgænger, BERT-rammen. However, på trods af GPT-3-rammens popularitet og dens omfattende anvendelser, har træningsprocessen og i nogle tilfælde GPT-3-rammen i sig selv været ikke gennemsigtig for offentligheden.
Det ovenstående punkt gør, at det er af kritisk værdi at dele virkemåden og træningsprocessen for højkvalitets store skala sprogmodeller som GPT-3, og med de etiske bekymringer i mente, er GLM-130B-rammen et forsøg på at forudtræne en præcis og åben sprogmodel med over 100 milliarder parametre.
Under udviklingen af GLM-130B-rammen observerede udviklingsteamet, at forudtræning af en stor skala sprogmodel ofte er forbundet med en bred vifte af tekniske og tekniske udfordringer i forhold til forudtræningsstabilitet, effektivitet og konvergens.
For at være mere specifik er GLM-130B en bidirectional og bipersonlig tæt rammework bestående af over 130 milliarder parametre, forudtrænet over 400 milliarder tokens på en cluster af 96 NVIDIA DGX-A100 GPU-noder over en periode på næsten to måneder.

De tekniske og tekniske koncepter, der er involveret i GLM-130B-rammen, overgår næsten alle store skala sprogmodeller, herunder GPT-3 og PaLM 540B med over 500 milliarder parametre, i mange tilfælde og på en bred vifte af benchmarks.

Til sidst er GLM-130B-rammen designede til at tillade så mange udviklere som muligt at udføre studier på rammer med over 100 milliarder parametre, og der er to måder, hvorpå GLM-130B-rammen opnår dette.
GLM-130B: Arkitektur
Den induktive bias af en maskinlæringsmodel beskrives af dens arkitektur, og det kommer ikke som en overraskelse, når udviklere ikke kan udforske forskellige arkitektoniske designs for store sprogmodeller, given den computermæssige affordability og viability.
Store skala sprogmodeller som PaLM, GPT og mere har over 100 milliarder parametre og er bygget på den konventionelle decoder-only GPT-style arkitektur for autoregressiv sprogmodelering.
Lag-normalisering
En af de største udfordringer, som udviklere står over for, når de træner en sprogmodel, er træningsinstabiliteten, og brugen af en passende lag-normalisering kan hjælpe med træningen af sprogmodeller.
FFN’er og positionskodning
Feedforward neurale netværk og positionskodning er to tilgange, der er valgt af GLM-130B-rammen til at introducere højendownstream-ydelse og træningsstabilitet.
GLM-130B: Træningsstabilitet
Træningsstabilitet er en vigtig faktor, når det kommer til at bestemme en sprogmodels kvalitet, og træningsstabiliteten påvirkes kraftigt af antallet af tokens, den passerer igennem.
Blandet præcision
For at øge træningsnøjagtigheden og reducere memoryforbruget følger GLM-130B-rammen den almindelige praksis med at bruge blandet præcision, dvs. FP16 for både fremad- og bagad-retning og FP32 for både master-weights og optimizer-tilstande.
GLM-130B: Resultater og ydelse
For at evaluere GLM-130B’s ydelse for engelske opgaver implementerer den samme indstillinger, der følges af almindelige sprogmodeller, herunder PaLM og GPT-3, og da GLM-130B er en bipersonlig rammework, evalueres den også på flere kinesiske benchmarks.
Sprogmodelering
Sprogmodeleringstesten på GLM-130B-rammen udføres på to datasets: LAMBADA og Pile.
LAMBADA-datasættet bruges til at teste den sidste ordmodeleringsfunktion af sprogmodeller, og GLM-130B-rammen opnår en zero-shot-nøjagtighed på 80,2 i en bipersonlig indstilling og sætter dermed en ny benchmark-rekord på LAMBADA-datasættet.
MMLU eller Massive Multitask Sprogforståelse
MMLU eller Massive Multitask Sprogforståelse er en diversificeret benchmark, der består af over 50 multiple-choice-spørgsmålssvarende opgaver omkring menneskelig intelligens og viden, der strækker sig fra high school til eksperterniveau, og det er udgivet efter crawling af Pile-test-sættet og tjener derfor som en ideal test-bed til at evaluere few-shot-læringsfunktionerne af en sprogmodel.
BIG-Bench eller Beyond the Imitation Game Benchmark
BIG-Bench eller Beyond the Imitation Game Benchmark-tester en models evne til at håndtere viden, resonnering og fællesskabssans.
CLUE eller Kinesisk Sprogforståelse Evaluering
GLM-130B’s kinesiske zero-shot-ydelse evalueres på etablerede NLP-benchmark-opgaver, herunder CLUE og FewCLUE, og sammenlignes med 260B ERNIE Titan 3.0, den største eksisterende kinesiske sprogmodel.
Konklusion
I denne artikel har vi talt om GLM-130B, en bipersonlig forudtrænet stor sprogmodel, der sigter mod at fremme inklusiv sprogforskning.












