AI-modeller og plattformer
GLM-130B: En åpen tospråklig forhånds trenet modell

GLM-130B-rammeverket er en tospråklig forhånds trenet stor språkmodell med over 130 milliarder parametre som kan generere tekstutdata på både engelsk og kinesisk. GLM-130B-rammeverket er et forsøk på å åpne kildekoden for en språkmodell i en skala over 100 milliarder parametre, og diskutere hvordan rammeverk av en så stor skala kan forhåndstrenes, fordi det å trenere en modell av en så stor skala ofte er forstyrret av problemer som divergens og tap-spisser.
I denne artikkelen skal vi snakke om GLM-130B-rammeverket, som forsøker å utvikle en metode for å effektivt forhåndstrenere store språkmodeller med hundredvis av milliarder parametre. Vi skal dykke dyptere inn i arbeidings- og arkitektur av GLM-130B-rammeverket, samt treningsprosessen og designvalg som ikke bare hjelper til å øke effektiviteten, men også stabiliteten. De første eksperimentene som ble utført for å teste arbeidingsmetoden til GLM-130B-rammeverket på en rekke engelske benchmark-resultater, resulterte i at GLM-130B-modellen overgikk den nåværende tilstanden av GPT-3-rammeverket med en betydelig margin. Så la oss begynne og utforske hvordan GLM-130B-rammeverket leverer så konsekvente, nøyaktige og stabile resultater.
En introduksjon til GLM-130B-rammeverket
Store språkmodeller som kan operere i få-skudds- og null-skudds-innstillinger, spesielt de med over 100 milliarder parametre, presenterer attraktive skaleringslover, hvorav GPT-3-rammeverket er ett av de best performende rammeverkene som leverer betydelige ytelsesforbedringer over sin forgjenger, BERT-rammeverket. Likevel, til tross for populariteten til GPT-3-rammeverket og dets vidstrakte anvendelser, har treningsprosessen og på noen måter GPT-3-rammeverket i seg selv vært uklare for offentligheten. Videre er det empirisk å oppregne alle mulige designs for å trenere LLM-er over 100 milliarder parametre komputasjonelt uaffordabelt, noe som gjør det enda mer kritisk å komme opp med en forhåndstreningsmetode for store skala LLM-rammeverk.
Det ovennevnte punktet gjør at det er viktig å dele arbeidingsmetoden og treningsprosessen for høykvalitets store skala LLM-rammeverk som GPT-3, og med de etiske bekymringene i mente, er GLM-130B-rammeverket et forsøk på å forhåndstrenere en nøyaktig og åpen kildekode LLM med over 100 milliarder parametre. Underveis i forsøket observerte GLM-130B-utviklingsteamet at forhåndstreningen av en stor skala LLM-rammeverk ofte er ledsaget av en rekke tekniske og tekniske utfordringer i forhold til forhåndstreningsstabilitet, effektivitet og konvergens.
For å være mer spesifik, er GLM-130B et bidireksjonalt og tospråklig tett rammeverk som består av over 130 milliarder parametre, forhåndstrenet over 400 milliarder token på en cluster av 96 NVIDIA DGX-A100 GPU-noder over en periode på nesten to måneder. Videre, i stedet for å bruke GPT-stil arkitektur, bruker GLM-130B-rammeverket GLM eller General Language Model-algoritmen i et forsøk på å utnytte dens autoregressive blank-fyllingsobjektiver og den bidireksjonale oppmerksomhetsfordelen. Følgende tabell sammenligner GLM-130B-rammeverket med andre modeller med over 100 milliarder parametre, inkludert GPT, BLOOM-176B og OPT-175B.

De tekniske og tekniske konseptene som er involvert i GLM-130B-rammeverket overgår nesten alle store skala LLM-rammeverk, inkludert GPT-3 og PaLM 540B med over 500 milliarder parametre, i mange tilfeller og over en rekke benchmark. Følgende figur sammenligner ytelsen til GLM-130B-rammeverket med modeller med over 100 milliarder parametre, og som det kan ses, har GLM-130B-rammeverket betydelig mindre genererings-toxicitet og bias enn sine motparter.

Til slutt er GLM-130B-rammeverket designet for å tillate så mange utviklere å utføre studier på rammeverk med over 100 milliarder parametre, og det er to måter som GLM-130B-rammeverket oppnår dette. Først, i stedet for å bruke over 175 milliarder parametre som BLOOM og OPT, bruker GLM-130B-rammeverket 130 milliarder parametre, fordi størrelsen på modellen støtter interferens selv på en enkelt A100-server. For det andre, er GPU-kravene for å kjøre GLM-130B-rammeverket mindre sammenlignet med andre LLM-rammeverk, og GLM-130B-rammeverket oppnår dette ved å kvantisere den originale rammeverket til INT4-presisjon. INT4-kvantiseringen som brukes av GLM-130B-rammeverket forbedrer ytelsen samtidig som den opprettholder en ubetydelig ytelsesnedgang.
GLM-130B: Arkitektur
Den induktive forutinntakten til en maskinlæringsmodell beskrives av dens arkitektur, og det kommer ikke som en overraskelse når utviklere ikke kan utforske ulike arkitektoniske designs for store språkmodeller gitt den komputasjonelle tilgjengeligheten og levedyktigheten. Med det sagt, la oss se på GLM-130B-arkitekturen.
Store skala LLM-rammeverk som PaLM, GPT og mer har over 100 milliarder parametre, og de er bygget på den konvensjonelle decoder-bare GPT-stil arkitekturen for autoregressiv språkmodellering. På den andre siden, utforsker GLM-130B-rammeverket muligheten for å bruke en bidireksjonal General Language Model eller GLM, en transformer-basert språkmodell som søker å utnytte autoregressive blank-fylling som treningsobjektivet, som grunnlag.
Den bidireksjonale oppmerksomheten til General Language Model over uforstyrrede eller umaskerte kontekster er det som skiller GLM-130B-rammeverket fra GPT-stil-tilnærmingen som bruker en unidireksjonal tilnærming. Videre, for å støtte både generering og forståelse av data, amalgamerer GLM-rammeverket to korruptionsstrategier, hver av dem indikert med en spesiell og unik mask-token.
- [MASK]: [MASK] er en korruptionsstrategi som bruker korte blanker i setninger, lengden av hvilke adderer opp til en viss prosent av inndata.
- [gMASK]: [gMASK] er en korruptionsstrategi som bruker tilfeldige lengder på blanker mot slutten av setningen med prefikskontekstene.
Tilnærmingen som følges av GLM-rammeverket er det som tillater rammeverket å oppnå en nøyaktighetsscore på over 80% på null-skudds LAMBADA-språkmodellering, og overgår både PaLM 540B og GPT-3-rammeverket.

Lag-normalisering
En av de største utfordringene som utviklere møter når de trenere en LLM-rammeverk er treningsinstabiliteten, og å bruke en passende LN (Lag-normalisering) kan hjelpe med treningsstabiliteten til LLM-er. GLM-130B-rammeverket bruker en Post-LN-tilnærming takket være dens ytelse på nedstrømsoppgaver.
FFN-er og posisjonskoding
Feedforward Neural Networks eller FFN-er og posisjonskoding er to tilnærminger som er adoptert av GLM-130B-rammeverket for å introdusere høy-ytelses nedstrømsoppgaver og treningsstabilitet.
Forhåndstreningsoppsett
Forhåndstreningsobjektivet til GLM-130B-rammeverket inkluderer ikke bare multi-oppgave-læring for et lite antall token, men også selv-styrte GLM for autoregressiv fylling av blanker, med forventningen om at denne tilnærmingen vil hjelpe GLM-130B-rammeverket i nedstrømsoppgaver. Med det sagt, ser forhåndstreningsoppsettet til GLM-130B-rammeverket ut som følger.
Selv-styrt blank-fylling
Som allerede nevnt, bruker GLM-130B-rammeverket to korruptionsstrategier, nemlig [MASK] og [gMASK], og en av disse strategiene blir uavhengig anvendt på hver enkelt treningssekvens, en gang av gangen. For å fylle inn blanker, maskerer [MASK]-strategien påfølgende spann i 30% av treningssekvensen, hvor lengden av spannene adderer opp til 15% av inndata, og følger en Poisson-fordeling. For de resterende 70% av sekvensen, blir prefiksen av hver sekvens beholdt som en kontekst, og [gMASK]-strategien hjelper med å maske resten av det, og den maskerte lengden blir så sampet med Uniform-fordeling.
Multi-oppgave-instruksjonsforhåndstrenings
Det har blitt indikert at å følge en multi-oppgave-læringstilnærming for å forhåndstrenere modellene kan levere bedre resultater enn finjustering, for å forbedre oppgave-overføringer i en null-skudds-innstilling. Deretter foreslår GLM-130B-rammeverket å bruke en rekke instruksjonspromptede datasett, inkludert språkgenerering, forståelse og informasjonsutvinning under forhåndstreningsfasen.
I sammenligning med andre tilnærminger for null-skudds-oppgave-overføring som bruker multi-oppgave-promptede finjusteringer, kontoer Multi-oppgave-instruksjonsforhåndstrenings-tilnærmingen som følges av GLM-130B-rammeverket for bare 5% av de totale token, og det er satt under forhåndstreningsfasen i et forsøk på å forhindre å ødelegge andre evner til LLM-rammeverket eller med andre ord, ubetinget fritt generering.
3D-parallellstrategi
Det er to de facto-praksiser for å trenere store skala-modeller med milliarder av parametre, tensor-modell-parallellisme og data-parallellisme. I et forsøk på å minimere GPU-anvendelsen og å håndtere enorme GPU-krav, implementerer GLM-130B-rammeverket en 3D-parallellstrategi som kombinerer pipeline-modell-parallellisme-strategien med tensor-modell-parallellisme- og data-parallellisme-strategiene.
GLM-130B: Treningsstabilitet
Treningsstabilitet er en viktig faktor når det gjelder å bestemme en LLMs kvalitet, og treningsstabiliteten påvirkes tungt avhengig av antallet token det passerer gjennom. Videre er det viktig å etablere en avveining mellom stabilitet og effektivitet med hensyn til flytende punkt-formater gitt de komputasjonelle begrensningene. For eksempel, lav-presisjons flytende punkt-formater booster komputasjonseffektiviteten, men de resulterer ofte i trenings-kollaps gitt de er utsatt for underflow- og overflow-feil.
Blandet presisjon
I et forsøk på å booste treningsnøyaktighet og redusere minneanvendelse, følger GLM-130B-rammeverket den vanlige praksisen med å bruke blandet presisjon, dvs. FP16 for både fremover- og bakover-retning, og FP32 for både master-vektorer og optimizer-tilstander. Like som andre populære LLM-rammeverk, inkludert BLOOM-176B og OPT-175B, møter treningsfasen til GLM-130B-rammeverket med hyppige tap-spisser, og frekvensen av disse tap-spissene tenderer å øke etterhvert som modellen fortsetter å trenere.

Først, kan verdiskalaen til hovedgreina til transformeren være enorm i de dypere lagene når man bruker Pre-LN, og i GLM-130B-rammeverket blir dette adressert ved å bruke en DeepNorm-basert Pre-LN, som sikrer at verdiskalaen forblir begrenset hele tiden. For det andre, vokser oppmerksomhetspoengene til et punkt hvor de overstiger FP16-området etterhvert som modellen skalerer opp.
Embedding-lagets gradient-krympning eller EGS
Utviklerne som arbeider med GLM-130B-rammeverket identifiserte at gradient-normen kan fungere som en informativ indikator for trenings-kollaps, og en trenings-kollaps følger vanligvis etter en spiss i gradient-normen. Årsaken til disse spissene er de abnormale gradientene til embedding-laget, og utviklerne observerte at når man sammenligner med gradient-normen til andre lag, er gradient-normen til embedding-lagene større med flere størrelsesordener, og den tenderer også å fluktuere dramatisk under den tidlige treningsfasen til rammeverket.

GLM-130B: Resultater og ytelse
For å evaluere GLM-130B-rammeverkets ytelse for engelske oppgaver, implementerer det samme innstillingene som følges av vanlige LLM-rammeverk, inkludert PaLM og GPT-3, og siden GLM-130B er et tospråklig rammeverk, blir det også evaluert over flere kinesiske benchmark. GLM-130B-rammeverkets ytelse vil bli målt over flere benchmark, inkludert språkmodellering, MMLU eller Massive Multitask Language Understanding, BIG-Bench eller Beyond the Imitation Game Benchmark, og CLUE eller Chinese Language Understanding Evaluation.
Språkmodellering
Språkmodellering-benchmark-testen på GLM-130B-rammeverket blir utført over to datasett: LAMBADA og Pile.
LAMBADA-datasettet blir brukt til å teste siste ord-modelleringsevnen til LLM-er, og GLM-130B-rammeverket oppnår en null-skudds-nøyaktighetsscore på 80,2 i en tospråklig innstilling, og setter en ny benchmark-rekord på LAMBADA-datasettet.
På den andre siden er Pile en testsett som består av en rekke benchmark for språkmodeller. I gjennomsnitt, i sammenligning med GPT-3 og Jurassic-1, leverer GLM-130B-rammeverket sin beste ytelse på 18 delte testsett i forhold til vektet BPBs. Resultatene demonstrerer de sterke språkevner til GLM-130B-rammeverket, og resultatene er inkludert i tabellen nedenfor.

MMLU eller Massive Multitask Language Understanding
MMLU eller Massive Multitask Language Understanding er en divers benchmark som består av over 50 multiple-choice-spørsmål-oppgaver om menneskelig intelligens og kunnskap, som spenner fra videregående skole til ekspertnivå, og det blir utgitt etter å ha crawlet Pile-testsettet, og derfor tjener det som en ideal test-bench for å evaluere null-skudds-lærings-evnen til en LLM.

Som det kan ses, i null-skudds-innstilling (5-skudd), nærmer GLM-130B-rammeverkets ytelse seg GPT-3-modellens ytelse etter å ha sett på nærmere 300 milliarder token. Ytelsen fortsetter å øke etterhvert som treningsfasen fortsetter, og når treningsfasen er ferdig, oppnår rammeverket en nøyaktighetsscore på 44,8 etter å ha sett på totalt 400 milliarder token.
BIG-Bench eller Beyond the Imitation Game Benchmark
BIG-Bench eller Beyond the Imitation Game Benchmark-utfordringer tester en modells evne til kunnskap, resonnering og sunn fornuft. Som demonstrert i figuren nedenfor, i null-skudds-innstilling, overgår GLM-130B-rammeverket både PaLM 540B og GPT-3 175B-rammeverk, som kan skyldes MIP og den bidireksjonale kontekst-oppmerksomheten for å booste GLM-130B-rammeverkets ytelse i usette oppgaver i null-skudds-innstilling.

CLUE eller Chinese Language Understanding Evaluation
GLM-130B-rammeverkets kinesiske null-skudds-ytelse blir evaluert på etablerte NLP-benchmark-oppgaver, inkludert CLUE og FewCLUE, og sammenlignes med 260B ERNIE Titan 3.0, den største eksisterende kinesiske språkmodellen. Som det kan observeres, overgår GLM-130B-rammeverket konstant 260B ERNIE Titan 3.0-rammeverket over 12 forskjellige oppgaver, og utfører nesten 260% bedre enn ERNIE-rammeverket på to abstrakte MRC-datasett.

Konklusjon
I denne artikkelen har vi snakket om GLM-130B, en tospråklig forhånds trenet stor språkmodell som søker å fremme inklusiv LLM-forskning. Arkitekturen, ingeniørvitenskapen og de tekniske foretakene søker å gi AI-samfunnet en bedre innsikt i arkitekturen til LLM-rammeverk, trenings-effektivitet og -stabilitet, forhåndstreningsobjektiver og rimelig interferens.












