Modely a platformy AI
GLM-130B: Otevřený bilingvní předtrénovaný model

Rámec GLM-130B je bilingvní předtrénovaný velký jazykový model s více než 130 miliardami parametrů, schopný generovat textové výstupy v angličtině i čínštině. Rámec GLM-130B je pokus o otevření zdrojového kódu jazykového modelu v rozsahu nad 100 miliard parametrů a diskusi o tom, jak lze rámce takové velikosti předtrénovat, protože目前, trénování modelu takové velikosti je často doprovázeno problémy, jako jsou divergence a loss spikes.
V tomto článku budeme mluvit o rámci GLM-130B, který se snaží vyvinout metodu pro efektivní předtrénování velkých jazykových modelů s desítkami miliard parametrů. Budeme se blíže zabývat fungováním a architekturou rámce GLM-130B, stejně jako procesem trénování a rozhodnutí, která pomáhají zvýšit efektivitu a stabilitu. První experimenty provedené pro testování fungování rámce GLM-130B na široké škále anglických benchmarků vedly k tomu, že model GLM-130B překonal současný stav umění GPT-3 framework o značnou marži. Takže začněme a prozkoumejme, jak rámec GLM-130B dosahuje tak konsistentních, přesných a stabilních výsledků.
Úvod do rámce GLM-130B
Velké jazykové modely, schopné fungovat v few-shot a zero-shot nastaveních, zejména ty s více než 100 miliardami parametrů, nabízejí atraktivní škálovací zákony, z nichž je GPT-3 framework jedním z nejlepších, který nabízí značné zlepšení výkonu oproti svému předchůdci, rámci BERT. Nicméně, navzdory popularitě rámce GPT-3 a jeho širokému použití, proces trénování a v některých ohledech samotný rámec GPT-3 nebyl transparentní pro veřejnost. Kromě toho, empiricky vyjmenovat všechny možné návrhy pro trénování LLM s více než 100 miliardami parametrů je komputačně nákladné, což činí ještě důležitějším najít metodu pro předtrénování velkých rámců LLM.
Tento bod činí sdílení fungování a procesu trénování vysokokvalitních velkých rámců LLM, jako je GPT-3, kriticky důležitým, a s ohledem na etické problémy, je rámec GLM-130B pokusem o předtrénování přesného a otevřeného LLM s více než 100 miliardami parametrů. Během svého pokusu tým vývoje rámce GLM-130B pozoroval, že předtrénování velkého rámce LLM je často doprovázeno širokou škálou inženýrských a technických problémů, jako je stabilita, efektivita a konvergence.
Konkrétněji, GLM-130B je bidirekční a bilingvní hustý rámec s více než 130 miliardami parametrů, předtrénovaný na 400 miliardách tokenů na clusteru 96 uzlů NVIDIA DGX-A100 GPU po dobu téměř dvou měsíců. Kromě toho, namísto použití architektury GPT, rámec GLM-130B využívá algoritmus GLM nebo General Language Model, který se snaží využít autoregresivní blank infilling objektivy a bidirekční pozornost. Následující tabulka porovnává rámec GLM-130B s jinými modely s více než 100 miliardami parametrů, včetně GPT, BLOOM-176B a OPT-175B.

Inženýrské a vývojové koncepty zapojené do rámce GLM-130B překonávají téměř všechny velké rámce LLM, včetně GPT-3 a PaLM 540B s více než 500 miliardami parametrů, v mnoha případech a na široké škále benchmarků. Následující obrázek porovnává výkon rámce GLM-130B s modely s více než 100 miliardami parametrů a je vidět, že rámec GLM-130B má značně méně generativní toxicity a bias než jeho protějšky.

Nakonec, rámec GLM-130B byl navržen tak, aby umožnil co největšímu počtu vývojářů provádět studie na rámcích s více než 100 miliardami parametrů, a existují dva způsoby, jak rámec GLM-130B dosahuje tohoto cíle. První, namísto použití více než 175 miliard parametrů, jako BLOOM a OPT, rámec GLM-130B využívá 130 miliard parametrů, protože velikost modelu podporuje interference i na jediném serveru A100. Druhý, požadavky na GPU pro běh rámce GLM-130B jsou nižší ve srovnání s jinými rámci LLM, a rámec GLM-130B dosahuje tohoto cíle kvantizací původního rámce do INT4 přesnosti. Kvantizace INT4 použitá rámcem GLM-130B zlepšuje výkon při zachování zanedbatelného poklesu výkonu.
GLM-130B: Architektura
Induktivní bias strojového učícího se modelu je popsán jeho architekturou, a není překvapením, že vývojáři nemohou prozkoumat různé architektonické návrhy pro velké jazykové modely, dané komputační dostupností a životaschopností. S tím řečeno, pojďme se podívat na architekturu GLM-130B.
Velké rámce LLM, jako PaLM, GPT a další, s více než 100 miliardami parametrů, jsou postaveny na konvenční dekodér-only architektuře GPT pro autoregresivní jazykové modelování. Na druhé straně, rámec GLM-130B prozkoumává možnost použití bidirekčního General Language Modelu nebo GLM, transformátorového jazykového modelu, který se snaží využít autoregresivní blank infilling jako trénovací objektivy, a bidirekční pozornost.
Bidirekční pozornost modelu GLM na nezkorumpované nebo nemaskované kontexty je to, co odlišuje rámec GLM-130B od přístupu GPT, který využívá unidirekční přístup. Kromě toho, pro podporu obou generace a porozumění dat, model GLM kombinuje dvě strategie korupce, z nichž každá je indikována speciálním a unikátním maskovaným tokenem.
- [MASK] : [MASK] je strategie korupce, která využívá krátké mezery ve větách, délka kterých se rovná určitému procentu vstupu.
- [gMASK] : [gMASK] je strategie korupce, která využívá náhodné délky mezer na konci věty s prefixovými kontexty.
Přístup modelu GLM je to, co umožňuje rámcům zaznamenat přesnost více než 80 % v zero-shot LAMBADA jazykovém modelování a překonat rámce PaLM 540B a GPT-3.

Normalizace vrstev
Jednou z hlavních výzev, kterým vývojáři čelí při trénování rámců LLM, je nestabilita trénování, a použití vhodné normalizace vrstev (LN) může pomoci s trénováním LLM. Rámec GLM-130B využívá přístup Post-LN díky jeho výkonu na downstream úkolech.
FFNs a pozicování
Feedforward Neural Networks (FFNs) a pozicování jsou dva přístupy, které rámec GLM-130B využívá pro zavedení vysoceúrovňového výkonu a stability trénování.
Předtrénovací nastavení
Předtrénovací objektivy rámce GLM-130B zahrnují nejen multi-task učení pro malé množství tokenů, ale také samo-supervizované GLM pro autoregresivní vyplňování mezer, s očekáváním, že tento přístup pomůže rámcům GLM-130B v downstream úkolech. S tím řečeno, předtrénovací nastavení rámce GLM-130B vypadá takto.
Samo-supervizované vyplňování mezer
Jak již bylo zmíněno, rámec GLM-130B využívá dvě strategie korupce, a to [MASK] a [gMASK], a jedna z těchto strategií je nezávisle aplikována na každou trénovací sekvenci, jednu po druhé. Pro vyplňování mezer, strategie [MASK] maskuje po sobě jdoucí části 30 % trénovací sekvence, kde délka částí se rovná 15 % vstupu, a sleduje Poissonovu distribuci. Pro zbývajících 70 % sekvence je prefix každé sekvence ponechán jako kontext, a strategie [gMASK] pomáhá maskovat zbytek, a maskovaná délka je pak vzorkována pomocí uniformní distribuce.
Multi-task instrukční předtrénování
Bylo naznačeno, že použití multi-task učení pro předtrénování modelů může vést k lepšímu výkonu než fine-tuning, pro zlepšení úkolů přenosu v zero-shot nastavení. Následně, rámec GLM-130B navrhuje použití pole instrukčních dat pro jazykovou generaci, porozumění a extrakci informací během předtrénování.
Ve srovnání s jinými přístupy pro zero-shot úkol přenos, které využívají multi-task prompted fine-tuning, přístup Multi-Task Instructions Pre-Training, který rámec GLM-130B využívá, zahrnuje pouze 5 % celkového počtu tokenů, a je nastaven během fáze předtrénování, aby se zabránilo poškození jiných schopností rámce LLM nebo jinými slovy, nesupervizované volné generace.
3D paralelní strategie
Existují dva de facto postupy pro trénování velkých modelů s miliardami parametrů, tensorová modelová paralelizace a datová paralelizace. V pokusu minimalizovat využití GPU a zvládnout enormní požadavky na GPU, rámec GLM-130B implementuje 3D paralelní strategii, která kombinuje strategii pipeline modelové paralelizace s tensorovou modelovou paralelizací a datovou paralelizací.
GLM-130B: Trénovací stabilita
Trénovací stabilita je důležitým faktorem při určování kvality LLM, a trénovací stabilita je silně ovlivněna počtem tokenů, kterými prochází. Kromě toho, je důležité stanovit kompromis mezi stabilitou a efektivitou ve vztahu k formátům s plovoucí desetinnou čárkou, dané komputačními omezeními. Například, nízká přesnost formátů s plovoucí desetinnou čárkou zvyšuje efektivitu výpočtu, ale často vede k trénovacímu kolapsu, protože jsou náchylné k chybám podtečení a přetečení.
Mixed Precision
V pokusu o zvýšení přesnosti trénování a snížení využití paměti, rámec GLM-130B využívá běžnou praxi použití smíšené přesnosti, tj. FP16 pro forward a backward a FP32 pro master váhy a stav optimizeru. Stejně jako jiné populární rámce LLM, včetně BLOOM-176B a OPT-175B, fáze trénování rámce GLM-130B pomocí smíšené přesnosti čelí častým ztrátám, a frekvence těchto ztrát se zvyšuje, jak model pokračuje v trénování. Kromě toho, existují majoritní problémy, kterým vývojáři čelí při škálování transformátorů.

První, hodnota měřítka hlavní větve transformátoru může být obrovská ve hlubších vrstvách při použití Pre-LN, a v rámcu GLM-130B je řešena pomocí DeepNorm založené na Pre-LN, která zajišťuje, že hodnota měřítka zůstává omezená ve všech případech. Druhý, jak model škáluje, pozornostní skóre rostou do bodu, kdy překračují rozsah FP16.
Embedding-Layer Gradient Shrink nebo EGS
Vývojáři pracující na rámcu GLM-130B identifikovali, že norma gradientu může sloužit jako informativní indikátor pro trénovací kolaps, a trénovací kolaps obvykle následuje po skoku v normě gradientu. Příčinou těchto skoků jsou abnormální gradienty vrstvy embedding, a vývojáři pozorovali, že ve srovnání s normou gradientu ostatních vrstev, norma gradientu vrstev embedding je větší o několik řádů, a také tendenci dramaticky kolísat během počáteční fáze trénování.

GLM-130B: Výsledky a výkon
Pro hodnocení výkonu rámce GLM-130B pro anglické úkoly, rámec GLM-130B implementuje stejné nastavení, které využívají běžné rámce LLM, včetně PaLM a GPT-3, a jelikož rámec GLM-130B je bilingvní, je také hodnocen na několika čínských benchmarcích. Výkon rámce GLM-130B bude měřen na několika benchmarcích, včetně jazykového modelování, MMLU nebo Massive Multitask Language Understanding, BIG-Bench nebo Beyond the Imitation Game Benchmark, a CLUE nebo Chinese Language Understanding Evaluation.Takže začněme.
Jazykové modelování
Test jazykového modelování na rámcu GLM-130B je proveden na dvou datech: LAMBADA a Pile.
Datová sada LAMBADA je použita pro testování schopnosti LLM modelovat poslední slovo, a rámec GLM-130B dosahuje zero-shot přesnosti 80,2 v bilingválním nastavení, a na této cestě, nastavil nový benchmark rekord na datové sadě LAMBADA.
Na druhé straně, Pile je testovací sada, která se skládá z série benchmarků pro jazykové modely. V průměru, ve srovnání s GPT-3 a Jurassic-1, rámec GLM-130B dosahuje svého nejlepšího výkonu na 18 sdílených testovacích sadách z hlediska vážených BPBs. Výsledky demonstrují silné jazykové schopnosti rámce GLM-130B, a výsledky jsou zahrnuty v následující tabulce.

MMLU nebo Massive Multitask Language Understanding
MMLU nebo Massive Multitask Language Understanding je rozmanitý benchmark, který se skládá z více než 50 úkolů multiple-choice otázek týkajících se lidské inteligence a znalostí, sahajících od úrovně střední školy až po odbornou úroveň, a je vydán po procházení testovací sady Pile, a tak, slouží jako ideální test-best pro hodnocení schopností few-shot učení LLM.

Jak je vidět, v few-shot nastavení (5-shot), výkon rámce GLM-130B se blíží výkonu modelu GPT-3 po prohlédnutí téměř 300 miliard tokenů. Výkon se dále zlepšuje, jak trénování pokračuje, a když trénování skončí, rámec dosahuje přesnosti 44,8 po prohlédnutí celkových 400 miliard tokenů.
BIG-Bench nebo Beyond the Imitation Game Benchmark
BIG-Bench nebo Beyond the Imitation Game Benchmarks je výzvou pro modely, aby prokázaly své schopnosti v oblasti znalostí, rozumu a zdravého rozumu. Jak je ukázáno v následujících obrázcích, v zero-shot nastavení, rámec GLM-130B překonává rámce PaLM 540B a GPT-3 175B, což může být způsobeno MIP a bidirekční kontextovou pozorností, která zvyšuje výkon rámce GLM-130B v neviditelných úkolech v zero-shot nastavení. Kromě toho, jak počet shotů se zvyšuje, výkon rámce GLM-130B se také zlepšuje, překonávající rámec GPT-3.

CLUE nebo Chinese Language Understanding Evaluation
Čínský zero-shot výkon rámce GLM-130B je hodnocen na etablovaných NLP benchmarcích, včetně CLUE a FewCLUE, a je srovnáván s 260B ERNIE Titan 3.0, největším stávajícím čínským jazykovým modelem. Jak je vidět, rámec GLM-130B konzistentně překonává rámec 260B ERNIE Titan 3.0 na 12 různých úkolech, a dosahuje téměř 260% lepšího výkonu než rámec ERNIE na dvou abstraktních MRC datech.

Závěr
V tomto článku, jsme mluvili o rámcu GLM-130B, bilingválním předtrénovaném velkém jazykovém modelu, který se snaží podporovat inkluzivní výzkum LLM. Architektura, inženýrství a technické úsilí se snaží poskytnout komunitě AI lepší přehled o architektuře rámců LLM, efektivitě trénování a stability, předtrénovacích objektivách a dostupné interference.












