AI-modeller og platforme

Decoder-baserede store sprogmodeller: En komplet guide

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Store sprogmodeller (LLM’er) har revolutioneret omrÃĨdet for naturlig sprogbehandling (NLP) ved at demonstrere bemÃĶrkelsesvÃĶrdige evner i generering af menneske-lignende tekst, besvarende af spÃļrgsmÃĨl og hjÃĶlpe med en lang rÃĶkke sprog-relaterede opgaver. I hjertet af disse kraftfulde modeller ligger decoder-only transformer-arkitekturen, en variant af den oprindelige transformer-arkitektur, der blev foreslÃĨet i den seminale artikel “Attention is All You Need” af Vaswani et al.

I denne omfattende guide vil vi udforske de indre mekanismer i decoder-baserede LLM’er, dykke ned i de grundlÃĶggende byggesten, arkitektoniske innovationer og implementeringsdetaljer, der har fÃļrt disse modeller til fronten af NLP-forskning og -anvendelser.

Transformer-arkitekturen: En opfriskning

FÃļr vi dykker ned i detaljerne om decoder-baserede LLM’er, er det essentiel at gensende transformer-arkitekturen, som er fundamentet for disse modeller. Transformeren introducerede en ny tilgang til sekvensmodellering, der kun afhÃĶnger af attention-mekanismer til at fange lange afhÃĶngigheder i data, uden behov for rekurrente eller convolutionelle lag.

Transformers Architecture

Transformers Architecture

Den oprindelige transformer-arkitektur bestÃĨr af to hovedkomponenter: en encoder og en decoder. Encoderen behandler input-sekvensen og genererer en kontekstualiseret reprÃĶsentation, der derefter forbruges af decoderen til at producere output-sekvensen. Denne arkitektur var oprindeligt designed til maskinoversÃĶttelse, hvor encoderen behandler input-sÃĶtningen i kilde-sproget, og decoderen genererer den tilsvarende sÃĶtning i mÃĨl-sproget.

Selv-attention: NÃļglen til Transformers succes

I hjertet af transformeren ligger selv-attention-mekanismen, en kraftfuld teknik, der tillader modellen at vÃĶgte og aggregere information fra forskellige positioner i input-sekvensen. I modsÃĶtning til traditionelle sekvensmodeller, der behandler input-token sekventielt, tillader selv-attention modellen at fange afhÃĶngigheder mellem enhver par token, uanset deres position i sekvensen.

Multiquery attention

Multiquery attention

Selv-attention-operationen kan deles op i tre hovedtrin:

  1. Query, Key og Value-projektioner: Input-sekvensen projiceres pÃĨ tre separate reprÃĶsentationer: queries (Q), keys (K) og values (V). Disse projektioner opnÃĨs ved at multiplicere input med lÃĶrende vÃĶgtmatricer.
  2. Attention-score-beregning: For hver position i input-sekvensen beregnes attention-scores ved at tage dot-produktet mellem den tilsvarende query-vektor og alle key-vektorer. Disse scores reprÃĶsenterer relevansen af hver position til den aktuelle position, der behandles.
  3. VÃĶgtet sum af Values: Attention-scores normaliseres ved hjÃĶlp af en softmax-funktion, og de resulterende attention-vÃĶgte bruges til at beregne en vÃĶgtet sum af value-vektorerne, hvilket producerer output-reprÃĶsentationen for den aktuelle position.

Multi-head attention, en variant af selv-attention-mekanismen, tillader modellen at fange forskellige typer af relationer ved at beregne attention-scores pÃĨ tvÃĶrs af multiple “hoveder” i parallel, hver med sin egen sÃĶt af query-, key- og value-projektioner.

Arkitektoniske varianter og konfigurationer

Selvom de grundlÃĶggende principper for decoder-baserede LLM’er forbliver konsekvente, har forskere udforsket forskellige arkitektoniske varianter og konfigurationer for at forbedre ydeevnen, effektiviteten og generaliserings-evnen. I dette afsnit vil vi dykke ned i de forskellige arkitektoniske valg og deres implikationer.

Arkitekturtyper

Decoder-baserede LLM’er kan bredt klassificeres i tre hovedtyper: encoder-decoder, causal decoder og prefix decoder. Hver arkitekturtype udviser distinkte attention-mÃļnstre.

Encoder-Decoder-Arkitektur

Baseret pÃĨ den oprindelige Transformer-model, bestÃĨr encoder-decoder-arkitekturen af to stable: en encoder og en decoder. Encoderen bruger stablede multi-head selv-attention-lag til at kodificere input-sekvensen og generere latente reprÃĶsentationer. Decoderen udfÃļrer derefter cross-attention pÃĨ disse reprÃĶsentationer til at generere output-sekvensen. Selvom denne arkitektur er effektiv i forskellige NLP-opgaver, adopterer fÃĨ LLM’er, sÃĨsom Flan-T5, denne arkitektur.

Causal Decoder-Arkitektur

Causal decoder-arkitekturen inkorporerer en unidirektional attention-maske, der tillader hver input-token at lytte til kun tidligere token og sig selv. BÃĨde input- og output-token behandles inden for samme decoder. Notable modeller som GPT-1, GPT-2 og GPT-3 er bygget pÃĨ denne arkitektur, med GPT-3, der viser bemÃĶrkelsesvÃĶrdige in-context-lÃĶrings-evner. Mange LLM’er, herunder OPT, BLOOM og Gopher, har bredt adopteret causal decodere.

Prefix Decoder-Arkitektur

OgsÃĨ kendt som den ikke-kausale decoder, modificerer prefix decoder-arkitekturen masking-mekanismen i causal decodere til at aktivere bidirektionel attention over prefix-token og unidirektionel attention pÃĨ genererede token. Ligesom encoder-decoder-arkitekturen kan prefix-decodere kodificere prefix-sekvensen bidirektionelt og forudsige output-token autoregressivt ved hjÃĶlp af fÃĶlles parametre. LLM’er baseret pÃĨ prefix-decodere inkluderer GLM130B og U-PaLM.

Alle tre arkitekturtyper kan udvides ved hjÃĶlp af mixture-of-experts (MoE)-skaleringsteknikken, der sparsomt aktiverer en undermÃĶngde af neurale netvÃĶrksvÃĶgte for hver input. Denne tilgang er blevet anvendt i modeller som Switch Transformer og GLaM, hvor Ãļgning af antallet af eksperter eller total parameterstÃļrrelse har vist betydelige ydeevnesforbedringer.

Decoder-Only Transformer: Embracing the Autoregressive Nature

Selvom den oprindelige transformer-arkitektur var designed til sekvens-til-sekvens-opgaver som maskinoversÃĶttelse, kan mange NLP-opgaver, sÃĨsom sprogmodellering og tekstgenerering, vÃĶre rammet som autoregressive problemer, hvor modellen genererer ÃĐt token ad gangen, betinget af tidligere genererede token.

Indgangen til decoder-only transformer, en simplificeret variant af transformer-arkitekturen, der kun beholder decoder-komponenten. Denne arkitektur er sÃĶrligt velegnet til autoregressive opgaver, da den genererer output-token ÃĐt ad gangen, udnyttende tidligere genererede token som input-kontekst.

Den vÃĶsentlige forskel mellem decoder-only transformer og den oprindelige transformer-decoder ligger i selv-attention-mekanismen. I decoder-only-indstillingen modificeres selv-attention-operationen til at forhindre, at modellen lytter til fremtidige token, en egenskab kendt som kausalitet. Dette opnÃĨs gennem en teknik kaldet “masked selv-attention”, hvor attention-scores, der svarer til fremtidige positioner, sÃĶttes til negative uendelighed, effektivt maskeret under softmax-normaliseringssteget.

Arkitektoniske komponenter af Decoder-baserede LLM’er

Selvom de grundlÃĶggende principper for selv-attention og masked selv-attention forbliver de samme, har moderne decoder-baserede LLM’er introduceret flere arkitektoniske innovationer for at forbedre ydeevnen, effektiviteten og generaliserings-evnen. Lad os udforske nogle af de nÃļglekomponenter og -teknikker, der anvendes i state-of-the-art LLM’er.

Input-reprÃĶsentation

FÃļr behandlingen af input-sekvensen anvender decoder-baserede LLM’er tokenisering og embedding-teknikker til at konvertere den rÃĨ tekst til en numerisk reprÃĶsentation, der er egnet for modellen.

vector embedding

vector embedding

Tokenisering: Tokeniseringprocessen konverterer input-teksten til en sekvens af token, der kan vÃĶre ord, subord eller selv enkelttegn, afhÃĶngigt af den valgte tokeniseringstrategi. PopulÃĶre tokeniseringsteknikker for LLM’er inkluderer Byte-Pair Encoding (BPE), SentencePiece og WordPiece. Disse metoder sÃļger at finde en balance mellem vocabulÃĶrstÃļrrelse og reprÃĶsentationsgranularitet, hvilket tillader modellen at hÃĨndtere sjÃĶldne eller udenfor-vocabulÃĶr-ord effektivt.

Token-embeddings: Efter tokenisering tildeles hvert token en tÃĶt vektorreprÃĶsentation kaldet en token-embedding. Disse embeddings lÃĶres under trÃĶningsprocessen og fanger semantiske og syntaktiske relationer mellem token.

Positionelle embeddings: Transformer-modeller behandler hele input-sekvensen samtidig, mangler den indbyggede forestilling om token-positioner, der er til stede i rekurrente modeller. For at inkorporere positionelle oplysninger tilfÃļjes positionelle embeddings til token-embeddings, hvilket tillader modellen at skelne mellem token baseret pÃĨ deres position i sekvensen. Tidlige LLM’er anvendte faste positionelle embeddings baseret pÃĨ sinusfunktioner, mens mere nyere modeller har udforsket lÃĶrbare positionelle embeddings eller alternative positionskodningsteknikker som rotary positionelle embeddings.

Multi-Head Attention Blocks

De grundlÃĶggende byggesten i decoder-baserede LLM’er er multi-head attention-lag, der udfÃļrer den masked selv-attention-operation, der blev beskrevet tidligere. Disse lag stablet multiple gange, hvor hvert lag lytter til outputtet fra det foregÃĨende lag, hvilket tillader modellen at fange stadig mere komplekse afhÃĶngigheder og reprÃĶsentationer.

Attention-hoveder: Hvert multi-head attention-lag bestÃĨr af multiple “attention-hoveder”, hver med sit eget sÃĶt af query-, key- og value-projektioner. Dette tillader modellen at lytte til forskellige aspekter af input-sekvensen samtidig, hvilket fanger forskellige relationer og mÃļnstre.

Residuelle forbindelser og lag-normalisering: For at lette trÃĶningen af dybe netvÃĶrk og mindske det forsvindende gradient-problem, anvender decoder-baserede LLM’er residuelle forbindelser og lag-normaliseringsteknikker. Residuelle forbindelser tilfÃļjer inputtet af et lag til dets output, hvilket tillader graderne at flyde mere let under backpropagation. Lag-normalisering hjÃĶlper med at stabilisere aktiveringerne og graderne, hvilket yderligere forbedrer trÃĶningsstabiliteten og ydeevnen.

Feed-Forward Layers

Ud over multi-head attention-lag inkorporerer decoder-baserede LLM’er feed-forward-lag, der anvender et simpelt feed-forward neuralt netvÃĶrk til hver position i sekvensen. Disse lag introducerer ikke-lineÃĶre transformationer og tillader modellen at lÃĶre mere komplekse reprÃĶsentationer.

Aktivationsfunktioner: Valget af aktivationsfunktion i feed-forward-lagene kan have en betydelig indvirkning pÃĨ modellens ydeevne. Selvom tidligere LLM’er afhÃĶngigt af den bredt anvendte ReLU-aktivationsfunktion, har mere nyere modeller adopteret mere avancerede aktivationsfunktioner som Gaussian Error Linear Unit (GELU) eller SwiGLU-aktivationsfunktionen, der har vist forbedret ydeevne.

Sparse Attention og Effektive Transformers

Selvom selv-attention-mekanismen er kraftfuld, kommer den med en kvadratisk beregningskompleksitet i forhold til sekvenslÃĶngden, hvilket gÃļr den beregningsmÃĶssigt dyrt for lange sekvenser. For at imÃļdegÃĨ denne udfordring er flere teknikker blevet foreslÃĨet for at reducere de beregnings- og hukommelseskrav til selv-attention, hvilket muliggÃļr effektiv behandling af lÃĶngere sekvenser.

Sparse Attention: Sparse attention-teknikker, sÃĨsom den anvendt i GPT-3-modellen, tillader modellen at lytte til en undermÃĶngde af positioner i input-sekvensen, i stedet for at beregne attention-scores for alle positioner. Dette kan betydeligt reducere den beregningskompleksitet, mens ydeevnen forbliver rimelig.

Sliding Window Attention: Introduceret i Mistral 7B-modellen, er sliding window attention (SWA) en simpel, men effektiv teknik, der begrÃĶnser attention-omfanget for hver token til en fast vinduestÃļrrelse. Denne tilgang udnytter transformer-lagernes evne til at overfÃļre information pÃĨ tvÃĶrs af multiple lag, hvilket effektivt Ãļger attention-omfanget uden den kvadratiske kompleksitet af fuld selv-attention.

Rullende Buffer Cache: For yderligere at reducere hukommelseskrav, isÃĶr for lange sekvenser, anvender Mistral 7B-modellen en rullende buffer-cache. Denne teknik gemmer og genanvender de beregnede key- og value-vektorer for en fast vinduestÃļrrelse, undgÃĨr redundant beregning og minimiserer hukommelsesbrug.

Grupperet Query Attention: Introduceret i LLaMA 2-modellen, er gruppet query attention (GQA) en variant af multi-query attention-mekanismen, der inddeler attention-hoveder i grupper, hvor hver gruppe deler en fÃĶlles key- og value-matrix. Denne tilgang finder en balance mellem effektiviteten af multi-query attention og ydeevnen af standard selv-attention, hvilket giver forbedret inferenstid, mens kvaliteten af resultaterne opretholdes.

Grouped-query attention

Grouped-query attention

Model StÃļrrelse og Skalering

En af de definerende karakteristika af moderne LLM’er er deres enorme stÃļrrelse, med antallet af parametre, der varierer fra milliarder til hundredvis af milliarder. At Ãļge modelstÃļrrelsen har vÃĶret en afgÃļrende faktor i opnÃĨelse af state-of-the-art-ydeevne, da stÃļrre modeller kan fange mere komplekse mÃļnstre og relationer i data.

Parameterantal: Antallet af parametre i en decoder-baseret LLM bestemmes primÃĶrt af embedding-dimensionen (d_model), antallet af attention-hoveder (n_heads), antallet af lag (n_layers) og vocabulÃĶrstÃļrrelsen (vocab_size). For eksempel har GPT-3-modellen 175 milliarder parametre, med d_model = 12288, n_heads = 96, n_layers = 96 og vocab_size = 50257.

Model-parallelisme: TrÃĶning og implementering af sÃĨdanne massive modeller krÃĶver betydelige beregningsressourcer og specialiseret hardware. For at overvinde denne udfordring er model-parallelisme-teknikker blevet anvendt, hvor modellen deles pÃĨ tvÃĶrs af multiple GPU’er eller TPU’er, hvor hver enhed er ansvarlig for en del af beregningerne.

Mixture-of-Experts: En anden tilgang til at skale LLM’er er mixture-of-experts (MoE)-arkitekturen, der kombinerer multiple eksperter, hvor hver ekspert specialiserer sig i en bestemt undermÃĶngde af data eller opgave. Mixtral 8x7B-modellen er et eksempel pÃĨ en MoE-model, der anvender Mistral 7B som grundmodel, opnÃĨende overlegen ydeevne, mens beregningskompleksiteten opretholdes.

Inferens og Tekstgenerering

En af de primÃĶre anvendelser af decoder-baserede LLM’er er tekstgenerering, hvor modellen genererer koherent og naturlig-lydende tekst baseret pÃĨ en given prompt eller kontekst.

Autoregressiv dekodning: Under inferens genererer decoder-baserede LLM’er tekst pÃĨ en autoregressiv mÃĨde, forudsiger ÃĐt token ad gangen baseret pÃĨ tidligere genererede token og input-prompten. Denne proces fortsÃĶtter, indtil en forudbestemt stop-kriterie er opnÃĨet, sÃĨsom at nÃĨ en maksimal sekvenslÃĶngde eller generere et slut-pÃĨ-sekvens-token.

Sampling-strategier: For at generere diverse og realistiske tekst kan forskellige sampling-strategier anvendes, sÃĨsom top-k sampling, top-p sampling (ogsÃĨ kendt som nucleus sampling) eller temperatur-justering. Disse teknikker kontrollerer trade-off’en mellem diversitet og kohÃĶrens af den genererede tekst ved at justere sandsynlighedsfordelingen over vocabulÃĶret.

Prompt-engineering: Kvaliteten og specifikationen af input-prompten kan have en betydelig indvirkning pÃĨ den genererede tekst. Prompt-engineering, kunsten at skabe effektive promptrer, er blevet en afgÃļrende aspekt af at udnytte LLM’er til forskellige opgaver, hvilket tillader brugere at guide modellens genereringsproces og opnÃĨ Ãļnskede output.

Menneske-i-lÃļkken dekodning: For yderligere at forbedre kvaliteten og kohÃĶrens af den genererede tekst er teknikker som Reinforcement Learning from Human Feedback (RLHF) blevet anvendt. I denne tilgang giver menneskelige vurderere feedback pÃĨ modellens genererede tekst, der derefter anvendes til at finjustere modellen, effektivt tilpasser den til menneskelige prÃĶferencer og forbedrer dens output.

Fremgang og Fremtidige Retninger

OmrÃĨdet for decoder-baserede LLM’er udvikler sig hurtigt, med nye forskningsresultater og gennembrud, der kontinuerligt skyder grÃĶnserne for, hvad disse modeller kan opnÃĨ. Her er nogle bemÃĶrkelsesvÃĶrdige fremgang og potentielle fremtidige retninger:

Effektive Transformer-varianten: Selvom sparse attention og sliding window attention har gjort betydelige fremskridt i forbedring af decoder-baserede LLM’ers effektivitet, udforsker forskere aktivt alternative transformer-arkitekturer og attention-mekanismer for at yderligere reducere beregningskrav, mens ydeevnen opretholdes eller forbedres.

Flervalgs LLM’er: At udvide kapaciteten af LLM’er ud over tekst, sigter flervalgs-modeller mod at integrere multiple modaliteter, sÃĨsom billeder, lyd eller video, i en enkelt, samlet ramme. Dette ÃĨbner op for spÃĶndende muligheder for anvendelser som billed-til-tekst, visuelt spÃļrgsmÃĨl-svar og multimedie-indholdsgenerering.

Styret Generering: At give brugere mulighed for at styre den genererede tekst pÃĨ en finmÃĶrket mÃĨde er en udfordring, men vigtig retning for LLM’er. Teknikker som styret tekstgenerering og prompt-justering sigter mod at give brugerne mere granuleret kontrol over forskellige attributter af den genererede tekst, sÃĨsom stil, tone eller bestemte indholdskrav.

Konklusion

Decoder-baserede LLM’er er blevet en transformerende kraft i omrÃĨdet for naturlig sprogbehandling, skubben til grÃĶnserne for, hvad der er muligt med sproggenerering og -forstÃĨelse. Fra deres beskedne begyndelse som en simplificeret variant af transformer-arkitekturen er disse modeller udviklet til at blive meget avancerede og kraftfulde systemer, der udnytter cutting-edge-teknikker og arkitektoniske innovationer.

Da vi fortsÃĶtter med at udforske og avancere decoder-baserede LLM’er, kan vi forvente at opleve endnu mere bemÃĶrkelsesvÃĶrdige resultater i sprog-relaterede opgaver, sÃĨvel som integrationen af disse modeller i en bred vifte af anvendelser og domÃĶner. Det er dog afgÃļrende at imÃļdegÃĨ de etiske overvejelser, fortolkningsudfordringer og potentielle bias, der kan opstÃĨ fra den omfattende implementering af disse kraftfulde modeller.

Ved at blive i fronten af forskningen, fremme ÃĨben samarbejde og opretholde en stÃĶrk forpligtelse til ansvarlig AI-udvikling kan vi lÃĨse den fulde potentiale i decoder-baserede LLM’er, samtidig med at vi sikrer, at de udvikles og anvendes pÃĨ en sikker, etisk og gavnlig mÃĨde for samfundet.

Jeg har brugt de sidste fem ÃĨr pÃĨ at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har fÃļrt mig til at bidrage til over 50 forskellige software-ingeniÃļrprojekter, med en sÃĶrlig fokus pÃĨ AI/ML. Min fortsatte nysgerrighed har ogsÃĨ fÃļrt mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.