AI-modeller og platforme
MPT-30B: MosaicML overgår GPT-3 med en ny LLM, der udvider grænserne for NLP
MosaicML er et generativt AI-firma, der tilbyder løsninger til AI-udvikling og skalerbarhed. Deres seneste store sprogmodel (LLM) MPT-30B skaber bølger i AI-fællesskabet.
MosaicML’s LLM-rejse startede med udgivelsen af MPT-7B (Mosaic Pretrained Transformer) i maj 2023, der kom med tre varianter:
- MPT-7B-StoryWriter-65k+ (til langformsskabelse)
- MPT-7B-Instruct (til instruktionsfølging)
- MPT-7B-Chat (til dialoggenerering)
Modellerne oplevede massiv succes i ML-fællesskabet på grund af deres open-source-natur, kommercielle brugbarhed og exceptionelle evne til at håndtere udvidede kontekstvinduer.
Mest væsentligt var modellen på niveau med og i visse tilfælde overgik andre sammenlignelige modeller (LLaMA-7B, StableLM 7B osv.). Inden juni havde MPT-7B-serien været downloadet over 3 millioner gange. Den 22. juni udgav MosaicML MPT-30B, der løftede standarden endnu højere for open-source grundmodeller.
MPT-30B: En kraftfuld LLM, der overgår GPT-3
MPT-30B er en open-source- og kommercielt licenseret decoder-baseret LLM, der er mere kraftfuld end GPT-3-175B med kun 17% af GPT-3-parametrene, dvs. 30B. Den overgår GPT-3 på flere opgaver. Her er en sammenligning mellem MPT-30B og GPT-3.
MPT-30B bygger videre på den forrige MPT-7B-model. Den er beregningsmæssigt effektiv at træne sammenlignet med modeller af samme størrelse. For eksempel brugte LLaMA-30B ca. 1,44 gange flere FLOPs-end MPT-30B, mens Falcon-40B havde en 1,27 gange højere FLOPs-end MPT-30B. Her er en illustration af MPT-30B’s forbedring på forskellige opgaver i forhold til dens forgænger.
Nogle særlige funktioner i MPT-30B er følgende:
8k Token Kontekstvindue
Kontekstvindue i LLM’er refererer til rækken af tokens, modellen kan overveje, før den genererer output. MPT-30B havde et kontekstvindue på 8000 tokens under træningstiden. Den blev først trænet på 1T token ved hjælp af 2k token-sekvenser og derefter yderligere 50B tokens af 8k token-sekvenser (omkring 6000 ord).
ALiBi-understøttelse
For at forklare denne funktion, lad os overveje et spørgsmål:
Hvordan kan MPT-30B forstå og gøre forudsigelser for længere sekvenser end det, den blev trænet på?
MPT-30B bruger en Attention med lineære bias (ALiBi)-teknik til at forstå længere sekvenser og udvide kontekstvinduet ud over 8k tokens under finjustering eller inferens.
I stedet for at beregne positionelle indlejring, hvor vi tildeler en vektor til hvert ord i sekvensen, beregner ALiBi opmærksomheds-score mellem nøgle- og forespørgsels-tokens. Når nøgle- og forespørgsels-tokens er tæt sammen, er straffen lav, men højere ellers. Som resultat kan den underliggende transformatorarkitektur ekstrapolere til langformindtastninger.
Effektiv Inferens- & Træningspræstation via FlashAttention
Opmærksomhed, dvs. fokus på relevante dele af inputsekvensen, er en kritisk komponent af transformatorer, men det kan være langsomt og kræve meget hukommelse, især når der behandles lange tekstsekvenser.
FlashAttention er en tilgang foreslået af forskere ved Cornell University, der løser dette problem for MPT-30B. Ved hjælp af en teknik kaldet tiling reducerer FlashAttention antallet af gange, modellen behøver at læse fra eller skrive til hukommelse, hvilket øger behandlingen. Derfor anvender modellen den nyeste FlashAttention-teknik og NVIDIA’s FasterTransformer-optimeringsbibliotek til effektiv træning og inferens.
Lettelse af Træning & Udrulning
Udviklere kan træne MPT-30B fra scratch eller bruge MosaicML’s checkpoints til hurtigere udrulning. Desuden kan den finjusteres for domænespecifikke brugsområder på en bestemt dataset.
Modellens størrelse blev valgt for at muliggøre let udrulning på en enkelt GPU, specifikt 1xA100-80GB i 16-bit præcision eller 1xA100-40GB i 8-bit præcision. Dette betyder, at modellen var designet til at kunne håndtere de begrænsninger, der er på disse GPU’er.
Kodningsfunktioner
MPT-30B tilbyder også exceptionelle kodningsfunktioner. HumanEval er en dataset udgivet af OpenAI, der indeholder 164 håndskabte programmeringsproblemer. På HumanEval-datasættet overgår modellen formål-byggede LLM-modeller, såsom StarCoder-serien.
Finjusterede Varianter: MPT-30B-Instruct & MPT-30B-Chat
MPT-30B-Instruct
LLM’er bruges primært til instruktioner, såsom spørgsmålssvar, tekstsummering, sprogoversættelse osv. MPT-30B-Instruct er en kommercielt brugbar (beholder kommerciel CC-By-SA-3.0-licens) variant af MPT-30B, der er finjusteret specifikt til instruktionsfølgende opgaver. Til finjustering blev følgende datasæt brugt:
- FLAN
- P3
- Alpaca
- Dolly-15k
Dolly-datasættet blev yderligere udvidet med Anthropics hjælpsomme og harmløse dataset til instruktionsfinjustering. Desuden blev et bredt udvalg af datasæt brugt til dataudvidelse, som følger:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat er en finjusteret version af MPT-30B til dialoggenerering. Den er en forskningsartefakt udgivet under CC-By-NC-SA-4.0-licens, der kun tillader ikke-kommerciel brug. Modellen blev finjusteret ved hjælp af forskellige sprogdatasæt, herunder:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM’er udgør en stor del af den multi-milliard dollar store generative AI-marked, der har oplevet enorm vækst på kort tid efter, at ChatGPT revolutionerede landskabet sidste år. MPT-familien er en grundlæggende del af denne revolution. I den nærmeste fremtid kan vi forvente at se kommercielt tilgængelige open-source-modeller, der er langt mere kraftfulde og effektive end MPT-familien.
For de seneste AI-nyheder, besøg unite.ai.















