AI-modellen en platforms
MPT-30B: MosaicML overtreft GPT-3 met een nieuwe LLM om de grenzen van NLP te verleggen
MosaicML is een generatieve AI-bedrijf dat AI-implementatie- en schaalbaarheidsoplossingen biedt. Hun laatste grote taalmodel (LLM) MPT-30B maakt golven in de AI-gemeenschap.
MosaicML’s LLM-reis begon met de release van MPT-7B (Mosaic Pretrained Transformer) in mei 2023, dat drie varianten had:
- MPT-7B-StoryWriter-65k+ (voor langformaatverhalengeneratie)
- MPT-7B-Instruct (voor korte instructievolging)
- MPT-7B-Chat (voor dialooggeneratie)
De modellen werden een enorm succes in de ML-gemeenschap vanwege hun open-source-natuur, commerciële bruikbaarheid en uitzonderlijke mogelijkheid om uitgebreide contextvensters te verwerken.
Het belangrijkste is dat het model gelijkwaardig was aan en in sommige gevallen beter presteerde dan andere vergelijkbare modellen (LLaMA-7B, StableLM 7B, enz.). Door juni was de MPT-7B-serie meer dan 3 miljoen keer gedownload. Op 22 juni bracht MosaicML MPT-30B uit, dat de lat nog hoger legde voor open-source-foundationmodellen.
De MPT-30B: een krachtig LLM dat GPT-3 overtreft
MPT-30B is een open-source- en commercieel gelicentieerd decoder-gebaseerd LLM dat krachtiger is dan GPT-3-175B met slechts 17% van de GPT-3-parameters, d.w.z. 30B. Het overtreft GPT-3 op verschillende taken. Hier is een vergelijking tussen MPT-30B en GPT-3.
MPT-30B bouwt voort op het vorige MPT-7B-model. Het is computationeel efficiënt om te trainen in vergelijking met modellen van vergelijkbare grootte. Zo gebruikte LLaMA-30B ongeveer 1,44 keer meer FLOPs-budget dan MPT-30B, terwijl Falcon-40B een 1,27 keer hoger FLOPs-budget had dan MPT-30B. Hier is een illustratie van MPT-30B’s verbetering op verschillende taken ten opzichte van zijn voorganger.
Enkele speciale functies van MPT-30B zijn als volgt:
8k Token Context Window
Contextwindow in LLM’s verwijst naar het bereik van tokens dat het model kan overwegen voordat het de uitvoer genereert. MPT-30B had een contextwindow van 8000 tokens tijdens de training. Het werd eerst getraind op 1T token met 2k token-sequenties en vervolgens op 50B tokens van 8k token-sequenties (ongeveer 6000 woorden).
ALiBi-ondersteuning
Om deze functie uit te leggen, laten we een vraag overwegen:
Hoe kan MPT-30B langer sequenties begrijpen en voorspellingen doen dan waarop het getraind is?
MPT-30B gebruikt een Attention with Linear Biases (ALiBi)-techniek om langer sequenties te begrijpen en het contextwindow te verlengen tot 8k tokens tijdens finetuning of inferentie.
In plaats van positionele inbeddingen te berekenen waarbij we een vector toewijzen aan elk woord in de sequentie, berekent ALiBi attentiescores tussen sleutel- en querytokens. Wanneer de sleutel- en querytokens dicht bij elkaar liggen, is de straf laag, maar hoger anders. Als gevolg hiervan kan de onderliggende transformatorarchitectuur extrapoleren naar langformaat-input.
Efficiënte inferentie- en trainingsprestaties via FlashAttention
Attentie, dat wil zeggen, focussen op relevante delen van de invoersequentie, is een kritisch onderdeel van transformators, maar kan langzaam en geheugenvretend zijn, vooral bij het verwerken van lange tekstsequenties.
FlashAttention is een benadering voorgesteld door onderzoekers van Cornell University die dit probleem voor MPT-30B aanpakt. Met behulp van een techniek genaamd tiling, vermindert FlashAttention het aantal keren dat het model moet lezen of schrijven naar het geheugen, waardoor de verwerking sneller wordt. Daarom gebruikt het model de state-of-the-art FlashAttention-techniek en NVIDIA’s FasterTransformer-optimalisatiebibliotheek voor efficiënte training en inferentie.
Gemakkelijke training en implementatie
Ontwikkelaars kunnen MPT-30B van scratch trainen of MosaicML’s checkpoints gebruiken voor snellere implementaties. Bovendien kan het worden gefinetuned voor domeinspecifieke use-cases op een specifieke dataset.
De modellengte was gekozen om een moeiteloze implementatie op één GPU mogelijk te maken, specifiek 1xA100-80GB in 16-bitsprecisie of 1xA100-40GB in 8-bitsprecisie. Dit betekent dat het model was ontworpen om binnen de geheugengrenzen van deze GPU’s te passen.
Coding-mogelijkheden
MPT-30B biedt uitzonderlijke coding-mogelijkheden. HumanEval is een dataset uitgebracht door OpenAI die 164 handgemaakte programmeringsproblemen bevat. Op de HumanEval-dataset overtreft het model doelgerichte LLM-modellen, zoals de StarCoder-serie.
Fine-tuned varianten: MPT-30B-Instruct en MPT-30B-Chat
MPT-30B-Instruct
LLM’s worden voornamelijk gebruikt voor instructies zoals vraagbeantwoording, tekstsamenvatting, taalvertaling, enz. MPT-30B-Instruct is een commercieel bruikbare (behoudt commerciële CC-By-SA-3.0-licentie) variant van MPT-30B die specifiek is gefinetuned voor instructievolgingstaken. Voor finetuning werden de volgende datasets gebruikt:
- FLAN
- P3
- Alpaca
- Dolly-15k
De Dolly-dataset werd verder aangevuld met Anthropic’s Helpful and Harmless-dataset voor instructiefinetuning. Bovendien werd een diverse reeks datasets gebruikt voor data-augmentatie, die als volgt zijn:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat is een gefinetuned versie van MPT-30B voor dialooggeneratie. Het is een onderzoeksartefact dat onder de CC-By-NC-SA-4.0-licentie is uitgebracht, waardoor alleen niet-commercieel gebruik is toegestaan. Het model werd gefinetuned met behulp van verschillende taaldatasets, waaronder:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM’s delen een groot deel van de miljarden dollar generatieve AI-markt, die een enorme groei heeft doorgemaakt na de revolutie van ChatGPT vorig jaar. De MPT-familie is een fundamenteel onderdeel van deze revolutie. In de nabije toekomst kunnen we verwachten commercieel beschikbare open-source-modellen te zien die krachtiger en efficiënter zijn dan de MPT-familie.
Voor het laatste AI-nieuws, bezoek unite.ai.















