AI-modeller och plattformar
MPT-30B: MosaicML överträffar GPT-3 med en ny LLM som utvidgar gränserna för NLP
MosaicML är ett generativt AI-företag som tillhandahåller AI-distribution och skalbarhetslösningar. Deras senaste stora språkmodell (LLM) MPT-30B skapar vågor inom AI-samhället.
MosaicML:s LLM-resa började med lanseringen av MPT-7B (Mosaic Pretrained Transformer) i maj 2023, som kom med tre varianter:
- MPT-7B-StoryWriter-65k+ (för långformsskildring)
- MPT-7B-Instruct (för instruktionsföljande)
- MPT-7B-Chat (för dialoggenerering)
Modellerna vittnade om massiv framgång inom ML-samhället på grund av sin öppen källkods-natur, kommersiell användbarhet och exceptionell förmåga att hantera utökade kontextfönster.
Viktigast var att modellen var jämbördig med och i vissa fall överträffade andra jämförbara modeller (LLaMA-7B, StableLM 7B etc.). I juni hade MPT-7B-serien laddats ner över 3 miljoner gånger. Den 22 juni släppte MosaicML MPT-30B, som höjde ribban ännu högre för öppen källkods grundmodeller.
MPT-30B: En kraftfull LLM som överträffar GPT-3
MPT-30B är en öppen källkods- och kommersiellt licensierad dekodarbaserad LLM som är kraftfullare än GPT-3-175B med endast 17% av GPT-3-parametrar, dvs. 30B. Den överträffar GPT-3 på flera uppgifter. Här är en jämförelse mellan MPT-30B och GPT-3.
MPT-30B bygger på den tidigare MPT-7B-modellen. Den är beräkningsmässigt effektiv att träna jämfört med modeller av liknande storlek. Till exempel använde LLaMA-30B ungefär 1,44 gånger fler FLOPs-budget än MPT-30B, medan Falcon-40B hade en 1,27 gånger högre FLOPs-budget än MPT-30B. Här är en illustration av MPT-30B:s förbättring på olika uppgifter jämfört med dess föregångare.
Några speciella funktioner i MPT-30B är följande:
8k Token Kontextfönster
Kontextfönster i LLM:er refererar till det område av token som modellen kan överväga innan den genererar utdata. MPT-30B hade ett kontextfönster på 8000 token under träningsfasen. Den tränades först på 1T token med 2k token sekvenser och sedan på ytterligare 50B token med 8k token sekvenser (ungefär 6000 ord).
ALiBi-stöd
För att förklara denna funktion, låt oss överväga en fråga:
Hur kan MPT-30B förstå och göra förutsägelser för längre sekvenser än vad den tränades på?
MPT-30B använder en Attention med linjära bias (ALiBi)-teknik för att förstå längre sekvenser och utöka kontextfönstret bortom 8k token under finjustering eller inferens.
Istället för att beräkna positionella inbäddningar, där vi tilldelar en vektor till varje ord i sekvensen, beräknar ALiBi uppmärksamhetspoäng mellan nyckel- och frågetoken. När nyckel- och frågetoken är nära varandra är straffet lågt, men högre annars. Som ett resultat kan den underliggande transformatorarkitekturen extrapolera till långformade indata.
Effektiv Inferens- och Träningsprestanda via FlashAttention
Uppmärksamhet, dvs. fokusering på relevanta delar av indatasekvensen, är en kritisk komponent i transformatorer, men den kan vara långsam och minneskrävande, särskilt när man bearbetar långa textsekvenser.
FlashAttention är en metod som föreslagits av forskare vid Cornell University som löser detta problem för MPT-30B. Med hjälp av en teknik som kallas tiling minskar FlashAttention antalet gånger modellen behöver läsa från eller skriva till minnet, vilket påskyndar bearbetningen. Därför använder modellen den senaste FlashAttention-tekniken och NVIDIAs FasterTransformer-optimeringsbibliotek för effektiv tränings- och inferens.
Lätthet att Träna och Distribuera
Utvecklare kan träna MPT-30B från scratch eller använda MosaicML:s kontrollpunkter för snabbare distributioner. Dessutom kan den finjusteras för domänspecifika användningsfall på en viss dataset.
Modellens storlek valdes för att möjliggöra smidig distribution på en enda GPU, specifikt 1xA100-80GB i 16-bitars precision eller 1xA100-40GB i 8-bitars precision. Detta innebär att modellen var utformad för att passa inom minnesbegränsningarna för dessa GPU:er.
Kodningsförmåga
MPT-30B erbjuder också exceptionell kodningsförmåga. HumanEval är en dataset som släppts av OpenAI som innehåller 164 handgjorda programmeringsproblem. På HumanEval-dataseten överträffar modellen specialbyggda LLM-modeller, såsom StarCoder-serien.
Finjusterade Varianter: MPT-30B-Instruct och MPT-30B-Chat
MPT-30B-Instruct
LLM:er används primärt för instruktioner, såsom frågesvar, textsummering, språköversättning etc. MPT-30B-Instruct är en kommersiellt användbar (upprätthåller kommersiell CC-By-SA-3.0-licens) variant av MPT-30B som är finjusterad specifikt för instruktionsföljande uppgifter. För finjustering användes följande dataset:
- FLAN
- P3
- Alpaca
- Dolly-15k
Dolly-datasetet utökades dessutom med Anthropics Helpful and Harmless-dataset för instruktionsfinjustering. Dessutom användes en mångfald av dataset för datautökning, som följer:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat är en finjusterad version av MPT-30B för dialoggenerering. Den är en forskningsartefakt som släppts under CC-By-NC-SA-4.0-licens, vilket tillåter endast icke-kommersiellt bruk. Modellen finjusterades med hjälp av olika språkdataset, inklusive:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM:er delar en stor del av den multi-miljarddollar stora generativa AI-marknaden, som har upplevt enorm tillväxt på kort tid efter att ChatGPT revolutionerade landskapet förra året. MPT-familjen är en grundläggande del av denna revolution. I nästa framtid kan vi förvänta oss att se kommersiellt tillgängliga öppen källkodsmodeller som är ännu kraftfullare och effektivare än MPT-familjen.
För den senaste AI-nyheten, besök unite.ai.















