Modele și platforme AI
MPT-30B: MosaicML depășește GPT-3 cu un nou LLM pentru a extinde granițele NLP
MosaicML este o companie de inteligență artificială generativă care oferă soluții de implementare și scalabilitate AI. Noul lor model de limbaj mare (LLM) MPT-30B face valuri în comunitatea AI.
Călătoria LLM a MosaicML a început cu lansarea MPT-7B (Mosaic Pretrained Transformer) în mai 2023, care a venit cu trei variante:
- MPT-7B-StoryWriter-65k+ (pentru generarea de povești lungi)
- MPT-7B-Instruct (pentru urmărirea instrucțiunilor scurte)
- MPT-7B-Chat (pentru generarea de dialoguri)
Modelele au fost un succes masiv în comunitatea ML, datorită naturii lor deschise, a capacității comerciale și a capacității excepționale de a gestiona ferestre de context extinse.
Mai important, modelul a fost la fel de bun ca și alte modele comparabile (LLaMA-7B, StableLM 7B, etc.) și, în unele cazuri, le-a depășit. Până în iunie, seria MPT-7B a fost descărcată de peste 3 milioane de ori. La 22 iunie, MosaicML a lansat MPT-30B, care a ridicat și mai mult bara pentru modelele de bază deschise.
MPT-30B: Un LLM puternic care depășește GPT-3
MPT-30B este un LLM deschis și cu licență comercială, bazat pe decodificator, care este mai puternic decât GPT-3-175B cu doar 17% din parametrii GPT-3, adică 30B. Acesta depășește GPT-3 în mai multe sarcini. Iată o comparație între MPT-30B și GPT-3.
MPT-30B se bazează pe modelul anterior MPT-7B. Acesta este eficient din punct de vedere computațional pentru a fi antrenat în comparație cu modelele de aceeași mărime. De exemplu, LLaMA-30B a utilizat aproximativ 1,44 ori mai mult buget FLOPs decât MPT-30B, în timp ce Falcon-40B a avut un buget FLOPs cu 1,27 ori mai mare decât MPT-30B. Iată o ilustrare a îmbunătățirii MPT-30B în diferite sarcini față de predecesorul său.
Unele caracteristici speciale ale MPT-30B sunt următoarele:
Fereastră de context de 8k tokeni
Fereastra de context în LLM-urile se referă la gama de tokeni pe care modelul îi poate lua în considerare înainte de a genera ieșirea. MPT-30B a avut o fereastră de context de 8000 de tokeni în timpul antrenamentului. Acesta a fost antrenat mai întâi pe 1T token folosind secvențe de 2k tokeni și apoi pe 50B tokeni de secvențe de 8k tokeni (aproximativ 6000 de cuvinte).
Suport ALiBi
Pentru a explica această caracteristică, să considerăm o întrebare:
Cum poate MPT-30B să înțeleagă și să facă predicții pentru secvențe mai lungi decât cele pe care a fost antrenat?
MPT-30B utilizează o tehnică de Atenție cu Biase Lineare (ALiBi) pentru a înțelege secvențe mai lungi și a extinde fereastra de context dincolo de 8k tokeni în timpul finisării sau inferenței.
În loc de a calcula încorporări poziționale în care se atribuie un vector fiecărui cuvânt din secvență, ALiBi calculează scoruri de atenție între tokenii cheie și tokenii de întrebare. Când tokenii cheie și tokenii de întrebare sunt apropiați, penalizarea este scăzută, dar mai mare în caz contrar. Ca rezultat, arhitectura de bază transformator poate extrapola la intrări de lungime mare.
Inferență și antrenament eficient prin FlashAttention
Atenția, adică concentrarea asupra părților relevante ale secvenței de intrare, este un component critic al transformatorilor, dar poate fi lentă și consumatoare de memorie, în special atunci când se procesează secvențe de text lungi.
FlashAttention este o abordare propusă de cercetători de la Universitatea Cornell care abordează această problemă pentru MPT-30B. Utilizând o tehnică numită tiling, FlashAttention reduce numărul de ori când modelul trebuie să citească din sau să scrie în memorie, accelerând procesarea. Prin urmare, modelul utilizează tehnica FlashAttention de ultimă generație și biblioteca de optimizare FasterTransformer a NVIDIA (NVDA ) pentru antrenament și inferență eficientă.
Ușurința antrenamentului și implementării
Dezvoltatorii pot antrena MPT-30B de la zero sau pot utiliza punctele de control ale MosaicML pentru implementări mai rapide. De asemenea, acesta poate fi finisat pentru cazuri de utilizare specifice pe un anumit set de date.
Mărimea modelului a fost aleasă pentru a permite o implementare ușoară pe o singură GPU, în special 1xA100-80GB în precizie de 16 biți sau 1xA100-40GB în precizie de 8 biți. Acest lucru înseamnă că modelul a fost proiectat pentru a se potrivi în limitările de memorie ale acestor GPU-uri.
Capacități de programare
MPT-30B oferă capacități excepționale de programare. HumanEval este un set de date lansat de OpenAI care conține 164 de probleme de programare create de oameni. Pe setul de date HumanEval, modelul depășește modelele LLM specializate, cum ar fi seria StarCoder.
Variante finisate: MPT-30B-Instruct și MPT-30B-Chat
MPT-30B-Instruct
LLM-urile sunt utilizate în principal pentru instrucțiuni, cum ar fi răspunsurile la întrebări, rezumarea textului, traducerea limbajului, etc. MPT-30B-Instruct este o variantă comercială (păstrează licența CC-By-SA-3.0) a MPT-30B, finisată special pentru sarcini de urmărire a instrucțiunilor. Pentru finisare, au fost utilizate următoarele seturi de date:
- FLAN
- P3
- Alpaca
- Dolly-15k
Setul de date Dolly a fost suplimentat cu setul de date Helpful and Harmless al Anthropic pentru finisarea instrucțiunilor. De asemenea, a fost utilizat un set divers de seturi de date pentru augmentarea datelor, care sunt următoarele:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat este o versiune finisată a MPT-30B pentru generarea de dialoguri. Acesta este un artefact de cercetare lansat sub licența CC-By-NC-SA-4.0, care permite doar utilizarea non-comercială. Modelul a fost finisat utilizând diverse seturi de date de limbaj, inclusiv:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM-urile dețin o parte semnificativă a pieței generative AI de miliarde de dolari, care a cunoscut o creștere extraordinară în timp scurt după ce ChatGPT a revoluționat peisajul anul trecut. Familia MPT este o parte fundamentală a acestei revoluții. În viitorul apropiat, putem aștepta să vedem modele deschise și comerciale care sunt mult mai puternice și eficiente decât familia MPT.
Pentru cele mai recente știri despre inteligența artificială, vizitați unite.ai.















