AI-modeller og plattformer

MPT-30B: MosaicML overgår GPT-3 med en ny LLM for å utvide grensene for NLP

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

MosaicML er et generativt AI-selskap som tilbyr løsninger for AI-utvikling og skalerbarhet. Deres nyeste store språkmodell (LLM) MPT-30B skaper bølger i AI-samfunnet.

MosaicMLs LLM-reise begynte med lanseringen av MPT-7B (Mosaic Pretrained Transformer) i mai 2023, som kom med tre varianter:

  1. MPT-7B-StoryWriter-65k+ (for langformsgenerering av historier)
  2. MPT-7B-Instruct (for kortformsgenerering av instruksjoner)
  3. MPT-7B-Chat (for dialoggenerering)

Modellene ble meget suksessfulle i ML-samfunnet på grunn av deres åpne kildekode, kommersielle anvendelighet og eksepsjonelle evne til å håndtere utvidede kontekstvinduer.

Viktigst var at modellen var like god som, og i noen tilfeller, overgikk andre sammenlignbare modeller (LLaMA-7B, StableLM 7B osv.). Ved juni hadde MPT-7B-serien blitt lastet ned over 3 millioner ganger. Den 22. juni lanserte MosaicML MPT-30B, som satte en ny standard for åpne kildekodemodeller.

MPT-30B: En kraftig LLM som overgår GPT-3

MPT-30B er en åpen kildekode- og kommersiell lisensiert decoder-basert LLM som er mer kraftig enn GPT-3-175B med bare 17% av GPT-3-parametrene, dvs. 30B. Den overgår GPT-3 på flere oppgaver. Her er en sammenligning mellom MPT-30B og GPT-3.

MPT-30B bygger på den tidligere MPT-7B-modellen. Den er komputasjonelt effektiv å trene sammenlignet med modeller av samme størrelse. For eksempel brukte LLaMA-30B omtrent 1,44 ganger mer FLOPs-budsjett enn MPT-30B, mens Falcon-40B hadde et 1,27 ganger høyere FLOPs-budsjett enn MPT-30B. Her er en illustrasjon av MPT-30B-forbedring på ulike oppgaver sammenlignet med dens forgjenger.

Noen spesielle egenskaper ved MPT-30B er følgende:

8k Token Kontekstvindu

Kontekstvindu i LLM-er refererer til rekkevidden av token modellen kan vurdere før den genererer utdata. MPT-30B hadde et kontekstvindu på 8000 token under trening. Den ble først trent på 1T token med 2k token sekvenser og deretter ytterligere 50B token med 8k token sekvenser (omtrent 6000 ord).

ALiBi-støtte

For å forklare denne funksjonen, la oss vurdere et spørsmål:

Hvordan kan MPT-30B forstå og gjøre prediksjoner for lengre sekvenser enn det den ble trent på?

MPT-30B bruker en Attention med lineære bias (ALiBi)-teknikk for å forstå lengre sekvenser og utvide kontekstvinduet beyond 8k token under finjustering eller inferens.

I stedet for å beregne posisjonsinnlegg hvor vi tilordner en vektor til hvert ord i sekvensen, beregner ALiBi oppmerksomhetsskår mellom nøkkel- og spørsmålstoner. Når nøkkel- og spørsmålstonene er nær hverandre, er straffen lav, men høyere ellers. Som resultat kan den underliggende transformatorarkitekturen ekstrapolere til langforminput.

Effektiv Inferens- og Treningstid via FlashAttention

Oppmerksomhet, dvs. fokus på relevante deler av inndatasekvensen, er en kritisk komponent i transformatorer, men kan være langsom og minneintensiv, spesielt når det behandles lange tekstsekvenser.

FlashAttention er en tilnærming foreslått av forskere ved Cornell University som løser dette problemet for MPT-30B. Ved å bruke en teknikk kalt tiling, reduserer FlashAttention antall ganger modellen må lese fra eller skrive til minne, og på den måten øker prosesseringen. Derfor bruker modellen den nyeste FlashAttention-teknikken og NVIDIAs FasterTransformer-optimeringsbibliotek for effektiv trening og inferens.

Enkelhet ved Trening og Utvikling

Utviklere kan trene MPT-30B fra scratch eller bruke MosaicMLs kontrollpunkter for raskere utvikling. Dessuten kan den finjusteres for domenespesifikke brukstilfeller på en bestemt datasett.

Modellens størrelse ble valgt for å muliggjøre enkel utvikling på en enkelt GPU, spesifikt 1xA100-80GB i 16-bit presisjon eller 1xA100-40GB i 8-bit presisjon. Dette betyr at modellen var designet for å passe innenfor minnebegrensningene til disse GPU-ene.

Kodingsevner

MPT-30B tilbyr også unike kodingsevner. HumanEval er en datasett utgitt av OpenAI som inneholder 164 håndlagde programmeringsproblemer. På HumanEval-datasettet overgår modellen formålbygde LLM-modeller, som StarCoder-serien.

Finjusterte Varianter: MPT-30B-Instruct og MPT-30B-Chat

MPT-30B-Instruct

LLM-er brukes hovedsakelig til instruksjoner som spørsmålssvar, tekstsummering, språkoversettelse osv. MPT-30B-Instruct er en kommersielt anvendelig (vedlikeholder kommersiell CC-By-SA-3.0-lisens) variant av MPT-30B finjustert spesifikt for instruksjonsfølging. For finjustering ble følgende datasett brukt:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Dolly-datasettet ble ytterligere utvidet med Antrhopics Hjelpsom og Harmløs datasett for instruksjonsfinjustering. Dessuten ble en rekke datasett brukt til dataforbedring, som følger:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat er en finjustert versjon av MPT-30B for dialoggenerering. Den er en forskningsartefakt utgitt under CC-By-NC-SA-4.0-lisens, som tillater bare ikke-kommersiell bruk. Modellen ble finjustert ved hjelp av ulike språkdatasett, inkludert:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLM-er deler en stor del av den multi-milliard dollar generative AI-markedet, som har opplevd enorm vekst på kort tid etter at ChatGPT revolusjonerte landskapet i fjor. MPT-familien er en grunnleggende del av denne revolusjonen. I nær fremtid kan vi forvente å se kommersielt tilgjengelige åpne kildekodemodeller som er langt mer kraftige og effektive enn MPT-familien.

For de siste nyhetene om AI, besøk unite.ai.

Haziqa er en dataforsker med omfattende erfaring med å skrive teknisk innhold for AI- og SaaS-selskaper.