AI-mallit ja alustat

MPT-30B: MosaicML Ohittaa GPT-3 Uudella LLM: llä, Joka Venyttää NLP:n Rajat

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

MosaicML on generatiivisen AI:n yritys, joka tarjoaa AI-käyttöönoton ja skaalautuvuusratkaisuja. Heidän uusin suuri kielen malli (LLM) MPT-30B on herättänyt aallon AI-yhteisössä.

MosaicML:n LLM-matka alkoi MPT-7B:n (Mosaic Pretrained Transformer) julkaisulla toukokuussa 2023, joka tuli kolmella variantilla:

  1. MPT-7B-StoryWriter-65k+ (pitkien tarinoiden luomiseen)
  2. MPT-7B-Instruct (lyhyiden ohjeiden seuraamiseen)
  3. MPT-7B-Chat (dialogin luomiseen)

Mallit saavuttivat valtavan suosion ML-yhteisössä avoimen lähdekoodin, kaupallisen käytön ja poikkeuksellisen kyvyn käsitellä laajennettuja kontekstien ikkunoita.

Ennen kaikkea, malli oli vertailukelpoinen ja jopa ylitti muut vertailukelpoiset mallit (LLaMA-7B, StableLM 7B jne). Kesäkuuhun mennessä MPT-7B-sarjaa oli ladattu yli 3 miljoonaa kertaa. 22. kesäkuuta MosaicML julkaisi MPT-30B:n, joka nosti avoimen lähdekoodin perusmallien standardin entisestään korkeammalle.

MPT-30B: Voimakas LLM, joka ylittää GPT-3:n

MPT-30B on avoimen lähdekoodin ja kaupallisen dekooderin perustein toimiva LLM, joka on voimakkaampi kuin GPT-3-175B vain 17 %:n GPT-3:n parametreilla, eli 30B. Se ylittää GPT-3:n useissa tehtävissä. Tässä on vertailu MPT-30B:n ja GPT-3:n välillä.

MPT-30B perustuu edelliseen MPT-7B-malliin. Se on laskennallisesti tehokas koulutettavaksi verrattuna malleihin, joilla on samankaltaisia kokoja. Esimerkiksi LLaMA-30B käytti noin 1,44 kertaa enemmän FLOPs-budjettia kuin MPT-30B, kun taas Falcon-40B:n FLOPs-budjetti oli 1,27 kertaa suurempi kuin MPT-30B:n. Tässä on esimerkki MPT-30B:n parantumisesta edeltäjäänsä nähden useissa tehtävissä.

MPT-30B:n erityisiä ominaisuuksia ovat seuraavat:

8k Tokenin Kontekstiikkuna

Kontekstiikkuna LLM-malleissa viittaa siihen, miten laaja token-alue malli voi huomioida ennen tulosteen luomista. MPT-30B:llä on 8000 tokenin kontekstiikkuna koulutusajassa. Se koulutettiin ensin 1T tokenilla 2k tokenin pituisilla sekvensseillä ja sitten 50B tokenilla 8k tokenin pituisilla sekvensseillä (noin 6000 sanaa).

ALiBi-tuki

Selittääkseni tämän ominaisuuden, tarkastellaan seuraavaa kysymystä:

Miten MPT-30B voi ymmärtää ja tehdä ennusteita pidemmille sekvensseille kuin mihin se on koulutettu?

MPT-30B käyttää Attention with Linear Biases (ALiBi) -tekniikkaa ymmärtääkseen pidemmät sekvenssit ja laajentaa kontekstiikkunaa 8k tokenin yli hienosäätö- tai inference-ajassa.

Sen sijaan, että lasketaan positionaalinen upotus, jossa jokaiselle sanalle annetaan vektori, ALiBi lasketaan huomioarvoja avain- ja kyselytokenien välillä. Kun avain- ja kyselytokenit ovat lähellä toisiaan, rangaistus on alhainen, mutta muutoin korkeampi. Tämän seurauksena transformer-arkkitehtuuri voi extrapoloida pitkiin syötteisiin.

Tehokas Inference- ja Koulutusosuus FlashAttentionin kautta

Huomio, eli keskittyminen syötteen relevantteihin osiin, on kriittinen komponentti transformer-malleissa, mutta se voi olla hidasta ja muistintensiivistä, erityisesti kun prosessoidaan pitkiä tekstisekvenssejä.

FlashAttention on Cornellin yliopiston tutkijoiden ehdottama lähestymistapa, joka ratkaisee tämän ongelman MPT-30B:lle. Käyttämällä tili-tekniikkaa FlashAttention vähentää kertaa, joina mallin on luettava tai kirjoitettava muistiin, nopeuttaen prosessointia. Näin ollen malli käyttää FlashAttention-tekniikkaa ja NVIDIA (NVDA ):n FasterTransformer -optimointikirjastoa tehokkaan koulutuksen ja inference:n vuoksi.

Koulutuksen ja Käyttöönoton Helppous

Kehittäjät voivat kouluttaa MPT-30B:n alusta tai käyttää MosaicML:n checkpointeja nopeamman käyttöönoton vuoksi. Lisäksi se voidaan hienosäätää erityisiin käyttökohteisiin tietyn datan joukon perusteella.

Mallin koko valittiin mahdollistaakseen vaivattoman käyttöönoton yhdellä GPU:lla, erityisesti 1xA100-80GB 16-bittisessä tarkkuudessa tai 1xA100-40GB 8-bittisessä tarkkuudessa. Tämä tarkoittaa, että malli suunniteltiin sopimaan näiden GPU:n muistirajoituksiin.

Koodausominaisuudet

MPT-30B tarjoaa myös poikkeukselliset koodausominaisuudet. HumanEval on OpenAI:n julkaisema tietokanta, joka sisältää 164 käsin tehtyä ohjelmointiongelmaa. HumanEval-tietokannassa malli ylittää tarkoituksenmukaisia LLM-malleja, kuten StarCoder -sarjan.

Hienosäätövariantit: MPT-30B-Instruct ja MPT-30B-Chat

MPT-30B-Instruct

LLM:t käytetään pääasiassa ohjeiden antamiseen, kuten kysymyksiin vastaamiseen, tekstien tiivistämiseen, kielien kääntämiseen jne. MPT-30B-Instruct on kaupallinen (säilyttää kaupallisen CC-By-SA-3.0-lisenssin) MPT-30B:n hienosäätövariantti, joka on erityisesti suunniteltu ohjeiden seuraamiseen. Hienosäätöä varten käytettiin seuraavia tietokantoja:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Dolly-tietokanta laajennettiin Anthropicin Helpful and Harmless -tietokannalla ohjeiden hienosäätöä varten. Lisäksi monipuolinen joukko tietokantoja käytettiin datan laajentamiseen, jotka ovat seuraavat:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat on MPT-30B:n hienosäätöversio dialogin luomiseen. Se on tutkimusartefakti, joka on julkaistu CC-By-NC-SA-4.0-lisenssillä, joka sallii ainoastaan ei-kaupallisen käytön. Malli hienosäädettiin useilla kielitietokannoilla, mukaan lukien:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLM:t muodostavat suuren osan monimiljardin dollarin generatiivisen AI-markkinaa, joka on kasvanut valtavasti viime aikoina ChatGPT:n vallankumouksen jälkeen. MPT-perhe on tämän vallankumouksen perusta. Lähitulevaisuudessa voidaan odottaa kaupallisia, avoimen lähdekoodin malleja, jotka ovat paljon voimakkaampia ja tehokkaampia kuin MPT-perhe.

Uusimmat AI-uutiset löytyvät unite.ai:sta.

Haziqa on Data Scientist, jolla on laaja kokemus teknisen sisällön kirjoittamisesta AI- ja SaaS-yrityksille.