AI-mallit ja alustat
MPT-30B: MosaicML Ohittaa GPT-3 Uudella LLM: llä, Joka Venyttää NLP:n Rajat
MosaicML on generatiivisen AI:n yritys, joka tarjoaa AI-käyttöönoton ja skaalautuvuusratkaisuja. Heidän uusin suuri kielen malli (LLM) MPT-30B on herättänyt aallon AI-yhteisössä.
MosaicML:n LLM-matka alkoi MPT-7B:n (Mosaic Pretrained Transformer) julkaisulla toukokuussa 2023, joka tuli kolmella variantilla:
- MPT-7B-StoryWriter-65k+ (pitkien tarinoiden luomiseen)
- MPT-7B-Instruct (lyhyiden ohjeiden seuraamiseen)
- MPT-7B-Chat (dialogin luomiseen)
Mallit saavuttivat valtavan suosion ML-yhteisössä avoimen lähdekoodin, kaupallisen käytön ja poikkeuksellisen kyvyn käsitellä laajennettuja kontekstien ikkunoita.
Ennen kaikkea, malli oli vertailukelpoinen ja jopa ylitti muut vertailukelpoiset mallit (LLaMA-7B, StableLM 7B jne). Kesäkuuhun mennessä MPT-7B-sarjaa oli ladattu yli 3 miljoonaa kertaa. 22. kesäkuuta MosaicML julkaisi MPT-30B:n, joka nosti avoimen lähdekoodin perusmallien standardin entisestään korkeammalle.
MPT-30B: Voimakas LLM, joka ylittää GPT-3:n
MPT-30B on avoimen lähdekoodin ja kaupallisen dekooderin perustein toimiva LLM, joka on voimakkaampi kuin GPT-3-175B vain 17 %:n GPT-3:n parametreilla, eli 30B. Se ylittää GPT-3:n useissa tehtävissä. Tässä on vertailu MPT-30B:n ja GPT-3:n välillä.
MPT-30B perustuu edelliseen MPT-7B-malliin. Se on laskennallisesti tehokas koulutettavaksi verrattuna malleihin, joilla on samankaltaisia kokoja. Esimerkiksi LLaMA-30B käytti noin 1,44 kertaa enemmän FLOPs-budjettia kuin MPT-30B, kun taas Falcon-40B:n FLOPs-budjetti oli 1,27 kertaa suurempi kuin MPT-30B:n. Tässä on esimerkki MPT-30B:n parantumisesta edeltäjäänsä nähden useissa tehtävissä.
MPT-30B:n erityisiä ominaisuuksia ovat seuraavat:
8k Tokenin Kontekstiikkuna
Kontekstiikkuna LLM-malleissa viittaa siihen, miten laaja token-alue malli voi huomioida ennen tulosteen luomista. MPT-30B:llä on 8000 tokenin kontekstiikkuna koulutusajassa. Se koulutettiin ensin 1T tokenilla 2k tokenin pituisilla sekvensseillä ja sitten 50B tokenilla 8k tokenin pituisilla sekvensseillä (noin 6000 sanaa).
ALiBi-tuki
Selittääkseni tämän ominaisuuden, tarkastellaan seuraavaa kysymystä:
Miten MPT-30B voi ymmärtää ja tehdä ennusteita pidemmille sekvensseille kuin mihin se on koulutettu?
MPT-30B käyttää Attention with Linear Biases (ALiBi) -tekniikkaa ymmärtääkseen pidemmät sekvenssit ja laajentaa kontekstiikkunaa 8k tokenin yli hienosäätö- tai inference-ajassa.
Sen sijaan, että lasketaan positionaalinen upotus, jossa jokaiselle sanalle annetaan vektori, ALiBi lasketaan huomioarvoja avain- ja kyselytokenien välillä. Kun avain- ja kyselytokenit ovat lähellä toisiaan, rangaistus on alhainen, mutta muutoin korkeampi. Tämän seurauksena transformer-arkkitehtuuri voi extrapoloida pitkiin syötteisiin.
Tehokas Inference- ja Koulutusosuus FlashAttentionin kautta
Huomio, eli keskittyminen syötteen relevantteihin osiin, on kriittinen komponentti transformer-malleissa, mutta se voi olla hidasta ja muistintensiivistä, erityisesti kun prosessoidaan pitkiä tekstisekvenssejä.
FlashAttention on Cornellin yliopiston tutkijoiden ehdottama lähestymistapa, joka ratkaisee tämän ongelman MPT-30B:lle. Käyttämällä tili-tekniikkaa FlashAttention vähentää kertaa, joina mallin on luettava tai kirjoitettava muistiin, nopeuttaen prosessointia. Näin ollen malli käyttää FlashAttention-tekniikkaa ja NVIDIA (NVDA ):n FasterTransformer -optimointikirjastoa tehokkaan koulutuksen ja inference:n vuoksi.
Koulutuksen ja Käyttöönoton Helppous
Kehittäjät voivat kouluttaa MPT-30B:n alusta tai käyttää MosaicML:n checkpointeja nopeamman käyttöönoton vuoksi. Lisäksi se voidaan hienosäätää erityisiin käyttökohteisiin tietyn datan joukon perusteella.
Mallin koko valittiin mahdollistaakseen vaivattoman käyttöönoton yhdellä GPU:lla, erityisesti 1xA100-80GB 16-bittisessä tarkkuudessa tai 1xA100-40GB 8-bittisessä tarkkuudessa. Tämä tarkoittaa, että malli suunniteltiin sopimaan näiden GPU:n muistirajoituksiin.
Koodausominaisuudet
MPT-30B tarjoaa myös poikkeukselliset koodausominaisuudet. HumanEval on OpenAI:n julkaisema tietokanta, joka sisältää 164 käsin tehtyä ohjelmointiongelmaa. HumanEval-tietokannassa malli ylittää tarkoituksenmukaisia LLM-malleja, kuten StarCoder -sarjan.
Hienosäätövariantit: MPT-30B-Instruct ja MPT-30B-Chat
MPT-30B-Instruct
LLM:t käytetään pääasiassa ohjeiden antamiseen, kuten kysymyksiin vastaamiseen, tekstien tiivistämiseen, kielien kääntämiseen jne. MPT-30B-Instruct on kaupallinen (säilyttää kaupallisen CC-By-SA-3.0-lisenssin) MPT-30B:n hienosäätövariantti, joka on erityisesti suunniteltu ohjeiden seuraamiseen. Hienosäätöä varten käytettiin seuraavia tietokantoja:
- FLAN
- P3
- Alpaca
- Dolly-15k
Dolly-tietokanta laajennettiin Anthropicin Helpful and Harmless -tietokannalla ohjeiden hienosäätöä varten. Lisäksi monipuolinen joukko tietokantoja käytettiin datan laajentamiseen, jotka ovat seuraavat:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat on MPT-30B:n hienosäätöversio dialogin luomiseen. Se on tutkimusartefakti, joka on julkaistu CC-By-NC-SA-4.0-lisenssillä, joka sallii ainoastaan ei-kaupallisen käytön. Malli hienosäädettiin useilla kielitietokannoilla, mukaan lukien:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM:t muodostavat suuren osan monimiljardin dollarin generatiivisen AI-markkinaa, joka on kasvanut valtavasti viime aikoina ChatGPT:n vallankumouksen jälkeen. MPT-perhe on tämän vallankumouksen perusta. Lähitulevaisuudessa voidaan odottaa kaupallisia, avoimen lähdekoodin malleja, jotka ovat paljon voimakkaampia ja tehokkaampia kuin MPT-perhe.
Uusimmat AI-uutiset löytyvät unite.ai:sta.















