Modelli e piattaforme di IA

MPT-30B: MosaicML supera GPT-3 con un nuovo LLM per spingere i confini del NLP

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

MosaicML è un’azienda di intelligenza artificiale generativa che fornisce soluzioni di distribuzione e scalabilità dell’AI. Il loro ultimo modello di linguaggio grande (LLM) MPT-30B sta facendo onde nell’intera comunità di intelligenza artificiale.

Il viaggio di MosaicML con gli LLM è iniziato con il rilascio di MPT-7B (Mosaic Pretrained Transformer) nel maggio 2023, che includeva tre varianti:

  1. MPT-7B-StoryWriter-65k+ (per la generazione di storie a lungo termine)
  2. MPT-7B-Instruct (per l’esecuzione di istruzioni a breve termine)
  3. MPT-7B-Chat (per la generazione di dialoghi)

I modelli hanno avuto un enorme successo nella comunità di apprendimento automatico a causa della loro natura open-source, della loro utilizzabilità commerciale e della loro eccezionale capacità di gestire finestre di contesto estese.

Soprattutto, il modello era alla pari e, in alcuni casi, superava altri modelli paragonabili (LLaMA-7B, StableLM 7B, ecc.). Entro giugno, la serie MPT-7B era stata scaricata oltre 3 milioni di volte. Il 22 giugno, MosaicML ha rilasciato MPT-30B, che ha alzato ulteriormente la barra per i modelli di base open-source.

MPT-30B: un LLM potente che supera GPT-3

MPT-30B è un LLM open-source e con licenza commerciale basato su decoder che è più potente di GPT-3-175B con solo il 17% dei parametri di GPT-3, ovvero 30B. Superava GPT-3 in diversi compiti. Ecco un confronto tra MPT-30B e GPT-3.

MPT-30B si basa sul precedente modello MPT-7B. È efficiente dal punto di vista computazionale per l’addestramento rispetto ai modelli di dimensioni simili. Ad esempio, LLaMA-30B ha utilizzato circa 1,44 volte più il budget FLOPs rispetto a MPT-30B, mentre Falcon-40B aveva un budget FLOPs del 27% più alto rispetto a MPT-30B. Ecco un’illustrazione del miglioramento di MPT-30B in vari compiti rispetto al suo predecessore.

Alcune caratteristiche speciali di MPT-30B sono le seguenti:

Fine di contesto di 8k token

La finestra di contesto negli LLM si riferisce all’intervallo di token che il modello può considerare prima di generare l’output. MPT-30B aveva una finestra di contesto di 8000 token durante l’addestramento. È stato addestrato su 1T token utilizzando sequenze di 2k token e poi su altri 50B token di sequenze di 8k token (circa 6000 parole).

Supporto ALiBi

Per spiegare questa funzione, consideriamo una domanda:

Come può MPT-30B comprendere e fare previsioni per sequenze più lunghe di quelle su cui è stato addestrato?

MPT-30B utilizza una tecnica di Attenzione con bias lineari (ALiBi) per comprendere sequenze più lunghe e estendere la finestra di contesto oltre 8k token durante il fine-tuning o l’inferenza.

Invece di calcolare le incastonature posizionali in cui assegniamo un vettore a ogni parola nella sequenza, ALiBi calcola i punteggi di attenzione tra token chiave e token di query. Quando i token chiave e di query sono vicini, la penalità è bassa, ma più alta altrimenti. Di conseguenza, l’architettura sottostante transformer può extrapolare a input a lungo termine.

Prestazioni di inferenza e addestramento efficienti tramite FlashAttention

L’attenzione, ovvero la concentrazione sulle parti rilevanti della sequenza di input, è un componente critico dei transformer, ma può essere lenta e intensiva in termini di memoria, specialmente quando si elaborano sequenze di testo lunghe.

FlashAttention è un approccio proposto da ricercatori della Cornell University che affronta questo problema per MPT-30B. Utilizzando una tecnica chiamata tiling, FlashAttention riduce il numero di volte in cui il modello deve leggere o scrivere nella memoria, velocizzando l’elaborazione. Pertanto, il modello impiega la tecnica FlashAttention allo stato dell’arte e la libreria di ottimizzazione FasterTransformer di NVIDIA (NVDA ) per un addestramento e un’inferenza efficienti.

Facilità di addestramento e distribuzione

Gli sviluppatori possono addestrare MPT-30B da zero o utilizzare i checkpoint di MosaicML per distribuzioni più rapide. Inoltre, può essere fine-tuned per casi d’uso specifici del dominio su un set di dati specifico.

La dimensione del modello è stata scelta per consentire una distribuzione senza sforzo su una sola GPU, in particolare 1xA100-80GB in precisione a 16 bit o 1xA100-40GB in precisione a 8 bit. Ciò significa che il modello è stato progettato per rientrare nei limiti di memoria di queste GPU.

Capacità di codifica

MPT-30B fornisce anche capacità di codifica eccezionali. HumanEval è un set di dati rilasciato da OpenAI che contiene 164 problemi di programmazione creati a mano. Sul set di dati HumanEval, il modello supera modelli LLM specifici, come la serie StarCoder.

Variants fine-tuned: MPT-30B-Instruct e MPT-30B-Chat

MPT-30B-Instruct

Gli LLM sono utilizzati principalmente per istruzioni come la risposta alle domande, la sintesi del testo, la traduzione del linguaggio, ecc. MPT-30B-Instruct è una variante di MPT-30B fine-tuned specificamente per compiti di esecuzione di istruzioni. Per il fine-tuning, sono stati utilizzati i seguenti set di dati:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Il set di dati Dolly è stato ulteriormente arricchito con il set di dati Helpful and Harmless di Anthropic per il fine-tuning delle istruzioni. Inoltre, è stato utilizzato un insieme diversificato di set di dati per l’arricchimento dei dati, che sono i seguenti:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat è una versione fine-tuned di MPT-30B per la generazione di dialoghi. È un artefatto di ricerca rilasciato sotto la licenza CC-By-NC-SA-4.0, che consente solo l’uso non commerciale. Il modello è stato fine-tuned utilizzando vari set di dati linguistici, tra cui:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

Gli LLM condividono una grande fetta del mercato dell’intelligenza artificiale generativa da multi-miliardi di dollari, che ha conosciuto una crescita incredibile in tempi brevi dopo che ChatGPT ha rivoluzionato il paesaggio l’anno scorso. La famiglia MPT è una parte fondamentale di questa rivoluzione. Nel prossimo futuro, possiamo aspettarci di vedere modelli open-source commercialmente disponibili che siano ancora più potenti ed efficienti della famiglia MPT.

Per le ultime notizie sull’AI, visita unite.ai.

Haziqa opera nel campo della scienza dei dati con una vasta esperienza nella scrittura di contenuti tecnici per aziende di intelligenza artificiale e SaaS.