Modelli e piattaforme di IA

MPT-30B: MosaicML supera GPT-3 con un nuovo LLM per spingere i confini del NLP

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

MosaicML è un’azienda di intelligenza artificiale generativa che fornisce soluzioni di distribuzione e scalabilità dell’AI. Il loro ultimo modello di linguaggio grande (LLM) MPT-30B sta facendo onde nell’intera comunità di intelligenza artificiale.

Il viaggio di MosaicML con gli LLM è iniziato con il rilascio di MPT-7B (Mosaic Pretrained Transformer) nel maggio 2023, che includeva tre varianti:

  1. MPT-7B-StoryWriter-65k+ (per la generazione di storie a lungo termine)
  2. MPT-7B-Instruct (per l’esecuzione di istruzioni a breve termine)
  3. MPT-7B-Chat (per la generazione di dialoghi)

I modelli hanno avuto un enorme successo nella comunità di apprendimento automatico a causa della loro natura open-source, della loro utilizzabilità commerciale e della loro eccezionale capacità di gestire finestre di contesto estese.

Soprattutto, il modello era alla pari e, in alcuni casi, superava altri modelli paragonabili (LLaMA-7B, StableLM 7B, ecc.). Entro giugno, la serie MPT-7B era stata scaricata oltre 3 milioni di volte. Il 22 giugno, MosaicML ha rilasciato MPT-30B, che ha alzato ulteriormente la barra per i modelli di base open-source.

MPT-30B: un LLM potente che supera GPT-3

MPT-30B è un LLM open-source e con licenza commerciale basato su decoder che è più potente di GPT-3-175B con solo il 17% dei parametri di GPT-3, ovvero 30B. Superava GPT-3 in diversi compiti. Ecco un confronto tra MPT-30B e GPT-3.

MPT-30B si basa sul precedente modello MPT-7B. È efficiente dal punto di vista computazionale per l’addestramento rispetto ai modelli di dimensioni simili. Ad esempio, LLaMA-30B ha utilizzato circa 1,44 volte più il budget FLOPs rispetto a MPT-30B, mentre Falcon-40B aveva un budget FLOPs del 27% più alto rispetto a MPT-30B. Ecco un’illustrazione del miglioramento di MPT-30B in vari compiti rispetto al suo predecessore.

Alcune caratteristiche speciali di MPT-30B sono le seguenti:

Fine di contesto di 8k token

La finestra di contesto negli LLM si riferisce all’intervallo di token che il modello può considerare prima di generare l’output. MPT-30B aveva una finestra di contesto di 8000 token durante l’addestramento. È stato addestrato su 1T token utilizzando sequenze di 2k token e poi su altri 50B token di sequenze di 8k token (circa 6000 parole).

Supporto ALiBi

Per spiegare questa funzione, consideriamo una domanda:

Come può MPT-30B comprendere e fare previsioni per sequenze più lunghe di quelle su cui è stato addestrato?

MPT-30B utilizza una tecnica di Attenzione con bias lineari (ALiBi) per comprendere sequenze più lunghe e estendere la finestra di contesto oltre 8k token durante il fine-tuning o l’inferenza.

Invece di calcolare le incastonature posizionali in cui assegniamo un vettore a ogni parola nella sequenza, ALiBi calcola i punteggi di attenzione tra token chiave e token di query. Quando i token chiave e di query sono vicini, la penalità è bassa, ma più alta altrimenti. Di conseguenza, l’architettura sottostante transformer può extrapolare a input a lungo termine.

Prestazioni di inferenza e addestramento efficienti tramite FlashAttention

L’attenzione, ovvero la concentrazione sulle parti rilevanti della sequenza di input, è un componente critico dei transformer, ma può essere lenta e intensiva in termini di memoria, specialmente quando si elaborano sequenze di testo lunghe.

FlashAttention è un approccio proposto da ricercatori della Cornell University che affronta questo problema per MPT-30B. Utilizzando una tecnica chiamata tiling, FlashAttention riduce il numero di volte in cui il modello deve leggere o scrivere nella memoria, velocizzando l’elaborazione. Pertanto, il modello impiega la tecnica FlashAttention allo stato dell’arte e la libreria di ottimizzazione FasterTransformer di NVIDIA (NVDA ) per un addestramento e un’inferenza efficienti.

Facilità di addestramento e distribuzione

Gli sviluppatori possono addestrare MPT-30B da zero o utilizzare i checkpoint di MosaicML per distribuzioni più rapide. Inoltre, può essere fine-tuned per casi d’uso specifici del dominio su un set di dati specifico.

La dimensione del modello è stata scelta per consentire una distribuzione senza sforzo su una sola GPU, in particolare 1xA100-80GB in precisione a 16 bit o 1xA100-40GB in precisione a 8 bit. Ciò significa che il modello è stato progettato per rientrare nei limiti di memoria di queste GPU.

Capacità di codifica

MPT-30B fornisce anche capacità di codifica eccezionali. HumanEval è un set di dati rilasciato da OpenAI che contiene 164 problemi di programmazione creati a mano. Sul set di dati HumanEval, il modello supera modelli LLM specifici, come la serie StarCoder.

Variants fine-tuned: MPT-30B-Instruct e MPT-30B-Chat

MPT-30B-Instruct

Gli LLM sono utilizzati principalmente per istruzioni come la risposta alle domande, la sintesi del testo, la traduzione del linguaggio, ecc. MPT-30B-Instruct è una variante di MPT-30B fine-tuned specificamente per compiti di esecuzione di istruzioni. Per il fine-tuning, sono stati utilizzati i seguenti set di dati:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Il set di dati Dolly è stato ulteriormente arricchito con il set di dati Helpful and Harmless di Anthropic per il fine-tuning delle istruzioni. Inoltre, è stato utilizzato un insieme diversificato di set di dati per l’arricchimento dei dati, che sono i seguenti:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat è una versione fine-tuned di MPT-30B per la generazione di dialoghi. È un artefatto di ricerca rilasciato sotto la licenza CC-By-NC-SA-4.0, che consente solo l’uso non commerciale. Il modello è stato fine-tuned utilizzando vari set di dati linguistici, tra cui:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

Gli LLM condividono una grande fetta del mercato dell’intelligenza artificiale generativa da multi-miliardi di dollari, che ha conosciuto una crescita incredibile in tempi brevi dopo che ChatGPT ha rivoluzionato il paesaggio l’anno scorso. La famiglia MPT è una parte fondamentale di questa rivoluzione. Nel prossimo futuro, possiamo aspettarci di vedere modelli open-source commercialmente disponibili che siano ancora più potenti ed efficienti della famiglia MPT.

Per le ultime notizie sull’AI, visita unite.ai.

Haziqa è uno scienziato dei dati con una vasta esperienza nella scrittura di contenuti tecnici per aziende di intelligenza artificiale e SaaS.