Modelli e piattaforme di IA

Mistral AI: stabilisce nuovi benchmark oltre Llama2 nello spazio open-source

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

I Large Language Model (LLM) hanno recentemente preso il centro della scena, grazie a performer di spicco come ChatGPT. Quando Meta ha introdotto i suoi modelli Llama, ha suscitato un rinnovato interesse per i LLM open-source. L’obiettivo? Creare LLM open-source accessibili e efficienti che siano così buoni come i modelli di fascia alta come GPT-4, ma senza il prezzo elevato o la complessità.

Questa combinazione di accessibilità e efficienza non solo ha aperto nuove strade per ricercatori e sviluppatori, ma ha anche segnato l’inizio di una nuova era di avanzamenti tecnologici nell’elaborazione del linguaggio naturale.

Recentemente, le startup di intelligenza artificiale generativa hanno ricevuto finanziamenti. Insieme hanno raccolto 20 milioni di dollari, con l’obiettivo di plasmare l’intelligenza artificiale open-source. Anthropic ha anche raccolto un impressionante 450 milioni di dollari, e Cohere, in partenariato con Google Cloud, ha raccolto 270 milioni di dollari nel giugno di quest’anno.

Introduzione a Mistral 7B: dimensioni e disponibilità

mistral AI

Mistral AI, con sede a Parigi e cofondata da ex dipendenti di Google’s DeepMind e Meta, ha annunciato il suo primo modello di linguaggio: Mistral 7B. Questo modello può essere facilmente scaricato da chiunque da GitHub e anche tramite un torrent da 13,4 gigabyte.

Questa startup è riuscita a ottenere finanziamenti record anche prima di avere un prodotto disponibile. Il primo modello di Mistral AI con 7 miliardi di parametri supera le prestazioni di Llama 2 13B in tutti i test e supera Llama 1 34B in molti metriche.

Paragonato ad altri modelli come Llama 2, Mistral 7B fornisce capacità simili o migliori con meno sovraccarico computazionale. Mentre i modelli fondamentali come GPT-4 possono raggiungere di più, hanno un costo più alto e non sono così user-friendly poiché sono principalmente accessibili tramite API.

Quando si tratta di compiti di codifica, Mistral 7B dà CodeLlama 7B una corsa per il denaro. Inoltre, è compatto a 13,4 GB per essere eseguito su macchine standard.

Inoltre, Mistral 7B Instruct, ottimizzato specificamente per set di dati di istruzioni su Hugging Face, ha mostrato grandi prestazioni. Superiore ad altri modelli 7B su MT-Bench e si pone alla pari con i modelli di chat 13B.

Test delle prestazioni

In un’analisi dettagliata delle prestazioni, Mistral 7B è stato misurato contro i modelli della famiglia Llama 2. I risultati sono stati chiari: Mistral 7B ha superato sostanzialmente Llama 2 13B in tutti i test. In realtà, ha eguagliato le prestazioni di Llama 34B, in particolare spiccatosi nei test di codifica e ragionamento.

I test sono stati organizzati in diverse categorie, come Ragionamento sul senso comune, Conoscenza del mondo, Comprensione della lettura, Matematica e Codifica, tra gli altri. Un’osservazione particolarmente degna di nota è stata la metrica di prestazione di Mistral 7B, definita “dimensioni del modello equivalenti”. In aree come ragionamento e comprensione, Mistral 7B ha dimostrato prestazioni simili a quelle di un modello Llama 2 tre volte più grande, indicando potenziali risparmi in termini di memoria e un aumento della velocità. Tuttavia, nei test di conoscenza, Mistral 7B si è allineato strettamente con Llama 2 13B, il che è probabilmente attribuibile alle limitazioni dei parametri che influiscono sulla compressione della conoscenza.

Cosa rende realmente il modello Mistral 7B migliore della maggior parte degli altri modelli di linguaggio?

Semplificazione dei meccanismi di attenzione

Mentre le sottigliezze dei meccanismi di attenzione sono tecniche, la loro idea fondamentale è relativamente semplice. Immagina di leggere un libro e di evidenziare le frasi importanti; questo è analogo a come i meccanismi di attenzione “evidenziano” o danno importanza a specifici punti di dati in una sequenza.

Nel contesto dei modelli di linguaggio, questi meccanismi consentono al modello di concentrarsi sulle parti più rilevanti dei dati di input, garantendo che l’output sia coerente e accurato nel contesto.

Nelle trasformazioni standard, i punteggi di attenzione vengono calcolati con la formula:

Transformers attention Formula

Formula di attenzione delle trasformazioni

La formula per questi punteggi prevede un passaggio cruciale – la moltiplicazione matriciale di Q e K. La sfida qui è che man mano che la lunghezza della sequenza aumenta, entrambe le matrici si espandono di conseguenza, portando a un processo computazionalmente intensivo. Questa preoccupazione di scalabilità è una delle principali ragioni per cui le trasformazioni standard possono essere lente, soprattutto quando si lavora con sequenze lunghe.

trasformazioneI meccanismi di attenzione aiutano i modelli a concentrarsi su specifiche parti dei dati di input. Tipicamente, questi meccanismi utilizzano “teste” per gestire l’attenzione. Quanto più teste hai, tanto più specifica è l’attenzione, ma diventa anche più complessa e lenta. Scopri di più sui trasformatori e sui meccanismi di attenzione qui.

L’attenzione multi-query (MQA) velocizza le cose utilizzando un set di “chiave-valore” teste, ma a volte sacrifica la qualità. Ora, potresti chiederti, perché non combinare la velocità di MQA con la qualità dell’attenzione multi-testa? È qui che entra in gioco l’attenzione a query raggruppate (GQA).

Attenzione a query raggruppate (GQA)

attenzione a query raggruppate

Attenzione a query raggruppate

GQA è una soluzione di compromesso. Invece di utilizzare solo una o più “chiave-valore” teste, le raggruppa. In questo modo, GQA raggiunge prestazioni vicine all’attenzione multi-testa dettagliata, ma con la velocità di MQA. Per modelli come Mistral, ciò significa prestazioni efficienti senza compromettere troppo la qualità.

Attenzione a finestra scorrevole (SWA)

longformer trasformazioni finestra scorrevole

Il metodo della finestra scorrevole è un altro metodo utilizzato nell’elaborazione delle sequenze di attenzione. Questo metodo utilizza una finestra di attenzione di dimensioni fisse attorno a ogni token nella sequenza. Con più livelli che impilano questa attenzione a finestra, i livelli superiori guadagnano alla fine una prospettiva più ampia, abbracciando informazioni dall’intero input. Questo meccanismo è analogo ai campi ricettivi osservati nelle reti neurali convoluzionali (CNN).

D’altra parte, l'”attenzione a finestra scorrevole dilatata” del modello Longformer, che è concettualmente simile al metodo della finestra scorrevole, calcola solo alcune diagonali della matrice . Questo cambiamento comporta un aumento dell’utilizzo della memoria in modo lineare piuttosto che quadrático, rendendolo un metodo più efficiente per sequenze più lunghe.

Trasparenza di Mistral AI vs. preoccupazioni per la sicurezza nella decentralizzazione

Nel loro annuncio, Mistral AI ha anche sottolineato la trasparenza con la dichiarazione: “Nessun trucco, nessun dato proprietario”. Ma allo stesso tempo, il loro unico modello disponibile al momento, ‘Mistral-7B-v0.1’, è un modello base pre-addestrato, quindi può generare una risposta a qualsiasi query senza moderazione, il che solleva potenziali preoccupazioni per la sicurezza. Mentre modelli come GPT e Llama hanno meccanismi per discernere quando rispondere, la natura completamente decentralizzata di Mistral potrebbe essere sfruttata da attori malintenzionati.

Tuttavia, la decentralizzazione dei Large Language Model ha i suoi meriti. Mentre alcuni potrebbero abusarne, le persone possono sfruttarne il potere per il bene sociale e rendere l’intelligenza accessibile a tutti.

Flessibilità di distribuzione

Uno dei punti salienti è che Mistral 7B è disponibile sotto licenza Apache 2.0. Ciò significa che non ci sono barriere reali per utilizzarlo – che tu lo stia utilizzando per scopi personali, per una grande azienda o anche per un’entità governativa. Hai solo bisogno del sistema giusto per eseguirlo, o potresti dover investire in risorse cloud.

Mentre ci sono altre licenze come la licenza MIT più semplice e la licenza CC BY-SA-4.0 cooperativa, che richiede crediti e licenze simili per i derivati, Apache 2.0 fornisce una base solida per imprese su larga scala.

Pensieri finali

La crescita dei Large Language Model open-source come Mistral 7B segna un cambiamento cruciale nell’industria dell’IA, rendendo i modelli di linguaggio di alta qualità accessibili a un pubblico più ampio. Gli approcci innovativi di Mistral AI, come l’attenzione a query raggruppate e l’attenzione a finestra scorrevole, promettono prestazioni efficienti senza compromettere la qualità.

Mentre la natura decentralizzata di Mistral pone alcune sfide, la sua flessibilità e la licenza open-source sottolineano il potenziale per la democratizzazione dell’IA. Man mano che il panorama evolve, l’attenzione sarà inevitabilmente focalizzata sull’equilibrio del potere di questi modelli con considerazioni etiche e meccanismi di sicurezza.

Cosa verrà dopo per Mistral? Il modello 7B è stato solo l’inizio. La squadra mira a lanciare modelli ancora più grandi presto. Se questi nuovi modelli eguagliano le prestazioni del 7B, Mistral potrebbe rapidamente emergere come un giocatore di spicco nel settore, tutto entro il loro primo anno.

Ho trascorso gli ultimi cinque anni immergendomi nel mondo affascinante del Machine Learning e del Deep Learning. La mia passione e la mia esperienza mi hanno portato a contribuire a oltre 50 progetti di ingegneria del software diversi, con un focus particolare su AI/ML. La mia curiosità in corso mi ha anche portato verso l'elaborazione del linguaggio naturale, un campo che sono ansioso di esplorare ulteriormente.