Modelli e piattaforme di IA

Dentro DBRX: Databricks Svela il Potente Modello di Linguaggio Open Source LLM

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Nel campo in rapida evoluzione dei modelli di linguaggio (LLM), è emerso un nuovo modello potente – DBRX, un modello open source creato da Databricks. Questo LLM sta facendo onde con le sue prestazioni all’avanguardia in una vasta gamma di benchmark, rivaleggiando addirittura con le capacità di giganti del settore come OpenAI’s GPT-4.

DBRX rappresenta un importante traguardo nella democratizzazione dell’intelligenza artificiale, fornendo ai ricercatori, agli sviluppatori e alle imprese l’accesso aperto a un modello di linguaggio di alta qualità. Ma cosa è esattamente DBRX e cosa lo rende così speciale? In questo approfondimento tecnico, esploreremo l’architettura innovativa, il processo di formazione e le principali capacità che hanno catapultato DBRX ai vertici del panorama LLM open source.

La nascita di DBRX La creazione di DBRX è stata guidata dalla missione di Databricks di rendere l’intelligenza dei dati accessibile a tutte le imprese. In quanto leader nelle piattaforme di analisi dei dati, Databricks ha riconosciuto l’enorme potenziale dei LLM e ha deciso di sviluppare un modello che potesse eguagliare o addirittura superare le prestazioni delle offerte proprietarie.

Dopo mesi di intensa ricerca, sviluppo e un investimento di diversi milioni di dollari, il team di Databricks ha raggiunto una svolta con DBRX. Le impressionanti prestazioni del modello su una vasta gamma di benchmark, tra cui la comprensione del linguaggio, la programmazione e la matematica, lo hanno saldamente stabilito come un nuovo stato dell’arte nei LLM open source.

Architettura Innovativa

Il Potere della Mixture-of-Experts Al cuore delle prestazioni eccezionali di DBRX c’è la sua innovativa architettura di mixture-of-experts (MoE). Questo design all’avanguardia rappresenta una deviazione dai modelli densi tradizionali, adottando un approccio sparso che migliora sia l’efficienza di pre-formazione che la velocità di inferenza.

Nel framework MoE, solo un gruppo selezionato di componenti, chiamati “esperti”, viene attivato per ogni input. Questa specializzazione consente al modello di affrontare una più ampia gamma di compiti con maggiore abilità, ottimizzando allo stesso tempo le risorse computazionali.

DBRX porta questo concetto ancora più avanti con la sua architettura MoE fine-grana. A differenza di alcuni altri modelli MoE che utilizzano un numero inferiore di esperti più grandi, DBRX impiega 16 esperti, con quattro esperti attivi per ogni input dato. Questo design fornisce una combinazione di esperti possibile di ben 65 volte superiore, contribuendo direttamente alle prestazioni superiori di DBRX.

DBRX si differenzia con diverse caratteristiche innovative:

  • Codici di Posizione Rotativi (RoPE): Migliorano la comprensione delle posizioni dei token, essenziale per generare testo contestualmente accurato.
  • Unità Lineari a Cancello (GLU): Introducono un meccanismo di controllo che migliora la capacità del modello di apprendere modelli complessi in modo più efficiente.
  • Attenzione Raggruppata alle Query (GQA): Migliora l’efficienza del modello ottimizzando il meccanismo di attenzione.
  • Tokenizzazione Avanzata: Utilizza il tokenizer di GPT-4 per elaborare gli input in modo più efficace.

L’architettura MoE è particolarmente adatta per i grandi modelli di linguaggio, poiché consente una scalabilità più efficiente e un miglior utilizzo delle risorse computazionali. Distribuendo il processo di apprendimento su più sottoreti specializzate, DBRX può allocare efficacemente i dati e il potere computazionale per ogni compito, garantendo sia la qualità del output che l’efficienza ottimale.

Estesi Dati di Formazione e Ottimizzazione Efficienti Mentre l’architettura di DBRX è senza dubbio impressionante, il suo vero potere risiede nel processo di formazione meticoloso e nella vasta quantità di dati a cui è stato esposto. DBRX è stato pre-addestrato su un totale di 12 trilioni di token di dati testuali e di codice, curati con cura per garantire alta qualità e diversità.

I dati di formazione sono stati elaborati utilizzando la suite di strumenti di Databricks, tra cui Apache Spark per l’elaborazione dei dati, Unity Catalog per la gestione e il governo dei dati e MLflow per il tracciamento degli esperimenti. Questa strumentazione completa ha consentito al team di Databricks di gestire, esplorare e raffinare efficacemente il vasto set di dati, gettando le basi per le prestazioni eccezionali di DBRX.

Per ulteriormente migliorare le capacità del modello, Databricks ha impiegato un curriculum di pre-formazione dinamico, variando innovativamente la miscela di dati durante la formazione. Questa strategia ha consentito a ogni token di essere efficacemente elaborato utilizzando i 36 miliardi di parametri attivi, risultando in un modello più completo e adattabile.

Inoltre, il processo di formazione di DBRX è stato ottimizzato per l’efficienza, sfruttando la suite di strumenti e librerie proprietarie di Databricks, tra cui Composer, LLM Foundry, MegaBlocks e Streaming. Impiegando tecniche come l’apprendimento per curriculum e strategie di ottimizzazione ottimizzate, il team ha raggiunto un miglioramento di quasi quattro volte nell’efficienza computazionale rispetto ai modelli precedenti.

Formazione e Architettura

DBRX è stato addestrato utilizzando un modello di previsione del prossimo token su un dataset colossale di 12 trilioni di token, enfatizzando sia il testo che il codice. Questo set di formazione si ritiene essere significativamente più efficace rispetto a quelli utilizzati nei modelli precedenti, garantendo una comprensione e una capacità di risposta ricche e variegate attraverso prompt diversi.

L’architettura di DBRX non è solo un tributo alla competenza tecnica di Databricks, ma sottolinea anche la sua applicazione in più settori. Dall’ampliamento delle interazioni dei chatbot al potenziamento di compiti di analisi dei dati complessi, DBRX può essere integrato in campi diversi che richiedono una comprensione del linguaggio sfumata.

In modo sorprendente, DBRX Instruct rivaleggia addirittura con alcuni dei modelli chiusi più avanzati sul mercato. Secondo le misurazioni di Databricks, supera GPT-3.5 e risulta competitivo con Gemini 1.0 Pro e Mistral Medium in vari benchmark, tra cui conoscenza generale, ragionamento basato sul senso comune, programmazione e ragionamento matematico.

Ad esempio, nel benchmark MMLU, che misura la comprensione del linguaggio, DBRX Instruct ha raggiunto un punteggio del 73,7%, superando il punteggio riportato di GPT-3.5 del 70,0%. Nel benchmark di ragionamento basato sul senso comune HellaSwag, DBRX Instruct ha ottenuto un impressionante 89,0%, superando l’85,5% di GPT-3.5.

DBRX Instruct si distingue veramente, raggiungendo un’accuratezza del 70,1% nel benchmark HumanEval, superando non solo GPT-3.5 (48,1%) ma anche il modello CodeLLaMA-70B Instruct specializzato (67,8%).

Questi risultati eccezionali evidenziano la versatilità di DBRX e la sua capacità di eccellere in una vasta gamma di compiti, dalla comprensione del linguaggio naturale alla risoluzione di problemi di programmazione e matematica complessi.

Efficienza dell’Inferenza e Scalabilità Una delle principali vantaggi dell’architettura MoE di DBRX è la sua efficienza durante l’inferenza. Grazie all’attivazione sparsa dei parametri, DBRX può raggiungere un throughput di inferenza che è fino a due o tre volte più veloce rispetto ai modelli densi con lo stesso numero totale di parametri.

In confronto a LLaMA2-70B, un popolare LLM open source, DBRX non solo dimostra una qualità superiore ma vanta anche quasi il doppio della velocità di inferenza, nonostante abbia circa la metà dei parametri attivi. Questa efficienza rende DBRX una scelta attraente per il deployment in una vasta gamma di applicazioni, dalla creazione di contenuti all’analisi dei dati e oltre.

Inoltre, Databricks ha sviluppato uno stack di formazione robusto che consente alle imprese di formare i propri modelli di classe DBRX da zero o di continuare la formazione a partire dai checkpoint forniti. Questa capacità consente alle aziende di sfruttare appieno il potenziale di DBRX e di adattarlo alle loro esigenze specifiche, democratizzando ulteriormente l’accesso alla tecnologia LLM all’avanguardia.

Accessibilità e Integrazioni

In linea con la sua missione di promuovere l’accesso aperto all’AI, Databricks ha reso DBRX disponibile attraverso più canali. I pesi di entrambi il modello base (DBRX Base) e il modello fine-tunato (DBRX Instruct) sono ospitati sulla piattaforma Hugging Face, consentendo ai ricercatori e agli sviluppatori di scaricare e lavorare facilmente con il modello.

Inoltre, il repository del modello DBRX è disponibile su GitHub, fornendo trasparenza e consentendo ulteriori esplorazioni e personalizzazioni del codice del modello.

inference throughput for various model configurations on our optimized serving infrastructure using NVIDIA TensorRT-LLM at 16-bit precision with the best optimization flags we could find.

Per i clienti di Databricks, DBRX Base e DBRX Instruct sono facilmente accessibili tramite le API dei modelli di base di Databricks, consentendo un’integrazione senza soluzione di continuità nei flussi di lavoro e nelle applicazioni esistenti. Ciò non solo semplifica il processo di deployment, ma garantisce anche la governance e la sicurezza dei dati per casi d’uso sensibili.

Inoltre, DBRX è già stato integrato in diverse piattaforme e servizi di terze parti, come You.com e Perplexity Labs, ampliando la sua portata e le sue potenziali applicazioni. Queste integrazioni dimostrano l’interesse crescente per DBRX e le sue capacità, nonché l’adozione sempre maggiore dei LLM open source in vari settori e casi d’uso.

Capacità di Contesto Lungo e Generazione Assistita da Recupero Una delle caratteristiche di spicco di DBRX è la sua capacità di gestire input di contesto lungo, con una lunghezza di contesto massima di 32.768 token. Ciò consente al modello di elaborare e generare testo in base a informazioni contestuali estese, rendendolo adatto a compiti come la sintesi di documenti, la risposta alle domande e il recupero di informazioni.

Nei benchmark che valutano le prestazioni di contesto lungo, come KV-Pairs e HotpotQAXL, DBRX Instruct ha superato GPT-3.5 Turbo in varie lunghezze di sequenza e posizioni di contesto.

DBRX outperforms established open source models on language understanding (MMLU), Programming (HumanEval), and Math (GSM8K).

DBRX outperforms established open source models on language understanding (MMLU), Programming (HumanEval), and Math (GSM8K).

Limitazioni e Lavori Futuri

Mentre DBRX rappresenta un importante traguardo nel campo dei LLM open source, è essenziale riconoscere le sue limitazioni e aree di miglioramento futuro. Come qualsiasi modello di intelligenza artificiale, DBRX può produrre risposte inaccurate o pregiudicate, a seconda della qualità e della diversità dei suoi dati di formazione.

Inoltre, mentre DBRX eccelle in compiti di scopo generale, alcune applicazioni specifiche di dominio potrebbero richiedere ulteriore fine-tuning o formazione specializzata per raggiungere prestazioni ottimali. Ad esempio, in scenari in cui l’accuratezza e la fedeltà sono di importanza fondamentale, Databricks consiglia l’uso di tecniche di generazione assistita da recupero (RAG) per migliorare l’output del modello.

Inoltre, il set di dati di formazione attuale di DBRX consiste principalmente in contenuti in lingua inglese, potenzialmente limitando le sue prestazioni in compiti non in inglese. Le iterazioni future del modello potrebbero coinvolgere l’espansione del set di dati di formazione per includere una gamma più diversificata di lingue e contesti culturali.

Databricks è impegnata a migliorare costantemente le capacità di DBRX e a risolvere le sue limitazioni. I lavori futuri si concentreranno sull’ampliamento delle prestazioni, della scalabilità e dell’usabilità del modello in vari ambiti e casi d’uso, nonché sull’esplorazione di tecniche per mitigare i pregiudizi potenziali e promuovere un uso etico dell’AI.

Inoltre, l’azienda pianifica di raffinare ulteriormente il processo di formazione, sfruttando tecniche avanzate come l’apprendimento federato e i metodi di conservazione della privacy per garantire la sicurezza e la protezione dei dati.

La Strada Davanti

DBRX rappresenta un passo significativo nella democratizzazione dello sviluppo dell’AI. Prefigura un futuro in cui ogni impresa avrà la capacità di controllare i propri dati e il proprio destino nel mondo emergente dell’AI generativa.

Rendendo DBRX open source e fornendo l’accesso agli stessi strumenti e infrastrutture utilizzati per costruirlo, Databricks sta abilitando le imprese e i ricercatori a sviluppare i propri modelli di classe DBRX personalizzati in base alle loro esigenze specifiche.

Attraverso la piattaforma Databricks, i clienti possono sfruttare la suite di strumenti di elaborazione dei dati di Databricks, tra cui Apache Spark, Unity Catalog e MLflow, per curare e gestire i propri dati di formazione. Possono quindi utilizzare le librerie di formazione ottimizzate di Databricks, come Composer, LLM Foundry, MegaBlocks e Streaming, per formare i propri modelli di classe DBRX in modo efficiente e su larga scala.

Questa democratizzazione dello sviluppo dell’AI ha il potenziale per sbloccare una nuova ondata di innovazione, poiché le imprese guadagnano la capacità di sfruttare il potere dei grandi modelli di linguaggio per una vasta gamma di applicazioni, dalla creazione di contenuti all’analisi dei dati e oltre.

Inoltre, promuovendo un ecosistema aperto e collaborativo intorno a DBRX, Databricks mira ad accelerare il ritmo della ricerca e dello sviluppo nel campo dei grandi modelli di linguaggio. Man mano che più organizzazioni e individui contribuiscono con la loro esperienza e conoscenze, la conoscenza collettiva e la comprensione di questi potenti sistemi di AI continueranno a crescere, preparando la strada per modelli ancora più avanzati e capaci nel futuro.

Conclusione

DBRX è un cambiamento di gioco nel mondo dei modelli di linguaggio open source. Con la sua architettura di mixture-of-experts innovativa, i dati di formazione estensivi e le prestazioni all’avanguardia, ha stabilito un nuovo benchmark per ciò che è possibile con i LLM open source.

Democratizzando l’accesso alla tecnologia AI all’avanguardia, DBRX abilita i ricercatori, gli sviluppatori e le imprese a esplorare nuove frontiere nell’elaborazione del linguaggio naturale, nella creazione di contenuti, nell’analisi dei dati e oltre. Man mano che Databricks continua a raffinare e migliorare DBRX, le potenziali applicazioni e l’impatto di questo potente modello sono veramente illimitati.

Ho trascorso gli ultimi cinque anni immergendomi nel mondo affascinante del Machine Learning e del Deep Learning. La mia passione e la mia esperienza mi hanno portato a contribuire a oltre 50 progetti di ingegneria del software diversi, con un focus particolare su AI/ML. La mia curiosità in corso mi ha anche portato verso l'elaborazione del linguaggio naturale, un campo che sono ansioso di esplorare ulteriormente.