Modele și platforme AI
În interiorul DBRX: Databricks deblochează un model LLM deschis puternic

De
Aayush Mittal Mittal
În domeniul în rapidă evoluție al modelelor de limbaj mare (LLM), a apărut un nou model puternic – DBRX, un model deschis creat de Databricks. Acest LLM face valuri cu performanța sa de ultimă generație într-o gamă largă de benchmark-uri, chiar rivalizând cu capacitățile gigantelor din industrie, cum ar fi GPT-4 de la OpenAI.
DBRX reprezintă o piatră de hotar importantă în democratizarea inteligenței artificiale, oferind cercetătorilor, dezvoltatorilor și întreprinderilor acces deschis la un model de limbaj de top. Dar ce este exact DBRX și ce îl face atât de special? În acestă analiză tehnică, vom explora arhitectura inovatoare, procesul de antrenare și capacitățile cheie care au propulsat DBRX în fruntea peisajului LLM deschis.
Nașterea DBRX Crearea DBRX a fost determinată de misiunea Databricks de a face inteligența datelor accesibilă tuturor întreprinderilor. Ca lider în platforme de analize de date, Databricks a recunoscut potențialul imens al LLM-urilor și a decis să dezvolte un model care să poată egala sau chiar să depășească performanța ofertelor proprietare.
După luni de cercetare intensă, dezvoltare și o investiție de zeci de milioane de dolari, echipa Databricks a realizat o descoperire cu DBRX. Performanța impresionantă a modelului pe o gamă largă de benchmark-uri, inclusiv înțelegerea limbajului, programare și matematică, a stabilit ferm DBRX ca o nouă referință în LLM-urile deschise.
Arhitectură inovatoare
Puterea mixture-of-experts La baza performanței excepționale a DBRX se află arhitectura sa inovatoare de mixture-of-experts (MoE). Acest design de ultimă generație reprezintă o abatere de la modelele dense tradiționale, adoptând o abordare rară care îmbunătățește atât eficiența preantrenării, cât și viteza de inferență.
În cadrul MoE, doar un grup select de componente, numite “experți”, sunt activate pentru fiecare intrare. Această specializare permite modelului să abordeze o gamă mai largă de sarcini cu mai multă abilitate, optimizând în același timp resursele computaționale.
DBRX duce acest concept și mai departe cu arhitectura sa de MoE fină. În contrast cu alte modele MoE care utilizează un număr mai mic de experți mai mari, DBRX folosește 16 experți, cu patru experți activi pentru orice intrare dată. Acest design oferă o cantitate uluitoare de 65 de ori mai multe combinații posibile de experți, contribuind direct la performanța superioară a DBRX.
DBRX se diferențiază prin mai multe caracteristici inovatoare:
- Rotary Position Encodings (RoPE): Îmbunătățește înțelegerea pozițiilor token-ilor, esențială pentru generarea de text contextualmente precis.
- Gated Linear Units (GLU): Introduce un mecanism de porțile care îmbunătățește capacitatea modelului de a învăța modele complexe mai eficient.
- Grouped Query Attention (GQA): Îmbunătățește eficiența modelului prin optimizarea mecanismului de atenție.
- Tokenizare avansată: Utilizează tokenizer-ul GPT-4 pentru a procesa intrările mai eficient.
Arhitectura MoE este în special potrivită pentru modelele de limbaj mari, deoarece permite o scalare mai eficientă și o utilizare mai bună a resurselor computaționale. Distribuind procesul de învățare pe multiple subrețele specializate, DBRX poate aloca eficient datele și puterea de calcul pentru fiecare sarcină, asigurând atât ieșiri de înaltă calitate, cât și eficiență optimă.
Date de antrenare extinse și optimizare eficientă În timp ce arhitectura DBRX este, fără îndoială, impresionantă, adevărata sa putere se află în procesul de antrenare atent și în cantitatea uriașă de date la care a fost expus. DBRX a fost preantrenat pe 12 trilioane de tokeni de date text și cod, atent selectate pentru a asigura calitatea și diversitatea.
Datele de antrenare au fost procesate utilizând suite-ul de instrumente Databricks, inclusiv Apache Spark pentru procesarea datelor, Unity Catalog pentru gestionarea și guvernanța datelor și MLflow pentru urmărirea experimentelor. Acest set cuprinzător de instrumente a permis echipei Databricks să gestioneze, exploreze și rafineze masivul set de date, stabilind baza pentru performanța excepțională a DBRX.
Pentru a îmbunătăți și mai mult capacitățile modelului, Databricks a utilizat un curriculum de preantrenare dinamic, variind inovativ amestecul de date în timpul antrenării. Această strategie a permis fiecărui token să fie procesat eficient utilizând cei 36 de miliarde de parametri activi, rezultând un model mai bine rotunjit și adaptabil.
Mai mult, procesul de antrenare al DBRX a fost optimizat pentru eficiență, utilizând tehnici precum învățarea curriculum și strategii de optimizare avansate. Prin angajarea acestor tehnici, echipa a obținut o îmbunătățire de aproape patru ori a eficienței computaționale în comparație cu modelele lor anterioare.
Antrenare și Arhitectură
DBRX a fost antrenat utilizând un model de predicție a următorului token pe un set de date masiv de 12 trilioane de tokeni, accentuând atât textul, cât și codul. Acest set de antrenare se crede a fi semnificativ mai eficient decât cele utilizate în modelele anterioare, asigurând o înțelegere și o capacitate de răspuns bogate și diverse.
Arhitectura DBRX nu este doar o mărturie a capacităților tehnice Databricks, ci și subliniază aplicabilitatea sa în multiple sectoare. De la îmbunătățirea interacțiunilor cu chatbot-urile la alimentarea unor sarcini complexe de analiză a datelor, DBRX poate fi integrat în diverse domenii care necesită o înțelegere nuanțată a limbajului.
În mod remarcabil, DBRX Instruct rivalizează chiar și unele dintre cele mai avansate modele închise de pe piață. Conform măsurătorilor Databricks, depășește GPT-3.5 și este competitiv cu Gemini 1.0 Pro și Mistral Medium în diverse benchmark-uri, inclusiv cunoașterea generală, raționamentul comun, programarea și raționamentul matematic.
De exemplu, pe benchmark-ul MMLU, care măsoară înțelegerea limbajului, DBRX Instruct a obținut un scor de 73,7%, depășind scorul de 70,0% al GPT-3.5. Pe benchmark-ul de raționament comun HellaSwag, DBRX Instruct a obținut un scor impresionant de 89,0%, depășind scorul de 85,5% al GPT-3.5.
DBRX Instruct strălucește cu adevărat, obținând o acuratețe remarcabilă de 70,1% pe benchmark-ul HumanEval, depășind nu numai GPT-3.5 (48,1%), ci și modelul specializat CodeLLaMA-70B Instruct (67,8%).
Aceste rezultate excepționale subliniază versatilitatea și capacitatea DBRX de a excela într-o gamă diversă de sarcini, de la înțelegerea limbajului natural la rezolvarea de probleme complexe de programare și matematică.
Inferență eficientă și scalabilitate Una dintre principalele avantaje ale arhitecturii MoE a DBRX este eficiența sa în timpul inferenței. Datorită activării rare a parametrilor, DBRX poate atinge o rată de inferență care este de până la două sau trei ori mai rapidă decât modelele dense cu același număr total de parametri.
Comparativ cu LLaMA2-70B, un model LLM deschis popular, DBRX nu numai că demonstrează o calitate superioară, dar are și o viteză de inferență aproape dublă, în ciuda faptului că are aproximativ jumătate din parametrii activi. Această eficiență face din DBRX o alegere atractivă pentru implementare într-o gamă largă de aplicații, de la crearea de conținut la analiza datelor și dincolo.
Mai mult, Databricks a dezvoltat un stivă de antrenare robustă care permite întreprinderilor să antreneze propriile modele DBRX de la zero sau să continue antrenarea pe baza punctelor de control oferite. Această capacitate împuternicește afacerile să valorifice pe deplin potențialul DBRX și să îl personalizeze în funcție de nevoile lor specifice, democratizând și mai mult accesul la tehnologia LLM de ultimă generație.
Accesibilitate și Integrări
În conformitate cu misiunea sa de a promova accesul deschis la IA, Databricks a făcut DBRX disponibil prin multiple canale. Greutățile atât a modelului de bază (DBRX Base), cât și a modelului finisat (DBRX Instruct) sunt găzduite pe platforma populară Hugging Face, permițând cercetătorilor și dezvoltatorilor să descarce și să lucreze cu modelul.
În plus, depozitul modelului DBRX este disponibil pe GitHub, oferind transparență și permisiunea de a explora și personaliza codul modelului.
Pentru clienții Databricks, DBRX Base și DBRX Instruct sunt accesibile prin API-urile de modele fundamentale Databricks, permițând o integrare fără efort în fluxurile de lucru și aplicații existente. Acest lucru nu numai că simplifică procesul de implementare, dar asigură și guvernanța și securitatea datelor pentru cazuri de utilizare sensibile.
Mai mult, DBRX a fost deja integrat în mai multe platforme și servicii terțe, cum ar fi You.com și Perplexity Labs, extinzându-și astfel domeniul de aplicare și posibilele utilizări. Aceste integrări demonstrează interesul crescând pentru DBRX și capacitățile sale, precum și adoptarea în creștere a LLM-urilor deschise în diverse industrii și cazuri de utilizare.
Capacități de context lung și generare îmbunătățită Una dintre caracteristicile remarcabile ale DBRX este capacitatea sa de a gestiona intrări de context lung, cu o lungime maximă de context de 32.768 de tokeni. Această capacitate permite modelului să proceseze și să genereze text pe baza informațiilor contextuale extinse, făcându-l potrivit pentru sarcini precum rezumarea documentelor, răspunsurile la întrebări și recuperarea informațiilor.
În benchmark-urile care evaluează performanța în context lung, cum ar fi KV-Pairs și HotpotQAXL, DBRX Instruct a depășit GPT-3.5 Turbo în diverse lungimi de secvențe și poziții de context.
Limitări și Lucrări Viitoare
Deși DBRX reprezintă o realizare semnificativă în domeniul LLM-urilor deschise, este esențial să recunoaștem limitările sale și domeniile care necesită îmbunătățiri viitoare. Ca orice model AI, DBRX poate produce răspunsuri inexacte sau biasate, în funcție de calitatea și diversitatea datelor sale de antrenare.
În plus, deși DBRX excelează în sarcini cu scop general, anumite aplicații specifice din domeniu pot necesita o finisare suplimentară sau un antrenament specializat pentru a atinge performanța optimă. De exemplu, în scenarii în care acuratețea și fidelitatea sunt de o importanță maximă, Databricks recomandă utilizarea tehnicilor de generare îmbunătățită de recuperare (RAG) pentru a îmbunătăți ieșirile modelului.
Mai mult, setul de date de antrenare curent al DBRX se compune în principal din conținut în limba engleză, ceea ce ar putea limita performanța sa în sarcini non-engleze. Iterațiile viitoare ale modelului ar putea implica extinderea setului de date de antrenare pentru a include o gamă mai diversă de limbi și contexte culturale.
Databricks este dedicat îmbunătățirii continue a capacităților DBRX și abordării limitărilor sale. Lucrările viitoare se vor concentra pe îmbunătățirea performanței, scalabilității și utilizabilității modelului în diverse aplicații și cazuri de utilizare, precum și pe explorarea tehnicilor pentru a mitigă potențialele bias-uri și a promova utilizarea etică a IA.
În plus, compania planifică să rafineze și mai mult procesul de antrenare, utilizând tehnici avansate precum învățarea federată și metodele de protecție a datelor pentru a asigura confidențialitatea și securitatea datelor.
Drumul Înainte
DBRX reprezintă un pas semnificativ înainte în democratizarea dezvoltării IA. Viziunea sa este una în care fiecare întreprindere are capacitatea de a controla datele și destinul său în lumea emergentă a IA generativă.
Prin deschiderea DBRX și oferirea accesului la aceleași instrumente și infrastructură utilizate pentru a-l construi, Databricks împuternicește afacerile și cercetătorii să dezvolte propriile modele Databricks personalizate în funcție de nevoile lor specifice.
Prin platforma Databricks, clienții pot valorifica suite-ul de instrumente de procesare a datelor, inclusiv Apache Spark, Unity Catalog și MLflow, pentru a curata și gestiona datele lor de antrenare. Ei pot apoi utiliza bibliotecile de antrenare optimizate Databricks, cum ar fi Composer, LLM Foundry, MegaBlocks și Streaming, pentru a antrena propriile modele DBRX eficient și la scară.
Această democratizare a dezvoltării IA are potențialul de a debloca o nouă undă de inovație, pe măsură ce întreprinderile câștigă capacitatea de a valorifica puterea modelelor de limbaj mari pentru o gamă largă de aplicații, de la crearea de conținut și analiza datelor la suportul deciziilor și dincolo.
Mai mult, prin promovarea unui ecosistem deschis și colaborativ în jurul DBRX, Databricks își propune să accelereze ritmul cercetării și dezvoltării în domeniul modelelor de limbaj mari. Pe măsură ce mai multe organizații și indivizi contribuie cu expertiza și insight-urile lor, cunoașterea și înțelegerea colectivă a acestor sisteme AI puternice vor continua să crească, deschizând calea pentru modele și mai avansate și capabile în viitor.
Concluzie
DBRX este un jucător cheie în lumea modelelor de limbaj mare deschise. Cu arhitectura sa inovatoare de mixture-of-experts, datele sale extinse de antrenare și performanța sa de ultimă generație, a stabilit un nou reper pentru ceea ce este posibil cu LLM-urile deschise.
Prin democratizarea accesului la tehnologia IA de ultimă generație, DBRX împuternicește cercetători, dezvoltatori și întreprinderi să exploreze noi frontiere în procesarea limbajului natural, crearea de conținut, analiza datelor și dincolo. Pe măsură ce Databricks continuă să rafineze și să îmbunătățească DBRX, aplicațiile și impactul acestui model puternic sunt cu adevărat nelimitate.
Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.
Descoperă mai multe


OpenAI lansează Agentul de Date în ChatGPT Work pentru a Analiza Datele Companiei


Mistral strânge €3 miliarde în seria D pentru a extinde AI suveran


Mistral și echipa HUMAIN despre AI suveran pentru Arabia Saudită și regiune


Microsoft extinde parteneriatul cu Mistral pentru a atrage cumpărători de AI reglementați


Parlamentul European construiește propria platformă de inteligență artificială pentru legislatori


De ce majoritatea aplicațiilor moderne vor fi inutile în era inteligenței artificiale

