AI-modellen en platforms
Binnenin DBRX: Databricks ontsluit krachtige open source LLM

Door
Aayush Mittal Mittal
In het snel evoluerende veld van grote taalmodellen (LLM’s) is een nieuw krachtig model ontstaan – DBRX, een open source model gemaakt door Databricks. Dit LLM maakt golven met zijn state-of-the-art prestaties op een breed scala aan benchmarks, zelfs de mogelijkheden van industrie-giganten zoals OpenAI’s GPT-4 rivaliserend.
DBRX vertegenwoordigt een belangrijke mijlpaal in de democratisering van kunstmatige intelligentie, waarbij onderzoekers, ontwikkelaars en ondernemingen open toegang krijgen tot een top-tier taalmodel. Maar wat is DBRX precies, en wat maakt het zo speciaal? In deze technische diepe duik zullen we de innovatieve architectuur, trainingsproces en sleutelcapaciteiten verkennen die DBRX naar de voorgrond van het open LLM-landschap hebben gebracht.
De geboorte van DBRX De creatie van DBRX werd gedreven door Databricks’ missie om data-intelligentie toegankelijk te maken voor alle ondernemingen. Als leider in data-analyseplatforms erkende Databricks het immense potentieel van LLM’s en zette zich in om een model te ontwikkelen dat de prestaties van propriëtaire aanbiedingen kon evenaren of zelfs overtreffen.
Na maanden van intensief onderzoek, ontwikkeling en een investering van meerdere miljoenen dollars bereikte het Databricks-team een doorbraak met DBRX. Het indrukwekkende prestatieniveau van het model op een breed scala aan benchmarks, waaronder taalbegrip, programmeren en wiskunde, vestigde het stevig als een nieuwe state-of-the-art in open LLM’s.
Innovatieve architectuur
De kracht van Mixture-of-Experts Aan de basis van DBRX’s uitzonderlijke prestaties ligt zijn innovatieve mixture-of-experts (MoE) architectuur. Deze baanbrekende ontwerp vertegenwoordigt een afwijking van traditionele dichte modellen, waarbij een schaarse benadering wordt geadopteerd die zowel de pretraining-efficiëntie als de inferentiesnelheid verbetert.
In het MoE-kader worden alleen een selecte groep componenten, genaamd “experts”, geactiveerd voor elke invoer. Deze specialisatie stelt het model in staat om een bredere reeks taken met grotere vaardigheid aan te pakken, terwijl het ook de computermiddelen optimaliseert.
DBRX gaat nog een stap verder met zijn fijngranige MoE-architectuur. In tegenstelling tot sommige andere MoE-modellen die een kleiner aantal grotere experts gebruiken, gebruikt DBRX 16 experts, met vier experts die actief zijn voor elke invoer. Dit ontwerp biedt een verbluffende 65 keer meer mogelijke expertcombinaties, wat rechtstreeks bijdraagt aan DBRX’s superieure prestaties.
DBRX onderscheidt zich met verschillende innovatieve functies:
- Rotary Position Encodings (RoPE): Verbeterd begrip van tokenposities, cruciaal voor het genereren van contextueel accurate tekst.
- Gated Linear Units (GLU): Introduceert een gating-mechanisme dat het vermogen van het model om complexe patronen te leren efficiënter maakt.
- Grouped Query Attention (GQA): Verbeterd de efficiëntie van het model door de aandachtmachine te optimaliseren.
- Geavanceerde tokenisatie: Maakt gebruik van GPT-4’s tokenizer om invoer effectiever te verwerken.
De MoE-architectuur is bijzonder geschikt voor grote taalmodellen, omdat het efficiëntere schaling en betere benutting van computermiddelen mogelijk maakt. Door het leerproces over meerdere gespecialiseerde subnetwerken te distribueren, kan DBRX effectief gegevens en computermiddelen voor elke taak toewijzen, waardoor zowel hoge kwaliteit output als optimale efficiëntie wordt gewaarborgd.
Uitgebreide trainingsgegevens en efficiënte optimalisatie Terwijl DBRX’s architectuur ongetwijfeld indrukwekkend is, ligt zijn ware kracht in het zorgvuldige trainingsproces en de enorme hoeveelheid gegevens waaraan het is blootgesteld. DBRX werd gepretraint op een verbijsterende 12 biljoen tokens aan tekst- en codegegevens, zorgvuldig geselecteerd om hoge kwaliteit en diversiteit te garanderen.
De trainingsgegevens werden verwerkt met Databricks’ suite van tools, waaronder Apache Spark voor gegevensverwerking, Unity Catalog voor gegevensbeheer en -governance, en MLflow voor experimenten bijhouden. Deze uitgebreide toolset stelde het Databricks-team in staat om de enorme dataset effectief te beheren, te verkennen en te verfijnen, waardoor de basis werd gelegd voor DBRX’s uitzonderlijke prestaties.
Om de mogelijkheden van het model verder te verbeteren, paste Databricks een dynamisch pretrainingscurriculum toe, waarbij de datamix tijdens de training innovatief werd gewijzigd. Deze strategie stelde elke token in staat om effectief te worden verwerkt met de 36 miljard actieve parameters, waardoor een meer afgerond en aanpasbaar model ontstond.
Bovendien was DBRX’s trainingsproces geoptimaliseerd voor efficiëntie, waarbij Databricks’ suite van propriëtaire tools en bibliotheken werd gebruikt, waaronder Composer, LLM Foundry, MegaBlocks en Streaming. Door technieken zoals curriculum learning en geoptimaliseerde optimalisatiestrategieën te gebruiken, bereikte het team een verbetering van bijna vier keer in rekenkracht-efficiëntie in vergelijking met hun eerdere modellen.
Training en architectuur
DBRX werd getraind met een next-token predictiemodel op een kolossaal dataset van 12 biljoen tokens, waarbij zowel tekst als code werd benadrukt. Deze trainingsset wordt verondersteld aanzienlijk effectiever te zijn dan die gebruikt in eerdere modellen, waardoor een rijke begrip en responsmogelijkheid over uiteenlopende prompts wordt gewaarborgd.
DBRX’s architectuur is niet alleen een getuigenis van Databricks’ technische kundigheid, maar benadrukt ook zijn toepassing in meerdere sectoren. Van het verbeteren van chatbot-interacties tot het aandrijven van complexe gegevensanalysetaak, kan DBRX worden geïntegreerd in uiteenlopende gebieden die verfijnd taalbegrip vereisen.
Opmerkelijk is dat DBRX Instruct zelfs enkele van de meest geavanceerde gesloten modellen op de markt evenaart. Volgens Databricks’ metingen overtreft het GPT-3.5 en is het concurrerend met Gemini 1.0 Pro en Mistral Medium op verschillende benchmarks, waaronder algemene kennis, gezond verstand, programmeren en wiskundig redeneren.
Bijvoorbeeld, op de MMLU-benchmark, die taalbegrip meet, behaalde DBRX Instruct een score van 73,7%, waarmee het GPT-3.5’s gerapporteerde score van 70,0% overtrof. Op de HellaSwag-benchmark voor gezond verstand redeneren behaalde DBRX Instruct een indrukwekkende score van 89,0%, waarmee het GPT-3.5’s 85,5% overtrof.
DBRX Instruct blinkt echt uit, met een opmerkelijke nauwkeurigheid van 70,1% op de HumanEval-benchmark, waarmee het niet alleen GPT-3.5 (48,1%) overtrof, maar ook het gespecialiseerde CodeLLaMA-70B Instruct-model (67,8%).
Deze uitzonderlijke resultaten benadrukken DBRX’s veelzijdigheid en zijn vermogen om uit te blinken in een breed scala aan taken, van natuurlijke taalbegrip tot complex programmeren en wiskundig probleemoplossen.
Efficiënte inferentie en schaalbaarheid Een van de belangrijkste voordelen van DBRX’s MoE-architectuur is zijn efficiëntie tijdens inferentie. Dankzij de schaarse activatie van parameters kan DBRX een inferentiesnelheid bereiken die tot twee tot drie keer sneller is dan dichte modellen met hetzelfde totale parameteraantal.
In vergelijking met LLaMA2-70B, een populaire open source LLM, toont DBRX niet alleen een hogere kwaliteit, maar ook bijna dubbele inferentiesnelheid, ondanks het feit dat het ongeveer de helft van het aantal actieve parameters heeft. Deze efficiëntie maakt DBRX een aantrekkelijke keuze voor implementatie in een breed scala aan toepassingen, van inhoudscreatie tot gegevensanalyse en verder.
Bovendien heeft Databricks een robuuste trainingsstack ontwikkeld die ondernemingen in staat stelt om hun eigen DBRX-klasse modellen van scratch te trainen of verder te trainen op basis van de verstrekte checkpoints. Deze mogelijkheid stelt bedrijven in staat om het volledige potentieel van DBRX te benutten en het aan te passen aan hun specifieke behoeften, waardoor de toegang tot cutting-edge LLM-technologie verder wordt gedemocratiseerd.
Toegankelijkheid en integraties
In overeenstemming met zijn missie om open toegang tot AI te bevorderen, heeft Databricks DBRX beschikbaar gemaakt via meerdere kanalen. De gewichten van zowel het basismodel (DBRX Base) als het gefinetuneerde model (DBRX Instruct) worden gehost op het populaire Hugging Face-platform, waardoor onderzoekers en ontwikkelaars het model gemakkelijk kunnen downloaden en gebruiken.
Bovendien is de DBRX-modelrepository beschikbaar op GitHub, waardoor transparantie wordt geboden en verdere exploratie en aanpassing van de modelcode mogelijk wordt gemaakt.
Voor Databricks-klanten zijn DBRX Base en DBRX Instruct gemakkelijk toegankelijk via de Databricks Foundation Model APIs, waardoor naadloze integratie in bestaande workflows en toepassingen mogelijk wordt. Dit vereenvoudigt niet alleen het implementatieproces, maar waarborgt ook gegevensbeheer en -beveiliging voor gevoelige use cases.
Bovendien is DBRX al geïntegreerd in verschillende derde-partijplatforms en -diensten, zoals You.com en Perplexity Labs, waardoor zijn bereik en potentiële toepassingen worden uitgebreid. Deze integraties demonstreren de groeiende interesse in DBRX en zijn mogelijkheden, evenals de toenemende adoptie van open LLM’s in verschillende industrieën en use cases.
Lange-contextmogelijkheden en retrieval-augmenteerde generatie Een van de opvallende functies van DBRX is zijn vermogen om lange-contextinvoer te verwerken, met een maximumcontextlengte van 32.768 tokens. Deze mogelijkheid stelt het model in staat om tekst te genereren op basis van uitgebreide contextuele informatie, waardoor het geschikt is voor taken zoals documentensamenvatting, vraagbeantwoording en informatieverwerving.
In benchmarks die de prestaties van lange-contextevaluatie beoordelen, zoals KV-Pairs en HotpotQAXL, overtrof DBRX Instruct GPT-3.5 Turbo op verschillende sequentielengtes en contextposities.

DBRX outperforms established open source models on language understanding (MMLU), Programming (HumanEval), and Math (GSM8K).
Beperkingen en toekomstig werk
Terwijl DBRX een belangrijke prestatie in het veld van open LLM’s vertegenwoordigt, is het essentieel om zijn beperkingen en gebieden voor toekomstige verbetering te erkennen. Net als elk AI-model kan DBRX onnauwkeurige of bevooroordeelde antwoorden produceren, afhankelijk van de kwaliteit en diversiteit van zijn trainingsgegevens.
Bovendien, terwijl DBRX uitblinkt in algemene taken, kunnen bepaalde domeinspecifieke toepassingen verdere fine-tuning of gespecialiseerde training vereisen om optimale prestaties te bereiken. In scenario’s waarbij nauwkeurigheid en geloofwaardigheid van het grootste belang zijn, beveelt Databricks aan om retrieval-augmenteerde generatie (RAG)-technieken te gebruiken om het modeloutput te verbeteren.
Bovendien bestaat DBRX’s huidige trainingsdataset voornamelijk uit Engelstalige inhoud, wat zijn prestaties op niet-Engelse taken mogelijk beperkt. Toekomstige iteraties van het model kunnen het opnemen van een meer diverse reeks talen en culturele contexten in de trainingsgegevens omvatten.
Databricks is toegewijd aan het continue verbeteren van DBRX’s mogelijkheden en het aanpakken van zijn beperkingen. Toekomstig werk zal zich richten op het verbeteren van het modelprestaties, schaalbaarheid en bruikbaarheid in verschillende toepassingen en use cases, evenals op het verkennen van technieken om potentiële vooroordelen te mitigeren en ethische AI-gebruik te bevorderen.
Bovendien plant het bedrijf om het trainingsproces verder te verfijnen, waarbij geavanceerde technieken zoals federated learning en privacy-beschermende methoden worden gebruikt om gegevensprivacy en -beveiliging te waarborgen.
De weg vooruit
DBRX vertegenwoordigt een belangrijke stap voorwaarts in de democratisering van AI-ontwikkeling. Het voorziet een toekomst waarin elke onderneming de mogelijkheid heeft om zijn eigen data en bestemming in de opkomende wereld van generatieve AI te controleren.
Door DBRX open source te maken en toegang te bieden tot dezelfde tools en infrastructuur die zijn gebruikt om het te bouwen, empowerd Databricks bedrijven en onderzoekers om hun eigen cutting-edge Databricks aan te passen aan hun specifieke behoeften.
Via het Databricks-platform kunnen klanten de suite van data-verwerkingsgereedschappen van Databricks gebruiken, waaronder Apache Spark, Unity Catalog en MLflow, om hun trainingsgegevens te cureren en te beheren. Vervolgens kunnen ze de geoptimaliseerde trainingsbibliotheken van Databricks gebruiken, zoals Composer, LLM Foundry, MegaBlocks en Streaming, om hun eigen DBRX-klasse modellen efficiënt en op grote schaal te trainen.
Deze democratisering van AI-ontwikkeling heeft het potentieel om een nieuwe golf van innovatie te ontsluiten, aangezien ondernemingen de mogelijkheid krijgen om de kracht van grote taalmodellen te benutten voor een breed scala aan toepassingen, van inhoudscreatie en gegevensanalyse tot beslissingsondersteuning en verder.
Bovendien door een open en collaboratief ecosysteem rond DBRX te creëren, beoogt Databricks de snelheid van onderzoek en ontwikkeling in het veld van grote taalmodellen te versnellen. Naarmate meer organisaties en individuen hun expertise en inzichten bijdragen, zal de collectieve kennis en het begrip van deze krachtige AI-systemen blijven groeien, waardoor de weg wordt geëffend voor nog geavanceerdere en capabelere modellen in de toekomst.
Conclusie
DBRX is een game-changer in de wereld van open source grote taalmodellen. Met zijn innovatieve mixture-of-experts architectuur, uitgebreide trainingsgegevens en state-of-the-art prestaties, heeft het een nieuwe benchmark gesteld voor wat mogelijk is met open LLM’s.
Door toegang tot cutting-edge AI-technologie te democratiseren, empowerd DBRX onderzoekers, ontwikkelaars en ondernemingen om nieuwe frontiers in natuurlijke taalverwerking, inhoudscreatie, gegevensanalyse en verder te verkennen. Terwijl Databricks DBRX blijft verfijnen en verbeteren, zijn de potentiële toepassingen en impact van dit krachtige model werkelijk onbeperkt.
Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.
Ontdek meer


OpenAI introduceert Data-agent in ChatGPT Work om bedrijfsgegevens te analyseren


Mistral haalt €3 mrd op in Serie D om Soevereine AI uit te breiden


Mistral en HUMAIN‑team over soevereine AI voor Saoedi‑Arabie en de regio


Microsoft breidt Mistral-deal uit om gereguleerde AI-kopers te verleiden


Het Europees Parlement bouwt zijn eigen AI-platform voor wetgevers


Waarom de meeste moderne apps nutteloos zullen zijn in het tijdperk van AI
