KI-Modelle und Plattformen
Innerhalb von DBRX: Databricks entfesselt leistungsstarke Open-Source-LLM

Von
Aayush Mittal Mittal
Im rasch fortschreitenden Bereich der großen Sprachmodelle (LLMs) ist ein neues leistungsstarkes Modell aufgetaucht – DBRX, ein Open-Source-Modell, das von Databricks erstellt wurde. Dieses LLM macht mit seiner Spitzenleistung über ein breites Spektrum von Benchmarks hinweg Wellen, sogar die Fähigkeiten von Branchenriesen wie OpenAI’s GPT-4 rivalisierend.
DBRX stellt einen bedeutenden Meilenstein in der Demokratisierung der künstlichen Intelligenz dar, indem es Forschern, Entwicklern und Unternehmen einen offenen Zugang zu einem Spitzen-Sprachmodell bietet. Aber was ist DBRX genau, und was macht es so besonders? In diesem technischen Deep Dive werden wir die innovative Architektur, den Trainingsprozess und die Schlüsselkapazitäten erkunden, die DBRX an die Spitze der offenen LLM-Landschaft katapultiert haben.
Die Geburt von DBRX Die Entstehung von DBRX wurde von Databricks’ Mission angetrieben, die Datenintelligenz für alle Unternehmen zugänglich zu machen. Als Leader in Datenanalyse-Plattformen erkannte Databricks das immense Potenzial von LLMs und setzte sich das Ziel, ein Modell zu entwickeln, das die Leistung von proprietären Angeboten erreichen oder sogar übertreffen könnte.
Nach monatelanger intensiver Forschung, Entwicklung und einer Millionenschweren Investition erzielte das Databricks-Team einen Durchbruch mit DBRX. Die beeindruckende Leistung des Modells auf einer breiten Palette von Benchmarks, einschließlich Sprachverständnis, Programmierung und Mathematik, etablierte es fest als neuen Spitzenreiter in offenen LLMs.
Innovative Architektur
Die Macht der Mixture-of-Experts Im Kern von DBRX’ außergewöhnlicher Leistung liegt seine innovative Mixture-of-Experts-(MoE)-Architektur. Diese bahnbrechende Konstruktion stellt einen Abweg von traditionellen dichten Modellen dar, indem sie einen sparsamen Ansatz annimmt, der sowohl die Vorbereitungseffizienz als auch die Inferenzgeschwindigkeit verbessert.
Im MoE-Rahmen werden nur eine ausgewählte Gruppe von Komponenten, sogenannte “Experten”, für jeden Eingabeaktiviert. Diese Spezialisierung ermöglicht es dem Modell, eine breitere Palette von Aufgaben mit größerer Geschicklichkeit zu bewältigen, während es auch die Rechenressourcen optimiert.
DBRX geht mit seiner feinkörnigen MoE-Architektur noch einen Schritt weiter. Im Gegensatz zu anderen MoE-Modellen, die eine kleinere Anzahl von größeren Experten verwenden, beschäftigt DBRX 16 Experten, von denen vier für jeden gegebenen Eingabe aktiv sind. Diese Konstruktion bietet eine atemberaubende 65-mal mehr mögliche Experten-Kombinationen, was direkt zu DBRX’ überlegener Leistung beiträgt.
DBRX unterscheidet sich durch mehrere innovative Funktionen:
- Rotary Position Encodings (RoPE): Verbessert das Verständnis von Token-Positionen, entscheidend für die Erzeugung kontextuell genauer Texte.
- Gated Linear Units (GLU): Führt einen Gate-Mechanismus ein, der die Fähigkeit des Modells verbessert, komplexe Muster effizienter zu erlernen.
- Grouped Query Attention (GQA): Verbessert die Effizienz des Modells, indem es den Aufmerksamkeitsmechanismus optimiert.
- Erweiterte Tokenisierung: Nutzt GPT-4’s Tokenizer, um Eingaben effektiver zu verarbeiten.
Die MoE-Architektur ist insbesondere für große Sprachmodelle gut geeignet, da sie eine effizientere Skalierung und bessere Nutzung von Rechenressourcen ermöglicht. Durch die Verteilung des Lernprozesses auf mehrere spezialisierte Subnetzwerke kann DBRX Daten und Rechenleistung für jede Aufgabe effektiv zuweisen, was sowohl hohe Ausgabequalität als auch optimale Effizienz gewährleistet.
Umfangreiche Trainingsdaten und effiziente Optimierung Während DBRX’ Architektur zweifellos beeindruckend ist, liegt seine wahre Stärke im sorgfältigen Trainingsprozess und der riesigen Menge an Daten, auf die es ausgebildet wurde. DBRX wurde auf 12 Billionen Token von Text- und Code-Daten vorgetrainiert, sorgfältig ausgewählt, um hohe Qualität und Vielfalt zu gewährleisten.
Die Trainingsdaten wurden mit Databricks’ Suite von Tools verarbeitet, einschließlich Apache Spark für Datenverarbeitung, Unity Catalog für Datenmanagement und -governance sowie MLflow für Experimenten-Tracking. Diese umfassende Tool-Suite ermöglichte es dem Databricks-Team, die massive Datensammlung effektiv zu verwalten, zu erkunden und zu verfeinern, und legte damit den Grundstein für DBRX’ außergewöhnliche Leistung.
Um die Fähigkeiten des Modells weiter zu verbessern, setzte Databricks eine dynamische Vorbereitungskurrikulum ein, indem es die Datenmischung während des Trainings innovativ variierte. Diese Strategie ermöglichte es jedem Token, effektiv mit den 36 Milliarden aktiven Parametern verarbeitet zu werden, was zu einem noch abgerundeteren und anpassungsfähigeren Modell führte.
Darüber hinaus war der Trainingsprozess von DBRX auf Effizienz optimiert, indem Databricks’ Suite von proprietären Tools und Bibliotheken eingesetzt wurde, einschließlich Composer, LLM Foundry, MegaBlocks und Streaming. Durch die Anwendung von Techniken wie Curriculum-Lernen und optimierten Optimierungsstrategien erzielte das Team eine fast vierfache Verbesserung der Recheneffizienz im Vergleich zu ihren vorherigen Modellen.
Training und Architektur
DBRX wurde mit einem Next-Token-Prediction-Modell auf einer kolossalen Datensammlung von 12 Billionen Token trainiert, wobei sowohl Text als auch Code betont wurden. Diese Trainingsmenge gilt als wesentlich effektiver als die in vorherigen Modellen verwendeten, was eine reiche Verständnis- und Antwortfähigkeit über verschiedene Prompts hinweg gewährleistet.
DBRX’ Architektur ist nicht nur ein Zeugnis von Databricks’ technischer Kompetenz, sondern unterstreicht auch ihre Anwendbarkeit in verschiedenen Branchen. Von der Verbesserung von Chatbot-Interaktionen bis hin zur Unterstützung komplexer Datenanalyse-Aufgaben kann DBRX in verschiedene Bereiche integriert werden, die ein differenziertes Sprachverständnis erfordern.
Bemerkenswerterweise übertrifft DBRX Instruct sogar einige der fortschrittlichsten geschlossenen Modelle auf dem Markt. Laut Databricks’ Messungen übertrifft es GPT-3.5 und ist mit Gemini 1.0 Pro und Mistral Medium auf verschiedenen Benchmarks, einschließlich allgemeines Wissen, alltägliches Denken, Programmierung und mathematisches Denken, wettbewerbsfähig.
Zum Beispiel erreichte DBRX Instruct auf dem MMLU-Benchmark, der das Sprachverständnis misst, eine Punktzahl von 73,7 %, was GPT-3.5’s gemeldete Punktzahl von 70,0 % übertrifft. Auf dem HellaSwag-Commonsense-Reasoning-Benchmark erzielte DBRX Instruct eine beeindruckende Punktzahl von 89,0 %, was GPT-3.5’s 85,5 % übertrifft.
DBRX Instruct glänzt wirklich, indem es eine bemerkenswerte Genauigkeit von 70,1 % auf dem HumanEval-Benchmark erreicht, was nicht nur GPT-3.5 (48,1 %) sondern auch das spezialisierte CodeLLaMA-70B-Instruct-Modell (67,8 %) übertrifft.
Diese außergewöhnlichen Ergebnisse unterstreichen DBRX’ Vielseitigkeit und seine Fähigkeit, in einer breiten Palette von Aufgaben von der natürlichen Sprachverarbeitung bis hin zur komplexen Programmierung und mathematischen Problemlösung hervorragend zu sein.
Effiziente Inferenz und Skalierbarkeit Eine der Hauptvorteile von DBRX’ MoE-Architektur ist ihre Effizienz während der Inferenz. Dank der sparsamen Aktivierung von Parametern kann DBRX eine Inferenzdurchsatzrate erreichen, die bis zu zwei- bis dreimal höher ist als die von dichten Modellen mit der gleichen Gesamtzahl von Parametern.
Im Vergleich zu LLaMA2-70B, einem beliebten Open-Source-LLM, zeigt DBRX nicht nur eine höhere Qualität, sondern auch eine fast doppelte Inferenzgeschwindigkeit, obwohl es nur etwa halb so viele aktive Parameter hat. Diese Effizienz macht DBRX zu einer attraktiven Wahl für die Bereitstellung in einer Vielzahl von Anwendungen, von der Inhaltserschaffung bis zur Datenanalyse und darüber hinaus.
Darüber hinaus hat Databricks einen robusten Trainingsstapel entwickelt, der es Unternehmen ermöglicht, ihre eigenen DBRX-Klass-Modelle von Grund auf zu trainieren oder die bereitgestellten Checkpoints weiter zu trainieren. Diese Fähigkeit ermöglicht es Unternehmen, das volle Potenzial von DBRX zu nutzen und es an ihre spezifischen Bedürfnisse anzupassen, was den Zugang zu Spitzen-LLM-Technologie weiter demokratisiert.
Zugänglichkeit und Integrationen
Im Einklang mit seiner Mission, den offenen Zugang zu KI zu fördern, hat Databricks DBRX über mehrere Kanäle zugänglich gemacht. Die Gewichte des Basis-Modells (DBRX Base) und des fein abgestimmten Modells (DBRX Instruct) sind auf der beliebten Hugging Face-Plattform gehostet, was es Forschern und Entwicklern ermöglicht, das Modell leicht herunterzuladen und zu verwenden.
Darüber hinaus ist das DBRX-Modell-Repository auf GitHub verfügbar, was Transparenz bietet und eine weitere Erforschung und Anpassung des Modell-Codes ermöglicht.
Für Databricks-Kunden sind DBRX Base und DBRX Instruct über die Databricks Foundation Model APIs leicht zugänglich, was eine nahtlose Integration in bestehende Workflows und Anwendungen ermöglicht. Dies vereinfacht nicht nur den Bereitstellungsprozess, sondern stellt auch die Datengovernance und -sicherheit für sensible Anwendungsfälle sicher.
Darüber hinaus wurde DBRX bereits in mehrere Drittanbieter-Plattformen und -Dienste integriert, wie z.B. You.com und Perplexity Labs, was seine Reichweite und potenziellen Anwendungen erweitert. Diese Integrationen zeigen das wachsende Interesse an DBRX und seine Fähigkeiten sowie die zunehmende Akzeptanz von offenen LLMs in verschiedenen Branchen und Anwendungsfällen.
Fähigkeit zur Verarbeitung langer Kontexte und retrieval-augmentierte Generierung Eine der herausragenden Funktionen von DBRX ist seine Fähigkeit, lange Kontexteingaben zu verarbeiten, mit einer maximalen Kontextlänge von 32.768 Token. Diese Fähigkeit ermöglicht es dem Modell, Text auf der Grundlage umfangreicher Kontextinformationen zu generieren und zu verarbeiten, was es für Aufgaben wie Dokumentzusammenfassung, Fragenbeantwortung und Informationsabruf geeignet macht.
In Benchmarks, die die Leistung bei der Verarbeitung langer Kontexte bewerten, wie KV-Pairs und HotpotQAXL, übertraf DBRX Instruct GPT-3.5 Turbo bei verschiedenen Sequenzlängen und Kontextpositionen.

DBRX übertrifft etablierte Open-Source-Modelle bei der Sprachverständnis (MMLU), Programmierung (HumanEval) und Mathematik (GSM8K).
Einschränkungen und zukünftige Arbeiten
Während DBRX einen bedeutenden Erfolg im Bereich der offenen LLMs darstellt, ist es wichtig, seine Einschränkungen und Bereiche für zukünftige Verbesserungen anzuerkennen. Wie jedes KI-Modell kann DBRX ungenaue oder voreingenommene Antworten produzieren, abhängig von der Qualität und Vielfalt seiner Trainingsdaten.
Darüber hinaus kann DBRX, obwohl es bei allgemeinen Aufgaben hervorragend ist, in bestimmten branchenspezifischen Anwendungen eine weitere Feinabstimmung oder spezielle Schulung erfordern, um optimale Leistung zu erzielen. Zum Beispiel empfiehlt Databricks in Szenarien, in denen Genauigkeit und Treue von größter Bedeutung sind, die Verwendung von Retrieval-augmentierten Generierungstechniken (RAG), um die Modellausgabe zu verbessern.
Darüber hinaus besteht das aktuelle Trainingsdatenset von DBRX hauptsächlich aus englischsprachigen Inhalten, was seine Leistung bei nicht-englischen Aufgaben potenziell einschränken könnte. Zukunftige Iterationen des Modells könnten die Erweiterung des Trainingsdatensets um eine vielfältigere Palette von Sprachen und kulturellen Kontexten beinhalten.
Databricks ist bestrebt, DBRX’ Fähigkeiten kontinuierlich zu verbessern und seine Einschränkungen anzugehen. Zukünftige Arbeiten werden sich auf die Verbesserung der Modellleistung, Skalierbarkeit und Benutzerfreundlichkeit in verschiedenen Anwendungen und Anwendungsfällen konzentrieren sowie auf die Erforschung von Techniken, um potenzielle Voreingenommenheiten zu mindern und ethische KI-Nutzung zu fördern.
Darüber hinaus plant das Unternehmen, den Trainingsprozess weiter zu verfeinern, indem es fortschrittliche Techniken wie federatives Lernen und privacy-erhaltende Methoden einsetzt, um Datensicherheit und -privatsphäre zu gewährleisten.
Der Weg vor uns
DBRX stellt einen bedeutenden Schritt in der Demokratisierung der KI-Entwicklung dar. Es visioniert eine Zukunft, in der jedes Unternehmen die Fähigkeit hat, seine Daten und sein Schicksal in der aufkommenden Welt der generativen KI zu kontrollieren.
Indem Databricks DBRX open source macht und Zugang zu den gleichen Tools und Infrastrukturen bietet, die zur Erstellung verwendet wurden, ermöglicht es Unternehmen und Forschern, ihre eigenen maßgeschneiderten Databricks-Modelle zu entwickeln, die auf ihre spezifischen Bedürfnisse zugeschnitten sind.
Über die Databricks-Plattform können Kunden die Suite von Datenverarbeitungstools von Databricks nutzen, einschließlich Apache Spark, Unity Catalog und MLflow, um ihre Trainingsdaten zu kuratieren und zu verwalten. Sie können dann die optimierten Trainingsbibliotheken von Databricks, wie Composer, LLM Foundry, MegaBlocks und Streaming, verwenden, um ihre eigenen DBRX-Klass-Modelle effizient und im großen Maßstab zu trainieren.
Diese Demokratisierung der KI-Entwicklung hat das Potenzial, eine neue Welle der Innovation auszulösen, da Unternehmen die Fähigkeit erlangen, die Macht großer Sprachmodelle für eine Vielzahl von Anwendungen zu nutzen, von der Inhaltserschaffung und Datenanalyse bis hin zur Entscheidungsunterstützung und darüber hinaus.
Darüber hinaus zielt Databricks darauf ab, durch die Förderung eines offenen und kollaborativen Ökosystems um DBRX herum den Forschungs- und Entwicklungsprozess im Bereich der großen Sprachmodelle zu beschleunigen. Wenn mehr Organisationen und Einzelpersonen ihr Fachwissen und ihre Erkenntnisse beisteuern, wird das kollektive Wissen und Verständnis dieser leistungsstarken KI-Systeme weiter wachsen, den Weg für noch fortschrittlichere und leistungsfähigere Modelle in der Zukunft ebnend.
Schlussfolgerung
DBRX ist ein Game-Changer in der Welt der offenen großen Sprachmodelle. Mit seiner innovativen Mixture-of-Experts-Architektur, umfangreichen Trainingsdaten und Spitzenleistung hat es einen neuen Benchmark für das gesetzt, was mit offenen LLMs möglich ist.
Indem DBRX den Zugang zu Spitzen-KI-Technologie demokratisiert, ermöglicht es Forschern, Entwicklern und Unternehmen, neue Grenzen in der natürlichen Sprachverarbeitung, Inhaltserschaffung, Datenanalyse und darüber hinaus zu erkunden. Wenn Databricks DBRX weiter verfeinert und verbessert, sind die potenziellen Anwendungen und der Einfluss dieses leistungsstarken Modells wirklich grenzenlos.
Ich habe die letzten fünf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu geführt, an über 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen möchte.
Mehr entdecken


OpenAI führt den Daten‑Agent in ChatGPT Work ein, um Unternehmensdaten zu analysieren


Mistral sammelt 3 Mrd. € in Serie‑D-Finanzierung zur Erweiterung souveräner KI


Mistral und HUMAIN-Team zur souveränen KI für Saudi-Arabien und die Region


Microsoft erweitert Mistral-Deal, um regulierte KI-Käufer zu gewinnen


EU-Parlament baut eigene KI-Plattform für Abgeordnete


Warum die meisten modernen Apps im Zeitalter von KI nutzlos sein werden
