Modèles et plateformes d’IA
À l’intérieur de DBRX : Databricks libère un puissant modèle de langage ouvert

Par
Aayush Mittal Mittal
Dans le domaine en constante évolution des modèles de langage (LLM), un nouveau modèle puissant est apparu – DBRX, un modèle ouvert créé par Databricks. Ce LLM fait des vagues avec ses performances de pointe sur une large gamme de benchmarks, rivalisant même avec les capacités des géants de l’industrie comme OpenAI’s GPT-4.
DBRX représente un jalon important dans la démocratisation de l’intelligence artificielle, offrant aux chercheurs, développeurs et entreprises un accès ouvert à un modèle de langage de haute qualité. Mais qu’est-ce exactement que DBRX, et qu’est-ce qui le rend si spécial ? Dans cette plongée technique, nous allons explorer l’architecture innovante, le processus de formation et les capacités clés qui ont propulsé DBRX au premier plan du paysage des LLM ouverts.
La naissance de DBRX La création de DBRX a été motivée par la mission de Databricks de rendre l’intelligence de données accessible à toutes les entreprises. En tant que leader dans les plateformes d’analyse de données, Databricks a reconnu le potentiel immense des LLM et a cherché à développer un modèle qui pourrait égaler ou même surpasser les performances des offres propriétaires.
Après des mois de recherche intensive, de développement et d’un investissement de plusieurs millions de dollars, l’équipe de Databricks a réalisé une avancée avec DBRX. Les performances impressionnantes du modèle sur une large gamme de benchmarks, notamment la compréhension du langage, la programmation et les mathématiques, l’ont solidement établi comme un nouveau modèle de pointe dans les LLM ouverts.
Architecture innovante
Le pouvoir de la mixture d’experts Au cœur des performances exceptionnelles de DBRX se trouve son architecture innovante de mixture d’experts (MoE). Cette conception de pointe représente un départ des modèles denses traditionnels, adoptant une approche éparse qui améliore à la fois l’efficacité de la préformation et la vitesse d’inférence.
Dans le cadre de MoE, seul un groupe sélectionné de composants, appelés “experts”, est activé pour chaque entrée. Cette spécialisation permet au modèle de traiter un plus large éventail de tâches avec plus d’habileté, tout en optimisant les ressources de calcul.
DBRX pousse cette conception encore plus loin avec son architecture MoE fine-grained. Contrairement à certains autres modèles MoE qui utilisent un nombre plus petit d’experts plus grands, DBRX emploie 16 experts, avec quatre experts actifs pour chaque entrée. Cette conception offre un nombre stupéfiant de 65 fois plus de combinaisons d’experts possibles, contribuant directement aux performances supérieures de DBRX.
DBRX se distingue par plusieurs fonctionnalités innovantes:
- Codage de position rotatif (RoPE): Améliore la compréhension des positions de jetons, essentielle pour générer du texte contextuellement précis.
- Unités linéaires à porte (GLU): Introduit un mécanisme de porte qui améliore la capacité du modèle à apprendre des modèles complexes plus efficacement.
- Attention de requête groupée (GQA): Améliore l’efficacité du modèle en optimisant le mécanisme d’attention.
- Tokénisation avancée: Utilise le tokéniseur de GPT-4 pour traiter les entrées plus efficacement.
L’architecture MoE est particulièrement bien adaptée pour les grands modèles de langage, car elle permet une mise à l’échelle plus efficace et une meilleure utilisation des ressources de calcul. En distribuant le processus d’apprentissage sur plusieurs sous-réseaux spécialisés, DBRX peut allouer efficacement les données et la puissance de calcul pour chaque tâche, garantissant à la fois une sortie de haute qualité et une efficacité optimale.
Données de formation étendues et optimisation efficace Alors que l’architecture de DBRX est sans aucun doute impressionnante, son véritable pouvoir réside dans le processus de formation méticuleux et la grande quantité de données auxquelles il a été exposé. DBRX a été préformé sur 12 billions de jetons de texte et de code, soigneusement sélectionnés pour garantir une haute qualité et une grande diversité.
Les données de formation ont été traitées à l’aide de l’ensemble d’outils de Databricks, notamment Apache Spark pour le traitement des données, Unity Catalog pour la gestion et la gouvernance des données, et MLflow pour le suivi des expériences. Cet ensemble d’outils complet a permis à l’équipe de Databricks de gérer efficacement, d’explorer et d’affiner l’énorme ensemble de données, jetant les bases des performances exceptionnelles de DBRX.
Pour améliorer encore les capacités du modèle, Databricks a employé un programme de préformation dynamique, innovant en variant le mélange de données pendant la formation. Cette stratégie a permis à chaque jeton d’être traité efficacement à l’aide des 36 milliards de paramètres actifs, aboutissant à un modèle plus polyvalent et adaptable.
De plus, le processus de formation de DBRX a été optimisé pour l’efficacité, en utilisant les outils et les bibliothèques propriétaires de Databricks, notamment Composer, LLM Foundry, MegaBlocks et Streaming. En employant des techniques telles que l’apprentissage par curriculum et les stratégies d’optimisation optimisées, l’équipe a réalisé une amélioration de près de quatre fois de l’efficacité de calcul par rapport à leurs modèles précédents.
Formation et architecture
DBRX a été formé en utilisant un modèle de prédiction de jeton suivant sur un ensemble de données colossal de 12 billions de jetons, mettant l’accent à la fois sur le texte et le code. Cet ensemble de formation est considéré comme nettement plus efficace que ceux utilisés dans les modèles précédents, garantissant une compréhension et une capacité de réponse riches sur une variété de invites.
L’architecture de DBRX n’est pas seulement un témoignage de la compétence technique de Databricks, mais met également en évidence son application dans de multiples secteurs. De l’amélioration des interactions avec les chatbots à l’alimentation de tâches d’analyse de données complexes, DBRX peut être intégré dans divers domaines nécessitant une compréhension nuancée du langage.
Remarquablement, DBRX Instruct rivalise même avec certains des modèles fermés les plus avancés sur le marché. Selon les mesures de Databricks, il dépasse GPT-3.5 et est compétitif avec Gemini 1.0 Pro et Mistral Medium sur divers benchmarks, notamment la connaissance générale, la raison commune, la programmation et la raison mathématique.
Par exemple, sur le benchmark MMLU, qui mesure la compréhension du langage, DBRX Instruct a obtenu un score de 73,7 %, surpassant le score de 70,0 % de GPT-3.5. Sur le benchmark de raisonnement commun HellaSwag, DBRX Instruct a obtenu un score impressionnant de 89,0 %, surpassant le score de 85,5 % de GPT-3.5.
DBRX Instruct brille vraiment, atteignant une précision remarquable de 70,1 % sur le benchmark HumanEval, surpassant non seulement GPT-3.5 (48,1 %) mais aussi le modèle CodeLLaMA-70B Instruct spécialisé (67,8 %).
Ces résultats exceptionnels mettent en évidence la polyvalence de DBRX et sa capacité à exceller dans une large gamme de tâches, allant de la compréhension du langage naturel à la résolution de problèmes de programmation et mathématiques complexes.
Inférence efficace et mise à l’échelle L’un des principaux avantages de l’architecture MoE de DBRX est son efficacité pendant l’inférence. Grâce à l’activation éparse des paramètres, DBRX peut atteindre un débit d’inférence qui est jusqu’à deux à trois fois plus rapide que les modèles denses avec le même nombre total de paramètres.
Par rapport à LLaMA2-70B, un LLM ouvert source populaire, DBRX ne montre pas seulement une qualité supérieure mais également une vitesse d’inférence presque deux fois plus rapide, malgré avoir environ la moitié de paramètres actifs. Cette efficacité rend DBRX un choix attractif pour le déploiement dans une large gamme d’applications, allant de la création de contenu à l’analyse de données et au-delà.
De plus, Databricks a développé une pile de formation robuste qui permet aux entreprises de former leurs propres modèles DBRX à partir de zéro ou de poursuivre la formation à partir des points de contrôle fournis. Cette capacité permet aux entreprises de tirer parti du plein potentiel de DBRX et de l’adapter à leurs besoins spécifiques, démocratisant ainsi l’accès à la technologie LLM de pointe.
Accessibilité et intégrations
Conformément à sa mission de promouvoir l’accès ouvert à l’IA, Databricks a rendu DBRX disponible via plusieurs canaux. Les poids du modèle de base (DBRX Base) et du modèle affiné (DBRX Instruct) sont hébergés sur la plateforme Hugging Face, permettant aux chercheurs et développeurs de télécharger et de travailler facilement avec le modèle.
En outre, le référentiel du modèle DBRX est disponible sur GitHub, offrant transparence et permettant une exploration et une personnalisation supplémentaires du code du modèle.
Pour les clients de Databricks, DBRX Base et DBRX Instruct sont accessibles via les API de modèles de base de Databricks, permettant une intégration transparente dans les flux de travail et les applications existants. Cela simplifie non seulement le processus de déploiement mais assure également la gouvernance et la sécurité des données pour les cas d’utilisation sensibles.
De plus, DBRX a déjà été intégré dans plusieurs plateformes et services tiers, tels que You.com et Perplexity Labs, élargissant ainsi son champ d’action et ses applications potentielles. Ces intégrations démontrent l’intérêt croissant pour DBRX et ses capacités, ainsi que l’adoption croissante des LLM ouverts dans diverses industries et cas d’utilisation.
Capacités de contexte long et génération avec récupération Un des aspects les plus remarquables de DBRX est sa capacité à gérer des entrées de contexte long, avec une longueur de contexte maximale de 32 768 jetons. Cette capacité permet au modèle de traiter et de générer du texte en fonction d’informations contextuelles étendues, le rendant particulièrement adapté à des tâches telles que la résumé de documents, la réponse à des questions et la récupération d’informations.
Dans les benchmarks évaluant les performances de contexte long, tels que KV-Pairs et HotpotQAXL, DBRX Instruct a surpassé GPT-3.5 Turbo sur diverses longueurs de séquence et positions de contexte.

DBRX surpasse les modèles open source établis en termes de compréhension du langage (MMLU), de programmation (HumanEval) et de mathématiques (GSM8K).
Limitations et travaux futurs
Bien que DBRX représente une réalisation importante dans le domaine des LLM ouverts, il est essentiel de reconnaître ses limites et les domaines d’amélioration futurs. Comme tout modèle d’IA, DBRX peut produire des réponses inexactes ou biaisées, en fonction de la qualité et de la diversité de ses données de formation.
En outre, bien que DBRX excelle dans les tâches à usage général, certaines applications spécifiques à un domaine peuvent nécessiter un affinage ou une formation spécialisée pour atteindre des performances optimales. Par exemple, dans les scénarios où l’exactitude et la fidélité sont d’une importance capitale, Databricks recommande d’utiliser des techniques de génération avec récupération (RAG) pour améliorer la sortie du modèle.
De plus, l’ensemble de données de formation actuel de DBRX se compose principalement de contenu en anglais, ce qui pourrait potentiellement limiter ses performances sur les tâches non anglaises. Les itérations futures du modèle pourraient impliquer l’expansion de l’ensemble de données de formation pour inclure une gamme plus diverse de langues et de contextes culturels.
Databricks s’engage à améliorer continuellement les capacités de DBRX et à résoudre ses limites. Les travaux futurs se concentreront sur l’amélioration des performances, de la mise à l’échelle et de l’utilisabilité du modèle dans diverses applications et cas d’utilisation, ainsi que sur l’exploration de techniques pour atténuer les biais potentiels et promouvoir une utilisation éthique de l’IA.
En outre, l’entreprise prévoit d’affiner davantage le processus de formation, en utilisant des techniques avancées telles que l’apprentissage fédéré et les méthodes de préservation de la confidentialité pour garantir la confidentialité et la sécurité des données.
La voie à suivre
DBRX représente un grand pas en avant dans la démocratisation du développement de l’IA. Il imagine un avenir où chaque entreprise a la capacité de contrôler ses données et son destin dans le monde émergent de l’IA générative.
En rendant DBRX open source et en fournissant l’accès aux mêmes outils et infrastructures utilisés pour le construire, Databricks permet aux entreprises et aux chercheurs de développer leurs propres modèles Databricks adaptés à leurs besoins spécifiques.
Grâce à la plateforme Databricks, les clients peuvent utiliser l’ensemble d’outils de traitement de données de l’entreprise, notamment Apache Spark, Unity Catalog et MLflow, pour curer et gérer leurs données de formation. Ils peuvent ensuite utiliser les bibliothèques de formation optimisées de Databricks, telles que Composer, LLM Foundry, MegaBlocks et Streaming, pour former leurs propres modèles DBRX de manière efficace et à grande échelle.
Cette démocratisation du développement de l’IA a le potentiel de débloquer une nouvelle vague d’innovation, car les entreprises gagnent la capacité d’harnacher le pouvoir des grands modèles de langage pour une large gamme d’applications, allant de la création de contenu et de l’analyse de données au soutien de la décision et au-delà.
De plus, en favorisant un écosystème ouvert et collaboratif autour de DBRX, Databricks vise à accélérer le rythme de la recherche et du développement dans le domaine des grands modèles de langage. À mesure que davantage d’organisations et d’individus contribuent leur expertise et leurs connaissances, les connaissances et la compréhension collectives de ces systèmes d’IA puissants continueront de croître, ouvrant la voie à des modèles encore plus avancés et capables à l’avenir.
Conclusion
DBRX est un changement de jeu dans le monde des modèles de langage ouverts. Avec son architecture innovante de mixture d’experts, ses données de formation étendues et ses performances de pointe, il a établi un nouveau référence pour ce qui est possible avec les LLM ouverts.
En démocratisant l’accès à la technologie d’IA de pointe, DBRX permet aux chercheurs, développeurs et entreprises d’explorer de nouveaux horizons dans le traitement du langage naturel, la création de contenu, l’analyse de données et au-delà. Alors que Databricks continue de raffiner et d’améliorer DBRX, les applications et l’impact potentiels de ce modèle puissant sont vraiment sans limites.
J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.
Découvrir plus


OpenAI présente l’agent de données dans ChatGPT Work pour analyser les données d’entreprise


Mistral lève 3 milliards d’euros en série D pour développer l’IA souveraine


Mistral et l’équipe HUMAIN sur l’IA souveraine pour l’Arabie Saoudite et la région


Microsoft Élargit le Partenariat avec Mistral pour Atteindre les Acheteurs Réglementés de l’IA


Le Parlement européen crée sa propre plateforme d’IA pour les législateurs


Pourquoi la plupart des applications modernes seront inutiles à l’ère de l’IA
