在大型语言模型(LLM)领域的快速发展中,一个新的强大模型出现了 – DBRX,这是一个由Databricks创建的开源模型。这个LLM以其在广泛的基准测试中的最先进的性能而引起了轰动,甚至在某些方面超过了行业巨头如OpenAI的GPT-4的能力。
DBRX代表着人工智能民主化的一个重要里程碑,为研究人员、开发人员和企业提供了对顶级语言模型的开放访问。但是什么是DBRX,它有什么特别之处?在这篇技术深度文章中,我们将探讨DBRX的创新架构、训练过程和关键能力,这些使DBRX成为开源LLM领域的领军者。
DBRX的诞生是由Databricks使数据智能对所有企业都可访问的使命驱动的。作为数据分析平台的领导者,Databricks认识到了LLM的巨大潜力,并着手开发一个能够匹配或甚至超过专有产品的模型。
经过数月的密集研究、开发和数百万美元的投资,Databricks团队在DBRX上取得了突破。该模型在语言理解、编程和数学等广泛基准测试中的令人印象深刻的性能,坚定地确立了它作为开源LLM的新状态。
创新架构
DBRX的卓越性能的核心在于其创新性的混合专家(MoE)架构。这种尖端设计代表了对传统密集模型的偏离,采用了稀疏方法,既提高了预训练效率,也提高了推理速度。
在MoE框架中,只有一个选定的组件,即“专家”,被激活用于每个输入。这种专业化使得模型能够以更大的灵活性处理更广泛的任务,同时也优化了计算资源。
DBRX进一步发展了这一概念,采用了细粒度的MoE架构。与其他一些使用较少数量的大型专家的MoE模型不同,DBRX采用16个专家,每个输入激活4个专家。这种设计提供了令人惊讶的65倍可能的专家组合,直接为DBRX的卓越性能做出了贡献。
DBRX具有以下几项创新功能:
- 旋转位置编码(RoPE):增强对令牌位置的理解,对于生成上下文准确的文本至关重要。
- 门控线性单元(GLU):引入了一种门控机制,提高了模型学习复杂模式的能力。
- 分组查询注意力(GQA):通过优化注意力机制提高了模型的效率。
- 高级令牌化:利用GPT-4的令牌化器更有效地处理输入。
MoE架构特别适合大型语言模型,因为它允许更高效的扩展和更好的计算资源利用。通过将学习过程分布在多个专门的子网络中,DBRX可以有效地为每个任务分配数据和计算资源,确保高质量的输出和最佳效率。
广泛的训练数据和高效的优化虽然DBRX的架构无疑令人印象深刻,但其真正的力量在于精心的训练过程和大量的训练数据。DBRX是在令人惊叹的12万亿个令牌的文本和代码数据上预训练的,这些数据经过精心策划,以确保高质量和多样性。
训练数据使用Databricks的工具套件进行处理,包括Apache Spark用于数据处理,Unity Catalog用于数据管理和治理,MLflow用于实验跟踪。这个全面的工具套件使Databricks团队能够有效地管理、探索和完善大量的数据集,为DBRX的卓越性能奠定了基础。
为了进一步提高模型的能力,Databricks采用了一种动态的预训练课程,创新地改变了训练期间的数据混合。这种策略使每个令牌都可以使用36亿个活跃参数进行有效处理,从而产生一个更加全面的和适应性更强的模型。
此外,DBRX的训练过程针对效率进行了优化,利用Databricks的专有工具和库,包括Composer、LLM Foundry、MegaBlocks和Streaming。通过采用课程学习和优化的优化策略,团队实现了与其前期模型相比几乎四倍的计算效率提高。
训练和架构
DBRX使用一个下一个令牌预测模型在一个巨大的12万亿个令牌的数据集上进行训练,强调了文本和代码。这个训练集被认为比以前的模型更有效,确保了对各种提示的丰富理解和响应能力。
DBRX的架构不仅是Databricks技术实力的见证,也突出了其在多个领域的应用。从增强聊天机器人交互到为复杂的数据分析任务提供动力,DBRX可以集成到多个领域,需要细致的语言理解。
值得注意的是,DBRX Instruct甚至在某些方面超过了市场上一些最先进的封闭模型。根据Databricks的测量,DBRX超过了GPT-3.5,并且在各种基准测试中,包括常识推理、编程和数学推理,与Gemini 1.0 Pro和Mistral Medium具有竞争力。
例如,在MMLU基准测试中,DBRX Instruct实现了73.7%的得分,超过了GPT-3.5的70.0%。在HellaSwag常识推理基准测试中,DBRX Instruct实现了89.0%的得分,超过了GPT-3.5的85.5%。
DBRX Instruct真正闪耀,实现了70.1%的准确率,超过了GPT-3.5(48.1%)和专门的CodeLLaMA-70B Instruct模型(67.8%)。
这些卓越的结果突出了DBRX的多样性和在广泛任务中的出色表现,从自然语言理解到复杂的编程和数学问题解决。
高效的推理和可扩展性是DBRX的MoE架构的主要优势之一。由于参数的稀疏激活,DBRX可以实现比具有相同参数总数的密集模型快两到三倍的推理速度。
与LLaMA2-70B相比,一个流行的开源LLM,DBRX不仅展示了更高的质量,而且具有几乎两倍的推理速度,尽管它只有大约一半的活跃参数。这种效率使DBRX成为在广泛应用中部署的有吸引力的选择,从内容创建到数据分析等。
此外,Databricks开发了一个强大的训练堆栈,允许企业从头开始训练自己的DBRX类模型或在提供的检查点上继续训练。这种能力使企业能够利用DBRX的全部潜力,并根据其特定需求定制它,进一步民主化了对尖端LLM技术的访问。
可访问性和集成
与其使AI开放的使命一致,Databricks通过多个渠道提供了DBRX。DBRX Base和DBRX Instruct的权重都托管在流行的Hugging Face平台上,允许研究人员和开发人员轻松下载和使用该模型。
此外,DBRX模型仓库可在GitHub上访问,提供透明度并允许进一步探索和定制模型的代码。

对于Databricks的客户,DBRX Base和DBRX Instruct可以通过Databricks基础模型API访问,实现无缝集成到现有的工作流和应用中。这不仅简化了部署过程,还确保了对敏感用例的数据治理和安全性。
此外,DBRX已经集成到几个第三方平台和服务中,例如You.com和Perplexity Labs,扩大了其影响力和潜在应用。这些集成展示了对DBRX及其能力的日益增长的兴趣,以及开源LLM在各个行业和用例中的采用率增加。
长上下文能力和检索增强生成是DBRX的主要特点之一。该模型可以处理最长32,768个令牌的长上下文输入,使其适合任务,如文档摘要、问答和信息检索。
在评估长上下文性能的基准测试中,例如KV-Pairs和HotpotQAXL,DBRX Instruct在各种序列长度和上下文位置上超过了GPT-3.5 Turbo。

DBRX在语言理解(MMLU)、编程(HumanEval)和数学(GSM8K)方面超过了既定的开源模型。
限制和未来工作
虽然DBRX代表了开源LLM领域的一个重大成就,但承认其局限性和需要改进的领域至关重要。像任何AI模型一样,DBRX可能会根据其训练数据的质量和多样性产生不准确或有偏见的响应。
此外,虽然DBRX在通用任务中表现出色,但某些特定领域的应用可能需要进一步的微调或专门的训练才能实现最佳性能。例如,在准确性和保真度至关重要的场景中,Databricks建议使用检索增强生成(RAG)技术来增强模型的输出。
此外,DBRX的当前训练数据集主要由英语内容组成,这可能会限制其在非英语任务中的性能。未来模型的迭代可能涉及扩展训练数据以包括更多语言和文化背景的多样化范围。
Databricks致力于不断提高DBRX的能力和解决其局限性。未来的工作将重点放在提高模型的性能、可扩展性和可用性,以及探索减轻潜在偏见和促进道德AI使用的技术。
此外,公司计划进一步完善训练过程,利用联邦学习和隐私保护方法等高级技术,以确保数据隐私和安全。
前进之路
DBRX代表了AI开发民主化的一个重要步骤。它设想了一个未来,每个企业都有能力控制自己的数据和在新兴的生成AI世界中的命运。
通过开源DBRX并提供访问用于构建它的相同工具和基础设施,Databricks使企业和研究人员能够开发自己的定制的Databricks模型,以满足他们的特定需求。
通过Databricks平台,客户可以利用公司的数据处理工具套件,包括Apache Spark、Unity Catalog和MLflow,来策划和管理他们的训练数据。然后,他们可以利用Databricks的优化训练库,例如Composer、LLM Foundry、MegaBlocks和Streaming,高效地训练自己的DBRX类模型,并扩大规模。
这种AI开发的民主化有可能解锁创新的一波新的浪潮,因为企业获得了利用大型语言模型的力量的能力,用于广泛的应用,从内容创建和数据分析到决策支持等。
此外,通过围绕DBRX建立一个开放和协作的生态系统,Databricks旨在加速大型语言模型领域的研究和开发步伐。随着更多组织和个人贡献他们的专业知识和见解,这些强大的AI系统的集体知识和理解将继续增长,为未来开发出更先进和更强大的模型铺平道路。
结论
DBRX是开源大型语言模型世界中的游戏规则改变者。凭借其创新性的混合专家架构、广泛的训练数据和最先进的性能,DBRX为开源LLM设定了新的基准。
通过民主化对尖端AI技术的访问,DBRX使研究人员、开发人员和企业能够探索自然语言处理、内容创建、数据分析和其他领域的新前沿。随着Databricks继续完善和增强DBRX,该强大的模型的潜在应用和影响是真正无限的。