AI 模型与平台
BlackMamba:状态空间模型的Mixture of Experts
大型语言模型(LLM)的发展,尤其是基于解码器的Transformer模型,对自然语言处理(NLP)领域产生了深远影响,并推动了各种深度学习应用的发展,包括强化学习、时间序列分析、图像处理等。然而,尽管这些模型具有可扩展性和强大的性能,但它们仍面临着显著的局限性。Transformer模型中的注意力机制需要大量的计算资源,在推理和训练过程中都需要大量的内存和计算操作(FLOPs)。这种高计算需求限制了模型的上下文长度,使得自回归生成任务的成本随着模型的规模而增加,并阻碍了模型从连续数据流中学习和处理无限序列的能力。
近年来,状态空间模型(SSM)已经展示了其卓越的能力和性能,能够与Transformer模型在大规模建模基准中竞争,并实现了线性时间复杂度和序列长度的函数关系。最近开发的状态空间模型,例如Mamba、RetNet等,已经展示了高效的长序列推理和训练能力,并在语言建模任务中取得了与Transformer模型相似的性能。同时,Mixture of Expert(MoE)模型也展示了其卓越的性能,能够显著减少推理和训练的计算成本,尽管需要更大的内存占用。通过结合Mamba状态空间模型和MoE模型,BlackMamba框架能够利用两种框架的优势。实验结果表明,BlackMamba框架能够在训练FLOPs和推理方面超越现有的Mamba框架和Transformer基准模型。
本文旨在深入探讨BlackMamba框架,包括其机制、方法论和架构,并将其与最先进的图像和视频生成框架进行比较。让我们开始吧。
BlackMamba:状态空间模型的Mixture of Experts介绍
大型语言模型(LLM)的发展,尤其是基于解码器的Transformer模型,对自然语言处理(NLP)领域产生了深远影响,并推动了各种深度学习应用的发展,包括强化学习、时间序列分析、图像处理等。然而,尽管这些模型具有可扩展性和强大的性能,但它们仍面临着显著的局限性。Transformer模型中的注意力机制需要大量的计算资源,在推理和训练过程中都需要大量的内存和计算操作(FLOPs)。这种高计算需求限制了模型的上下文长度,使得自回归生成任务的成本随着模型的规模而增加,并阻碍了模型从连续数据流中学习和处理无限序列的能力。
近年来,状态空间模型(SSM)已经展示了其卓越的能力和性能,能够与Transformer模型在大规模建模基准中竞争,并实现了线性时间复杂度和序列长度的函数关系。最近开发的状态空间模型,例如Mamba、RetNet等,已经展示了高效的长序列推理和训练能力,并在语言建模任务中取得了与Transformer模型相似的性能。同时,Mixture of Expert(MoE)模型也展示了其卓越的性能,能够显著减少推理和训练的计算成本,尽管需要更大的内存占用。通过结合Mamba状态空间模型和MoE模型,BlackMamba框架能够利用两种框架的优势。实验结果表明,BlackMamba框架能够在训练FLOPs和推理方面超越现有的Mamba框架和Transformer基准模型。
这种架构进步为传统Transformer模型带来了显著的优势,并代表了未来发展的一个令人兴奋的方向。我们认为,将这些增强功能集成到Mamba-MoE模型中,可以显著加速语言建模能力和效率,超越标准Transformer模型。预期的Mamba-MoE架构优势包括:
Mamba:实现了相对于输入序列长度的线性计算复杂度,在训练和推理过程中都能实现常数时间和内存使用。
MoE:提供了与较小的密集基准模型相似的推理速度和训练计算效率,同时保持了与具有相当数量参数的模型相似的质量水平。
尽管Transformer模型仍然是最先进的,并在语言建模任务和序列处理任务中展示了强大的性能,但BlackMamba框架能够结合Mamba和MoE模型的优势,实现更快的推理速度和更低的计算成本。
BlackMamba:架构和方法论
状态空间模型
状态空间模型属于序列模型,具有相对于输入序列长度的线性复杂度。状态空间模型的架构更类似于循环神经网络和卷积神经网络,而不是基于注意力的架构,并且受到连续动态系统的启发,通过隐式潜在空间映射一维函数。线性动态系统使得并行计算变得高效,使用关联或卷积扫描。实际上,状态空间模型的递归性质使得它们仍然难以在高度并行的AI硬件如GPU上采用。然而,最近开发的状态空间模型,例如RWKV和Mamba,已经使用并行扫描内核将递归操作高效地映射到GPU上,从而实现了与Transformer模型相似的效率。
Transformer模型中固有的二次复杂度限制了其上下文长度,使得推理和理解长序列变得困难。最近的创新已经引入了扩展上下文长度的想法,使得Transformer模型能够在可行的规模上训练,然后在更长的上下文中进行推理。尽管这些进步,推理过程仍然需要大量的计算资源和内存,特别是为了维护Key-Value(KV)缓存。最近的研究工作重点是增强状态空间模型的表达能力,通过将输入依赖的门控机制纳入其中,类似于注意力机制中的Query、Key、Value(QKV)矩阵。
这些努力旨在保留状态空间递归的线性进展,使得通过卷积或选择扫描过程能够高效执行。这种方法显著地缩小了与Transformer模型在实际应用中的性能差距。在这些进步中,Mamba作为一个状态空间模型,展示了其卓越的性能,能够与Transformer模型在相同的规模上竞争,并实现了相对于输入序列长度的线性计算复杂度。Mamba通过将输入依赖的门控应用于状态空间模型(SSM)递归的输入,并通过使用定制的选择扫描内核来实现高效计算。
Mixture of Expert模型
Mixture of Expert(MoE)模型通过选择性地激活参数来实现推理成本和总参数数量之间的分离。在前向传递过程中,这些模型将令牌定向到特定的多层感知器(MLP)专家。理想情况下,每个专家都针对特定类型的输入进行了优化,并且路由机制,即一个紧凑的神经网络,决定了每个令牌最合适的专家。这种方法旨在保留具有相当数量参数的模型的全面表达能力,但具有显著降低的计算需求。通常,路由器是一个从令牌到专家索引的线性层映射,每个专家只是一个标准的Transformer多层感知器。然而,开发人员仍然需要弄清楚路由器的最佳训练方法,因为专家分配问题是非可微的,Mixture of Expert模型通常难以在不同专家之间实现负载平衡和训练稳定性,以实现硬件效率。
架构
BlackMamba框架的核心是一个标准的Transformer模型,包括交替的MLP块和注意力块,沿着一个残差流添加。现在,大多数Mixture of Expert模型只是用路由专家层替换多层感知器块。另一方面,BlackMamba框架不仅用路由专家层替换Transformer中的多层感知器块,还用Mamba状态空间模型层替换注意力层。BlackMamba框架的架构如下图所示。
训练和数据集
BlackMamba模型在超过300亿令牌的自定义数据集上进行训练,并使用SwiGLU激活函数进行专家多层感知器的训练。框架使用8个专家进行训练,开发人员发现这是内存占用和推理成本之间的合适平衡。用于训练BlackMamba框架的自定义数据集包括现有的开源数据集,如Starcoder、SlimPajama、Pile等。以下表格展示了用于训练BlackMamba框架的每个数据集的权重。总共有1.8万亿令牌在数据集中。
BlackMamba:结果
为了确保Mamba和BlackMamba之间的公平比较,开发人员已经使用相同的训练参数和训练数据对两个模型进行了训练。BlackMamba框架能够在推理时间和训练浮点运算次数方面超越Mamba和Transformer模型。以下图表展示了从一个令牌提示生成一个给定长度序列的时间,作为序列长度的函数。

此外,Mixture of Expert和Mamba模型的延迟优势在BlackMamba框架中得到了结合,导致与Transformer模型、纯Mamba模型和MoE模型相比推理时间显著减少。BlackMamba框架的推理优势与序列长度直接成比例,使得BlackMamba在长序列生成中极为有效。接下来,以下图表展示了分配给BlackMamba模型的令牌数量,分别具有3.4亿和6.4亿参数。如图所示,大多数层都表现出高水平的专家平衡,这是BlackMamba模型中改进的Sinkhorn算法的结果。

以下表格展示了BlackMamba框架与各种开源预训练语言模型的评估结果。如图所示,BlackMamba框架能够与大多数框架竞争和超越,尽管有些模型具有更高的参数数量,但性能差距很小,表明BlackMamba框架具有较少参数的能力。

最后的思考
在本文中,我们讨论了BlackMamba,一种新型架构,它结合了Mamba状态空间模型和Mixture of Expert模型,利用了两种框架的优势。实验结果表明,BlackMamba框架能够在训练FLOPs和推理方面超越现有的Mamba框架和Transformer基准模型。BlackMamba框架的卓越性能表明,它能够继承和结合Mamba和MoE框架的能力,实现快速和廉价的推理和线性复杂度的生成。我们讨论了BlackMamba框架如何在训练FLOPs和推理成本方面超越强大的大型语言模型、现有的Mamba框架和Mixture of Expert模型。BlackMamba框架还继承了Mixture of Expert模型和Mamba框架的生成FLOPs和减少训练,同时实现了快速和廉价的推理。












