AI 模型与平台
MPT-30B:MosaicML超越GPT-3的强大LLM,推动NLP的边界
MosaicML是一家提供AI部署和扩展解决方案的生成式AI公司。他们最新的MPT-30B大型语言模型(LLM)正在AI社区中引起轰动。
MosaicML的LLM之旅始于2023年5月发布的MPT-7B(Mosaic预训练变换器),它有三个变体:
- MPT-7B-StoryWriter-65k+(用于长篇故事生成)
- MPT-7B-Instruct(用于短篇指令遵循)
- MPT-7B-Chat(用于对话生成)
这些模型在ML社区中获得了巨大的成功,原因是它们的开源性、商业可用性和处理扩展上下文窗口的卓越能力。
最重要的是,该模型在某些情况下甚至超越了其他可比拟的模型(如LLaMA-7B、StableLM 7B等)。到6月份,MPT-7B系列已经被下载超过300万次。6月22日,MosaicML发布了MPT-30B,这进一步提高了开源基础模型的标准。
MPT-30B:一个比GPT-3更强大的LLM
MPT-30B是一个开源和商业授权的解码器基于LLM,仅使用GPT-3参数的17%,即30B,就超越了GPT-3-175B。它在多个任务中超越了GPT-3。以下是MPT-30B和GPT-3的比较。
MPT-30B是在之前的MPT-7B模型基础上发展而来。与同等规模的模型相比,它在计算效率和训练速度方面具有优势。例如,LLaMA-30B使用的浮点运算预算约为MPT-30B的1.44倍,而Falcon-40B的浮点运算预算比MPT-30B高出1.27倍。以下是MPT-30B在各项任务中相对于其前身的改进情况。
MPT-30B的一些特殊特点如下:
8k Token上下文窗口
LLM中的上下文窗口是指模型在生成输出之前可以考虑的令牌范围。MPT-30B在训练时具有8000个令牌的上下文窗口。它首先使用2k令牌序列训练1T令牌,然后使用8k令牌序列(大约6000个字)训练额外的50B令牌。
ALiBi支持
为了解释这一特点,我们来考虑一个问题:
如何让MPT-30B理解和预测比其训练数据更长的序列?
MPT-30B使用带线性偏差的注意力(ALiBi)技术来理解更长的序列,并在微调或推理期间将上下文窗口扩展到8k令牌之外。
与为序列中的每个单词分配一个向量(即位置嵌入)不同,ALiBi计算键令牌和查询令牌之间的注意力分数。当键令牌和查询令牌相邻时,惩罚较低,否则惩罚较高。因此,底层变换器架构可以外推到长输入序列。
通过FlashAttention实现高效推理和训练性能
注意力,即关注输入序列的相关部分,是变换器的一个关键组成部分,但它可能很慢且内存密集,尤其是在处理长文本序列时。
FlashAttention是一种由康奈尔大学研究人员提出的方法,用于解决MPT-30B中的这个问题。使用称为tiling的技术,FlashAttention减少了模型需要从内存中读取或写入的次数,从而加快了处理速度。因此,该模型采用了最先进的FlashAttention技术和NVIDIA的FasterTransformer优化库,以实现高效的训练和推理。
易于训练和部署
开发人员可以从头开始训练MPT-30B,也可以使用MosaicML的检查点以实现更快的部署。此外,它可以针对特定数据集进行微调以适应特定领域的使用场景。
该模型的大小是为了使其能够轻松地在单个GPU上部署,特别是1xA100-80GB(16位精度)或1xA100-40GB(8位精度)。这意味着该模型的设计是为了适应这些GPU的内存限制。
编码能力
MPT-30B还提供了卓越的编码能力。 HumanEval是OpenAI发布的一个包含164个手工编写的编程问题的数据集。在HumanEval数据集上,该模型超越了专门为编码而设计的LLM模型,例如StarCoder系列。
微调变体:MPT-30B-Instruct和MPT-30B-Chat
MPT-30B-Instruct
LLM主要用于指令,如问答、文本摘要、语言翻译等。MPT-30B-Instruct是MPT-30B的一个商业可用(保持商业CC-By-SA-3.0许可)变体,专门针对指令遵循任务进行微调。用于微调的数据集包括:
- FLAN
- P3
- Alpaca
- Dolly-15k
Dolly数据集还使用Anthropic的有帮助和无害数据集进行指令微调。此外,用于数据增强的多样化数据集包括:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat是MPT-30B的一个针对对话生成进行微调的版本。它是一个在CC-By-NC-SA-4.0许可下发布的研究成果,仅允许非商业用途。该模型使用了多种语言数据集进行微调,包括:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
LLM占据了多亿美元的生成式AI市场的很大一部分,该市场在去年ChatGPT改变了格局后迅速增长。MPT系列是这一革命的基础。我们可以预计,在不久的将来,我们将看到比MPT系列更强大、更高效的商业可用开源模型。
有关最新的AI新闻,请访问unite.ai。















