AI 模型与平台
多语言大型语言模型的现状:超越英语
根据微软研究,世界上大约88%的语言,由12亿人使用,缺乏大型语言模型(LLM)的访问。这是因为大多数LLM都是以英语为中心的,即它们主要是用英语数据构建的,针对英语使用者。这种英语主导地位也在LLM的开发中占据主导地位,导致了数字语言鸿沟,可能将大多数人排除在LLM的益处之外。为了解决LLM的问题,需要一个可以在不同语言中训练并执行任务的LLM。多语言LLM的应用非常广泛,包括将文学翻译成当地方言,实时多语言通信,多语言内容创作等。它们将帮助每个人轻松获取信息和相互交流,无论他们的语言是什么。
多语言LLM还解决了文化细微差别和上下文的缺乏、训练数据限制以及翻译过程中知识可能丢失等挑战。
什么是多语言LLM?
多语言LLM可以理解和生成多种语言的文本。它们是在包含不同语言的数据集上训练的,可以处理来自用户提示的多种语言任务。
多语言LLM的应用非常广泛,包括将文学翻译成当地方言,实时多语言通信,多语言内容创作等。它们将帮助每个人轻松获取信息和相互交流,无论他们的语言是什么。
多语言LLM如何工作?
构建多语言LLM需要仔细准备一个包含多种语言的平衡语料库,并选择适合训练模型的架构和技术,例如Transformer模型,它非常适合多语言学习。

来源:作者图片
一种技术是共享嵌入,这可以捕捉不同语言中单词的语义含义。这使得LLM能够学习每种语言的相似性和差异,从而更好地理解不同语言。
这种知识还使LLM能够适应各种语言任务,例如翻译语言、以不同风格写作等。另一种技术是跨语言迁移学习,即模型在大量多语言数据上预训练,然后在特定任务上进行微调。
这种两步过程确保模型在多语言语言理解方面有坚实的基础,使其能够适应各种下游应用。
多语言大型语言模型的例子

来源:Ruder.io
已经出现了几种值得注意的多语言LLM,每一种都满足特定的语言需求和文化背景。让我们来探索其中几个:
1. BLOOM
BLOOM是一种开放访问的多语言LLM,它优先考虑语言多样性和可访问性。具有176亿参数,BLOOM可以处理46种自然语言和13种编程语言的任务,使其成为最大的和最多样化的LLM之一。
BLOOM的开源性质允许研究人员、开发人员和语言社区从其能力中受益并为其改进做出贡献。
2. YAYI 2
YAYI 2是一种专门为亚洲语言设计的开源LLM,考虑到该地区的复杂性和文化细微差别。它从头开始在包含16种亚洲语言的多语言语料库上预训练,语料库中有2.65万亿个过滤令牌。
这使得模型能够更好地满足亚洲语言和文化的特定需求。
3. PolyLM
PolyLM是一种开源的“多语种”LLM,专注于解决低资源语言的挑战,提供适应能力。它是在约6400亿令牌的数据集上训练的,提供1.7B和13B两种模型大小。PolyLM支持超过16种语言。
它使得在高资源语言上训练的模型能够为低资源语言进行微调,即使数据有限。这使得LLM在不同语言情况和任务中更加有用。
4. XGLM
XGLM拥有75亿参数,是一种使用少次学习技术在20多种语言的语料库上训练的多语言LLM。它是大规模多语言LLM家族的一部分,训练数据包括大量文本和代码。
它旨在涵盖尽可能多的语言,这就是为什么它注重包容性和语言多样性。XGLM展示了构建满足各语言社区需求的模型的潜力。
5. mT5
mT5(大规模多语言文本到文本转换器)由Google AI开发。训练在公共爬虫数据集上,mT5是一种最先进的多语言LLM,可以处理101种语言,从西班牙语和中文等广泛使用的语言到巴斯克语和克丘亚语等资源较少的语言。
它还擅长多语言任务,如翻译、摘要、问答等。
是否可能实现通用LLM?
语言中立LLM的概念,即能够理解和生成语言而不偏向任何特定语言,非常有趣。
虽然开发真正的通用LLM仍然遥遥无期,但当前的多语言LLM已经展示了显著的成功。一旦完全开发,它们可以满足欠代表语言和多样化社区的需求。
例如,研究表明,大多数多语言LLM可以在没有任务特定训练数据的情况下实现零次跨语言迁移,从资源丰富的语言到资源匮乏的语言。
此外,像YAYI和BLOOM这样的模型,它们专注于特定语言和社区,已经展示了语言中心方法在推动进步和包容性的潜力。
为了构建通用LLM或改进当前的多语言LLM,个人和组织必须:
- 众包本地语言使用者以参与社区互动和语言数据集的策划。
- 支持社区在开源贡献和多语言研究与开发方面的努力。
多语言LLM的挑战
虽然通用多语言LLM的概念很有前景,但它们也面临着必须解决的几个挑战:
1. 数据量
多语言模型需要比单语言模型更大的词汇量来表示多种语言的令牌,但许多语言缺乏大规模数据集。这使得训练这些模型变得困难。
2. 数据质量问题
确保多语言LLM输出在各语言中的准确性和文化适当性是一个重大问题。模型必须在训练和微调过程中仔细注意语言和文化细微差别,以避免偏见和不准确性。
3. 资源限制
训练和运行多语言模型需要大量计算资源,例如强大的GPU(例如NVIDIA A100 GPU)。高昂的成本对资源有限的语言和社区来说是一个挑战,特别是那些计算基础设施有限的社区。
4. 模型架构
适应模型架构以适应不同的语言结构和复杂性是一个持续的挑战。模型必须能够处理具有不同词序、形态变异和书写系统的语言,同时保持高性能和效率。
5. 评估复杂性
评估多语言LLM的性能超出了英语基准,这对于衡量其真正的有效性至关重要。它需要考虑文化细微差别、语言特点和领域特定要求。
多语言LLM有潜力打破语言障碍,赋予欠资源语言权力,并促进不同社区之间的有效沟通。
不要错过最新的AI和ML新闻和分析——今天就访问unite.ai。












