AI 模型与平台

微软的Phi-3 Mini:一个超出其重量的轻量级AI模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

微软最近推出了其最新的轻量级语言模型Phi-3 Mini,这标志着一系列紧凑的AI模型的开始,这些模型旨在提供最先进的性能,同时足够小以高效地在具有有限计算资源的设备上运行。仅有3.8亿参数,Phi-3 Mini是像GPT-4这样的AI巨头的分数,但它承诺在许多关键领域匹配他们的能力。

Phi-3 Mini的开发代表了在使高级AI能力民主化方面的一个重要里程碑,即通过使其在更广泛的硬件上可访问。其小尺寸使其可以在智能手机、平板电脑和其他边缘设备上本地部署,克服了与基于云的模型相关的延迟和隐私问题。这为虚拟助手、对话式AI、编码助手和语言理解任务等领域的智能设备上的体验开启了新的可能性。

4位量化的phi-3-mini在iPhone上本地运行
4位量化的phi-3-mini在iPhone上本地运行

内部架构和训练

在其核心,Phi-3 Mini是一个基于类似开源Llama-2模型的变压器解码器模型。它具有32层,3072个隐藏维度和32个注意力头,默认上下文长度为4,000个令牌。微软还引入了一种长上下文版本称为Phi-3 Mini-128K,它使用LongRope等技术将上下文长度扩展到128,000个令牌。

然而,Phi-3 Mini的训练方法使其与众不同。微软没有仅仅依赖大量数据和计算能力,而是专注于策划高质量、推理密集的训练数据集。该数据集由过滤后的网络数据和由较大的语言模型生成的合成数据组成。

训练过程遵循两阶段方法。在第一阶段,模型被暴露在多样化的网络来源中,以教会它一般知识和语言理解。第二阶段将过滤后的网络数据与合成数据相结合,以传授逻辑推理技能和专业领域的专业知识。

微软将这种方法称为“数据最优方案”,这与许多大型语言模型使用的传统“计算最优方案”或“过度训练方案”不同。目标是使训练数据与模型的规模相匹配,提供正确的知识和推理能力,同时为其他能力留出足够的容量。

新Phi-3模型的质量,如Massive Multitask Language Understanding(MMLU)基准测试的性能所示
新Phi-3模型的质量,如Massive Multitask Language Understanding(MMLU)基准测试的性能所示

这种数据驱动的方法已经带来了回报,Phi-3 Mini在广泛的学术基准测试中取得了显著的性能,通常与或超过更大的模型。例如,它在多任务学习和理解的MMLU基准测试中获得69%的成绩,在数学推理的MT-bench基准测试中获得8.38的成绩——这些结果与Mixtral 8x7B和GPT-3.5等模型相当。

安全性和鲁棒性

除了其令人印象深刻的性能外,微软还在Phi-3 Mini的开发中强调了安全性和鲁棒性。该模型经过了严格的后训练过程,包括监督微调(SFT)和直接偏好优化(DPO)。

SFT阶段利用了多个领域的高度策划数据,包括数学、编码、推理、对话、模型身份和安全性。这有助于加强模型在这些领域的能力,同时灌输强烈的身份和道德行为意识。

DPO阶段则专注于通过使用被拒绝的响应作为负面示例来引导模型远离不需要的行为。这个过程涵盖了聊天格式数据、推理任务和负责任的AI(RAI)工作,确保Phi-3 Mini遵循微软的道德和值得信赖的AI原则。

为了进一步增强其安全性,Phi-3 Mini已经接受了广泛的红队测试和自动化测试,跨越了数十个RAI危害类别。微软的一个独立红队迭代地检查了该模型,找到了需要改进的领域,并通过额外的策划数据集和重新训练来解决这些问题。

这种多方面的方法已经显著降低了有害响应、事实不准确和偏见的发生率,如微软的内部RAI基准测试所示。例如,该模型在有害内容继续(0.75%)和摘要(10%)方面显示出低缺陷率,以及低的无根性(0.603),表明其响应根植于给定的上下文。

应用和用例

凭借其令人印象深刻的性能和强大的安全措施,Phi-3 Mini非常适合广泛的应用,特别是在资源受限的环境和延迟受限的场景中。

最令人兴奋的前景之一是直接在移动设备上部署智能虚拟助手和对话式AI。通过本地运行,这些助手可以在无需网络连接的情况下提供即时响应,同时也可以确保敏感数据保持在设备上,解决了隐私问题。

Phi-3 Mini强大的推理能力也使其成为编码辅助和数学问题求解的宝贵资产。开发人员和学生可以从设备上的代码完成、错误检测和解释中受益,简化开发和学习过程。

除了这些应用外,该模型的多功能性还为语言理解、文本摘要和问答等领域开启了新的机会。其小尺寸和高效性使其成为一种有吸引力的选择,用于将AI能力嵌入到广泛的设备和系统中,从智能家居设备到工业自动化系统。

展望:Phi-3 Small和Phi-3 Medium

虽然Phi-3 Mini本身就是一个显著的成就,但微软对Phi-3家族有着更大的计划。该公司已经预览了两个更大的模型,Phi-3 Small(7亿参数)和Phi-3 Medium(14亿参数),这两个模型都有望在紧凑语言模型的性能方面突破界限。

例如,Phi-3 Small利用更先进的标记器(tiktoken)和分组查询注意力机制,以及一种新颖的块稀疏注意力层,以优化其内存占用同时保持长上下文检索性能。它还融入了额外的10%的多语言数据,增强了其在语言理解和生成方面的能力,支持多种语言。

Phi-3 Medium则代表着一个显著的规模提升,具有40层、40个注意力头和5,120个嵌入维度。虽然微软指出,一些基准测试可能需要进一步完善训练数据混合以充分利用这一增加的容量,但初步结果很有希望,在MMLU、TriviaQA和HumanEval等任务中表现出显著的改进,超过Phi-3 Small。

限制和未来方向

尽管Phi-3 Mini具有令人印象深刻的能力,但像所有语言模型一样,它并非完美。最显著的弱点之一是其相对有限的存储事实知识的能力,如TriviaQA基准测试所示。

然而,微软相信这一限制可以通过增强模型的搜索引擎能力来缓解,使其能够检索和推理相关信息。这种方法在Hugging Face Chat-UI中得到了体现,Phi-3 Mini可以利用搜索来增强其响应。

另一个需要改进的领域是模型的多语言能力。虽然Phi-3 Small已经通过融入额外的多语言数据迈出了第一步,但仍需要进一步的工作来充分解锁这些紧凑模型的跨语言应用潜力。

展望未来,微软致力于不断推进Phi家族模型的发展,解决其限制并扩展其能力。这可能涉及进一步完善训练数据和方法,以及探索专门为紧凑、高性能语言模型设计的新架构和技术。

结论

微软的Phi-3 Mini代表了高级AI能力民主化的一个重大飞跃。通过在紧凑、资源高效的包中提供最先进的性能,它为广泛的应用开启了新的可能性,特别是在资源受限的环境和延迟受限的场景中。

该模型的创新训练方法,强调高质量、推理密集的数据而非纯粹的计算能力,已经被证明是一个游戏规则的改变者,使Phi-3 Mini能够超出其体重级别。结合其强大的安全措施和持续的开发工作,Phi-3家族的模型有望在未来智能系统的发展中发挥至关重要的作用,使AI更加易于获取、效率高且值得信赖。

随着科技行业不断推动AI的可能性的边界,微软对像Phi-3 Mini这样的轻量级、高性能模型的承诺代表了一个令人耳目一新的转变,远离了“更大就是更好”的传统智慧。通过证明尺寸并不是一切,Phi-3 Mini有潜力激发一波新的创新浪潮,专注于通过智能数据策划、周到的模型设计和负责任的开发实践来最大化AI的价值和影响力。

我已经沉浸在了令人着迷的机器学习和深度学习世界中五年了。我的热情和专业知识让我为超过50个不同的软件工程项目做出了贡献,特别关注AI/ML。我的持续的好奇心也让我对自然语言处理产生了兴趣,这是一个我渴望进一步探索的领域。