AI 模型与平台
艾伦AI的Tülu 3成为DeepSeek的意外对手

头条新闻不断。 DeepSeek的模型一直在挑战基准,设定新的标准,并引起了很多关注。 但是,AI研究领域刚刚发生了一件有趣的事情,值得关注。
艾伦AI悄悄发布了他们新的 Tülu 3家族的模型,他们的405B参数版本不仅仅是在与DeepSeek竞争 – 它在关键基准上匹配或超越了它。
让我们从这个角度来看。
405B Tülu 3模型正在与顶级表现者如 DeepSeek V3在一系列任务中竞争。 我们看到在数学问题、编码挑战和精确指令遵循等领域的可比或更好的表现。 他们还以完全开放的方式实现了这一点。
他们发布了完整的训练流水线、代码,甚至他们的新型强化学习方法称为强化学习与可验证奖励(RLVR),使这一切成为可能。
这样的发展在过去的几周内真正改变了顶级AI开发的方式。 当一个完全 开源模型可以匹配最好的闭源模型时,它开启了以前被私有公司墙壁锁住的可能性。
技术之战
是什么让Tülu 3脱颖而出?它归结于一个独特的四阶段训练过程,超越了传统方法。
让我们看看艾伦AI如何构建这个模型:
阶段1:战略数据选择
团队知道模型质量从数据质量开始。他们结合了既定的数据集,如 WildChat和 Open Assistant,以及自定义生成的内容。但是,这里有一个关键的洞察:他们不仅仅是聚合数据 – 他们为特定的技能创建了有针对性的数据集,如数学推理和编码能力。
阶段2:构建更好的响应
在第二阶段,艾伦AI专注于教他们的模型特定的技能。他们创建了不同的训练数据集 – 一些用于数学,其他用于编码,更多用于一般任务。通过反复测试这些组合,他们可以看到模型在哪里出色,哪里需要改进。这种迭代过程揭示了Tülu 3在每个领域真正的潜力。
阶段3:从比较中学习
这是艾伦AI变得创造性的地方。他们建立了一个系统,可以瞬间比较Tülu 3的响应与其他顶级模型。但是,他们也解决了一个在AI中持续存在的问题 – 模型倾向于仅仅为了长度而写长响应。他们的方法,使用 长度归一化的直接偏好优化(DPO),意味着模型学会了重视质量而不是数量。结果?响应既精确又有目的。
当AI模型从偏好(哪个响应更好,A或B?)中学习时,它们倾向于发展出一个令人沮丧的偏见:它们开始认为更长的响应总是更好。就像它们试图通过说更多而不是说得好来赢得胜利。
长度归一化的DPO通过调整模型从偏好中学习的方式来解决这个问题。与其仅仅查看哪个响应被更喜欢,它还考虑了每个响应的长度。可以把它看作是根据每个字的质量来判断响应,而不是仅仅根据总体影响。
为什么这很重要?因为它帮助Tülu 3学会变得精确和高效。与其用额外的词来填充响应以显得更全面,它学会了在实际需要的长度内提供价值。
这可能看起来是一个小细节,但对于构建自然交流的AI至关重要。最好的人类专家知道何时简洁、何时详细 – 而这正是长度归一化的DPO帮助模型学习的东西。
阶段4:RLVR创新
这就是值得关注的技术突破。RLVR用具体的可验证结果取代了主观的奖励模型。
大多数AI模型通过一个复杂的奖励模型系统来学习 – 本质上是关于什么使得一个好的响应的有根据的猜测。 但是艾伦AI在RLVR中走了一条不同的路。
想想我们目前如何训练AI模型。我们通常需要其他AI模型(称为奖励模型)来判断响应是否好或不好。它是主观的、复杂的、往往不一致的。一些响应可能看起来很好,但包含微妙的错误,这些错误可能会悄悄地通过。
RLVR颠倒了这种方法。与其依赖主观判断,它使用具体的可验证结果。当模型尝试一个数学问题时,没有灰色地带 – 答案要么是正确的,要么是错误的。当它编写代码时,这段代码要么运行正确,要么不运行。
这里是它变得有趣的地方:
- 模型获得即时的二进制反馈:10分用于正确答案,0分用于错误答案
- 没有部分信用或模糊评估的空间
- 学习变得专注和精确
- 模型学会优先考虑准确性而不是听起来合理但不正确的响应

RLVR训练(艾伦AI)
结果?Tülu 3在正确性至关重要的任务中表现出显著的改善。其在数学推理(GSM8K基准)和编码挑战方面的性能显著提高。甚至其指令遵循变得更加精确,因为模型学会了重视具体的准确性而不是近似的响应。
是什么让这特别令人兴奋?它改变了开源AI的游戏规则。以前的方法通常难以在技术任务上匹配闭源模型的精度。RLVR表明,通过正确的训练方法,开源模型可以实现同样的可靠性水平。
数据分析
405B参数版本的Tülu 3直接与顶级模型竞争。让我们看看它在哪里出色以及这对开源AI意味着什么。
数学
Tülu 3在复杂的数学推理方面表现出色。它在GSM8K和MATH基准上匹配DeepSeek的性能。该模型处理多步骤问题并展示出强大的数学推理能力。
代码
编码结果同样令人印象深刻。得益于RLVR训练,Tülu 3编写出有效解决问题的代码。其优势在于理解编码指令并产生功能性解决方案。
精确指令遵循
模型遵循指令的能力脱颖而出。虽然许多模型近似或概括指令,但Tülu 3展示出在执行指令时的显著精确性。
揭开AI开发的黑盒
艾伦AI发布了一个强大的模型和他们的完整开发过程。
训练过程的每个方面都被记录和公开。从四阶段方法到数据准备方法和RLVR实现 – 整个过程都对研究和复制开放。这种透明度为高性能AI开发设定了新的标准。
开发人员获得了全面的资源:
- 完整的训练流水线
- 数据处理工具
- 评估框架
- 实现规格
这使得团队能够:
- 修改训练过程
- 适应特定需求的方法
- 建立在经过验证的方法之上
- 创建专用实现
这种开放方法加速了整个领域的创新。研究人员可以建立在经过验证的方法之上,而开发人员可以专注于改进而不是从零开始。
开源卓越的崛起
Tülu 3的成功是开源AI开发的一个重要时刻。 当开源模型匹配或超过私有替代品时,它从根本上改变了行业。 全球的研究团队获得了经过验证的方法,推进了他们的工作,并产生了新的创新。 私人AI实验室需要适应 – 要么增加透明度,要么进一步推动技术边界。
展望未来,Tülu 3在可验证奖励和多阶段训练方面的突破预示着即将到来的发展。 团队可以建立在这些基础上,可能将性能推向更高。 代码存在,方法得到了记录,新的AI开发浪潮已经开始。 对于开发人员和研究人员来说,尝试和改进这些方法的机会标志着AI开发的一个激动人心的章节的开始。
关于Tülu 3的常见问题(FAQ)
什么是Tülu 3及其主要特点是什么?
Tülu 3是由艾伦AI开发的一系列开源LLM,基于Llama 3.1架构。它有多种尺寸(8B、70B和405B参数)。Tülu 3旨在提高多样化任务的性能,包括知识、推理、数学、编码、指令遵循和安全性。
Tülu 3的训练过程是什么,使用了什么数据?
Tülu 3的训练涉及几个关键阶段。首先,团队策划了来自公共数据集和针对特定技能的合成数据的多样化提示集,确保数据在基准方面是去污的。其次,在一组混合了指令遵循、数学和编码数据的基础上进行了监督微调(SFT)。接下来,使用通过人类和LLM反馈生成的偏好数据的直接偏好优化(DPO)进行了处理。最后,对于具有可衡量的正确性的任务,使用了强化学习与可验证奖励(RLVR)。Tülu 3使用了每个阶段的策划数据集,包括基于人格的指令、数学和代码数据。
Tülu 3如何处理安全性,使用什么指标来评估它?
安全性是Tülu 3开发的核心组成部分,贯穿整个训练过程。SFT期间使用了特定的安全数据集,这在很大程度上与其他任务导向的数据是正交的。
什么是RLVR?
RLVR是一种技术,其中模型被训练为针对可验证的奖励(如答案的正确性)进行优化。这与传统的RLHF不同,后者使用奖励模型。













