思想领袖

开源模型持续变得更好,经济形势却日益复杂。

mm
将 Unite.AI 添加到您在 Google 上的首选来源

AI模型显然比18个月前更好。但当我深入研究时,常见的进步解释并不成立。

它们的提升并非仅仅因为规模更大。“开源正在取胜”只是一半正确。而建议关注基准分数的做法也远没有我预期的那么有用。这一点我花了很长时间才接受。

所以我提取了跨越八个实验室的46个模型的18个月数据。我想了解智能是否正在成为商品,开源模型是否正在赶上前沿,以及公司在选择将要构建的系统时应衡量哪些指标。

关键发现很直接:基准分数并不真正是模型的属性。它反映了模型本身、其配套软件和环境,以及所允许使用的时间和计算资源。只公布一个数字,就把另外两个因素隐藏了。

然而,其影响要广得多。公司在比较单个模型,而实际上应该评估完成工作所需的完整系统。

基准掩盖了系统

当我不再关注综合分数,而是逐项比较模型时,领先的开源模型与专有模型之间的差距根本不是一个单一数字。

在SWE-bench Verified上,这是一项在无数模型公告中出现的较早测试,差距为0.2分。而在SWE-bench Pro上,这是一项针对真实、多语言软件工作并采用标准化设置的较新测试,差距为18.2分。

显著的模型差距取决于基准

基准 差距 状态
SWE-bench Verified 0.2 分 已饱和,已标记污染
GPQA Diamond 2.0 分 已饱和,上限约为92–95%
Terminal-Bench 2.1 4.9 分 实时,具代理性
Humanity’s Last Exam 9.8 分 实时,前沿推理
SWE-bench Pro 18.2 分 实时,标准化框架

来源:Jaspreet Singh 对领先的开源模型和专有模型的分析,2026年7月。

同一模型在不同测试方下也会得到不同分数。Kimi K3 在独立评估中于 Terminal-Bench 2.1 上得分为 80.9%,而其制造商报告的结果为 88.3%。这 7.4 分的差距大于我分析的五个基准中有三个的开源与前沿差距。

模型通过周边软件接收指令,利用所提供的上下文,使用可访问的工具,并在开发者设定的推理预算内运行。改变这些条件,结果也会随之改变。

公共基准有助于了解进展方向,但它们并不是决定在贵公司内部何种方案可行的可靠依据。

代理可靠性改变了计算方式

随着 AI 从回答问题转向执行一系列操作,这一点变得更加重要。

设想一个包含 20 步的工作流,AI 每一步的正确率为 95%。听起来很可靠,但在完整序列中,工作流的成功率仅为 36%。

更好的模型可以提升每一步的成功概率,尤其是在困难的代理任务上。决定是否因一步失误而导致整个工作失败的,是周边的工程实现。保存进度、验证输出、安全重试以及从失败中恢复,往往是让演示看起来可信与让产品真正可靠之间的关键区别。

模型选择仍然重要,但得分最高的模型并不一定能自动构建出最可靠的系统。

根据工作选择模型

数据支持的结论比开源与专有争论双方通常给出的要更为具体。

开源模型在定义明确、时限短且结果可直接衡量的任务中具有竞争力。分类、抽取、摘要以及结构化生成正日益属于此类。

前沿模型仍在更长的代理任务、在压力下遵循指令以及事后检测成本高的工作中体现其溢价价值。这也是较新基准显示出约 18 分差距而非零差距的领域,同时模型供应商提供的安全层也在此发挥价值。

公司应根据任务选择模型,但不应认为切换是免费的。上下文、推理和提示缓存在不同供应商之间无法顺畅迁移。如果更换系统导致工作重新开始或增加工程和治理层面,廉价模型反而可能更昂贵。

模型选择正变得不再永久。切换仍然是一个架构决策。

随着智能成本下降,判断仍然昂贵

胜任的通用能力正变得异常低廉。然而,在曲线的顶端,每提升一点性能的成本都高于之前的提升。最后的九个性能点的成本大约是其以下所有点成本的十倍。

大多数公司并不需要为每个请求都使用最强大的模型。但他们需要了解哪些工作值得使用该模型。

摘要、抽取、分类、起草和翻译正逐步转向实用能力。仍然稀缺的是判断力:知道五个可能答案中哪个是正确的,发现问题本身有误,以及决定何时停止并请求人工介入。

判断来源于专有的上下文、业务规则、工作流、历史知识以及验证工作并控制失误的工程体系。

构建只有自己能运行的评估

对于企业而言,最有价值的基准是基于自身业务构建的。

创建一个包含 50 到 200 项真实业务任务的私有评估集。保持外围系统不变,反复运行测试,并评估工作是否正确完成,而不是答案的润色程度。

同样的原则也适用于成本。当模型推理时间更长、需要更多重试或产生更多人工审阅工作时,单词成本可能产生误导。应改为衡量每个被接受结果的成本。

先从少量模型开始。在任务开始时分配工作,而不是在进行中更换供应商。将每个额外供应商的安全、治理和运营负担与其标价一起计入。

市场将持续推出新的基准冠军,企业也会不断受到诱惑围绕每个冠军重塑 AI 战略。更好的做法是为具体工作挑选模型,然后在实际运行条件下评估整个系统。

应驱动您架构的基准是只有贵公司能够运行的那一个。

创始人兼首席执行官Jaspreet Singh融合了产品愿景和总经理经验,带领Druva成为数十亿美元数据保护和管理行业中增长最快的公司之一。他的创业精神使他能够自力更生创立Druva,如今公司估值已超过 $2 billion,受到全球数千家走在云时代前沿的公司的信任。他对市场和技术的洞察促使他打造了首个云原生数据保护平台,该平台提供创新的技术解决方案和独特的消费模式,颠覆了老旧硬件和软件的传统。

在创立Druva之前,Jaspreet曾在Veritas和Ensim Corp担任基础性职务。此外,他拥有多项专利,并拥有印度理工学院古瓦哈提分校的计算机科学学士学位。