思想领袖
开源模型持续变得更好,经济形势却日益复杂。

AI模型显然比18个月前更好。但当我深入研究时,常见的进步解释并不成立。
它们的提升并非仅仅因为规模更大。“开源正在取胜”只是一半正确。而建议关注基准分数的做法也远没有我预期的那么有用。这一点我花了很长时间才接受。
所以我提取了跨越八个实验室的46个模型的18个月数据。我想了解智能是否正在成为商品,开源模型是否正在赶上前沿,以及公司在选择将要构建的系统时应衡量哪些指标。
关键发现很直接:基准分数并不真正是模型的属性。它反映了模型本身、其配套软件和环境,以及所允许使用的时间和计算资源。只公布一个数字,就把另外两个因素隐藏了。
然而,其影响要广得多。公司在比较单个模型,而实际上应该评估完成工作所需的完整系统。
基准掩盖了系统
当我不再关注综合分数,而是逐项比较模型时,领先的开源模型与专有模型之间的差距根本不是一个单一数字。
在SWE-bench Verified上,这是一项在无数模型公告中出现的较早测试,差距为0.2分。而在SWE-bench Pro上,这是一项针对真实、多语言软件工作并采用标准化设置的较新测试,差距为18.2分。
显著的模型差距取决于基准
| 基准 | 差距 | 状态 |
|---|---|---|
| SWE-bench Verified | 0.2 分 | 已饱和,已标记污染 |
| GPQA Diamond | 2.0 分 | 已饱和,上限约为92–95% |
| Terminal-Bench 2.1 | 4.9 分 | 实时,具代理性 |
| Humanity’s Last Exam | 9.8 分 | 实时,前沿推理 |
| SWE-bench Pro | 18.2 分 | 实时,标准化框架 |
来源:Jaspreet Singh 对领先的开源模型和专有模型的分析,2026年7月。
同一模型在不同测试方下也会得到不同分数。Kimi K3 在独立评估中于 Terminal-Bench 2.1 上得分为 80.9%,而其制造商报告的结果为 88.3%。这 7.4 分的差距大于我分析的五个基准中有三个的开源与前沿差距。
模型通过周边软件接收指令,利用所提供的上下文,使用可访问的工具,并在开发者设定的推理预算内运行。改变这些条件,结果也会随之改变。
公共基准有助于了解进展方向,但它们并不是决定在贵公司内部何种方案可行的可靠依据。
代理可靠性改变了计算方式
随着 AI 从回答问题转向执行一系列操作,这一点变得更加重要。
设想一个包含 20 步的工作流,AI 每一步的正确率为 95%。听起来很可靠,但在完整序列中,工作流的成功率仅为 36%。
更好的模型可以提升每一步的成功概率,尤其是在困难的代理任务上。决定是否因一步失误而导致整个工作失败的,是周边的工程实现。保存进度、验证输出、安全重试以及从失败中恢复,往往是让演示看起来可信与让产品真正可靠之间的关键区别。
模型选择仍然重要,但得分最高的模型并不一定能自动构建出最可靠的系统。
根据工作选择模型
数据支持的结论比开源与专有争论双方通常给出的要更为具体。
开源模型在定义明确、时限短且结果可直接衡量的任务中具有竞争力。分类、抽取、摘要以及结构化生成正日益属于此类。
前沿模型仍在更长的代理任务、在压力下遵循指令以及事后检测成本高的工作中体现其溢价价值。这也是较新基准显示出约 18 分差距而非零差距的领域,同时模型供应商提供的安全层也在此发挥价值。
公司应根据任务选择模型,但不应认为切换是免费的。上下文、推理和提示缓存在不同供应商之间无法顺畅迁移。如果更换系统导致工作重新开始或增加工程和治理层面,廉价模型反而可能更昂贵。
模型选择正变得不再永久。切换仍然是一个架构决策。
随着智能成本下降,判断仍然昂贵
胜任的通用能力正变得异常低廉。然而,在曲线的顶端,每提升一点性能的成本都高于之前的提升。最后的九个性能点的成本大约是其以下所有点成本的十倍。
大多数公司并不需要为每个请求都使用最强大的模型。但他们需要了解哪些工作值得使用该模型。
摘要、抽取、分类、起草和翻译正逐步转向实用能力。仍然稀缺的是判断力:知道五个可能答案中哪个是正确的,发现问题本身有误,以及决定何时停止并请求人工介入。
判断来源于专有的上下文、业务规则、工作流、历史知识以及验证工作并控制失误的工程体系。
构建只有自己能运行的评估
对于企业而言,最有价值的基准是基于自身业务构建的。
创建一个包含 50 到 200 项真实业务任务的私有评估集。保持外围系统不变,反复运行测试,并评估工作是否正确完成,而不是答案的润色程度。
同样的原则也适用于成本。当模型推理时间更长、需要更多重试或产生更多人工审阅工作时,单词成本可能产生误导。应改为衡量每个被接受结果的成本。
先从少量模型开始。在任务开始时分配工作,而不是在进行中更换供应商。将每个额外供应商的安全、治理和运营负担与其标价一起计入。
市场将持续推出新的基准冠军,企业也会不断受到诱惑围绕每个冠军重塑 AI 战略。更好的做法是为具体工作挑选模型,然后在实际运行条件下评估整个系统。
应驱动您架构的基准是只有贵公司能够运行的那一个。












