观点
Jev 与 AI 代理的新决策层

为什么 System One 模型能够将快速判断与缓慢推理分离
许多 AI 代理在几乎所有决策中都使用语言模型。语言模型选择工具,评估结果,判断是否需要继续,并最终生成答案。灵活;然而,当是/否决策在大规模重复时,这一过程可能成本高昂。 Unite.AI 之前已经讨论过代理工作流如何增加模型调用、上下文以及重试次数每增加一次决策,都可能在向用户提供有用信息之前增加时间和成本。
Jev 建议以不同方式拆分任务。使用为有界判断构建的模型,其中答案集合已定义。使用生成模型进行开放式推理和语言处理。Jev 表示,这里的核心观点并不是所有代理都需要购买一种新产品。关键概念是,代理在每个阶段并不需要相同类型的智能。
Jev 实际做了什么
TypeSafe 于 2026 年 9 月推出了 Jev,是他们全新 System One 系列的首款模型。Jev 不会生成完整的文字。相反,您向它发送一个状态(例如支持消息和用户数据)。您还可以发送一个或多个具有预定义答案类型的问题。随后 Jev 会返回带类型的答案以及概率。
根据公司的官方文档,有三种原语用于做出判断:
- Choice让您从预定义的选项中进行选择。
- Score让您根据有序的评分标准对某事进行评分。
- Noul估计某个陈述为真的概率。
您可以在一次请求中针对同一状态提出多个独立的问题。
例如,假设您正在处理一个客服问题。系统可能需要确定哪个团队应处理此案例。它还可能判断需要多快响应,并查看客户是否请求退款。
聊天模型可能能够执行所有三项任务。然而,它需要将结果以结构化响应返回给您的应用程序。相比之下,Jev 只提供这些有界决策。您的应用程序随后会根据这些决策决定下一步采取的操作。
架构转变比模型本身更重要
大多数争论都是在比较大模型与小模型。Jev 提出了一种替代的边界。一些步骤涉及语言生成,另一些则是软件可以直接使用的狭义判断。
这在代理中创建了一个决策层。模型会进行估计。软件会应用策略。如果估计概率超过已测试的阈值且该操作风险低且可逆,工作流可以继续。如果结果存在不确定性或该操作可能产生严重影响,系统可以寻求人类监督。推理模型可能有助于调查不确定性,但它不能取代必要的人类批准。

图 1。 有界决策路径在代码中保留阈值、权限和升级。
模型路由有相似之处,但存在关键差异。RouteLLM决定从两个语言模型中选择哪一个。它在更强和更弱的模型之间进行选择,以平衡质量和成本。System One 模型生成代码可以直接使用的有界判断。这些判断既可支持模型路由,也可用于代理内的其他决策。
为何代理循环天然适配
代理循环的特性使其特别适合在极细微的层面上进行大量判断。这些判断有助于达成最终输出。换句话说,用户提交问题或请求后,代理需要进行大量的“细小”判断。这些判断发生在答案或输出返回之前。
一个例子是决定使用哪些工具、对检索到的记录进行排序以及评估风险。系统还会判断是否存在足够的证据以及流程是否应继续。很可能这些都会反复发生。此外,每个循环之间的延迟会随时间累积。
代理循环的这种作用在LangChain 的 Jev 集成,在此,Jev 可以同时执行模型路由和工具调用检查。虽然 Jev 在生成模型的边缘进行集成,但生成模型本身仍继续规划和生成内容。这代表了 Jev 更为现实的使用场景。它是对通用语言模型的补充,而非取代它。
此外,将问题并行化也会改变团队对任务分解的思考方式。具体而言,团队能够将一个模糊指令拆分为多个离散的评估问题。这可能会显著缩短模型调用的序列。它可以创建一个更易于评估的工作流。同时,它也让开发者能够使用显式的业务逻辑来组合得到的判断。
通用语言模型可以生成结构化输出,在某些情况下可能是更好的选择。例如,可能需要同时提供判定和解释。因此,Jev 必须展示出超出仅符合模式的能力,才能被视为有效。
Jev 的有效性取决于能否降低整体系统延迟。它还依赖于提供有用的概率估计并在不同输入下保持性能稳定。如果 Jev 未能实现这些收益,选择其他模型只会增加额外的开发和运营开销。
Typed 是否意味着正确?
在对 Jev 作出声明时使用的语言也需要谨慎措辞。由于输出空间事先已定义,模型不应返回虚构的字段或无法解析的段落。这可以消除一种失败形式,但并不能消除语义错误。没有任何东西能阻止系统返回错误的部门、分配错误的风险等级,或给出过于确定的陈述。它可以在完全类型安全的前提下实现上述所有功能。
TypeSafe 的System One 文档作出了重要区分。校准是对一组预测进行测量的;它并不保证单个预测的正确性。在生产环境中,这具有影响。团队需要在自己的数据上测试预测概率是否与观察结果匹配。
性能证据仍处于早期阶段
TypeSafe 报告响应时间为 70 到 500 毫秒。它还提到了在内部工作流评估中实现了显著的成本节约和速度提升。此外,TypeSafe 表示这些 headline 增益可能接近真实世界收益的上限。TypeSafe 的公开可用的工作流测试使用其他前沿模型提供的参考概率,而非真实标签。结果对于形成假设是有价值的,但不能取代针对真实工作负载的独立测试。
采用前的实用测试
在构建首个 AI 驱动的决策工作流时,不要选择最关键的决策(例如医疗批准或账户冻结)。相反,挑选那些非常常见、可逆且易于团队其他成员审查的场景。这包括但不限于工单分配、文档分类、模型选择以及低风险的质量检查。
以下四个问题可以帮助你判断此方案是否可行:
- 输出是否只有有限数量的可能答案?
- 你能否清晰阐述判断的标准?
- 是否有可衡量的结果?跟踪预测、其概率、对应的操作以及后续结果。通过将预测概率与实际观察结果对比,定期检查校准情况。
- 如果自动决策过程失败,你是否有备选方案?确定一个明确的节点,以使用推理模型、请求更多信息或引入人工干预。
你的分析应覆盖整个工作流,包括决策过程本身。使用决策准确率、弃权或升级率、端到端总处理时间、每个成功完成任务的成本以及错误影响等指标。在不利条件下进行测试:词汇变化、遗漏相关数据、罕见类别以及对抗性输入。一个在下游产生额外成本的优化分类器并不是真正的优化。
这里的长期教训
如果 Jev 成功、显著变化或被快速取代,有一点始终不变:架构问题依旧存在。是否必须让每个机器决策都以生成的语言形式呈现?
在许多情况下,答案是“否”。在生产环境中,使用生成模型的系统可以生成解释、计划和说明。使用受限的决策模型,同一系统可以进行路由、打分和门控。代码仍然可以决定可接受的阈值和权限。人类应当对影响他人生活的决策负责。
虽然这比让单一自主模型可靠地完成所有任务的观点更为温和,但它反映了可靠系统的构建方式。代理的下一步性能提升可能取决于在系统中选择那些思考时间更长的环节。其他环节需要快速决策,甚至有些根本不需要任何操作。












