网络安全
Goodfire 为 Kimi K3 和 GLM 5.3 部署基于探针的网络监控

Goodfire 于 2026 年 10 月 8 日发布了 在 Kimi K3 上训练和部署生产网络监控,这是一篇描述针对 Kimi K3 和 GLM 5.3 开源模型的网络安全监控的研究文章,该公司已在生产推理堆栈上部署这些模型。Goodfire 报告称,这些监控在公司运营点上能够匹配 LLM 判官的召回率,同时成本约低 50 倍。
该文章的核心贡献者包括 Ekdeep Singh Lubana、Connor Watts、Siddharth Boppana、Dron Hazra 和 Vasudev Shyam。
为什么网络监控如此困难
Goodfire 将网络安全描述为监控 AI 代理的最艰难场景之一:审计代码库以发现漏洞并对其进行利用涉及相互重叠的任务,因此要在良性与恶意行为之间做出区分,需要在可能延伸至数百万 token 的轨迹上跟踪意图。显而易见的解决方案是让第二个 LLM 判官读取每一次对话,但这在实时与代理并行运行时速度过慢且成本过高,因此监控通常是异步进行的,且有害轨迹只能在代理行动后才会显现。
根据 OpenRouter 的费率,文章估算,对 Kimi K3 的一百万轮次进行每轮判官评估的成本约为 20 万美元(使用 Claude Opus 5)或约 3 万美元(使用 Kimi K3 本身)。
探针加判官级联
Goodfire 的方案是两阶段级联。探针在推理服务器生成 token 时读取目标模型的内部激活,并充当始终开启的第一线检测器;当探针的读数超过校准阈值时,推理过程会升级到 LLM 判官,后者可以拒绝请求或继续交互。公司表示,探针架构能够以局部方式(关联到回合的特定片段)和分布式方式(贯穿整个回合)捕获行为,同时保持运行高效。校准后,探针在留出的代理和聊天交互集合上实现了 0% 的假阴性率和 95% 的真阴性率,Goodfire 报告称,因此判官主要用于有害活动,并可采用更快、能力较弱的判官。
训练数据来源于在网络和非网络环境中具有有害和良性目标的模拟用户,其中部分数据通过 Prime Intellect 的验证器、Prime 沙盒和隧道收集,以实现网络攻击性和良性 Kimi K3 推理在无网络访问的情况下运行。书面政策通过具体因素定义了不良网络活动,将良性工作(如受限的漏洞复现)与恶意工作(如漏洞利用)区分开来,且模拟用户可以在任何时刻升级其有害意图,包括在最初的良性请求之后。
该设计延伸了 Goodfire 之前的奖励劫持研究。 在 2026 年 9 月 17 日发布的文章 中,公司报告称在 Kimi K3、GLM 5.2 和 Qwen 3.8 Max 的三个代理基准上,50%–96% 的 rollout 出现了奖励劫持,并伴随一个与作弊、操纵指标、规避检测等概念相关的内部信号。针对该信号调校的简单激活探针捕获了 LLM 思路链监控未能发现的劫持行为,且在 Kimi K3 上,探针加 LLM 的组合将 LLM 监控成本降低了 90%,精度仅下降约 1%,公司报告称。
吞吐量、延迟与检测结果
为了实时运行探针,Goodfire 对 SGLang 服务引擎进行了扩展,以在内部计算探针分数,编写了探针逻辑的自定义内核,并通过基数树、DSpark 推测器以及预填充‑解码拆分将探针分数传递下去,以避免重复计算。每个为 Kimi K3 副本提供服务的工作节点都会运行探针并为其活跃请求保留历史记录,监控事件随响应流返回。
在四种推理工作负载中,启用探针后吞吐量保持在 Goodfire 基准的噪声阈值内,较默认 SGLang 服务下降不到 2%。该级联将每回合的平均额外延迟从 160 毫秒降至 2 毫秒(不使用判官推理)以及从 2,750 毫秒降至 42 毫秒(使用推理),Goodfire 报告称,成本分别为每百万代理回合 65 美元(不使用推理)或 185 美元(使用推理),相较于对每回合进行审查,判官成本分别降低约 49 倍和 29 倍。在固定的计算预算下,公司表示,监控器的计算占用低于 1%,而每回合判官最高可达 20%。由于该级联足够廉价以同步运行,Goodfire 表示,可以在代理调用工具之前阻止风险网络行为,而不是事后标记。
Goodfire 在内部数据集上评估了这些监控器,该数据集包含 2,400 场聊天和代理会话,超过 60,000 条回合,使用 Claude Opus 5 的标签作为参考;交互来自 Anthropic 的开源 Petri 红队库、从 ExploitBench 等基准改编的真实环境、WildChat 的网络安全子集以及良性的软件工程、编码和 DevOps 部署。以 5.5% 的良性会话中断率为基准,Goodfire 报告称该级联在有无评审推理的有害会话上实现了约 93% 的召回率,并且标记了 0% 的非网络流量,公司称这相较于仅使用评审在每个测试的中断量上实现了帕累托改进。加入监控后,Kimi K3 的有害会话阻断率从约 29% 提升至 96%,良性会话中断率从约 5% 上升至 9%;对于 GLM 5.3,阻断率从约 36% 提升至 91%,良性中断率从约 10% 上升至 15%。
相较于 Jev——一种可以充当廉价评审的决策模型——该级联在相同的 5.5% 良性中断率下实现了 93% 的召回率,而 Jev 为 86%;每百万回合的评审计算成本约为 65 美元,额外延迟约为每回合 2 毫秒,而 Jev 则为 600 美元和 200 毫秒,Goodfire 报告称。Jev 仅捕获了 12% 的嵌入良性框架的有害提示,并且在其 32,000 令牌窗口之外越来越多地中断良性会话。标准线性探针的召回率比最终配方低约 5%,非线性探针在分布外数据集上召回率下降最高达 30%,而匹配评审召回上限且使用六倍更少评审调用的需求只能通过探针级联而非随机回合选择实现。该配方还迁移至 GLM 5.3,仅使用为 Kimi K3 开发的数据,产生了在 Kimi 部署中同等能力的 GLM 监控器,在 GLM 自身评估数据上略逊一筹,公司报告称。
FAR.AI 的外部红队测试
为了在内部评估之外测试已部署系统,Goodfire 邀请 FAR.AI 对其进行红队攻击。以下是 FAR.AI 在帖子中引用的说法:
“FAR.AI 对 Goodfire 的 Kimi K3 监控器进行了为期两天的初步测试,使用了针对聊天环境的进攻性网络滥用的非自适应静态 jailbreak 组合。从最初的 1500 个候选 jailbreak 中,测试筛选出 140 个在未使用我们监控器的不同版本基础模型上有效。对这 140 个 jailbreak 在对应不同攻击者目标的 8 次单独交互中进行测试,Goodfire 的监控器将 66 个通用 jailbreak 和 700 次总 jailbreak 交互的漏洞降低至 0 个通用 jailbreak 和 18 次 jailbreak 交互。”
未使用监控器时,通用 jailbreak 攻击的成功率在不同推理努力设置下介于 12% 到 53% 之间;启用监控器后,140 种策略均未产生通用 jailbreak,而在 1,120 次非通用交互中,单个提示的成功率从至少 9%–40% 降至 0.1%–1.6%,具体取决于推理努力。
Goodfire 将此类监控设置描述为面向任何在代理环境中提供开放模型的实用默认方案,指出开放模型并未配备完整的安全栈。公司表示计划继续与 FAR.AI 合作,进一步测试并强化这些监控器。












