网络安全
Anaconda 将 AI 代理群与自主安全测试相结合

为 AI 代理提供更多工具可以提升其效用。一次为多个代理提供这些工具则会提出更棘手的问题:企业如何跟踪每个代理的行为,并在其产生不良操作之前阻止其影响真实系统?
Anaconda 10月6日平台扩展通过将协同 AI 开发与自主安全测试相结合来解决该问题。它整合了来自 Kilo Code、Enkrypt AI 和 Outerbounds 的技术,覆盖开发工作区、安全控制和生产编排。
其战略构想是将代理构建软件的地点、其行为受到挑战的环节以及生成工作流运行的环境相互连接。Anaconda 将其称为 AI 开发工厂。对于企业而言,实际问题在于这些连接是否能让日益增长的代理自主性更易于检查和治理。
Kilo 代理如何协同工作
代理群会在多个 AI 代理之间分配相关任务。一个代理可能研究认证设计,而另一个则编写测试或实现独立组件。只要代理能够共享发现并避免相互冲突,这种方式的潜在优势在于并行推进。
Kilo 对 Swarm 的技术描述阐释了协同机制:主会话及其衍生代理共享一个消息板。代理可以在工作进行时发布发现并阅读消息板,而无需等待所有子任务完成后再交换结果。
这一区别很重要。测试代理可以在编写假设不同的测试套件之前了解认证决策。Kilo 表示,早期内部评估显示,减少重复工作可能降低代币消耗,但其并未公布该主张的具体数值结果。
同一文档还定义了一个值得了解的边界:消息板上的信息不会唤醒、恢复或批准代理,建议性暂停或否决信息也不会自动阻止它们。所有参与者均可阅读完整的消息板历史。因此,协同需要与可强制的权限和执行控制区分开来。
Anaconda 的 启动页面将这些工作流嵌入 VS Code,并描述了跨工作树的并行工作。它还在 beta 版中推出了 Kilo Desktop,将工程、数据科学和 Python 环境管理结合,并可访问超过 500 种模型及本地推理。
随策略变化的安全测试
Enkrypt AI 为平台提供对抗性测试部分。Anaconda 表示,扩展后的安全功能会在 300 多个攻击类别中测试模型、代理和 MCP 集成,并提供运行时防护。
在其 自主红队的技术解释中,Anaconda 描述了先从已知攻击模式入手,然后利用代理根据目标的响应调整方法。代理会对某一弱点形成假设,进行测试,检查结果,并决定下一步尝试什么。
例如,拒绝响应可以促使策略调整,而不是对同一请求进行再次改写。系统利用会话记忆避免重复失败的做法,并通过并行探索一次性调查不同风险。Anaconda 表示,此类测试在客户环境中运行,并针对部署的威胁模型进行调优。
该方法适用于从工具和外部来源获取信息的代理。风险不仅限于不安全的答案:检索材料中隐藏的指令可能导致后续工具调用偏离预期。测试需要审查行为链条,包括代理信任的资讯以及随之产生的操作。
运行时防护栏解决了另一类问题
在测试期间发现弱点并在运行时阻止不安全行为是两个独立任务。Enkrypt AI 的 Guardrails 产品旨在对跨代理、工具、检索增强生成以及模型上下文协议连接的风险行为进行批准、修改或阻断。
该公司将提示注入、不安全的工具操作、特权边界违规以及敏感数据泄露列为其关注的风险。其对可审计决策的重视使得控制层对事件调查和预防同样具有重要意义。
Anaconda 的发布还在 Kilo 中加入了模型风险评分,并提供了包含来源支持的公开事件报告的代理事件登记册。这些信息可用于指导模型选择和测试重点。它们应被视为安全流程的输入,而非某一部署已安全的证明。
这些规模数据同样需要谨慎对待。Anaconda 报告称,在其针对 AI 原生构建者的调查中,63% 的受访者正以某种形式向代理群转变。其公告还引用了 Enkrypt 的研究,发现四个月内扫描的 25,264 台 MCP 服务器中有 73% 存在漏洞。这些是供应商对受访者和被检查系统的报告,并非对所有企业代理部署的测量。
为何生产环境在此故事中占据重要位置
Anaconda 的 AI Orchestration 平台,前称 Outerbounds,解决了开发之后会发生的情况。其网站描述了可重现的工作流运行、制品追踪和血缘关系,计算资源可跨多个云平台使用,并对软件包和模型实施治理。
这提供了一种将输出与生成它的环境和依赖关系相连接的方式。当工作流发生变化时,团队需要了解是哪一个模型、软件包或策略随之改变。可重现性使调查和比较更加实用。
十月的发布为编排工作流中的受治理制品提供了原生访问。其更广泛的发布页面还介绍了 Fast Bakery,它可以从 conda 和 PyPI 依赖(包括本机库)构建容器镜像,并提供了超过 19,000 个精选软件包和 77 个经过审查的开源模型的扩展目录。
此扩展使 Anaconda 的角色超越了仅提供 Python 组件。其定位现在涵盖了代理辅助开发、对抗性评估、运行时控制以及可重复交付。关键的考验在于这些组件是否能为团队提供可靠的记录,记录代理构建了什么、测试了什么,以及在软件开始运行时允许它们执行的操作。












