访谈

Simon Edwards,SE Labs 首席执行官兼创始人 – 访谈系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Simon Edwards,SE Labs 的首席执行官兼创始人,是一位网络安全测试专家,拥有三十多年跨越安全研究、产品评估、技术新闻报道和行业标准的经验。在 2015 年创立 SE Labs 之前,Edwards 负责 Dennis Technology Labs,领导安全测试项目,并在此之前多年担任技术记者和编辑。他还曾在反恶意软件测试标准组织(AMTSO)担任高级领导职务,包括主席、董事和联合主席。Edwards 自 1990 年代中期起就开始测试安全产品,并开创了早期的真实世界反恶意软件测试方法,旨在评估安全技术在完整的、通过互联网传递的攻击下的表现,而非仅针对孤立的恶意软件样本。

SE Labs是一家独立的网络安全测试与咨询公司,评估安全技术在真实攻击情境下的表现。其研究人员在完整的攻击链中复现攻击者技术,以评估包括终端防护、端点检测与响应(EDR)、云安全服务、防火墙、邮件安全以及网络检测技术在内的产品。除了公开的对比测试,SE Labs 还为企业和网络安全供应商提供认证、先进的安全测试、产品验证和咨询服务。公司公开其测试方法论和威胁仿真框架,并已获得 ISO/IEC 27001:2022 和 BS EN ISO 9001:2015 认证,以提供 IT 安全产品测试服务。

您的职业生涯跨越三十多年,涵盖技术新闻报道、安全咨询、独立测试以及在反恶意软件测试标准组织(AMTSO)的领导职务。这些经历如何塑造了您区分 AI 驱动的网络安全真正进步与主要出于营销目的被标榜为“AI”的技术的方式?

新闻工作教会我质疑声明,而独立测试让我明白唯一可靠的答案来自证据。网络安全公司多年来一直在使用机器学习和自动决策,因此在产品名称中加入 “AI” 并不一定代表技术上的进步。

需要考虑的三个基本要点:AI 实际在做什么?它提升了哪些可衡量的安全成果?以及独立测试者能否复现这种改进?

如果答案仅是产品分析大量数据或自动化已有流程,那么 AI 标签可能更多是营销定位而非实际能力。

真正的进步能够在面对未知或全新攻击时表现出色,提升防护或响应能力,减轻分析师负担,并且不引入不可接受的风险。其他情况要么没有改进,要么是倒退!

“AI 驱动”已成为网络安全产品的常见宣传。组织在接受 AI 驱动的安全平台能够兑现供应商承诺之前,最重要的能力是什么,需要进行哪些独立测试?

我不会先去测试产品是否包含 AI,而是先检验其所作的安全声明。我并不在乎产品的工作原理,只要它能正常运行即可。这正是 PIVOT 测试计划的核心目标,该计划目前在业界正获得广泛关注。

这种测试方式意味着让产品面对完整的攻击并衡量其响应情况。它应当能够检测到攻击行为,并可能进一步阻止攻击的进一步发展。这取决于产品的构建和配置方式,以及供应商所做的营销声明。

我们还需要审视向客户呈现的调查叙事。系统是否了解发生了什么,关联相关事件,并将证据呈现给必须采取行动的人员?

测试应包括未知的变体、真实的客户配置以及正常的业务活动。还必须衡量误报、资源消耗以及可能被视为不安全的操作。如果系统是自主的,我们需要了解它何时行动、为何行动、使用了哪些权限,以及其决策是否可以撤销。

我们在新闻中看到过一些关于 AI 安全失控、超出其边界甚至触犯法律的案例。关键问题不在于平台是否看起来智能,而在于它是否能够持续提供更好、更安全的安全结果。

自主 AI 代理可能在侦察、利用、横向移动以及攻击的其他阶段,以远快于人类攻击者的速度执行。面对机器速度的攻击,网络安全测试需要如何改变?

测试的单元需要从单一技术转变为在时间压力下运行的完整攻击活动。我的意思是,与其在一上午或一周内尝试不同的攻击方式,不如快速对特定安全措施进行测试。否则测试缺乏真实性,而真实性极为重要。

传统测试可能在各阶段之间留下便利的间隙,以便能够单独检查每个事件。自主攻击者可能会将侦察、利用和横向移动压缩到更短的时间内。这可能会暴露在较慢测试中看不见的弱点,包括遥测延迟、系统过载以及防御措施仅在攻击已达成目标后才出现。

举一个极其简单的例子,如果我们入侵一台 Mac,下载其所有文件并窃取账户密码,但防病毒软件在一天后才弹出警告,这几乎没有任何用处。

因此,对 AI 攻击者的安全响应进行测试需要高分辨率的仪器和对检测与响应延迟的精确测量。测试应检查随着活动量和速度的提升,性能是否会下降,以及防御是否能够在不等待每个阶段人工决策的情况下中断攻击。

攻击还可能根据其发现进行适应。测试必须在保持真实数据、证据和可重放性的前提下反映这一点。机器速度不应意味着放弃受控的方法论。我们需要继续设计能够以与被评估系统相同速度运行并测量事件的受控测试。

SE Labs 使用基于诸如 Scattered Spider 等威胁组织的战术和技术的真实攻击场景。您如何在受控环境中重现这些对手,同时确保测试反映真实攻击的展开方式,而不是仅仅针对预定义的检查清单进行测试?

我们从对手的目标、已知行为和可能的决策入手,而不是把其技术当作购物清单。

测试遵循一次真实的攻击链,包括侦察、初始访问、执行、特权提升、妥协后活动以及横向移动。重要的是,测试者只能使用在侦察和攻击过程中实际发现的信息。我们不会向攻击者提供在真实交互中不可获得的情报。

场景是有限且经过精心控制的,但并非仅仅是一系列预设的按钮操作。如果某条路径被阻断,攻击者可以在测试规则范围内寻找可信的替代方案。这使得安全产品能够影响场景的展开方式。

与此同时,所有重要的行动和结果都会被记录,以便我们能够解释结果并公平地比较产品。受控并不一定意味着严格的脚本化,而应意味着安全、可观察且有证据支撑。

网络安全产品传统上主要依据其检测威胁的能力进行评估。组织在评估 AI 驱动的安全系统时,为什么应更加关注防护、遏制和事件响应?

检测并不等同于防御。平台即使生成了准确的警报,也可能仍让攻击者达成目标。这也是 PIVOT 测试计划将检测和防护作为整体测试的共同且独立部分的原因。

可以把网络安全检测比作闭路电视摄像头。它应当发现入侵并提供事件线索,但并不会对入侵者进行物理阻止。网络安全防护则更为主动,能够驱逐或以其他方式中和攻击者,防止损害发生。

组织需要了解产品是否阻止了初始活动、是否中断了攻击链、是否限制了横向移动、是否保护了重要资产并支持恢复。如果攻击成功,接下来的问题是它被遏制的速度以及客户是否获得了足够可靠的信息以有效响应。

这在 AI 驱动的系统中尤为重要,因为尽管它们可能提供非常有说服力的事后摘要,但有说服力的解释并不能替代防护。解释必须有证据支撑,并且必须引导出恰当的行动。

因此,我们分别衡量检测和防护。我们还会检查声称的检测是否真正可见且对客户有用。归根结底,安全系统的价值在于改变攻击的结果,而不仅仅是观察它。

随着安全平台引入能够调查警报并执行补救措施的自主代理,独立实验室应如何测试整个人工与 AI 的工作流程,而不是仅孤立评估底层检测技术?

测试应跟踪从首次恶意活动到最终安全结果的整个过程,结果可能是攻击被阻止、完全成功,或介于两者之间的某种状态。

我们需要审查代理观察了什么、得出了什么结论、推荐或执行了何种操作、向人工操作员展示了哪些信息以及操作员如何响应(或提供了哪些选项)。这包括证据的质量、交接的清晰度、所需时间、干预次数以及人工是否能够理解、质疑或逆转代理的决策。

不同的运行模式也很重要。一个需要批准才能执行操作的代理所带来的风险,与能够自动隔离系统、禁用账户或更改安全控制的代理截然不同。

仅仅因为底层检测器识别出了攻击,系统并不算成功。如果它产生了难以理解的队列、隐藏了重要证据、推荐了错误的响应或采取了破坏性行动,那么整体工作流就已经失败。独立测试应当衡量技术本身、其自主组件以及预期使用者的综合表现。

标准化安全基准的一个风险在于供应商可以专门针对测试进行产品优化。独立测试如何在保持可复现性和公平性的同时,又引入足够的不可预测性,以揭示产品在面对陌生攻击时的表现?

可复现性并不要求提前向参与者提供考试题目。

可信的测试应公布其方法论、环境、评分原则、产品配置和证据要求。供应商应了解规则,并有公平的机会验证其产品是否正常运行。然而,具体的攻击活动、载荷以及部分攻击路径应在测试进行前保持未知。

例如,在 PIVOT 项目中,我们在测试完成之前不会披露将要复制的攻击组织。真实的目标在攻击开始前是不会收到预警的!

我们可以将一个支持随时间比较的标准核心与陌生变体相结合,以测试整体能力。基准化和隐藏的安静期可以确定产品在攻击前的行为。随后应控制配置、保留日志,并将任何声明与测试者自己的证据进行核对。

公平性意味着对每位参与者使用相同的规则和证据标准。这并不意味着以可预测的方式重复攻击,以至于供应商能够识别基准而非识别威胁。

此外,彻底的透明度帮助供应商复现攻击,这对他们想要修复遇到的问题至关重要,例如未能检测或防御某种威胁。SE Labs 本质上在客户遇到问题时为其提供培训。

自主安全代理引入了不同类别的风险,因为错误决策可能触发不必要甚至破坏性的修复行动。测试应如何在传统检测准确率的基础上,衡量误报、错误推理以及潜在有害的自主行动?

传统的误报测试仅是第一层。面对自主代理时,我们需要区分误报、无依据的结论和错误的行动。每种情况的潜在影响各不相同。

测试应让系统面对类似恶意行为的合法活动,以及不完整、模糊或误导性的证据。如果代理处理不可信内容,测试还应检查该内容是否会不当影响其决策。

推理应以结论是否得到可用证据支持为准,而非解释听起来多么可信或自信。对于自主行动,我们应衡量其范围、比例、权限使用、批准控制、可审计性和可逆性。

评分必须反映后果。无意义的警报虽不便,却不致于造成重大损失;禁用重要账户或隔离关键系统则可能扰乱组织。因此,有效的安全措施需要同时考虑错误频率和每次错误可能造成的损害。

话虽如此,有时客户会选择导致问题的策略。这并不一定是安全供应商的错。

生成式人工智能和日益强大的开源模型正在降低自动化攻击过程的门槛。您是否预期 AI 会使网络攻击在本质上更为复杂,还是更大的危险在于攻击者能够以极大规模和速度进行操作?

我的预期是,更直接的危险在于规模、速度以及成本的降低。

AI 可以帮助攻击者收集信息、个性化社会工程、修改代码并协调攻击活动的各个环节。由此产生的某些攻击会变得更为复杂,尤其是当 AI 帮助将已有技术串联或针对特定目标进行适配时。但 AI 并不能消除对访问权限、凭证、可利用漏洞或防御者失误的需求。

AI 在生成可靠的漏洞利用方面也并不擅长,而这本身对熟练的人类来说已经相当困难。因此,我强烈认为这降低了根本上更复杂攻击的可能性。

更大的变化在于,以前需要时间、技能或团队才能完成的活动,现在可以更快地在更多目标上尝试。AI 能提升相对普通攻击者的作战能力,同时让有能力的攻击者能够同时进行更多的行动。

即使底层攻击技术并非革命性,这仍具有重要意义。危险并不一定是全新形式的网络攻击,而是熟悉的攻击变得更快、更便宜、更具个性化且数量大幅增加。

随着防御性和攻击性 AI 代理变得更加自主,可信的网络安全测试环境需要呈现何种形态才能跟上步伐?我们是否最终会达到一个阶段,即安全产品需要持续受到自适应 AI 对手的挑战,而不再主要通过定期安全测试来评估?

可信的环境需要类似于一个活生生的组织,而不是一堆孤立的目标。它应当涵盖终端、身份系统、电子邮件、网络、云服务、真实用户以及正常的业务活动。同时,它必须提供完整的监控手段,以便能够重建每一个决策及其后果。

可以为自适应对手设定目标和边界,然后让其根据发现的情况以及防御产品的响应自行选择路径。测试仍需具备受控的起始条件、对实际发生情况的可靠描述以及重放关键事件的能力。如果缺少这些要素,自适应测试可能看起来很炫目,却在科学上薄弱。

我确实预期测试将变得更加持续,尤其是在产品、模型和策略频繁变化的情况下。然而,持续的挑战应当是对定期对比测试的补充,而非取代。组织需要两者兼备:像 PIVOT 这样的受控基准,用于支持问责和比较;以及持续的自适应评估,以揭示系统在威胁和产品本身变化时的行为。

我认为我们更应该担心相对缺乏技能的人类能够入侵系统和网络,而不是机器人制造下一代网络攻击技术。

感谢这次精彩的访谈,想要了解更多的读者请访问 SE Labs

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。