思想领袖

超越简单的上下线监控:在复杂基础设施中定义“正常”的更好方法

mm
将 Unite.AI 添加到您在 Google 上的首选来源

我们已经走过了很长一段路,从简单的上下线监控到现在。从工厂车间到现代企业基础设施,IT管理员现在需要比简单的上下线状态更多的信息来确定网站或应用程序是否能够为用户提供服务。当然,看到基本的“上”或“下”状态很有帮助,但这并不能告诉我们整个技术如何提供预期的业务价值。此外,随着IT和OT环境的融合,生态系统变得更加动态和短暂,这些警报不能准确地建立或反映基准。

了解什么是正常的,学习性能模式,防止昂贵的停机时间是在今天的复杂基础设施中至关重要的功能。尤其是当威胁者使用越来越复杂的工具来做更多事情时,现代相互连接的基础设施会创建新的漏洞。

在这种情况下,AI驱动的监控通过提供对正常和异常行为的洞察力来改变基础设施管理,消除了糟糕的基准和警报疲劳。让我们探索一下这种从反应式消防到预防式预防的转变如何标志着监控的演进。

发现新的正常

什么是正常的?这是基础设施团队在监控服务器、网络设备、应用程序和数据库时几个世纪以来一直在问的问题。为什么?因为定义“正常”在动态和分布式环境中是复杂和容易出错的,需要监控多样化的系统。找到答案将取决于您的特定业务模式和技术。此外,它还将取决于您的监控技术和配置,因为设置静态阈值不能捕获到许多问题。相反,它会给您一个很好的想法,当您预期某些事情发生时,但它不会帮助您捕获到您不预期的问题,导致假阳性、警报疲劳和可见性差。

考虑一个制造设施,突然在星期二下午2点出现流量激增。传统的监控可能会触发警报,因为它超过了预设的阈值,但这实际上是一个问题吗?没有更深入的数据和诊断就无法确定。激增可能表明合法的业务活动,例如新的班次安排或为了满足截止日期而增加生产。或者,它可能表明严重的安全威胁,例如数据泄露或系统被入侵并向命令和控制服务器发送信号。

这就是AI驱动的异常检测增强基础设施监控智能的位置。这种新兴方法持续分析历史数据以创建智能基准,这些基准会根据不断变化的条件自动调整。这使得更主动的警报成为可能,为IT管理员和DevOps团队提供了额外的时间来解决问题并减轻影响。

网络流量监控是一个很好的例子。基础设施监控系统收集各种信号,包括日志和指标。日志是系统生成的事件,而指标是衡量标准。随着时间的推移,这些措施被收集并以时间序列的形式表示,类似于一天中测量的温度。用于监控网络条件的数据包括入站和出站广播包速率、丢弃和错误数量以及总吞吐量等指标。如果与正常性能相比有什么异常,智能监控可以确保引发正确的警报并避免假阳性。

因此,基础设施团队可以专注于提供业务价值,而不是不断调整警报设置和解决可能不存在的问题。

避免警报重复

监控的重复可能会引入额外的挑战,导致更多的警报。随着团队为新项目添加跟踪或在故障排除或测试时创建额外的监控,监控可能会随着时间的推移而变得混乱。最初看起来很干净和简单的监控设置可能会变成一个过载的警报迷宫,这些警报可能是虚假或冗余的,掩盖了问题而不是阐明问题。

例如,IT团队可能会收到来自同一个过载服务器的CPU使用率高、应用程序响应时间慢和网络拥塞的警报。如果没有理解这些警报之间的相关性,团队可能会调查三个单独的问题,而不是单个根源问题。

现代AI技术,当与监控结合使用时,再次通过自动检测类似的监控配置来改变这一问题。使用模糊数学和启发式等技术,这种方法分析行为模式并揭示类似监控之间的隐藏关联。

这有两个主要原因。首先,它减少了警报噪音。团队不再收到三个单独的警报,而是收到一个带有清晰解释的警报,说明需要关注什么以及为什么需要关注。其次,它消除了冗余的监控。这有助于创建一个更易于管理的设置,简化了仪表盘并减少了认知负担。

智能监控的未来

其他网络和网络安全发展也支持了监控复杂性的增加。曾经独立的、空气隔离的工业网络现在与企业系统相互连接,创建了混合环境,网络问题可能会影响生产线和业务应用程序。我们正在整个现代堆栈中看到这种融合。

工业物联网传感器、边缘网关和OT设备现在与标准IT协议一起通信。当这些多样化的系统出现问题时,管理员需要能够理解整个生态系统关系的监控,而不是将每个系统视为一个独立的隔离区。警惕性是不可协商的,因为一次成功的入侵可能会停止生产线、损坏昂贵的设备并造成安全隐患。事实上,计划外停机现在使财富全球500强公司损失了11%的年度收入,这凸显了智能监控的成本远远低于手动故障排除和生产力损失的费用。

与此同时,黑客正在使用这项技术作为生产力突破来大规模发起攻击。免费或廉价的生成式AI大型语言模型(LLM)使黑客能够以最低的成本生成和修改攻击。随着时间的推移,很明显,恶意行为者越来越多地将AI视为游戏规则的改变者。今天,7成黑客认为这项技术及其各种工具增强了黑客行为,高于2023年的2成。

如今的异常检测算法基于几十年来建立的数学和统计学。这种技术是有效的,但将AI和LLM应用于指标监控是一个游戏规则的改变者。我们正在看到第一批基于时间序列的LLM进入市场,可以预计这将在未来两年内改变异常检测。其中一些新模型显示出卓越的准确性和进步。

现在,IT和运营团队必须决定如何最佳地监督他们的生态系统并应对威胁。好消息是,自动异常检测和基准监控可以帮助更好地保护资产,同时学习、适应和优化,从而实现更有效的容量规划和资源优化。基本的上下线检查仍然有价值,但当单个问题可以跨IT、OT和IoT系统蔓延时,我们需要在基础设施上添加智能上下文。基础设施防御者可以通过相应地扩大他们的可见性来应对这一挑战,ables更有效的容量规划和资源优化。基本的上下线检查仍然有价值,但当单个问题可以跨IT、OT和IoT系统蔓延时,我们需要在基础设施上添加智能上下文。基础设施防御者可以通过相应地扩大他们的可见性来应对这一挑战。

乔纳·考沃尔(Jonah Kowall)是Paessler的产品和设计高级副总裁。在拥有超过20年的实践和管理经验的同时,乔纳·考沃尔在基础设施和运营、安全和性能工程方面拥有丰富的经验。目前,乔纳·考沃尔正在监督PRTG的预测和主动AI功能以及自动化优化能力的引入。