ソートリーダー

アップ/ダウンを超えて:複雑なインフラストラクチャで「正常」を再定義するためのより良い方法

mm
Unite.AI を Google の優先ソースに追加

アップ/ダウン監視から遠く離れています。工場の床から現代のエンタープライズインフラストラクチャまで、IT管理者は、単純なチェックでウェブサイトまたはアプリケーションがユーザーにサービスを提供できるかどうかを判断するだけでなく、はるかに多くの情報を必要としています。もちろん、基本的な「アップ」または「ダウン」状態を確認することは役立ちますが、これだけでは、テクノロジーが期待されるビジネス価値をどのように提供しているかという全貌を示すものではありません。さらに、ITとOT環境が融合し、エコシステムがよりダイナミックで短暂になるにつれて、これらのアラートは基準を確立したり反映したりすることができません。

何が「正常」であるかを理解し、パフォーマンスパターンを学び、コストのかかるダウンタイムを防ぐことは、今日の複雑なインフラストラクチャでは重要な機能です。これは特に、脅威行為者がより洗練されたツールを使用してより多くのことを行うようになり、現代の相互接続インフラストラクチャが新しい脆弱性を生み出すようになったためです。

この風景の中で、AI駆動型の監視がインフラストラクチャ管理を変革し、正常な動作と異常な動作を示す洞察を提供し、基準を確立し、アラート疲労を排除します。反応的な消防活動から予防的な予防への移行が必要な監視の進化について見ていきましょう。

新しい正常を発見する

何が「正常」であるかというのは、サーバー、ネットワークデバイス、アプリケーション、データベースを担当するインフラストラクチャチームが何十年も前にから問いかけてきた質問です。なぜなら、「正常」を定義することは、ダイナミックで分散された環境で多様なシステムを監視することが複雑でエラーが発生しやすいためです。答えを求めるには、特定のビジネスパターンとテクノロジーに依存します。さらに、監視テクノロジーと設定にも依存します。静的なしきい値を設定することは多くの問題を捉えず、予想外の問題を捉えることができず、誤った陽性、アラート疲労、可視性のギャップにつながります。

例えば、14時に突然トラフィックが急増する製造工場を考えてみましょう。従来の監視では、予め設定されたしきい値を超えたため、アラートが発生するかもしれませんが、これが実際に問題であるかどうかはわかりません。より深いデータと診断がなければ、わかりません。このスパイクは、新しいシフトスケジュールや納期に応じた増加した生産などの正当なビジネス活動を示す可能性があります。代わりに、データの流出や妥協されたシステムがコマンドアンドコントロールサーバーにビーコンを送信するような深刻なセキュリティ脅威を示す可能性もあります。

ここで、AI駆動型の異常検出がインフラストラクチャ監視の知能を高めます。この新しい方法は、歴史的なデータを継続的に分析して、変化する条件に自動的に調整される知能的な基準を作成します。このアプローチにより、より予防的なアラートが可能になり、IT管理者とDevOpsチームが問題を軽減するための余裕が生まれます。

ネットワークトラフィックの監視は、この機能の良い例です。インフラストラクチャ監視システムは、ログやメトリクスなどのさまざまなシグナルを収集します。ログはシステムによって生成されるイベントであり、メトリクスは測定値です。時間の経過とともに、これらの測定値は収集され、時間系列として表されます。ネットワーク状態を監視するために収集されるデータには、受信および送信ブロードキャストパケットレート、破棄およびエラーの数、合計トラフィックスループットなどのメトリクスが含まれます。何かが通常のパフォーマンスと比較して異常である場合、知能的な監視により、適切なアラートが発生し、誤った陽性が回避されます。

結果として、インフラストラクチャチームは、常にアラート設定を微調整したり、存在しない可能性のある問題に対処したりするのではなく、ビジネス価値の提供に集中できます。

アラートの重複を回避する

監視の二重化は、追加の課題をもたらし、アラートの数を増やします。監視は、新しいプロジェクトの追跡を追加したり、トラブルシューティングまたはテスト中に追加の監視を作成したりすると、時間の経過とともに混雑する可能性があります。すぐにに、シンプルで整理された監視設定は、問題を明らかにするのではなく、問題を隠す冗長または重複するアラートの混乱した迷路になる可能性があります。

例えば、ITチームは、同じオーバーロードされたサーバーから、CPU使用率が高い、アプリケーションの応答時間が遅い、ネットワークが混雑しているなどのアラートを受け取ることがあります。相関関係がわからないと、チームは3つの個別の問題を調査するかもしれませんが、実際には1つの根本的な原因があります。

モダンなAIテクノロジーは、監視と組み合わせてこの問題を変革します。監視の類似の構成を自動的に検出することで、ふわふわの数学やヒューリスティックなどの技術を使用して、行動パターンを分析し、監視間の隠れた相関関係を明らかにします。

これは2つの理由で重要です。まず、アラートノイズを削減します。1つの問題に対して3つの個別のアラートを受け取るのではなく、チームは問題とその理由を明確に示す1つのアラートを受け取ります。2つ目は、冗長な監視を排除します。これにより、ダッシュボードが整理され、認知負荷が軽減されます。

知能的な監視の未来

その他のネットワークおよびサイバーセキュリティの開発も、複雑さが指数関数的に増加するにつれて、より高度な監視の必要性を強調しています。もともと独立してエアギャップのある産業用ネットワークは、エンタープライズシステムと相互接続されており、ハイブリッド環境を形成し、1つのネットワーク問題が生産ラインとビジネスアプリケーションの両方に影響を及ぼす可能性があります。また、OT環境でのAIの使用が増えています。

産業用IoTセンサー、エッジゲートウェイ、OTデバイスは、標準的なITプロトコルとともに通信します。これらの多様なシステムで問題が発生すると、管理者は、各システムを個別のシロに扱うのではなく、エコシステム全体の関係を理解できる監視が必要になります。警戒性は、生産ラインを停止させ、機器を損傷させ、安全上の危険をもたらす可能性があるため、交渉できないものです。実際、計画外のダウンタイムは、フォーチュン・グローバル500社の年間収益の11%のコストとなり、知能的な監視のコストは、手動でのトラブルシューティングと生産性の低下の費用よりもはるかに低いことを強調しています。

一方、サイバーセキュリティの反対側のハッカーは、技術を使用して大規模な攻撃をしかけています。無料または低コストの生成的なAI大規模言語モデル(LLM)を使用して、攻撃を生成および変更できます。時間の経過とともに、悪意のある行為者は、AIをゲームチェンジャーとして見なすことが明らかです。今日、7人中10人が、テクノロジーとそのツールがハッキングを強化することを信じていることがわかります。これは、2023年の2人中10人から増加した数字です。

今日の異常検出アルゴリズムは、数十年前に確立された数学と統計に基づいています。このテクノロジーは機能しますが、AIとLLMをメトリック監視に適用することは、ゲームチェンジャーです。時系列ベースのLLMの最初のものが市場に出てきており、2年以内に異常検出を変革することが予想されます。これらの新しいモデルの中には、優れた精度と進歩を示すものがあります。

選択は、ITと運用チームがエコシステムをどのように最適に監視し、脅威に対抗するかです。良いニュースは、自動的な異常検出と基準監視が、学習、適応、最適化を可能にし、さらに効果的な容量計画とリソース最適化を可能にすることで、資産をよりよく保護できることです。基本的なアップ/ダウンチェックはまだ価値がありますが、1つの問題がIT、OT、IoTシステム全体に波及する場合、基盤の上に知的コンテキストが必要です。インフラストラクチャの防御者は、視野を拡大することで、機会に応えることができます。ables more effective capacity planning and resource optimization. Basic up/down checks are still valuable but – when a single issue can cascade across IT, OT, and IoT systems – we need intelligent context on top of that foundation. Infrastructure defenders can meet the moment by scaling up their visibility accordingly.

ヨナ・コウォールは、パエスラーの製品およびデザイン担当シニア・バイス・プレジデントです。20年以上の実務者およびマネージャーとしての経験を持つヨナは、インフラストラクチャ、運用、セキュリティ、およびパフォーマンス・エンジニアリングに焦点を当てています。パエスラーでは、ヨナは、PRTGの予測的および予防的AI機能および自動最適化機能の導入を担当しています。