ソートリーダー

自動化を超えて:AIがIT運用で変えていること

mm
Unite.AI を Google の優先ソースに追加

監視におけるノイズの削減

我々が大きな改善を実感した領域の一つは監視です。

大規模な技術環境では膨大な数のアラートが生成されますが、すべてが同じレベルの注意を必要とするわけではありません。重複したアラートや一時的な異常、低優先度のイベントは不要なノイズを生み出し、チームが実際の運用影響を持つ問題を特定しにくくなります。

監視環境にAI駆動の異常検出とノイズ抑制を組み込むことで、監視ノイズを75%削減することに成功しました。

チームにとっては、不要なアラート処理に費やす時間が減り、注意が必要な問題の調査により多くの時間を割けるようになります。また、異常なパターンを早期に特定でき、エンジニアがインシデント調査を開始する際により有用な情報が提供されます。

AIが特に有用な領域は、大量の情報を迅速に処理できる点です。しかし、一度異常が検出されても、原因や潜在的な影響を理解するには、環境に詳しい担当者が必要になることが多いです。

日常的なIT運用の改善

我々はAI対応のリモート監視・管理(RMM)プラットフォームを活用し、日常的なエンドポイント作業を自動化しています。

これには、パッチのオーケストレーション、ヘルスチェック、スクリプトによる修復、リモートトラブルシューティングなどが含まれます。

以前は、パッチ適合率が常に50%未満で、主に手作業の負荷と環境規模が原因でした。AI支援のRMMフレームワークを導入した結果、適合率は現在95パーセンタイルに達しています。

この改善によりエンドポイントの安定性が強化され、既知の脆弱性への曝露を減らす、と同時に、エンジニアが手作業で管理する繰り返し作業の量も削減できました。

自動化が理にかなう好例です。プロセスは予測可能で、常に一貫して実行され、数千のエンドポイントにわたって機能しなければなりません。

この技術は多くの作業をバックグラウンドで管理でき、チームは例外対応やエスカレーション、より深い調査が必要な課題に注力できます。

人が依然として差を生む場面

すべてのIT課題が予測可能なパターンに従うわけではありません。

我々のチームは、さまざまなインフラ環境、ネットワーク、システム、クライアント要件を横断して作業しています。最初は単純に見える課題でも、複数の依存関係が絡んだり、異なるチーム間の調整が必要になることがあります。

AIは異常の特定や情報の分析、潜在的な原因の提示に役立ちますが、チームは依然として広範な環境で何が起きているかを理解する必要があります。

この点は、課題が複数のシステムに影響を及ぼす場合や、技術的に明白な解決策が他の場所で副作用をもたらす可能性がある場合に特に重要です。

ここで経験が重要になります。

環境を熟知したエンジニアは、個々のアラートを超えて、何が変化したか、どのシステムが接続されているか、類似の問題が過去に起きたか、特定の行動が全体の運用に与える影響を考慮できます。

我々にとって、AIはエンジニアにより良い情報を提供し、プロセスから完全に排除しようとするのではなく、補助的に機能する時に最も効果的です。

高需要環境への支援

環境の規模が大きいため、単に手作業を増やすだけでなく、キャパシティを拡大する方法を見つける必要があります。

自動化がこれに貢献しています。

日常的なエンドポイント作業はバックグラウンドで一貫して実行できます。監視ツールはエンジニアに届く前にシグナルをフィルタリングし統合できます。予測機能は潜在的な問題を早期に特定するのに役立ち、自動修復は手動での介入を待たずに既知の問題に対処できます。

これにより、チームはサービス継続性、エスカレーション、より複雑な技術課題に注力できる余裕が生まれます。

また、IT運用における生産性の考え方も変わります。メリットは単にタスクが速く完了することだけでなく、エンジニアが経験を活かしてより大きなインパクトを与えられる作業に割く時間が増えることです。

ガバナンスは依然として重要

AIと自動化が高度化するにつれ、ガバナンスの重要性はますます高まります。

どの活動を自動化できるか、エンジニアが介入すべきタイミング、そして自動化プロセスが期待通りに動作しなかった場合の責任者を明確にする必要があります。

これは特に大規模な技術環境で重要です。数千のエンドポイントに適用される自動化アクションは、個々のマシンに対する操作よりもはるかに広範な影響を及ぼす可能性があります。

そのため、明確なエスカレーションパス、定義されたアクセスレベル、そして自動化された活動に対する適切な制御が依然として必要です。

このアプローチは、National Institute of Standards and TechnologyのAIリスク管理フレームワークと一致しており、継続的なAIシステムの監視、明確に定義された責任と人間による監視・介入のプロセスを重視しています。

私たちにとって、ガバナンスはAIの利用を遅らせることではなく、実稼働環境で自信を持って責任ある形で使用できることを確保することです。

ITエンジニアの役割は進化しています

日常的な作業がますます自動化されるにつれて、エンジニアの役割も変化しています。

技術的知識は依然として重要ですが、情報を解釈し、依存関係を理解し、明確な答えのない問題を調査できることの価値が高まっています。

エンジニアは自分が使用しているツールを理解する必要もあります。AI対応システムがある行動を推奨した場合、責任者はその推奨が妥当かどうか判断できるだけの環境知識を持っている必要があります。

これにより、トレーニングはAI導入の重要な要素となります。

私たちのチームは、テクノロジーが何ができるか、その制限はどこにあるか、そして何かをエスカレーションしたり別の方法で調査する必要がある時期を理解する必要があります。

NISTも同様に、AIシステムを運用・監督する人々の責任を明確に定義し、適切なトレーニングと熟練度基準を併せて推奨しています。

これまでに学んだこと

これまでの経験から、IT運用におけるAIの最も有用な活用例のいくつかは、比較的実用的であることが分かっています。

監視ノイズの75%削減は、エンジニアが不要なアラート処理に費やす時間が減少することを意味します。パッチ適合率を 50%未満から第95パーセンタイルへ 引き上げることで、エンドポイント管理の一貫性が強化されました。10,000台以上のエンドポイントにわたる自動化は、そうでなければ大量の反復的な手作業が必要となる環境の管理を支援しています。

同時に、IT運用のより複雑な部分は依然として人間に大きく依存しています。

テクノロジーは異常なパターンを特定したり、既知の修正を自動化したりできます。経験豊富なエンジニアは、より広範な環境、関係する依存関係、そして意思決定の潜在的な影響を理解しています。

AIが日常のIT運用の一部になるにつれて、そのバランスはますます重要になっています。

私にとって、AIの価値は非常に実用的です。スケール管理を支援し、チームにより良い可視性を提供し、重要な課題から時間を奪うような反復作業の一部を削減してくれます。

テクノロジーはますます高度になっていますが、環境を管理する人々の経験も同様に重要です。

Marvin Odhiambo Ondong は CCI の IT オペレーション部門長であり、同社の複数国にわたるインフラストラクチャ、サイバーセキュリティ、コールセンターテクノロジーの運用、そして地域全体のサービス提供を統括しています。10 年以上のリーダーシップ経験を活かし、大規模なデジタルトランスフォーメーションイニシアチブを先導し、主要なグローバルブランドを支えるレジリエントな IT アーキテクチャを構築してきました。