ソートリーダー
稼働時間から体験へ:AI主導の現代オブザーバビリティの変革

2001年、IBMは自律ITマニフェストを書いた。自律コンピューティングのビジョンは自己最適化、自己修復、自己構成、自己保護の4つの柱に自己管理を分解した。私はIBMがこのITビジョンを提示したときMicrosoftにいた。私たちは自律データセンターなどの技術アイデアを提案したが、結局それは時代を先取りしすぎた夢であり、実現する実用的な方法はなかった。
Microsoft在籍時、私はClippyのチームにいた。アニメーションのクリップアシスタントは悪名高く侵入的だったが、その背後にある考え方は正しかった:コンピュータは人間の仕事を積極的に支援すべきだ。計算能力とAIが不足していただけだ。25年後、ようやく実現した。
サービスレベルから体験レベルへ
オブザーバビリティの概念はITから生まれたわけではない。1960年、ハンガリー系米国人エンジニアで数学者のRudolf E. Kálmánは造語した「observability」という用語で、システムが出力によってどれだけ測定可能かを表した。その後、2013年にTwitterは用語を採用した一連のブログ投稿で、従来の監視は商用オフ・ザ・シェルフツールに依存しており、マイクロサービス規模のアーキテクチャには適さないと実質的に述べた。
医師が患者を診察するように考えてみよう。脈拍を測り、血圧を取り、他の外部的特徴を観察して患者の内部状態を間接的に評価する。ITでも同様に行う必要がある。患者の脈拍に揺らぎがあれば、腎臓に問題があるのか肝臓に問題があるのかを知る必要がある。Twitterが20年前に扱っていた規模と複雑さ(同社はリアルタイムツイートとフィードで1億ユーザーにサービスを提供していた)では、オブザーバビリティには異なるツールと監視アプローチが必要だった。
今日のシステムはさらに大規模かつ複雑化し、コンテンツ配信ネットワーク、キャッシュ、ビットマップ、フォント、JavaScriptファイルなど、世界中に依存している。実際のアプリケーションのパフォーマンスを正確に把握するのは容易ではない。
ITが午前4時にページングされると、誰かがベッドから起きて、問題がハードドライブの不良セクタによるものか、インフラに侵入し混乱を引き起こす悪意あるアクターによるものかを判断しなければならない。どちらであっても結局のところ、彼らの仕事はすべてのシステムを稼働させ続けることだ。幸い、今日ではアプリケーションの健全性を評価するために、すべてのテレメトリを取り込める:すべてのネットワークデバイス、すべてのアプリケーション、数千の標準統合、JIRAやAtlassianを通じたチケットフロー、その他多数のシグナル。
ここでExperience Level Objectives(XLO)という概念が登場する。Service Level Agreements(SLAs)やService Level Objectives(SLOs)はよく聞くが、XLOは顧客や従業員が求める体験レベルを測定する次のステップだ。これは稼働時間だけでなく品質に関するものだ。技術的観点から、XLOを実現する唯一の方法は、NICからエンドユーザーデバイスまでの可視性を確保することだ。
昨年10月、AWS US‑EAST‑1はダウンした。CatchpointはAmazonが公に認める16分前に問題を検知した。その可視性を持つ顧客は、ユーザーが障害の影響を感じる前に対応できた。
オブザーバビリティの約束は、スモーキー・ベアのようなものだ:火事になる前に煙がある場所を検知する。正しく実施すれば、オブザーバビリティはカリフォルニアのパリセーズが倒壊するような大火災になる前に、草原の炎を消し止めることができる。スモーキーは、AWSの問題であれ、Oracleの問題であれ、GCPの問題であれ、Microsoft Azureの問題であれ、インフラの異常であれ、どこからでも出る小さな煙を検知できる早期警戒システムだ。
AIがセキュリティシステムを拡大
人間のオペレーターが今日のインフラシステムをすべて把握することは不可能だ。ペタバイト規模のログデータと1日あたり数兆件のメトリクスを取り込んでシステムを大規模に監視する唯一の方法はAIを利用することだ。
たとえば、ディスクの読み書き性能やネットワーク環境内の入出力やパケットバッファのオーバーランを追跡したいとする。動的しきい値を使用して「正常」な状態を定義したり、過去1週間、1か月、1年、あるいは任意の期間の時系列データを決定論的に分析して正常性能のしきい値を設定できる。この統計分析ができれば、平均から2標準偏差の範囲をレベルとして設定でき、その範囲外の事象が発生したときに性能が異常である可能性を警告として受け取れる。
しかし、極めて複雑なシステムは1日あたり数千件のアラートを受け取ることがある。ダッシュボードが点滅し、人々がページングされ始める。これらすべてのアラートを精査するのは人間の時間の有効活用とは言えない。実際、Vectraは推定すると、組織は1日平均2,992件のセキュリティアラートを受け取り、そのうち63%が未処理のままである。
AI ツールは、1日あたり何千件ものアラートをわずか数十件に削減できます。あるケースでは、1 台のサーバーの 1 枚の NIC の単一の問題が、下流で 2,000 件のアラートを引き起こしたことを覚えています。AI のおかげで、クライアントはアラートの相関を行い、はるかに迅速な根本原因分析を実施できました。その結果、特定の時点での 1 つの問題が、会社全体のダッシュボードを赤くしていたことが判明しました。
AI が IT を再びワクワクさせる
2023 年に Cisco が Splunk を買収した後、しばらく休暇を取りました。その後の 2 年間で、友人や元同僚が、5 年前には不可能だった方法で AI を活用する企業を立ち上げる様子を見てきました。(ChatGPT を人間の子どもに例えるなら、3 歳児に相当することを覚えておいてください)。
IT チームは、アラームが鳴る前に煙を検知する支援が必要であり、見るだけのダッシュボードを増やすことは求めていません。彼らは。ある意味、これは IBM、Twitter、そして Clippy を持つ Microsoft までが取り組んできた問題と同じです。
これが私が再び参入することにした理由です。技術はついに、可観測性と自律的な IT という当初の約束を実現できる段階に到達しました。












