Liderzy opinii
Poza prostym monitorowaniem: Istnieje lepszy sposób definiowania „normalności” w złożonej infrastrukturze

Przebyliśmy długą drogę od prostego monitorowania dostępności. Od hal produkcyjnych po nowoczesną infrastrukturę przedsiębiorstw, administratorzy IT wymagają znacznie więcej informacji niż tylko proste sprawdzenie, czy witryna lub aplikacja są w stanie obsłużyć użytkowników. Oczywiście, jest pomocne zobaczyć podstawowy status „dostępny” lub „niedostępny”, ale to nie mówi całej historii o tym, jak technologia dostarcza oczekiwaną wartość biznesową. Ponadto, gdy środowiska IT i OT się zbiegają, a ekosystemy stają się bardziej dynamiczne i efemeryczne, te alerty nie ustalają ani nie odzwierciedlają prawidłowo bazowych wartości.
Zrozumienie, co jest normalne, nauka wzorców wydajności i zapobieganie kosztownym przestojom są niezwykle ważnymi funkcjami we współczesnej złożonej infrastrukturze. Jest to szczególnie prawdziwe, gdy aktorzy zagrożeń wykorzystują coraz bardziej zaawansowane narzędzia, aby osiągnąć więcej z mniejszymi środkami, a nowoczesna, połączona infrastruktura tworzy nowe słabości.
To właśnie w tym krajobrazie monitorowanie oparte na sztucznej inteligencji przekształca zarządzanie infrastrukturą, oferując wgląd w to, co jest i co nie jest normalnym zachowaniem, eliminując w ten sposób słabe bazy i zmęczenie alarmami. Przejdźmy do tego, jak ten przejście od reaktywnego gaszenia pożarów do proaktywnej prewencji oznacza niezbędną ewolucję monitorowania.
Odkrywanie nowej normalności
Co jest normalne? To pytanie, które zespoły infrastruktury nadzorujące serwery, urządzenia sieciowe, aplikacje i bazy danych zadają od dziesięcioleci. Dlaczego? Ponieważ definiowanie „normalności” jest skomplikowane i podatne na błędy w dynamicznych i coraz bardziej rozproszonych środowiskach z różnorodnymi systemami do monitorowania. Znalezienie odpowiedzi będzie zależało od Twoich konkretnych wzorców biznesowych i technologii. Dodatkowo, będzie zależało od Twojej technologii monitorowania i konfiguracji, ponieważ ustawianie statycznych progów nie wyłapuje wielu problemów. Zamiast tego, da Ci to dobrą wizję, kiedy coś się dzieje, czego oczekujesz, ale nie pomoże wyłapać problemów, których nie oczekujesz, prowadząc do fałszywych pozytywów, zmęczenia alarmami i luk w widoczności.
Wyobraź sobie fabrykę, w której ruch sieciowy nagle wzrasta o 14:00 w wtorek. Tradycyjne monitorowanie może wyzwolić alert, ponieważ przekracza ustawiony próg, ale czy to naprawdę problem? Nie ma sposobu, aby to wiedzieć bez głębszych danych i diagnostyki. Wzrost może wskazywać na uzasadnioną działalność biznesową, taką jak nowy harmonogram zmiany lub zwiększoną produkcję w celu spełnienia terminu. Alternatywnie, może sygnalizować poważne zagrożenie bezpieczeństwa, takie jak wykradzenie danych lub naruszenie systemu, który wysyła sygnały do serwerów dowodzenia i kontroli.
To właśnie tutaj wykrywanie anomalii oparte na sztucznej inteligencji zwiększa inteligencję monitorowania infrastruktury. Ta nowa metoda nieustannie analizuje historyczne dane, aby utworzyć inteligentne bazy, które automatycznie dostosowują się do zmieniających się warunków. Ten podejście pozwala na bardziej proaktywne alarmowanie, które daje dodatkowy czas administratorom IT i zespołom DevOps, aby interweniować i złagodzić problem, zanim nastąpią poważne skutki.
Monitorowanie ruchu sieciowego jest dobrym przykładem tego w praktyce. Systemy monitorowania infrastruktury zbierają różne sygnały, w tym logi i dane pomiarowe. Log to zdarzenie wygenerowane przez system, a pomiar to miara. Z czasem te pomiary są zbierane i reprezentowane jako seria czasowa, podobna do temperatury mierzonej przez cały dzień. Dane zebrane do monitorowania stanu sieci obejmują pomiary, takie jak szybkość pakietów wejściowych i wyjściowych, liczba odrzuceń i błędów oraz całkowity przepływ ruchu. Jeśli coś jest nie tak w porównaniu z regularną wydajnością, inteligentne monitorowanie może zapewnić, że odpowiednie alarmy są uruchamiane, a fałszywe pozytywy są unikane.
W efekcie zespoły infrastruktury mogą skoncentrować się na dostarczaniu wartości biznesowej zamiast ciągłego dostosowywania ustawień alertów i gaszenia problemów, które mogą nie istnieć.
Unikanie duplikowania alertów
Podwójne monitorowanie może wprowadzić dodatkowe wyzwania, tworząc więcej alertów. Monitorowanie może stać się zagmatwane z czasem, gdy zespoły dodają śledzenie nowych projektów lub tworzą dodatkowe monitorowanie podczas rozwiązywania problemów lub testowania. Przed długi czasem to, co wydawało się czystym i prostym ustawieniem monitorowania, może przerodzić się w przeładowaną sieć fałszywych lub redundantnych alertów, które zaciemniają problemy zamiast je ujawniać.
Na przykład zespoły IT czasami otrzymują alerty dotyczące wysokiego zużycia procesora, wolnych czasów odpowiedzi aplikacji i zatorów sieciowych z tego samego przeciążonego serwera. Bez zrozumienia korelacji zespoły mogą badać trzy oddzielne problemy zamiast jednej przyczyny pierwotnej.
Nowoczesne technologie sztucznej inteligencji, połączone z monitorowaniem, ponownie przekształcają ten problem poprzez automatyczne wykrywanie podobnych konfiguracji monitorowania. Wykorzystując techniki takie jak matematyka nieostrości i heurystyki, ten podejście analizuje wzorce zachowań i ujawnia korelacje między podobnym monitorowaniem, aby ujawnić ukryte powiązania.
To ma znaczenie z dwóch głównych powodów. Po pierwsze, redukuje szum alarmowy. Zamiast otrzymywać trzy oddzielne alerty z jednego problemu, zespoły otrzymują jeden alert z klarownym zrozumieniem, co wymaga uwagi i dlaczego. Po drugie, eliminuje redundantne monitorowanie. To pomaga utworzyć bardziej zarządzalne ustawienie, które upraszcza pulpity i redukuje obciążenie poznawcze.
Przyszłość inteligentnego monitorowania
Inne rozwoje sieciowe i bezpieczeństwa wspierają również przypadek zwiększonego monitorowania, gdy złożoność nadal rośnie wykładniczo. Co było kiedyś oddzielnymi, izolowanymi sieciami przemysłowymi, teraz jest połączone z systemami przedsiębiorstw, tworząc hybrydowe środowiska, w których jeden problem sieciowy może wpłynąć na zarówno linie produkcyjne, jak i aplikacje biznesowe. I widzimy tę konwergencję w całym nowoczesnym stosie.
Czujniki przemysłowe IoT, bramy krawędziowe i urządzenia OT teraz komunikują się obok standardowych protokołów IT. Gdy te różnorodne systemy doświadczają problemów, administratorzy wymagają monitorowania, które może zrozumieć relacje w całym ekosystemie, a nie traktuje każdego jako oddzielną izolowaną część. Czujność jest niezbędna, ponieważ udany atak może zatrzymać linie produkcyjne, uszkodzić drogie urządzenia i stwarzać zagrożenia bezpieczeństwa. W rzeczywistości nieplanowane przestoje teraz kosztują firmy z listy Fortune Global 500 11% ich rocznych przychodów, co podkreśla, że koszt inteligentnego monitorowania jest znacznie mniejszy niż koszt ręcznego rozwiązywania problemów i utraconej produktywności.
Tymczasem nie ma ucieczki od faktu, że hakery po drugiej stronie rejestru bezpieczeństwa wykorzystują tę technologię jako przełom produktywności, aby atakować na dużą skalę. Darmowe lub tanie generatywne modele językowe (LLM) umożliwiają hakom generowanie i modyfikowanie ataków przy minimalnych kosztach. I z czasem jest jasne, że złe aktorzy coraz bardziej widzą AI jako przełom. Dziś 7 na 10 uważa, że technologia i jej różne narzędzia zwiększają hakowanie, w porównaniu z zaledwie 2 na 10 w 2023 roku.
Algoritmy wykrywania anomalii używane dzisiaj opierają się na matematyce i statystyce, które zostały dobrze ustalone od dziesięcioleci. Ta technologia działa, ale pojawienie się i zastosowanie AI i LLM do monitorowania metryk jest przełomowe. Widzimy niektóre z pierwszych modeli opartych na szeregach czasowych LLM, które pojawiają się na rynku, i można oczekiwać, że to przekształci wykrywanie anomalii w ciągu najbliższych dwóch lat. Kilka z tych nowych modeli pokazuje doskonałą dokładność i postępy.
Wybór leży teraz po stronie zespołów IT i operacyjnych, jak najlepiej nadzorować swoje ekosystemy i przeciwdziałać zagrożeniom. Dobra wiadomość jest taka, że automatyczne wykrywanie anomalii i monitorowanie baz może pomóc lepiej chronić aktywa, ucząc się, adaptując i optymalizując, co z kolei umożliwia bardziej efektywne planowanie pojemności i optymalizację zasobów. Podstawowe sprawdzenia dostępności są nadal cenne, ale – gdy jeden problem może rozprzestrzenić się na systemy IT, OT i IoT – potrzebujemy inteligentnego kontekstu na podstawie tej bazy. Obrońcy infrastruktury mogą sprostać wymogom, zwiększając swoją widoczność odpowiednio.












