Myslitelé

Mimo jednoduchého monitorování: Existuje lepší způsob, jak definovat „normální“ stav v komplexní infrastruktuře

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Přišli jsme daleko od jednoduchého monitorování, zda je něco aktivní nebo ne. Od výrobních hal až po moderní podnikovou infrastrukturu nyní vyžadují IT správci mnohem více informací než jen jednoduchou kontrolu, zda je webová stránka nebo aplikace schopna sloužit uživatelům. Samozřejmě, že je užitečné vidět základní „aktivní“ nebo „neaktivní“ stav, ale to nevypráví celou historii o tom, jak technologie dodává očekávanou obchodní hodnotu. Kromě toho, jak se IT a OT prostředí sbližují a ekosystémy se stávají více dynamickými a efemérními, tyto výstrahy neprecizují ani odrážejí základní hodnoty.

Pochopení toho, co je normální, učení se výkonovým vzorcům a prevence nákladných prostojů jsou životně důležité funkce v dnešní komplexní infrastruktuře. To je zvláště pravdivé, protože útočníci používají stále sofistikovanější nástroje, aby dosáhli více s menším úsilím, a moderní propojená infrastruktura vytváří nové zranitelnosti.

Je to v tomto prostředí, kde monitorování poháněné umělou inteligencí transformuje správu infrastruktury tím, že nabízí přehled o tom, co je a co není normální chování, a tím eliminuje špatné základní hodnoty a únavu z výstrah. Pojďme prozkoumat, jak tento posun od reaktivního hašení požárů k proaktivní prevenci představuje nutnou evoluci monitorování.

Objevování nového normálu

Co je vlastně normální? Toto je otázka, kterou týmy infrastruktury, které dohlížejí na servery, síťová zařízení, aplikace a databáze, kladou už desetiletí. Proč? Protože definice „normálu“ je komplexní a náchylná k chybám napříč dynamickými a stále více distribuovanými prostředími s různými systémy, které je třeba monitorovat. Najít odpověď bude záviset na vašich specifických obchodních vzorcích a technologiích. Kromě toho bude záviset na vaší technologii a konfiguraci monitorování, protože nastavení statických práhů nechytnou mnoho problémů. Místo toho vám to dá dobrý přehled, kdy se něco děje, co očekáváte, ale nepomůže chytit problémy, které neočekáváte, což vede k falešným pozitivům, únavě z výstrah a mezerám ve viditelnosti.

Připomeňme si výrobní závod, kde se náhle zvýší provoz v 14:00 v úterý. Tradiční monitorování by mohlo spustit výstrahu, protože překročí předem stanovený práh, ale je to skutečně problém? Bez hlubších dat a diagnostiky nelze říci. Zvýšení mohlo signalizovat legitimní obchodní aktivitu, jako je nový rozvrh směn nebo zvýšená produkce na splnění termínu. Na druhou stranu to mohlo signalizovat vážnou bezpečnostní hrozbu, jako je únik dat nebo ohrožený systém, který komunikuje se servery pro řízení a kontrolu.

Toto je místo, kde anomální detekce poháněná umělou inteligencí zvyšuje inteligenci monitorování infrastruktury. Tento vznikající metodický přístup nepřetržitě analyzuje historická data, aby vytvořil inteligentní základní hodnoty, které se automaticky přizpůsobují měnícím se podmínkám. Tento přístup umožňuje proaktivnější výstrahy, které poskytují více času pro IT správce a týmy DevOps, aby zasáhli a zmírnili problém, než dojde k vážným dopadům.

Monitorování síťového provozu je dobrým příkladem toho, jak toto funguje. Systémy monitorování infrastruktury shromažďují různé signály, včetně protokolů a metrik. Protokol je událost generovaná systémem, zatímco metrika je měření. Časem se tato měření shromažďují a představují se jako časová řada, podobně jako měření teploty po celý den. Data shromážděná pro monitorování síťových podmínek zahrnují metriky, jako jsou příchozí a odchozí broadcast pakety, počet odstraněných a chybných paketů a celkový síťový výkon. Pokud je něco neobvyklé ve srovnání s obvyklým výkonem, inteligentní monitorování může zajistit, aby se spustily správné výstrahy a falešné pozitivy se eliminovaly.

Jako výsledek mohou týmy infrastruktury soustředit se na poskytování obchodní hodnoty místo neustálého jemného ladění nastavení výstrah a hašení problémů, které možná neexistují.

Vyhnout se duplikaci výstrah

Dvojnásobné monitorování může zavést další výzvy vytvořením více výstrah. Monitorování se může stát zahuštěným, protože týmy přidávají sledování nových projektů nebo vytvářejí další monitorování při řešení problémů nebo testování. Brzy se to, co vypadalo jako čisté a jednoduché monitorovací nastavení, může změnit v přetížený labyrint falešných nebo redundantních výstrah, které spíše zakrývají než osvětlují problémy.

Například IT týmy někdy dostávají výstrahy pro vysoké využití procesoru, pomalé reakce aplikací a síťové kongesce ze stejného přetíženého serveru. Bez pochopení korelace by týmy mohly vyšetřovat tři samostatné problémy místo jediné základní příčiny.

Moderní technologie umělé inteligence, když jsou spojeny s monitorováním, opět transformují tuto problematiku automatickou detekcí podobných monitorovacích konfigurací. Používáním technik, jako je fuzzy matematika a heuristika, tento přístup analyzuje behaviorální vzorce a odhaluje korelace mezi podobným monitorováním, aby odhalil skryté vzájemné souvislosti.

To má význam z dvou hlavních důvodů. První, snižuje hluk výstrah. Místo tří samostatných výstrah pro jeden problém dostávají týmy jednu výstrahu s jasným pochopením toho, co vyžaduje pozornost a proč. Druhý, eliminuje redundantní monitorování. To pomáhá vytvořit více spravovatelné nastavení, které streamuje panely a snižuje kognitivní zátěž.

Budoucnost inteligentního monitorování

Další rozvoj sítí a kybernetické bezpečnosti také podporuje případ pro zvýšené monitorování, protože komplexita pokračuje v exponenciálním růstu. Co byly dříve samostatné, vzduchově izolované průmyslové sítě, jsou nyní propojeny s podnikovými systémy, vytvářející hybridní prostředí, kde jeden problém sítě může ovlivnit jak výrobní linky, tak podnikové aplikace. A vidíme tuto konvergenci napříč moderním stackem.

Průmyslové IoT senzory, edge brány a OT zařízení nyní komunikují spolu se standardními IT protokoly. Když tyto různé systémy zažívají problémy, správci vyžadují monitorování, které může pochopit vztahy napříč ekosystémem, spíše než zacházet s každým jako s samostatným silem. Ostražitost je nezbytná, protože úspěšný útok může zastavit výrobní linky, poškodit drahá zařízení a představovat bezpečnostní rizika. Ve skutečnosti neočekávané odstávky nyní stojí společnosti Fortune Global 500 11 % jejich ročního příjmu, což zdůrazňuje, že náklady na inteligentní monitorování jsou podstatně nižší než náklady na manuální řešení problémů a ztracenou produktivitu.

Zatímco na druhé straně kybernetické bezpečnosti útočníci využívají tuto technologii jako průlom v produktivitě, aby zaútočili v měřítku. Volné nebo levné generativní modely umělé inteligence (LLM) umožňují útočníkům generovat a modifikovat útoky za minimální náklady. A s časem je zřejmé, že špatní aktéři stále více považují umělou inteligenci za herní změnu. Dnes 7 z 10 věří, že tato technologie a její různé nástroje zvyšují útoky, oproti pouze dvěma z 10 v roce 2023.

Dnešní algoritmy anomální detekce jsou založeny na matematice a statistice, které jsou dobře etablovány po desetiletí. Tato technologie funguje, ale příchod a aplikace umělé inteligence a LLM do monitorování metrik je herní změnou. Vidíme některé z prvních časových řad založených na LLM, které přicházejí na trh, a můžeme očekávat, že to transformuje anomální detekci v průběhu následujících dvou let. Několik z těchto nových modelů ukazuje excelente přesnost a pokroky.

Volba nyní leží u IT a operačních týmů, aby rozhodli, jak nejlépe dohlížet na své ekosystémy a čelit hrozbám. Dobrou zprávou je, že automatizovaná anomální detekce a monitorování bazálních hodnot mohou pomoci lépe chránit aktiva, zatímco se učí, přizpůsobují a optimalizují, což umožňuje efektivnější kapacitní plánování a optimalizaci zdrojů. Základní kontroly aktivního/neaktivního stavu jsou stále cenné, ale – když jeden problém může mít kaskádový efekt napříč systémy IT, OT a IoT – potřebujeme inteligentní kontext nad touto základnou. Obránci infrastruktury mohou využít tento okamžik, pokud zvýší svou viditelnost odpovídajícím způsobem.

Jonah Kowall je Senior Vice President of Product and Design ve společnosti Paessler. S více než 20 lety zkušeností jako praktik a manažer v startupů a velkých podniků se Jonah zaměřuje na infrastrukturu a operace, bezpečnost a výkonové inženýrství. Ve společnosti Paessler Jonah dohlíží na zavedení prediktivních a proaktivních funkcí AI PRTG a automatizovaných optimalizačních schopností.