Tankeledere
Ud over op/ned: Der er en bedre måde at definere ‘normalt’ i kompleks infrastruktur

Vi er kommet langt fra op/ned-overvågning. Fra fabriksgulve til moderne virksomhedsinfrastruktur, kræver IT-administratoren nu betydelig mere information end en simpel check for at bestemme, om en hjemmeside eller en applikation kan servicere brugere. Selvfølgelig er det nyttigt at se en grundlæggende “op” eller “ned”-status, men dette fortæller ikke hele historien om, hvordan teknologien leverer den forventede forretningsværdi. Desuden, da IT- og OT-miljøer konvergerer og økosystemer bliver mere dynamiske og efemère, etablerer disse alerts ikke nøjagtigt baselines eller reflekterer ændringer.
At forstå, hvad der er normalt, at lære performancesmønstre og at forebygge dyrt downtime er væsentlige funktioner i dagens komplekse infrastruktur. Dette er særligt sandt, da truslerne bruger stadig mere avancerede værktøjer til at gøre mere med mindre, og moderne sammenkoblede infrastrukturer skaber nye sårbarheder.
Det er i dette landskab, at AI-drevet overvågning transformerer infrastrukturledelse ved at give indsigt i, hvad der er, og hvad der ikke er normalt adfærd, og dermed eliminerer dårlige baselines og alert træthed. Lad os udforske, hvordan denne skift fra reaktiv brandbekæmpelse til proaktiv forebyggelse markerer en nødvendig overvågningsudvikling.
At opdage det nye normale
Hvad er normalt, så? Dette er et spørgsmål, som infrastrukturhold, der overvåger servere, netværksenheder, applikationer og databaser, har stillet i årtier. Hvorfor? Fordi at definere ‘normalt’ er komplekst og fejlbehæftet over dynamiske og stadig mere distribuerede miljøer med forskellige systemer at overvåge. At finde svaret vil afhænge af jeres specifikke forretningsmønstre og teknologier. Desuden vil det afhænge af jeres overvågnings-teknologi og konfiguration, fordi faste grænseværdier ikke fanger mange problemer. I stedet vil det give jer en god idé om, når noget sker, som I forventer, men hjælper ikke med at fange problemer, I ikke forventer, hvilket fører til falske positiver, alert træthed og huller i synlighed.
Overvej en produktionsfacilitet, hvor trafikken pludselig stiger klokken 14 på en tirsdag. Traditionel overvågning kan udløse en alert, fordi den overskrider en forudindstillet grænseværdi, men er dette virkelig et problem? Der er ingen måde at vide det på uden dybere data og diagnostik. Stigningen kan indikere legitime forretningsaktiviteter som en ny skema eller øget produktion for at møde en deadline. Alternativt kan det signalere en alvorlig sikkerheds trussel, såsom dataeksfiltration eller et kompromitteret system, der sender signaler til kommando- og kontrolservere.
Dette er, hvor AI-drevet afvigelsesdetektion forbedrer intelligensen i infrastruktur-overvågning. Denne opdyrkende metode analyserer kontinuerligt historiske data for at skabe intelligente baselines, der automatisk tilpasser sig ændringer. Denne tilgang tillader en mere proaktiv alarmering, der giver ekstra tid til IT-administratoren og DevOps-hold til at gribe ind og afhjælpe problemet, før det har stor indvirkning.
Overvågning af netværkstrafik er et godt eksempel på dette i praksis. Infrastruktur-overvågnings-systemer indsamler forskellige signaler, herunder logs og metrics. En log er en begivenhed, der er genereret af et system, mens en metric er en måling. Over tid indsamles og repræsenteres disse målinger som en tidsrække, ligesom temperaturen måles hele dagen. Data, der indsamles til at overvåge netværksforhold, omfatter metrics som indgående og udgående broadcast-pakke-rater, antallet af discard og fejl, og total trafik-gennemstrømning. Hvis noget er forkert i forhold til normal præstation, kan intelligent overvågning sikre, at de rette alarmsignaler udløses, og falske positiver undgås.
Som resultat kan infrastrukturhold fokusere på at levere forretningsværdi i stedet for at være konstant beskæftiget med at justere alert-indstillinger og bekæmpe problemer, der måske ikke eksisterer.
At undgå alert-duplikation
At doble overvågning kan introducere yderligere udfordringer ved at skabe flere alerts. Overvågning kan blive overbelastet over tid, da hold tilføjer sporing for nye projekter eller skaber yderligere overvågning under fejlfinding eller test. Før længe kan det, der så ud som en ren og simpel overvågningsopsætning, forvandle sig til en overbelastet labyrint af spurious eller redundant alerts, der skjuler snarere end oplyser problemer.
For eksempel modtager IT-hold ofte alerts for høj CPU-brug, langsom applikationsrespons og netværkskongestion fra den samme overbelastede server. Uden at forstå korrelationen kan holdene måske undersøge tre separate problemer i stedet for den enkelte rodårsag.
Moderna AI-teknologier, når de kombineres med overvågning, transformerer igen dette problem gennem automatisk detektion af lignende overvågningskonfigurationer. Ved at anvende teknikker som fuzzy matematik og heuristikker analyserer denne tilgang adfærds-mønstre og afslører korrelationer mellem lignende overvågning for at afsløre skjulte sammenhænge.
Dette er vigtigt af to grundlæggende årsager. Først reducerer det alert-støj. I stedet for at modtage tre separate alerts for ét problem, modtager holdet en enkelt alert med en klar forståelse af, hvad der kræver opmærksomhed, og hvorfor. Anden, det eliminerer redundant overvågning. Dette hjælper med at skabe en mere håndterbar opsætning, der strømliner dashboards og reducerer den kognitive belastning.
Fremtiden for intelligent overvågning
Andre netværks- og cybersikkerhedsudviklinger støtter også tilfældet for øget overvågning, da kompleksiteten fortsætter med at vokse eksponentielt. Hvad der engang var separate, luft-lukkede industrielle netværk er nu sammenkoblede med virksomheds-systemer, hvilket skaber hybride miljøer, hvor ét netværksproblem kan påvirke både produktionslinjer og forretningsapplikationer. Og vi ser denne konvergens på tværs af den moderne stak.
Industrielle IoT-sensorer, edge-gateways og OT-enheder kommunikerer nu sammen med standard IT-protokoller. Når disse forskellige systemer oplever problemer, kræver administratorer overvågning, der kan forstå forhold på tværs af økosystemet i stedet for at behandle hver som en separat silo. Vigilans er uafviselig, da en succesfuld brud kan standse produktionslinjer, beskadige dyre udstyr og udgøre sikkerhedsrisici. Faktisk koster uventet downtime Fortune Global 500-virksomheder 11% af deres årlige omsætning, hvilket understreger, at omkostningerne ved intelligent overvågning er betydeligt lavere end omkostningerne ved manuel fejlfinding og tabt produktivitet.
Mens der ikke er muligt at undgå, at hackere på den anden side af cybersikkerheds-regnskabet bruger denne teknologi som en produktivitets-gennembrud for at angribe i stor skala. Frie eller billige generative AI-store sprogmodeller (LLM’er) giver hackere mulighed for at generere og modificere angreb til en minimal omkostning. Og med tiden er det klart, at dårlige aktører stadig mere ser AI som en spilforvandler. I dag 7 ud af 10 mener, at teknologien og dens værktøjer forbedrer hacking, op fra kun to ud af 10 i 2023.
I dag er anomaly-detektionsalgoritmerne baseret på matematik og statistik, der har været etableret i årtier. Denne teknologi fungerer, men introduktionen og anvendelsen af AI og LLM’er til metric-overvågning er spil-forvandlende. Vi ser nogle af de første tidsserie-baserede LLM’er komme på markedet og kan forvente, at dette vil transformere anomaly-detektion over de næste to år. Flere af disse nye modeller viser fremragende nøjagtighed og fremskridt.
Valget ligger nu hos IT- og operationsholdene om, hvordan de bedst kan overvåge deres økosystemer og imødegå trusler. Det gode nyheder er, at automatiseret anomaly-detektion og baseline-overvågning kan hjælpe med at bedre beskytte aktiver, mens de lærer, tilpasser sig og optimerer, hvilket igen <ables mere effektiv kapacitetsplanlægning og ressourceoptimering. Grundlæggende op/ned-kontroller er stadig værdifulde, men – når ét problem kan kaskade på tværs af IT-, OT- og IoT-systemer – har vi brug for intelligent kontekst oven på den grundlæggende basis. Infrastruktur-forsvarere kan møde øjeblikket ved at skale op deres synlighed derefter.












