Tankeledere
Ut over/ner: Det finnes en bedre måte å definere ‘normalt’ i kompleks infrastruktur

Vi har kommet langt fra over/ner-overvåking. Fra fabrikksgulv til moderne bedriftsinfrastruktur, trenger IT-administratorer nå betydelig mer informasjon enn en enkel sjekk for å bestemme om en nettsted eller en applikasjon kan betjene brukere. Selvfølgelig er det nyttig å se en grunnleggende “opp” eller “ned” status, men dette forteller ikke hele historien om hvordan teknologien leverer den forventede forretningsverdien. Videre, ettersom IT- og OT-miljøer konvergerer og økosystemer blir mer dynamiske og efemère, reflekterer disse varslingene ikke nøyaktig baselinjer eller endringer.
Å forstå hva som er normalt, å lære om ytelsesmønster og å forebygge dyrekostbar nedtid er avgjørende funksjoner i dagens komplekse infrastruktur. Dette er spesielt sant ettersom trusler bruker stadig mer avanserte verktøy for å gjøre mer med mindre, og moderne sammenkoblede infrastruktur skaper nye sårbarheter.
I dette landskapet transformerer AI-drevet overvåking infrastrukturhåndtering ved å gi innsikt i hva som er og hva ikke er normalt atferd, og eliminerer dermed dårlige baselinjer og varslingsutmattelse. La oss utforske hvordan denne skiftet fra reaktiv brannslukking til proaktiv forebygging markerer en nødvendig overvåkingsutvikling.
Oppdagelse av det nye normale
Hva er normalt, egentlig? Dette er et spørsmål som infrastrukturteamene som overvåker servere, nettverksenheter, applikasjoner og databaser har stilt i årevis. Hvorfor? Fordi å definere ‘normalt’ er komplekst og feilfølsomt over dynamiske og stadig mer distribuerte miljøer med mangfoldige systemer å overvåke. Svaret vil avhenge av dine spesifikke forretningsmønster og teknologier. I tillegg vil det avhenge av din overvåkingsteknologi og konfigurasjon, fordi å sette statiske terskler ikke fanger mange problemer. Isteden vil det gi deg en god idé om når noe skjer som du forventer, men hjelper ikke å fange problemer du ikke forventer, noe som fører til feilpositive, varslingsutmattelse og hull i synlighet.
Overveur en produksjonsanlegg hvor trafikken plutselig øker klokken 14.00 på en tirsdag. Tradisjonell overvåking kan utløse en varsel fordi den overstiger en forhåndsinnstilt terskel, men er dette virkelig et problem? Det finnes ingen måte å vite uten dypere data og diagnostikk. Økningen kan indikere legitime forretningsaktiviteter som en ny skiftplan eller økt produksjon for å møte en frist. Alternativt kan det signalisere en alvorlig sikkerhetstrussel, som dataeksfiltrering eller et kompromittert system som sender signaler til kommandosentrale servere.
Dette er hvor AI-drevet anomalioppsporing forbedrer intelligensen i infrastruktur-overvåking. Denne nye metoden analyserer kontinuerlig historiske data for å skape intelligente baselinjer som automatisk justerer seg etter endrede forhold. Denne tilnærmingen tillater mer proaktiv varslingsutløsning som gir ekstra tid for IT-administratorer og DevOps-team å gripe inn og mildne problemet før det får store konsekvenser.
Overvåking av nettverkstrafikk er et godt eksempel på dette i praksis. Infrastruktur-overvåkingssystemer samler inn ulike signaler, inkludert logger og målinger. En logg er en hendelse generert av et system, mens en måling er en måling. Over tid samles disse målingene inn og presenteres som en tidsrekke, lik temperaturmålinger gjennom dagen. Dataene som samles inn for å overvåke nettverksforhold inkluderer målinger som innkommende og utgående broadcast-pakkehastigheter, antall kast og feil, og total trafikk-gjennomstrømming. Hvis noe er feil i forhold til vanlig ytelse, kan intelligent overvåking sikre at riktige varsler utløses og feilpositive unngås.
Som resultat kan infrastrukturteamene fokusere på å levere forretningsverdi i stedet for å stadig finjustere varslingsinnstillinger og slukke problemer som kanskje ikke eksisterer.
Unngå varslingsduplisering
Å doble overvåking kan introdusere ekstra utfordringer ved å skape flere varsler. Overvåking kan bli overbelastet over tid ettersom teamene legger til sporing for nye prosjekter eller skaper ekstra overvåking under feilsøking eller testing. Før lenge kan det som en gang var et rent og enkelt overvåkingssystem bli et overbelastet labyrint av spuriøse eller redundante varsler som skjuler problemer i stedet for å avsløre dem.
For eksempel kan IT-team motta varsler for høy CPU-bruk, langsom applikasjonsrespons og nettverkskongestjon fra samme overbelastede server. Uten å forstå korrelasjonen, kan teamene undersøke tre separate problemer i stedet for en enkelt rotårsak.
Moderne AI-teknologier, når de kombineres med overvåking, transformerer igjen dette problemet gjennom automatisk oppdaging av lignende overvåkingskonfigurasjoner. Ved å bruke teknikker som fuzzy-matematikk og heuristikk, analyserer denne tilnærmingen atferdsmønster og avdekker korrelasjoner mellom lignende overvåking for å avsløre skjulte sammenhenger.
Dette er viktig av to hovedgrunner. Først reducerer det varslingsstøy. I stedet for å motta tre separate varsler for ett problem, mottar teamene ett varsel med en tydelig forståelse av hva som trengs oppmerksomhet og hvorfor. For det andre eliminerer det redundante overvåking. Dette hjelper til å skape en mer håndterbar konfigurasjon som strømlinjeformer dashboards og reduserer den kognitive belastningen.
Fremtiden for intelligent overvåking
Andre nettverks- og sikkerhetsutviklinger støtter også opp om behovet for økt overvåking ettersom kompleksiteten fortsetter å vokse eksponentielt. Det som en gang var separate, luftgappede industrielle nettverk er nå sammenkoblede med bedriftssystemer, og skaper hybrid-miljøer hvor ett nettverksproblem kan påvirke både produksjonslinjer og forretningsapplikasjoner. Og vi ser denne konvergeringen over hele den moderne stakken.
Industrielle IoT-sensorer, edge-gateways og OT-enhetene kommuniserer nå sammen med standard IT-protokoller. Når disse diverse systemene opplever problemer, trenger administratorer overvåking som kan forstå relasjoner over hele økosystemet i stedet for å behandle hver enkelt som en separat silo. Vigilans er ikke forhandelbar, ettersom en vellykket brudd kan stoppe produksjonslinjer, skade dyre utstyr og utgjøre sikkerhetsrisiko. I virkeligheten koster uventet nedtid Fortune Global 500-selskaper 11% av deres årlige omsetning, og understreker at kostnadene ved intelligent overvåking er betydelig lavere enn utgiftene til manuell feilsøking og tapt produktivitet.
I mellomtiden er det ingen måte å unngå at hackere på den andre siden av sikkerhetsregnskapet bruker denne teknologien som en produktivitetsgjennombrudd for å angripe i stor skala. Frie eller billig generative AI-store språkmodeller (LLM-er) gjør det mulig for hackere å generere og modifisere angrep til en minimal kostnad. Og med tid er det tydelig at dårlige aktører stadig mer ser på AI som en spillendrer. I dag 7 av 10 mener at teknologien og dens ulike verktøy forbedrer hacking, opp fra bare to av 10 i 2023.
I dag er anomalioppsporingsalgoritmene basert på matematikk og statistikk som har vært etablert i årevis. Denne teknologien fungerer, men introduksjonen og anvendelsen av AI og LLM-er til metrisk overvåking er spillendrende. Vi ser noen av de første tidsrekke-baserte LLM-ene komme på markedet, og kan forvente at dette vil transformere anomalioppsporing over de neste to årene. Flere av disse nye modellene viser utmerket nøyaktighet og fremgang.
Valget ligger nå hos IT- og operasjonsteamene om hvordan de best kan overvåke sine økosystemer og motstå trusler. Det gode nyhetene er at automatisert anomalioppsporing og baselinjeovervåking kan hjelpe til å bedre beskytte eiendeler samtidig som de lærer, tilpasser og optimaliserer, noe som igjen muliggjør mer effektiv kapasitetsplanlegging og ressursoptimalisering. Grunnleggende opp/ned-sjekker er fortsatt verdifulle, men – når ett enkelt problem kan påvirke IT-, OT- og IoT-systemer – trenger vi intelligent kontekst på toppen av denne grunnleggende funksjonen. Infrastruktur-forsvarere kan møte øyeblikket ved å skalerer opp sin synlighet i henhold til.












