Tankeledare
Bortom up/down: Det finns ett bättre sätt att definiera ‘normalt’ i komplex infrastruktur

Vi har kommit långt från up/down-övervakning. Från fabriksgolv till modern företagsinfrastruktur kräver IT-administratörer nu betydligt mer information än en enkel kontroll för att avgöra om en webbplats eller applikation kan betjäna användare. Visst, det är hjälpsamt att se en grundläggande “up” eller “down”-status, men detta berättar inte hela historien om hur tekniken levererar det förväntade affärsvärdet. Dessutom, när IT- och OT-miljöer konvergerar och ekosystem blir mer dynamiska och efemära, etablerar dessa larm inte korrekt baslinjer eller reflekterar förändringar.
Att förstå vad som är normalt, lära sig prestandamönster och förhindra dyra driftstopp är viktiga funktioner i dagens komplexa infrastruktur. Detta är särskilt sant när hotaktörer använder alltmer sofistikerade verktyg för att göra mer med mindre och moderna sammanlänkade infrastrukturer skapar nya sårbarheter.
I detta landskap transformerar AI-driven övervakning infrastrukturförvaltning genom att erbjuda insikt i vad som är och inte är normalt beteende, och därmed eliminera dåliga baslinjer och larmtrötthet. Låt oss undersöka hur denna förändring från reaktiv släckning till proaktiv förebyggande markerar en nödvändig övervakningsutveckling.
Upptäckandet av det nya normala
Vad är normalt, egentligen? Detta är en fråga som infrastrukturteam som övervakar servrar, nätverksenheter, applikationer och databaser har ställt i decennier. Varför? För att definitionen av “normalt” är komplex och felbenägen över dynamiska och alltmer distribuerade miljöer med olika system att övervaka. Svaret kommer att bero på era specifika affärsmönster och teknologier. Dessutom kommer det att bero på er övervakningsteknologi och konfiguration, eftersom inställning av statiska trösklar inte upptäcker många problem. Istället ger det er en bra uppfattning om när något händer som ni förväntar er, men hjälper inte till att upptäcka problem som ni inte förväntar er, vilket leder till falska positiva larm, larmtrötthet och brister i synlighet.
Överväg en tillverkningsanläggning där trafiken plötsligt ökar klockan 14 på en tisdag. Traditionell övervakning kan utlösa ett larm eftersom det överskrider en förinställd tröskel, men är detta verkligen ett problem? Det finns inget sätt att veta utan djupare data och diagnostik. Ökningen kan indikera legitimitet i affärsaktivitet som en ny skiftschema eller ökad produktion för att möta en deadline. Alternativt kan det signalera ett allvarligt säkerhetshot, såsom dataexfiltration eller ett komprometterat system som sänder signaler till kommandocentraler.
Här förbättrar AI-driven avvikelseupptäckt intelligensen i infrastrukturövervakning. Denna nya metod analyserar kontinuerligt historiska data för att skapa intelligenta baslinjer som automatiskt anpassar sig till förändrade förhållanden. Detta tillvägagångssätt möjliggör mer proaktiv larmning som ger extra tid för IT-administratörer och DevOps-team att ingripa och mildra problemet innan det får stora konsekvenser.
Övervakning av nätverkstrafik är ett bra exempel på detta i praktiken. Infrastrukturövervakningssystem samlar in olika signaler, inklusive loggar och mått. En logg är en händelse genererad av ett system, medan ett mått är en mätning. Över tiden samlas dessa mått in och representeras som en tidsserie, liknande temperaturen som mäts under dagen. Data som samlas in för att övervaka nätverksförhållanden inkluderar mått som inkommande och utgående sändningspaket, antalet förkastningar och fel, och total nätverkstrafik. Om något avviker från normal prestanda kan intelligent övervakning se till att rätt larm utlöses och falska positiva undviks.
Som ett resultat kan infrastrukturteam fokusera på att leverera affärsnytta istället för att ständigt finjustera larminställningar och släcka bränder som kanske inte existerar.
Undvikande av larmduplikation
Dubbel övervakning kan införa ytterligare utmaningar genom att skapa fler larm. Övervakning kan bli överbelastad över tiden när team lägger till spårning för nya projekt eller skapar ytterligare övervakning under felsökning eller testning. Innan länge kan det som en gång var en ren och enkel övervakningsinställning förvandlas till en överbelastad labyrint av falska eller redundanta larm som skymmer snarare än belyser problem.
Till exempel kan IT-team ibland få larm för hög CPU-användning, långsamma applikationssvarstider och nätverkskonflikter från samma överbelastade server. Utan att förstå korrelationen kan teamen undersöka tre separata problem istället för den underliggande orsaken.
Modern AI-teknik, när den kombineras med övervakning, transformerar detta problem genom automatisk upptäckt av liknande övervakningskonfigurationer. Genom att använda tekniker som fuzzy matematik och heuristik analyserar detta tillvägagångssätt beteendemönster och avslöjar korrelationer mellan liknande övervakning för att avslöja dolda samband.
Detta är viktigt av två huvudsakliga skäl. Först minskar det larmbruset. Istället för att få tre separata larm för ett problem får teamet ett enda larm med en tydlig förståelse för vad som kräver uppmärksamhet och varför. För det andra eliminerar det redundant övervakning. Detta hjälper till att skapa en mer hanterbar inställning som strömlinjeformar instrumentpaneler och minskar den kognitiva belastningen.
Framtiden för intelligent övervakning
Andra nätverks- och cybersäkerhetsutveckling stödjer också fallet för ökad övervakning när komplexiteten fortsätter att växa exponentiellt. Vad som en gång var separata, luftgapade industriella nätverk är nu sammanlänkade med företagssystem, vilket skapar hybridmiljöer där ett nätverksproblem kan påverka både produktionslinjer och affärsapplikationer. Och vi ser denna konvergens över den moderna stacken.
Industriella IoT-sensorer, edge-gatewayer och OT-enheter kommunicerar nu bredvid standard-IT-protokoll. När dessa olika system upplever problem kräver administratörer övervakning som kan förstå relationer över ekosystemet snarare än att behandla var och en som en separat silo. Vigilans är ovillkorlig eftersom en lyckad attack kan stoppa produktionslinjer, skada dyra utrustningar och utgöra säkerhetsrisker. I själva verket oplanerad driftstopp kostar nu Fortune Global 500-företag 11% av deras årliga intäkter, vilket understryker att kostnaden för intelligent övervakning är betydligt mindre än kostnaden för manuell felsökning och förlorad produktivitet.
Samtidigt finns det ingen möjlighet att undvika att hackare på den andra sidan av cybersäkerhetsleden använder denna teknik som en produktivitetsgenombrott för att attackera i stor skala. Fria eller billiga generativa AI-stora språkmodeller (LLM) möjliggör för hackare att generera och modifiera attacker till en minimal kostnad. Och med tiden är det tydligt att illvilliga aktörer alltmer ser AI som en spelväxlare. Idag 7 av 10 tror att tekniken och dess olika verktyg förbättrar hacking, upp från bara två av 10 år 2023.
Dagens avvikelsealgoritmer baseras på matematik och statistik som har etablerats under decennier. Denna teknik fungerar, men tillkomsten och tillämpningen av AI och LLM i metric-övervakning är en spelväxlare. Vi ser några av de första tidsseriebaserade LLM som kommer till marknaden och kan förvänta oss att detta kommer att transformera avvikelseupptäckt under de närmaste två åren. Flera av dessa nya modeller visar utmärkt noggrannhet och framsteg.
Valet ligger nu hos IT- och operationslag om hur de bäst ska övervaka sina ekosystem och motverka hot. Det goda nyheten är att automatiserad avvikelseupptäckt och baslinjövervakning kan hjälpa till att bättre skydda tillgångar medan de lär, anpassar och optimerar, vilket i sin tur möjliggör mer effektiv kapacitetsplanering och resursoptimering. Grundläggande up/down-kontroller är fortfarande värdefulla, men när ett enda problem kan kaskada över IT-, OT- och IoT-system behöver vi intelligent kontext ovanpå den grundläggande nivån. Infrastrukturförsvarare kan möta utmaningen genom att skala upp sin synlighet enligt behov.












