Lideri de opinie

Dincolo de monitorizarea Up/Down: Există o modalitate mai bună de a defini “normal” în infrastructura complexă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Amburgăm un drum lung de la monitorizarea Up/Down. De la sălile de fabricație la infrastructura modernă a întreprinderilor, administratorii IT au nevoie de informații semnificativ mai multe decât un simplu test pentru a determina dacă un site web sau o aplicație poate fi utilizată de utilizatori. Desigur, este util să vezi un statut “up” sau “down” de bază, dar acesta nu spune întreaga poveste a modului în care tehnologia livrează valoarea business așteptată. Mai mult, pe măsură ce mediile IT și OT se converg și ecosistemele devin mai dinamice și efemere, aceste alerte nu stabilesc sau reflectă în mod corect limitele.

Înțelegerea a ceea ce este normal, învățarea modelelor de performanță și prevenirea timpului de închidere costisitor sunt funcții vitale în infrastructura complexă de astăzi. Acest lucru este mai adevărat cu atât mai mult pe măsură ce actorii de amenințare utilizează instrumente din ce în ce mai sofisticate pentru a face mai mult cu mai puțin și infrastructura interconectată modernă creează noi vulnerabilități.

În acest peisaj, monitorizarea condusă de IA transformă managementul infrastructurii prin oferirea de informații despre ceea ce este și ceea ce nu este un comportament normal, eliminând astfel limitele slabe și oboseala de alerte. Să explorăm cum această schimbare de la stingerea incendiilor reactive la prevenirea proactivă marchează o evoluție necesară a monitorizării.

Descoperirea noului normal

Ce este normal, oricum? Aceasta este o întrebare pe care echipele de infrastructură care supraveghează servere, dispozitive de rețea, aplicații și baze de date au pus-o timp de decenii. De ce? Pentru că definirea “normalului” este complexă și predispusă la erori în medii dinamice și din ce în ce mai distribuite, cu sisteme diverse de monitorizat. Găsirea răspunsului va depinde de modelele dvs. de afaceri și tehnologii specifice. În plus, va depinde de tehnologia și configurarea dvs. de monitorizare, deoarece stabilirea pragurilor statice nu prinde multe probleme. În schimb, vă va oferi o idee bună când se întâmplă ceva pe care vă așteptați, dar nu vă va ajuta să prindeți problemele pe care nu le așteptați, ceea ce duce la alerte false, oboseală de alerte și lacune în vizibilitate.

Luăm în considerare o fabrică unde traficul brusc crește la ora 14:00, marți. Monitorizarea tradițională ar putea declanșa o alertă pentru că depășește un prag prestabilit, dar este acesta, într-adevăr, o problemă? Nu există nicio modalitate de a ști fără date și diagnostice mai profunde. Creșterea poate indica o activitate de afaceri legitimă, cum ar fi un nou program de schimburi sau o creștere a producției pentru a îndeplini un termen limită. Alternativ, ar putea semnala o amenințare gravă la adresa securității, cum ar fi exfiltrarea de date sau un sistem compromis care semnalează serverelor de comandă și control.

Acesta este locul în care detectarea anomaliilor condusă de IA îmbunătățește inteligența monitorizării infrastructurii. Această metodă emergentă analizează în mod continuu datele istorice pentru a crea limite inteligente care se ajustează automat la condiții în schimbare. Acest abordaj permite alerte proactive care oferă timp suplimentar pentru administratorii IT și echipele DevOps pentru a interveni și a atenua problema înainte de a avea impacturi majore.

Monitorizarea traficului de rețea este un exemplu bun al acestui lucru în acțiune. Sistemele de monitorizare a infrastructurii colectează diverse semnale, inclusiv jurnale și metrice. Un jurnal este un eveniment generat de un sistem, în timp ce o metrică este o măsură. În timp, aceste măsurători sunt colectate și reprezentate sub formă de serie temporală, similar cu temperatura măsurată pe parcursul zilei. Datele colectate pentru monitorizarea condițiilor de rețea includ metrice, cum ar fi rata pachetelor de difuzare intră și ieșire, numărul de abandonări și erori, și debitul total de trafic. Dacă ceva este în neregulă în comparație cu performanța regulată, monitorizarea inteligentă poate asigura declanșarea alarmelor corecte și evitarea alertelor false.

În consecință, echipele de infrastructură pot se concentra asupra livrării valorii business în loc de a se lupta în mod constant cu setările de alerte și cu stingerea problemelor care pot să nu existe.

Evitarea duplicării alertelor

Dublarea monitorizării poate introduce provocări suplimentare prin crearea de alerte suplimentare. Monitorizarea poate deveni încărcată în timp, pe măsură ce echipele adaugă urmărirea pentru noi proiecte sau creează monitorizări suplimentare în timpul depanării sau testării. În curând, ceea ce părea a fi o configurație de monitorizare curată și simplă se poate transforma într-un labirint supraîncărcat de alerte spurii sau redundante care obscurează, mai degrabă decât iluminează, problemele.

De exemplu, echipele IT primesc uneori alerte pentru utilizarea ridicată a CPU, timpul de răspuns lent al aplicației și congestia rețelei de la același server supraîncărcat. Fără a înțelege corelația, echipele ar putea investiga trei probleme separate, în loc de o singură cauză principală.

Tehnologiile moderne de IA, atunci când sunt cuplate cu monitorizarea, transformă din nou această problemă prin detectarea automată a configurațiilor de monitorizare similare. Utilizând tehnici precum matematica fuzzy și euristica, acest abordaj analizează modelele de comportament și descoperă corelații între monitorizările similare pentru a dezvălui interconexiuni ascunse.

Acest lucru contează din două motive principale. În primul rând, reduce zgomotul de alerte. În loc de a primi trei alerte separate pentru o singură problemă, echipele primesc o singură alertă cu o înțelegere clară a ceea ce necesită atenție și de ce. În al doilea rând, elimină monitorizarea redundantă. Acest lucru ajută la crearea unei configurații mai ușor de gestionat, care simplifică tablourile de bord și reduce încărcătura cognitivă.

Viitorul monitorizării inteligente

Alte evoluții în domeniul rețelelor și securității cibernetice sprijină, de asemenea, cazul pentru o monitorizare crescută, pe măsură ce complexitatea continuă să crească exponențial. Ceea ce erau odată rețele industriale separate și izolate sunt acum interconectate cu sistemele întreprinderii, creând medii hibride în care o problemă de rețea poate afecta atât liniile de producție, cât și aplicațiile de business. Și vedem această convergență în întreaga stivă modernă.

Senzorii IoT industriali, porțile de frontieră și dispozitivele OT comunică acum alături de protocoalele IT standard. Când aceste sisteme diverse experimentează probleme, administratorii necesită o monitorizare care poate înțelege relațiile de-a lungul ecosistemului, mai degrabă decât tratarea fiecăruia ca pe un siloz separat. Vigilența este nelimitată, deoarece o încălcare de securitate reușită poate opri liniile de producție, poate deteriora echipamente scumpe și poate prezenta pericole pentru siguranță. Într-adevăr, timpul de închidere neplanificat costă acum companiile din Fortune Global 500 11% din veniturile lor anuale, subliniind faptul că costul monitorizării inteligente este semnificativ mai mic decât cheltuielile cu depanarea manuală și productivitatea pierdută.

Între timp, nu există nicio scăpare de faptul că hackerii de pe partea cealaltă a înregistrării securității cibernetice utilizează această tehnologie ca o întrerupere a productivității pentru a ataca la scară. Modelele de limbaj generative gratuite sau ieftine (LLM) permit hackerilor să genereze și să modifice atacuri la un cost minim. Și, cu timpul, este clar că actorii răi văd din ce în ce mai mult IA ca pe un factor de schimbare a jocului. Astăzi, 7 din 10 cred că tehnologia și diversele sale instrumente îmbunătățesc hackingul, față de doar două din 10 în 2023.

Algoritmii de detectare a anomaliilor de astăzi se bazează pe matematică și statistică, care au fost bine stabilite de zeci de ani. Această tehnologie funcționează, dar apariția și aplicarea IA și a LLM la monitorizarea metricilor este o schimbare a jocului. Vom vedea unele dintre primele modele LLM bazate pe serii temporale care vin pe piață și putem aștepta ca acestea să transforme detectarea anomaliilor în următorii doi ani. Mai multe dintre aceste noi modele arată o acuratețe excelentă și progrese.

Alegerea se află acum în mâinile echipelor IT și de operațiuni cu privire la modul în care să supravegheze cele mai bune ecosisteme și să contracareze amenințările. Vestea bună este că detectarea automată a anomaliilor și monitorizarea bazelor poate ajuta la o protecție mai bună a activelor, învățând, adaptându-se și optimizând, ceea ce, la rândul său, permite o planificare mai eficientă a capacității și o optimizare a resurselor. Verificările de bază up/down sunt încă valoroase, dar – atunci când o singură problemă poate avea un efect de cascada asupra sistemelor IT, OT și IoT – avem nevoie de un context inteligent pe lângă această bază. Apărătorii infrastructurii pot face față momentului prin creșterea vizibilității în consecință. Acest lucru permite o planificare mai eficientă a capacității și o optimizare a resurselor. Verificările de bază up/down sunt încă valoroase, dar – atunci când o singură problemă poate avea un efect de cascada asupra sistemelor IT, OT și IoT – avem nevoie de un context inteligent pe lângă această bază. Apărătorii infrastructurii pot face față momentului prin creșterea vizibilității în consecință.

Jonah Kowall este Vicepreședintele Senior al Produsului și Designului la Paessler. Cu peste 20 de ani de experiență ca practician și manager atât în startup-uri, cât și în întreprinderi mari, Jonah se axează pe infrastructură și operațiuni, securitate și inginerie de performanță. La Paessler, Jonah supraveghează introducerea funcțiilor predictive și proactive AI ale PRTG și capacităților de optimizare automată.