Vordenker
Jenseits von Up/Down: Es gibt eine bessere Möglichkeit, “Normal” in komplexen Infrastrukturen zu definieren

Wir haben uns von der Überwachung von Up/Down entfernt. Von Fabrikhallen bis hin zu modernen Unternehmensinfrastrukturen benötigen IT-Administratoren jetzt wesentlich mehr Informationen als nur einen einfachen Check, um zu bestimmen, ob eine Website oder Anwendung in der Lage ist, Benutzern Dienste anzubieten. Sicherlich ist es hilfreich, einen grundlegenden “Up”- oder “Down”-Status zu sehen, aber das erzählt nicht die ganze Geschichte darüber, wie die Technologie den erwarteten Geschäftswert liefert. Darüber hinaus stellen diese Warnungen, da IT- und OT-Umgebungen konvergieren und Ökosysteme dynamischer und ephemeraler werden, keine Baselines her oder spiegeln sie nicht wider.
Das Verständnis dessen, was normal ist, das Lernen von Leistungsmustern und die Verhinderung teurer Ausfallzeiten sind wesentliche Funktionen in heute komplexen Infrastrukturen. Dies ist insbesondere wahr, da Bedrohungsakteure zunehmend sophisticatede Tools verwenden, um mehr mit weniger zu tun, und moderne vernetzte Infrastrukturen neue Verwundbarkeiten schaffen.
Es ist in diesem Umfeld, dass AI-gesteuerte Überwachung das Infrastrukturmanagement durch die Bereitstellung von Erkenntnissen darüber, was normales und was nicht normales Verhalten ist, transformiert und somit schlechte Baselines und Warnmüdigkeit eliminiert. Lassen Sie uns erkunden, wie dieser Wechsel von reaktiver Brandbekämpfung zu proaktiver Prävention eine notwendige Überwachungsevolution markiert.
Die Entdeckung des neuen Normalzustands
Was ist normal? Das ist eine Frage, die Infrastrukturteams, die Server, Netzwerkgeräte, Anwendungen und Datenbanken überwachen, seit Jahrzehnten stellen. Warum? Weil die Definition von “normal” komplex und fehleranfällig ist, insbesondere in dynamischen und zunehmend verteilten Umgebungen mit verschiedenen Systemen, die überwacht werden müssen. Die Antwort darauf hängt von Ihren spezifischen Geschäftsmodellen und Technologien ab. Darüber hinaus hängt sie von Ihrer Überwachungstechnologie und -konfiguration ab, da die Festlegung statischer Schwellenwerte viele Probleme nicht erkennt. Stattdessen gibt es Ihnen eine gute Vorstellung davon, wenn etwas passiert, das Sie erwarten, aber es hilft nicht, Probleme zu erkennen, die Sie nicht erwarten, was zu falschen Positiven, Warnmüdigkeit und Lücken in der Sichtbarkeit führt.
Ein Beispiel ist ein Fertigungsbetrieb, in dem der Datenverkehr plötzlich um 14 Uhr an einem Dienstag ansteigt. Traditionelle Überwachung würde eine Warnung auslösen, weil sie einen vordefinierten Schwellenwert überschreitet, aber ist dies tatsächlich ein Problem? Es gibt keinen Weg, dies ohne tiefergehende Daten und Diagnosen zu wissen. Der Anstieg könnte legitimes Geschäftsverhalten wie einen neuen Schichtplan oder erhöhte Produktion zur Erfüllung eines Termins anzeigen. Alternativ könnte es ein ernstes Sicherheitsrisiko signalisieren, wie Datenexfiltration oder ein kompromittiertes System, das mit Befehls- und Kontrollservern kommuniziert.
Dies ist der Punkt, an dem AI-gesteuerte Anomalie-Erkennung die Intelligenz der Infrastruktur-Überwachung erhöht. Diese neue Methode analysiert kontinuierlich historische Daten, um intelligente Baselines zu erstellen, die sich automatisch an veränderte Bedingungen anpassen. Dieser Ansatz ermöglicht proaktive Warnungen, die IT-Administratoren und DevOps-Teams mehr Zeit geben, um das Problem zu mildern, bevor es zu schwerwiegenden Auswirkungen kommt.
Die Überwachung von Netzwerkverkehr ist ein gutes Beispiel dafür. Infrastruktur-Überwachungssysteme sammeln verschiedene Signale, einschließlich Protokollen und Metriken. Ein Protokoll ist ein Ereignis, das von einem System generiert wird, während eine Metrik ein Maß ist. Im Laufe der Zeit werden diese Maße gesammelt und als Zeitreihe dargestellt, ähnlich wie die Temperatur, die während des Tages gemessen wird. Die gesammelten Daten zur Überwachung von Netzwerkbedingungen umfassen Metriken wie die Anzahl der eingehenden und ausgehenden Broadcast-Paketraten, die Anzahl der Verwerfungen und Fehler sowie den gesamten Datenverkehr. Wenn etwas im Vergleich zur regulären Leistung auffällt, kann intelligente Überwachung sicherstellen, dass die richtigen Alarme ausgelöst werden und falsche Positive vermieden werden.
Dadurch können Infrastruktur-Teams sich auf die Lieferung von Geschäftswert konzentrieren, anstatt ständig Warnparameter anzupassen und Probleme zu bekämpfen, die möglicherweise nicht existieren.
Vermeidung von Warnungsverdopplung
Die Verdopplung von Überwachung kann zusätzliche Herausforderungen mit sich bringen, indem sie mehr Warnungen erzeugt. Überwachung kann im Laufe der Zeit verstopft werden, wenn Teams neue Projekte verfolgen oder zusätzliche Überwachung während der Fehlersuche oder des Testens erstellen. Bald kann das, was einmal eine saubere und einfache Überwachungseinrichtung war, zu einem überlasteten Labyrinth von spurious oder redundanten Warnungen werden, die Probleme eher verdecken als erhellen.
Beispielsweise erhalten IT-Teams manchmal Warnungen für hohe CPU-Auslastung, langsame Anwendungsantwortzeiten und Netzwerküberlastung von demselben überlasteten Server. Ohne die Korrelation zu verstehen, könnten Teams drei separate Probleme untersuchen, anstatt die einzige Ursache.
Moderne AI-Technologien, wenn sie mit Überwachung kombiniert werden, transformieren dieses Problem erneut durch die automatische Erkennung ähnlicher Überwachungskonfigurationen. Durch die Verwendung von Techniken wie Fuzzy-Mathematik und Heuristik analysiert dieser Ansatz Verhaltensmuster und deckt Korrelationen zwischen ähnlicher Überwachung auf, um verborgene Interaktionen aufzudecken.
Dies ist wichtig aus zwei Gründen. Erstens reduziert es Warnlärm. Anstatt drei separate Warnungen für ein Problem zu erhalten, erhalten Teams eine Warnung mit einem klaren Verständnis dessen, was Aufmerksamkeit benötigt und warum. Zweitens eliminiert es redundante Überwachung. Dies hilft, eine überschaubarere Einrichtung zu erstellen, die Dashboards strafft und die kognitive Belastung reduziert.
Die Zukunft der intelligenten Überwachung
Andere Entwicklungen im Bereich Netzwerk und Cybersicherheit unterstützen den Fall für eine erhöhte Überwachung, da die Komplexität exponentiell wächst. Was einst separate, luftgekapselte industrielle Netzwerke waren, sind jetzt mit Unternehmenssystemen vernetzt und bilden hybride Umgebungen, in denen ein Netzwerkproblem sowohl Produktionslinien als auch Geschäftsanwendungen beeinträchtigen kann. Und wir sehen diese Konvergenz im modernen Stack.
Industrielle IoT-Sensoren, Edge-Gateways und OT-Geräte kommunizieren jetzt neben Standard-IT-Protokollen. Wenn diese diversen Systeme Probleme erleben, benötigen Administratoren eine Überwachung, die Beziehungen über das Ökosystem hinweg verstehen kann, anstatt jedes als separate Silo zu behandeln. Wachsamkeit ist unverhandelbar, da ein erfolgreicher Angriff Produktionslinien stoppen, teure Ausrüstung beschädigen und Sicherheitsrisiken darstellen kann. Tatsächlich kostet ungeplante Ausfallzeit Fortune-Global-500-Unternehmen 11% ihres jährlichen Umsatzes, was unterstreicht, dass die Kosten für intelligente Überwachung erheblich geringer sind als die Kosten für manuelle Fehlersuche und verlorene Produktivität.
Währenddessen gibt es keinen Ausweg daraus, dass Hacker auf der anderen Seite des Cybersicherheits-Leders diese Technologie als Produktivitätsdurchbruch verwenden, um im großen Maßstab anzugreifen. Kostenlose oder günstige generative AI-Large-Language-Modelle (LLMs) ermöglichen es Hackern, Angriffe zu generieren und zu modifizieren, ohne großen Aufwand. Und mit der Zeit ist es klar, dass schlechte Akteure zunehmend AI als Spielveränderer sehen. Heute glauben 7 von 10, dass die Technologie und ihre verschiedenen Tools das Hacken verbessern, im Vergleich zu nur zwei von 10 im Jahr 2023.
Heutige Anomalie-Erkennungsalgorithmen basieren auf Mathematik und Statistik, die seit Jahrzehnten etabliert sind. Diese Technologie funktioniert, aber die Einführung und Anwendung von AI und LLMs zur Metrik-Überwachung ist spielverändernd. Wir sehen einige der ersten Zeitreihen-basierten LLMs auf dem Markt und können erwarten, dass dies die Anomalie-Erkennung in den nächsten zwei Jahren transformiert. Einige dieser neuen Modelle zeigen hervorragende Genauigkeit und Fortschritte.
Die Wahl liegt jetzt bei IT- und Operations-Teams, wie sie ihre Ökosysteme am besten überwachen und Bedrohungen abwehren. Die gute Nachricht ist, dass automatische Anomalie-Erkennung und Baseline-Überwachung dazu beitragen können, Vermögenswerte besser zu schützen, während sie lernen, anpassen und optimieren, was wiederum eine effektivere Kapazitätsplanung und Ressourcenoptimierung ermöglicht. Grundlegende Up/Down-Checks sind immer noch wertvoll, aber – wenn ein einzelnes Problem über IT-, OT- und IoT-Systeme hinweg ausgelöst werden kann – benötigen wir intelligente Kontexte auf dieser Grundlage. Infrastruktur-Verteidiger können die Herausforderung annehmen, indem sie ihre Sichtbarkeit entsprechend skaliert.












