Лидеры мнений

За пределами простого мониторинга: лучший способ определить «нормальное» состояние в сложной инфраструктуре

mm
Добавьте Unite.AI в избранные источники в Google

Мы прошли долгий путь от простого мониторинга. От заводских полов до современной инфраструктуры предприятий, администраторы IT теперь требуют значительно больше информации, чем простая проверка, чтобы определить, может ли веб-сайт или приложение обслуживать пользователей. Конечно, полезно видеть базовый статус «включено» или «выключено», но это не рассказывает всю историю о том, как технологии обеспечивают ожидаемую бизнес-ценность. Более того, поскольку IT и OT-среды сходятся и экосистемы становятся более динамичными и эфемерными, эти оповещения не точно устанавливают или отражают базовые показатели.

Понимание того, что такое «нормальное» состояние, изучение моделей производительности и предотвращение дорогостоящего простоя являются важными функциями в современной сложной инфраструктуре. Это особенно верно, поскольку злоумышленники используют все более совершенные инструменты, чтобы сделать больше с меньшими затратами, и современная взаимосвязанная инфраструктура создает новые уязвимости.

Именно в этом ландшафте мониторинг на основе ИИ преображает управление инфраструктурой, предлагая представление о том, что является и не является нормальным поведением, тем самым устраняя плохие базовые показатели и усталость от оповещений. Давайте исследуем, как этот переход от реактивного тушения пожаров к проактивной профилактике знаменует собой необходимую эволюцию мониторинга.

Открытие нового нормального

Что такое «нормальное» состояние? Это вопрос, который команды инфраструктуры, отвечающие за серверы, сетевые устройства, приложения и базы данных, задают себе на протяжении десятилетий. Почему? Потому что определение «нормального» состояния сложно и подвержено ошибкам в динамичных и все более распределенных средах с разнообразными системами для мониторинга. Ответ будет зависеть от ваших конкретных бизнес-паттернов и технологий. Кроме того, он будет зависеть от вашей технологии мониторинга и конфигурации, поскольку установка статических порогов не обнаруживает многие проблемы. Вместо этого это даст вам хорошее представление, когда происходит что-то, что вы ожидаете, но не поможет обнаружить проблемы, которые вы не ожидаете, что приводит к ложным положительным результатам, усталости от оповещений и пробелам в видимости.

Рассмотрим производственный цех, где трафик внезапно увеличивается в 14:00 во вторник. Традиционный мониторинг может сработать, поскольку он превышает предварительно установленный порог, но является ли это действительно проблемой? Нет способа узнать это без более глубоких данных и диагностических средств. Этот скачок может указывать на законную бизнес-активность, например, новый график смен или увеличение производства для выполнения сроков. Альтернативно, это может сигнализировать о серьезной угрозе безопасности, такой как экспiltrация данных или скомпрометированная система, сигнализирующая на командные серверы.

Именно здесь обнаружение аномалий на основе ИИ повышает интеллект мониторинга инфраструктуры. Этот появляющийся метод непрерывно анализирует исторические данные, чтобы создать интеллектуальные базовые показатели, которые автоматически корректируются при изменении условий. Этот подход позволяет более проактивно оповещать, что дает дополнительное время IT-администраторам и командам DevOps, чтобы вмешаться и смягчить проблему до того, как она окажет существенное влияние.

Мониторинг сетевого трафика является хорошим примером этого в действии. Системы мониторинга инфраструктуры собирают различные сигналы, включая журналы и метрики. Журнал – это событие, сгенерированное системой, а метрика – это мера. Со временем эти меры собираются и представляются как временной ряд, аналогичный измерению температуры в течение дня. Данные, собранные для мониторинга сетевых условий, включают метрики, такие как входящие и исходящие скорости пакетов, количество отбрасываний и ошибок, а также общую пропускную способность трафика. Если что-то не так по сравнению с обычной производительностью, интеллектуальный мониторинг может обеспечить, чтобы правильные сигналы тревоги были подняты и ложные положительные результаты были избегнуты.

В результате команды инфраструктуры могут сосредоточиться на обеспечении бизнес-ценности, вместо того, чтобы постоянно настраивать параметры оповещений и тушить проблемы, которые могут не существовать.

Избежание дублирования оповещений

Дублирование мониторинга может ввести дополнительные проблемы, создавая больше оповещений. Мониторинг может стать загроможденным со временем, поскольку команды добавляют отслеживание для новых проектов или создают дополнительный мониторинг при устранении неполадок или тестировании. Прежде чем вы это осознаете, то, что казалось чистым и простым мониторингом, может превратиться в перегруженную лабиринт спurious или избыточных оповещений, которые затеняют, а не освещают проблемы.

Например, IT-команды иногда получают оповещения о высокой загрузке ЦП, медленном времени ответа приложений и сетевой загрузке с одного и того же перегруженного сервера. Без понимания корреляции команды могут расследовать три отдельные проблемы вместо одной коренной причины.

Современные технологии ИИ, когда они сочетаются с мониторингом, снова преображают эту проблему через автоматическое обнаружение подобных конфигураций мониторинга. Используя методы, такие какuzzy математика и эвристика, этот подход анализирует поведенческие модели и раскрывает корреляции между подобным мониторингом, чтобы раскрыть скрытые взаимосвязи.

Это важно по двум основным причинам. Во-первых, это снижает шум оповещений. Вместо получения трех отдельных оповещений от одной проблемы команды получают одно оповещение с четким пониманием того, что требует внимания и почему. Во-вторых, это устраняет избыточный мониторинг. Это помогает создать более управляемую настройку, которая упрощает панели управления и снижает когнитивную нагрузку.

Будущее интеллектуального мониторинга

Другие сети и разработки в области кибербезопасности также подтверждают необходимость увеличения мониторинга, поскольку сложность продолжает расти экспоненциально. То, что когда-то были отдельными, воздушными промышленными сетями, теперь взаимосвязаны с корпоративными системами, создавая гибридные среды, где одна проблема сети может повлиять как на производственные линии, так и на бизнес-приложения. И мы наблюдаем это сходимость во всем современном стеке.

Промышленные IoT-сенсоры, шлюзы края и OT-устройства теперь общаются наряду с стандартными IT-протоколами. Когда эти разнообразные системы испытывают проблемы, администраторы требуют мониторинга, который может понять отношения на протяжении всей экосистемы, а не относиться к каждой как к отдельному сегменту. Бдительность не обсуждается, поскольку успешное нарушение может остановить производственные линии, повредить дорогое оборудование и представлять опасность для безопасности. На самом деле, не запланированный простой теперь стоит компаниям Fortune Global 500 11% их годового дохода, подчеркивая, что стоимость интеллектуального мониторинга значительно меньше, чем стоимость ручного устранения неполадок и потерянной производительности.

Между тем, нет逃ения от того, что хакеры на другой стороне ледгера кибербезопасности используют эту технологию как прорыв продуктивности, чтобы атаковать в масштабе. Бесплатные или недорогие генеративные модели ИИ (LLM) позволяют хакерам генерировать и изменять атаки при минимальных затратах. И со временем ясно, что злоумышленники все больше считают ИИ прорывом. Сегодня 7 из 10 считают, что технология и ее различные инструменты повышают взлом, по сравнению с только двумя из 10 в 2023 году.

Сегодня алгоритмы обнаружения аномалий основаны на математике и статистике, которые были хорошо установлены на протяжении десятилетий. Эта технология работает, но появление и применение ИИ и LLM к мониторингу метрик является прорывом. Мы наблюдаем некоторые из первых временных рядов на основе LLM, которые выходят на рынок, и можем ожидать, что это преобразует обнаружение аномалий в течение следующих двух лет. Некоторые из этих новых моделей показывают отличную точность и достижения.

Выбор теперь лежит с IT- и операционными командами на то, как лучше всего контролировать свои экосистемы и противостоять угрозам. Хорошая новость заключается в том, что автоматическое обнаружение аномалий и базовое мониторинг могут помочь лучше защитить активы, обучаясь, адаптируясь и оптимизируясь, что, в свою очередь, позволяет более эффективно планировать емкость и оптимизировать ресурсы. Базовые проверки включения/выключения все еще ценны, но – когда одна проблема может повлиять на IT-, OT- и IoT-системы – нам нужно интеллектуальный контекст поверх этой основы. Защитники инфраструктуры могут встретить момент, увеличивая свою видимость соответственно.

Иона Коволл является старшим вице-президентом по продукту и дизайну в Paessler. С более чем 20-летним опытом как практика и менеджера в стартапах и крупных предприятиях, Иона фокусируется на инфраструктуре и операциях, безопасности и инженерии производительности. В Paessler Иона курирует введение предсказательных и проактивных функций ИИ PRTG и автоматических возможностей оптимизации.