사상 리더
업/다운을 넘어서: 복잡한 인프라에서 ‘정상’을 정의하는 더 나은 방법

우리는 업/다운 모니터링을 넘어서 왔습니다. 공장 바닥부터 현대적인 엔터프라이즈 인프라까지, IT 관리자는 사용자에게 서비스를 제공하는지 여부를 결정하기 위해 단순한 확인 이상의 많은 정보를 필요로 합니다. 물론, 기본적인 “업” 또는 “다운” 상태를 보는 것이 도움이 되지만, 기술이 기대하는 비즈니스 값을 제공하는 방법의 전체 이야기를 전달하지 않습니다.さらに, IT와 OT 환경이 수렴하고 생태계가 더 동적이고 일시적이 되면서 이러한 경고는 기준선을 설정하거나 반영하지 않습니다.
오늘날의 복잡한 인프라에서 정상이 무엇인지 이해하고, 성능 패턴을 학습하며, 비용이 많이 드는 다운타임을 방지하는 기능은 매우 중요합니다. 특히 위협 행위자가 점점 더 복잡한 도구를 사용하여 더 많은 것을 수행하고, 현대적인 상호 연결된 인프라가 새로운 취약성을 생성하는 경우에 더욱 중요합니다.
이러한 풍경에서 AI 기반 모니터링은 인프라 관리를 변革시키며, 정상적인 행동과 비정상적인 행동을 식별하여 나쁨 기준선과 경고 피로를 제거합니다. 이 모니터링의 변화를 어떻게 탐색하는지 살펴보겠습니다.
새로운 정상을 발견하다
정상은 무엇일까요? 이것은 서버, 네트워크 장치, 애플리케이션, 데이터베이스를 관리하는 인프라 팀이 수십 년 동안 묻고 있는 질문입니다. 왜냐하면 동적이고 점점 더 분산된 환경에서 다양한 시스템을 모니터링하는 정상을 정의하는 것이 복잡하고 오류가 발생하기 쉽기 때문입니다. 정상을 정의하는 방법은 비즈니스 패턴과 기술에 따라 다를 것입니다. 또한 모니터링 기술과 구성에 따라 다를 것입니다. 정적인 임계값을 설정하는 것은 많은 문제를 잡지 못하기 때문에, 예상치 못한 문제를 잡기 위해 더 깊은 데이터와 진단이 필요합니다.
예를 들어, 제조 공장에서 화요일 오후 2시에 트래픽이 갑자기 증가할 수 있습니다. 전통적인 모니터링은 미리 설정된 임계값을 초과하기 때문에 경고를 트리거할 수 있지만, 이것이 실제로 문제인지 알 수 없습니다. 더 깊은 데이터와 진단이 없으면, 이것이 합법적인 비즈니스 활동인지, 또는 데이터 유출 또는 시스템이 명령 및 제어 서버에 신호를 보내는 것인지 알 수 없습니다.
이것이 AI 기반 이상치 감지가 인프라 모니터링의 지능을 향상시키는 곳입니다. 이 새로운 방법은 역사적인 데이터를 지속적으로 분석하여 자동으로 조건에 따라 조정되는 지능형 기준선을 생성합니다. 이 접근 방식은 더 프로액티브한 경고를 제공하여 IT 관리자와 DevOps 팀이 문제를 해결하기 전에 더 많은 시간을 제공합니다.
네트워크 트래픽 모니터링은 이러한 예입니다. 인프라 모니터링 시스템은 로그와 메트릭스를 포함한 다양한 신호를 수집합니다. 로그는 시스템에서 생성된 이벤트이며, 메트릭스는 측정値입니다. 시간이 지남에 따라 이러한 측정값은 수집되어 시간 시리즈로 표시됩니다. 네트워크 상태를 모니터링하는 데 사용되는 데이터에는 들어오는 및 나가는 방송 패킷 속도, 버리기 및 오류 수, 총 트래픽 처리량 등이 포함됩니다. 정상적인 성능과 다를 경우, 지능형 모니터링은 올바른 경고를 발생시키고 거짓 양성 오류를 피할 수 있습니다.
이로 인해 인프라 팀은 경고 설정을 미세 조정하고 존재하지 않을 수 있는 문제를 해결하는 대신 비즈니스 값을 제공하는 데 집중할 수 있습니다.
경고 중복을 피하다
모니터링을 중복하면 추가적인 문제를 일으킬 수 있습니다. 모니터링은 새로운 프로젝트를 추적하거나 문제를 해결하거나 테스트하는 동안 추가 모니터링을 생성함으로써 시간이 지남에 따라 더 복잡해질 수 있습니다. 결국, 깨끗하고 단순한 모니터링 설정은 실제 문제를 가려서 오히려 혼란을 주는 과부하된 경고의 미로로 변할 수 있습니다.
예를 들어, IT 팀은 때때로 동일한 과부하된 서버에서 높은 CPU 사용량, 느린 응용 프로그램 응답 시간, 네트워크 혼잡에 대한 경고를 받을 수 있습니다. 상관관계를 이해하지 못하면, 팀은 하나의 근본 원인 대신 세 가지 별개의 문제를 조사할 수 있습니다.
최신 AI 기술은 모니터링과 결합하여 모니터링 구성의 자동 감지를 통해 이 문제를 변혁합니다. 퍼지 수학 및 휴리스틱과 같은 기술을 사용하여 이 접근 방식은 행동 패턴을 분석하고 유사한 모니터링 간의 상관관계를 발견하여 숨겨진 상호 연결성을 드러냅니다.
이것은 두 가지 주요 이유로 중요합니다. 첫째, 경고 노이즈를 줄입니다. 하나의 문제에서 세 개의 별개 경고를 받는 대신, 팀은 하나의 경고와 함께 필요한 사항과 이유에 대한 명확한 이해를 얻습니다. 둘째, 중복된 모니터링을 제거합니다. 이것은 더 관리하기 쉬운 설정을 만들고 대시보드를 간소화하며 인지 부하를 줄입니다.
지능형 모니터링의 미래
네트워킹 및 사이버 보안 개발도 복잡성이 지수적으로 증가함에 따라 모니터링의 필요성을 강조합니다. 한때 별개였던 공업 네트워크는现在 기업 시스템과 상호 연결되어 하이브리드 환경을 생성하여 네트워크 문제가 생산 라인과 비즈니스 애플리케이션 모두에 영향을 미칠 수 있습니다. 그리고 이러한 수렴은 현대적인 스택 전반에 걸쳐 발생합니다.
산업용 IoT 센서, 에지 게이트웨이, OT 장치는 이제 표준 IT 프로토콜과 함께 통신합니다. 이러한 다양한 시스템에서 문제가 발생하면 관리자는 각 시스템을 별개의 실로 처리하는 대신 생태계 전반에 걸쳐 관계를 이해할 수 있는 모니터링이 필요합니다. 경계는 협상할 수 없습니다. 성공적인 침입은 생산 라인을 중단시키고, 비싼 장비를 손상시키고, 안전 위험을 초래할 수 있습니다. 실제로, 계획되지 않은 다운타임은 Fortune Global 500 기업의 연간 수익의 11%를 차지하며, 지능형 모니터링의 비용이 수동 문제 해결 및 생산성 손실의 비용보다 훨씬 적다는 것을 강조합니다.
한편, 사이버 보안의 다른 쪽에 있는 해커들은 이 기술을 생산성 향상을 위한 돌파구로 사용하여 대규모로 공격하고 있습니다. 무료 또는 저렴한 생성적 AI 대형 언어 모델(LLM)은 해커가 공격을 생성하고 수정할 수 있도록 해줍니다. 그리고 시간이 지남에 따라, 악의적인 행위자는 점점 더 AI를 게임 체인저로 간주합니다. 현재, 10명 중 7명이 이 기술과 다양한 도구가 해킹을 강화한다고 믿고 있습니다. 2023년에는 10명 중 2명만이 그렇게 생각했습니다.
오늘날의 이상치 감지 알고리즘은 수십 년 동안 잘 확립된 수학 및 통계에 기반합니다. 이 기술은 작동하지만, AI 및 LLM을 메트릭 모니터링에 적용하는 것은 게임 체인저입니다. 우리는 처음으로 시계열 기반 LLM이 시장에 나오고 있으며, 이는 다음 2년 동안 이상치 감지를 변革할 것입니다. 이러한 새로운 모델 중 일부는 우수한 정확도와 발전을 보여주고 있습니다.
선택은 이제 IT 및 운영 팀에게 있습니다. 생태계를 어떻게 감독하고 위협을 어떻게 대처할지 결정해야 합니다. 좋은 소식은 자동 이상치 감지 및 기준선 모니터링이 자산을 더 잘 보호하는 데 도움이 되며, 학습, 적응, 최적화가 가능하므로 더 효과적인 용량 계획 및 리소스 최적화를 가능하게 합니다. 기본 업/다운 확인은 여전히 가치 있지만, 하나의 문제가 IT, OT, IoT 시스템에 걸쳐 확산될 수 있는 경우, 우리는 그 기초 위에 지능형 컨텍스트가 필요합니다. 인프라 방어자는 그 순간을 맞이하여 가시성을 확대할 수 있습니다.












