AI 기초
IT 운영(ITOps)이란 무엇인가?
IT operations (ITOps)는 조직이 의존하는 기술 서비스를 운영하는 작업입니다. 여기에는 컴퓨팅, 네트워크, 아이덴티티, 엔드포인트, 클라우드 플랫폼, 데이터베이스, 스토리지, 백업 및 이러한 구성 요소를 가용하고, 안전하며, 지원 가능하도록 유지하는 운영 프로세스가 포함됩니다.
현대 ITOps는 대시보드를 감시하는 네트워크 운영 센터에 국한되지 않습니다. 팀은 점점 더 소프트웨어 정의 인프라, 플랫폼 서비스, 자동화 및 분산된 소유권을 관리하면서 사고, 용량, 연속성 및 서비스 수준에 대한 책임을 유지합니다.
핵심 요점
- ITOps는 온프레미스, 클라우드 및 엣지 환경 전반에 걸쳐 서비스와 그 종속성을 관리합니다.
- 관측성, 구성 및 인벤토리는 장애를 해석하는 데 필요한 컨텍스트를 제공합니다.
- 사고 관리가 서비스를 복구하고, 문제 관리는 재발하거나 체계적인 원인을 해결합니다.
- ITOps는 ITSM, SRE, DevOps, SecOps 및 AIOps와 겹치지만 이들 중 어느 하나와도 동일하지 않습니다.

서비스, 자산 및 구성
운영은 어떤 서비스가 존재하고, 누가 소유하며, 어떤 사용자가 의존하고, 어떤 인프라가 이를 지원하는지를 아는 것에서 시작됩니다. 자산 인벤토리는 구성 요소를 기록하고, 구성 관리는 관련 관계와 제어된 상태를 기록합니다.
한 번도 조정되지 않은 인벤토리는 오히려 오해를 불러일으킵니다. 유용한 경우 자동으로 탐색하고, 권위 있는 소스를 식별하며, 모든 종속성 지도가 완전하다고 가장하지 말고 신뢰도 또는 최신성을 기록하십시오.
관측성 및 서비스 목표
메트릭은 동작을 정량화하고, 로그는 이벤트를 기록하며, 트레이스는 서비스 간 작업 흐름을 추적합니다. 합성 검사는 사용자 여정을 테스트할 수 있습니다. 유용한 관측성은 질문과 서비스 목표에서 시작하고, 이를 답하기 위해 필요한 신호를 수집합니다.
알림은 시기적절한 조치가 필요한 상황을 식별해야 합니다. 사용자 영향을 고려하지 않은 임계값은 잡음을 만들고, 종속성 컨텍스트가 없으면 진단이 지연됩니다. AIOps는 상관관계 분석을 도울 수 있지만, 신뢰할 수 있는 텔레메트리와 운영 피드백이 필요합니다.
사고, 문제 및 변경 관리
사고 관리는 탐지, 분류, 완화, 커뮤니케이션 및 복구를 조정합니다. 명확한 역할은 압박 상황에서 혼란을 줄여줍니다. 임시 우회 조치를 통해 서비스를 복구하고, 이후 문제 조사에서 근본 원인을 파악할 수 있습니다.
변경 관리는 모든 변경을 대기열에 넣지 않고 위험을 평가하고 기록합니다. 표준화되고 자동화된 저위험 변경은 사전 승인된 경로를 따를 수 있으며, 고위험 변경은 더 강력한 증거, 일정 및 롤백 준비가 필요합니다.
용량, 복원력 및 연속성
팀은 자원 수요를 예측하고, 병목을 제거하며, 부하 하에서 동작을 테스트합니다. 백업은 복구 테스트가 이루어질 때만 유용합니다. 중복성은 장애 유형이 독립적이고 장애 조치가 실제로 작동할 때만 도움이 됩니다.
비즈니스 연속성은 우선순위, 복구 시간 및 허용 가능한 데이터 손실을 정의합니다. 아이덴티티, DNS, 클라우드 제어 평면 및 공급업체에 대한 의존성도 연습에 포함시켜야 하며, 단순히 이용 가능하다고 가정해서는 안 됩니다.
ITOps, ITSM, SRE 및 DevOps
IT 서비스 관리(ITSM)는 서비스와 조직 요구를 맞추는 프로세스를 제공합니다. 사이트 신뢰성 엔지니어링(SRE)은 운영에 소프트웨어 엔지니어링을 적용하고 서비스 수준 목표와 오류 예산을 사용합니다. DevOps는 개발과 운영 피드백을 연결합니다.
SecOps는 위협과 대응에 초점을 맞추는 반면, ITOps는 보다 넓은 서비스 건강을 유지합니다. 조직도는 다르지만, 중요한 요구 사항은 명시적인 소유권과 이러한 분야 간의 공유 증거입니다.
The ITOps operating model
IT 운영은 조직의 기술 서비스를 가용하고, 성능이 뛰어나며, 안전하고, 복구 가능하도록 유지합니다. 범위에는 일반적으로 엔드포인트, 아이덴티티, 네트워크, 서버, 클라우드, 스토리지, 협업, 데이터베이스, 모니터링, 서비스 데스크, 백업 및 공급업체 서비스가 포함됩니다. 현대 ITOps는 자체 인프라와 관리형 플랫폼을 모두 포괄하므로, 운영이 외주화되더라도 책임은 명확히 해야 합니다. 구성 또는 서비스 인벤토리는 기술 구성 요소를 소유자, 사용자, 종속성, 데이터 분류 및 비즈니스 중요도와 연결합니다.
서비스 관리는 사고, 요청, 문제, 변경, 자산, 지식 및 서비스 수준을 조직합니다. 사고 관리는 서비스를 복구하고, 문제 관리는 재발 원인을 조사하며, 변경 활성화는 위험을 평가하고 조정합니다. 모든 변경을 느린 승인 절차에 맡기면 우회가 발생하고, 관리되지 않은 자동화는 통제되지 않은 실패를 초래합니다. 표준 저위험 변경은 사전 승인 및 자동화가 가능하고, 고위험 변경은 증거, 커뮤니케이션, 롤백 및 영향 기반 일정이 필요합니다.
Reliability, capacity, and continuity
모니터링은 장치 수만이 아니라 사용자에게 노출되는 서비스와 종속성을 따라야 합니다. 가용성, 지연, 용량, 최신성 및 지원 목표를 비즈니스 소유자와 정의하십시오. 실행 가능한 증상과 오류 예산 소비에 대해 알림을 설정하고, 이벤트에 소유권 및 최근 변경 정보를 추가하십시오. 용량 계획 모델은 수요, 포화, 라이선스 및 리드 타임을 고려합니다. 클라우드 탄력성은 프로비저닝 지연을 줄이지만 할당량, 지역 제한 또는 비용 제어를 없애지는 못합니다.
비즈니스 연속성은 테스트된 백업, 복구, 아이덴티티 복구, 네트워크 대체 경로, 공급업체 연락처 및 수동 절차를 요구합니다. 서비스별 복구 시간 목표(RTO)와 복구 시점 목표(RPO)를 정의하십시오. 백업은 복구 및 검증이 이루어질 때까지 복구 증거가 아닙니다. 랜섬웨어, 지역 손실, 인증서 만료, 아이덴티티 중단 및 공급업체 실패 시나리오를 연습하십시오. 가능한 경우 구성 및 인프라를 코드로 관리해 복구가 재현 가능하도록 하십시오.
Security, automation, and metrics
최소 권한 원칙, 패치 및 취약점 관리, 엔드포인트 제어, 네트워크 분리, 로깅 및 사고 대응을 사용하십시오. 반복 작업은 멱등성, 제한, 승인 및 감사를 통해 자동화합니다. 서비스 가용성, 사고 재발, 요청 이행, 변경 실패, 복구, 패치 노출, 용량, 비용 및 사용자 만족도를 측정하고, 티켓 종료만으로는 평가하지 마십시오. ITOps는 기술이 예측 가능하게 작업을 지원하고 실패에서 복구할 수 있을 때 성공적이라고 평가됩니다.
Worked example: recovering a collaboration service
한 기업은 협업 플랫폼에 대해 4시간 복구 시간 목표와 1시간 복구 시점 목표를 정의합니다. 아이덴티티, DNS, 네트워크, 데이터, 키, 구성, 통합 및 공급업체 종속성을 인벤토리합니다. 복구 연습에서는 기본 지역과 관리자 계정이 사용할 수 없다고 가정합니다. 운영자는 독립적으로 보호된 비상 아이덴티티를 활성화하고, 서비스 구성을 복원한 뒤 격리된 지역에 데이터를 복구하며, 권한, 메시지, 통합 및 클라이언트 접근을 검증합니다. 비즈니스 소유자는 인프라 상태 확인만이 아니라 현실적인 사용자 여정을 통해 복구된 서비스를 검증합니다.
연습은 실제 데이터 손실량, 경과 시간, 수동 단계, 실패한 연락처 및 숨겨진 종속성을 기록합니다. 파일은 복구하지만 암호화 키나 아이덴티티 정책이 복구되지 않은 백업은 미완료로 표시됩니다. 교정 조치는 소유자와 날짜를 명시하고, 실행 매뉴얼은 업데이트 및 재테스트됩니다. 모니터링 및 커뮤니케이션 템플릿도 포함됩니다. 조직은 백업 작업 성공이 아니라 복구 증거를 측정하여, 신뢰할 수 있는 ITOps는 현실적인 장애 상황에서 사용자가 필요로 하는 서비스를 복구해야 함을 인식합니다.
Implementation evidence and operational readiness
프로덕션 결정을 내리려면 성공적인 시연만으로는 부족합니다. 의도된 사용자, 운영 환경, 입력, 출력, 종속성, 소유자 및 각 주요 실패에 대한 결과를 정의하십시오. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 구축합니다. 일반적인 경우, 경계 조건, 잘못된 또는 누락된 입력, 분포 변화, 종속성 중단, 오용 및 가장 취약할 가능성이 높은 그룹이나 환경을 테스트합니다. 작업 품질을 보정 또는 불확실성, 지연, 처리량, 자원 비용, 접근성, 프라이버시 및 보안과 함께 측정합니다. 모든 변환 및 임계값을 기록해 독립적인 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있도록 합니다.
출시 전에는 릴리스, 예외, 변경, 롤백 및 폐기에 대한 권한을 할당합니다. 단계적 롤아웃을 사용하고 안전한 폴백을 유지하며, 고의로 주입한 장애를 통해 모니터링을 검증합니다. 운영 텔레메트리는 입력 품질, 출력 동작, 모델 또는 규칙 버전, 종속성 상태, 인간 개입 및 확인된 결과를 보여주어야 하며, 불필요한 민감 데이터는 수집하지 않아야 합니다. 알림 임계값과 대응 책임자를 정의하고, 배포 후 실제 증거를 검토하며, 오프라인 성능이 지속될 것이라고 가정하지 마십시오. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어 또는 목표가 변경될 때마다 재평가하십시오. 유지 관리되는 시스템은 문서화된 복구, 사고 학습, 삭제 및 보존 절차와 함께, 비활성화 또는 교체 시점을 명확히 정의해야 합니다.
Frequently asked questions
What is the primary goal of ITOps?
합의된 보안, 성능, 연속성 및 비용 제약 내에서 신뢰할 수 있는 기술 서비스를 제공하고 복구하는 것입니다.
Is cloud infrastructure operated entirely by the cloud provider?
아니요. 공급자는 기본 플랫폼의 일부만 운영하며, 고객은 구성, 아이덴티티, 데이터, 워크로드, 모니터링 및 많은 서비스 수준 결정에 대한 책임을 집니다.












