사상 리더
자율 에이전트는 AI 관찰 가능성보다 더 많은 것을 필요로 한다

기업이 워크플로우를 생각하고, 행동하고, 시작하는 에이전트를 사용할 때, 그것들을 모니터링하고 관리하기 위한 계획을 개발하는 것이 중요합니다.
에이전트가 비즈니스 프로세스, 인프라, 애플리케이션 및 클라이언트에 즉시 영향을 미치는 동적 시스템을 관리하는 팀은 더 이상 모델 출력만을 모니터링하지 않습니다. 그들은 에이전트가 선택하고, 워크플로우를 시작하며, 다른 에이전트 또는 시스템과 함께 작동하는 능동적인 시스템을 관리합니다.
자율 에이전트의 등장
기업용 최초의 에이전트는 프롬프트 기반 시스템이었습니다. 사용자가 질의를 제기하고, 모델이 응답하고, 교류가 끝나는 곳이었습니다. 이러한 초기 기술은 본질적으로 반응적이었지만, 검색, 조종사, 콘텐츠 생성 및 요약에 유용했습니다.
다음 물결은 다릅니다. 자율 에이전트는 반응하는 것 외에도 목표를 위해 이유를 제공하고, 도구를 선택하고, 정보를 추출하고, 행동을 취하고, 워크플로우를 시작합니다. 때때로 다른 에이전트 또는 시스템과 함께 작동하고, 점점 더 기업 내에서 운영 플레이어로 작동하며, 인간의 지시를 위한 인터페이스 계층이 아닌 것입니다.
이 변화는 에이전트의 작동 방식을 변경합니다. 에이전트는 다음에 무엇을 할지 선택할 수 있고, 목표를 단계로 나눌 수 있으며, 다양한 수준에서 활동을 완료할 수 있습니다. API에 접근하여, 데이터베이스를 쿼리하고, 내부 시스템을 검색하고, 레코드를 업데이트하고, 다운스트림 작업을 시작함으로써 워크플로우를 조정할 수 있습니다. 프롬프트, 메모리, 비즈니스 규칙, 검색된 정보 및 실시간 운영 신호를 통합하여 에이전트는 또한 상황 기반의 판단을 내릴 수 있습니다.
보다 발전된 에이전트는 워크플로우가 실패할 때 식별하고, 다시 시도하고, 문제를升级시키거나 인간 검토자에게 작업을 전달할 수 있습니다. CRM, 티켓팅, 클라우드 인프라, 내부 지식 베이스, 관찰 가능성 플랫폼 및 비즈니스 애플리케이션에서 에이전트는 독립적으로 작동할 수 있습니다. 이러한 기능이 빠르게 확장할 것으로 예상됩니다.
오늘날 에이전트의 능력
에이전트의 능력은 그들과 함께 진화합니다. 에이전트는 다음에 무엇을 할지 선택할 수 있고, 목표를 단계로 나눌 수 있으며, 다양한 수준에서 활동을 완료할 수 있습니다. API에 접근하여, 데이터베이스를 쿼리하고, 내부 시스템을 검색하고, 레코드를 업데이트하고, 다운스트림 작업을 시작함으로써 워크플로우를 조정할 수 있습니다. 프롬프트, 메모리, 비즈니스 규칙, 검색된 정보 및 실시간 운영 신호를 통합하여 에이전트는 또한 상황 기반의 판단을 내릴 수 있습니다.
보다 발전된 에이전트는 워크플로우가 실패할 때 식별하고, 다시 시도하고, 문제를升级시키거나 인간 검토자에게 작업을 전달할 수 있습니다. CRM, 티켓팅, 클라우드 인프라, 내부 지식 베이스, 관찰 가능성 플랫폼 및 비즈니스 애플리케이션에서 에이전트는 독립적으로 작동할 수 있습니다. 이러한 기능이 빠르게 확장할 것으로 예상됩니다.
비즈니스에서 자율 에이전트를 통합하는 방법
에이전트는 점점 더 많은 조직 운영에 통합되고 있으며, 속도, 정확성, 안전성 및 거버넌스가 중요한 운영 프로세스에 가까워지고 있습니다. 이러한 운영에는 고객 서비스 및 사례 처리, 인시던트 응답 및 IT 운영, DevOps 및 사이트 신뢰성 워크플로우, 코드 수정 및 소프트웨어 개발, 운영 및 공급망 계획 등이 포함됩니다.
새로운 운영 위험
그러나 에이전트가 점점 더 독립적으로 작동함에 따라, 비즈니스에서는 새로운 유형의 운영 위험을 처리해야 합니다.
- 나쁜 선택이 단순히 제안되지 않고, 종종 수행됩니다
- 작은 실수가 빠르게 연결된 다른 시스템으로 퍼질 수 있습니다
- 실제 세계의 행동이 환상에 의해 트리거될 수 있습니다
- 에이전트가 비즈니스 의도, 정책 또는 규정에서 벗어날 수 있습니다
- 여러 구성 요소 간의 상호 작용으로 인해 실패가 발생할 수 있습니다
- 자동화된 의사 결정이 인간의 평가보다 더 빠르게 결정할 수 있습니다
팀은 증상을 관찰할 수 있지만, 시스템의 행동背後의 이유를 이해할 수도 있어야 합니다. 기업용 에이전트에는 관찰 가능성 외에도 신뢰성 제어가 필요합니다.
에이전트의 복잡성
오늘날의 에이전트는 단일 모델이 아닙니다. 여러 상호 작용하는 구성 요소로 구성된 분산형, 계층형 시스템입니다. 이러한 구성 요소에는 다음이 포함됩니다.
- 기초 모델 (LLM)
- 세부 모델 (SLM)
- 임베딩 모델
- 벡터 데이터베이스
- 검색 파이프라인 및 RAG 구성 요소
- 프롬프트 템플릿 및 프롬프트 오케스트레이션 계층
- 훈련 및 평가 데이터 세트
- 가드레일 및 정책 계층
- 에이전트 및 워크플로우
- 도구 호출 시스템
- 원격 분석 (로그, 메트릭, 트레이스)
- 인간의 개입을 위한 승인 체크포인트
에이전트의 위험
각 구성 요소는 다른 유형의 실패 모드를 추가하며, 이러한 구성 요소 간의 상호 작용은 추가적인 복잡성을 추가합니다. 시스템이 인프라 계층에서 강력해 보일 수 있지만, 여전히 나쁜 선택을 할 수 있고, 만족스러운 결과를 생성할 수 있으며, 아래에 운영 위험을 축적할 수 있습니다.
에이전트의 위험에는 다음이 포함됩니다. 데이터 파이프라인에 의해 소개된 나쁨 또는 오염된 입력, 인프라 병목 현상에 의해 신뢰성이 감소하는 것, 유해하거나 잘못된 결과, 인간의 검토에 대한 운영 병목 현상 등입니다. 이러한 문제를 더욱 복잡하게 만드는 것은, 여러 에이전트 또는 단계가 있는 시스템이 즉시적으로 나타나지 않는 방식으로 실패할 수 있다는 것입니다.
에이전트 관찰 가능성
전통적인 모니터링은 프롬프트의 행동, 검색 품질, 모델 드리프트, 에이전트 실행 채널 또는 에이전트의 행동과 다운스트림 비즈니스 또는 운영 영향 간의 연결을 이해하기에 충분하지 않습니다.
이것이 에이전트 관찰 가능성이 필요한 이유입니다. 에이전트 관찰 가능성은 입력, 출력, 원하는 행동 및 에이전트 시스템에서 생성된 의사 결정 신호를 수집하여, 상호 관련시키고, 평가함으로써 팀이 에이전트 시스템의 작동 방식을 이해할 수 있도록 합니다. 이것은 필수적입니다. 왜냐하면 에이전트 시스템은 분산되어 있고, 비결정론적이며, 매우 상황에 민감하기 때문입니다.
에이전트 관찰 가능성은 에이전트 워크플로우에 대한 종단 간의 통찰력을 제공하여, 팀이 프롬프트, 모델, 검색 레이어, 도구 및 다운스트림 시스템이 실행 중에 어떻게 상호 작용하는지 이해할 수 있도록 합니다.
에이전트 관찰 가능성은 성능 및 행동, 대기 시간, 비용, 토큰 사용, 처리량, 오류율, 모델 행동 및 출력 품질 지표를 모니터링할 수 있도록 합니다. 복잡한 에이전트 워크플로우에서 실행 경로를 추적하고, 여러 단계 및 종속성에 걸쳐 결과가 어떻게 도달하는지 보여줍니다.
에이전트 관찰 가능성은 또한 운영 및 에이전트 신호에 걸쳐서 비정상적인 행동을 노출함으로써, 팀이 수동으로 발견하기 전에 비정상적인 행동을 식별할 수 있도록 합니다. 이것은 문제가 발생했을 때 진단을 가속화하고, 원인 분석을 더 쉽게 만듭니다.
관찰 가능성만으로는 충분하지 않다
에이전트 관찰 가능성이 필수적인 비즈니스 관행임에도 불구하고, 그것에는 내재된 제한이 있습니다.
관찰 가능성은 진단적이지만, 예방적이지 않습니다. 팀은 무엇이 잘못되었는지 알 수 있지만, 그것이 다시 발생하지 않도록 어떻게 막을 수 있는지 알 수 없습니다. 에이전트의 과거 행동에 대한 지식이 자동으로 에이전트의 미래 행동에 대한 제어로 번역되지 않는다는 것을 이해하는 것이 중요합니다.
비결정론적 시스템의 경우, 관찰 가능성은 종종 팀을 불확실성으로 이끄는 데이터로 가득 차 있습니다. 운영적인 답변을 제공하는 대신, 관찰 가능성은 종종 설명으로 끝납니다. 팀이 문제를 인식하고 있지만, 수정 조치를 취하거나, 시스템을 안전한 운영 매개변수 내에서 유지하기 위한 자동화, 안전 장치 및 제어 루프가 없을 수 있습니다.
이것은 운영적인 간격을 만듭니다. 비즈니스에서는 드리프트, 나쁨 결과, 위험한 행동 또는 저하된 생산성을 식별할 수 있지만, 그것이 다시 발생하지 않도록 막거나, 그 영향을 완화하거나, 자율 시스템을 안전한 운영 매개변수 내에서 유지하기 위해 필요한 자동화 및 제어가 없을 수 있습니다.
이것은 팀이 반응적으로 작동하는 것을 의미합니다. 그들은 수동적인 개입을 사용하여, 문제가 발생했을 때 조사하고, 인간의 노동을 사용하여 시스템이 더 빠르고 더 자율적으로 되는 것을 보충합니다.
에이전트 신뢰성의 개요
에이전트 신뢰성은 단순히 문제를 관찰하는 것을 넘어섭니다. 그것은 에이전트 시스템이 실제 생산 환경에서 안전하게, 일관되게, 예측 가능하게, 성공적으로 작동하는 것을 보장하는 것입니다. 에이전트 신뢰성은 에이전트를 둘러싼 전체 시스템을 이해하고 관리합니다. 그것은 발견과 행동 사이의 루프를 닫습니다.
에이전트 신뢰성은 모델이 정확한 응답을 제공했는지 여부에만 관심이 있는 것이 아니라, 전체 에이전트 기반 시스템이 합리적인 운영 제약 조건 내에서 시간이 지남에 따라 작동할 수 있는지 여부에 관심이 있습니다. 품질, 안전성, 회복성, 설명 가능성, 정책 준수, 비용 효율성 및 운영 안정성이 모두 이 방정식의 일부입니다.
탐지에서 예방으로의 전환
에이전트 신뢰성은 문제를 인식하고 수정하는 시간을 줄입니다. 그것은 “무엇이 잘못되었는지”에서 “우리의 에이전트가 얼마나 빨리 개선될지”로 대화를 전환합니다. 다음 기술을 사용하면 관찰 가능성을 수동적인 관찰에서 예방적인 예방으로 이동할 수 있습니다.
- 문제를 식별하기 위해 모델, 데이터 및 인프라를 통해 신호를 상관시키는 것
- 영향에 앞서서 문제를 예측적으로 감지하는 것
- 확률적 에이전트 시스템에서 모든 입력 및 출력을 검증하여 미묘한 행동 변경을 감지하는 것
- 생산에서 원치 않는 출력을 감지하고, 이를 사용하여 기본 모델의 정확도를 개선하는 미세 조정 데이터를 생성하는 피드백 루프를 만드는 것
- 복잡한 에이전트 워크플로우에서 멀티 에이전트 워크플로우 트레이싱을 통해 데이터가 어떻게 진화하여 복잡한 행동을 알 수 있는지 연결하는 것
- 안전한 응답 및 자동 복구를 위한 정의된 인간의 개입 에이전트 워크플로우
제어와 관찰 사이의 간격을 닫는 것
비즈니스에서는 관찰 가능성과 제어를 통합하는 프레임워크가 필요합니다. 이러한 프레임워크는 생성적 에이전트에 대한 관찰 가능성 계층 이상을 필요로 합니다. 결정론적 및 비결정론적 시스템 모두에서, 신뢰성 플랫폼은 문제를 식별하고, 예측하고, 설명하고, 제어하는 데 도움을 줄 수 있습니다.
신뢰할 수 있는 에이전트 작동을 위한 жиз력 가능한 프레임워크에는 다음이 포함되어야 합니다.
- IT 시스템 및 에이전트 시스템을 위한 통합 원격 분석
- 종단 간 에이전트 워크플로우 및 시스템 종속성 추적
- 에이전트 특정 행동 및 품질 추적 (프롬프트 및 평가)
- 원인에 관계없이 고급 이상 탐지
- 원인적 추론 및 근본 원인 분석
- 환경에 자동으로 적응하고 수동 임계값이 필요하지 않은 알림
- 정책 시행 및 가드레일
- 중요하거나 중요한 행동에 대한 인간의 개입 평가
- 워크플로우 자동화 및 복구 조정
- 예측 분석을 사용하여 문제를 예방
- 이상 탐지와 개선된 에이전트 모델 품질을 연결하는 피드백 루프
에이전트 기능을 촉진하는 것
에이전트 시스템은 인프라, 서비스, 데이터 파이프라인 및 운영 루틴에 의존합니다. 에이전트는 혼자서 실패하지 않습니다. 팀은 에이전트와 IT 신뢰성을 결합하여 전체 그림을 얻습니다.
얇은 LLM 래퍼는 신뢰할 수 있는 플랫폼의 기반이되어서는 안 됩니다. 다른 에이전트 전용 도구가 간과하는 문제를 식별하고 수정하려면, 무감독 학습, 예측 에이전트, 인과 에이전트 및 생성 에이전트와 같은 다양한 에이전트 기술을 고려해야 합니다. 이러한 기술의 조합은 일반적으로 “합성 에이전트”로 알려져 있습니다.
생성 에이전트는 자연어를 요약하는 데 유용합니다. 비정형 데이터를 통해推論하거나 인간과 상호 작용하는 상황에서 가장 적합합니다. 그러나 이것은 대부분의 생산 환경에서 신뢰성 문제의 모양과 일치하지 않습니다.
예측 에이전트는 이상 탐지 알고리즘을 사용하여 고장, 나쁨 고객 경험 또는 비싼 실패 전에 초기 신호를 식별하는 데 중점을 둡니다.
인과 에이전트는 성능 저하의 실제 근본 원인을 밝혀내기 위해 검색 품질, 모델 행동, 인프라 느림, 업스트림 데이터 드리프트 또는 다운스트림 시스템 실패를 확인하는 데 도움이 됩니다.
무감독 학습은 인간의 지시에 따라 데이터에서 숨겨진 패턴, 구조 또는 이상을 자동으로 발견합니다. 신뢰성에는 생성 에이전트보다 더 적합합니다. 왜냐하면 복잡한, 분류되지 않은 데이터에서 숨겨진 구조를 찾거나 유사한 항목을 그룹화하거나 관계를 찾는 데 중점을 둔 때문입니다.
위험, 불확실성 또는 비즈니스 영향이重大할 때, 운영 에이전트는 자동으로 반응하면서도 안전한 작동을 위해 인간의 개입을 유지할 수 있어야 합니다.
에이전트 모델은 실제 사용자 데이터에서 강화 학습을 사용하여 각 상호 작용에서 비즈니스 컨텍스트에 대한 이해를 향상시킬 수 있습니다.
가장 발전된 시스템은 경고를 넘어, 각 사건에서 학습하고, 인식된 반응을 자동화하고, 안전한 조치를 시작하는 폐쇄 루프 복구를 제공합니다.
자율 에이전트 시스템을 준비하는 것
비즈니스에서는 자율 에이전트 시스템을 준비하는 몇 가지 방법이 있습니다. 첫째, 에이전트는 생산성 도구가 아니라 운영 시스템으로 간주되어야 합니다. 에이전트가 행동할 수 있는 능력이 있게 되면, 그것은 비즈니스 운영의 중요한 부분이 됩니다.
팀은 에이전트를 즉시 инструмент화하여 모델, 프롬프트, 도구, 워크플로우, 인프라 및 사용자 결과에서 신호를 기록할 수 있습니다. 이 기본적인 감시는 에이전트가 비즈니스에 필수적인 때까지 연기되어서는 안 됩니다.
에이전트를 광범위하게 배포하기 전에 신뢰성 표준을 설정하는 것도 중요합니다. 안전성, 대기 시간, 오류율, 환상 위험, 정책 준수 및 비즈니스 영향에 대한 허용 가능한 임계값은 에이전트의 설계에 통합되어야 합니다.
에이전트의 행동을 지원하는 기본 시스템 및 프로세스와 연결하면 비즈니스에서는 에이전트와 IT 작동을 통합할 수 있습니다. 인프라와 모델 모니터링을 위한 별도의 도구를 사용하면盲点이 생성됩니다.
플랫폼 엔지니어링, SRE, 보안, 데이터 팀, 에이전트 팀 및 비즈니스 소유자는 신뢰할 수 있는 에이전트 작동을 제공하기 위해 함께 일해야 합니다. 자율 시스템은 전통적인 실로를超越합니다.
각 사고, 이상 및ニア미스를 운영에 피드백 루프를 통합함으로써 시스템을 향상시킵니다. 비즈니스에서는 생산 행동에서 지속적으로 학습할 수 있습니다.
마지막으로, 관찰 가능성만이 아니라 제어를 위한 플랫폼을 선택하는 것이 중요합니다. 비즈니스에서는 관찰 가능성, 예측, 설명 및 행동을 통합하는 시스템으로부터 이점을 얻을 것입니다. 에이전트가 더 자율적으로 될수록, 문제를 식별하는 것에서 안전한 결과를 제어하는 것으로 전환하는 조직은 승자가 될 것입니다.
결론
에이전트는 기업에서 더 이상 도구가 아니라 운영 시스템입니다. 실제 생산 환경에서 에이전트 시스템에 신뢰성을 추가하면 안전한, 일관된, 예측 가능한, 효율적인 작동을 보장합니다. 에이전트가 더 자율적으로 될수록, 문제를 식별하는 것에서 안전한 결과를 제어하는 것으로 전환하는 조직이 승자가 될 것입니다.












