인터뷰
제프 샴페인, 크리블의 필드 CTO – 인터뷰 시리즈

제프 샴페인, 크리블의 필드 CTO는 관측 가능성, 엔터프라이즈 데이터, 제품 전략, 기술 아키텍처에 걸친 심오한 경험을 가지고 있습니다. 크리블에 합류하기 전에 그는 데이터브릭스의 제품 관리 디렉터를 역임하였으며, 스플렁크에서 7년 이상의 기간 동안 시니어 필드 제품, 아키텍처, 글로벌 시스템 엔지니어링 역할을 수행했습니다. 그의 배경에는 또한 BNY 컨버제克斯의 시스템 아키텍처 리더십, 프리미어 테크놀로지 솔루션의 시니어 엔지니어링, 어시스트-투-셀의 초기 엔지니어링 리더십이 포함되어 있습니다. 이는 기업이 대규모의 운영 데이터를 수집, 관리, 분석, 및 행동하는 방법에 대한 광범위한 관점을 제공합니다.
크리블은 IT, 보안, SRE, 및 DevOps 팀이 관측 가능성 및 보안 데이터를 단일 벤더에 종속되지 않고 수집, 처리, 라우팅, 저장, 분석할 수 있도록 도와주는 엔터프라이즈 텔레메트리 회사입니다. 이 회사는 “텔레메트리용 AI 플랫폼”으로 자신을 пози션하고 있으며, 텔레메트리 수집, 감소, 강화, 라우팅을 위한 크리블 스트림, 벤더 중립형 엔드포인트 텔레메트리 수집을 위한 크리블 에지, 데이터 검색을 위한 크리블 서치, 저장을 위한 크리블 레이크와 같은 제품을 제공합니다. 더 넓은 목표는 텔레메트리 볼륨이 증가하고 AI 구동 운영이 깨끗하고 더 접근하기 쉬운 데이터를 요구하는 경우에 기업에 더 많은 제어, 유연성, 효율성을 제공하는 것입니다.
스플렁크, 데이터브릭스, 그리고 지금 크리블에서 일하면서 엔터프라이즈 데이터, 관측 가능성, 인프라에 대한 드문 관점을 가지게 되었습니다. 그 관점에서 एज엔틱 AI가 만드는 관측 가능성의 도전은 무엇이 진정으로 다르다고 생각하시나요?
애플리케이션 관측 가능성에서 우리는 항상 복잡한 분기 실행 경로, 마이크로 서비스를 통해 요청을 추적하고 분산 시스템에서 로그를 상관시키는 문제를 다루어 왔습니다. 보안 운영에서 우리는 시스템 전체에 걸쳐 위협을 탐지하기 위해 높은 볼륨의 이질적인 데이터 소스를 다루어 왔습니다. 그러나 이러한 시스템은 대체로 예측 가능한 방식으로 작동합니다. 에이전트는 의사 결정 链을 동적으로 생성하고, 외부 도구를 호출하며, 하위 에이전트를 생성하는 등 예측할 수 없는 방식으로 작동합니다. 실행 그래프는 단순히 복잡한 것이 아니라 매번 매우 다를 수 있습니다. 에이전트가 실제로 무슨 일이 발생했는지 재구성하기 위해 필요한 텔레메트리의 볼륨은 각 홉에서 지수적으로 증가합니다. 이러한 텔레메트리를 수집하는 것은 쉽게 기기화되어야 하며 대규모로 운영할 때 비용 효율적이어야 합니다. 그렇지 않으면 기업은 가시성을 줄이고 비용을 제어하려고 할 것입니다. 그러나 이는 잘못된 시점에 발생하는 것입니다.
에이전트를 워크플로우에 통합하는 기업에서 에이전트가 요청받은 작업과 실제 시스템에서 발생하는 작업 사이에 가장 큰 가시성 갭은 어디에 있습니까?
에이전트는 표면적으로 성공적인 워크플로우를 완료하지만, 조용히 잘못된 도구 호출을 하거나, 매개변수를 상상하거나, 원래 목표에서 벗어납니다. 이러한 결과는 종종 다른 시스템에서 몇 시간 후에 나타납니다.
이러한 불일치는 일반적으로 해석에서 시작됩니다. 원래 지시의 약간의 모호성이 에이전트가 메모리에서检索하는 내용, 사용 가능한 도구, 또는 이전 단계가 어떻게 맥락을 형성했는지에 따라 다르게 해결될 수 있습니다. 또한 에이전트가 의존하는 하위 시스템도 기기화해야 합니다. 에이전트가 완벽하게 구성된 데이터베이스 호출을 할 수 있지만, 기본 테이블이 업스트림에서 실패한 ETL 작업으로 인해 새로 고침되지 않았다면, 잘못된 답변을 반환할 수 있습니다.
전통적인 관측 가능성 도구는 왜 종종 에이전틱 AI 시스템을 모니터링하는 데 불충분합니까?
첫째, 이러한 도구는rigid한 고유한 스키마와 예측 가능한 데이터 형태를 중심으로 구축되었습니다. 에이전트 추적은 이러한 기대에 부응하지 않습니다. 오픈 텔레메트리와 같은 오픈 표준이 이러한 문제를 해결하기 위해 등장하고 있지만, 많은 레거시 플랫폼은 이러한 표준을 활용하도록 설계되지 않았습니다.
둘째, 규모와 비용 방정식이 빠르게 깨집니다. 단일 에이전트가 생산 워크로드를 처리하는 경우, 전통적인 플랫폼이 처리할 수 있는 것보다 훨씬 많은 텔레메트리를 단시간에 생성할 수 있습니다. 대부분의 전통적인 플랫폼은 처리하고 저장하는 볼륨에 따라 비용을 청구하므로, 이는 불가능한 트레이드오프를 만들게 됩니다. 모든 것을 기기화하면 비용이 폭증하고, 가시성을 줄이면 필요한 곳에서 가시성이 부족해집니다.
에이전트가 실패할 때, 조직은 모델, 검색 계층, API 종속성, 권한 문제, 또는 하위 인프라 문제 중 어디가 근본 원인인지 어떻게 결정할 수 있습니까?
근본 원인을 분리하는 것은 모든 계층에서 일련의 제거 과정입니다. 이는 모든 계층에서 일관되게 텔레메트리가 존재할 때만 가능합니다. 모델 범위의 지연 및 오류 신호는 LLM 자체를 가리킵니다. 검색 범위는 반환된 컨텍스트가 관련성이 있거나 구식인지 알려줍니다. 도구 호출 범위는 실패한 API 종속성이나 권한 오류를 노출합니다.
기업이 에이전트의 행동을 이해하려고 할 때, 어떤 종류의 텔레메트리 데이터가 가장 중요한가요?
기초는 여전히 MELT(메트릭, 이벤트, 로그, 트레이스)입니다. 그러나 에이전트 시스템으로 이동할 때 가중치가 크게 변경됩니다. 메트릭은 무엇이 잘못되었는지 알려주고, 로그는 실제로 발생한 일을 기록하지만, 에이전트가 왜 잘못된 답변에 도달했는지 재구성하는 데는 도움이 되지 않습니다. 트레이스는 에이전트가 문제를 해결하기 위해 어떻게 추론했는지, 어떤 도구를 호출했는지, 어떤 컨텍스트를检索했는지, 어떻게 분기되었는지, 각 단계에서 무슨 결정을 내렸는지 보여줍니다. 이러한 트레이스 없이 출력을 설명할 방법이 없습니다.
에이전트가 워크플로우에 통합됨에 따라, 에이전트의 행동을 이해하기 위해 보안, SRE, 데이터, AI 팀이 공유된 관점에서 작동하는 데 텔레메트리 파이프라인이 어떤 역할을 할 수 있습니까?
보안 팀, SRE, 데이터 엔지니어, AI 팀은 모두 다른 도구를 통해 같은 문제의 다른 부분을 보고 있습니다. 텔레메트리 파이프라인은 이러한 문제를 해결합니다. 모든 도구 앞에 있는 단일, 잘 관리되는 파이프라인은 모든 팀이 동일한 정규화되고 강화된 데이터에서 작동하도록 보장합니다.
기업이 에이전트를 배포할 때 기존 모니터링 관행을 에이전트에 재사용하는 경우 가장 흔한 실수는 무엇입니까?
가장 흔한 실수는 기존의 프리미엄 관측 가능성 플랫폼을 사용하여 에이전트 트레이스를 수집하는 것입니다. 에이전트 트레이스는 전통적인 애플리케이션 텔레메트리와는 다르게 큰 볼륨이고 가변적이며 구조가 다양합니다. 대부분의 프리미엄 플랫폼은 수신 및 저장에 따라 비용을 청구하므로, 이는 심각한 문제가 될 수 있습니다. 일반적인 반응은 수집하는 것을 줄이는 것입니다. 결과는 최악의 경우입니다. 높은 비용과 불완전한 가시성입니다.
앞으로, 인프라 가시성이 클라우드 관측 가능성과 마찬가지로 대규모 클라우드 마이그레이션에 필수적인 요소가 될까요?
클라우드와의 평행은 매우 유사합니다. 클라우드에 인프라를 이동할 때 가장 중요한 것은 기존 아키텍처를 단순히 이동시키지 않는다는 것입니다. 새로운 아키텍처를 배포하고 있으며, 이는 새로운 능력을 가지고 있습니다. 모든 것이 기기화되고 모니터링되도록 설계되어야 합니다. 이러한 단계를 생략한 기업은 진단할 수 없는 캐스케이드 실패, 설명할 수 없는 비용, 예방할 수 없는 중단에 직면했습니다. 관측 가능성이 클라우드의 확장 가능성을 위한 신뢰의 기반이 되었습니다. 에이전트 AI와도 같은 패턴이 발생하고 있습니다.
멋진 인터뷰 감사합니다. 더 많은 정보를 원하는 독자는 크리블을 방문하십시오.












