인터뷰
샤하르 아줄라이, 그라운드커버의 CEO 및 공동 창립자

샤하르 아줄라이, 그라운드커버의 CEO이자 공동 창립자는 시리얼 R&D 리더입니다. 샤하르는 애플, 데이투, 사이모티브 테크놀로지스 등에서 사이버 보안과 기계 학습 분야에서 경험을積んだ 리더입니다. 샤하르는 이스라엘 총리办公室의 사이버 부서에서 많은 시간을 보냈으며, 테크니온 이스라엘 공과대학과 텔아비브 대학교에서 물리학, 전기 공학, 컴퓨터 과학을 전공했습니다. 샤하르는 이 풍부한 배경에서 얻은 기술적 지식을 오늘날의 클라우드 네이티브 전장에서 가장 날카롭고 혁신적인 형태로 적용하여 개발자 세계를 더 나은 곳으로 만들고자 합니다.
(AAPL )그라운드커버는 엔지니어링 팀이 전통적인 모니터링 도구의 복잡성이나 비용 없이 시스템에 대한 전체적인 실시간 가시성을 제공하는 클라우드 네이티브 관측 가능성 플랫폼입니다. eBPF 기술을 기반으로 구축된 이 플랫폼은 클라우드 네이티브 및 쿠버네티스 환경에서 코드 변경 없이 로그, 메트릭, 추적, 이벤트를 수집 및 상관관계를 맺습니다. 이는 더 빠른 근본 원인 분석 및 더 명확한 시스템 인사이트를 가능하게 합니다. 플랫폼은 예측 가능한 가격, 데이터를 고객의 클라우드에 유지하는 유연한 배포, 인프라, 애플리케이션, 현대적인 AI 구동 워크로드를 아우르는 종단 간 관측 가능성을 강조합니다.
サイバー R&D 팀을 이끄는 것에서부터 애플의 ML 이니셔티브를 관리하는 것까지, 그라운드커버를 설립하게 된 결정적인 경험은 무엇이었나요? 또한, 현대적인 AI 시스템에서 관측 가능성의 간격을 언제 처음 인식했나요?
그라운드커버를 설립하게 된 동기는 애플과 데이투에서 일한 경험에서 비롯되었습니다. 그 당시에는巨額의 예산을 지불하거나 샘플링하여 맹목적으로 진행해야 하는 상황에 직면했습니다. 그 때부터 우리는 그 문제를 해결할 기술을 찾기 시작했습니다. Extended Berkeley Packet Filter (eBPF)를 만나게 된 후, 모든 것이 달라질 것이라는 것을 알게 되었습니다. eBPF를 통해 애플리케이션 변경 없이 커널 수준에서 모든 것을 볼 수 있게 되었습니다. 나는 왜 관측 가능성 도구들이 이 기술을 활용하지 않는지 이해할 수 없었습니다. AI 간격은 나중에 명확해졌습니다. 쿠버네티스 플랫폼이 성숙한 후, 고객들이 GenAI 배포를 위해 급하게 이동하는 동안 LLM을 블랙 박스처럼 취급하는 것을 보게 되었습니다. 그들은 모델이 반응한다는 것을 알았지만, 왜 비예측적으로 행동하거나 왜 비용이 급증하는지 모르는 상황이었습니다. 우리는 에이전트 워크플ロー가 단순히 복잡한 비결정론적 마이크로 서비스라는 것을 깨달았습니다. 이미 구축한 제로 터치 가시성을 필요로 하는 것입니다.
サイバー 보안, 임베디드 시스템, 기계 학습 R&D 배경은 그라운드커버의 비전에 어떻게 영향을 미쳤나요? 또한, LLM 구동 및 에이전트 애플리케이션을 위한 관측 가능성 회사로 구축하는 초기 도전은 무엇이었나요?
サイバー 보안 배경은 회사 전체의 DNA를 형성했습니다. 정보 세계에서는 애플리케이션을 제어하지 않는다고 가정합니다. 그것이 그라운드커버가 기구를 요구하지 않는 이유입니다. 개발자에게 코드를 수정하도록 요청하는 것은 가장 빠른 방법으로 채택을 차단하는 것이라는 것을 경험적으로 알고 있습니다. LLM 모니터링에서 가장 어려운 초기 도전은 개인 정보 보호였습니다. AI 관측 가능성은 민감한 개인 정보나 지적 재산을 포함할 수 있는 프롬프트를 캡처할 수 있습니다. 배경으로부터 명백하게 기업들이 그 데이터를 환경 밖으로 내보내지 않을 것이라는 것을 알게 되었습니다. đó가 우리가 클라우드 아키텍처를 구축한 이유입니다. 이를 통해 에이전트 행동에 대한 깊은 가시성을 제공할 수 있으면서도 모든 데이터를 고객의 환경 내에 유지할 수 있습니다.
LLM 관측 가능성을 정의하고, 전통적인 모니터링 또는 ML 모니터링과 어떻게 다른지 설명하세요.
LLM 관측 가능성은 생산 시스템에서 대규모 언어 모델을 캡처하여 모든 추론의 전체 컨텍스트를 볼 수 있도록 하는 관행입니다. 프롬프트, 컨텍스트, 완성, 토큰 사용, 지연, 오류, 모델 메타데이터, 그리고 이상적으로는 다운스트림 피드백 또는 품질 신호를 포함합니다. “서비스가 작동하고 빠른가?” 또는 “이 요청이 오류가 발생했는가?”라는 질문만 하는 것이 아니라, “이 특정 요청이 왜 성공했는지 또는 왜 실패했는지?”, “이 멀티 스텝 워크플로우에서 실제로 무슨 일이 있었는지?”, “프롬프트, 컨텍스트, 모델 버전의 변경이 비용, 지연, 출력 품질에 어떻게 영향을 미치는지?”라는 질문에 대한 답변을 도와줍니다. 이것은 전통적인 모니터링 또는 심지어 기존 ML 모니터링과 매우 다릅니다. 레거시 접근 방식은 결정론적 시스템, 인프라 메트릭, 정적 임계값에 맞춰져 있습니다. LLM 애플리케이션은 비결정론적, 개방형,高度 컨텍스트 종속적입니다. 성공은 종종 의미론적이고 주관적이며 단순히 200 대 500 상태 코드가 아닙니다. 따라서 입력과 출력을 추적하고, 툴 호출 및检索 단계를 이해하고, 응답을 홀루시네이션 또는 정책 위반과 같은 것들에 대해 평가하고, 토큰 수준의 비용과 지연을周囲의 애플리케이션과 인프라에 연결해야 합니다.
LLM 구동 애플리케이션이 전통적인 관측 가능성 도구가 부족한 도전을 무엇을 giới thiệu하나요?
LLM 구동 시스템은 다음 도전을 giới thiệu합니다:
- 복잡한 멀티 스텝 워크플로우 – 우리는 단순한 “모델 호출, 응답 받기” 흐름에서 멀티 턴 에이전트, 멀티 스텝 파이프라인,检索 증강 생성, 툴 사용으로 이동했습니다. 이러한 단계 중 하나에서 조용한 실패, 예를 들어检索, 강화, 임베딩, 툴 호출, 모델 호출은 전체 경험을 깸니다. 전통적인 모니터링은 이러한 체인의 전체, 추적 수준 보기와 함께 프롬프트와 응답을 제공하지 않습니다.
- 급속하게 진화하는 AI 스택 – 팀은 새로운 모델, 툴, 벤더를 이전에 본 적이 없는 속도로 추가하고 있습니다. 많은 회사에서 현재 프로덕션에서 어떤 모델이 사용되고 있는지 확신할 수 없습니다. 클래식 관측 가능성은 SDK를 기구화하고, 재배포하고, 측정할 내용을 신중하게 큐레이션할 시간이 있다고 가정합니다. 이는 AI가 채택되는 속도에 따라잡을 수 없습니다.
- 토큰 기반 경제와 할당량 – 가격과 속도 제한은 토큰과 컨텍스트 길이, 개발자, 프롬프트 또는 사용자 행동에 의해 제어되는 경우가 많습니다. 전통적인 도구는 “어느 모델, 어느 워크플로우, 어느 지연에서 토큰을 얼마나 사용했는지”를 보여주도록 설계되지 않았습니다.
- 이진 성공 대신 의미론적 정밀도 – LLM은 200을 반환할 수 있지만 여전히 홀루시네이션, 프롬프트에서 벗어나거나 정책을 위반할 수 있습니다. 전통적인 도구는 이것을 성공으로 간주합니다. 프롬프트와 응답을 표면화하고 충분한 컨텍스트를 제공하여 행동을 검사하고, 시간이 지남에 따라 자동화된 품질 검사를 플러그인할 수 있는 관측 가능성이 필요합니다.
- 제3자에게 흐르는 민감한 입력 데이터 – LLM은 사용자에게 매우 민감한 정보를 공유하도록 초대합니다. 이제 그 데이터에 대한 책임이 있으며, 어디에 저장되고, 어느 벤더가 보는지에 대한 책임이 있습니다. 이는 GDPR, 데이터 거주지, 고객 신뢰에重大한 영향을 미칩니다.
이 모든 것은 LLM 시스템이 AI 인식, 컨텍스트 풍부, 수동 기구화에 대한 의존도가 낮은 관측 가능성을 필요로 함을 의미합니다.
LLM 시스템의 성능과 품질을 이해하는 데 가장 중요한 신호 또는 메트릭은 무엇인가요? 여기에는 지연, 토큰 사용, 프롬프트/응답 행동이 포함됩니다.
실제로 중요한 몇 가지 신호 범주가 있습니다:
지연 및 처리량
- 모델 시간과周囲의 애플리케이션 시간을 포함한 요청당 종단 간 지연.
- 모델 및 워크플로우당 테일 지연(P90, P95, P99).
- 모델, 경로, 서비스당 처리량으로 실제 부하가 어디에 가는지 알 수 있습니다.
토큰 사용 및 비용 드라이버
- 요청당 모델별 입력 및 출력 토큰.
- 모델, 팀, 사용자, 워크플로우당 집계된 토큰 사용량.
- 검색 중단 파이프라인의 컨텍스트 크기로 프롬프트가 폭발할 때 볼 수 있습니다.
- 이것이 “누가 실제로 우리의 AI 예산을 사용하고 무엇에 사용하는지”라는 질문에 대한 답변을 가능하게 합니다.
프롬프트 및 응답 행동
- 대표적인 추적에 대한 실제 프롬프트 및 응답 페이로드, 툴 호출 및 추론 경로를 포함합니다.
- LLM이 호출한 툴과 호출 순서.
- 유사한 프롬프트에 대한 응답의 분산으로 행동의 안정성을 알 수 있습니다.
신뢰성 및 오류
- 모델별 오류율 및 유형(제공자 오류, 타임아웃, 인증 문제, 할당량 오류).
- LLM 호출과 상관관계 있는 워크플로우의 실패, 예를 들어 툴 타임아웃 또는检索 오류.
클래식 인프라 컨텍스트
- LLM 호출을 오케스트레이팅하는 서비스의 컨테이너 CPU, 메모리, 네트워크 메트릭.
- 애플리케이션이 무엇을 시도했는지 설명하는 상관관계 로그.
이 모든 것을 한 곳에서 볼 수 있으면, LLM 관측 가능성이 “어떤 것이 느리거나 비싼지”에서 “어느 모델, 프롬프트 패턴, 서비스가 왜 책임이 있는지”로 이동합니다.
관측 가능성이 프롬프트 드리프트, 홀루시네이션 또는 출력 품질의 점진적인恶化와 같은 조용한 실패를 감지하는 데 어떻게 도움이 될 수 있나요?
LLM 시스템에서 조용한 실패는 인프라 수준에서 모든 것이 “초록”으로 보이지만 실제 행동이漂하는 경우에 발생합니다. 관측 가능성은 몇 가지 방법으로 도움이 됩니다:
- 전체 워크플로우를 추적하는 것, 모델 호출만이 아닌 – 요청의 전체 경로를 캡처하여 행동이 변경된 위치를 볼 수 있습니다. 예를 들어,检索가 더 적은 문서를 반환하기 시작하거나 툴 호출이 간헐적으로 실패하고 모델이 즉흥적으로 행동할 수 있습니다.
- 프롬프트, 컨텍스트, 응답을 보는 것 – 추적과 함께 프롬프트와 응답을 검사할 수 있을 때, 새로운 프롬프트 버전, 시스템 지침 또는 컨텍스트 소스가 행동을 변경했는지 쉽게 알 수 있습니다. 지연과 오류율은 동일하게 유지되더라도 말입니다.
- 의미론적 조건으로 필터링 및 슬라이싱 – 풍부한 LLM 텔레메트리를 얻은 후, “1초 이상의 베드락 호출”, “이 모델 패밀리를 사용하는 요청”, 또는 “이 특정 경로를 포함하는 추적”과 같은 것들로 필터링할 수 있습니다. 그런 다음 프롬프트와 응답을 읽어 모델이漂하거나 홀루시네이션하는지 확인할 수 있습니다.
- 사업 수준의 SLO에 대한 알림 – “LLM 호출이 1초 이상인 경우 우리의 사용자 대면 SLA를 위반한다”와 같은 SLO를 정의하고, 이러한 조건이 충족될 때 알림을 트리거할 수 있습니다. 시간이 지남에 따라, 유사한 SLO는 품질 점수 또는 정책 검사와 연결될 수 있으므로 품질이恶化할 때 알림을 받을 수 있습니다.
관측 가능성 레이어가 AI 특정 신호와 클래식 로그, 메트릭, 추적에 모두 접근할 수 있으므로, 사용자 경험을悪化시키는 문제를 잡는 자연스러운 위치가 됩니다.
그라운드커버의 접근법은 멀티 스텝 에이전트 워크플로우와 툴 호출 내에서 예측할 수 없는 지연 또는 예상치 못한 행동을 진단하는 데 어떻게 지원하나요?
그라운드커버는 현대적인 AI 시스템을 위한 접근법을 사용합니다. 우리는 코드 변경이나 재배포 없이 마이크로 서비스 간의 트래픽을 관찰하기 위해 커널 수준에서 eBPF 기반 센서를 사용합니다. LLM 워크플로우를 도입하는 순간 자동으로 그 호출을 обнаруж할 수 있습니다. 내일 앤트로픽, 오픈AI, 베드락과 같은 새로운 모델을 사용하기 시작하면, 그라운드커버는 자동으로 그 트래픽을 캡처합니다. 이를 통해:
- 멀티 홉 워크플로우의 종단 간 추적 – 서비스를横断하는 요청의 전체 경로를 볼 수 있습니다. LLM 또는 툴이 사용되는 위치를 포함합니다.
- 각 LLM 호출에 대한 깊은 컨텍스트 – 모든 호출에는 사용된 모델, 지연, 토큰 사용, 프롬프트, 응답, 상관관계 로그 및 인프라 메트릭이 포함됩니다.
- 지연 및 조건에 대한 강력한 필터링 – 예를 들어, 1초 이상의 클라우드 3.5 호출을 필터링하고 즉시 SLA를 위반한 추적을 검사할 수 있습니다.
- LLM 행동과 관련된 알림 및 대시보드 – 데이터가 사용 가능해지면, SLA 위반 또는 지연, 처리량, 토큰 사용, 오류를 추적하는 대시보드를 생성할 수 있습니다.
모든 것이 에지에서 eBPF에 의해 수집되고 고객의 클라우드에 저장되므로, 기구화 추가 없이 높은粒度의 보기를 얻을 수 있습니다.
LLM 배포에서 나타나는 데이터 보안 및 규정 위험은 무엇이며, 관측 가능성이 이러한 위험을 어떻게 줄일 수 있나요?
LLM 배포는 몇 가지 고유한 데이터 위험을 가져옵니다:
- 제한되지 않은 사용자 입력 – 사용자는 매우 민감한 정보를 채팅봇이나 AI 구동 인터페이스에 입력할 수 있습니다. 이는 개인 데이터, 고객 데이터 또는 의도하지 않은 수집한 정보를 포함할 수 있습니다.
- 제3자 모델 제공업체 – 외부 LLM 제공업체에 데이터를 보낸 후, 그 데이터가 어디에 저장되고, 어느 하위 처리업체가 관여하는지에 대한 책임이 있습니다. 이는 GDPR, 데이터 거주지, 고객 신뢰에重大한 영향을 미칩니다.
- 텔레메트리로서의 두 번째 민감한 데이터 복사본 – 관측 가능성 스택이 전체 페이로드를 SaaS 벤더에 보낸다면, 이제 환경 외부에 민감한 정보의 또 다른 복사본이 있습니다.
그라운드커버의 아키텍처는 이러한 우려를 직접 해결하도록 설계되었습니다:
- 우리는 고객의 클라우드 계정 내에서 완전히 관리되는 데이터 플레인을 사용하는 자체 클라우드 모델을 사용합니다. 제어 플레인은 우리가 실행하지만, 우리는 고객의 텔레메트리 데이터에 접근하거나 저장하거나 처리하지 않습니다.
- 우리가 고객의 환경에서 페이로드를 안전하게 캡처할 수 있으므로, 데이터가 클라우드를 떠나지 않고 프롬프트, 응답, 워크플로우를 관찰할 수 있습니다. 제3자 저장소나 추가 데이터 이그레스에 대한 우려는 없습니다.
- 이 가시성을 통해, 민감한 데이터의 예기치 않은 사용을 감지하고, 모델 및 지역에 대한 정책을 적용할 수 있습니다.
즉, 관측 가능성은 신뢰성 및 비용 도구뿐만 아니라 개인 정보 보호, 데이터 거주지, 규정 준수를 위한 주요 제어 지점이 됩니다.
조직이 하나의 LLM 통합에서 여러 AI 구동 서비스로 확장함에 따라, 가시성, 신뢰성, 비용에 대한 운영적인 도전은 무엇인가요?
첫 번째 통합은 일반적으로 단일 모델과 단일 워크플로우입니다. 그 단계에서는 모든 것이 관리 가능하게 느껴집니다. 하지만 팀이 가치를 보고 사용량이 폭발적으로 증가하면서 몇 가지 도전이 나타납니다:
- 모델 및 벤더 확산 – 팀은 새로운 모델을 끊임없이 테스트합니다. 어느 모델이 프로덕션에서 사용되고 있는지, 어떻게 사용되는지 확신할 수 없습니다.
- 토큰 사용으로 인한 비용 сю프라이즈 – 토큰 소비는 컨텍스트 길이와 워크플로우 복잡성으로 증가합니다. 토큰 사용량에 대한 가시성이 없으면 비용 관리가 매우 어렵습니다.
- 외부 제공업체에 대한 신뢰성 의존성 – 사용자 대면 API는 모델 지연 또는 오류에 민감해집니다. 이는 코어 인프라가 건강하더라도 SLA를 방해할 수 있습니다.
- 기구화 부채 증가 – 전통적인 관측 가능성은 기구화를 추가할 시간이 있다고 가정합니다. 빠르게 움직이는 AI 스택에서는 개발자가 거의 기구화를 할 시간이 없습니다.
그라운드커버는 자동으로 AI 트래픽을 발견하고 다음을 제공함으로써 이러한 문제를 해결합니다:
- 사용 중인 모델 및 벤더에 대한 중앙 집중식 가시성.
- 지연, 처리량, 토큰 사용량에 대한 대시보드.
- LLM 행동과 의존하는 서비스 간의 상관관계.
- AI 구동 SLO 위반에 대한 알림.
이로써 “한 가지 멋진 AI 기능”에서 “AI가 수십 개의 임계 서비스에織り込まれている”로 확장하는 것을 더 쉽게 만들 수 있습니다.
앞으로 5년 동안, 에이전트 AI, 멀티 모델 오케스트레이션, 규제 압력이 가속화함에 따라 LLM 관측 가능성이 어떻게 진화할 것으로 예상하나요?
우리는 아직 초기 단계에 있습니다. 앞으로 5년 동안 몇 가지 큰 변화를 예상합니다:
- 요청 수준에서 에이전트 수준 이해로 – 관측 가능성은 모델 호출만이 아닌 툴 시퀀스, 추론 경로, 재시도 논리를 캡처할 것입니다.
- 더 풍부한 의미론적 및 정책 신호 – 홀루시네이션, 안전성 문제, 브랜드 일치에 대한 자동화된 품질 검사가 표준 메트릭이 됩니다.
- 거버넌스 및 개인 정보 보호와의 긴밀한 결합 – 규제가 증가함에 따라, 관측 가능성은 또한 데이터 거주지, 보유, 승인된 모델 사용에 대한 시행 및 감사 레이어로 작용할 것입니다.
- 모델 간, 다중 벤더 최적화 – 팀은 성능 및 비용에 따라 모델 간에 트래픽을 동적으로 라우팅할 것입니다. 이는 실시간 관측 가능성 데이터에 의해 안내됩니다.
- 수동 기구화 감소 – eBPF 기반 수집 및 자동 발견과 같은 기술이 기본값이 됩니다. 따라서 팀은 느리게 하는 것을 걱정하지 않고 혁신할 수 있습니다.
간단히 말해, LLM 관측 가능성은 “AI용 대시보드가 좋다”에서 신뢰성, 비용 제어, 데이터 거버넌스, 제품 품질을 연결하는 중앙 신경계로 진화할 것입니다.
그레이트 인터뷰, 더 많은 것을 배우고 싶은 독자는 그라운드커버를 방문해야 합니다.












