펀딩
Lemma, $2.3M의 시드 투자로 생산 환경에서 조용히 실패하는 AI 에이전트 문제 해결에 나서

AI 에이전트 신뢰성 스타트업 Lemma는 생산 환경에서 조용히 실패하는 AI 에이전트 문제를 해결하기 위해 230만 달러의 시드 투자를 유치했습니다. 이 문제는 에이전트가 작업을 성공적으로 완료한 것으로 보이지만 실제로는 잘못된 결과를 생산하는 경우입니다.
본 라운드는 Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures, Eight Capital 등의 참여로 이루어졌으며, OpenAI, xAI, Meta, DoorDash (DASH ) 등의 천사 투자자와 운영자가 참여했습니다.
Jerry Zhang와 Cole Gawin이 설립한 Lemma는 Y Combinator의 2025년 가을 배치에 속했으며, 생산 환경에서 AI 에이전트를 모니터링하는 데 중점을 두었습니다. 회사는 현재까지 100만 개 이상의 에이전트 트레이스를 처리했으며, 엔지니어링 팀은 점점 더 자율적인 시스템의 동작을 이해하기 위해 방법을 찾고 있습니다.
생산 환경에서 조용히 실패하는 AI 에이전트 문제
전통적인 소프트웨어 모니터링은 대부분 명시적인 실패 신호를 중심으로 설계되었습니다. 응용 프로그램이 충돌하거나, 요청이 오류 코드를 반환하거나, 지연 시간이 증가하거나, 인프라 구성 요소가 사용할 수 없게 됩니다.
AI 에이전트는 다른 문제를 제기합니다.
에이전트는 기술적인 단계를 모두 성공적으로 수행했지만 사용자가 원하는 것을 이해하지 못할 수 있습니다. 또한 잘못된 도구를 호출하거나, 잘못된 정보를 사용하거나, 비생산적인 루프에 빠지거나, 타당하지만 잘못된 답변을 반환할 수 있습니다. 전통적인 모니터링 인프라에서 볼 때, 요청은 완전히 건강해 보일 수 있습니다.
Lemma는 이러한 실패를 의미론적 실패라고 설명합니다. 예를 들어, 고객 서비스 에이전트가 잘못된 환불 정책을 인용하거나, 감사 에이전트가 구식 보고서를 생성하거나, 에이전트가 외부 시스템을 호출할 때 발명된 정보를 사용하는 경우와 같습니다. 이러한 실패는 AI 에이전트의 일반적인 실패 지점입니다.
에이전트가 대화형 인터페이스를 넘어 더 긴 다단계 워크플로우를 실행하기 시작하면서 이러한 구별은 점점 더 중요해집니다. 여기서 언어 모델은 데이터베이스, API, 검색 시스템, 소프트웨어 도구 등과 상호 작용합니다.
Lemma가 생산 환경에서 AI 에이전트를 모니터링하는 방법
Lemma는 이러한 에이전트 실행 경로를 중심으로 관察 가능성 계층을 구축하고 있습니다.
트레이싱 시스템은 각 에이전트 실행을 구조화된 트레이스에 변환하여 기본적인 대규모 언어 모델 호출, 도구 호출, 입력, 출력, 타이밍 데이터, 검색 단계 및 워크플로우에서 발생하는 오류를 포함합니다. 엔지니어링 팀은 에이전트의 최종 응답만을 살펴보지 않고 전체 실행 트리를 검사할 수 있습니다.
트레이싱은 접근 방식의 일부에 불과합니다.
Lemma는 생산 트레이스를 에이전트의 지침과 비교하여 반복되는 문제를 문제로 그룹화하여 팀이 개별 상호 작용에 걸쳐 숨겨진 실패 패턴을 식별하도록 도와줍니다. 플랫폼은 또한 문제를 우선순위로 지정하고 잠재적으로 중요한 문제가 발생할 때 슬랙을 통해 경고를 보낼 수 있습니다.
목표는 소프트웨어가 성공적으로 실행되었는지 여부를 묻는 것보다 더 어려운 질문에 답하는 것입니다. 즉, 에이전트가 실제로 의도한 바를 수행했는지 여부입니다.
생산 실패를 에이전트 개선으로 전환
Lemma는 문제를 발견하고 수정하는 거리를 줄이려하고 있습니다.
플랫폼이 반복되는 실패를 식별하면, 그 주변의 트레이스와 컨텍스트를 분석하여 가능한根本 원인을 결정합니다. 그 다음에, 프롬프트, 애플리케이션 논리 또는 에이전트 워크플로우에 대한 변경을 제안할 수 있습니다. 엔지니어가 모든 문제적인 상호 작용을 수동으로 재구성할 필요는 없습니다.
회사는 Model Context Protocol(MCP) 서버를 통해 개발 환경으로 이 워크플로우를 확장하고 있습니다. 개발자는 Cursor, Claude Desktop, Claude Code와 같은 도구에서 Lemma의 트레이스를 쿼리할 수 있으므로 디버깅 프로세스가 에이전트가 개발되는 곳에서 더 가까이 발생할 수 있습니다.
패치가 배포된 후, Lemma는 생산 실패를 온라인 평가로 전환하고 재발을 모니터링할 수 있습니다. 이렇게 하면 이전에 보지 못한 실제 실패가 미래의 테스트와 개선으로 변하는 피드백 루프가 생성됩니다.
설립자가 직접 겪은 문제
Zhang와 Gawin은 남부 캘리포니아 대학교에서 신입생으로 만나, 이후 AI 네이티브 스타트업에서 AI 시스템을 함께 작업했습니다. Lemma를 설립하기 전에, 두 사람은 Tandem에서 AI를 적용하고, ChipStack에서 칩 디자인을 위한 AI 에이전트를 개발했습니다.
이러한 경험은 에이전트를 제어된 개발 환경에서 생산 환경으로 옮기는 어려움을 노출시켰습니다.
“Cole과 나는 AI 에이전트를 직접 구축하는 고통을 겪었습니다. 에이전트가 작동하는 것처럼 보이지만, 생산 환경에서 결과가 충분히 신뢰할 수 없다는 문제를 계속 마주쳤습니다.”라고 Zhang는 말했습니다.
설립자는 기본 모델을 개선하는 것만으로는 이 문제를 해결할 수 없다고 주장합니다. 실제 에이전트 동작은 프롬프트, 애플리케이션 논리, 도구, 통합, 검색 시스템, 사용자 동작 및 이들을 연결하는 점점 더 복잡한 체인에 의존합니다.
생산 환경에서 AI 에이전트를 모니터링하는 더广泛한 도전
새로운 자금은 Lemma의 모니터링 및 실패 감지 도구의 추가 개발을 지원할 것입니다. 초기에는 이미 생산 환경에서 AI 에이전트를 실행하는 스타트업에 중점을 둘 것입니다.
회사는 점점 더 중요해지는 분야에서 운영하고 있습니다. 전통적인 관측 도구는 기술적인 문제를 감지하는 데 좋지만, 에이전트는 작업을 완료했지만, 실제로는 작업을 올바르게 완료하지 못한 경우를 감지하는 데는 부족합니다.
이러한 구별은 고객 지원, 금융 분석, 의료 관리, 소프트웨어 개발, 연구와 같은 분야에서 에이전트가 사용됨에 따라 더 중요해질 것입니다. 이러한 환경에서 워크플로우를 완료했는지 여부는 에이전트가 워크플로우를 올바르게 완료했는지 여부보다 중요하지 않을 수 있습니다.
Lemma에게는 생산 환경에서 의미론적 실패를 모니터링하는 것이 표준이 되는지 여부에 따라 기회가 달려 있습니다. 230만 달러의 시드 라운드는 회사가 이 가설을 테스트하는 데 필요한 자본을 제공합니다.
개선된 에이전트 모니터링이 AI에 미치는 영향
에이전트가 더 복잡하고 자율적인 작업을 수행할수록, 전통적인 모니터링만으로는 충분하지 않을 수 있습니다. 미래의 시스템은 에이전트가 작업을 완료했는지 여부를 평가하는 것보다, 에이전트가 목표를 이해했는지, 올바른 도구를 사용했는지, 올바른 결과를 생산했는지 평가해야 합니다.
Lemma와 같은 도구는 생산과 개발 사이에 더 긴밀한 피드백 루프를 만들 수 있습니다. 실제 실패를 새로운 테스트와 개선으로 전환하여, 에이전트 관측 가능성이 AI 인프라 스택의 표준 부분이 될 수 있습니다. 특히, 신뢰성과 책임성이 가장 중요한 고위험 환경에서 더욱 그렇습니다.












