펀딩

Lemma, 드러나지 않는 AI 에이전트 운영 실패에 대응할 프리시드 투자 230만 달러 유치

mm
Unite.AI를 Google의 선호 소스에 추가

AI 에이전트 신뢰성 스타트업 Lemma 가 프리시드 투자 230만 달러를 유치했습니다. 작업을 성공적으로 끝낸 듯 보이면서 실제로는 잘못된 결과를 내는 AI 에이전트라는, 포착하기 까다로운 문제를 감지할 모니터링 인프라를 구축하기 위한 자금입니다.

이번 라운드에는 Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures, Eight Capital 등이 참여했으며 OpenAI, xAI, Meta, DoorDash 출신 엔젤 투자자와 기업 운영 실무자들도 투자했습니다.

Jerry Zhang과 Cole Gawin이 설립한 Lemma는 Y Combinator의 2025년 가을 기수에 참여했으며 실제 운영 환경의 AI 에이전트 모니터링에 집중합니다. 배포 후 자율 시스템의 행동을 이해할 방법을 찾는 엔지니어링 팀이 늘어나는 가운데, 회사는 자사 플랫폼이 지금까지 100만 건 이상의 에이전트 실행 추적 기록을 처리했다고 밝혔습니다.

겉으로 드러나지 않는 AI 에이전트 실패가 늘고 있다

기존 소프트웨어 모니터링은 대체로 명확한 실패 신호를 중심으로 설계됐습니다. 애플리케이션이 중단되거나 요청이 오류 코드를 반환하고, 지연 시간이 급증하거나 인프라 구성요소를 사용할 수 없게 되는 경우입니다.

AI 에이전트는 다른 문제를 제기합니다.

에이전트는 워크플로의 모든 기술적 단계를 성공적으로 실행하면서도 사용자의 의도를 오해하거나 잘못된 도구를 호출하고, 부정확한 정보를 사용하거나 성과 없는 반복에 빠지며, 그럴듯하지만 틀린 답을 내놓을 수 있습니다. 기존 모니터링 인프라에는 요청이 완전히 정상으로 보일 수 있습니다.

Lemma는 이를 의미적 실패라고 설명합니다. 고객 서비스 에이전트가 잘못된 환불 정책을 인용하거나, 감사 에이전트가 오래된 보고서를 만들거나, 에이전트가 스스로 지어낸 정보로 외부 시스템을 호출하는 경우가 해당합니다. 이는 흔히 나타나는 AI 에이전트의 실패 지점입니다.

에이전트가 대화 인터페이스를 넘어 더 길고 여러 단계로 이루어진 워크플로를 실행하면서 이 구분은 점점 중요해집니다. 이런 과정에서 언어 모델은 데이터베이스, 애플리케이션 프로그래밍 인터페이스(API), 검색 시스템, 기타 소프트웨어 도구와 상호작용합니다.

연결된 과정의 어딘가에서 실패해도 예외가 발생하지 않을 수 있습니다. 에이전트가 그대로 계속 진행할 수도 있습니다.

Lemma는 실제 운영 환경의 AI 에이전트를 어떻게 모니터링하나

Lemma는 이런 에이전트 실행 경로에 초점을 맞춘 관측 가능성 계층을 구축하고 있습니다.

추적 시스템은 각 에이전트 실행을 구조화된 기록으로 바꿉니다. 기록에는 워크플로 전반의 대규모 언어 모델 호출, 도구 호출, 입력, 출력, 시간 정보, 검색 단계, 오류가 포함됩니다. 엔지니어링 팀은 최종 응답만 보는 대신 전체 실행 트리를 살펴볼 수 있습니다.

하지만 추적은 접근 방식의 일부일 뿐입니다.

Lemma는 운영 환경의 추적 기록을 에이전트의 지침과 대조하고 반복되는 문제를 이슈로 묶습니다. 이를 통해 수천 건의 개별 상호작용 속에 묻힐 수 있는 실패 양상을 팀이 파악하도록 돕습니다. 문제의 우선순위를 정하고 중요할 수 있는 문제가 나타날 때 Slack 알림을 보낼 수도 있습니다.

목표는 소프트웨어가 성공적으로 실행됐는지보다 어려운 질문, 즉 에이전트가 해야 할 일을 실제로 해냈는지에 답하는 것입니다.

이는 에이전트 소프트웨어의 관측 가능성이 작동해야 하는 방식에 상당한 변화를 뜻합니다.

운영 중 실패를 에이전트 개선으로 연결하기

Lemma는 문제를 발견한 뒤 고치기까지의 과정도 줄이려 합니다.

반복되는 실패를 찾아내면 주변 추적 기록과 맥락을 분석해 유력한 근본 원인을 파악합니다. 이를 바탕으로 프롬프트, 애플리케이션 로직, 에이전트 워크플로의 변경을 제안할 수 있습니다. 엔지니어가 문제 있는 상호작용을 하나하나 수작업으로 재구성할 필요를 줄이는 방식입니다.

회사는 Model Context Protocol(MCP) 서버를 통해 이 워크플로를 개발 환경으로 확장하고 있습니다. 개발자는 Cursor, Claude Desktop, Claude Code 같은 도구에서 Lemma의 추적 기록을 조회할 수 있어 에이전트를 만드는 환경에 더 가까운 곳에서 디버깅할 수 있습니다.

수정 사항을 배포한 뒤에는 운영 중 실패를 온라인 평가로 바꾸고 재발 여부를 모니터링할 수 있습니다. 이전에 보지 못한 실제 실패가 개별 사건으로 끝나지 않고 향후 테스트가 되는 피드백 순환이 만들어집니다.

이 접근은 Lemma를 기존 관측 가능성의 범위보다 더 나아가게 합니다. 장기적 목표는 모든 예외 사례를 찾아 재현하고 수작업으로 고치는 일을 전적으로 엔지니어에게 맡기는 대신, 에이전트가 운영 중 실패에서 체계적으로 배우도록 돕는 인프라입니다.

창립자들이 직접 겪은 문제

Zhang과 Gawin은 서던캘리포니아대학교 신입생 때 만났으며 이후 서로 다른 AI 중심 스타트업에서 AI 시스템을 개발했습니다. Lemma 설립 전 경력에는 의료에 AI를 적용하는 Tandem과 칩 설계용 AI 에이전트를 개발하는 ChipStack이 있습니다.

그 경험을 통해 통제된 개발 환경의 에이전트를 실제 운영 환경으로 옮기는 일이 얼마나 어려운지 알게 됐습니다.

Zhang은 “Cole과 저는 AI 에이전트를 만드는 어려움을 직접 겪었기 때문에 Lemma를 시작했습니다”라며 “에이전트가 작동하는 것처럼 보이지만 실제 운영에서 결과를 충분히 신뢰할 수 없다는 같은 문제에 계속 부딪혔습니다”라고 말했습니다.

창립자들은 기반 모델 개선만으로 이 문제가 사라지지는 않는다고 주장합니다. 실제 에이전트의 행동은 프롬프트, 애플리케이션 로직, 도구, 통합, 검색 시스템, 사용자 행동, 그리고 이들을 연결하는 점점 복잡해지는 처리 과정에도 달려 있기 때문입니다.

Lemma의 기술적 관점은 오프라인 평가로는 배포 후 에이전트가 만나는 예측 불가능한 조건을 재현하기 어렵다는 것입니다. 따라서 운영 데이터는 시스템이 실제로 어디에서 실패하는지 이해하는 중요한 자료가 됩니다.

운영 환경의 AI 에이전트 모니터링이 맞닥뜨린 더 넓은 과제

새 자금은 Lemma의 모니터링과 실패 감지 도구를 더 발전시키는 데 사용됩니다. 초기에는 이미 실제 운영 환경에서 AI 에이전트를 사용하는 스타트업에 집중합니다.

AI 시스템이 개별 시연을 넘어 실제 업무로 옮겨 가면서 회사가 속한 분야의 중요성도 커지고 있습니다. 기존 관측 도구는 가동 중단, 지연, 요청 실패 같은 기술적 문제를 대체로 잘 찾아냅니다. 그러나 에이전트 시스템에는 또 다른 복잡성이 있습니다. 애플리케이션이 정상 작동해도 에이전트가 업무를 오해하거나 잘못된 도구를 선택하고 틀린 결과를 만들 수 있습니다.

고객 지원, 금융 분석, 의료 행정, 소프트웨어 개발, 연구에 에이전트가 쓰일수록 이 구분은 더 중요해질 전망입니다. 이런 환경에서는 워크플로를 완료했는지보다 올바르게 완료했는지를 판단하는 것이 더 중요할 수 있습니다.

따라서 Lemma의 기회는 의미적 실패의 모니터링이 AI 에이전트 운영의 표준이 되느냐에 달려 있습니다. 프리시드 230만 달러는 조직들이 갈수록 복잡한 워크플로에 에이전트를 배포하는 가운데 이 가설을 검증할 추가 자본을 제공합니다.

더 나은 에이전트 모니터링이 AI에 갖는 의미

AI 에이전트가 더 복잡하고 자율적인 업무를 맡으면서 기존 모니터링만으로는 부족해질 수 있습니다. 향후 시스템은 작업 완료 여부뿐 아니라 목표를 이해했는지, 올바른 도구를 썼는지, 정확한 결과를 냈는지도 평가해야 합니다.

Lemma 같은 도구는 실제 실패를 새로운 테스트와 개선으로 바꿔 운영과 개발 사이의 피드백 순환을 더 긴밀하게 만들 수도 있습니다. 시간이 지나면서 에이전트 관측 가능성은 AI 인프라 스택의 표준 요소가 될 수 있습니다. 특히 신뢰성과 책임성이 중요한, 실패의 영향이 큰 환경에서 그렇습니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.