Финансирование
Lemma привлекла $2,3 млн на предпосевном этапе для решения проблемы неявных сбоев агентов ИИ в производстве

Стартап Lemma, занимающийся надежностью агентов ИИ, привлек $2,3 млн на предпосевном этапе для создания инфраструктуры мониторинга, предназначенной для выявления особого класса проблем: агентов ИИ, которые, казалось бы, успешно выполнили задачу, но на самом деле дали неверный результат.
В раунде участвовали Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures и Eight Capital, а также бизнес-ангелы и операторы из OpenAI, xAI, Meta и DoorDash.
Founded by Джерри Чжан и Коул Гавин, Lemma была частью осеннего выпуска Y Combinator 2025 года и фокусируется на мониторинге агентов ИИ в производстве. Компания заявляет, что ее платформа уже обработала более одного миллиона отслеживаний агентов, поскольку инженерные команды все чаще ищут способы понять, как автономные системы ведут себя после развертывания.
Растущая проблема агентов ИИ, которые неявно терпят неудачу
Традиционный мониторинг программного обеспечения в основном предназначен для явных сигналов неудач. Приложение崩溃, запрос возвращает код ошибки, задержка увеличивается, или компонент инфраструктуры становится недоступным.
Агенты ИИ вводят другую проблему.
Агент может успешно выполнить каждый технический шаг в рабочем процессе, но все равно неправильно понять, чего хотел пользователь, вызвать неправильный инструмент, использовать неверную информацию, застрять в непродуктивном цикле или вернуть правдоподобный, но неверный ответ. С точки зрения традиционной инфраструктуры мониторинга, запрос может выглядеть совершенно здоровым.
Lemma описывает это как семантические неудачи. Примеры включают агента обслуживания клиентов, который ссылается на неправильную политику возврата, агента аудита, который генерирует устаревший отчет, или агента, который вызывает внешнюю систему, используя вымышленную информацию. Это общие точки неудач агентов ИИ.
Этот различие становится все более важным, поскольку агенты выходят за рамки интерфейсов разговора и начинают выполнять более длинные, многоступенчатые рабочие процессы, где модели языка взаимодействуют с базами данных, интерфейсами программирования приложений (API), системами извлечения и другими программными инструментами.
Неудача где-то в этой цепи может не произвести исключение. Агент может просто продолжить работу.
Как Lemma отслеживает агентов ИИ в производстве
Lemma строит слой наблюдаемости, специально предназначенный для этих путей выполнения агентов.
Ее система отслеживания превращает каждое выполнение агента в структурированный след, содержащий основные вызовы больших языковых моделей, вызовы инструментов, входные данные, выходные данные, данные о времени и ошибки, сгенерированные на протяжении всего рабочего процесса. Инженерные команды могут затем изучить все дерево выполнения, а не смотреть только на окончательный ответ агента.
Но отслеживание – это только часть подхода.
Lemma анализирует следы производства по сравнению с инструкциями агента и группирует повторяющиеся проблемы в вопросы, giúpая командам выявить закономерности неудач, которые в противном случае могли бы остаться скрытыми в тысячах отдельных взаимодействий. Платформа также может расставлять приоритеты вопросов и отправлять уведомления через Slack, когда появляются потенциально значимые проблемы.
Цель – ответить на более сложный вопрос, чем то, выполнил ли программное обеспечение свою работу успешно: действительно ли агент выполнил то, что он должен был выполнить?
Это значительный сдвиг в том, как наблюдаемость может работать для программного обеспечения агентов.
Преобразование неудач в производстве в улучшения агентов
Lemma также пытается сократить расстояние между обнаружением проблемы и ее исправлением.
Как только платформа выявляет повторяющуюся неудачу, она анализирует окружающие следы и контекст, чтобы определить вероятную первопричину. Оттуда она может предложить изменения в подсказках, логике приложения или рабочих процессах агентов, а не требовать от инженеров вручную реконструировать каждое проблематичное взаимодействие.
Компания расширяет этот рабочий процесс в среды разработки через сервер протокола контекста модели (MCP). Разработчики могут запрашивать следы Lemma из инструментов, включая Cursor, Claude Desktop и Claude Code, что позволяет процессу отладки происходить ближе к месту, где разрабатывается основной агент.
После развертывания исправления Lemma может превратить неудачу в производстве в онлайн-оценку и отслеживать ее повторение. Это создает обратную связь, в которой ранее не видимые реальные неудачи становятся будущими тестами, а не остаются изолированными инцидентами.
Этот подход продвигает Lemma немного за пределы традиционной наблюдаемости. Долгосрочная цель – создание инфраструктуры, которая помогает агентам систематически учиться на неудачах в производстве, а не полагаться исключительно на инженеров для обнаружения, воспроизведения и ручного исправления каждого краевого случая.
Проблема, с которой столкнулись основатели
Чжан и Гавин встретились, когда были первокурсниками в Университете Южной Калифорнии, и позже работали над системами ИИ в отдельных стартапах, родных для ИИ. До основания Lemma они работали в Tandem, который применяет ИИ в здравоохранении, и ChipStack, который разрабатывает агентов ИИ для проектирования микросхем.
Эти опыт помог им столкнуться с трудностью переноса агентов из контролируемых сред разработки в производство.
«Коул и я начали Lemma, потому что мы испытали боль от построения агентов ИИ на собственном опыте», – сказал Чжан. «Мы постоянно сталкивались с одной и той же проблемой: агенты казались работающими, но результаты не были достаточно надежными в производстве».
Основатели утверждают, что улучшение только основных моделей не устранит эту проблему. Реальное поведение агентов также зависит от подсказок, логики приложения, инструментов, интеграций, систем извлечения и все более сложных цепей, соединяющих их.
Техническая гипотеза Lemma заключается в том, что офлайн-оценки борются с воспроизведением непредсказуемых условий, с которыми агенты сталкиваются после развертывания, что делает производственные данные важным источником для понимания, где системы фактически ломаются.
Более широкая задача мониторинга агентов ИИ в производстве
Новые финансирования будут поддерживать дальнейшее развитие инструментов мониторинга и обнаружения неудач Lemma, с первоначальным акцентом на стартапах, которые уже запускают агентов ИИ в производстве.
Компания работает в области, которая становится все более важной, поскольку системы ИИ переходят от изолированных демонстраций к реальным рабочим процессам. Традиционные инструменты наблюдаемости обычно хорошо обнаруживают технические проблемы, такие как простой, задержка или неудавшиеся запросы, но агентные системы вводят дополнительный уровень сложности: приложение может оставаться работоспособным, даже если агент неправильно понимает задачу, выбирает неправильный инструмент или производит неверный результат.
Это различие, вероятно, станет более значимым, поскольку агенты используются в поддержке клиентов, финансовом анализе, администрировании здравоохранения, разработке программного обеспечения и исследованиях. В этих средах измерение того, выполнил ли агент рабочий процесс, может иметь меньшее значение, чем определение того, выполнил ли он рабочий процесс правильно.
Для Lemma возможность зависит от того, станет ли мониторинг семантических неудач стандартной частью эксплуатации агентов ИИ в производстве. Раунд предпосевного финансирования в размере $2,3 млн дает компании дополнительный капитал для проверки этой гипотезы, поскольку организации развертывают агентов в все более сложных рабочих процессах.
Что может означать лучший мониторинг агентов для ИИ
Когда агенты ИИ берут на себя более сложную и автономную работу, традиционный мониторинг может оказаться недостаточным. Будущие системы должны оценивать не только то, выполнил ли агент задачу, но и то, понял ли он цель, использовал ли правильные инструменты и произвел ли правильный результат.
Инструменты, такие как Lemma, также могут создать более тесные обратные связи между производством и разработкой, превращая реальные неудачи в новые тесты и улучшения. Со временем это может сделать наблюдаемость агентов стандартной частью стека инфраструктуры ИИ, особенно в средах с высокими ставками, где надежность и подотчетность имеют наибольшее значение.












