Financiación
Lemma recauda $2,3 millones en financiación pre-semilla para abordar los fallos silenciosos de los agentes de IA en producción

La startup de confiabilidad de agentes de IA, Lemma, ha recaudado $2,3 millones en financiación pre-semilla para construir una infraestructura de monitoreo diseñada para detectar una clase particular de problemas: los agentes de IA que parecen haber completado una tarea con éxito mientras producen silenciosamente el resultado incorrecto.
La ronda de financiación incluye la participación de Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures y Eight Capital, junto con inversores ángeles y operadores de OpenAI, xAI, Meta y DoorDash.
Fundada por Jerry Zhang y Cole Gawin, Lemma fue parte de la promoción de otoño de 2025 de Y Combinator y se centra en el monitoreo de producción para agentes de IA. La empresa afirma que su plataforma ha procesado más de un millón de trazas de agentes, ya que los equipos de ingeniería buscan cada vez más formas de comprender cómo se comportan los sistemas autónomos después de su implementación.
El creciente problema de los agentes de IA que fallan silenciosamente
El monitoreo de software tradicional está diseñado en gran medida alrededor de señales de fallo explícitas. Una aplicación se bloquea, una solicitud devuelve un código de error, la latencia aumenta o un componente de infraestructura se vuelve indisponible.
Los agentes de IA introducen un problema diferente.
Un agente puede ejecutar con éxito cada paso técnico en un flujo de trabajo y aún así malentender lo que el usuario quería, llamar a la herramienta incorrecta, utilizar información incorrecta, quedar atrapado en un bucle improductivo o devolver una respuesta plausible pero incorrecta. Desde la perspectiva de la infraestructura de monitoreo convencional, la solicitud puede parecer perfectamente saludable.
Lemma describe estos como fallos semánticos. Ejemplos incluyen un agente de servicio al cliente que cita la política de reembolso incorrecta, un agente de auditoría que genera un informe desactualizado o un agente que llama a un sistema externo utilizando información que inventó. Estos son puntos de fallo comunes de los agentes de IA.
Esta distinción se vuelve cada vez más importante a medida que los agentes van más allá de las interfaces conversacionales y comienzan a ejecutar flujos de trabajo más largos y multi-paso, donde los modelos de lenguaje interactúan con bases de datos, interfaces de programación de aplicaciones (API), sistemas de recuperación y otras herramientas de software.
Un fallo en alguna parte de esa cadena puede no producir una excepción. El agente puede simplemente continuar.
Cómo Lemma monitorea los agentes de IA en producción
Lemma está construyendo una capa de observabilidad específicamente alrededor de estos caminos de ejecución de agentes.
Su sistema de trazado convierte cada ejecución de agente en una traza estructurada que contiene las llamadas subyacentes al modelo de lenguaje grande, las invocaciones de herramientas, las entradas, las salidas, los datos de temporización, los pasos de recuperación y los errores generados en todo el flujo de trabajo. Los equipos de ingeniería pueden examinar entonces todo el árbol de ejecución en lugar de mirar solo la respuesta final del agente.
Pero el trazado es solo parte del enfoque.
Lemma analiza las trazas de producción contra las instrucciones del agente y agrupa los problemas recurrentes en problemas, lo que ayuda a los equipos a identificar patrones de fallo que de otro modo podrían permanecer enterrados en miles de interacciones individuales. La plataforma también puede priorizar los problemas y enviar alertas a través de Slack cuando aparecen problemas potencialmente significativos.
El objetivo es responder a una pregunta más difícil de la que si el software se ejecutó con éxito: ¿El agente realmente logró lo que se suponía que debía lograr?
Esa es una cambio significativo en cómo la observabilidad puede necesitar funcionar para el software agente.
Convirtiendo los fallos de producción en mejoras de agente
Lemma también está tratando de acortar la distancia entre encontrar un problema y solucionarlo.
Una vez que la plataforma identifica un fallo recurrente, analiza las trazas y el contexto circundantes para determinar una causa raíz probable. A partir de ahí, puede proponer cambios en los prompts, la lógica de la aplicación o los flujos de trabajo del agente en lugar de requerir que los ingenieros reconstruyan manualmente cada interacción problemática.
La empresa está extendiendo ese flujo de trabajo a entornos de desarrollo a través de un servidor de Protocolo de Contexto de Modelo (MCP). Los desarrolladores pueden consultar las trazas de Lemma desde herramientas que incluyen Cursor, Claude Desktop y Claude Code, lo que permite que el proceso de depuración ocurra más cerca de donde se está desarrollando el agente subyacente.
Después de que se implementa una solución, Lemma puede convertir el fallo de producción en una evaluación en línea y monitorear su recurrencia. Esto crea un bucle de retroalimentación en el que los fallos reales del mundo que no se habían visto antes se convierten en pruebas futuras en lugar de permanecer como incidentes aislados.
Este enfoque lleva a Lemma un poco más allá de la observabilidad convencional. El objetivo a largo plazo es una infraestructura que ayude a los agentes a aprender sistemáticamente de los fallos de producción en lugar de depender enteramente de los ingenieros para descubrir, reproducir y solucionar manualmente cada caso de borde.
Un problema que los fundadores encontraron de primera mano
Zhang y Gawin se conocieron como estudiantes de primer año en la Universidad del Sur de California y más tarde trabajaron en sistemas de IA en startups nativas de IA. Antes de fundar Lemma, trabajaron en Tandem, que aplica la IA en la atención médica, y ChipStack, que desarrolla agentes de IA para el diseño de chips.
Esas experiencias les ayudaron a exponerse a la dificultad de llevar a los agentes desde entornos de desarrollo controlados a la producción.
“Cole y yo empezamos Lemma porque experimentamos el dolor de construir agentes de IA de primera mano”, dijo Zhang. “Seguíamos encontrando el mismo problema: los agentes parecían funcionar, pero los resultados no eran lo suficientemente confiables en producción”.
Los fundadores argumentan que mejorar los modelos de base subyacentes solos no eliminará este problema. El comportamiento real de los agentes también depende de los prompts, la lógica de la aplicación, las herramientas, las integraciones, los sistemas de recuperación y las cadenas cada vez más complicadas que los conectan.
La tesis de ingeniería de Lemma es que las evaluaciones fuera de línea luchan por reproducir las condiciones impredecibles que los agentes encuentran después de la implementación, lo que hace que los datos de producción sean una fuente importante para comprender dónde se rompen realmente los sistemas.
El desafío más amplio de monitorear a los agentes de IA en producción
La nueva financiación apoyará el desarrollo adicional de las herramientas de monitoreo y detección de fallos de Lemma, con un enfoque inicial en las startups que ya están ejecutando agentes de IA en producción.
La empresa opera en un área que se vuelve más importante a medida que los sistemas de IA se mueven desde demostraciones aisladas a flujos de trabajo del mundo real. Las herramientas de observabilidad tradicionales son generalmente buenas para detectar problemas técnicos como el tiempo de inactividad, la latencia o las solicitudes fallidas, pero los sistemas agente introducen otra capa de complejidad: una aplicación puede permanecer operativa mientras el agente malentende una tarea, elige la herramienta incorrecta o produce un resultado incorrecto.
Esta distinción probablemente se vuelva más significativa a medida que los agentes se utilicen en el soporte al cliente, el análisis financiero, la administración de la atención médica, el desarrollo de software y la investigación. En estos entornos, medir si un agente completó un flujo de trabajo puede importar menos que determinar si lo completó correctamente.
Para Lemma, la oportunidad depende de si el monitoreo de los fallos semánticos se convierte en una parte estándar de la operación de los agentes de IA en producción. La ronda de financiación pre-semilla de $2,3 millones da a la empresa capital adicional para probar esa tesis a medida que las organizaciones despliegan agentes en flujos de trabajo cada vez más complejos.
Qué podría significar un mejor monitoreo de agentes para la IA
A medida que los agentes de IA asumen trabajos más complejos y autónomos, el monitoreo tradicional puede no ser suficiente. Los sistemas futuros necesitarán evaluar no solo si un agente completó una tarea, sino si entendió el objetivo, utilizó las herramientas correctas y produjo el resultado correcto.
Herramientas como Lemma también podrían crear bucles de retroalimentación más estrechos entre la producción y el desarrollo, convirtiendo los fallos del mundo real en nuevas pruebas y mejoras. Con el tiempo, esto podría hacer que la observabilidad del agente se convierta en una parte estándar de la pila de infraestructura de IA, particularmente en entornos de alto riesgo donde la confiabilidad y la rendición de cuentas son más importantes.












