Financement

Lemma lève 2,3 millions de dollars en pré-amorçage pour résoudre les défaillances silencieuses des agents IA en production

mm
Ajouter Unite.AI à vos sources préférées sur Google

La startup de fiabilité des agents IA, Lemma, a levé 2,3 millions de dollars en pré-amorçage pour construire une infrastructure de surveillance conçue pour détecter une classe de problèmes particulièrement difficiles : les agents IA qui semblent avoir terminé une tâche avec succès tout en produisant discrètement un résultat incorrect.

Le tour comprend la participation de Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures, et Eight Capital, aux côtés d’investisseurs providentiels et d’opérateurs d’OpenAI, xAI, Meta et DoorDash.

Fondée par Jerry Zhang et Cole Gawin, Lemma faisait partie du lot d’automne 2025 de Y Combinator et se concentre sur la surveillance de production pour les agents IA. La société affirme que sa plate-forme a désormais traité plus d’un million de traces d’agents, les équipes d’ingénierie recherchant de plus en plus de moyens pour comprendre comment les systèmes autonomes se comportent après leur déploiement.

Le problème croissant des agents IA qui défaillent silencieusement

La surveillance logicielle traditionnelle est en grande partie conçue autour de signaux de défaillance explicites. Une application plante, une requête renvoie un code d’erreur, la latence augmente ou un composant d’infrastructure devient indisponible.

Les agents IA introduisent un problème différent.

Un agent peut exécuter avec succès chaque étape technique d’un flux de travail et néanmoins mal comprendre ce que l’utilisateur voulait, appeler l’outil incorrect, utiliser des informations incorrectes, rester bloqué dans une boucle non productive ou renvoyer une réponse plausible mais incorrecte. Du point de vue de l’infrastructure de surveillance conventionnelle, la requête peut paraître parfaitement saine.

Lemma décrit ces cas comme des défaillances sémantiques. Des exemples incluent un agent de service client qui cite la mauvaise politique de remboursement, un agent d’audit qui génère un rapport obsolète ou un agent qui appelle un système externe en utilisant des informations qu’il a inventées. Ce sont des points de défaillance d’agents IA courants .

Cette distinction devient de plus en plus importante à mesure que les agents dépassent les interfaces conversationnelles et commencent à exécuter des flux de travail plus longs et plus complexes, où les modèles de langage interagissent avec des bases de données, des interfaces de programmation d’applications (API), des systèmes de récupération et d’autres outils logiciels.

Une défaillance quelque part dans cette chaîne peut ne pas produire d’exception. L’agent peut simplement continuer.

Comment Lemma surveille les agents IA en production

Lemma construit une couche d’observabilité spécifiquement autour de ces chemins d’exécution d’agents.

Son système de traçage transforme chaque exécution d’agent en une trace structurée contenant les appels de modèles de langage de grande taille sous-jacents, les invocations d’outils, les entrées, les sorties, les données de temporisation, les étapes de récupération et les erreurs générées tout au long du flux de travail. Les équipes d’ingénierie peuvent alors examiner un arbre d’exécution complet plutôt que de ne regarder que la réponse finale de l’agent.

Mais le traçage n’est qu’une partie de l’approche.

Lemma analyse les traces de production par rapport aux instructions de l’agent et regroupe les problèmes récurrents en problèmes, aidant les équipes à identifier les modèles de défaillance qui pourraient autrement rester enfouis à travers des milliers d’interactions individuelles. La plate-forme peut également prioriser les problèmes et envoyer des alertes via Slack lorsque des problèmes potentiellement importants apparaissent.

L’objectif est de répondre à une question plus difficile que celle de savoir si le logiciel a fonctionné avec succès : l’agent a-t-il réellement accompli ce qu’il était censé accomplir ?

C’est un changement significatif dans la façon dont l’observabilité peut devoir fonctionner pour les logiciels agents.

Transformer les défaillances de production en améliorations d’agents

Lemma tente également de raccourcir la distance entre la découverte d’un problème et sa résolution.

Une fois que la plate-forme identifie une défaillance récurrente, elle analyse les traces et le contexte environnants pour déterminer une cause racine probable. À partir de là, elle peut proposer des modifications aux invites, à la logique d’application ou aux flux de travail d’agents plutôt que d’exiger que les ingénieurs reconstituent manuellement chaque interaction problématique.

La société étend ce flux de travail dans les environnements de développement via un serveur de protocole de contexte de modèle (MCP). Les développeurs peuvent interroger les traces de Lemma à partir d’outils tels que Cursor, Claude Desktop et Claude Code, permettant au processus de débogage de se produire plus près de l’endroit où l’agent sous-jacent est développé.

Une fois que la correction est déployée, Lemma peut transformer la défaillance de production en une évaluation en ligne et surveiller sa récurrence. Cela crée une boucle de rétroaction dans laquelle des défaillances réelles du monde réel, auparavant inconnues, deviennent des tests et des améliorations futurs plutôt que de rester des incidents isolés.

Cette approche pousse Lemma un peu au-delà de l’observabilité conventionnelle. L’objectif à long terme est d’avoir une infrastructure qui aide les agents à apprendre systématiquement des défaillances de production plutôt que de compter entièrement sur les ingénieurs pour découvrir, reproduire et corriger manuellement chaque cas de bordure.

Un problème que les fondateurs ont rencontré personnellement

Zhang et Gawin se sont rencontrés en tant que freshmen à l’Université de Californie du Sud et ont plus tard travaillé sur des systèmes d’IA dans des startups d’IA natives distinctes. Avant de fonder Lemma, ils ont travaillé chez Tandem, qui applique l’IA dans les soins de santé, et ChipStack, qui développe des agents d’IA pour la conception de puces.

Ces expériences les ont aidés à découvrir la difficulté de passer des agents des environnements de développement contrôlés à la production.

« Cole et moi avons créé Lemma parce que nous avons vécu la douleur de construire des agents d’IA en personne », a déclaré Zhang. « Nous nous heurtions constamment au même problème : les agents semblaient fonctionner, mais les résultats n’étaient pas fiables enough en production. »

Les fondateurs soutiennent qu’améliorer les modèles de base sous-jacents ne suffira pas à éliminer ce problème. Le comportement réel des agents dépend également des invites, de la logique d’application, des outils, des intégrations, des systèmes de récupération, du comportement des utilisateurs et des chaînes de plus en plus compliquées qui les relient.

La thèse d’ingénierie de Lemma est que les évaluations hors ligne peinent à reproduire les conditions imprévisibles que les agents rencontrent après leur déploiement, ce qui rend les données de production une source importante pour comprendre où les systèmes réels se cassent.

Le défi plus large de la surveillance des agents IA en production

Le nouveau financement soutiendra le développement ultérieur des outils de surveillance et de détection de défaillance de Lemma, avec une attention initiale sur les startups qui exécutent déjà des agents d’IA en production.

La société opère dans un domaine qui devient de plus en plus important à mesure que les systèmes d’IA passent des démonstrations isolées à des flux de travail réels. Les outils d’observabilité traditionnels sont généralement bons pour détecter des problèmes techniques tels que les temps d’arrêt, la latence ou les requêtes échouées, mais les systèmes agents introduisent une autre couche de complexité : une application peut rester opérationnelle tandis que l’agent mal comprend une tâche, choisisse l’outil incorrect ou produise un résultat incorrect.

Cette distinction est susceptible de devenir plus significative à mesure que les agents sont utilisés dans le support client, l’analyse financière, l’administration des soins de santé, le développement de logiciels et la recherche. Dans ces environnements, mesurer si un agent a terminé un flux de travail peut importer moins que déterminer s’il a terminé le flux de travail correctement.

Pour Lemma, l’opportunité dépend donc de savoir si la surveillance des défaillances sémantiques devient une partie standard de l’exécution des agents d’IA en production. Le tour de pré-amorçage de 2,3 millions de dollars donne à la société un capital supplémentaire pour tester cette thèse à mesure que les organisations déployeront des agents à travers des flux de travail de plus en plus complexes.

Ce que pourrait signifier une meilleure surveillance des agents pour l’IA

À mesure que les agents d’IA prennent en charge des tâches plus complexes et plus autonomes, la surveillance traditionnelle peut ne plus suffire. Les systèmes futurs devront évaluer non seulement si un agent a terminé une tâche, mais également s’il a compris l’objectif, utilisé les bons outils et produit le résultat correct.

Des outils comme Lemma pourraient également créer des boucles de rétroaction plus étroites entre la production et le développement, transformant les défaillances réelles du monde réel en nouveaux tests et améliorations. Avec le temps, cela pourrait faire de l’observabilité des agents une partie standard de la pile d’infrastructure d’IA, en particulier dans les environnements à enjeux élevés où la fiabilité et la responsabilité sont les plus importantes.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.