Finanzierung

Lemma erhÃĪlt 2,3 Millionen Dollar fÞr Pre-Seed-Finanzierung, um stille AI-Agenten-Fehler in der Produktion zu bekÃĪmpfen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Das Startup fÞr die ZuverlÃĪssigkeit von kÞnstlicher Intelligenz, Lemma, hat 2,3 Millionen Dollar an Pre-Seed-Finanzierung aufgenommen, um Überwachungsinfrastruktur zu entwickeln, die speziell auf die Erkennung einer besonders schwierigen Klasse von Problemen ausgerichtet ist: KI-Agents, die den Anschein erwecken, eine Aufgabe erfolgreich abgeschlossen zu haben, wÃĪhrend sie stillschweigend das falsche Ergebnis produzieren.

Die Runde umfasst die Beteiligung von Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures und Eight Capital, neben Engelinvestoren und Betreibern von OpenAI, xAI, Meta und DoorDash.

GegrÞndet von Jerry Zhang und Cole Gawin, war Lemma Teil der Herbst-Batch 2025 von Y Combinator und konzentriert sich auf die Überwachung von KI-Agents in der Produktion. Das Unternehmen gibt an, dass seine Plattform bereits Þber eine Million Agenten-Spuren verarbeitet hat, wÃĪhrend Ingenieur-Teams zunehmend nach Wegen suchen, um zu verstehen, wie autonome Systeme nach der Bereitstellung funktionieren.

Das wachsende Problem von KI-Agents, die stillschweigend fehlschlagen

Traditionelle Software-Überwachung ist grÃķßtenteils auf explizite Fehler-Signale ausgerichtet. Eine Anwendung stÞrzt ab, eine Anfrage gibt einen Fehlercode zurÞck, die Latenz steigt oder ein Infrastruktur-Komponent wird nicht verfÞgbar.

KI-Agents stellen ein anderes Problem dar.

Ein Agent kann jeden technischen Schritt in einem Workflow erfolgreich ausfÞhren und dennoch missverstehen, was der Benutzer wollte, das falsche Tool aufrufen, falsche Informationen verwenden, in einer unproduktiven Schleife stecken bleiben oder eine plausible, aber falsche Antwort zurÞckgeben. Aus der Perspektive der herkÃķmmlichen Überwachungs-Infrastruktur kann die Anfrage vÃķllig gesund aussehen.

Lemma bezeichnet diese als semantische Fehler. Beispiele umfassen einen Kundenservice-Agenten, der die falsche RÞckerstattungsrichtlinie zitiert, einen PrÞfungs-Agenten, der einen veralteten Bericht generiert, oder einen Agenten, der ein externes System mit Informationen aufruft, die er erfunden hat. Diese sind hÃĪufige KI-Agenten-Fehlerpunkte.

Diese Unterscheidung wird zunehmend wichtig, da Agents Þber konversationale Schnittstellen hinausgehen und lÃĪngere, mehrstufige Workflows ausfÞhren, bei denen Sprachmodelle mit Datenbanken, APIs, Abrufsystemen und anderen Software-Tools interagieren.

Ein Fehler irgendwo in dieser Kette kann keine Ausnahme produzieren. Der Agent kann einfach weitermachen.

Wie Lemma KI-Agents in der Produktion Þberwacht

Lemma baut eine ObservabilitÃĪtsschicht speziell um diese Agenten-AusfÞhrungspfade herum.

Ihr Spur-System verwandelt jede Agenten-AusfÞhrung in eine strukturierte Spur, die die zugrunde liegenden großen Sprachmodell-Aufrufe, Tool-Aufrufe, Eingaben, Ausgaben, Zeitdaten, Abrufschritte und Fehler enthÃĪlt, die wÃĪhrend des Workflows generiert werden. Ingenieur-Teams kÃķnnen dann den gesamten AusfÞhrungsbaum untersuchen, anstatt nur auf die endgÞltige Antwort des Agents zu schauen.

Aber Spuren sind nur ein Teil des Ansatzes.

Lemma analysiert Produktions-Spuren gegen die Anweisungen eines Agents und gruppiert wiederkehrende Probleme in Probleme, um Teams zu helfen, Fehlermuster zu identifizieren, die sonst mÃķglicherweise Þber Tausende von individuellen Interaktionen hinweg verborgen bleiben. Die Plattform kann auch Probleme priorisieren und Þber Slack warnen, wenn potenziell signifikante Probleme auftauchen.

Das Ziel ist, eine schwierigere Frage zu beantworten, als ob die Software erfolgreich gelaufen ist: Hat der Agent tatsÃĪchlich das erreicht, was er erreichen sollte?

Das ist ein bedeutender Schritt in der Art und Weise, wie ObservabilitÃĪt fÞr agierende Software funktionieren muss.

Produktionsfehler in Agenten-Verbesserungen umwandeln

Lemma versucht auch, den Abstand zwischen der Erkennung eines Problems und seiner Behebung zu verkÞrzen.

Sobald die Plattform einen wiederkehrenden Fehler identifiziert, analysiert sie die umgebenden Spuren und den Kontext, um eine wahrscheinliche Ursache zu bestimmen. Von dort aus kann sie Änderungen an Prompts, Anwendungslogik oder Agenten-Workflows vorschlagen, anstatt Ingenieuren zu erfordern, jeden problematischen Vorgang manuell zu rekonstruieren.

Das Unternehmen erweitert diesen Workflow in Entwicklungsumgebungen durch einen Model-Context-Protocol-Server. Entwickler kÃķnnen Lemmas Spuren aus Tools wie Cursor, Claude Desktop und Claude Code abfragen, sodass der Debug-Prozess nÃĪher an der Stelle stattfinden kann, an der das zugrunde liegende Agenten-System entwickelt wird.

Nachdem ein Fix bereitgestellt wurde, kann Lemma den Produktionsfehler in eine Online-Bewertung umwandeln und auf sein Wiederauftreten achten. Dies schafft eine RÞckkopplungsschleife, in der bisher nicht gesehene realweltliche Fehler zu zukÞnftigen Tests und Verbesserungen werden, anstatt isolierte VorfÃĪlle zu bleiben.

Dieser Ansatz bringt Lemma ein wenig Þber die herkÃķmmliche ObservabilitÃĪt hinaus. Das langfristige Ziel ist eine Infrastruktur, die Agents systematisch von Produktionsfehlern lernen lÃĪsst, anstatt sich ausschließlich auf Ingenieure zu verlassen, um jeden Randfall zu entdecken, zu reproduzieren und manuell zu patchen.

Ein Problem, das die GrÞnder selbst erlebt haben

Zhang und Gawin trafen sich als Erstsemester an der University of Southern California und arbeiteten spÃĪter an KI-Systemen bei verschiedenen KI-nativen Startups. Bevor sie Lemma grÞndeten, arbeiteten sie bei Tandem, das KI im Gesundheitswesen anwendet, und ChipStack, das KI-Agents fÞr Chip-Design entwickelt.

Diese Erfahrungen halfen ihnen, die Schwierigkeit zu erkennen, Agents aus kontrollierten Entwicklungsumgebungen in die Produktion zu ÞberfÞhren.

“Cole und ich haben Lemma gegrÞndet, weil wir den Schmerz des Aufbaus von KI-Agents selbst erlebt haben”, sagte Zhang. “Wir rannten immer wieder an das gleiche Problem: Agents schienen zu funktionieren, aber die Ergebnisse waren in der Produktion nicht zuverlÃĪssig genug.”

Die GrÞnder argumentieren, dass die Verbesserung der zugrunde liegenden Grundmodell allein dieses Problem nicht beseitigen wird. Das realweltliche Verhalten von Agents hÃĪngt auch von Prompts, Anwendungslogik, Tools, Integrationen, Abrufsystemen, Benutzerverhalten und den zunehmend komplizierten Ketten, die sie verbinden, ab.

Lemmas eigene Ingenieur-These ist, dass Offline-Bewertungen Schwierigkeiten haben, die unvorhersehbaren Bedingungen zu reproduzieren, mit denen Agents nach der Bereitstellung konfrontiert sind, wodurch Produktionsdaten eine wichtige Quelle fÞr das VerstÃĪndnis darstellen, wo Systeme tatsÃĪchlich versagen.

Die breitere Herausforderung der Überwachung von KI-Agents in der Produktion

Die neue Finanzierung wird die weitere Entwicklung von Lemmas Überwachungs- und Fehler-Erkennungstools unterstÞtzen, mit einem anfÃĪnglichen Fokus auf Startups, die bereits KI-Agents in der Produktion einsetzen.

Das Unternehmen operiert in einem Bereich, der zunehmend wichtiger wird, da KI-Systeme von isolierten Demonstrationen in realweltliche Workflows Þbergehen. Traditionelle Überwachungstools sind im Allgemeinen gut darin, technische Probleme wie Ausfallzeiten, Latenz oder fehlgeschlagene Anfragen zu erkennen, aber agentische Systeme stellen eine weitere Ebene der KomplexitÃĪt dar: Eine Anwendung kann weiterhin funktionsfÃĪhig sein, wÃĪhrend der Agent eine Aufgabe missversteht, das falsche Tool wÃĪhlt oder ein falsches Ergebnis produziert.

Diese Unterscheidung wird wahrscheinlich noch bedeutender, da Agents in Bereichen wie Kundensupport, Finanzanalyse, Gesundheitsverwaltung, Software-Entwicklung und Forschung eingesetzt werden. In diesen Umgebungen kann die Messung, ob ein Agent einen Workflow abgeschlossen hat, weniger wichtig sein als die Bestimmung, ob er den Workflow korrekt abgeschlossen hat.

FÞr Lemma hÃĪngt die Chance daher davon ab, ob die Überwachung semantischer Fehler zu einem Standardbestandteil des Betriebs von KI-Agents in der Produktion wird. Die Pre-Seed-Runde von 2,3 Millionen Dollar gibt dem Unternehmen zusÃĪtzliches Kapital, um diese These zu testen, wÃĪhrend Organisationen Agents Þber zunehmend komplexe Workflows einsetzen.

Was bessere Agenten-Überwachung fÞr KI bedeuten kÃķnnte

Wenn KI-Agents komplexere und autonomere Arbeiten Þbernehmen, kann traditionelle Überwachung mÃķglicherweise nicht mehr ausreichen. Zukunftssysteme mÞssen beurteilen, ob ein Agent nicht nur eine Aufgabe abgeschlossen hat, sondern auch, ob er das Ziel verstanden, das richtige Tool verwendet und das korrekte Ergebnis produziert hat.

Tools wie Lemma kÃķnnten auch engere RÞckkopplungsschleifen zwischen Produktion und Entwicklung schaffen, indem sie realweltliche Fehler in neue Tests und Verbesserungen umwandeln. Im Laufe der Zeit kÃķnnte dies dazu fÞhren, dass die ObservabilitÃĪt von Agents zu einem Standardbestandteil des KI-Infrastruktur-Stacks wird, insbesondere in Umgebungen mit hohen Risiken, in denen ZuverlÃĪssigkeit und Rechenschaftspflicht am wichtigsten sind.

Antoine ist ein visionÃĪrer Leiter und GrÞndungspartner von Unite.AI, getrieben von einer unerschÞtterlichen Leidenschaft fÞr die Gestaltung und FÃķrderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI fÞr die Gesellschaft so disruptiv sein wird wie ElektrizitÃĪt, und er wird oft dabei erwischt, wie er Þber das Potenzial disruptiver Technologien und AGI schwÃĪrmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prÃĪgen werden. DarÞber hinaus ist er der GrÞnder von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.