Financiering

Lemma Haalt $2,3 Miljoen Op in Pre-Seed Fonds om Stille AI-Agent Fouten in Productie aan te Pakken

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

AI-agent betrouwbaarheidsstartup Lemma heeft $2,3 miljoen opgehaald in pre-seed financiering om een monitoring-infrastructuur te bouwen die specifiek is ontworpen om een moeilijke klasse van problemen op te sporen: AI-agents die lijken een taak succesvol te hebben voltooid, maar in werkelijkheid de verkeerde resultaten produceren.

De ronde omvat deelname van Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures, en Eight Capital, naast angel-investeerders en operators van OpenAI, xAI, Meta en DoorDash.

Opgericht door Jerry Zhang en Cole Gawin, was Lemma onderdeel van Y Combinator’s Fall 2025-batch en richt zich op productiebewaking voor AI-agents. Het bedrijf zegt dat zijn platform inmiddels meer dan een miljoen agent-traces heeft verwerkt, omdat engineering-teams steeds meer op zoek zijn naar manieren om te begrijpen hoe autonome systemen zich gedragen na implementatie.

Het Groeiende Probleem van AI-Agents die Stil Fouten Maken

Traditionele softwarebewaking is grotendeels ontworpen rond expliciete foutsignalen. Een applicatie crasht, een verzoek retourneert een foutcode, latentie piekt of een infrastructuurcomponent wordt onbeschikbaar.

AI-agents introduceren een ander probleem.

Een agent kan elke technische stap in een workflow succesvol uitvoeren en toch de verkeerde conclusie trekken, de verkeerde tool aanroepen, onjuiste informatie gebruiken, vast komen te zitten in een onproductieve lus of een plausibele maar onjuiste antwoord retourneren. Vanuit het perspectief van conventionele bewakingsinfrastructuur kan het verzoek er perfect gezond uitzien.

Lemma beschrijft deze als semantische fouten. Voorbeelden zijn een klantenservice-agent die het verkeerde restitutiebeleid noemt, een audit-agent die een verouderde rapport genereert, of een agent die een externe systeem aanroept met informatie die hij heeft verzonnen. Dit zijn veelvoorkomende AI-agent foutpunten.

Die onderscheid wordt steeds belangrijker naarmate agents verder gaan dan conversatie-interfaces en langer, meerdere stappen workflows beginnen uitvoeren waarin taalmodellen interactie hebben met databases, applicatieprogramma’s (API’s), opvraagsystemen en andere softwaretools.

Een fout ergens in die keten kan geen uitzondering produceren. De agent kan gewoon doorgaan.

Hoe Lemma AI-Agents in Productie Bewaakt

Lemma bouwt een observatielaag specifiek rond deze agent-uitvoerpaden.

Hun tracingsysteem zet elke agent-uitvoering om in een gestructureerde trace die de onderliggende grote taalmodelaanroepen, toolaanroepen, invoer, uitvoer, tijdsgegevens, opvraagstappen en fouten bevat die tijdens de workflow worden gegenereerd. Engineering-teams kunnen dan het hele uitvoeringsboom bekijken in plaats van alleen naar het eindantwoord van de agent te kijken.

Maar tracering is slechts een deel van de aanpak.

Lemma analyseert productietraces tegen de instructies van een agent en groepeert terugkerende problemen in problemen, waardoor teams foutpatronen kunnen identificeren die anders mogelijk onderduiken in duizenden individuele interacties. Het platform kan ook problemen prioriteren en waarschuwingen sturen via Slack wanneer potentieel significante problemen verschijnen.

Het doel is om een moeilijker vraag te beantwoorden dan of de software succesvol is uitgevoerd: heeft de agent eigenlijk bereikt wat hij zou moeten bereiken?

Dat is een significante verschuiving in hoe observatie mogelijk moet werken voor agente-software.

Productiefouten Omzetten in Agentverbeteringen

Lemma probeert ook de afstand tussen het vinden van een probleem en het oplossen ervan te verkorten.

Als het platform een terugkerende fout identificeert, analyseert het de omliggende traces en context om de waarschijnlijke oorzaak te bepalen. Van daaruit kan het wijzigingen voorstellen in prompts, applicatielogica of agent-workflows, in plaats van engineers te dwingen elke problematische interactie handmatig te reconstrueren.

Het bedrijf breidt die workflow uit naar ontwikkelomgevingen via een Model Context Protocol (MCP)-server. Ontwikkelaars kunnen Lemma’s traces opvragen vanuit tools zoals Cursor, Claude Desktop en Claude Code, waardoor het debugproces dichter bij de onderliggende agent kan plaatsvinden.

Nadat een oplossing is geïmplementeerd, kan Lemma de productiefout omzetten in een online evaluatie en controleren op herhaling. Dit creëert een feedbacklus waarin eerder ongeziene real-world fouten toekomstige tests en verbeteringen worden, in plaats van geïsoleerde incidenten te blijven.

Deze aanpak brengt Lemma enigszins verder dan conventionele observatie. Het langetermijndoel is infrastructuur die agents systematisch helpt leren van productiefouten, in plaats van volledig te vertrouwen op engineers om elke randcase te ontdekken, reproduceren en handmatig te patchen.

Een Probleem dat de Oprichters Zelf Hebben Meegemaakt

Zhang en Gawin ontmoetten elkaar als eerstejaars studenten aan de University of Southern California en werkten later aan AI-systemen bij afzonderlijke AI-natieve startups. Voordat ze Lemma oprichtten, werkten ze bij Tandem, dat AI toepast in de gezondheidszorg, en ChipStack, dat AI-agents ontwikkelt voor chipontwerp.

Die ervaringen hebben hen geholpen om de moeilijkheid van het overbrengen van agents van gecontroleerde ontwikkelomgevingen naar productie te begrijpen.

“Cole en ik zijn Lemma begonnen omdat we de pijn van het bouwen van AI-agents zelf hebben meegemaakt”, zei Zhang. “We bleven tegen hetzelfde probleem aanlopen: agents leken te werken, maar de resultaten waren niet betrouwbaar genoeg in productie.”

De oprichters betogen dat het verbeteren van de onderliggende foundation-modellen alleen dit probleem niet zal elimineren. Real-world agent-gedrag hangt ook af van prompts, applicatielogica, tools, integraties, opvraagsystemen, gebruikersgedrag en de steeds ingewikkelder ketens die hen verbinden.

Lemma’s eigen ingenieurssthese is dat offline-evaluaties worstelen om de onvoorspelbare omstandigheden te reproduceren die agents tegenkomen na implementatie, waardoor productiedata een belangrijke bron vormt voor het begrijpen waar systemen eigenlijk falen.

De Breder Uitdaging van het Bewaken van AI-Agents in Productie

De nieuwe financiering zal de verdere ontwikkeling van Lemma’s monitoring- en foutdetectietools ondersteunen, met een eerste focus op startups die al AI-agents in productie hebben.

Het bedrijf opereert in een gebied dat steeds belangrijker wordt naarmate AI-systemen van geïsoleerde demonstraties naar real-world workflows verhuizen. Traditionele bewakings-tools zijn over het algemeen goed in het detecteren van technische problemen zoals downtime, latentie of mislukte verzoeken, maar agente-systemen introduceren een extra laag van complexiteit: een applicatie kan operationeel blijven terwijl de agent een taak verkeerd begrijpt, de verkeerde tool kiest of een onjuist resultaat produceert.

Die onderscheid zal waarschijnlijk belangrijker worden naarmate agents worden gebruikt in klantenservice, financiële analyse, gezondheidszorg, softwareontwikkeling en onderzoek. In deze omgevingen kan het meten of een agent een workflow heeft voltooid minder belangrijk zijn dan het bepalen of hij de workflow correct heeft voltooid.

Voor Lemma hangt de kans af van of het bewaken van semantische fouten een standaardonderdeel wordt van het gebruik van AI-agents in productie. De $2,3 miljoen pre-seed ronde geeft het bedrijf extra kapitaal om die these te testen terwijl organisaties agents implementeren in steeds complexere workflows.

Wat Beter Agentbewaking voor AI Kan Betekenen

Naarmate AI-agents meer complexe en autonome taken uitvoeren, kan traditionele bewaking mogelijk niet langer voldoende zijn. Toekomstige systemen moeten niet alleen beoordelen of een agent een taak heeft voltooid, maar ook of hij het doel heeft begrepen, de juiste tools heeft gebruikt en het correcte resultaat heeft geproduceerd.

Tools zoals Lemma kunnen ook strakkere feedbacklusjes creëren tussen productie en ontwikkeling, waarbij real-world fouten worden omgezet in nieuwe tests en verbeteringen. Over tijd kan dit agent-observatie een standaardonderdeel maken van de AI-infrastructuurstack, vooral in high-stakes omgevingen waar betrouwbaarheid en verantwoordelijkheid het meest tellen.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.