Finansiering
Lemma indsamler 2,3 mio. dollars i pre-seed-finansiering til at tackle silent AI-agent-fejl i produktion

AI-agent pÃĨlidelighedsstartup Lemma har indsamlet 2,3 millioner dollars i pre-seed-finansiering til at bygge overvÃĨgningsinfrastruktur, der er designet til at fange en sÃĶrlig svÃĶr klasse af problemer: AI-agenter, der ser ud til at have fuldfÃļrt en opgave succesfuldt, mens de stille producerer det forkerte resultat.
Runden inkluderer deltagelse fra Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures og Eight Capital, samt engleinvestorer og operatÃļrer fra OpenAI, xAI, Meta og DoorDash.
Lemma blev grundlagt af Jerry Zhang og Cole Gawin og var en del af Y Combinators efterÃĨr 2025-batch. Virksomheden fokuserer pÃĨ produktionsovervÃĨgning for AI-agenter. Selskabet siger, at deres platform nu har behandlet mere end en million agent-spor, da ingeniÃļrteamene stadig sÃļger efter mÃĨder at forstÃĨ, hvordan autonome systemer opfÃļrer sig efter installation.
Det voksende problem med AI-agenter, der fejler stille
Traditionel softwareovervÃĨgning er primÃĶrt designet omkring eksplicitte fejlsignaler. En applikation crasher, en anmodning returnerer en fejlkode, latency spidser, eller en infrastrukturkomponent bliver utilgÃĶngelig.
AI-agenter introducerer et andet problem.
En agent kan udfÃļre hver teknisk trin i en arbejdsgang og alligevel misforstÃĨ, hvad brugeren Ãļnskede, ringe til det forkerte vÃĶrktÃļj, bruge forkert information, blive fast i en uproduktiv lÃļkke eller returnere et plausibelt, men forkert svar. Set fra konventionel overvÃĨgningsinfrastrukturs synspunkt kan anmodningen se fuldstÃĶndig sund ud.
Lemma beskriver disse som semantiske fejl. Eksempler inkluderer en kundeserviceagent, der citerer den forkerte refunderingspolitik, en revisionsagent, der genererer en forÃĶldet rapport, eller en agent, der ringer til et eksternt system ved hjÃĶlp af information, den har opfundet. Disse er almindelige AI-agent fejlpunkter.
Denne forskel bliver stadig vigtigere, da agenterne bevÃĶger sig ud over konversationsgrÃĶnser og begynder at udfÃļre lÃĶngere, multi-trins arbejdsgange, hvor sprogmodeller interagerer med databaser, programmeringsgrÃĶnseflader (APIâer), hentningssystemer og andre softwarevÃĶrktÃļjer.
En fejl et sted i den kÃĶde kan ikke producere en undtagelse. Agenten kan blot fortsÃĶtte.
Hvordan Lemma overvÃĨger AI-agenter i produktion
Lemma bygger et overvÃĨgningslag specifikt omkring disse agent-udfÃļrelsesveje.
Deres sporingssystem omdanner hver agent-udfÃļrelse til en struktureret spor, der indeholder de underliggende store sprogmodel-kald, vÃĶrktÃļjsanmodninger, indgange, udgange, tidsdata, hentningstrin og fejl, der genereres under arbejdsgangen. IngeniÃļrteam kan derefter undersÃļge hele udfÃļrelsestrÃĶet i stedet for kun at se pÃĨ agentens endelige svar.
Men sporing er kun en del af tilgangen.
Lemma analyserer produktionspor mod agentens instruktioner og grupperer gentagne problemer i problemer, hvilket hjÃĶlper team med at identificere fejlmÃļnstre, der ellers kan forblive begravet pÃĨ tvÃĶrs af tusinder af enkeltinteraktioner. Platformen kan ogsÃĨ prioritere problemer og sende beskeder via Slack, nÃĨr potentielt betydningsfulde problemer dukker op.
MÃĨlet er at besvare et mere svÃĶrt spÃļrgsmÃĨl end, om softwaren kÃļrte succesfuldt: OpnÃĨede agenten faktisk, hvad den skulle opnÃĨ?
Det er en betydelig ÃĶndring i, hvordan overvÃĨgning mÃĨske skal fungere for agenter.
At omdanne produktionsfejl til agentforbedringer
Lemma forsÃļger ogsÃĨ at forkorte afstanden mellem at finde et problem og at lÃļse det.
NÃĨr platformen identificerer en gentagen fejl, analyserer den de omgivende spor og kontekst for at bestemme en sandsynlig rodÃĨrsag. Derefter kan den foreslÃĨ ÃĶndringer til prompts, applikationslogik eller agent-arbejdsgange i stedet for at krÃĶve, at ingeniÃļrer manuelt genskaber hver problematisk interaktion.
Virksomheden udvider denne arbejdsgang til udviklingsmiljÃļer gennem en Model Context Protocol (MCP)-server. Udviklere kan forespÃļrgse Lemmas spor fra vÃĶrktÃļjer, herunder Cursor, Claude Desktop og Claude Code, hvilket tillader, at fejlfindingprocessen sker tÃĶttere pÃĨ, hvor den underliggende agent udvikles.
Efter en lÃļsning er installeret, kan Lemma omdanne produktionsfejlen til en online-evaluering og overvÃĨge dens gentagelse. Dette skaber en feedback-lÃļkke, hvor tidligere usete realverdenfejl bliver fremtidige tests og forbedringer i stedet for at forblive isolerede tilfÃĶlde.
Denne tilgang fÃļrer Lemma lidt ud over konventionel overvÃĨgning. Det langsigtede mÃĨl er infrastruktur, der hjÃĶlper agenter med at lÃĶre systematisk fra produktionsfejl i stedet for at afhÃĶnge fuldstÃĶndigt af ingeniÃļrer til at opdage, genskabe og manuelt lave hver kanttilfÃĶlde.
Et problem, grundlÃĶggerne selv oplevede
Zhang og Gawin mÃļdte hinanden som fÃļrsteÃĨrselever pÃĨ University of Southern California og arbejdede senere med AI-systemer pÃĨ separate AI-native startups. FÃļr de grundlagde Lemma, arbejdede de pÃĨ Tandem, der anvender AI i sundhedssektoren, og ChipStack, der udvikler AI-agenter til chipdesign.
Disse erfaringer hjalp med at afslÃļre dem for svÃĶrheden ved at tage agenter fra kontrollerede udviklingsmiljÃļer til produktion.
âCole og jeg startede Lemma, fordi vi selv oplevede smerten ved at bygge AI-agenter,â sagde Zhang. âVi lÃļb igen og igen ind i det samme problem: Agenterne sÃĨ ud til at fungere, men resultaterne var ikke pÃĨlidelige nok i produktion.â
GrundlÃĶggerne mener, at forbedring af de underliggende grundmodeller alene ikke vil eliminere dette problem. Realverden-agenteradfÃĶrd afhÃĶnger ogsÃĨ af prompts, applikationslogik, vÃĶrktÃļjer, integrationer, hentningssystemer, brugeradfÃĶrd og de stadig mere komplicerede kÃĶder, der forbinder dem.
Lemmas egen ingeniÃļrtese er, at offline-evalueringer kÃĶmper for at genskabe de uforudsigelige betingelser, agenterne mÃļder efter installation, hvilket gÃļr produktionsdata til en vigtig kilde til at forstÃĨ, hvor systemerne faktisk bryder sammen.
Den bredere udfordring ved at overvÃĨge AI-agenter i produktion
Den nye finansiering vil stÃļtte yderligere udvikling af Lemmas overvÃĨgnings- og fejldetektionsvÃĶrktÃļjer, med en initial fokus pÃĨ startups, der allerede kÃļrer AI-agenter i produktion.
Virksomheden opererer i et omrÃĨde, der bliver mere vigtigt, da AI-systemer bevÃĶger sig fra isolerede demonstrationer til realverdensarbejdsgange. Traditionelle overvÃĨgningsvÃĶrktÃļjer er generelt gode til at detektere tekniske problemer som downtime, latency eller fejlede anmodninger, men agenter introducerer en anden lag af kompleksitet: En applikation kan forblive operativ, mens agenten misforstÃĨr en opgave, vÃĶlger det forkerte vÃĶrktÃļj eller producerer et forkert resultat.
Denne forskel er sandsynligvis mere betydningsfuld, da agenterne bruges pÃĨ tvÃĶrs af kundesupport, finansielle analyser, sundhedsadministration, softwareudvikling og forskning. I disse miljÃļer kan det vÃĶre mindre vigtigt at mÃĨle, om en agent fuldfÃļrte en arbejdsgang, end at bestemme, om den fuldfÃļrte arbejdsgangen korrekt.
For Lemma afhÃĶnger muligheden af, om overvÃĨgning af semantiske fejl bliver en standarddel af at kÃļre AI-agenter i produktion. Den 2,3 millioner dollars pre-seed-runde giver virksomheden yderligere kapital til at teste denne tese, da organisationer deployer agenter pÃĨ tvÃĶrs af stadig mere komplekse arbejdsgange.
Hvad bedre agentovervÃĨgning kunne betyde for AI
Da AI-agenter pÃĨtager sig mere komplekse og autonome arbejde, kan traditionel overvÃĨgning ikke lÃĶngere vÃĶre nok. Fremtidige systemer skal evaluere, om en agent ikke kun fuldfÃļrte en opgave, men ogsÃĨ, om den forstod mÃĨlet, brugte de rigtige vÃĶrktÃļjer og producerede det korrekte resultat.
VÃĶrktÃļjer som Lemma kunne ogsÃĨ skabe tÃĶttere feedback-lÃļkker mellem produktion og udvikling, hvilket omdanner realverdensfejl til nye tests og forbedringer. Over tid kan dette gÃļre agentovervÃĨgning til en standarddel af AI-infrastrukturstaben, isÃĶr i miljÃļer med hÃļje indsatsomkostninger, hvor pÃĨlidelighed og ansvarlighed betyder mest.












