Finansiering
Lemma Samlar In 2,3 Miljoner Dollar I För-Seed-Finansiering För Att Hantera Tysta AI-Agentsfel I Produktion

AI-agenttillförlitlighetsstartupp Lemma har samlat in 2,3 miljoner dollar i för-seed-finansiering för att bygga övervakningsinfrastruktur som är utformad för att upptäcka en särskilt svår klass av problem: AI-agenter som verkar ha slutfört en uppgift framgångsrikt medan de tyst producerar felaktiga resultat.
Rundan inkluderar deltagande från Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures, och Eight Capital, tillsammans med ängelinvesterare och operatörer från OpenAI, xAI, Meta och DoorDash.
Lemma grundades av Jerry Zhang och Cole Gawin och var en del av Y Combinators höstbatch 2025. Företaget fokuserar på produktionsövervakning för AI-agenter. Bolaget säger att dess plattform nu har bearbetat mer än en miljon agent-spårningar, eftersom ingenjörsteam alltmer letar efter sätt att förstå hur autonoma system beter sig efter distribution.
Det Växande Problemet Med AI-Agenter Som Misslyckas Tyst
Traditionell programvaruövervakning är till stor del utformad kring explicita felmeddelanden. Ett program kraschar, en begäran returnerar ett felkod, svarstiden ökar eller en infrastrukturkomponent blir otillgänglig.
AI-agenter introducerar ett annat problem.
En agent kan utföra varje teknisk steg i en arbetsflöde och ändå missförstå vad användaren ville, ringa fel verktyg, använda felaktig information, fastna i en oproduktiv loop eller returnera ett trovärdigt men felaktigt svar. Ur konventionell övervakningsinfrastrukturs synvinkel kan begäran se helt frisk ut.
Lemma beskriver dessa som semantiska fel. Exempel inkluderar en kundtjänstagent som citerar fel återbetalningspolicy, en revisionsagent som genererar en inaktuell rapport eller en agent som ringer en extern system med information som den har uppfunnit. Dessa är vanliga AI-agent fel punkter.
Den distinktionen blir allt viktigare när agenter flyttar bortom konversationsgränssnitt och börjar utföra längre, flerstegsarbetsflöden där språkmodeller interagerar med databaser, API:er, återställningssystem och andra programvaror.
Ett fel någonstans i den kedjan kan inte producera ett undantag. Agenten kan fortsätta.
Hur Lemma Övervakar AI-Agenter I Produktion
Lemma bygger ett observabilitetsskikt specifikt runt dessa agentutförandestigar.
Deras spårningssystem omvandlar varje agentutförande till en strukturerad spårning som innehåller de underliggande stora språkmodellssamtalen, verktygsanrop, indata, utdata, tidsdata, återställningssteg och fel som genereras under arbetsflödet. Ingenjörsteam kan sedan undersöka hela exekveringsträdet snarare än att bara titta på agentens slutliga svar.
Men spårning är bara en del av tillvägagångssättet.
Lemma analyserar produktionspårningar mot en agents instruktioner och grupperar återkommande problem i frågor, vilket hjälper team att identifiera felmönster som annars kan förbli begravda över tusentals enskilda interaktioner. Plattformen kan också prioritera frågor och skicka aviseringar via Slack när potentiellt betydande problem visas.
Målet är att besvara en svårare fråga än om programvaran kördes framgångsrikt: Utförde agenten faktiskt det den var tänkt att göra?
Det är en betydande förändring i hur observabilitet kan behöva fungera för agenter.
Omformning Av Produktionsfel Till Agentförbättringar
Lemma försöker också förkorta avståndet mellan att hitta ett problem och åtgärda det.
När plattformen identifierar ett återkommande fel analyserar den de omgivande spårningarna och sammanhanget för att fastställa en sannolik rotorsak. Därifrån kan den föreslå ändringar av uppmaningar, programlogik eller agentarbetsflöden snarare än att kräva att ingenjörer manuellt återskapar varje problematisk interaktion.
Företaget utvidgar den arbetsflödet till utvecklingsmiljöer via en modellkontextprotokoll (MCP)-server. Utvecklare kan fråga Lemmas spårningar från verktyg som Cursor, Claude Desktop och Claude Code, vilket gör att felsökningsprocessen kan ske närmare där den underliggande agenten utvecklas.
Efter att en korrigering har distribuerats kan Lemma omvandla produktionsfelet till en onlineutvärdering och övervaka dess återkomst. Detta skapar en återkopplingsloop där tidigare osedda realvärldsfel blir framtida tester snarare än att förbli isolerade incidenter.
Detta tillvägagångssätt för Lemma något utöver konventionell observabilitet. Det långsiktiga målet är infrastruktur som hjälper agenter att lära sig systematiskt av produktionsfel snarare än att förlita sig helt på ingenjörer för att upptäcka, reproducera och manuellt laga varje kanthändelse.
Ett Problem Som Grundarna Stött På Personligen
Zhang och Gawin möttes som nybörjare vid University of Southern California och arbetade senare med AI-system på separata AI-nativa startups. Innan de grundade Lemma arbetade de på Tandem, som tillämpar AI i hälso- och sjukvård, och ChipStack, som utvecklar AI-agenter för chipdesign.
De erfarenheterna hjälpte till att avslöja dem för svårigheten att ta agenter från kontrollerade utvecklingsmiljöer till produktion.
“Cole och jag startade Lemma för att vi upplevde smärtan av att bygga AI-agenter personligen”, sa Zhang. “Vi fortsatte att stöta på samma problem: agenter verkade fungera, men resultaten var inte tillförlitliga nog i produktion.”
Grundarna hävdar att förbättring av underliggande grundmodeller ensam inte kommer att eliminera det här problemet. Verkliga agentbeteenden beror också på uppmaningar, programlogik, verktyg, integreringar, återställningssystem, användarbeteende och de alltmer komplicerade kedjor som kopplar dem samman.
Lemmas egen ingenjörstes är att offlineutvärderingar kämpar för att reproducera de oförutsägbara förhållanden som agenter möter efter distribution, vilket gör produktionsdata till en viktig källa för att förstå var system faktiskt bryter samman.
Den Större Utmaningen Att Övervaka AI-Agenter I Produktion
Den nya finansieringen kommer att stödja ytterligare utveckling av Lemmas övervaknings- och felupptäktverktyg, med ett första fokus på startups som redan kör AI-agenter i produktion.
Företaget verkar inom ett område som blir allt viktigare när AI-system flyttar från isolerade demonstrationer till riktiga arbetsflöden. Traditionella övervakningsverktyg är generellt bra på att upptäcka tekniska problem som driftstopp, svarstid eller misslyckade begäranden, men agentbaserade system introducerar en annan lager av komplexitet: ett program kan förbli operativt medan agenten missförstår en uppgift, väljer fel verktyg eller producerar ett felaktigt resultat.
Den distinktionen kommer sannolikt att bli mer betydande när agenter används över kundsupport, finansiell analys, hälso- och sjukvårdsadministration, programvaruutveckling och forskning. I dessa miljöer kan det vara mindre viktigt att mäta om en agent slutförde ett arbetsflöde än att avgöra om den slutförde det korrekt.
För Lemma beror möjligheten på om övervakning av semantiska fel blir en standarddel av att köra AI-agenter i produktion. De 2,3 miljoner dollar i för-seed-finansiering ger företaget ytterligare kapital för att testa den tesen när organisationer distribuerar agenter över alltmer komplexa arbetsflöden.
Vad Bättre Agentövervakning Kunde Betyda För AI
När AI-agenter tar på sig mer komplexa och autonoma uppgifter kan traditionell övervakning inte längre räcka till. Framtida system kommer att behöva utvärdera inte bara om en agent slutförde en uppgift, utan om den förstod målet, använde rätt verktyg och producerade rätt resultat.
Verktyg som Lemma kunde också skapa tätare återkopplingsloopar mellan produktion och utveckling, omvandla realvärldsfel till nya tester och förbättringar. Över tid kan detta göra agentövervakning till en standarddel av AI-infrastrukturstacken, särskilt i miljöer med höga insatser där tillförlitlighet och ansvarighet är viktigast.












