Finansiering

Lemma samler inn 2,3 millioner dollar i pre-seed-finansiering for å takle stille AI-agentfeil i produksjon

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

AI-agent-pålitelighetsstartupen Lemma har samlet inn 2,3 millioner dollar i pre-seed-finansiering for å bygge overvåkingsinfrastruktur som er designet for å fange en spesielt vanskelig klasse av problemer: AI-agenter som ser ut til å ha fullført en oppgave suksessfullt, men i hemmelighet produserer feil resultat.

Runden inkluderer deltakelse fra Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures og Eight Capital, samt engelinvesterere og operatører fra OpenAI, xAI, Meta og DoorDash.

Lemma ble grunnlagt av Jerry Zhang og Cole Gawin, og var en del av Y Combinators høstbatch i 2025. Selskapet fokuserer på produksjonsovervåking for AI-agenter. De sier at deres plattform nå har prosessert over en million agent-spor, ettersom ingeniørteamene stadig søker etter måter å forstå hvordan autonome systemer oppfører seg etter distribusjon.

Det økende problemet med AI-agenter som feiler stille

Tradisjonell programvareovervåking er i stor grad designet rundt eksplisitte feilsignaler. En applikasjon krasjer, en forespørsel returnerer en feilkode, latensen øker, eller en infrastrukturkomponent blir utilgjengelig.

AI-agenter introduserer et annet problem.

En agent kan utføre hver teknisk steg i en arbeidsflyt og likevel misforstå hva brukeren ønsket, ringe feil verktøy, bruke feil informasjon, bli fast i en unproduktiv løkke eller returnere et plausibelt, men feilaktig svar. Fra konvensjonell overvåkingsinfrastrukturs perspektiv kan forespørselen se helt frisk ut.

Lemma beskriver disse som semantiske feil. Eksempler inkluderer en kundeserviceagent som nevner feil refusjonspolitikk, en revisjonsagent som genererer en utdatert rapport eller en agent som ringer en ekstern system ved hjelp av informasjon den har funnet opp. Disse er vanlige AI-agentfeilpunkter.

Denne distinksjonen blir stadig viktigere ettersom agenter flytter seg beyond konversasjonsgrensesnitt og begynner å utføre lengre, flertrinnsarbeidsflyter hvor språkmodeller samhandler med databaser, programmeringsgrensesnitt (API-er), innhentingssystemer og andre programværktøy.

En feil et sted i denne kjeden kan ikke produsere en unntak. Agenten kan bare fortsette.

Hvordan Lemma overvåker AI-agenter i produksjon

Lemma bygger en overvåkingslag spesifikt rundt disse agent-utføringsspor.

Deres sporingsystem gjør hver agent-utføring om til en strukturert spor som inneholder de underliggende store språkmodellkall, verktøykall, inn-data, ut-data, tiddata, innhentingssteg og feil som genereres gjennom arbeidsflyten. Ingeniørteamene kan deretter undersøke hele utførings-treet i stedet for å se bare på agentens endelige svar.

Men sporings er bare en del av tilnærmingen.

Lemma analyserer produksjonsspor mot en agents instruksjoner og grupperer gjentakende problemer i problemer, som hjelper teamene med å identifisere feil-mønster som ellers kan forbli gravlagt over tusenvis av enkeltinteraksjoner. Plattformen kan også prioritere problemer og sende varslinger gjennom Slack når potensielt betydelige problemer dukker opp.

Målet er å svare på et vanskeligere spørsmål enn om programvaren kjørte suksessfullt: Greide agenten faktisk å oppnå hva den var ment å oppnå?

Dette er en betydelig endring i hvordan overvåking kan fungere for agenter.

Omvandling av produksjonsfeil til agent-forbedringer

Lemma prøver også å forkorte avstanden mellom å finne et problem og å fikse det.

Når plattformen identifiserer en gjentakende feil, analyserer den de omgivende spor og konteksten for å bestemme en sannsynlig rotårsak. Deretter kan den foreslå endringer i promter, applikasjonslogikk eller agent-arbeidsflyt i stedet for å kreve at ingeniører manuelt rekonstruerer hver problematisk interaksjon.

Selskapet utvider denne arbeidsflyten til utviklingsmiljøer gjennom en Modellkontekstprotokoll (MCP)-tjener. Utviklere kan spørre Lemmas spor fra verktøy som Cursor, Claude Desktop og Claude Code, som gjør at feilsøkingsprosessen kan skje nærmere der den underliggende agenten utvikles.

Etter at en fiksering er distribuert, kan Lemma omgjøre produksjonsfeilen til en online-evaluering og overvåke dens gjentakelse. Dette skaper en tilbakemeldingsloop hvor tidligere usette, virkelige feil blir fremtidige tester i stedet for å forbli isolerte hendelser.

Dette tilnærmingen skyver Lemma litt utenfor konvensjonell overvåking. Det lengrevarige målet er infrastruktur som hjelper agenter med å lære systematisk fra produksjonsfeil i stedet for å være avhengig av ingeniører til å oppdage, reprodusere og manuelt fikse hver enkelt kantfall.

Et problem grunnleggerne møtte personlig

Zhang og Gawin møttes som førsteårsstudenter ved University of Southern California og arbeidet senere med AI-systemer i separate AI-native startups. Før de grunnla Lemma, arbeidet de i Tandem, som anvender AI i helsevesenet, og ChipStack, som utvikler AI-agenter for chipdesign.

Disse erfaringene hjalp med å avdekke vanskeligheten med å ta agenter fra kontrollerte utviklingsmiljøer til produksjon.

“Cole og jeg startet Lemma fordi vi opplevde smerten med å bygge AI-agenter personlig,” sa Zhang. “Vi fortsatte å løpe inn i samme problem: agenter ville se ut til å fungere, men resultater var ikke pålitelige nok i produksjon.”

Grundleggerne hevder at å forbedre de underliggende grunnmodellene alene vil ikke eliminere dette problemet. Virkelige agent-atferd avhenger også av promter, applikasjonslogikk, verktøy, integrasjoner, innhentingssystemer, brukeratferd og de stadig mer kompliserte kjedene som kobler dem sammen.

Lemmas egen ingeniørtese er at offline-evalueringer sliter med å reprodusere de uforutsigbare betingelsene agenter møter etter distribusjon, og at produksjonsdata er en viktig kilde for å forstå hvor systemer faktisk bryter sammen.

Den bredere utfordringen med å overvåke AI-agenter i produksjon

Den nye finansieringen vil støtte videre utvikling av Lemmas overvåkings- og feil-dettektverktøy, med en opprinnelig fokus på startups som allerede kjører AI-agenter i produksjon.

Selskapet opererer i et område som blir stadig viktigere ettersom AI-systemer flytter seg fra isolerte demonstrasjoner til virkelige arbeidsflyter. Tradisjonelle overvåkingsverktøy er generelt gode til å detektere tekniske problemer som nedtid, latens eller feil forespørsler, men agenter introduserer en annen lag med kompleksitet: en applikasjon kan forbli operativ mens agenten misforstår en oppgave, velger feil verktøy eller produserer et feilaktig resultat.

Denne distinksjonen er sannsynligvis å bli mer betydelig ettersom agenter brukes over kundeservice, finansiell analyse, helseadministrasjon, programvareutvikling og forskning. I disse miljøene kan måling av om en agent fullførte en arbeidsflyt være mindre viktig enn å bestemme om den fullførte arbeidsflyten riktig.

For Lemma er muligheten derfor avhengig av om overvåking av semantiske feil blir en standarddel av å kjøre AI-agenter i produksjon. De 2,3 millioner dollar i pre-seed-runden gir selskapet ekstra kapital til å teste denne tesen ettersom organisasjoner distribuerer agenter over stadig mer komplekse arbeidsflyter.

Hva bedre agent-overvåking kan bety for AI

Ettersom AI-agenter tar på seg mer komplekse og autonome arbeid, kan tradisjonell overvåking ikke lenger være nok. Fremtidige systemer må vurdere ikke bare om en agent fullførte en oppgave, men også om den forstod målet, brukte riktige verktøy og produserte riktig resultat.

Verktøy som Lemma kunne også skape tettere tilbakemeldingsløkker mellom produksjon og utvikling, og omdanne virkelige feil til nye tester og forbedringer. Over tid kan dette gjøre agent-overvåking til en standarddel av AI-infrastruktur-staken, spesielt i høyrisikomiljøer hvor pålitelighet og ansvarlighet betyr mest.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.