Finansowanie

Lemma pozyskał 2,3 mln dolarów w rundzie pre-seed, aby rozwiązać problem cichych awarii agentów AI w produkcji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Startup Lemma, specjalizujący się w niezawodności agentów AI, pozyskał 2,3 mln dolarów w rundzie pre-seed, aby zbudować infrastrukturę monitorowania, która pozwoliłaby na wykrywanie szczególnie trudnego rodzaju problemów: agentów AI, które wydają się kończyć zadanie pomyślnie, ale w rzeczywistości produkują błędny wynik.

Runda ta obejmuje udział takich inwestorów, jak Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures oraz Eight Capital, a także aniołów biznesu i operatorów z OpenAI, xAI, Meta i DoorDash.

Założony przez Jerry’ego Zhang i Cole’a Gawin, Lemma był częścią grupy Y Combinator’s Fall 2025 i koncentruje się na monitorowaniu produkcji agentów AI. Firma twierdzi, że jej platforma przetworzyła już ponad milion śladów agentów, gdy zespoły inżynierskie coraz częściej szukają sposobów na zrozumienie, jak zachowują się autonomiczne systemy po wdrożeniu.

Rosnący problem agentów AI, które awaryjnie zawodzą

Tradycyjne monitorowanie oprogramowania jest w dużej mierze zaprojektowane wokół jawnych sygnałów awaryjnych. Aplikacja ulega awarii, żądanie zwraca kod błędu, opóźnienie wzrasta, lub składnik infrastruktury staje się niedostępny.

Agenci AI wprowadzają inny problem.

Agent może pomyślnie wykonać każdy techniczny krok w przepływie pracy i nadal nie zrozumieć, co użytkownik chciał, nazwie nieprawidłowy narzędzie, użyje nieprawidłowych informacji, utknie w nieproduktywnej pętli lub zwróci prawdopodobny, ale nieprawidłowy wynik. Z perspektywy konwencjonalnej infrastruktury monitorowania, żądanie może wyglądać idealnie zdrowo.

Lemma opisuje te przypadki jako awarie semantyczne. Przykłady obejmują agenta obsługi klienta, który cytuje nieprawidłową politykę zwrotu, agenta audytowego, który generuje przestarzały raport, lub agenta, który wywołuje zewnętrzny system, używając informacji, które wymyślił. Są to typowe punkty awaryjne agentów AI.

To rozróżnienie staje się coraz ważniejsze, gdy agenci przechodzą od interfejsów konwersacyjnych do wykonywania dłuższych, wieloetapowych przepływów pracy, w których modele językowe взаимодействują z bazami danych, interfejsami programowania aplikacji (API), systemami pobierania i innymi narzędziami oprogramowania.

Awaria w łańcuchu może nie spowodować wyjątku. Agent może po prostu kontynuować.

Jak Lemma monitoruje agenty AI w produkcji

Lemma buduje warstwę obserwowalności specjalnie wokół tych ścieżek wykonywania agentów.

Ich system śledzenia zamienia każde wykonywanie agenta w ustrukturyzowany ślad zawierający podstawowe wywołania dużych modeli językowych, wywołania narzędzi, dane wejściowe, dane wyjściowe, dane czasowe, kroki pobierania i błędy generowane podczas przepływu pracy. Zespoły inżynierskie mogą następnie zbadać całe drzewo wykonywania, zamiast patrzeć tylko na ostateczną odpowiedź agenta.

Ale śledzenie jest tylko częścią podejścia.

Lemma analizuje ślady produkcji w odniesieniu do instrukcji agenta i grupuje powtarzające się problemy w kwestie, pomagając zespołom identyfikować wzorce awarii, które mogłyby pozostać ukryte w tysiącach poszczególnych interakcji. Platforma może również priorytetowo traktować problemy i wysyłać alerty za pośrednictwem Slack, gdy pojawiają się potencjalnie znaczące problemy.

Celem jest odpowiedź na trudniejsze pytanie niż to, czy oprogramowanie uruchomiło się pomyślnie: Czy agent rzeczywiście osiągnął to, co miał osiągnąć?

To jest znacząca zmiana w tym, jak obserwowalność może działać w przypadku oprogramowania agenticznego.

Zamiana awarii produkcyjnych w ulepszenia agentów

Lemma próbuje również skrócić dystans między znalezieniem problemu a jego naprawieniem.

Gdy platforma identyfikuje powtarzającą się awarię, analizuje otaczające ślady i kontekst, aby określić prawdopodobną przyczynę. Następnie może zaproponować zmiany w promocjach, logice aplikacji lub przepływach pracy agentów, zamiast wymagać od inżynierów ręcznego odtworzenia każdej problematycznej interakcji.

Firma rozszerza ten przepływ pracy na środowiska programistyczne za pomocą serwera Model Context Protocol (MCP). Deweloperzy mogą wysyłać zapytania do śladów Lemma z narzędziami, takimi jak Cursor, Claude Desktop i Claude Code, co pozwala na debugowanie bliżej miejsca, w którym rozwijany jest podstawowy agent.

Po wdrożeniu poprawki Lemma może przekształcić awarię produkcyjną w ocenę online i monitorować jej ponowne wystąpienie. Tworzy to pętlę sprzężenia zwrotnego, w której wcześniej niewidoczne awarie świata rzeczywistego stają się przyszłymi testami, a nie izolowanymi incydentami.

To podejście prowadzi Lemma nieco poza konwencjonalną obserwowalność. Długoterminowym celem jest infrastruktura, która pomaga agentom uczyć się systematycznie z awarii produkcyjnych, zamiast polegać wyłącznie na inżynierach, aby odkryć, odtworzyć i ręcznie naprawić każdy przypadek graniczny.

Problem, z którym współzałożyciele spotkali się osobiście

Zhang i Gawin spotkali się jako studenci pierwszego roku na Uniwersytecie Południowej Kalifornii i później pracowali nad systemami AI w oddzielnych startupach AI. Przed założeniem Lemma pracowali w Tandem, które stosuje AI w ochronie zdrowia, i ChipStack, które rozwija agenty AI do projektowania układów scalonych.

Te doświadczenia pomogły im zrozumieć trudność przeniesienia agentów z kontrolowanych środowisk programistycznych do produkcji.

„Cole i ja założyliśmy Lemma, ponieważ doświadczyliśmy bólu budowy agentów AI osobiście”, powiedział Zhang. „Niezależnie od tego, ile razy próbowaliśmy, agenci wydawali się działać, ale wyniki nie były wystarczająco niezawodne w produkcji”.

Współzałożyciele twierdzą, że poprawa podstawowych modeli fundamentów nie wyeliminuje tego problemu. Zachowanie się agentów w świecie rzeczywistym zależy również od promocji, logiki aplikacji, narzędzi, integracji, systemów pobierania i coraz bardziej skomplikowanych łańcuchów, które je łączą.

Własna teza inżynierska Lemma mówi, że oceny offline mają trudności z odtworzeniem nieprzewidywalnych warunków, które agenci spotykają po wdrożeniu, co sprawia, że dane produkcyjne są ważnym źródłem informacji o tym, gdzie systemy naprawdę ulegają awariom.

Szerszy wyzwanie monitorowania agentów AI w produkcji

Nowe finansowanie wesprze dalszy rozwój narzędzi monitorowania i wykrywania awarii Lemma, z początkowym naciskiem na startupy, które już uruchamiają agenty AI w produkcji.

Firma działa w obszarze, który staje się coraz ważniejszy, gdy systemy AI przechodzą od izolowanych demonstracji do rzeczywistych przepływów pracy. Tradycyjne narzędzia obserwowalności są geralnie dobre w wykrywaniu problemów technicznych, takich jak przestoje, opóźnienia lub nieudane żądania, ale systemy agenticzne wprowadzają kolejną warstwę złożoności: aplikacja może pozostać operacyjna, podczas gdy agent nie rozumie zadania, wybiera nieprawidłowe narzędzie lub produkuje nieprawidłowy wynik.

To rozróżnienie prawdopodobnie stanie się bardziej znaczące, gdy agenci będą stosowani w obszarach takich jak wsparcie klienta, analiza finansowa, administracja ochrony zdrowia, rozwój oprogramowania i badania. W tych środowiskach mierzenie, czy agent zakończył przepływ pracy, może mieć mniejsze znaczenie niż określenie, czy zakończył przepływ pracy poprawnie.

Dla Lemma możliwość zależy od tego, czy monitorowanie awarii semantycznych stanie się standardową częścią obsługi agentów AI w produkcji. Runda pre-seed o wartości 2,3 mln dolarów daje firmie dodatkowy kapitał, aby przetestować tę tezę, gdy organizacje wdrożą agenty w coraz bardziej złożonych przepływach pracy.

Co lepsze monitorowanie agentów może oznaczać dla AI

Gdy agenci AI podejmują coraz bardziej złożoną i autonomiczną pracę, tradycyjne monitorowanie może już nie być wystarczające. Przyszłe systemy będą musiały ocenić, czy agent nie tylko zakończył zadanie, ale także, czy zrozumiał cel, użył odpowiednich narzędzi i wyprodukował prawidłowy wynik.

Narzędzia takie, jak Lemma, mogą również stworzyć ściślejsze pętle sprzężenia zwrotnego między produkcją a rozwojem, przekształcając awarie świata rzeczywistego w nowe testy i ulepszenia. Z czasem może to sprawić, że obserwowalność agentów stanie się standardową częścią stosu infrastruktury AI, zwłaszcza w środowiskach o wysokich stawkach, gdzie niezawodność i odpowiedzialność mają największe znaczenie.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.