Financování

Lemma Získala 2,3 Milionu dolarů Před-seed Financování Pro Řešení Problému Tichého Selhání AI Agentů V Provozu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Společnost Lemma, která se specializuje na spolehlivost AI agentů, získala 2,3 milionu dolarů v před-seed financování za účelem vybudování monitorovací infrastruktury, která je navržena pro odhalení zvláště obtížné třídy problémů: AI agenti, kteří se zdají dokončit úloha úspěšně, zatímco potichu produkují nesprávný výsledek.

Financování zahrnuje účast od Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures a Eight Capital, spolu s andělskými investory a operátory z OpenAI, xAI, Meta a DoorDash.

Společnost Lemma byla založena Jerry Zhangem a Cole Gawinem a je součástí Y Combinator’s Fall 2025 batch. Společnost se zaměřuje na monitorování produkce pro AI agenty. Společnost uvádí, že její platforma již zpracovala více než jeden milion stop agentů, protože inženýrské týmy stále hledají způsoby, jak pochopit, jak se autonomní systémy chovají po nasazení.

Rostoucí Problém AI Agentů, Kteří Selhávají Tichě

Tradiční monitorování softwaru je většinou navrženo kolem explicitních signálů selhání. Aplikace havaruje, požadavek vrátí chybový kód, latence vzroste nebo komponent infrastruktury se stane nedostupným.

AI agenti představují jiný problém.

Agent může úspěšně provést každý technický krok v pracovním postupu a přesto nepochopit, co uživatel chtěl, zavolat špatný nástroj, použít nesprávné informace, stát se uvězněným v neproduktivním cyklu nebo vrátit pravděpodobný, ale nesprávný výsledek. Z pohledu konvenční monitorovací infrastruktury může požadavek vypadat dokonale zdravý.

Lemma popisuje tyto jako semantické selhání. Příklady zahrnují zákaznického servisního agenta, který cituje špatnou refundační politiku, auditního agenta, který generuje zastaralou zprávu, nebo agenta, který volá externí systém pomocí informací, které vymyslel. Tyto jsou běžné bod selhání AI agentů.

Tento rozdíl se stává stále důležitějším, protože agenti přecházejí za hranice konverzačních rozhraní a začínají provádět delší, vícekrokové pracovní postupy, kde jazykové modely interagují s databázemi, aplikačními programovacími rozhraními (API), systémy načítání a jinými softwarovými nástroji.

Selhání někde v této řetězci nemusí produkovat výjimku. Agent může jednoduše pokračovat.

Jak Lemma Monitoruje AI Agenty V Provozu

Lemma buduje vrstvu pozorovatelnosti specificky kolem těchto cest provádění agentů.

<p Jejich systém stopování převádí každé provedení agenta na strukturovanou stopu, která obsahuje podkladové velké jazykové modely, volání nástrojů, vstupní a výstupní data, časová data, kroky načítání a chyby generované během pracovního postupu. Inženýrské týmy mohou poté prozkoumat celý strom provádění místo toho, aby se dívaly pouze na konečnou odpověď agenta.

Ale stopování je pouze částí přístupu.

Lemma analyzuje produkční stopy proti instrukcím agenta a seskupuje opakující se problémy do problémů, což pomáhá týmům identifikovat vzorce selhání, které by jinak mohly zůstat pohřbeny napříč tisíci jednotlivými interakcemi. Platforma může také priorizovat problémy a posílat upozornění prostřednictvím Slacku, když se objeví potenciálně významné problémy.

Cílem je zodpovědět obtížnější otázku, než zda software běžel úspěšně: zda agent skutečně dosáhl toho, co měl dosáhnout.

To je významný posun v tom, jak pozorovatelnost může fungovat pro agenticí software.

Převod Produkčních Selhání Na Zlepšení Agentů

Lemma se také snaží zkrátit vzdálenost mezi nalezením problému a jeho opravou.

Jakmile platforma identifikuje opakující se selhání, analyzuje okolní stopy a kontext, aby určila pravděpodobnou příčinu. Odtud může navrhnout změny promptů, aplikační logiky nebo pracovních postupů agentů, místo aby vyžadovala, aby inženýři ručně rekonstruovali každou problematickou interakci.

Společnost rozšiřuje tento pracovní postup do vývojových prostředí prostřednictvím serveru Model Context Protocol (MCP). Vývojáři mohou dotazovat stopy Lemma z nástrojů, včetně Cursor, Claude Desktop a Claude Code, což umožňuje, aby se proces ladění udál blíže k místu, kde je základní agent vyvíjen.

Po nasazení opravy může Lemma převést produkční selhání na online hodnocení a monitorovat jeho opakování. Tím se vytváří zpětná vazba, ve které dříve neviditelná reálná selhání se stávají budoucími testy, místo aby zůstaly izolovanými incidenty.

Tento přístup posouvá Lemma somewhat za hranice konvenční pozorovatelnosti. Dlouhodobým cílem je infrastruktura, která pomáhá agentům učit se systematicky z produkčních selhání, místo aby se spoléhala pouze na inženýry, aby objevili, reprodukovali a ručně opravili každý okrajový případ.

Problém, Který Zakladatelé Zažili Osobně

Zhang a Gawin se seznámili jako čerství studenti na University of Southern California a později pracovali na AI systémech v samostatných AI-nativních startupách. Před založením Lemma pracovali v Tandem, který aplikuje AI ve zdravotnictví, a ChipStack, který vyvíjí AI agenty pro návrh čipů.

Tyto zkušenosti jim pomohly odhalit obtížnost převodu agentů z řízených vývojových prostředí do produkce.

„Cole a já jsme založili Lemma, protože jsme osobně zažili bolest budování AI agentů,“ řekl Zhang. „Stále jsme naráželi na stejný problém: agenti se zdáli fungovat, ale výsledky nebyly dostatečně spolehlivé v produkci.“

Zakladatelé argumentují, že zlepšování základních modelů samo o sobě nevyřeší tento problém. Reálné chování agentů také závisí na promptech, aplikační logice, nástrojích, integračních systémech, systémech načítání a stále komplikovanějších řetězcích, které je spojují.

Vlastní inženýrská teze Lemma je, že offline hodnocení zápasí s reprodukcí nepředvídatelných podmínek, se kterými se agenti setkávají po nasazení, což činí produkční data důležitým zdrojem pro pochopení, kde systémy skutečně selhávají.

Širší Výzva Monitorování AI Agentů V Provozu

Nové financování bude podporovat další vývoj monitorovacích a detekčních nástrojů Lemma, s počátečním zaměřením na startupy, které již běží AI agenty v produkci.

Společnost funguje v oblasti, která se stává stále důležitější, protože AI systémy přecházejí z izolovaných demonstrací do reálných pracovních postupů. Tradiční nástroje pro monitorování jsou obecně dobré v detekci technických problémů, jako je downtime, latence nebo selhání požadavků, ale agenticí systémy představují další vrstvu komplexity: aplikace může zůstat funkční, zatímco agent nepochopí úkol, zvolí špatný nástroj nebo produkuje nesprávný výsledek.

Tento rozdíl je pravděpodobně ještě významnější, protože agenti jsou používáni v zákaznické podpoře, finanční analýze, správě zdravotnictví, softwarovém vývoji a výzkumu. V těchto prostředích může měření, zda agent dokončil pracovní postup, záležet méně než určení, zda pracovní postup dokončil správně.

Pro Lemma je příležitost tedy závislá na tom, zda monitorování semantických selhání se stane standardní součástí provozu AI agentů v produkci. Před-seed kolo ve výši 2,3 milionu dolarů poskytuje společnosti další kapitál pro testování této teze, protože organizace nasazují agenty napříč stále složitějšími pracovními postupy.

Co Lepší Monitorování Agentů Může Znamenat Pro AI

Jak AI agenti přebírají více komplexní a autonomní práci, tradiční monitorování již nemusí být dostatečné. Budoucí systémy budou muset hodnotit, zda agent dokončil úkol, zda pochopil cíl, zda použil správné nástroje a zda produkoval správný výsledek.

Nástroje, jako je Lemma, by také mohly vytvořit těsnější zpětnou vazbu mezi produkcí a vývojem, převádějící reálná selhání na nové testy a zlepšení. V průběhu času by to mohlo učinit pozorovatelnost agentů standardní součástí AI infrastruktury, zejména v prostředí s vysokými zárukami, kde spolehlivost a zodpovědnost záleží nejvíce.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.