Finanțare

Lemma atrage 2,3 milioane de dolari în fonduri pre-seed pentru a aborda eșecurile agenților de inteligență artificială care nu sunt vizibile în producție

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Startup-ul de inteligență artificială Lemma a obținut 2,3 milioane de dolari în fonduri pre-seed pentru a construi o infrastructură de monitorizare destinată să detecteze o clasă dificilă de probleme: agenții de inteligență artificială care par să fi finalizat o sarcină cu succes, dar care produc în mod tacit un rezultat incorect.

Runda de finanțare include participarea unor investitori precum Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures și Eight Capital, alături de investitori îngeri și operatori de la OpenAI, xAI, Meta și DoorDash.

Înființat de Jerry Zhang și Cole Gawin, Lemma a făcut parte din seria de toamnă a lui Y Combinator din 2025 și se axează pe monitorizarea producției pentru agenții de inteligență artificială. Compania afirmă că platforma sa a procesat peste un milion de urme de agent, pe măsură ce echipele de ingineri caută modalități de a înțelege cum se comportă sistemele autonome după implementare.

Problema în creștere a agenților de inteligență artificială care eșuează în mod tacit

Monitorizarea software-ului tradiționalional este în mare măsură concepută în jurul semnalelor de eșec explicite. O aplicație se prăbușește, o cerere returnează un cod de eroare, latența crește sau un component de infrastructură devine indisponibil.

Agenții de inteligență artificială introduc o altă problemă.

Un agent poate executa cu succes fiecare pas tehnic dintr-un flux de lucru și totuși să nu înțeleagă ce a dorit utilizatorul, să apeleze la uneltele greșite, să utilizeze informații incorecte, să rămână blocat într-un buclă improductivă sau să returneze un răspuns plauzibil, dar incorect. Din perspectiva infrastructurii de monitorizare convențională, cererea poate părea perfect sănătoasă.

Lemma descrie aceste situații ca fiind eșecuri semantice. Exemple includ un agent de asistență pentru clienți care citează o politică de rambursare incorectă, un agent de audit care generează un raport învechit sau un agent care apelează la un sistem extern folosind informații inventate. Acestea sunt puncte comune de eșec pentru agenții de inteligență artificială.

Această distincție devine din ce în ce mai importantă pe măsură ce agenții trec dincolo de interfețele conversaționale și încep să execute fluxuri de lucru mai lungi și mai complexe, în care modelele de limbaj interacționează cu baze de date, interfețe de programare a aplicațiilor (API), sisteme de recuperare și alte unelte software.

Un eșec undeva în acea lanț poate să nu producă o excepție. Agentul poate pur și simplu să continue.

Cum monitorizează Lemma agenții de inteligență artificială în producție

Lemma construiește un strat de observabilitate specific pentru aceste căi de execuție ale agenților.

Sistemul său de urmărire transformă fiecare execuție a agentului într-o urmă structurată care conține apelurile modelului de limbaj mare, invocările de unelte, intrările, ieșirile, datele de temporizare și erorile generate pe tot parcursul fluxului de lucru. Echipele de ingineri pot examina astfel un întreg arbore de execuție, și nu doar răspunsul final al agentului.

Însă urmărirea este doar o parte a abordării.

Lemma analizează urmele de producție împotriva instrucțiunilor agentului și grupează problemele recurente în probleme, ajutând echipele să identifice modele de eșec care ar fi putut rămâne ascunse în mii de interacțiuni individuale. Platforma poate prioritiza, de asemenea, problemele și trimite alerte prin Slack atunci când apar posibile probleme semnificative.

Obiectivul este de a răspunde la o întrebare mai dificilă decât dacă software-ul a rulat cu succes: A reușit agentul să îndeplinească ceea ce trebuia să facă?

Acesta este un schimbare semnificativă în modul în care observabilitatea poate fi necesară pentru software-ul agențial.

Transformarea eșecurilor de producție în îmbunătățiri ale agenților

Lemma încearcă, de asemenea, să scurteze distanța dintre găsirea unei probleme și corectarea ei.

Odată ce platforma identifică un eșec recurent, analizează urmele și contextul din jurul lui pentru a determina o cauză probabilă. De acolo, poate propune modificări la prompturi, logica aplicației sau fluxurile de lucru ale agenților, mai degrabă decât să solicite inginerilor să reconstituie manual fiecare interacțiune problematică.

Compania extinde acest flux de lucru în mediile de dezvoltare prin intermediul unui server Model Context Protocol (MCP). Dezvoltatorii pot interoga urmele Lemma din unelte precum Cursor, Claude Desktop și Claude Code, permițând procesului de depanare să aibă loc mai aproape de locul unde este dezvoltat agentul în sine.

După implementarea unei corecții, Lemma poate transforma eșecul de producție într-o evaluare online și monitoriza recurența lui. Acest lucru creează un buclă de feedback în care eșecurile reale din lumea reală devin teste și îmbunătățiri viitoare, mai degrabă decât să rămână incidente izolate.

Acestă abordare împinge Lemma puțin dincolo de observabilitatea convențională. Obiectivul pe termen lung este de a crea o infrastructură care ajută agenții să învețe în mod sistematic din eșecurile de producție, mai degrabă decât să se bazeze în întregime pe ingineri pentru a descoperi, reproduce și corecta manual fiecare caz marginal.

O problemă cu care fondatorii s-au confruntat din proprie experiență

Zhang și Gawin s-au întâlnit ca studenți în primul an la Universitatea din California de Sud și au lucrat ulterior la sisteme de inteligență artificială în startup-uri native de inteligență artificială separate. Înainte de a fonda Lemma, au lucrat la Tandem, care aplică inteligența artificială în sănătate, și la ChipStack, care dezvoltă agenți de inteligență artificială pentru proiectarea de cipuri.

Aceste experiențe i-au expus dificultății de a trece de la medii de dezvoltare controlate la producție.

„Cole și cu mine am început Lemma pentru că am experimentat durerea de a construi agenți de inteligență artificială din proprie experiență”, a spus Zhang. „Am continuat să ne confruntăm cu aceeași problemă: agenții păreau să funcționeze, dar rezultatele nu erau suficient de fiabile în producție.”

Fondatorii susțin că îmbunătățirea modelelor de bază fundamentale nu va elimina această problemă. Comportamentul real al agenților depinde și de prompturi, logica aplicației, unelte, integrări, sisteme de recuperare, comportamentul utilizatorilor și lanțurile din ce în ce mai complicate care le leagă.

Teza de inginerie a lui Lemma este că evaluările offline au dificultăți în a reproduce condițiile imprevizibile pe care le întâlnesc agenții după implementare, făcând datele de producție o sursă importantă pentru înțelegerea locurilor în care sistemele se defectează cu adevărat.

Provocarea mai largă a monitorizării agenților de inteligență artificială în producție

Noul fond va sprijini dezvoltarea ulterioară a uneltelor de monitorizare și detectare a eșecurilor Lemma, cu un accent inițial pe startup-urile care rulează deja agenți de inteligență artificială în producție.

Compania operează într-o zonă care devine din ce în ce mai importantă pe măsură ce sistemele de inteligență artificială trec de la demonstrații izolate la fluxuri de lucru din lumea reală. Uneltele tradiționale de observabilitate sunt în general bune la detectarea problemelor tehnice, cum ar fi downtime, latență sau cereri eșuate, dar sistemele agențiale introduc o altă strat de complexitate: o aplicație poate rămâne operațională, în timp ce agentul nu înțelege o sarcină, alege uneltele greșite sau produce un rezultat incorect.

Această distincție este probabil să devină și mai semnificativă pe măsură ce agenții sunt utilizați în domenii precum suportul clienților, analiza financiară, administrația sănătății, dezvoltarea software-ului și cercetarea. În aceste medii, măsurarea dacă un agent a finalizat un flux de lucru poate fi mai puțin importantă decât determinarea dacă a finalizat fluxul de lucru corect.

Pentru Lemma, oportunitatea depinde de faptul dacă monitorizarea eșecurilor semantice devine o parte standard a operării agenților de inteligență artificială în producție. Runda de 2,3 milioane de dolari pre-seed oferă companiei capital suplimentar pentru a testa această teză pe măsură ce organizațiile implementează agenți în fluxuri de lucru din ce în ce mai complexe.

Ce ar putea însemna o monitorizare mai bună a agenților pentru inteligența artificială

Pe măsură ce agenții de inteligență artificială preiau sarcini mai complexe și mai autonome, monitorizarea tradițională poate să nu mai fie suficientă. Sistemele viitoare vor trebui să evalueze nu numai dacă un agent a finalizat o sarcină, ci și dacă a înțeles obiectivul, a utilizat uneltele corecte și a produs rezultatul corect.

Unelte precum Lemma ar putea, de asemenea, să creeze bucle de feedback mai strânse între producție și dezvoltare, transformând eșecurile din lumea reală în noi teste și îmbunătățiri. În timp, acest lucru ar putea face observabilitatea agenților o parte standard a stivei de infrastructură de inteligență artificială, în special în medii cu risc ridicat în care securitatea și răspunderea sunt cele mai importante.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.