Фінансування

Lemma зібрала $2,3 млн на попередньому етапі для боротьби з тихими невдачами штучного інтелекту в продуктивній роботі

mm
Додайте Unite.AI до бажаних джерел у Google

Стартап Lemma, який займається надійністю штучного інтелекту, зібрав $2,3 млн на попередньому етапі для будівництва інфраструктури моніторингу, призначеної для виявлення особливо складної категорії проблем: штучного інтелекту, який видає помилкові результати під час виконання завдань.

У раунді участь взяли Matrix, Y Combinator, Liquid 2 Ventures, Vermilion Cliffs Ventures, Irregular Expressions, Cervin Ventures, Comma Capital, Position Ventures та Eight Capital, а також ангельські інвестори та оператори з OpenAI, xAI, Meta та DoorDash.

Заснований Джері Чжаном та Коулом Гавіном, Lemma був частиною осінньої партії Y Combinator 2025 року та зосереджується на моніторингу продукції штучного інтелекту. Компанія каже, що її платформа вже обробила понад один мільйон слідів агентів, оскільки інженерні команди все частіше шукають способи зрозуміти, як автономні системи поводяться після розгортання.

Розростання проблеми тихих невдач штучного інтелекту

Традиційний моніторинг програмного забезпечення в основному розроблений навколо явних сигналів невдачі. Застосування виходить з ладу, запит повертає код помилки, затримка спалахує, або компонент інфраструктури стає недоступним.

Штучний інтелект вводить іншу проблему.

Агент може успішно виконати кожний технічний крок у робочому процесі та все одно неправильно зрозуміти, чого хоче користувач, викликати неправильний інструмент, використовувати неправильну інформацію, застрягти в непродуктивному циклі або повернути правдоподібний, але неправильний результат. З точки зору традиційної інфраструктури моніторингу запит може виглядати абсолютно здоровим.

Lemma описує ці як семантичні невдачі. Приклади включають агента обслуговування клієнтів, який цитує неправильну політику повернення коштів, агента аудиту, який генерує застарілий звіт, або агента, який викликає зовнішню систему, використовуючи інформацію, яку він вигадав. Це загальні точки невдачі штучного інтелекту.

Ця відмінність стає все більш важливою, оскільки агенти виходять за межі розмовних інтерфейсів та починають виконувати довші, багатокрокові робочі процеси, де моделі мови взаємодіють з базами даних, інтерфейсами програмування застосунків (API), системами відновлення, інструментами програмного забезпечення та іншими інструментами.

Невдача десь у цій ланцюжку може не викликати виняток. Агент просто продовжить роботу.

Як Lemma моніторить штучний інтелект у продуктивній роботі

Lemma будує шар спостереження конкретно навколо цих шляхів виконання агентів.

Її система трасування перетворює кожне виконання агента у структуровану трасу, яка містить основні великі мовні моделі викликів, інструментів викликів, вхідних даних, вихідних даних, даних про час та помилок, згенерованих у робочому процесі. Інженерні команди можуть тоді вивчити весь дерево виконання, а не дивитися лише на кінцеву відповідь агента.

Але трасування – це тільки частина підходу.

Lemma аналізує продуктивні траси проти інструкцій агента та групує повторювані проблеми у питання, допомагаючи командам визначити моделі невдач, які інакше могли б залишитися поховані по тисячі окремих взаємодій. Платформа також може пріоритизувати питання та надсилати сповіщення через Slack, коли з’являються потенційно значущі проблеми.

Мета полягає у відповіді на більш складне питання, ніж те, чи програмне забезпечення працювало успішно: чи агент насправді досяг того, чого мав досягти?

Це суттєвий зсув у тому, як спостережливість може працювати для програмного забезпечення агентів.

Перетворення продуктивних невдач у покращення агентів

Lemma також намагається скоротити відстань між виявленням проблеми та її виправленням.

Як тільки платформа визначає повторювану невдачу, вона аналізує навколишні траси та контекст, щоб визначити ймовірну причину. Від那里 вона може запропонувати зміни у підказках, логіці застосунку або робочих процесах агентів, а не вимагати від інженерів ручного відновлення кожної проблемної взаємодії.

Компанія розширює цей робочий процес у середовища розробки через сервер протоколу контекstu моделі (MCP). Розробники можуть запитувати траси Lemma з інструментів, включаючи Cursor, Claude Desktop та Claude Code, що дозволяє процесу налагодження відбуватися ближче до місця, де розробляється основний агент.

Після того, як виправлення розгорнуто, Lemma може перетворити продуктивну невдачу на онлайн-оцінку та моніторити її повторення. Це створює зворотній зв’язок, у якому раніше невидимі реальні невдачі стають майбутніми тестами, а не залишаються ізольованими інцидентами.

Цей підхід розширює Lemma трохи далі традиційної спостережливості. Довгострокова мета полягає у створенні інфраструктури, яка допоможе агентам систематично вивчати з продуктивних невдач, а не покладатися повністю на інженерів для виявлення, відтворення та ручного виправлення кожного краю випадку.

Проблема, з якою засновники зіткнулися особисто

Чжан і Гавін зустрілися на першому курсі Університету Південної Каліфорнії та пізніше працювали над системами штучного інтелекту в окремих стартапах, орієнтованих на штучний інтелект. До заснування Lemma вони працювали в Tandem, який застосовує штучний інтелект у сфері охорони здоров’я, та ChipStack, який розробляє агенти штучного інтелекту для проектування мікросхем.

Ці досвіди допомогли їм побачити складність переходу агентів з контрольованих середовищ розробки у продуктивну роботу.

«Кол та я заснували Lemma, оскільки ми особисто зіткнулися з болем будівництва агентів штучного інтелекту», – сказав Чжан. «Ми постійно натикалися на одну й ту ж проблему: агенти видають результати, які не були достатньо надійними у продуктивній роботі».

Засновники стверджують, що покращення лише основних моделей не усуне цю проблему. Поведінка агентів у реальному світі також залежить від підказок, логіки застосунку, інструментів, інтеграцій, систем відновлення, поведінки користувачів та все більш складних ланцюжків, що їх поєднують.

Інженерна теза Lemma полягає у тому, що офлайн-оцінки борються з відтворенням непередбачуваних умов, з якими агенти зустрічаються після розгортання, що робить продуктивні дані важливим джерелом для розуміння того, де системи насправді виходить з ладу.

Ширша проблема моніторингу штучного інтелекту у продуктивній роботі

Нове фінансування підтримає подальшу розробку інструментів моніторингу та виявлення невдач Lemma, з початковим фокусом на стартапах, які вже запускають агенти штучного інтелекту у продуктивній роботі.

Компанія діє у сфері, яка стає все більш важливою, оскільки системи штучного інтелекту переходять від ізольованих демонстрацій до реальних робочих процесів. Традиційні інструменти спостережливості загалом добре виявляють технічні проблеми, такі як простої, затримка або невдалі запити, але агентні системи вводять ще один рівень складності: застосунок може залишатися робочим, тоді як агент неправильно розуміє завдання, вибирає неправильний інструмент або видає неправильний результат.

Ця відмінність, ймовірно, стане ще більш значущою, оскільки агенти будуть використовуватися у сфері підтримки клієнтів, фінансового аналізу, адміністрації охорони здоров’я, розробки програмного забезпечення та наукових досліджень. У цих середовищах вимірювання того, чи агент завершив робочий процес, може мати менше значення, ніж визначення того, чи агент завершив робочий процес правильно.

Для Lemma можливість залежить від того, чи стане моніторинг семантичних невдач стандартною частиною роботи агентів штучного інтелекту у продуктивній роботі. Раунд фінансування на суму $2,3 млн дає компанії додатковий капітал для перевірки цієї тези, оскільки організації розгортають агентів у все більш складних робочих процесах.

Що краще моніторинг агентів може означати для штучного інтелекту

Під час виконання агентами все більш складних і автономних робіт традиційний моніторинг може вже не бути достатнім. Будучі системи повинні оцінювати не тільки те, чи агент виконав завдання, але й чи агент зрозумів мету, використав правильні інструменти та видав правильний результат.

Інструменти, такі як Lemma, також можуть створити тісніші зворотні зв’язки між продуктивною роботою та розробкою, перетворюючи реальні невдачі на нові тести та покращення. З часом це може зробити спостережливість агентів стандартною частиною стека інфраструктури штучного інтелекту, особливо у високих ставках середовищах, де надійність та підзвітність мають найбільше значення.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.