資金調達
Lemmaが230万ドルのプレスीड資金を調達し、生産環境でのサイレントなAIエージェントの故障に取り組む

AIエージェントの信頼性スタートアップであるLemmaは、230万ドルのプレスीड資金を調達し、特に難しい問題クラスである、タスクを成功裏に完了したように見せかけて、実際には誤った結果を生成するAIエージェントを検出するように設計されたモニタリングインフラストラクチャを構築するために資金を調達しました。
このラウンドには、Matrix、Y Combinator、Liquid 2 Ventures、Vermilion Cliffs Ventures、Irregular Expressions、Cervin Ventures、Comma Capital、Position Ventures、およびEight Capitalが参加し、OpenAI、xAI、Meta、DoorDashからのエンジェル投資家およびオペレーターも参加しています。
Jerry ZhangとCole Gawinによって設立されたLemmaは、Y Combinatorの2025年秋バッチの一部であり、AIエージェントの生産環境モニタリングに焦点を当てています。同社は、エンジニアリングチームがデプロイ後の自律システムの動作を理解する方法を探しているため、プラットフォームが100万を超えるエージェントトレースを処理したと述べています。
サイレントに故障するAIエージェントの増加する問題
従来のソフトウェアモニタリングは、主に明示的な故障シグナルを中心に設計されています。アプリケーションがクラッシュした場合、リクエストがエラーコードを返した場合、待ち時間が増加した場合、またはインフラストラクチャコンポーネントが利用できない場合です。
AIエージェントは別の問題を引き起こします。
エージェントは、ワークフロー内の技術的なすべてのステップを正常に実行していても、ユーザーが何を望んでいたかを誤解したり、間違ったツールを呼んだり、不正確な情報を使用したり、非生産的なループに陥ったり、妥当だが不正確な答えを返したりすることができます。従来のモニタリングインフラストラクチャの観点から見ると、リクエストは完全に正常に見えます。
Lemmaはこれをセマンティック故障と呼んでいます。例として、顧客サービスエージェントが間違った返金ポリシーを引用したり、監査エージェントが古いレポートを生成したり、エージェントが外部システムを呼び出すために発明された情報を使用したりします。これらは、一般的なAIエージェントの故障点です。
この区別は、エージェントが会話型インターフェイスを超えて、長いマルチステップのワークフローを実行し始め、言語モデルがデータベース、API、検索システム、その他のソフトウェアツールと相互作用するようになると、ますます重要になります。
エージェントが故障しても、例外が発生しない可能性があります。エージェントはただ続行するだけです。
Lemmaが生産環境でAIエージェントをモニタリングする方法
Lemmaは、これらのエージェントの実行パスを中心に、観察可能性レイヤーを構築しています。
トレーシングシステムは、各エージェントの実行を、基礎となる大規模言語モデルの呼び出し、ツールの呼び出し、入力、出力、タイミングデータ、リトリーバルステップ、およびワークフロー全体で生成されるエラーを含む構造化トレースに変換します。エンジニアリングチームは、エージェントの最終的な応答のみを見るのではなく、実行の全体像を調べることができます。
ただし、トレーシングはアプローチの一部にすぎません。
Lemmaは、生産トレースをエージェントの指示と比較して分析し、繰り返し発生する問題を問題にグループ化して、チームが個々のインタラクションに散在する可能性のある故障パターンを特定するのに役立ちます。プラットフォームは問題を優先順位付けし、潜在的に重大な問題が発生したときにSlack経由でアラートを送信することもできます。
目的は、ソフトウェアが正常に実行されたかどうかという質問よりも、エージェントが実際に何を達成するように設計されたかという質問に答えることです。
これは、エージェントソフトウェアの観察可能性がどのように機能する必要があるかという点で、重大なシフトです。
生産環境での故障をエージェントの改善に変える
Lemmaは、問題を発見して修正するまでの距離を短縮しようとしています。
プラットフォームが繰り返し発生する故障を特定すると、周囲のトレースとコンテキストを分析して、最も可能性の高い根本的な原因を決定します。その後、エンジニアが毎回問題のあるインタラクションを手動で再構築する必要なく、プロンプト、ロジック、またはエージェントのワークフローへの変更を提案できます。
同社は、Model Context Protocol (MCP) サーバーを介して開発環境にこのワークフローを拡張しています。開発者は、Cursor、Claude Desktop、Claude CodeなどのツールからLemmaのトレースを照会し、デバッグプロセスをエージェントが開発されている場所に近づけることができます。
修正がデプロイされると、Lemmaは生産環境での故障をオンライン評価に変え、再発を監視できます。これにより、以前には見られなかった実世界の故障が将来のテストとなり、単なる孤立したインシデントではなくなります。
このアプローチは、Lemmaを従来の観察可能性の範囲を超えて拡大します。長期的な目標は、エンジニアが毎回エッジケースを発見して修正するのではなく、生産環境での故障からエージェントが体系的に学習できるインフラストラクチャを構築することです。
設立者が直面した問題
ZhangとGawinは、南カリフォルニア大学の新入生として出会い、後にAIネイティブのスタートアップでAIシステムに取り組みました。Lemmaを設立する前に、Tandem(ヘルスケアでAIを適用)とChipStack(チップ設計用のAIエージェントを開発)で働きました。
これらの経験は、彼らが開発環境から生産環境へのエージェントの移行の難しさを理解するのに役立ちました。
「コールと私は、AIエージェントの構築の痛みを直接経験したため、Lemmaを始めました」とZhangは述べています。「エージェントは動作するように見えたが、生産環境では結果が十分に信頼できるものではありませんでした。」
設立者は、基礎モデルのみを改善してもこの問題を解決できないと主張しています。実世界のエージェントの動作は、プロンプト、ロジック、ツール、統合、リトリーバルシステム、ユーザーの動作、およびそれらを接続する複雑なチェーンにも依存します。
Lemmaの独自のエンジニアリングテーゼは、オフライン評価がデプロイ後の予測不可能な条件を再現するのに苦労するため、生産データはシステムが実際にどのように壊れるかを理解するための重要な情報源であるということです。
生産環境でのAIエージェントのモニタリングのより広範な課題
新しい資金は、特にすでに生産環境でAIエージェントを実行しているスタートアップに初期焦点を当てて、Lemmaのモニタリングおよび故障検出ツールのさらなる開発を支援します。
同社は、AIシステムが分離されたデモから実際のワークフローへの移行が重要性を増す分野で活動しています。従来の観察可能性ツールは、ダウンタイム、待ち時間、失敗したリクエストなどの技術的な問題を検出するのに優れていますが、エージェントシステムは別の複雑さのレベルを導入します。アプリケーションは動作しているかもしれませんが、エージェントはタスクを誤解したり、間違ったツールを選択したり、不正確な結果を生成したりします。
この区別は、エージェントが顧客サポート、財務分析、ヘルスケア管理、ソフトウェア開発、研究に使用されるようになるにつれて、ますます重要になります。これらの環境では、エージェントがワークフローを完了したかどうかよりも、エージェントがワークフローを正しく完了したかどうかを判断することが重要になります。
Lemmaにとって、機会は、生産環境でのAIエージェントの運用において、セマンティック故障のモニタリングが標準的な部分となるかどうかです。230万ドルのプレスイドラウンドは、組織がエージェントをより複雑なワークフローに展開するにつれて、同社がこのテーゼをテストするための追加資金を提供します。
より良いエージェントモニタリングがAIに与える影響
エージェントがより複雑で自律的な作業を担うにつれて、従来のモニタリングだけでは不十分になる可能性があります。将来のシステムは、エージェントがタスクを完了したかどうかを評価するだけでなく、エージェントが目的を理解し、正しいツールを使用し、正しい結果を生成したかどうかを評価する必要があります。
Lemmaのようなツールは、生産環境と開発環境の間により緊密なフィードバックループを作成し、実世界の故障を新しいテストや改善に変えることができます。時間の経過とともに、これにより、エージェントの観察可能性が、特に信頼性と説明責任が最も重要な高リスク環境において、AIインフラストラクチャスタックの標準的な部分になる可能性があります。












