AIモデルとプラットフォーム
アンソロジックのプロジェクトディールは、クラウドエージェントが実際の商品を取引できるようにする
アンソロジックは4月24日、 “プロジェクトディール” の結果を公開しました。これは、同社のサンフランシスコオフィスにある69人の従業員のために、クラウドエージェントが1週間にわたって実際のアイテムを購入および販売する内部実験でした。
エージェントは186の取引を成立させ、約4,000ドルの価値がありました。研究によると、より強力なモデルによって表現された参加者は、人間の参加者が気づかないほど、測定可能に良い結果を得た。
アンソロジックの研究者であるケビン・K・トロイ、ディラン・シールズ、キアー・ブラッドウェル、ピーター・マククローリーの著した調査結果は、AIメディエーテッド・マーケットプレイスが実際にどのように動作するかについて、現在までで最も明確な絵を示しています。
また、業界、規制当局、およびユーザーが対処する必要がある「不快な意味」を浮き彫りにします。 エージェントコマース が主流になる前に。
プロジェクトディールの仕組み
実験は2025年12月に1週間実施されました。
アンソロジックは69人の従業員を募集し、各自に100ドルの「予算」(実験後にギフトカードの形で支払われ、購入または販売した商品の価値にプラスまたはマイナスされました)を与え、クラウドが各ボランティアと短いインタビューを実施して、どんな商品を売りたいか、どんな商品を買いたいのか、エージェントがどのような交渉スタイルを使用するかを判断しました。アンソロジックはそれらの回答を各エージェントのカスタムシステムプロンプトに変換しました。
アンソロジックはSlackチャンネル内に4つの並行マーケットプレイスを実行しました。
「ランAとランDでは、すべてのエージェントが当時の最先端モデルであるClaude Opus 4.5に基づいていました。」とチームは述べています。 「他の2つのラン(ランBとランC)では、参加者は50%の確率で、より低力のモデルであるClaude Haiku 4.5が割り当てられました。」
ランAのみが「実際の」ランで、実際の商品が交換されました。 他の3つのランは研究条件で、参加者は実験後の調査まで、どのランが実際のランであるかを知らされませんでした。
エージェントが配置された後、人間の介入はありませんでした。
プロジェクトのSlackチャンネルは、エージェントをランダムにループさせ、アイテムを販売するための投稿、他人の商品のオファー、または取引の締結を可能にしました。重要なのは、実験が開始された後、人間の介入はなかったということです。
500以上のリスト化されたアイテムの中で、エージェントはマッチを特定し、価格を提案し、取引を自律的に締結しました。人間は、エージェントが交換することに同意した商品を物理的に交換するために、最後にシーンに戻りました。
より強力なモデルは静かにより良い取引を交渉する
見出しとなる発見は、シンプルです。エージェントの品質は重要であり、ドルで重要です。
4つのランのうち少なくとも2つで販売された161のアイテムについて、Opusセラーは平均で2.68ドル多く獲得し、Opusバイヤーは2.45ドル少ない価格で購入しました。OpusセラーがHaikuバイヤーと対決した場合、平均価格は24.18ドルでした。Opus対Opusの取引では18.63ドルでした。アンソロジックによると、中央値は12ドル、平均は20.05ドルで、これらのギャップは重要ではありません。
個々のケースはより鋭敏でした。
同じ折りたたみ自転車、同じ買い手、同じ売り手。Opusエージェントは65ドルを獲得しましたが、Haikuエージェントは38ドルしか獲得しませんでした。
Haikuがリストアップしたラボグロウンルビーは65ドルで販売されましたが、Opusが販売した場合は35ドルでした。
参加者が認識しなかったのは、キャッチです。
明確な価格ギャップにもかかわらず、Haikuエージェントを持つ参加者は、Opusユーザーとほぼ同じくらい、取引の公平さを評価しました。公平性の尺度では、4.06対4.05でした。
「28人の参加者は、HaikuとOpusの両方を持っていました。17人はOpusランをHaikuランよりも上にランク付けしましたが、11人はその逆をしました。」と会社は書いています。
2番目の、より反直感的な結果。参加者が最初のインタビューで要求した交渉スタイルは、結果にほとんど影響しませんでした。
攻撃的なセラーは高い価格を得ましたが、それは攻撃的なセラーが最初に高い開始価格を設定したためでした。アンソロジックによると。
攻撃的な指示は、販売の可能性、販売価格、または購入価格に統計的に有意な影響を及ぼさなかった。モデルの選択は、プロンプトよりも重要でした。
エージェントコマースへの意味
プロジェクトディールは、製品ではなくパイロットです。アンソロジックは、自社従業員のプール、低リスク、敵対的なアクターの欠如などの限界を注意深く指摘しています。ただし、参加者の46%がこのようなサービスを支払う用意があることを示唆しており、アンソロジックは、エージェントメディエーテッドのピアツーピアコマースが近い将来に実現する可能性があると考えています。
そのタイミングは重要です。アンソロジックは、クラウドを消費者取引に向けて明らかに導いてきました。同社は最近、クラウド会話を広告なしで維持することを約束する ブログ投稿 を公開し、エージェントコマースを明示的に支持しています。また、エージェントをサードパーティサービスで実行できるように、 マネージドエージェント などのエンタープライズインフラストラクチャを構築しています。プロジェクトディールは、その将来の失敗モードを静かにマッピングする研究成果として現れます。
アンソロジックは、実験から生じる3つの懸念を指摘しています。まず、企業ではなくボランティアが参加する世界では、インセンティブは非常に異なります。AIエージェントの注意を最適化することは、必ずしも人の利益になる強力なツールになる可能性があります。
2番目に、AIエージェントの注意を最適化することは、人間の注意を最適化するのではなく、新しい操作可能な表面を導入する可能性があります。ジャイルブレイクや プロンプトインジェクション を含みます。
3番目に、「私たちに代わって取引するAIモデルに関する政策および法的枠組みはまだ存在しません。」と同社は書いています。
答えられていない質問は、開示が認識のギャップを埋めることができるかどうかです。プロジェクトディールの参加者は、どのモデルが彼らを表しているかを知らなかった。これは、ユーザーが消費者向けロールアウトで直面する状況とほぼ同じです。アンソロジックの自選従業員プールで、1週間の実験で100ドルのステークがある場合、OpusとHaikuの間の公平性のギャップは、スケールで見えにくくなります。マーケットプレイスが、どのエージェントが誰のために、どの能力ティアで行動しているかを開示することを要求しない限りです。アンソロジックが今、公開的に提起しているのは、その種の規制上の質問です。エージェントメディエーテッドコマースがサンフランシスコのSlackチャンネルを超えて進化するときに、最初に着地する可能性が最も高い質問です。












