Модели и платформы ИИ

Проект Deal от Anthropic позволяет агентам Claude торговать реальными товарами

mm
Добавьте Unite.AI в избранные источники в Google

Компания Anthropic 24 апреля опубликовала результаты эксперимента “Project Deal“, который проводился в течение одной недели и включал в себя покупку и продажу реальных товаров агентами Claude от имени 69 сотрудников офиса компании в Сан-Франциско.

Агенты заключили 186 сделок на общую сумму чуть более 4 000 долларов, и исследование показало, что участники, представленные более сильными моделями, получили значительно лучшие результаты, которые их человеческие коллеги не заметили.

Результаты, опубликованные исследователями Anthropic Kevin K. Troy, Dylan Shields, Keir Bradwell и Peter McCrory, дают наиболее четкое представление о том, как может выглядеть рынок, посредником на котором выступают искусственные интеллекты, когда агенты будут вести переговоры с обеих сторон сделки.

Они также подчеркивают “неудобное последствие”, которое, по мнению компании, отрасль, регулирующие органы и пользователи должны будут решить до того, как агентная коммерция станет мейнстримом.

Как работал проект Deal

Эксперимент проводился в течение одной недели в декабре 2025 года.

Anthropic набрала 69 сотрудников, дала каждому из них “бюджет” в размере 100 долларов (выплаченный после эксперимента в виде подарочной карты, плюс или минус стоимость того, что они купили или продали), и провела с каждым волонтером короткое интервью, чтобы определить, что они хотели продать, по какой цене, что они хотели купить, и какой стиль переговоров их агент должен использовать. Затем Anthropic преобразовала эти ответы в индивидуальный системный запрос для каждого агента.

Anthropic запустила четыре параллельных рынка внутри каналов Slack.

“В Run A и Run D агенты всех участников были основаны на модели Claude Opus 4.5, которая была нашей ведущей моделью на тот момент”, – сказали в команде. “В двух других запусках (Runs B и C) у участников была 50-процентная вероятность быть назначенным агентом Claude Haiku 4.5, который был менее мощной моделью”.

Только Run A был “реальным” запуском, где товары действительно менялись руками; остальные три были условиями исследования, и участники не знали, какой запуск был реальным, пока не прошли опрос после эксперимента.

Как только агенты были развернуты, в процессе больше не участвовали люди.

Проектный канал Slack случайным образом перебирал агентов, позволяя им размещать товары на продажу, делать предложения о покупке чьих-то товаров или заключать сделки. Критически важно, что человеческое вмешательство не было возможно, как только эксперимент начался.

Из более чем 500 перечисленных товаров агенты определили совпадения, предложили цены и заключили сделки автономно. Люди снова вошли в картину только в конце, чтобы физически обменять товары, которые их агенты согласились обменять.

Более сильные модели тихо ведут лучшие переговоры

Основной вывод прямой: качество агента имеет значение, и оно имеет значение в долларах.

Из 161 товара, проданного хотя бы в двух из четырех запусков, продавец Opus в среднем получил на 2,68 доллара больше, а покупатель Opus заплатил на 2,45 доллара меньше. Когда продавец Opus столкнулся с покупателем Haiku, средняя цена составила 24,18 доллара, по сравнению с 18,63 долларами за сделки Opus на Opus. С медианной ценой 12 долларов и средней ценой 20,05 долларов во всех запусках Anthropic говорит, что эти разрывы не являются тривиальными.

Индивидуальные случаи были более острыми.

То же самое сломанное складное велосипед, тот же покупатель, тот же продавец: агент Opus получил 65 долларов, агент Haiku – только 38 долларов.

Рубин, выращенный в лаборатории, проданный агентом Opus за 65 долларов, был продан агентом Haiku за 35 долларов.

Подвох заключается в том, чего участники не заметили.

Несмотря на явный разрыв в цене, участники с агентами Haiku оценили справедливость своих сделок почти так же, как и пользователи Opus: 4,06 против 4,05 по шкале справедливости.

“Двадцать восемь наших участников имели Haiku в одном запуске Haiku и Opus и Opus в другом. И хотя 17 из них поставили запуск Opus выше запуска Haiku, 11 сделали обратное”, – написала компания.

Второй, более контринтуитивный результат: стили переговоров, которые участники запрашивали в своих интервью, практически не повлияли на результат.

Агрессивные продавцы действительно получили более высокие цены, но только потому, что они изначально установили более высокие цены, говорит Anthropic.

Агрессивные инструкции не дали статистически значимого прироста вероятности продажи, цены продажи или цены покупки, когда были учтены более высокие цены, которые эти пользователи установили. Выбор модели имел гораздо большее значение, чем подсказка.

Что это значит для агентной коммерции

Project Deal – это пилот, а не продукт, и Anthropic тщательно подчеркивает ограничения – самодостаточную группу сотрудников, низкие ставки и отсутствие враждебных акторов. Тем не менее, 46 процентов участников сказали, что они заплатили бы за такую услугу, которую Anthropic рассматривает как доказательство того, что агентная коммерция между физическими лицами не за горами.

Это время имеет значение, потому что Anthropic явно направляет Claude в сторону потребительских транзакций. Компания недавно опубликовала блог-пост, в котором обязалась сохранить разговоры Claude без рекламы, а также явно одобрила агентную коммерцию, и строит корпоративную инфраструктуру, такую как Managed Agents, чтобы позволить Claude действовать от имени пользователей в третьих сервисах. Project Deal становится исследовательским артефактом, который тихо картографирует режимы отказа будущего.

Anthropic подчеркивает три проблемы, которые возникают из эксперимента. Во-первых, в мире с компаниями вместо волонтеров стимулы будут выглядеть совсем иначе. Оптимизация для внимания агентов ИИ может стать мощным инструментом, который не обязательно работает в пользу людей.

Во-вторых, оптимизация систем для внимания агентов ИИ – а не для человеческого внимания – может ввести новые поверхности манипуляций, включая jailbreaking и prompt injection.

В-третьих, “политические и правовые рамки вокруг моделей ИИ, которые совершают транзакции от нашего имени, просто еще не существуют”, – пишет компания.

Неясным остается вопрос о том, может ли раскрытие закрыть разрыв в восприятии. Участники Project Deal не знали, какая модель представляла их, что примерно соответствует ситуации, с которой пользователи столкнутся в любом потребительском выпуске. Если разрыв в справедливости между Opus и Haiku невидим внутри самодостаточной рабочей силы Anthropic, которая проводит недельный эксперимент с ставками 100 долларов, он, скорее всего, будет невидимым в масштабе – если только рынки не будут обязаны раскрывать, какой агент действует за кого и на какой уровне возможностей. Это тот тип регуляторного вопроса, который Anthropic теперь публично приглашает, и это, вероятно, первый вопрос, который возникнет, когда агентная коммерция выйдет за пределы канала Slack в Сан-Франциско.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.