AI-mallit ja alustat

Anthropicin Projektisopimus antoi Claude-agenteille mahdollisuuden käydä kauppaa oikeilla tuotteilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Anthropic julkaisi 24. huhtikuuta tulokset “Projektisopimuksesta”, joka oli yhden viikon sisäinen kokeilu, jossa Claude-agenteille ostettiin ja myytiin oikeita tuotteita 69 työntekijän puolesta yrityksen San Franciscon toimistossa.

Agentit tekivät 186 kauppaa, joiden arvo oli hieman yli 4 000 dollaria – ja tutkimus osoitti, että vahvempien mallien edustamat osallistujat saivat mitattavasti parempia tuloksia kuin heidän ihmisvastineensa, joita he eivät huomanneet.

Tulokset, jotka on kirjoittanut Anthropicin tutkijat Kevin K. Troy, Dylan Shields, Keir Bradwell ja Peter McCrory, antavat selkeimmän kuvan siitä, miten AI-välittäinen markkinapaikka voi käyttäytyä, kun agentit neuvottelevat kummallakin puolella transaktiota.

Ne myös paljastavat “epämukavan implikaation”, jonka yritys sanoo, että teollisuus, sääntelijät ja käyttäjät joutuvat kohtaamaan ennen kuin agentic commerce tulee valtavirtaan.

Miten Projektisopimus toimi

Kokeilu kesti yhden viikon joulukuussa 2025.

Anthropic palkkasi 69 työntekijää, antoi heille kullekin 100 dollarin “budjetti” (joka maksettiin kokeen jälkeen lahjakortin muodossa, plussa tai miinus siitä, mitä he ostivat tai myivät), ja teki Claude-agentin kanssa lyhyen haastattelun jokaisen vapaaehtoisen kanssa, jotta selvitettiin, mitä he halusivat myydä, mihinnä, mitä he halusivat ostaa ja minkälaista neuvottelutyyliä heidän agenttinsa tulisi käyttää. Anthropic muunsi vastaukset mukautettuun järjestelmäkysymykseen kullekin agentille.

Anthropic pyöritti neljää rinnakkaista markkinapaikkaa Slack-kanavissa.

“Suorituksissa A ja D jokaisen agentti perustui Claude Opus 4.5:een, joka oli silloinen eturintamalli”, tiimi sanoi. “Muissa suorituksissa (Suoritukset B ja C) osallistujilla oli 50-50 % mahdollisuus saada Claude Haiku 4.5, joka on vähemmän voimakas malli.”

Vain Suoritus A oli “oikea” suoritus, jossa hyödyt vaihdettiin käteen; muut kolme olivat tutkimusolosuhteita, eikä osallistujia kerrottu, kumpi suoritus oli todellinen, ennen kuin heidät haastateltiin kokeen jälkeen.

Kun agentit oli käyttöön otettu, niiden toiminnassa ei ollut enää ihmisten väliintuloa.

Projektin Slack-kanava toisti satunnaisesti agenteja, jolloin he pystyivät julkaisemaan tuotteen myyntiin, tekemään tarjouksen jonkun toisen henkilön tuotteista tai solmimaan kaupan. Olennaisesti tärkeää oli, että kokeen aikana ei ollut ihmisten väliintuloa.

Yli 500 listatun tuotteen yli agentit tunnistivat osumat, ehdottivat hintoja ja solmivat kaupat autonomisesti. Ihmiset osallistuivat jälleen kuvaan vasta lopussa, jotta he voisivat vaihtaa fyysisesti hyödyt, jotka heidän agenttinsa olivat sopineet vaihtaa.

Vahvemmat mallit neuvottelevat hiljaisesti parempia kauppoja

Otsikko löytö on suora: agentin laatu on merkittävää, ja se on merkittävää dollareissa.

161 myydyn tuotteen yli, jotka myytiin vähintään kahdessa neljästä suorituksesta, Opus-myyjä sai keskimäärin 2,68 dollaria enemmän, kun taas Opus-ostaja maksoi 2,45 dollaria vähemmän. Kun Opus-myyjä kohtasi Haiku-ostajan, keskimääräinen hinta oli 24,18 dollaria, verrattuna 18,63 dollariin Opus-Opus-kauppoihin. Keskiarvon ollessa 20,05 dollaria kaikissa suorituksissa Anthropic sanoo, että nämä aukot eivät ole merkityksettömiä.

Yksittäiset tapaukset olivat terävämpiä.

Sama rikkinäinen taittuva polkupyörä, sama ostaja, sama myyjä: Opus-agentti sai 65 dollaria, Haiku-agentti sai vain 38 dollaria.

Laboratoriossa kasvatettu rubiini, jota Opus myi 65 dollarilla, myytiin vain 35 dollarilla, kun Haiku hoiti listauksen.

Kiinni on se, mitä osallistujat eivät havainneet.

Vaikka hintaeron oli selkeä, osallistujat, joilla oli Haiku-agenteja, arvioivat kauppojensa reiluuden lähes samalla tavalla kuin Opus-käyttäjät: 4,06 verrattuna 4,05 reiluuden asteikolle.

“Kahdeksantoista osallistujista oli Haiku yhdessä Haiku- ja Opus-suorituksessa ja Opus toisessa. Ja vaikka 17 heistä arvioi Opus-suorituksensa korkeammaksi kuin Haiku-suorituksensa, 11 teki päinvastaisen”, yritys kirjoitti.

Toinen, vastaanottamattomampi tulos: neuvottelutyyli, jonka osallistujat pyysivät haastatteluissaan, vaikuttivat vain vähän lopputuloksiin.

Aggressiiviset myyjät saivat korkeamman hinnan, mutta vain siksi, että he asettivat korkeamman aloitushinnan alussa, Anthropic sanoo.

Aggressiiviset ohjeet eivät tuottaneet tilastollisesti merkittävää lisäystä myyntimahdollisuudessa, myyntihinnassa tai ostohinnassa, kun korkeammat pyyntihinnat, jotka nämä käyttäjät asettivat, otettiin huomioon. Mallin valinta oli tärkeämpää kuin ohjeistus.

Mikä se tarkoittaa agentic commercesta

Projektisopimus on pilotti, ei tuote, ja Anthropic on varovainen siinä, että se korostaa rajoituksia – itsevalittu työntekijäjoukko, matalat panokset ja ei-vastakkainasetteluja toimijoita. Vaikka niin olisi, 46 prosenttia osallistujista sanoi, että he maksaisivat palvelusta, joka Anthropic pitää näyttönä siitä, että agenttivälittäinen peer-to-peer-kauppa ei ole kaukana.

Ajoitus on tärkeää, koska Anthropic on näyttänyt johtavansa Clauden kuluttajakauppoihin. Yritys on julkaissut äskettäin blogikirjoituksen, jossa se sitoutuu pitämään Claude-keskustelut ilman mainoksia ja jossa se tukisi avoimesti agentic commercea, ja se on rakentanut yritysinfrastruktuuria, kuten Hallitut agentit, jotta Claude voi toimia käyttäjien puolesta kolmannen osapuolen palveluissa. Projektisopimus on tutkimusartefakti, joka karttaa hiljaisesti epäonnistumisen muotoja tulevaisuudessa.

Anthropic korostaa kolmea huolenaihetta, jotka kasvavat kokeilusta. Ensinnäkin, maailmassa, jossa on yrityksiä eikä vapaaehtoisia, kannustimet näyttävät erilaisilta. Optimointi AI-agentin huomion kannalta voi tulla voimakkaaksi työkaluksi, joka ei välttämättä toimi ihmisten eduksi.

Toiseksi, optimointi järjestelmiä AI-agentin huomion sijaan voi esittää uusia manipulointipintoja, mukaan lukien vankilamurtaminen ja ohjelmointipisteen injektio.

Kolmanneksi, “AI-mallien käyttämisestä, jotka transaktioivat puolestamme, ei ole olemassa vielä politiikkaa tai lakirunkoja”, yritys kirjoitti.

Vastamaton kysymys on, voittaako selvitys havaintoeron. Projektisopimuksen osallistujat eivät tienneet, mikä malli edusti heitä, mikä on suunnilleen sama tilanne, jossa käyttäjät kohtaavat kuluttajien julkaisussa. Jos reiluuskuilu Opus- ja Haiku-välillä on näkymätön sisällä itsevalittua Anthropicin työntekijäjoukkoa, joka suorittaa yhden viikon kokeilun 100 dollarin panoksilla, se on todennäköisesti näkymätön mittakaavassa – ellei markkinapaikkoja vaadita paljastamaan, mikä agentti toimii kenen puolesta ja minkä kykytason mukaan. Se on sellainen sääntelykysymys, johon Anthropic nyt julkisesti kutsuu, ja se on se, joka todennäköisesti tulee ensin, kun agenttivälittäinen kauppa siirtyy Slack-kanavasta San Franciscossa.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.