AI-mallit ja alustat

Alibaba.com sanoo, että Accio suoritti verkkokauppatehtäviä yli 50% alhaisemmalla kustannuksella

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Alibaba.com ilmoitti 9. syyskuuta 2026 tuloksista 107‑tehtävän vertailuarvioinnista, jonka mukaan Accio, sen kaupankäyntiin tarkoitettu AI‑agenttialusta, suoritti joukon verkkokauppatehtäviä yli 50 % alhaisemmalla arvioidulla kustannuksella kuin OpenAI:n Codex ja Anthropic:n Claude Code, ja yritys kuvaili tuloksia vertailukelpoiseksi suorituslaaduksi.

Koko tehtäväjoukon suorittaminen maksaisi arvioiden mukaan 3,69 $, kun taas Codex maksaisi 9,27 $ ja Claude Code 9,51 $, ja Alibaba.com kuvaili näitä lukuja yli 50 % alhaisemmiksi kummassakin tapauksessa. Yritys totesi, että tulokset tekevät Acciosta kustannustehokkaimman verkkokaupan AI‑työkalun, joka on saatavilla pienille ja keskisuurille yrityksille. Ilmoitukset tehtiin tapahtumassa CoCreate, Alibaba.comin vuosittaisessa yrittäjille ja pienyrityksille suunnatussa tapahtumassa, jonka Los Angelesin 2026‑versio järjestetään 9.–10. syyskuuta 2026.

Kuinka Alibaba.com selittää kustannuseron

Yrityksen mukaan Accion tehokkuus johtuu koko järjestelmän optimoinnista todellista kaupankäyntityötä varten. Accio hyödyntää kaupankäyntiin spesifisiä tietoja ja työnkulkuja kevyiden mallien jälkikouluttamiseen selkeästi määritellyissä tehtävissä, mikä yrityksen mukaan mahdollistaa pienempien mallien hoitaa rutiinitehtävät tehokkaasti, kun taas kykenevämmät mallit ovat käytettävissä, jos vaaditaan syvempää päättelyä.

Sen sijaan, että järjestelmä valitsisi oletuksena joko halvimman tai tehokkaimman mallin, se jakaa monimutkaiset pyynnöt hallittaviin vaiheisiin ja arvioi jokaisen vaiheen laatua, nopeutta, kustannuksia ja datavaatimuksia, yrityksen mukaan. Alibaba.com kuvaili tätä lähestymistapaa taloustieteellisesti siirtämällä jokainen työnkulku lähemmäs Pareton raja‑aluetta, eli pistettä, jossa yhden ulottuvuuden parantaminen edellyttää toisen heikentymistä. Yritys myös kiitti välimuistin uudelleenkäyttöä, kontekstin pakkausta ja koordinoitua agenttien suoritusta toistuvan prosessoinnin, tarpeettomien työkalukutsujen ja ylimääräisen token‑kulutuksen vähentämisestä.

“Pienyrityksille unaffordable AI on hyödytöntä,” sanoi Alibaba.comin presidentti Kuo Zhang yrityksen ilmoituksessa. Zhang totesi, että tavoitteena on tehdä kaupankäynnin AI:sta käytännöllistä ja edullista jopa yhden hengen yritykselle, eikä pelkästään tehdä AI:sta voimakkaampaa.

Commerce Agent Bench, avoimen lähdekoodin

Alibaba.com ilmoitti, että se on avannut Commerce Agent Benchin GitHubissa avoimeksi lähdekoodiksi. Yrityksen mukaan vertailu perustuu todelliseen kauppiaiden toimintaan (10 miljoonaa aktiivista PK‑yrityskäyttäjää, 1,6 miljoonaa keskustelua ja 200 000 suoritustietuetta), jotka on tiivistetty 107‑kokonaisvaltaiseen kaupankäyntitehtävään seitsemässä kategoriassa ja neljässä autonomian tasossa, eikä synteettisiin harjoituksiin luoteta. Tehtäviin kuuluu satojen rakenteettomien sähköpostien tarkastelu, maksupetosten havaitseminen, maahantuontikustannusten laskeminen sekä monikulkutavaran reittien varaaminen.

Varasto, jonka Accio-tiimi Alibaba Internationalissa on kehittänyt ja ylläpitää, jakaa 107 tehtävää 53 komentorivi‑, 28 selain‑, 16 tiedosto‑ ja 10 API/MCP‑tehtävään, ja kykyalueet kattavat 65 pelkästään teksti‑, 20 selain‑teksti‑kykyistä ja 22 näkökykyä vaativaa tehtävää. Projekti tunnettiin aiemmin nimellä RealReplicaBench. Jokainen tehtävä ajetaan tuoreessa säiliössä ja sitä arvioi oma deterministinen tai LLM‑avusteinen tarkistaja. Testirunko, Python‑paketti, mokkipalvelukoodi, skriptit ja asetustiedostot julkaistaan Apache‑2.0‑lisenssillä, kun taas tehtäväpaketti on CC‑BY‑4.0‑lisenssin alla; nykyinen julkaisu on merkitty versiona v1.3.1.

Alibaba.com totesi, ettei yksikään malli ollut läpi kaikkien arvioinnin, ja esitti tuloksen tukevan tehtäväkohtaisen reitityksen tarvetta, jossa eri tehtävät hoidetaan eri AI‑malleilla sen sijaan, että yksi yleiskäyttöinen malli hoitaisi kaiken.

Viitearvot ja tarkistussäännöt

Varaston viitearvot kattavat kolmetoista malliperhettä kolmessa testirungossa (Pi, OpenClaw ja Accio), ja ne osoittavat Anthropic:n Claude Opus 5:n johtavan jokaisessa taulukossa, läpäisten 65/107 tehtävää Pi:ssä, 60/107 OpenClawissa ja 66/107 Acciossa, varaston mukaan. Julkaistut pisteet tuotettiin Accio‑hallinnoimien arviointipisteiden kautta gemini-3.1-pro-preview -mallilla tuomarina, ja varasto tunnistaa live‑tulostaulun viralliseksi lähteeksi.

Vertailun dokumentoitujen tarkistussääntöjen mukaan tehtävä lasketaan läpäistyksi vain, jos kaikki vaaditut tarkistajan tarkistukset onnistuvat. Tarkistaja ajetaan isäntäpuolella agentin lopettamisen jälkeen, lukien eristettyjen mokkipalveluiden lopputilan ja tehtävän vaatimat artefaktit, ja jokainen yritys ajetaan yhdessä tuoreessa säiliössä, joka poistetaan pisteytyksen jälkeen.

Tulostaulun sivu dokumentoi myös vertailukelpoisuuden rajoituksia. Sen yhdenmukaisuustarkastus raportoi, että OpenClaw- ja Accio‑runkojen mallit saavutettiin eri päätepisteiden kautta, joten runkojen välisten piste-erojen lisäksi otetaan huomioon myös palveluntarjoajan reittierot. Accio‑runko on vain viite‑runko eikä sitä toimiteta varastossa, mikä tarkoittaa, että vain OpenClaw‑polkua voidaan suorittaa alusta loppuun julkisesta tarkistuksesta.

Accio laajeni yhtenäiseksi työtilaksi

Vertailutulosten ohella Alibaba.com ilmoitti, että Accio on kehittynyt yhtenäiseksi työtilaksi globaaleja verkkokauppatoimintoja varten. Yritys kertoi, että pienyritykset voivat käyttää Accioa markkinoiden tutkimiseen, tuote­mahdollisuuksien tunnistamiseen, tuotteiden kehittämiseen, toimittajien arviointiin ja päivittäisten toimintojen hallintaan, ja että yhteydet Amazonin, Shopify‑n, eBayn, TikTok Shopin ja Walmartin kanssa antavat myyjille mahdollisuuden käyttää tuettuja kauppapaikkatyönkulkuja yhdestä paikasta.

CoCreate‑tapahtuman eurooppalainen lippulaistapahtuma on suunniteltu 19.–20. marraskuuta 2026 Lontoossa, tapahtumasivuston mukaan.

Aiden Cross on tekoälystrategi Unite.AI:ssa, joka kattaa tekoälytuotteiden strategian, toteutuksen ja kokeellisten mallien muuttamisen skaalattaviksi, markkinoille valmiiksi tuotteiksi. Hänen työnsä keskittyy siihen, miten startup-yritykset ja suuret yritykset siirtävät prototyyppien ja demojen tuotantoon luotettaviksi järjestelmiksi, joita todelliset asiakkaat käyttävät.
Hänen työnsä on pragmaattista ja yksityiskohtaista, ja Aiden analysoi tuotteen kehitysroadmappeja, markkinointistrategioita, alustapäätöksiä ja organisaatioiden kompromisseja, jotka määräävät, onnistuvatko tekoälyhankkeet vai jäävätkö ne paikoilleen. Hän kiinnittää erityistä huomiota käyttöönoton todellisuuteen, käyttäjähyväksyntään, infrastruktuurirajoituksiin ja teknisen kyvyn ja liiketoimintarahoituksen väliseen tasapainoon.
Aiden Crossin kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksellinen tiimi tarkistaa ne, jotta varmistetaan selkeä, tarkin ja vastuullinen kattavuus siitä, miten tekoälytuotteet rakennetaan, toimitetaan ja skaalataan todellisessa maailmassa.