AI-modeller og plattformer

Alibaba.com sier at Accio utførte netthandeloppgaver med over 50% lavere kostnad

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Alibaba.com kunngjorde 9. september 2026 resultatene fra en benchmark‑evaluering med 107 oppgaver, som viser at Accio, deres AI‑agentplattform for handel, fullførte en rekke netthandeloppgaver til mer enn 50 % lavere estimert kostnad enn OpenAI sin Codex og Anthropic sin Claude Code, med det selskapet beskrev som sammenlignbar fullføringskvalitet.

Å fullføre hele oppgavesettet kostet anslagsvis $3,69 med Accio, mot $9,27 for Codex og $9,51 for Claude Code, tall som Alibaba.com beskrev som mer enn 50 % lavere i begge tilfeller. Selskapet sa at resultatene gjør Accio til det mest kostnadseffektive AI‑verktøyet for netthandel som er tilgjengelig for små og mellomstore bedrifter. Kunngjøringene ble gjort på CoCreate, Alibaba.com sitt årlige arrangement for entreprenører og småbedrifter, hvor 2026‑utgaven i Los Angeles går av stabelen 9.–10. september 2026.

Hvordan Alibaba.com forklarer kostnadsforskjellen

Ifølge selskapet skyldes Accios effektivitet at hele systemet er optimalisert rundt reelt handelsarbeid. Accio bruker handels‑spesifikke data og arbeidsflyter til å etter‑trene lette modeller for tydelig definerte oppgaver, noe som, ifølge selskapet, gjør at mindre modeller kan håndtere rutinearbeid effektivt mens mer kapable modeller er tilgjengelige når dypere resonnering kreves.

I stedet for å default til enten den billigste eller den kraftigste modellen, deler systemet komplekse forespørsler inn i håndterbare trinn og vurderer kvalitet, hastighet, kostnad og datakrav for hvert trinn, sier selskapet. Alibaba.com beskrev denne tilnærmingen, i økonomiske termer, som å flytte hver arbeidsflyt nærmere Pareto‑fronten, punktet hvor forbedring av én dimensjon krever et kompromiss i en annen. Selskapet kreditert også gjenbruk av cache, komprimering av kontekst og koordinert agentutførelse for å redusere gjentatt prosessering, unødvendige verktøy‑kall og overflødig token‑forbruk.

«For små bedrifter er uoverkommelig AI nytteløs», sa Kuo Zhang, president i Alibaba.com, i the company’s announcement. Zhang uttalte at målet er å gjøre handels‑AI praktisk og rimelig selv for ett‑person‑selskaper, snarere enn bare å gjøre AI kraftigere.

Commerce Agent Bench, åpen kildekode

Alibaba.com opplyste at de har gjort Commerce Agent Bench tilgjengelig som åpen kildekode på GitHub. Ifølge selskapet baserer benchmarken seg på reell handelsaktivitet (10 millioner aktive SMB‑brukere, 1,6 millioner samtaler og 200 000 utførelsesspor) som er destillert til 107 ende‑til‑ende handelsoppgaver fordelt på syv kategorier og fire autonominivåer, i stedet for å stole på syntetiske øvelser. Oppgavene inkluderer å gå gjennom hundrevis av ustrukturerte e‑postmeldinger, oppdage betalingssvindel, beregne innføringskostnader og bestille fraktruter med flere transportører.

Repository‑en, utviklet og vedlikeholdt av Accio‑teamet i Alibaba International, deler de 107 oppgavene inn i 53 kommandolinje‑, 28 nettleser‑, 16 fil‑ og 10 API/MCP‑oppgaver, med kapabilitetssegmenter som dekker 65 kun‑tekst, 20 nettleser‑tekst‑kapable og 22 oppgaver som krever syn. Prosjektet var tidligere kjent som RealReplicaBench. Hver oppgave kjøres i en ny container og vurderes av sin egen deterministiske eller LLM‑assisterte verifikator. Harness‑en, Python‑pakken, mock‑service‑koden, skriptene og konfigurasjonene distribueres under Apache‑2.0‑lisensen, mens oppgavesuiten distribueres under CC‑BY‑4.0; den nåværende utgivelsen er merket som v1.3.1.

Alibaba.com opplyste at ingen enkeltmodell ledet samlet i evalueringen, et resultat de presenterte som en styrking av argumentet for oppgave‑nivå‑ruting, hvor ulike oppgaver håndteres av forskjellige AI‑modeller i stedet for én generisk modell for alt.

Referansescore og verifiseringsregler

Referanseresultatene i repository‑en dekker tretten modellfamilier på tvers av tre harness‑er (Pi, OpenClaw og Accio), og viser at Anthropic sin Claude Opus 5 leder hver tabell, ved å bestå 65 av 107 oppgaver på Pi, 60 av 107 på OpenClaw og 66 av 107 på Accio, ifølge repository‑en. De publiserte poengene ble generert via Accio‑styrte evaluerings‑endepunkter med gemini‑3.1‑pro‑preview som dommermodell, og repository‑en identifiserer den levende ranglisten som den offisielle kilden.

I henhold til benchmarkens dokumenterte verifiseringsregler, teller en oppgave som bestått kun hvis alle påkrevde verifiseringskontroller lykkes. Verifikatoren kjører på verts‑siden etter at agenten avslutter, leser den endelige tilstanden til de isolerte mock‑tjenestene og artefaktene oppgaven krevde, og hvert forsøk kjøres i en ny container som destrueres etter poengsetting.

Ranglistens nettsted dokumenterer også begrensninger i sammenlignbarhet. Dens justeringsrevisjon rapporterer at OpenClaw‑ og Accio‑harness‑ene nådde modellleverandører via ulike endepunkter, så forskjeller i poeng mellom harness‑ene absorberer både leverandør‑rute‑forskjeller og harness‑forskjeller. Accio‑harness er kun referanse og distribueres ikke i repository‑en, noe som betyr at kun OpenClaw‑stien kan kjøres på nytt ende‑til‑ende fra den offentlige checkout‑en.

Accio utvidet til et samlet arbeidsområde

Ved siden av benchmark‑resultatene kunngjorde Alibaba.com at Accio har utviklet seg til et samlet arbeidsområde for globale netthandelsoperasjoner. Selskapet sa at små bedrifter kan bruke Accio til å undersøke markeder, identifisere produktmuligheter, utvikle produkter, evaluere leverandører og håndtere daglige operasjoner, og at integrasjoner med Amazon, Shopify, eBay, TikTok Shop og Walmart gjør at selgere kan nå støttede butikk‑arbeidsflyter fra ett enkelt sted.

CoCreates europeiske flaggskip‑utgave er planlagt til 19.–20. november 2026 i London, ifølge arrangementsnettstedet.

Aiden Cross er en AI-generert strateg hos Unite.AI, som dekker AI-produktstrategi, gjennomføring og de praktiske utfordringene ved å omdanne eksperimentelle modeller til skalerbare, markedsklare produkter. Hans arbeid fokuserer på hvordan startups og bedrifter går fra prototyper og demonstrasjoner til pålitelige systemer som brukes av ekte kunder.
Med en pragmatisk og detaljorientert perspektiv, analyserer Aiden produktveikart, markedsstrategier, plattformbeslutninger og organisatoriske kompromisser som avgjør om AI-initiativer lykkes eller stopper. Han legger særlig vekt på deployeringsrealiteter, brukeradopsjon, infrastrukturbegrensninger og sammenligningen mellom teknisk evne og forretningsverdi.
Artikler skrevet av Aiden Cross er AI-generert og gjennomgått av Unite.AIs redaksjonsteam for å sikre klarhet, nøyaktighet og ansvarlig dekning av hvordan AI-produkter bygges, sendes og skaleres i den virkelige verden.