AI-modeller og platforme
Alibaba.com siger, at Accio udførte e-handelsopgaver til over 50% lavere omkostninger

Alibaba.com annoncerede den 9. september 2026 resultater fra en benchmark‑evaluering med 107 opgaver, som viser, at Accio, deres AI‑agentplatform for handel, gennemførte en række e‑handelsopgaver til mere end 50 % lavere anslået omkostning end OpenAI’s Codex og Anthropics Claude Code, med en kvalitet, som virksomheden beskrev som sammenlignelig.
At gennemføre hele opgavesættet kostede anslået $3,69 med Accio, sammenlignet med $9,27 for Codex og $9,51 for Claude Code – tal, som Alibaba.com beskrev som mere end 50 % lavere i begge tilfælde. Virksomheden sagde, at resultaterne gør Accio til det mest omkostningskonkurrencedygtige AI‑værktøj for e‑handel, der er tilgængeligt for små og mellemstore virksomheder. Meddelelserne blev givet på CoCreate, Alibaba.coms årlige begivenhed for iværksættere og små virksomheder, hvis 2026‑udgave i Los Angeles løber fra den 9. til den 10. september 2026.
Hvordan Alibaba.com forklarer omkostningsforskellen
Ifølge virksomheden skyldes Accios effektivitet, at hele systemet er optimeret omkring reelt handelsarbejde. Accio bruger handels‑specifikke data og arbejdsgange til eftertræning af letvægtsmodeller til klart definerede opgaver, hvilket ifølge virksomheden gør det muligt for mindre modeller at håndtere rutinearbejde effektivt, mens mere kapable modeller forbliver tilgængelige, når dybere ræsonnement er påkrævet.
I stedet for automatisk at vælge den billigste eller den mest kraftfulde model, opdeler systemet komplekse forespørgsler i håndterbare trin og afvejer kvalitet, hastighed, omkostning og datakrav for hvert trin, siger virksomheden. Alibaba.com beskrev denne tilgang, i økonomiske termer, som at flytte hver arbejdsgang tættere på Pareto‑fronten, det punkt hvor forbedring af én dimension kræver et kompromis i en anden. Virksomheden tilskrev også genbrug af cache, komprimering af kontekst og koordineret agent‑eksekvering en reduktion af gentagen behandling, unødvendige værktøjs‑kald og overflødig token‑forbrug.
„For små virksomheder er uoverkommelig AI ubrugelig,“ sagde Kuo Zhang, præsident for Alibaba.com, i virksomhedens meddelelse. Zhang sagde, at målet er at gøre handels‑AI praktisk og overkommelig selv for en enkeltperson‑virksomhed, snarere end blot at gøre AI mere kraftfuld.
Commerce Agent Bench, open source
Alibaba.com meddelte, at de har gjort Commerce Agent Bench open source på GitHub. Ifølge virksomheden baserer benchmarken sig på reel handelsaktivitet (10 millioner aktive SMV‑brugere, 1,6 millioner samtaler og 200 000 eksekveringsspor) destilleret til 107 end‑to‑end handelsopgaver fordelt på syv kategorier og fire autonominiveauer, i stedet for at stole på syntetiske øvelser. Opgaverne omfatter gennemgang af hundredvis af ustrukturerede e‑mails, opsporing af betalingssvindel, beregning af landingsomkostninger og booking af fragtløsruter med flere transportører.
Repositoryen, udviklet og vedligeholdt af Accio‑teamet hos Alibaba International, opdeler de 107 opgaver i 53 kommandolinje‑, 28 browser‑, 16 fil‑ og 10 API/MCP‑opgaver, med kapacitets‑segmenter der dækker 65 kun‑tekst, 20 browser‑tekst‑kapable og 22 vision‑krævende opgaver. Projektet var tidligere kendt som RealReplicaBench. Hver opgave kører i en frisk container og vurderes af sin egen deterministiske eller LLM‑assisterede verifikator. Hætten, Python‑pakken, mock‑service‑koden, scripts og konfigurationer distribueres under Apache‑2.0‑licensen, mens opgavesættet distribueres under CC‑BY‑4.0; den aktuelle udgivelse er fastsat til v1.3.1.
Alibaba.com sagde, at ingen enkelt model førte samlet i evalueringen, et resultat som de præsenterede som en styrkelse af argumentet for opgave‑niveau routing, hvor forskellige opgaver håndteres af forskellige AI‑modeller i stedet for én generel model til alt.
Reference‑resultater og verifikationsregler
Reference‑resultaterne i repositoryen dækker tretten model‑familier på tværs af tre harnesses (Pi, OpenClaw og Accio) og viser, at Anthropics Claude Opus 5 fører hver tabel, idet den beståede 65 af 107 opgaver på Pi, 60 af 107 på OpenClaw og 66 af 107 på Accio, ifølge repositoryen. De offentliggjorte scorer blev genereret via Accio‑styrende evaluerings‑endpoints med gemini‑3.1‑pro‑preview som dommermodel, og repositoryen identificerer live‑leaderboarden som den officielle kilde.
I henhold til benchmarkens dokumenterede verifikationsregler tæller en opgave kun som bestået, hvis alle påkrævede verifikations‑checks lykkes. Verifikatoren kører på værts‑siden efter agentens afslutning, læser den endelige tilstand af de isolerede mock‑services og de artefakter, som opgaven krævede, og hvert forsøg kører i en frisk container, som destrueres efter scoringen.
Leaderboard‑siden dokumenterer også begrænsninger i sammenlignelighed. Dens justerings‑audit rapporterer, at OpenClaw‑ og Accio‑harnesses nåede model‑udbydere via forskellige endpoints, så forskelle i score på tværs af harnesses absorberer både udbyder‑rute‑forskelle og harness‑forskelle. Accio‑harnesset er kun reference og er ikke inkluderet i repositoryen, hvilket betyder, at kun OpenClaw‑stien kan køres igen fra ende til ende fra den offentlige checkout.
Accio udvidet til et samlet arbejdsområde
Sammen med benchmarkresultaterne annoncerede Alibaba.com, at Accio er udviklet til et samlet arbejdsområde for globale e‑handelsoperationer. Virksomheden sagde, at små virksomheder kan bruge Accio til at undersøge markeder, identificere produktmuligheder, udvikle produkter, evaluere leverandører og håndtere daglige operationer, og at forbindelser med Amazon, Shopify, eBay, TikTok Shop og Walmart gør det muligt for sælgere at nå understøttede butik‑arbejdsgange fra ét enkelt sted.
CoCreate’s europæiske flagskibsudgave er planlagt til den 19.–20. november 2026 i London, ifølge begivenhedssiden.












