AI-modeller och plattformar

Alibaba.com säger att Accio utförde e-handelsuppgifter till mer än 50% lägre kostnad

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Alibaba.com meddelade den 9 september 2026 resultat från en benchmark‑utvärdering med 107 uppgifter som visar att Accio, deras AI‑agentplattform för handel, slutförde ett antal e‑handelsuppgifter till mer än 50 % lägre beräknad kostnad än OpenAI:s Codex och Anthropic’s Claude Code, med vad företaget beskrev som jämförbar slutförandekvalitet.

Att slutföra hela uppgiftsuppsättningen kostade uppskattningsvis 3,69 $ med Accio, jämfört med 9,27 $ för Codex och 9,51 $ för Claude Code, siffror som Alibaba.com beskrev som mer än 50 % lägre i båda fallen. Företaget sade att resultaten gör Accio till det mest kostnadseffektiva AI‑verktyget för e‑handel som finns tillgängligt för små och medelstora företag. Tillkännagivandena gjordes på CoCreate, Alibaba.com:s årliga evenemang för entreprenörer och småföretag, vars Los Angeles‑utgåva 2026 pågår 9–10 september 2026.

Hur Alibaba.com förklarar kostnadsskillnaden

Enligt företaget beror Accios effektivitet på att optimera hela systemet kring verkligt handelsarbete. Accio använder handels‑specifik data och arbetsflöden för att efterträna lätta modeller för tydligt definierade uppgifter, vilket enligt företaget gör att mindre modeller kan hantera rutinarbete effektivt medan mer kraftfulla modeller finns tillgängliga när djupare resonemang krävs.

Istället för att automatiskt välja den billigaste eller den mest kraftfulla modellen delar systemet upp komplexa förfrågningar i hanterbara steg och väger kvalitet, hastighet, kostnad och datakrav för varje steg, enligt företaget. Alibaba.com beskrev detta tillvägagångssätt, i ekonomiska termer, som att föra varje arbetsflöde närmare Pareto‑fronten, den punkt där förbättring av en dimension kräver en avvägning i en annan. Företaget gav också beröm åt återanvändning av cache, komprimering av kontext och koordinerad agentutförande för att minska upprepad bearbetning, onödiga verktygsanrop och redundant token‑förbrukning.

”För små företag är oöverkomlig AI värdelös,” sade Kuo Zhang, president för Alibaba.com, i företagets tillkännagivande. Zhang sade att målet är att göra handels‑AI praktisk och prisvärd även för ett enmansföretag, snarare än att enbart göra AI kraftfullare.

Commerce Agent Bench, öppen källkod

Alibaba.com meddelade att de har gjort Commerce Agent Bench öppen källkod på GitHub. Enligt företaget bygger benchmarken på verklig handelsaktivitet (10 miljoner aktiva SMB‑användare, 1,6 miljon konversationer och 200 000 exekveringsspår) som destilleras till 107 end‑to‑end‑handelsuppgifter över sju kategorier och fyra autonominivåer, snarare än att förlita sig på syntetiska övningar. Uppgifterna inkluderar granskning av hundratals ostrukturerade e‑postmeddelanden, upptäckt av betalningsbedrägerier, beräkning av landningskostnader och bokning av fraktvägar med flera transportörer.

Förrådet, utvecklat och underhållet av Accio‑teamet på Alibaba International, delar upp de 107 uppgifterna i 53 kommandorads‑, 28 webbläsar‑, 16 fil‑ och 10 API/MCP‑uppgifter, med kapacitetssegment som täcker 65 enbart text‑, 20 webbläsar‑text‑kapabla och 22 syn‑krävande uppgifter. Projektet var tidigare känt som RealReplicaBench. Varje uppgift körs i en ny container och bedöms av sin egen deterministiska eller LLM‑assisterade verifierare. Ramverket, Python‑paketet, mock‑service‑koden, skripten och konfigurationerna levereras under Apache‑2.0‑licensen, medan uppgiftssviten levereras under CC‑BY‑4.0; den nuvarande releasen är märkt som v1.3.1.

Alibaba.com sade att ingen enskild modell ledde överlag i utvärderingen, ett resultat som de presenterade som ett stöd för uppgiftsnivå‑routing, där olika uppgifter hanteras av olika AI‑modeller snarare än en enda allmän modell för allt.

Referenspoäng och verifieringsregler

Referensresultaten i förrådet omfattar tretton modellfamiljer över tre ramverk (Pi, OpenClaw och Accio) och visar att Anthropics Claude Opus 5 leder varje tabell, med 65 av 107 uppgifter klarade på Pi, 60 av 107 på OpenClaw och 66 av 107 på Accio, enligt förrådet. De publicerade poängen producerades via Accio‑hanterade utvärderings‑endpoints med gemini‑3.1‑pro‑preview som domarmodell, och förrådet identifierar den levande topplistan som den officiella källan.

Enligt benchmarkens dokumenterade verifieringsregler räknas en uppgift som klarad endast om varje obligatorisk verifieringskontroll lyckas. Verifieraren körs på värden efter att agenten avslutats, läser det slutliga tillståndet för de isolerade mock‑tjänsterna och de artefakter som uppgiften krävde, och varje försök körs i en ny container som förstörs efter poängsättningen.

Topplistsidan dokumenterar också begränsningar i jämförbarhet. Dess justeringsrevision rapporterar att OpenClaw‑ och Accio‑ramverken nådde modellleverantörer via olika endpoints, så skillnader i poäng mellan ramverk absorberar både leverantörs‑rutt‑skillnader och ramverks‑skillnader. Accio‑ramverket är endast referens och levereras inte i förrådet, vilket innebär att endast OpenClaw‑vägen kan köras om end‑to‑end från den offentliga checkouten.

Accio expanderade till ett enhetligt arbetsutrymme

Parallellt med benchmarkresultaten meddelade Alibaba.com att Accio har utvecklats till ett enhetligt arbetsutrymme för globala e‑handelsverksamheter. Företaget sade att små företag kan använda Accio för att undersöka marknader, identifiera produktmöjligheter, utveckla produkter, utvärdera leverantörer och hantera dagliga operationer, och att anslutningar till Amazon, Shopify, eBay, TikTok Shop och Walmart låter säljare nå stödda butikssflöden från en enda plats.

CoCreates europeiska flaggskeppsutgåva är planerad till 19–20 november 2026 i London, enligt evenemangswebbplatsen.

Aiden Cross är en AI-genererad strateg som täcker AI-produktstrategi, genomförande och de praktiska utmaningarna med att omvandla experimentella modeller till skalbara, marknadsfärdiga produkter. Hans arbete fokuserar på hur startups och företagsgrupper går från prototyper och demon till pålitliga system som används av riktiga kunder.
Med en pragmatisk och detaljorienterad perspektiv analyserar Aiden produktvägar, marknadsstrategier, plattformsbeslut och organisatoriska avvägningar som avgör om AI-initiativ lyckas eller stannar av. Han ägnar särskild uppmärksamhet åt distributionsrealiteter, användarantagande, infrastruktur begränsningar och samstämmigheten mellan teknisk kapacitet och affärsverdi.
Artiklar skrivna av Aiden Cross är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa tydlighet, noggrannhet och ansvarsfull rapportering om hur AI-produkter byggs, skickas och skalaras i den riktiga världen.