एआई मॉडल और प्लेटफ़ॉर्म
Alibaba.com कहता है कि Accio ने ई-कॉमर्स कार्यों को 50% से अधिक कम लागत पर चलाया

Alibaba.com ने 9 सितंबर, 2026 को 107 कार्यों के बेंचमार्क मूल्यांकन के परिणाम घोषित किए, जिसमें दिखाया गया कि इसका वाणिज्य AI एजेंट प्लेटफ़ॉर्म Accio ने ई-कॉमर्स कार्यों की एक श्रृंखला को OpenAI के Codex और Anthropic के Claude Code की तुलना में अनुमानित लागत में 50% से अधिक कम पर पूरा किया, और कंपनी ने इसे तुलनीय पूर्णता गुणवत्ता बताया।
पूरे कार्य सेट को पूरा करने की अनुमानित लागत Accio के साथ $3.69 थी, जबकि Codex के लिए $9.27 और Claude Code के लिए $9.51 थी, जिन्हें Alibaba.com ने दोनों मामलों में 50% से अधिक कम बताया। कंपनी ने कहा कि ये परिणाम Accio को छोटे और मध्यम आकार के व्यवसायों के लिए उपलब्ध सबसे लागत‑प्रतिस्पर्धी ई‑कॉमर्स AI टूल बनाते हैं। यह घोषणा CoCreate में की गई, जो Alibaba.com का उद्यमियों और छोटे व्यवसायों के लिए वार्षिक कार्यक्रम है, और 2026 का लॉस एंजिल्स संस्करण 9–10 सितंबर, 2026 को आयोजित हुआ।
Alibaba.com लागत अंतर को कैसे समझाता है
कंपनी के अनुसार, Accio की दक्षता वास्तविक वाणिज्य कार्यों के चारों ओर पूरे सिस्टम को अनुकूलित करने से आती है। Accio वाणिज्य‑विशिष्ट डेटा और कार्यप्रवाह का उपयोग करके स्पष्ट रूप से परिभाषित कार्यों के लिए हल्के मॉडल को पोस्ट‑ट्रेन करता है, जिससे छोटे मॉडल नियमित कार्यों को कुशलता से संभाल सकते हैं, जबकि अधिक सक्षम मॉडल गहरी तर्कशीलता की आवश्यकता होने पर उपलब्ध रहते हैं।
सबसे सस्ता या सबसे शक्तिशाली मॉडल चुनने के बजाय, प्रणाली जटिल अनुरोधों को प्रबंधनीय चरणों में विभाजित करती है और प्रत्येक चरण के लिए गुणवत्ता, गति, लागत और डेटा आवश्यकताओं का मूल्यांकन करती है, कंपनी ने कहा। Alibaba.com ने इस दृष्टिकोण को आर्थिक शब्दों में पैरिटो सीमा के करीब ले जाने के रूप में वर्णित किया, जहाँ एक आयाम में सुधार करने के लिए दूसरे में समझौता आवश्यक होता है। कंपनी ने कैश पुन: उपयोग, संदर्भ संपीड़न और समन्वित एजेंट निष्पादन को दोहराए गए प्रसंस्करण, अनावश्यक टूल कॉल और अतिरिक्त टोकन खपत को कम करने के लिए भी श्रेय दिया।
“छोटे व्यवसायों के लिए, वहन नहीं की जा सकने वाली AI बेकार है,” Alibaba.com के अध्यक्ष कुओ झांग ने कंपनी की घोषणा में कहा। झांग ने कहा कि लक्ष्य वाणिज्य AI को व्यावहारिक और किफायती बनाना है, यहाँ तक कि एक‑व्यक्ति कंपनी के लिए भी, न कि केवल AI को अधिक शक्तिशाली बनाना।
Commerce Agent Bench, ओपन‑सोर्स किया गया
Alibaba.com ने कहा कि उसने GitHub पर Commerce Agent Bench को ओपन‑सोर्स किया है। कंपनी के अनुसार, यह बेंचमार्क वास्तविक व्यापारी गतिविधियों (10 मिलियन सक्रिय SMB उपयोगकर्ता, 1.6 मिलियन वार्तालाप और 200,000 निष्पादन ट्रेस) को सात श्रेणियों और चार स्वायत्तता स्तरों में 107 पूर्ण‑चक्र वाणिज्य कार्यों में संकलित करता है, न कि सिंथेटिक अभ्यासों पर निर्भर करता है। इन कार्यों में सैकड़ों असंरचित ई‑मेल की समीक्षा, भुगतान धोखाधड़ी की पहचान, लैंडेड लागत की गणना और बहु‑कैरियर शिपिंग मार्गों का बुकिंग शामिल है।
Alibaba International की Accio टीम द्वारा विकसित और रखरखाव किया गया यह रिपॉजिटरी 107 कार्यों को 53 कमांड‑लाइन, 28 ब्राउज़र, 16 फ़ाइल और 10 API/MCP कार्यों में विभाजित करता है, जिसमें क्षमता स्लाइस 65 केवल‑पाठ, 20 ब्राउज़र‑पाठ‑सक्षम और 22 विज़न‑आवश्यक कार्यों को कवर करते हैं। इस परियोजना को पहले RealReplicaBench कहा जाता था। प्रत्येक कार्य एक नए कंटेनर में चलता है और अपने स्वयं के निर्धारक या LLM‑सहायता प्राप्त सत्यापक द्वारा मूल्यांकन किया जाता है। हार्नेस, Python पैकेज, मॉक‑सेवा कोड, स्क्रिप्ट और कॉन्फ़िगरेशन Apache-2.0 लाइसेंस के तहत वितरित होते हैं, जबकि कार्य सूट CC-BY-4.0 के तहत; वर्तमान रिलीज़ v1.3.1 के रूप में पिन किया गया है।
Alibaba.com ने कहा कि मूल्यांकन में कोई एकल मॉडल सभी कार्यों में अग्रणी नहीं रहा, यह परिणाम उन्होंने टास्क‑लेवल रूटिंग के पक्ष में प्रस्तुत किया, जिसमें विभिन्न कार्यों को विभिन्न AI मॉडलों द्वारा संभाला जाता है, न कि सभी के लिए एक सामान्य‑उद्देश्य मॉडल द्वारा।
संदर्भ स्कोर और सत्यापन नियम
रिपॉजिटरी में संदर्भ परिणाम तीन हार्नेस (Pi, OpenClaw और Accio) में बतेर मॉडल परिवारों को कवर करते हैं, और दिखाते हैं कि Anthropic का Claude Opus 5 प्रत्येक तालिका में अग्रणी है, Pi पर 107 में से 65 कार्य, OpenClaw पर 107 में से 60 कार्य और Accio पर 107 में से 66 कार्य पास करता है, रिपॉजिटरी के अनुसार। प्रकाशित स्कोर Accio‑प्रबंधित मूल्यांकन एंडपॉइंट्स के माध्यम से gemini-3.1-pro-preview को जज मॉडल बनाकर उत्पन्न किए गए, और रिपॉजिटरी लाइव लाइव लीडरबोर्ड को रिकॉर्ड स्रोत के रूप में पहचानता है।
बेंचमार्क के दस्तावेज़ित सत्यापन नियमों के तहत, एक कार्य तभी पास माना जाता है जब सभी आवश्यक सत्यापक जांच सफल हों। एजेंट के बाहर निकलने के बाद सत्यापक होस्ट‑साइड पर चलता है, अलग‑थलग मॉक सेवाओं की अंतिम स्थिति और कार्य द्वारा आवश्यक कलाकृतियों को पढ़ता है, और प्रत्येक प्रयास एक नए कंटेनर में चलता है जिसे स्कोरिंग के बाद नष्ट कर दिया जाता है।
लीडरबोर्ड साइट तुलनीयता पर सीमाओं को भी दस्तावेज़ करती है। इसके संरेखण ऑडिट में बताया गया है कि OpenClaw और Accio हार्नेस विभिन्न एंडपॉइंट्स के माध्यम से मॉडल प्रदाताओं तक पहुँचे, इसलिए क्रॉस‑हार्नेस स्कोर अंतर प्रदाता‑मार्ग अंतर और हार्नेस अंतर दोनों को सम्मिलित करते हैं। Accio हार्नेस केवल संदर्भ के लिए है और रिपॉजिटरी में वितरित नहीं किया गया है, जिसका अर्थ है कि केवल OpenClaw पथ को सार्वजनिक चेकआउट से अंत‑से‑अंत पुनः चलाया जा सकता है।
Accio एकीकृत कार्यस्थल में विस्तारित हुआ
बेंचमार्क परिणामों के साथ, Alibaba.com ने घोषणा की कि Accio वैश्विक ई‑कॉमर्स संचालन के लिए एकीकृत कार्यस्थल में विकसित हो गया है। कंपनी ने कहा कि छोटे व्यवसाय Accio का उपयोग बाजारों की रिसर्च, उत्पाद अवसरों की पहचान, उत्पाद विकास, आपूर्तिकर्ता मूल्यांकन और दैनिक संचालन प्रबंधन के लिए कर सकते हैं, और Amazon, Shopify, eBay, TikTok Shop और Walmart के साथ कनेक्शन से विक्रेता एक ही स्थान से समर्थित स्टोरफ़्रंट वर्कफ़्लो तक पहुँच सकते हैं।
इवेंट साइट के अनुसार, CoCreate का यूरोपीय प्रमुख संस्करण 19–20 नवंबर, 2026 को लंदन में आयोजित होने वाला है।












