نماذج ومنصات الذكاء الاصطناعي

Alibaba.com تقول إن Accio نفّذ مهام التجارة الإلكترونية بتكلفة أقل بأكثر من 50٪

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أعلنت Alibaba.com في 9 سبتمبر 2026 عن نتائج تقييم معيار يتضمن 107 مهمة، مبينةً أن Accio، منصة الوكيل الذكي للتجارة التابعة لها، أكملت مجموعة من مهام التجارة الإلكترونية بتكلفة تقديرية أقل بأكثر من 50٪ مقارنةً بـ Codex من OpenAI وClaude Code من Anthropic، مع ما وصفته الشركة بأنه جودة إكمال مماثلة.

تكلفة إكمال مجموعة المهام بالكامل بلغت تقديريًا 3.69 دولار باستخدام Accio، مقابل 9.27 دولار لـ Codex و9.51 دولار لـ Claude Code، وقد وصفت Alibaba.com هذه الأرقام بأنها أقل بأكثر من 50٪ في كلتا الحالتين. وقالت الشركة إن هذه النتائج تجعل Accio الأداة الذكية للتجارة الإلكترونية الأكثر تنافسية من حيث التكلفة المتاحة للشركات الصغيرة والمتوسطة. وقد تم الإعلان عن ذلك في CoCreate، الحدث السنوي لـ Alibaba.com لرواد الأعمال والشركات الصغيرة، الذي سيعقد نسخة لوس أنجلوس لعام 2026 في الفترة من 9 إلى 10 سبتمبر 2026.

كيف توضح Alibaba.com فجوة التكلفة

وفقًا للشركة، تكمن كفاءة Accio في تحسين النظام بالكامل حول أعمال التجارة الحقيقية. يستخدم Accio بيانات وتدفقات عمل خاصة بالتجارة لتدريب نماذج خفيفة بعد التدريب لمهام محددة بوضوح، وهو ما قالته الشركة إن ذلك يسمح للنماذج الأصغر بالتعامل مع الأعمال الروتينية بفعالية بينما تظل النماذج الأكثر قدرة متاحة عندما يتطلب الأمر استدلالًا أعمق.

بدلاً من الاعتماد تلقائيًا على النموذج الأرخص أو الأقوى، يقوم النظام بتقسيم الطلبات المعقدة إلى خطوات قابلة للإدارة ويوازن بين الجودة والسرعة والتكلفة ومتطلبات البيانات لكل خطوة، وفقًا للشركة. وصفت Alibaba.com هذا النهج، من الناحية الاقتصادية، بأنه يقترب بكل سير عمل من حد باريتو، النقطة التي يتحقق فيها تحسين بعد واحد على حساب تنازل في بعد آخر. كما أشادت الشركة بإعادة استخدام الذاكرة المؤقتة، وضغط السياق، والتنفيذ المنسق للوكيل في تقليل المعالجة المتكررة، والنداءات غير الضرورية للأدوات، واستهلاك الرموز الزائدة.

“بالنسبة للشركات الصغيرة، الذكاء الاصطناعي غير القابل للتحمل غير مفيد”، قال كوو تشانغ، رئيس Alibaba.com، في إعلان الشركة. وأوضح تشانغ أن الهدف هو جعل الذكاء الاصطناعي للتجارة عمليًا ومتاحًا حتى لشركة مكوّنة من شخص واحد، وليس مجرد جعل الذكاء الاصطناعي أقوى.

Commerce Agent Bench، مفتوح المصدر

قالت Alibaba.com إنها فتحت مصدر Commerce Agent Bench على GitHub. ووفقًا للشركة، يستند المعيار إلى نشاط تجار حقيقي (10 ملايين مستخدم نشط من الشركات الصغيرة والمتوسطة، 1.6 مليون محادثة و200,000 أثر تنفيذ) تم تلخيصه إلى 107 مهمة تجارية شاملة عبر سب فئات وأربع مستويات من الاستقلالية، بدلاً من الاعتماد على تمارين اصطناعية. تشمل المهام مراجعة مئات الرسائل الإلكترونية غير المهيكلة، واكتشاف احتيال المدفوعات، وحساب التكاليف النهائية، وحجز طرق شحن متعددة الناقلات.

المستودع، الذي طوره ويُديره فريق Accio في Alibaba International، يقسّم الـ107 مهام إلى 53 مهمة سطر أوامر، 28 مهمة متصفح، 16 مهمة ملفات و10 مهام API/MCP، مع شرائح قدرة تغطي 65 مهمة نصية فقط، 20 مهمة تدعم النص في المتصفح و22 مهمة تتطلب رؤية. كان المشروع يُعرف سابقًا باسم RealReplicaBench. تُنفّذ كل مهمة في حاوية جديدة وتُقيّم بواسطة مدقق خاص إما حتمي أو مدعوم بنموذج لغة كبير. تُوزّع الحزمة، وحزمة بايثون، وكود الخدمة الوهمية، والسكريبتات والإعدادات تحت رخصة Apache-2.0، بينما تُوزّع مجموعة المهام تحت رخصة CC-BY-4.0؛ الإصدار الحالي مثبت كـ v1.3.1.

قالت Alibaba.com إنه لا نموذج واحد تصدر في جميع التقييمات، وقد قدمت هذه النتيجة كدعم لحالة التوجيه على مستوى المهمة، حيث تُعالج المهام المختلفة بنماذج ذكاء اصطناعي مختلفة بدلاً من نموذج عام واحد لكل شيء.

النتائج المرجعية وقواعد التحقق

تشمل النتائج المرجعية في المستودع ثلاثة عشر عائلة نماذج عبر ثلاث أطر (Pi، OpenClaw وAccio)، وتظهر أن Claude Opus 5 من Anthropic يتصدّر كل جدول، حيث نجح في 65 من 107 مهام على Pi، و60 من 107 على OpenClaw، و66 من 107 على Accio، وفقًا للمستودع. تم إنتاج الدرجات المنشورة عبر نقاط تقييم تُدار بواسطة Accio باستخدام نموذج gemini-3.1-pro-preview كقاضي، ويُحدّد المستودع لوحة المتصدرين الحية كمصدر السجل.

وفقًا لقواعد التحقق الموثقة للمعيار، تُحتسب المهمة كمنجزة فقط إذا نجحت جميع فحوصات المدقق المطلوبة. يعمل المدقق على الجانب المضيف بعد خروج الوكيل، حيث يقرأ الحالة النهائية للخدمات الوهمية المعزولة والملفات التي تطلبها المهمة، وتُنفّذ كل محاولة في حاوية جديدة تُدمّر بعد التقييم.

توثّق موقع لوحة المتصدرين أيضًا حدود القابلية للمقارنة. تشير تقارير تدقيق التوافق إلى أن أطر OpenClaw وAccio وصلت إلى مزودي النماذج عبر نقاط نهاية مختلفة، لذا فإن اختلافات الدرجات بين الأطر تشمل اختلافات مسار المزود بالإضافة إلى اختلافات الإطار نفسه. إطار Accio هو للمرجعية فقط ولا يُضمّن في المستودع، مما يعني أن مسار OpenClaw هو الوحيد القابل لإعادة تشغيله من البداية إلى النهاية عبر السحب العام.

توسّع Accio إلى مساحة عمل موحدة

إلى جانب نتائج المعيار، أعلنت Alibaba.com أن Accio تطور إلى مساحة عمل موحدة للعمليات التجارية الإلكترونية العالمية. وقالت الشركة إن الشركات الصغيرة يمكنها استخدام Accio للبحث في الأسواق، وتحديد فرص المنتجات، وتطوير المنتجات، وتقييم الموردين وإدارة العمليات اليومية، وأن الاتصالات مع Amazon وShopify وeBay وTikTok Shop وWalmart تسمح للبائعين بالوصول إلى سير عمل المتاجر المدعومة من مكان واحد.

من المقرر أن تُعقد النسخة الأوروبية الرائدة من CoCreate في 19–20 نوفمبر 2026 في لندن، وفقًا لموقع الحدث.

إيدن كروس هو استراتيجي مولد بالذكاء الاصطناعي في Unite.AI ، يغطي استراتيجية المنتج الذكي والتنفيذ والتحديات العملية لتحويل النماذج التجريبية إلى منتجات قابلة للتطوير والجاهزة للأسواق. يركز عمله على كيفية انتقال فرق الشركات الناشئة والشركات الكبيرة من النماذج الأولية والتجارب إلى أنظمة موثوقة تستخدمها العملاء الحقيقيون.
مع منظور عملي ومتعمق ، ي分析 إيدن كروس خطط المنتج ، والاستراتيجيات التسويقية ، وتصميم المنصات ، والتنازلات التنظيمية التي تحدد ما إذا كانت مبادرات الذكاء الاصطناعي ستنجح أو تتعثر. يولي اهتماما خاصا للواقعيات التطبيقية ، واعتماد المستخدم ، وقيود البنية التحتية ، والتوازن بين القدرة الفنية والقيمة التجارية.
المقالات التي كتبها إيدن كروس تم إنشاؤها بواسطة الذكاء الاصطناعي ومراجعتها بواسطة فريق التحرير في Unite.AI لضمان الوضوح والدقة والتغطية المسؤولة لكيفية بناء منتجات الذكاء الاصطناعي وشحنها وتوسيعها في العالم الحقيقي.