Modèles et plateformes d’IA

Alibaba.com affirme qu’Accio a exécuté des tâches de commerce électronique à plus de 50% de coût inférieur

mm
Ajouter Unite.AI à vos sources préférées sur Google

Alibaba.com, le 9 septembre 2026, a annoncé les résultats d’une évaluation de référence de 107 tâches montrant qu’Accio, sa plateforme d’agents IA pour le commerce, a réalisé une série de tâches de commerce électronique à un coût estimé de plus de 50 % inférieur à celui de Codex d’OpenAI et de Claude Code d’Anthropic, avec une qualité d’exécution que l’entreprise a décrite comme comparable.

L’exécution de l’ensemble complet des tâches a coûté environ 3,69 $ avec Accio, contre 9,27 $ pour Codex et 9,51 $ pour Claude Code, des chiffres qu’Alibaba.com a qualifiés de plus de 50 % inférieurs dans les deux cas. L’entreprise a déclaré que ces résultats font d’Accio l’outil d’IA pour le commerce électronique le plus compétitif en termes de coût, disponible pour les petites et moyennes entreprises. Les annonces ont été faites lors de CoCreate, l’événement annuel d’Alibaba.com destiné aux entrepreneurs et aux petites entreprises, dont l’édition 2026 de Los Angeles se déroulera du 9 au 10 septembre 2026.

Comment Alibaba.com explique l’écart de coût

Selon l’entreprise, l’efficacité d’Accio provient de l’optimisation de l’ensemble du système autour du travail commercial réel. Accio utilise des données et des flux de travail spécifiques au commerce pour affiner, après entraînement, des modèles légers destinés à des tâches clairement définies, ce qui, selon l’entreprise, permet aux modèles plus petits de gérer les travaux de routine de manière efficace, tandis que des modèles plus performants restent disponibles lorsque des raisonnements plus approfondis sont nécessaires.

Plutôt que de se rabattre systématiquement sur le modèle le moins cher ou le plus puissant, le système découpe les demandes complexes en étapes gérables et évalue la qualité, la rapidité, le coût et les exigences de données pour chaque étape, selon l’entreprise. Alibaba.com a décrit cette approche, en termes économiques, comme rapprochant chaque flux de travail de la frontière de Pareto, le point où l’amélioration d’une dimension nécessite un compromis sur une autre. L’entreprise a également attribué la réduction du traitement répété, des appels d’outils inutiles et de la consommation redondante de jetons à la réutilisation du cache, à la compression du contexte et à l’exécution coordonnée des agents.

“Pour les petites entreprises, une IA inabordable est inutile,” a déclaré Kuo Zhang, président d’Alibaba.com, dans l’annonce de l’entreprise. Zhang a indiqué que l’objectif est de rendre l’IA commerciale pratique et abordable même pour une entreprise d’une seule personne, plutôt que de simplement rendre l’IA plus puissante.

Commerce Agent Bench, à code source ouvert

Alibaba.com a indiqué avoir rendu le Commerce Agent Bench disponible en code source ouvert sur GitHub. Selon l’entreprise, la référence s’appuie sur l’activité réelle des commerçants (10 millions d’utilisateurs PME actifs, 1,6 million de conversations et 200 000 traces d’exécution) condensées en 107 tâches de commerce de bout en bout réparties sur sept catégories et quatre niveaux d’autonomie, plutôt que de se baser sur des exercices synthétiques. Les tâches comprennent la révision de centaines d’e‑mails non structurés, la détection de fraudes de paiement, le calcul des coûts d’acheminement et la réservation d’itinéraires d’expédition multi‑transporteurs.

Le dépôt, développé et maintenu par l’équipe Accio d’Alibaba International, répartit les 107 tâches en 53 en ligne de commande, 28 pour le navigateur, 16 pour les fichiers et 10 pour les API/MCP, avec des tranches de capacité couvrant 65 tâches uniquement textuelles, 20 capables de texte dans le navigateur et 22 nécessitant la vision. Le projet était auparavant connu sous le nom de RealReplicaBench. Chaque tâche s’exécute dans un conteneur neuf et est évaluée par son propre vérificateur déterministe ou assisté par LLM. Le cadre, le paquet Python, le code de service factice, les scripts et les configurations sont distribués sous licence Apache‑2.0, tandis que la suite de tâches est distribuée sous CC‑BY‑4.0 ; la version actuelle est fixée à v1.3.1.

Alibaba.com a déclaré qu’aucun modèle unique n’a dominé l’évaluation, un résultat qu’elle a présenté comme renforçant l’argument en faveur du routage au niveau des tâches, selon lequel différentes tâches sont prises en charge par différents modèles d’IA plutôt que par un seul modèle à usage général pour tout.

Scores de référence et règles de vérification

Les résultats de référence du dépôt couvrent treize familles de modèles réparties sur trois cadres (Pi, OpenClaw et Accio), et montrent que Claude Opus 5 d’Anthropic domine chaque tableau, réussissant 65 sur 107 tâches sur Pi, 60 sur 107 sur OpenClaw et 66 sur 107 sur Accio, selon le dépôt. Les scores publiés ont été générés via des points d’évaluation gérés par Accio avec gemini‑3.1‑pro‑preview comme modèle juge, et le dépôt identifie le classement en ligne comme source officielle.

Selon les règles de vérification documentées du benchmark, une tâche n’est considérée comme réussie que si chaque contrôle de vérificateur requis aboutit. Le vérificateur s’exécute côté hôte après la sortie de l’agent, en lisant l’état final des services factices isolés et les artefacts requis par la tâche, chaque tentative s’exécutant dans un conteneur neuf qui est détruit après l’attribution du score.

Le site du classement documente également des limites de comparabilité. Son audit d’alignement indique que les cadres OpenClaw et Accio ont atteint les fournisseurs de modèles via des points de terminaison différents, de sorte que les différences de scores entre cadres intègrent à la fois les différences de route du fournisseur et les différences de cadre. Le cadre Accio est uniquement de référence et n’est pas fourni dans le dépôt, ce qui signifie que seul le chemin OpenClaw peut être relancé de bout en bout depuis le checkout public.

Accio s’est développé en un espace de travail unifié

Parallèlement aux résultats du benchmark, Alibaba.com a annoncé qu’Accio était devenu un espace de travail unifié pour les opérations de commerce électronique mondiales. L’entreprise a déclaré que les petites entreprises peuvent utiliser Accio pour étudier les marchés, identifier des opportunités de produits, développer des produits, évaluer les fournisseurs et gérer les opérations quotidiennes, et que les connexions avec Amazon, Shopify, eBay, TikTok Shop et Walmart permettent aux vendeurs d’accéder aux flux de travail de vitrines prises en charge depuis un seul endroit.

L’édition phare européenne de CoCreate est prévue les 19 et 20 novembre 2026 à Londres, selon le site de l’événement.

Aiden Cross est un stratège généré par IA chez Unite.AI, couvrant la stratégie de produit IA, l'exécution et les défis pratiques pour transformer des modèles expérimentaux en produits prêts pour le marché et évolutifs. Son travail se concentre sur la façon dont les startups et les équipes d'entreprise passent des prototypes et des démos à des systèmes fiables utilisés par de vrais clients.
Avec une perspective pragmatique et axée sur les détails, Aiden analyse les feuilles de route de produit, les stratégies de lancement sur le marché, les décisions de plateforme et les compromis organisationnels qui déterminent si les initiatives IA réussissent ou stagner. Il prête une attention particulière aux réalités de déploiement, à l'adoption des utilisateurs, aux contraintes d'infrastructure et à l'alignement entre la capacité technique et la valeur commerciale.
Les articles rédigés par Aiden Cross sont générés par IA et révisés par l'équipe éditoriale de Unite.AI pour garantir la clarté, l'exactitude et la couverture responsable de la façon dont les produits IA sont construits, expédiés et mis à l'échelle dans le monde réel.