Modele și platforme AI

Alibaba.com afirmă că Accio a realizat sarcini de comerț electronic cu costuri cu peste 50% mai mici

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Alibaba.com a anunțat pe 9 septembrie 2026 rezultatele unei evaluări de referință cu 107 sarcini, demonstrând că Accio, platforma sa de agenți AI pentru comerț, a finalizat o serie de sarcini de comerț electronic la un cost estimat cu peste 50 % mai mic decât Codex de la OpenAI și Claude Code de la Anthropic, cu o calitate a finalizării descrisă de companie ca fiind comparabilă.

Finalizarea întregului set de sarcini a costat estimativ 3,69 $ cu Accio, comparativ cu 9,27 $ pentru Codex și 9,51 $ pentru Claude Code, cifre pe care Alibaba.com le-a descris ca fiind cu peste 50 % mai mici în ambele cazuri. Compania a declarat că rezultatele fac din Accio cea mai competitivă din punct de vedere al costurilor unealtă AI pentru comerț electronic disponibilă pentru întreprinderile mici și mijlocii. Anunțurile au fost făcute la CoCreate, evenimentul anual al Alibaba.com pentru antreprenori și afaceri mici, ediția din Los Angeles 2026 desfășurându-se în perioada 9‑10 septembrie 2026.

Cum explică Alibaba.com diferența de cost

Potrivit companiei, eficiența lui Accio provine din optimizarea întregului sistem în jurul activităților reale de comerț. Accio folosește date și fluxuri de lucru specifice comerțului pentru a antrena ulterior modele ușoare pentru sarcini clar definite, ceea ce, conform companiei, permite modelelor mai mici să gestioneze eficient munca de rutină, în timp ce modelele mai capabile rămân disponibile atunci când este necesară o raționare mai profundă.

În loc să se bazeze automat pe modelul cel mai ieftin sau cel mai puternic, sistemul împarte cererile complexe în pași gestionabili și evaluează calitatea, viteza, costul și cerințele de date pentru fiecare pas, a declarat compania. Alibaba.com a descris această abordare, în termeni economici, ca apropierea fiecărui flux de lucru de frontiera Pareto, punctul în care îmbunătățirea unei dimensiuni ar necesita un compromis în alta. Compania a atribuit, de asemenea, reutilizarea cache‑ului, comprimarea contextului și execuția coordonată a agenților reducerii procesărilor repetate, apelurilor inutile de instrumente și consumului redundant de tokeni.

„Pentru întreprinderile mici, AI-ul inaccesibil este inutil”, a declarat Kuo Zhang, președinte al Alibaba.com, în anunțul companiei. Zhang a precizat că scopul este de a face AI-ul pentru comerț practic și accesibil chiar și pentru o firmă cu o singură persoană, nu doar de a face AI-ul mai puternic.

Commerce Agent Bench, cu cod sursă deschis

Alibaba.com a declarat că a pus la dispoziție cu cod sursă deschis Commerce Agent Bench pe GitHub. Conform companiei, benchmark‑ul se bazează pe activitatea reală a comercianților (10 milioane de utilizatori activi SMB, 1,6 milioane de conversații și 200 000 de înregistrări de execuție) distilate în 107 sarcini de comerț de la cap la cap, acoperind șapte categorii și patru niveluri de autonomie, în loc să se bazeze pe exerciții sintetice. Sarcinile includ revizuirea a sute de e‑mailuri nestructurate, detectarea fraudei de plată, calcularea costurilor de livrare și rezervarea rutelor de transport multimodal.

Depozitul, dezvoltat și întreținut de echipa Accio de la Alibaba International, împarte cele 107 sarcini în 53 de tip linie de comandă, 28 de tip browser, 16 de tip fișier și 10 de tip API/MCP, cu segmente de capacitate ce acoperă 65 de sarcini doar text, 20 de sarcini capabile de text în browser și 22 de sarcini ce necesită viziune. Proiectul era cunoscut anterior sub numele de RealReplicaBench. Fiecare sarcină rulează într-un container nou și este evaluată de propriul său verificator determinist sau asistat de LLM. Cadru, pachetul Python, codul de servicii simulate, scripturile și configurațiile sunt distribuite sub licența Apache‑2.0, în timp ce suita de sarcini este distribuită sub CC‑BY‑4.0; versiunea curentă este fixată la v1.3.1.

Alibaba.com a afirmat că niciun model nu a condus în mod uniform în evaluare, un rezultat pe care l‑a prezentat ca întărind argumentul pentru rutarea la nivel de sarcină, în care sarcinile diferite sunt gestionate de modele AI diferite, în loc de un singur model cu scop general pentru tot.

Scoruri de referință și reguli de verificare

Rezultatele de referință din depozit acoperă treisprezece familii de modele în trei cadre (Pi, OpenClaw și Accio) și arată că Claude Opus 5 de la Anthropic conduce fiecare tabel, trecând 65 din 107 sarcini pe Pi, 60 din 107 pe OpenClaw și 66 din 107 pe Accio, conform depozitului. Scorurile publicate au fost generate prin puncte finale de evaluare gestionate de Accio, cu gemini‑3.1‑pro‑preview ca model judecător, iar depozitul identifică clasamentul live ca sursă oficială.

Conform regulilor de verificare documentate ale benchmark‑ului, o sarcină este considerată trecută numai dacă toate verificările obligatorii ale verificatorului reușesc. Verificatorul rulează pe gazdă după ce agentul se încheie, citind starea finală a serviciilor simulate izolate și artefactele solicitate de sarcină, iar fiecare încercare rulează într-un container nou care este distrus după evaluare.

Site‑ul cu clasamentul documentează, de asemenea, limite privind comparabilitatea. Auditul său de aliniere raportează că cadrele OpenClaw și Accio au accesat furnizorii de modele prin puncte finale diferite, astfel încât diferențele de scor între cadre absorb diferențele de rută ale furnizorilor, precum și diferențele de cadru. Cadru Accio este doar de referință și nu este inclus în depozit, ceea ce înseamnă că numai calea OpenClaw poate fi reluată de la cap la cap din checkout‑ul public.

Accio s‑a extins într‑un spațiu de lucru unificat

În paralel cu rezultatele benchmark‑ului, Alibaba.com a anunțat că Accio a evoluat într‑un spațiu de lucru unificat pentru operațiuni globale de comerț electronic. Compania a declarat că întreprinderile mici pot folosi Accio pentru a cerceta piețele, a identifica oportunități de produse, a dezvolta produse, a evalua furnizorii și a gestiona operațiunile zilnice, iar conexiunile cu Amazon, Shopify, eBay, TikTok Shop și Walmart permit vânzătorilor să acceseze fluxuri de lucru ale vitrinelor suportate dintr‑un singur loc.

Ediția europeană principală a CoCreate este programată pentru 19‑20 noiembrie 2026, la Londra, conform site‑ului evenimentului.

Aiden Cross este un strategist generat de AI la Unite.AI, care acoperă strategia de produs AI, execuția și provocările practice de transformare a modelelor experimentale în produse scalabile și gata de piață. Lucrările sale se concentrează pe modul în care startup-urile și echipele enterprise trec de la prototipuri și demo-uri la sisteme fiabile utilizate de clienți reali.
Cu o perspectivă pragmatică și atentă la detalii, Aiden analizează planurile de drum ale produselor, strategiile de lansare pe piață, deciziile de platformă și compromisurile organizaționale care determină dacă inițiativele AI reușesc sau stagnează. El acordă o atenție deosebită realităților de implementare, adoptării utilizatorilor, constrângerilor de infrastructură și alinierii dintre capacitatea tehnică și valoarea business.
Articolele scrise de Aiden Cross sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura claritatea, acuratețea și acoperirea responsabilă a modului în care produsele AI sunt create, expediate și scalate în lumea reală.