Modelli e piattaforme di IA
Alibaba.com dichiara che Accio ha eseguito le attività di e‑commerce a costi più del 50% inferiori

Alibaba.com, il 9 settembre 2026, ha annunciato i risultati di una valutazione di benchmark composta da 107 attività, dimostrando che Accio, la sua piattaforma di agenti IA per il commercio, ha completato una serie di compiti di e‑commerce a un costo stimato più del 50 % inferiore rispetto a Codex di OpenAI e Claude Code di Anthropic, con una qualità di completamento descritta dall’azienda come comparabile.
Il completamento dell’intero set di attività ha avuto un costo stimato di 3,69 $ con Accio, contro 9,27 $ per Codex e 9,51 $ per Claude Code, cifre che Alibaba.com ha definito più del 50 % inferiori in entrambi i casi. L’azienda ha affermato che i risultati rendono Accio lo strumento di IA per l’e‑commerce più competitivo in termini di costi disponibile per le piccole e medie imprese. Gli annunci sono stati fatti durante CoCreate, l’evento annuale di Alibaba.com per imprenditori e piccole imprese, la cui edizione 2026 a Los Angeles si svolge dal 9 al 10 settembre 2026.
Come Alibaba.com spiega il divario di costo
Secondo l’azienda, l’efficienza di Accio deriva dall’ottimizzazione dell’intero sistema attorno al lavoro commerciale reale. Accio utilizza dati e flussi di lavoro specifici per il commercio per addestrare in post‑produzione modelli leggeri per compiti ben definiti, consentendo, secondo l’azienda, ai modelli più piccoli di gestire in modo efficiente le attività di routine, mentre i modelli più potenti rimangono disponibili quando è necessario un ragionamento più approfondito.
Piuttosto che ricorrere automaticamente al modello più economico o al più potente, il sistema suddivide le richieste complesse in passaggi gestibili e valuta per ciascuno qualità, velocità, costo e requisiti di dati, secondo l’azienda. Alibaba.com ha descritto tale approccio, in termini economici, come un avvicinamento di ogni flusso di lavoro alla frontiera di Pareto, il punto in cui migliorare una dimensione richiederebbe un compromesso su un’altra. L’azienda ha inoltre attribuito al riutilizzo della cache, alla compressione del contesto e all’esecuzione coordinata degli agenti la riduzione dell’elaborazione ripetuta, delle chiamate inutili agli strumenti e del consumo ridondante di token.
“Per le piccole imprese, l’IA inaccessibile è inutile”, ha dichiarato Kuo Zhang, presidente di Alibaba.com, nell’annuncio dell’azienda. Zhang ha affermato che l’obiettivo è rendere l’IA per il commercio pratica e accessibile anche per un’azienda di una sola persona, piuttosto che semplicemente rendere l’IA più potente.
Commerce Agent Bench, con codice aperto
Alibaba.com ha dichiarato di aver rilasciato con codice aperto Commerce Agent Bench su GitHub. Secondo l’azienda, il benchmark si basa su attività reali dei commercianti (10 milioni di utenti PMI attivi, 1,6 milioni di conversazioni e 200 000 tracce di esecuzione) sintetizzate in 107 compiti di commercio end‑to‑end distribuiti su sette categorie e quattro livelli di autonomia, anziché basarsi su esercizi sintetici. I compiti includono la revisione di centinaia di email non strutturate, l’individuazione di frodi nei pagamenti, il calcolo dei costi di sdoganamento e la prenotazione di percorsi di spedizione multi‑vettore.
Il repository, sviluppato e mantenuto dal team Accio di Alibaba International, suddivide le 107 attività in 53 da riga di comando, 28 per browser, 16 per file e 10 per API/MCP, con sezioni di capacità che coprono 65 solo testuali, 20 con capacità testuale per browser e 22 che richiedono visione. Il progetto era precedentemente noto come RealReplicaBench. Ogni attività viene eseguita in un contenitore nuovo e valutata dal proprio verificatore deterministico o assistito da LLM. L’harness, il pacchetto Python, il codice del servizio mock, gli script e le configurazioni sono distribuiti sotto licenza Apache‑2.0, mentre la suite di attività è rilasciata sotto CC‑BY‑4.0; l’attuale versione è fissata a v1.3.1.
Alibaba.com ha affermato che nessun singolo modello ha prevalso in tutti i casi della valutazione, un risultato presentato come rafforzante la necessità di un instradamento a livello di compito, in base al quale diversi compiti sono gestiti da diversi modelli IA anziché da un unico modello a uso generale per tutto.
Punteggi di riferimento e regole di verifica
I risultati di riferimento nel repository coprono tredici famiglie di modelli attraverso tre harness (Pi, OpenClaw e Accio) e mostrano Claude Opus 5 di Anthropic in testa a ciascuna tabella, superando 65 su 107 compiti su Pi, 60 su 107 su OpenClaw e 66 su 107 su Accio, secondo il repository. I punteggi pubblicati sono stati generati tramite endpoint di valutazione gestiti da Accio con gemini‑3.1‑pro‑preview come modello giudice, e il repository identifica la classifica live come fonte ufficiale.
Secondo le regole di verifica documentate del benchmark, un compito è considerato superato solo se tutti i controlli di verifica richiesti hanno esito positivo. Il verificatore viene eseguito sul host dopo l’uscita dell’agente, leggendo lo stato finale dei servizi mock isolati e gli artefatti richiesti dal compito, e ogni tentativo viene eseguito in un contenitore nuovo che viene distrutto dopo la valutazione.
Il sito della classifica documenta anche i limiti di comparabilità. Il suo audit di allineamento segnala che gli harness OpenClaw e Accio hanno raggiunto i fornitori di modelli tramite endpoint diversi, quindi le differenze di punteggio tra harness includono differenze di percorso del fornitore oltre a differenze di harness. L’harness Accio è solo di riferimento e non è incluso nel repository, il che significa che solo il percorso OpenClaw può essere rieseguito end‑to‑end dal checkout pubblico.
Accio si espande in uno spazio di lavoro unificato
Insieme ai risultati del benchmark, Alibaba.com ha annunciato che Accio si è evoluto in uno spazio di lavoro unificato per le operazioni di e‑commerce a livello globale. L’azienda ha dichiarato che le piccole imprese possono utilizzare Accio per analizzare i mercati, individuare opportunità di prodotto, sviluppare prodotti, valutare fornitori e gestire le operazioni quotidiane, e che le integrazioni con Amazon, Shopify, eBay, TikTok Shop e Walmart consentono ai venditori di accedere ai flussi di lavoro dei negozi supportati da un unico punto.
L’edizione europea di punta di CoCreate è prevista per il 19–20 novembre 2026, a Londra, secondo il sito dell’evento.












