Modelos e plataformas de IA
Alibaba.com afirma que Accio executou tarefas de comércio eletrônico com mais de 50% de custo reduzido

Em 9 de setembro de 2026, a Alibaba.com anunciou resultados de uma avaliação de benchmark com 107 tarefas, mostrando que o Accio, sua plataforma de agentes de IA para comércio, concluiu uma variedade de tarefas de comércio eletrônico a um custo estimado mais de 50 % inferior ao do Codex da OpenAI e ao Claude Code da Anthropic, com qualidade de conclusão considerada comparável pela empresa.
Concluir todo o conjunto de tarefas custou cerca de US$ 3,69 com o Accio, contra US$ 9,27 para o Codex e US$ 9,51 para o Claude Code, números que a Alibaba.com descreveu como mais de 50 % menores em ambos os casos. A empresa afirmou que os resultados tornam o Accio a ferramenta de IA para comércio eletrônico mais competitiva em termos de custo disponível para pequenas e médias empresas. Os anúncios foram feitos no CoCreate, evento anual da Alibaba.com para empreendedores e pequenas empresas, cuja edição de 2026 em Los Angeles ocorre de 9 a 10 de setembro de 2026.
Como o Alibaba.com explica a diferença de custo
Segundo a empresa, a eficiência do Accio provém da otimização de todo o sistema em torno de trabalhos reais de comércio. O Accio utiliza dados e fluxos de trabalho específicos do comércio para treinar, após a fase inicial, modelos leves para tarefas claramente definidas, o que, segundo a empresa, permite que modelos menores lidem com trabalhos rotineiros de forma eficiente, enquanto modelos mais avançados permanecem disponíveis quando é necessário raciocínio mais profundo.
Em vez de recorrer automaticamente ao modelo mais barato ou ao mais potente, o sistema divide solicitações complexas em etapas manejáveis e avalia qualidade, velocidade, custo e requisitos de dados para cada etapa, afirmou a empresa. A Alibaba.com descreveu essa abordagem, em termos econômicos, como mover cada fluxo de trabalho mais próximo da fronteira de Pareto, ponto em que melhorar uma dimensão exigiria concessões em outra. A empresa também atribuiu a reutilização de cache, compressão de contexto e execução coordenada de agentes a redução de processamento repetido, chamadas de ferramentas desnecessárias e consumo redundante de tokens.
“Para pequenas empresas, IA inacessível é inútil”, disse Kuo Zhang, presidente da Alibaba.com, no anúncio da empresa. Zhang afirmou que o objetivo é tornar a IA para comércio prática e acessível até mesmo para uma empresa de uma única pessoa, e não apenas tornar a IA mais poderosa.
Commerce Agent Bench, código aberto
A Alibaba.com informou que disponibilizou o código aberto do Commerce Agent Bench no GitHub. Segundo a empresa, o benchmark se baseia em atividades reais de comerciantes (10 milhões de usuários ativos de PMEs, 1,6 milhão de conversas e 200 mil rastros de execução) condensados em 107 tarefas de comércio de ponta a ponta, distribuídas em sete categorias e quatro níveis de autonomia, em vez de depender de exercícios sintéticos. As tarefas incluem a revisão de centenas de e‑mails não estruturados, a detecção de fraudes em pagamentos, o cálculo de custos de importação e a reserva de rotas de envio com múltiplas transportadoras.
O repositório, desenvolvido e mantido pela equipe Accio da Alibaba International, divide as 107 tarefas em 53 de linha de comando, 28 de navegador, 16 de arquivo e 10 de API/MCP, com segmentos de capacidade abrangendo 65 apenas de texto, 20 capazes de texto em navegador e 22 que exigem visão. O projeto era anteriormente conhecido como RealReplicaBench. Cada tarefa é executada em um contêiner novo e avaliada por seu próprio verificador determinístico ou assistido por LLM. O harness, o pacote Python, o código de serviço simulado, os scripts e as configurações são distribuídos sob a licença Apache‑2.0, enquanto o conjunto de tarefas é licenciado sob CC‑BY‑4.0; a versão atual está fixada como v1.3.1.
A Alibaba.com afirmou que nenhum modelo único liderou em todos os aspectos da avaliação, resultado que apresentou como reforço da necessidade de roteamento por nível de tarefa, em que diferentes tarefas são tratadas por diferentes modelos de IA, em vez de um modelo de uso geral para tudo.
Pontuações de referência e regras de verificação
Os resultados de referência no repositório abrangem treze famílias de modelos em três harnesses (Pi, OpenClaw e Accio) e mostram o Claude Opus 5 da Anthropic liderando cada tabela, aprovando 65 de 107 tarefas no Pi, 60 de 107 no OpenClaw e 66 de 107 no Accio, conforme o repositório. As pontuações publicadas foram geradas por meio de endpoints de avaliação gerenciados pelo Accio, com o gemini‑3.1‑pro‑preview como modelo juiz, e o repositório identifica a leaderboard ao vivo como a fonte oficial.
De acordo com as regras de verificação documentadas do benchmark, uma tarefa só é considerada aprovada se todas as verificações exigidas pelo verificador forem bem‑sucedidas. O verificador é executado no host após a saída do agente, lendo o estado final dos serviços simulados isolados e os artefatos exigidos pela tarefa, e cada tentativa ocorre em um contêiner novo que é destruído após a pontuação.
O site da leaderboard também documenta limites de comparabilidade. Seu auditoria de alinhamento relata que os harnesses OpenClaw e Accio acessaram os provedores de modelo por meio de endpoints diferentes, de modo que diferenças de pontuação entre harnesses absorvem diferenças de rota do provedor, bem como diferenças de harness. O harness Accio é apenas de referência e não é distribuído no repositório, o que significa que somente o caminho OpenClaw pode ser reexecutado de ponta a ponta a partir do checkout público.
Accio ampliado para um espaço de trabalho unificado
Juntamente com os resultados do benchmark, a Alibaba.com anunciou que o Accio evoluiu para um espaço de trabalho unificado para operações globais de comércio eletrônico. A empresa afirmou que pequenas empresas podem usar o Accio para pesquisar mercados, identificar oportunidades de produtos, desenvolver produtos, avaliar fornecedores e gerenciar operações diárias, e que conexões com Amazon, Shopify, eBay, TikTok Shop e Walmart permitem que os vendedores acessem fluxos de trabalho de vitrines suportados a partir de um único local.
A edição europeia principal do CoCreate está programada para 19 e 20 de novembro de 2026, em Londres, conforme o site do evento.












