Modele i platformy AI
Alibaba.com twierdzi, że Accio wykonało zadania e‑commerce przy ponad 50% niższym koszcie

Alibaba.com 9 września 2026 r. ogłosiło wyniki oceny benchmarku obejmującego 107 zadań, wykazujące, że Accio, ich platforma agentów AI dla handlu, wykonało szereg zadań e‑commerce przy szacowanym koszcie ponad 50 % niższym niż Codex firmy OpenAI oraz Claude Code firmy Anthropic, przy jakości wykonania określonej przez firmę jako porównywalna.
Zrealizowanie pełnego zestawu zadań kosztowało szacunkowo 3,69 USD przy użyciu Accio, w porównaniu do 9,27 USD dla Codex i 9,51 USD dla Claude Code – liczby, które Alibaba.com określiło jako ponad 50 % niższe w obu przypadkach. Firma stwierdziła, że wyniki czynią Accio najbardziej konkurencyjnym kosztowo narzędziem AI dla e‑commerce dostępnym dla małych i średnich przedsiębiorstw. Ogłoszenia zostały przedstawione podczas CoCreate, corocznego wydarzenia Alibaba.com skierowanego do przedsiębiorców i małych firm, którego edycja w Los Angeles w 2026 r. odbywa się w dniach 9–10 września 2026.
Jak Alibaba.com wyjaśnia różnicę kosztową
Według firmy, efektywność Accio wynika z optymalizacji całego systemu pod kątem rzeczywistych działań handlowych. Accio wykorzystuje dane i przepływy pracy specyficzne dla handlu do dalszego trenowania lekkich modeli przeznaczonych do jasno określonych zadań, co, jak twierdzi firma, pozwala mniejszym modelom efektywnie obsługiwać rutynowe zadania, podczas gdy bardziej zaawansowane modele pozostają dostępne w sytuacjach wymagających głębszego rozumowania.
Zamiast domyślnie wybierać najtańszy lub najpotężniejszy model, system dzieli złożone żądania na wykonalne kroki i ocenia jakość, szybkość, koszt oraz wymagania danych dla każdego z nich, jak podkreśla firma. Alibaba.com określiło to podejście, w kategoriach ekonomicznych, jako przybliżanie każdego przepływu pracy do granicy Pareto, czyli punktu, w którym poprawa jednej wymiaru wymaga kompromisu w innym. Firma również przypisała zmniejszenie powtarzalnego przetwarzania, niepotrzebnych wywołań narzędzi i nadmiarowego zużycia tokenów na ponowne wykorzystanie pamięci podręcznej, kompresję kontekstu oraz skoordynowane wykonywanie agentów.
„Dla małych firm, nieosiągalna cenowo sztuczna inteligencja jest bezużyteczna,” powiedział Kuo Zhang, prezes Alibaba.com, w ogłoszeniu firmy. Zhang stwierdził, że celem jest uczynienie AI handlowej praktyczną i przystępną cenowo nawet dla jednoosobowej firmy, a nie jedynie zwiększanie mocy AI.
Commerce Agent Bench, udostępniony jako open source
Alibaba.com poinformowało, że udostępniło jako open source Commerce Agent Bench on GitHub. Według firmy, benchmark opiera się na rzeczywistej aktywności handlowców (10 milionów aktywnych użytkowników MŚP, 1,6 miliona konwersacji i 200 000 śladów wykonania) przetworzonych do 107 kompleksowych zadań handlowych obejmujących siedem kategorii i cztery poziomy autonomii, zamiast polegać na syntetycznych ćwiczeniach. Zadania obejmują przeglądanie setek nieustrukturyzowanych e‑maili, wykrywanie oszustw płatniczych, obliczanie kosztów docelowych oraz rezerwację tras wysyłkowych z wieloma przewoźnikami.
Repozytorium, opracowane i utrzymywane przez zespół Accio w Alibaba International, dzieli 107 zadań na 53 zadania wiersza poleceń, 28 zadań przeglądarkowych, 16 zadań plikowych i 10 zadań API/MCP, przy czym zakresy możliwości obejmują 65 zadań wyłącznie tekstowych, 20 zadań obsługujących tekst w przeglądarce oraz 22 zadania wymagające wizji. Projekt wcześniej nosił nazwę RealReplicaBench. Każde zadanie uruchamiane jest w nowym kontenerze i oceniane przez własny weryfikator deterministyczny lub wspomagany przez LLM. Środowisko testowe, pakiet Pythona, kod usługi mock, skrypty i konfiguracje są udostępniane na licencji Apache‑2.0, natomiast zestaw zadań na licencji CC‑BY‑4.0; bieżące wydanie jest oznaczone jako v1.3.1.
Alibaba.com poinformowało, że w ocenie żaden pojedynczy model nie przewyższał innych we wszystkich zadaniach, co firma przedstawiła jako potwierdzenie potrzeby routingu na poziomie zadania, w którym różne zadania są obsługiwane przez różne modele AI, a nie przez jeden uniwersalny model.
Wyniki referencyjne i zasady weryfikacji
Wyniki referencyjne w repozytorium obejmują trzynaście rodzin modeli w trzech środowiskach testowych (Pi, OpenClaw i Accio) i wykazują, że Claude Opus 5 firmy Anthropic prowadzi w każdej tabeli, uzyskując 65 z 107 zadań w Pi, 60 z 107 w OpenClaw oraz 66 z 107 w Accio, zgodnie z danymi repozytorium. Opublikowane wyniki zostały wygenerowane przy użyciu punktów końcowych oceny zarządzanych przez Accio, z modelem sędziującym gemini‑3.1‑pro‑preview, a repozytorium wskazuje na live leaderboard jako źródło rekordowe.
Zgodnie z udokumentowanymi zasadami weryfikacji benchmarku, zadanie uznaje się za zaliczone tylko wtedy, gdy wszystkie wymagane kontrole weryfikatora zakończą się sukcesem. Weryfikator działa po stronie hosta po zakończeniu działania agenta, odczytując końcowy stan izolowanych usług mock oraz artefakty wymagane przez zadanie, a każda próba uruchamiana jest w nowym kontenerze, który jest usuwany po ocenie.
Strona z tablicą wyników dokumentuje również ograniczenia porównywalności. Audyt zgodności wskazuje, że środowiska OpenClaw i Accio uzyskiwały dostęp do dostawców modeli przez różne punkty końcowe, dlatego różnice w wynikach pomiędzy środowiskami uwzględniają zarówno różnice w trasach dostawców, jak i różnice w samych środowiskach. Środowisko Accio jest wyłącznie referencyjne i nie jest udostępniane w repozytorium, co oznacza, że jedynie ścieżka OpenClaw może być ponownie uruchomiona od początku do końca z publicznego checkoutu.
Accio rozszerzone do jednego, zintegrowanego środowiska pracy
Wraz z wynikami benchmarku Alibaba.com ogłosiło, że Accio przekształciło się w zintegrowane środowisko pracy dla globalnych operacji e‑commerce. Firma stwierdziła, że małe przedsiębiorstwa mogą korzystać z Accio do badania rynków, identyfikowania możliwości produktowych, opracowywania produktów, oceny dostawców i zarządzania codziennymi operacjami, a połączenia z Amazon, Shopify, eBay, TikTok Shop i Walmart umożliwiają sprzedawcom dostęp do obsługiwanych przepływów pracy w sklepach z jednego miejsca.
Europejska flagowa edycja CoCreate jest zaplanowana na 19–20 listopada 2026 r. w Londynie, według strony wydarzenia.












