Моделі та платформи ШІ
Alibaba.com стверджує, що Accio виконує e‑Commerce завдання за більш ніж 50% нижчою вартістю

Alibaba.com 9 вересня 2026 року оголосив результати 107‑завданого бенчмарку, які показали, що Accio, його платформа AI‑агентів для комерції, виконала низку e‑commerce завдань за більш ніж 50 % нижчою оціненою вартістю, ніж Codex від OpenAI та Claude Code від Anthropic, при цьому компанія охарактеризувала якість виконання як порівнянну.
Виконання повного набору завдань обійшлося приблизно у $3,69 за допомогою Accio, у порівнянні з $9,27 для Codex та $9,51 для Claude Code, що, за словами Alibaba.com, становить більш ніж 50 % зниження у обох випадках. Компанія заявила, що ці результати роблять Accio найекономічнішим інструментом AI для e‑commerce, доступним малим і середнім підприємствам. Оголошення були зроблені на CoCreate, щорічному заході Alibaba.com для підприємців і малих бізнесів, який у 2026 р. у Лос‑Анджелесі проходить 9–10 вересня 2026 р.
Як Alibaba.com пояснює різницю у вартості
За словами компанії, ефективність Accio походить від оптимізації всієї системи під реальну комерційну роботу. Accio використовує спеціалізовані дані та робочі процеси комерції для післятренування легковагових моделей для чітко визначених завдань, що, за словами компанії, дозволяє меншим моделям ефективно виконувати рутинну роботу, тоді як більш потужні моделі залишаються доступними, коли потрібне глибше міркування.
Замість того, щоб автоматично обирати найдешевшу або найпотужнішу модель, система розбиває складні запити на керовані кроки та оцінює якість, швидкість, вартість і вимоги до даних для кожного кроку, повідомляє компанія. Alibaba.com охарактеризувала цей підхід у економічних термінах як наближення кожного робочого процесу до фронтиру Парето — точки, у якій покращення одного параметра вимагає компромісу в іншому. Компанія також приписує зниження повторної обробки, зайвих викликів інструментів та надлишкового споживання токенів повторному використанню кешу, стисканню контексту та координованому виконанню агентів.
“Для малих підприємств недоступний AI — це марно,” — сказав Куо Чжан, президент Alibaba.com, у заяві компанії. Чжан зазначив, що мета полягає у тому, щоб зробити комерційний AI практичним і доступним навіть для одноперсонної компанії, а не лише робити AI потужнішим.
Commerce Agent Bench, відкритий вихідний код
Alibaba.com повідомив, що відкрив вихідний код Commerce Agent Bench на GitHub. За словами компанії, бенчмарк базується на реальній діяльності торговців (10 млн активних користувачів МСБ, 1,6 млн розмов і 200 000 трас виконання), які були згруповані у 107 сквозних комерційних завдань у семи категоріях і чотирьох рівнях автономії, замість використання синтетичних вправ. Завдання включають перегляд сотень неструктурованих електронних листів, виявлення шахрайства з платежами, розрахунок вартості доставки та бронювання маршрутів багатоканальної доставки.
Репозиторій, розроблений і підтримуваний командою Accio у Alibaba International, розподіляє 107 завдань на 53 командного рядка, 28 браузерних, 16 файлових та 10 API/MCP завдань, з можливостями, що охоплюють 65 лише текстових, 20 браузер‑текстових та 22 завдання, що вимагають зору. Проект раніше називався RealReplicaBench. Кожне завдання виконується у новому контейнері і оцінюється власним детермінованим або LLM‑допоміжним верифікатором. Фреймворк, пакет Python, код мок‑сервісу, скрипти та конфігурації розповсюджуються під ліцензією Apache‑2.0, а набір завдань — під CC‑BY‑4.0; поточний випуск зафіксовано як v1.3.1.
Alibaba.com зазначив, що жодна окрема модель не випередила інші у всій оцінці, що, за їх словами, підкреслює важливість маршрутизації на рівні завдань, коли різні завдання обробляються різними AI‑моделями, а не однією універсальною моделлю для всього.
Референсні оцінки та правила верифікації
Референсні результати в репозиторії охоплюють тринадцять сімей моделей у трьох фреймворках (Pi, OpenClaw та Accio) і показують, що Claude Opus 5 від Anthropic очолює кожну таблицю, пройшовши 65 із 107 завдань у Pi, 60 із 107 у OpenClaw та 66 із 107 у Accio, згідно з репозиторієм. Опубліковані оцінки були отримані через оцінювальні кінцеві точки, керовані Accio, з gemini‑3.1‑pro‑preview як моделлю‑суддею, а репозиторій визначає живу таблицю лідерів як офіційне джерело.
Відповідно до задокументованих правил верифікації бенчмарку, завдання вважається успішним лише тоді, коли успішно проходять усі необхідні перевірки верифікатора. Верифікатор виконується на хості після завершення роботи агента, читаючи кінцевий стан ізольованих мок‑сервісів та артефактів, необхідних завданням, і кожна спроба запускається в новому контейнері, який знищується після оцінювання.
Сайт таблиці лідерів також документує обмеження щодо порівнянності. Його аудит узгодженості повідомляє, що фреймворки OpenClaw і Accio підключалися до постачальників моделей через різні кінцеві точки, тому різниці у баллах між фреймворками враховують як відмінності у маршрутах постачальників, так і відмінності у самих фреймворках. Фреймворк Accio є лише референсним і не постачається в репозиторії, що означає, що лише шлях OpenClaw можна повторно запустити скрізь від початку до кінця з публічного checkout.
Accio розширився до єдиного робочого простору
Разом з результатами бенчмарку Alibaba.com оголосив, що Accio перетворився на єдиний робочий простір для глобальних операцій e‑commerce. Компанія зазначила, що малі підприємства можуть використовувати Accio для дослідження ринків, виявлення можливостей продукту, розробки продуктів, оцінки постачальників та управління щоденною діяльністю, а інтеграції з Amazon, Shopify, eBay, TikTok Shop та Walmart дозволяють продавцям отримати доступ до підтримуваних процесів у вітринах з одного місця.
За інформацією з сайту заходу, європейська флагманська версія CoCreate запланована на 19–20 листопада 2026 р. у Лондоні.












