Модели и платформы ИИ
Alibaba.com заявляет, что Accio выполнил задачи электронной коммерции более чем на 50% дешевле

Alibaba.com 9 сентября 2026 года объявила результаты оценки по бенчмарку из 107 задач, показав, что Accio, её платформа AI‑агентов для коммерции, выполнила ряд задач электронной коммерции с более чем на 50 % меньшей оценочной стоимостью по сравнению с Codex от OpenAI и Claude Code от Anthropic, при том, что компания охарактеризовала качество выполнения как сопоставимое.
Выполнение полного набора задач обошлось в оценочные $3,69 с Accio, против $9,27 у Codex и $9,51 у Claude Code; эти цифры Alibaba.com охарактеризовала как более чем на 50 % ниже в обоих случаях. Компания заявила, что результаты делают Accio самым экономически конкурентоспособным AI‑инструментом для электронной коммерции, доступным малому и среднему бизнесу. Объявления были сделаны на CoCreate, ежегодном мероприятии Alibaba.com для предпринимателей и малых предприятий, которое в 2026 году проходит в Лос‑Анджелесе 9–10 сентября 2026 года.
Как Alibaba.com объясняет разницу в стоимости
По словам компании, эффективность Accio достигается за счёт оптимизации всей системы под реальные коммерческие операции. Accio использует специфичные для торговли данные и рабочие процессы для дообучения лёгких моделей под чётко определённые задачи, что, по заявлению компании, позволяет небольшим моделям эффективно выполнять рутинную работу, в то время как более мощные модели остаются доступными для более глубоких рассуждений.
Вместо того чтобы автоматически выбирать либо самую дешёвую, либо самую мощную модель, система разбивает сложные запросы на управляемые шаги и оценивает качество, скорость, стоимость и требования к данным для каждого шага, сообщает компания. Alibaba.com охарактеризовала такой подход в экономических терминах как приближение каждого рабочего процесса к границе Парето — точке, в которой улучшение одного параметра требует компромисса в другом. Компания также отдала должное повторному использованию кэша, сжатию контекста и скоординированному выполнению агентов, которые снижают повторную обработку, лишние вызовы инструментов и избыточное потребление токенов.
«Для малого бизнеса недоступный AI бесполезен», — сказал Куо Чжанг, президент Alibaba.com, в объявлении компании. Чжанг отметил, что цель состоит в том, чтобы сделать AI для коммерции практичным и доступным даже для одночленного предприятия, а не просто сделать AI более мощным.
Commerce Agent Bench с открытым исходным кодом
Alibaba.com заявила, что разместила Commerce Agent Bench с открытым исходным кодом на GitHub. По словам компании, бенчмарк основан на реальной активности торговцев (10 млн активных пользователей МСП, 1,6 млн диалогов и 200 тыс. трасс выполнения), сведённых в 107 сквозных коммерческих задач, охватывающих семь категорий и четыре уровня автономии, вместо использования синтетических упражнений. Задачи включают проверку сотен неструктурированных электронных писем, выявление мошенничества с платежами, расчёт себестоимости и бронирование маршрутов многотранспортных перевозок.
Репозиторий, разработанный и поддерживаемый командой Accio в Alibaba International, делит 107 задач на 53 командные, 28 браузерные, 16 файловые и 10 задач API/MCP, при этом покрывая 65 задач только с текстом, 20 задач, требующих взаимодействия с браузером, и 22 задачи, требующие зрительного восприятия. Проект ранее назывался RealReplicaBench. Каждая задача запускается в отдельном контейнере и оценивается собственным детерминированным или LLM‑поддерживаемым проверяющим. Инструментарий, пакет Python, код имитационных сервисов, скрипты и конфигурации распространяются под лицензией Apache‑2.0, а набор задач — под CC‑BY‑4.0; текущий релиз зафиксирован как v1.3.1.
Alibaba.com заявила, что ни одна модель не возглавила оценку во всех категориях, что, по её мнению, подкрепляет необходимость маршрутизации на уровне задач, при которой разные задачи обрабатываются разными AI‑моделями, а не одной универсальной моделью для всего.
Эталонные оценки и правила проверки
Эталонные результаты в репозитории охватывают тринадцать семейств моделей в рамках трёх наборов (Pi, OpenClaw и Accio) и показывают, что Claude Opus 5 от Anthropic лидирует в каждой таблице, проходя 65 из 107 задач в Pi, 60 из 107 в OpenClaw и 66 из 107 в Accio, согласно репозиторию. Публикация оценок была выполнена через управляемые Accio конечные точки оценки с моделью‑судьёй gemini‑3.1‑pro‑preview, а репозиторий указывает живой лидерборд как официальный источник.
Согласно документированным правилам проверки бенчмарка, задача считается пройденной только в случае успешного выполнения всех обязательных проверок верификатором. Верификатор запускается на хосте после завершения работы агента, считывая конечное состояние изолированных имитационных сервисов и артефакты, требуемые задачей; каждый запуск происходит в отдельном контейнере, который уничтожается после подсчёта баллов.
Сайт лидерборда также фиксирует ограничения на сопоставимость. Его аудит согласования указывает, что наборы OpenClaw и Accio взаимодействуют с поставщиками моделей через разные конечные точки, поэтому различия в оценках между наборами учитывают как различия в маршрутах поставщиков, так и различия в наборах. Набор Accio является только эталонным и не включён в репозиторий, что означает, что только путь OpenClaw можно полностью повторно запустить из публичного репозитория.
Accio расширился до единого рабочего пространства
Вместе с результатами бенчмарка Alibaba.com объявила, что Accio превратился в единое рабочее пространство для глобальных операций электронной коммерции. Компания заявила, что малый бизнес может использовать Accio для исследования рынков, выявления товарных возможностей, разработки продуктов, оценки поставщиков и управления ежедневными операциями, а интеграция с Amazon, Shopify, eBay, TikTok Shop и Walmart позволяет продавцам получать доступ к поддерживаемым рабочим процессам витрин из единого места.
По данным сайта мероприятия, европейская флагманская версия CoCreate запланирована на 19–20 ноября 2026 года в Лондоне.












