Modely a platformy AI

Alibaba.com uvádí, že Accio provádí úkoly e‑commerce za více než 50% nižší náklady

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Alibaba.com dne 9. září 2026 oznámila výsledky z benchmarkového hodnocení zahrnujícího 107 úkolů, které ukazují, že Accio, její platforma AI agentů pro obchod, dokončila řadu úkolů e‑commerce s více než 50 % nižší odhadovanou cenou než Codex od OpenAI a Claude Code od Anthropic, přičemž společnost popisuje kvalitu dokončení jako srovnatelnou.

Dokončení celého souboru úkolů stálo odhadovaných 3,69 $, u Accio, oproti 9,27 $ u Codexu a 9,51 $ u Claude Code, údaje, které Alibaba.com popisuje jako více než 50 % nižší v obou případech. Společnost uvedla, že výsledky činí z Accio nejkonkurenceschopnější AI nástroj pro e‑commerce dostupný malým a středním podnikům. Oznámení byla učiněna na CoCreate, roční akci Alibaba.com pro podnikatele a malé firmy, jejíž edice v Los Angeles v roce 2026 probíhá 9.–10. září 2026.

Jak Alibaba.com vysvětluje cenový rozdíl

Podle společnosti je efektivita Accio dosažena optimalizací celého systému kolem reálné obchodní činnosti. Accio využívá obchodně specifická data a pracovní postupy k následnému trénování lehkých modelů pro jasně definované úkoly, což podle společnosti umožňuje menším modelům efektivně zvládat rutinní práci, zatímco výkonnější modely zůstávají k dispozici, když je vyžadováno hlubší uvažování.

Místo toho, aby se systém automaticky řídil buď nejlevnějším, nebo nejvýkonnějším modelem, rozděluje složité požadavky na zvládnutelné kroky a pro každý krok váží kvalitu, rychlost, náklady a požadavky na data, uvedla společnost. Alibaba.com popsal tento přístup v ekonomických termínech jako posun každého pracovního postupu blíže k Pareto frontě, bodu, ve kterém zlepšení jedné dimenze vyžaduje kompromis v jiné. Společnost také přisuzuje snížení opakovaného zpracování, zbytečných volání nástrojů a nadbytečné spotřeby tokenů opětovnému využití mezipaměti, kompresi kontextu a koordinovanému provádění agentů.

„Pro malé firmy je nedostupná AI zbytečná,“ řekl Kuo Zhang, prezident Alibaba.com, ve oznámení společnosti. Zhang uvedl, že cílem je učinit obchodní AI praktickou a dostupnou i pro jednojmennou společnost, spíše než jen zvyšovat sílu AI.

Commerce Agent Bench, otevřený zdroj

Alibaba.com uvedla, že otevřela zdrojový kód Commerce Agent Bench on GitHub. Podle společnosti benchmark čerpá z reálné činnosti obchodníků (10 milionů aktivních uživatelů SMB, 1,6 milionu konverzací a 200 000 stop provádění) a zhušťuje je do 107 komplexních obchodních úkolů napříč sedmi kategoriemi a čtyřmi úrovněmi autonomie, namísto spoléhaní se na syntetické cvičení. Úkoly zahrnují kontrolu stovek nestrukturovaných e‑mailů, odhalování podvodů při platbách, výpočet přirážek a rezervaci přepravních tras s více dopravci.

Úložiště, vyvíjené a udržované týmem Accio v Alibaba International, rozděluje 107 úkolů na 53 úkoly příkazové řádky, 28 úkoly prohlížeče, 16 úkoly souborů a 10 úkoly API/MCP, přičemž schopnostní segmenty zahrnují 65 úkolů jen pro text, 20 úkolů schopných pracovat s textem v prohlížeči a 22 úkoly vyžadující vizuální vstup. Projekt byl dříve známý jako RealReplicaBench. Každý úkol běží v novém kontejneru a je hodnocen vlastním deterministickým nebo LLM‑asistovaným verifikátorem. Testovací rámec, balíček Python, kód mock‑služby, skripty a konfigurace jsou distribuovány pod licencí Apache‑2.0, zatímco sada úkolů pod licencí CC‑BY‑4.0; aktuální vydání je označeno jako v1.3.1.

Alibaba.com uvedla, že v hodnocení nevedl žádný jediný model napříč všemi úkoly, což podle ní posiluje argument pro směrování na úrovni úkolu, kde různé úkoly zpracovávají různé AI modely místo jednoho univerzálního modelu pro vše.

Referenční skóre a pravidla ověřování

Referenční výsledky v úložišti zahrnují třináct rodin modelů napříč třemi testovacími prostředími (Pi, OpenClaw a Accio) a ukazují, že Claude Opus 5 od Anthropic vede v každé tabulce, úspěšně absolvuje 65 ze 107 úkolů v Pi, 60 ze 107 v OpenClaw a 66 ze 107 v Accio, podle úložiště. Publikovaná skóre byla vytvořena prostřednictvím hodnotících koncových bodů spravovaných Accio s modelem gemini‑3.1‑pro‑preview jako soudcem a úložiště uvádí live leaderboard jako oficiální zdroj.

Podle dokumentovaných pravidel ověřování benchmarku se úkol považuje za splněný jen tehdy, pokud všechny požadované kontroly verifikátoru uspějí. Verifikátor běží na hostiteli po ukončení agenta, čte konečný stav izolovaných mock služeb a artefakty požadované úkolem, a každý pokus běží v novém kontejneru, který je po ohodnocení zničen.

Stránka s žebříčkem také uvádí omezení srovnatelnosti. Její audit souladu uvádí, že testovací prostředí OpenClaw a Accio dosáhla poskytovatelů modelů přes různé koncové body, takže rozdíly ve skórech napříč prostředími zahrnují rozdíly v trasách poskytovatelů i rozdíly v prostředích. Accio prostředí je pouze referenční a není součástí úložiště, což znamená, že pouze cesta OpenClaw může být z veřejného checkoutu znovu spuštěna od začátku do konce.

Accio rozšířeno do jednotného pracovního prostoru

Vedle výsledků benchmarku Alibaba.com oznámila, že Accio se vyvinulo do jednotného pracovního prostoru pro globální operace e‑commerce. Společnost uvedla, že malé firmy mohou Accio využívat k výzkumu trhů, identifikaci produktových příležitostí, vývoji produktů, hodnocení dodavatelů a řízení každodenních operací, a že propojení s Amazon, Shopify, eBay, TikTok Shop a Walmart umožňuje prodejcům přistupovat k podporovaným pracovním postupům obchodních rozhraní z jednoho místa.

Evropská vlajková edice CoCreate je podle stránky akce naplánována na 19.–20. listopadu 2026 v Londýně.

Aiden Cross je AI-generovaný stratég v Unite.AI, který se zabývá strategií AI produktů, jejich prováděním a praktickými výzvami spojenými s transformací experimentálních modelů na škálovatelné a tržně připravené produkty. Jeho práce se zaměřuje na to, jak startupy a podnikové týmy přecházejí od prototypů a demonstrací k spolehlivým systémům používaným skutečnými zákazníky.
S pragmatickým a detailním pohledem analyzuje Aiden produktové mapy, strategie vstupu na trh, rozhodnutí o platformách a organizační kompromisy, které určují, zda iniciativy AI uspějí nebo uváznou. Zvláštní pozornost věnuje realitám nasazení, přijetí uživatelů, omezením infrastruktury a souladu mezi technickými schopnostmi a obchodními hodnotami.
Články napsané Aidenem Crossem jsou AI-generované a recenzované redakčním týmem Unite.AI, aby zajistily jasnost, přesnost a odpovědné pokrytí toho, jak jsou AI produkty vyvíjeny, expedovány a škálovány v reálném světě.