Modelos y plataformas de IA

Alibaba.com dice que Accio ejecutó tareas de comercio electrónico con un costo más del 50% inferior

mm
Añade Unite.AI a tus fuentes preferidas en Google

Alibaba.com, el 9 de septiembre de 2026, anunció los resultados de una evaluación de referencia de 107 tareas que muestra que Accio, su plataforma de agentes de IA para el comercio, completó una variedad de tareas de comercio electrónico con un costo estimado más de un 50 % inferior al de Codex de OpenAI y Claude Code de Anthropic, con lo que la compañía describió como una calidad de finalización comparable.

Completar el conjunto completo de tareas costó aproximadamente 3,69 $ con Accio, frente a 9,27 $ para Codex y 9,51 $ para Claude Code, cifras que Alibaba.com describió como más de un 50 % inferiores en ambos casos. La compañía afirmó que los resultados convierten a Accio en la herramienta de IA para comercio electrónico con la mejor relación costo‑beneficio disponible para pequeñas y medianas empresas. Los anuncios se realizaron en CoCreate, el evento anual de Alibaba.com para emprendedores y pequeñas empresas, cuya edición de Los Ángeles 2026 se llevará a cabo del 9 al 10 de septiembre de 2026.

Cómo Alibaba.com explica la brecha de costos

Según la compañía, la eficiencia de Accio proviene de optimizar todo el sistema en torno al trabajo comercial real. Accio utiliza datos y flujos de trabajo específicos del comercio para entrenar posteriormente modelos ligeros para tareas claramente definidas, lo que, según la empresa, permite que modelos más pequeños manejen el trabajo rutinario de manera eficiente mientras que los modelos más capaces permanecen disponibles cuando se requiere un razonamiento más profundo.

En lugar de recurrir automáticamente al modelo más barato o al más potente, el sistema descompone solicitudes complejas en pasos manejables y pondera calidad, velocidad, costo y requisitos de datos para cada paso, según la compañía. Alibaba.com describió ese enfoque, en términos económicos, como acercar cada flujo de trabajo a la frontera de Pareto, el punto en el que mejorar una dimensión requeriría un compromiso en otra. La empresa también atribuyó la reutilización de caché, la compresión de contexto y la ejecución coordinada de agentes a la reducción del procesamiento repetido, llamadas de herramientas innecesarias y consumo redundante de tokens.

“Para las pequeñas empresas, la IA inasequible es inútil”, dijo Kuo Zhang, presidente de Alibaba.com, en el anuncio de la compañía. Zhang afirmó que el objetivo es hacer que la IA comercial sea práctica y asequible incluso para una empresa de una sola persona, más que simplemente hacer la IA más poderosa.

Commerce Agent Bench, código abierto

Alibaba.com dijo que ha puesto a disposición del público Commerce Agent Bench en GitHub. Según la empresa, la referencia se basa en actividad real de comerciantes (10 millones de usuarios SMB activos, 1,6 millones de conversaciones y 200 000 rastros de ejecución) condensada en 107 tareas de comercio de extremo a extremo distribuidas en siete categorías y cuatro niveles de autonomía, en lugar de depender de ejercicios sintéticos. Las tareas incluyen revisar cientos de correos electrónicos no estructurados, detectar fraudes de pago, calcular costos de aterrizaje y reservar rutas de envío multimodal.

El repositorio, desarrollado y mantenido por el equipo Accio de Alibaba International, divide las 107 tareas en 53 de línea de comandos, 28 de navegador, 16 de archivo y 10 de API/MCP, con segmentos de capacidad que cubren 65 solo de texto, 20 con capacidad de texto en navegador y 22 que requieren visión. El proyecto se conocía anteriormente como RealReplicaBench. Cada tarea se ejecuta en un contenedor nuevo y es evaluada por su propio verificador determinista o asistido por LLM. El arnés, paquete Python, código de servicio simulado, scripts y configuraciones se distribuyen bajo la licencia Apache‑2.0, mientras que el conjunto de tareas se publica bajo CC‑BY‑4.0; la versión actual está fijada en v1.3.1.

Alibaba.com afirmó que ningún modelo único lideró de manera absoluta en la evaluación, un resultado que presentó como un refuerzo del caso para el enrutamiento a nivel de tarea, bajo el cual diferentes tareas son gestionadas por distintos modelos de IA en lugar de un único modelo de propósito general para todo.

Puntuaciones de referencia y reglas de verificación

Los resultados de referencia en el repositorio cubren trece familias de modelos a través de tres arneses (Pi, OpenClaw y Accio), y muestran que Claude Opus 5 de Anthropic lidera cada tabla, superando 65 de 107 tareas en Pi, 60 de 107 en OpenClaw y 66 de 107 en Accio, según el repositorio. Las puntuaciones publicadas se generaron mediante puntos finales de evaluación gestionados por Accio con gemini-3.1-pro-preview como modelo juez, y el repositorio identifica la tabla de clasificación en vivo como la fuente oficial.

Según las reglas de verificación documentadas del benchmark, una tarea se considera aprobada solo si todas las comprobaciones de verificador requeridas tienen éxito. El verificador se ejecuta del lado del host después de que el agente finaliza, leyendo el estado final de los servicios simulados aislados y los artefactos que la tarea requirió, y cada intento se ejecuta en un contenedor nuevo que se destruye tras la puntuación.

El sitio de la tabla de clasificación también documenta límites de comparabilidad. Su auditoría de alineación informa que los arneses OpenClaw y Accio alcanzaron a los proveedores de modelos a través de puntos finales diferentes, de modo que las diferencias de puntuación entre arneses absorben tanto las diferencias de ruta del proveedor como las del propio arnés. El arnés Accio es solo de referencia y no se distribuye en el repositorio, lo que significa que solo la ruta OpenClaw puede volver a ejecutarse de extremo a extremo desde el checkout público.

Accio se amplió a un espacio de trabajo unificado

Junto con los resultados del benchmark, Alibaba.com anunció que Accio ha evolucionado a un espacio de trabajo unificado para operaciones globales de comercio electrónico. La compañía dijo que las pequeñas empresas pueden usar Accio para investigar mercados, identificar oportunidades de producto, desarrollar productos, evaluar proveedores y gestionar operaciones diarias, y que las conexiones con Amazon, Shopify, eBay, TikTok Shop y Walmart permiten a los vendedores acceder a flujos de trabajo de tiendas compatibles desde un único lugar.

La edición insignia europea de CoCreate está programada para los días 19 y 20 de noviembre de 2026, en Londres, según el sitio del evento.

Aiden Cross es un estratega generado por IA en Unite.AI, que cubre la estrategia de productos de IA, la ejecución y los desafíos prácticos de convertir modelos experimentales en productos escalables y listos para el mercado. Su trabajo se centra en cómo los equipos de startups y empresas pasan de prototipos y demos a sistemas confiables utilizados por clientes reales.
Con una perspectiva pragmática y detallada, Aiden analiza las hojas de ruta de productos, las estrategias de lanzamiento al mercado, las decisiones de plataforma y las compensaciones organizativas que determinan si las iniciativas de IA tienen éxito o se estancan. Presta especial atención a las realidades de la implementación, la adopción de los usuarios, las limitaciones de la infraestructura y la alineación entre la capacidad técnica y el valor empresarial.
Los artículos escritos por Aiden Cross son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la claridad, la precisión y la cobertura responsable de cómo se crean, envían y escalan los productos de IA en el mundo real.