Mô hình và nền tảng AI

Alibaba.com cho biết Accio thực hiện các nhiệm vụ thương mại điện tử với chi phí giảm hơn 50%

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Alibaba.com vào ngày 9 tháng 9 năm 2026 đã công bố kết quả từ một đánh giá chuẩn benchmark gồm 107 nhiệm vụ, cho thấy Accio, nền tảng AI agent cho thương mại của họ, đã hoàn thành một loạt các nhiệm vụ thương mại điện tử với chi phí ước tính giảm hơn 50% so với Codex của OpenAI và Claude Code của Anthropic, với chất lượng hoàn thành mà công ty mô tả là tương đương.

Việc hoàn thành toàn bộ bộ nhiệm vụ tiêu tốn ước tính 3,69 USD với Accio, so với 9,27 USD cho Codex và 9,51 USD cho Claude Code, các con số mà Alibaba.com mô tả là giảm hơn 50% trong cả hai trường hợp. Công ty cho biết kết quả này khiến Accio trở thành công cụ AI thương mại điện tử có chi phí cạnh tranh nhất hiện có cho các doanh nghiệp nhỏ và vừa. Các thông báo được đưa ra tại CoCreate, sự kiện thường niên của Alibaba.com dành cho các doanh nhân và doanh nghiệp nhỏ, phiên bản Los Angeles năm 2026 diễn ra từ ngày 9‑10 tháng 9 năm 2026.

Cách Alibaba.com Giải Thích Khoảng Cách Chi Phí

Theo công ty, hiệu suất của Accio đến từ việc tối ưu hoá toàn bộ hệ thống dựa trên công việc thương mại thực tế. Accio sử dụng dữ liệu và quy trình làm việc đặc thù cho thương mại để huấn luyện sau (post‑train) các mô hình nhẹ cho các nhiệm vụ được xác định rõ, điều mà công ty cho rằng cho phép các mô hình nhỏ hơn xử lý công việc thường ngày một cách hiệu quả, trong khi các mô hình mạnh hơn vẫn sẵn sàng khi cần suy luận sâu hơn.

Thay vì mặc định sử dụng mô hình rẻ nhất hoặc mạnh nhất, hệ thống chia các yêu cầu phức tạp thành các bước có thể quản lý được và cân nhắc chất lượng, tốc độ, chi phí và yêu cầu dữ liệu cho mỗi bước, công ty cho biết. Alibaba.com mô tả cách tiếp cận này, theo thuật ngữ kinh tế, là đưa mỗi quy trình làm việc gần hơn tới ranh giới Pareto, điểm mà việc cải thiện một khía cạnh sẽ đòi hỏi phải nhượng bộ một khía cạnh khác. Công ty cũng ghi nhận việc tái sử dụng bộ nhớ đệm, nén ngữ cảnh và thực thi đồng bộ các agent đã giúp giảm xử lý lặp lại, các lời gọi công cụ không cần thiết và tiêu thụ token dư thừa.

“Đối với các doanh nghiệp nhỏ, AI không thể chi trả là vô dụng,” Kuo Zhang, Chủ tịch Alibaba.com, nói trong thông báo của công ty. Zhang cho biết mục tiêu là làm cho AI thương mại trở nên thực tiễn và có giá cả phải chăng ngay cả đối với một công ty chỉ có một người, chứ không chỉ đơn thuần làm AI mạnh hơn.

Commerce Agent Bench, Mã Nguồn Mở

Alibaba.com cho biết đã mở mã nguồn Commerce Agent Bench trên GitHub. Theo công ty, benchmark này dựa trên hoạt động thực tế của các thương gia (10 triệu người dùng SMB hoạt động, 1,6 triệu cuộc trò chuyện và 200.000 dấu vết thực thi) được tinh luyện thành 107 nhiệm vụ thương mại đầu‑cuối thuộc bảy danh mục và bốn mức độ tự chủ, thay vì dựa vào các bài tập tổng hợp. Các nhiệm vụ bao gồm việc rà soát hàng trăm email không có cấu trúc, phát hiện gian lận thanh toán, tính toán chi phí nhập khẩu và đặt lịch các tuyến vận chuyển đa nhà cung cấp.

Kho lưu trữ, do đội ngũ Accio tại Alibaba International phát triển và duy trì, chia 107 nhiệm vụ thành 53 nhiệm vụ dòng lệnh, 28 nhiệm vụ trình duyệt, 16 nhiệm vụ tệp và 10 nhiệm vụ API/MCP, với các phần khả năng bao gồm 65 nhiệm vụ chỉ văn bản, 20 nhiệm vụ hỗ trợ văn bản trong trình duyệt và 22 nhiệm vụ yêu cầu thị giác. Dự án trước đây được gọi là RealReplicaBench. Mỗi nhiệm vụ chạy trong một container mới và được chấm điểm bởi bộ xác minh riêng, có thể là xác minh quyết định hoặc hỗ trợ bởi LLM. Bộ khung, gói Python, mã dịch vụ mô phỏng, các script và cấu hình được phát hành dưới giấy phép Apache-2.0, trong khi bộ nhiệm vụ được phát hành dưới CC-BY-4.0; phiên bản hiện tại được gắn nhãn là v1.3.1.

Alibaba.com cho biết không có mô hình nào duy nhất dẫn đầu trong toàn bộ đánh giá, kết quả này được công ty trình bày như một bằng chứng củng cố cho việc định tuyến theo mức độ nhiệm vụ, trong đó các nhiệm vụ khác nhau được xử lý bởi các mô hình AI khác nhau thay vì một mô hình đa năng cho mọi thứ.

Điểm Tham Khảo và Quy Tắc Xác Minh

Kết quả tham khảo trong kho lưu trữ bao gồm mười ba họ mô hình trên ba bộ khung (Pi, OpenClaw và Accio), và cho thấy Claude Opus 5 của Anthropic dẫn đầu mỗi bảng, vượt qua 65 trong 107 nhiệm vụ trên Pi, 60 trong 107 trên OpenClaw và 66 trong 107 trên Accio, theo kho lưu trữ. Các điểm số đã công bố được tạo ra thông qua các điểm cuối đánh giá do Accio quản lý với gemini-3.1-pro-preview làm mô hình giám khảo, và kho lưu trữ xác định bảng xếp hạng trực tiếp là nguồn ghi chép.

Theo các quy tắc xác minh được ghi chép trong benchmark, một nhiệm vụ chỉ được tính là đã vượt qua khi mọi kiểm tra xác minh bắt buộc đều thành công. Bộ xác minh chạy phía máy chủ sau khi agent kết thúc, đọc trạng thái cuối cùng của các dịch vụ mô phỏng cô lập và các tài liệu mà nhiệm vụ yêu cầu, và mỗi lần thử chạy trong một container mới được phá hủy sau khi chấm điểm.

Trang bảng xếp hạng cũng ghi lại các giới hạn về khả năng so sánh. Báo cáo kiểm tra đồng bộ của nó cho biết các bộ khung OpenClaw và Accio tiếp cận các nhà cung cấp mô hình qua các điểm cuối khác nhau, do đó sự khác biệt điểm số giữa các bộ khung bao gồm cả sự khác biệt về lộ trình nhà cung cấp cũng như sự khác biệt về bộ khung. Bộ khung Accio chỉ dùng làm tham chiếu và không được phát hành trong kho lưu trữ, có nghĩa là chỉ có đường dẫn OpenClaw có thể được chạy lại toàn bộ từ checkout công cộng.

Accio Mở Rộng Thành Không Gian Làm Việc Thống Nhất

Cùng với kết quả benchmark, Alibaba.com công bố rằng Accio đã phát triển thành một không gian làm việc thống nhất cho các hoạt động thương mại điện tử toàn cầu. Công ty cho biết các doanh nghiệp nhỏ có thể sử dụng Accio để nghiên cứu thị trường, xác định cơ hội sản phẩm, phát triển sản phẩm, đánh giá nhà cung cấp và quản lý hoạt động hàng ngày, và việc kết nối với Amazon, Shopify, eBay, TikTok Shop và Walmart cho phép người bán tiếp cận các quy trình cửa hàng được hỗ trợ từ một nơi duy nhất.

Theo trang sự kiện, phiên bản chủ lực châu Âu của CoCreate dự kiến diễn ra vào ngày 19‑20 tháng 11 năm 2026 tại London.

Aiden Cross là một chiến lược gia được tạo bởi AI tại Unite.AI, chuyên về chiến lược sản phẩm AI, thực hiện và các thách thức thực tế khi chuyển đổi các mô hình thử nghiệm thành các sản phẩm sẵn sàng cho thị trường. Công việc của ông tập trung vào cách các công ty khởi nghiệp và các đội doanh nghiệp chuyển từ các nguyên mẫu và demo sang các hệ thống đáng tin cậy được sử dụng bởi khách hàng thực sự.
Với quan điểm thực tế và chi tiết, Aiden phân tích các bản đồ sản phẩm, chiến lược tiếp thị, quyết định nền tảng và các lựa chọn tổ chức mà quyết định liệu các sáng kiến AI có thành công hay không. Ông đặc biệt chú ý đến các thực tế triển khai, việc áp dụng của người dùng, các hạn chế về cơ sở hạ tầng và sự phù hợp giữa khả năng kỹ thuật và giá trị kinh doanh.
Các bài viết được viết bởi Aiden Cross được tạo bởi AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo sự rõ ràng, chính xác và phạm vi bao quát có trách nhiệm về cách các sản phẩm AI được xây dựng, vận chuyển và mở rộng trong thế giới thực.