AI 모델 및 플랫폼

Alibaba.com, Accio가 전자상거래 작업을 50% 이상 낮은 비용으로 수행했다고 발표

mm
Unite.AI를 Google의 선호 소스에 추가

Alibaba.com은 2026년 9월 9일, 107개의 작업 벤치마크 평가 결과를 발표했습니다. 이 평가에서 상거래용 AI 에이전트 플랫폼인 Accio가 OpenAI의 Codex와 Anthropic의 Claude Code보다 50% 이상 낮은 추정 비용으로 다양한 전자상거래 작업을 수행했으며, 완성 품질은 비교 가능하다고 회사는 설명했습니다.

전체 작업 세트를 완료하는 데 Accio는 약 $3.69가 소요된 반면, Codex는 $9.27, Claude Code는 $9.51이 필요했으며, Alibaba.com은 이 수치가 두 경우 모두 50% 이상 낮다고 설명했습니다. 회사는 이 결과가 Accio를 중소기업이 사용할 수 있는 가장 비용 경쟁력 있는 전자상거래 AI 도구로 만든다고 밝혔습니다. 이 발표는 CoCreate에서 이루어졌으며, CoCreate는 기업가와 소규모 사업자를 위한 Alibaba.com의 연례 행사로 2026년 로스앤젤레스 판은 9월 9일~10일에 진행됩니다.

Alibaba.com이 비용 격차를 설명하는 방식

회사에 따르면 Accio의 효율성은 실제 상거래 작업을 중심으로 전체 시스템을 최적화한 데서 비롯됩니다. Accio는 상거래 전용 데이터와 워크플로우를 활용해 사후 학습된 경량 모델을 명확히 정의된 작업에 적용하는데, 이를 통해 작은 모델이 일상적인 작업을 효율적으로 처리하고, 보다 복잡한 추론이 필요할 때는 더 강력한 모델을 사용할 수 있다고 설명했습니다.

Alibaba.com은 시스템이 가장 저렴한 모델이나 가장 강력한 모델에 일괄적으로 의존하지 않고, 복잡한 요청을 관리 가능한 단계로 나누어 각 단계마다 품질, 속도, 비용 및 데이터 요구사항을 평가한다고 밝혔습니다. 경제적 관점에서 이 접근법을 파레토 경계에 각 워크플로우를 더 가깝게 이동시키는 것으로 설명했으며, 이는 한 차원을 개선하려면 다른 차원에서의 트레이드오프가 필요함을 의미합니다. 또한 캐시 재사용, 컨텍스트 압축 및 에이전트 협조 실행이 반복 처리, 불필요한 도구 호출 및 중복 토큰 사용을 감소시키는 데 기여했다고 덧붙였습니다.

“소규모 기업에게 감당할 수 없는 AI는 쓸모가 없습니다,” 라고 Alibaba.com 사장인 Kuo Zhang가 회사 발표에서 말했습니다. Zhang는 목표가 AI를 단순히 더 강력하게 만드는 것이 아니라, 1인 기업이라도 실용적이고 저렴하게 사용할 수 있도록 상거래 AI를 구현하는 것이라고 강조했습니다.

Commerce Agent Bench, 오픈소스화

Alibaba.com은 GitHub에 Commerce Agent Bench를 오픈소스화했다고 발표했습니다. 회사에 따르면 이 벤치마크는 실제 상인 활동(활성 중소기업 사용자 1천만 명, 160만 건 대화, 20만 건 실행 추적)을 기반으로 7개 카테고리와 4단계 자율성을 아우르는 107개의 종단 간 상거래 작업으로 정제했으며, 인공적인 연습에 의존하지 않습니다. 작업에는 수백 개의 비정형 이메일 검토, 결제 사기 탐지, 착송 비용 계산, 다중 운송업체 배송 경로 예약 등이 포함됩니다.

Alibaba International의 Accio 팀이 개발·유지 관리하는 이 저장소는 107개의 작업을 53개의 명령줄, 28개의 브라우저, 16개의 파일, 10개의 API/MCP 작업으로 나누며, 기능 구분은 텍스트 전용 65개, 브라우저 텍스트 가능 20개, 비전 필요 22개 작업을 포함합니다. 이 프로젝트는 이전에 RealReplicaBench라는 이름으로 알려졌습니다. 각 작업은 새로운 컨테이너에서 실행되며 자체 결정론적 혹은 LLM 지원 검증기에 의해 평가됩니다. 하네스, Python 패키지, 모의 서비스 코드, 스크립트 및 설정 파일은 Apache-2.0 라이선스로 제공되고, 작업 스위트는 CC-BY-4.0 라이선스로 제공됩니다; 현재 릴리스는 v1.3.1로 고정되어 있습니다.

Alibaba.com은 평가에서 전체를 주도한 단일 모델이 없었다고 밝혔으며, 이는 모든 작업을 하나의 범용 모델이 처리하기보다 작업별 라우팅을 통해 서로 다른 AI 모델이 각각의 작업을 담당하도록 하는 사례를 강화하는 결과라고 제시했습니다.

참조 점수 및 검증 규칙

저장소의 참조 결과는 세 가지 하네스(Pi, OpenClaw, Accio)에서 13개의 모델 패밀리를 포괄하며, Anthropic의 Claude Opus 5가 각 표에서 선두를 차지하고 Pi에서는 107개 중 65개, OpenClaw에서는 107개 중 60개, Accio에서는 107개 중 66개 작업을 통과했다고 저장소에 기록되어 있습니다. 공개된 점수는 gemini-3.1-pro-preview를 평가 모델로 사용한 Accio 관리 평가 엔드포인트를 통해 산출되었으며, 저장소는 실시간 순위표를 공식 기록원으로 지정하고 있습니다.

벤치마크에 명시된 검증 규칙에 따르면, 모든 필수 검증 체크가 성공해야 작업이 통과된 것으로 간주됩니다. 검증기는 에이전트가 종료된 후 호스트 측에서 실행되며, 격리된 모의 서비스의 최종 상태와 작업이 요구하는 아티팩트를 읽습니다. 각 시도는 점수 산출 후 파기되는 새로운 컨테이너에서 수행됩니다.

순위표 사이트는 비교 가능성에 대한 제한도 문서화하고 있습니다. 정렬 감사 보고서에 따르면 OpenClaw와 Accio 하네스가 서로 다른 엔드포인트를 통해 모델 제공자에 도달했으므로, 하네스 간 점수 차이는 제공자 경로 차이와 하네스 차이를 모두 포함합니다. Accio 하네스는 참조 전용이며 저장소에 포함되지 않아, 공개 체크아웃에서 전체 과정을 다시 실행할 수 있는 것은 OpenClaw 경로뿐입니다.

Accio, 통합 워크스페이스로 확장

벤치마크 결과와 함께 Alibaba.com은 Accio가 글로벌 전자상거래 운영을 위한 통합 워크스페이스로 진화했다고 발표했습니다. 회사는 소규모 기업이 Accio를 활용해 시장 조사, 제품 기회 발굴, 제품 개발, 공급업체 평가 및 일상 운영 관리가 가능하며, Amazon, Shopify, eBay, TikTok Shop, Walmart와의 연동을 통해 판매자가 하나의 플랫폼에서 지원되는 스토어프론트 워크플로우에 접근할 수 있다고 설명했습니다.

행사 사이트에 따르면 CoCreate의 유럽 플래그십 에디션은 2026년 11월 19일~20일에 런던에서 개최될 예정입니다.

에이든 크로스유나이트.AI의 AI 생성 전략가로서 AI 제품 전략, 실행, 그리고 실험 모델을 확장 가능하고 시장에 적합한 제품으로 전환하는 실제적인 도전 과제에 대해 다룹니다. 그의 작업은 스타트업과 기업 팀이 프로토タイプ과 데모에서 실제 고객이 사용하는 신뢰할 수 있는 시스템으로 이동하는 방식에 중점을 둡니다.
실용적이고 세부적으로 집중하는 관점에서 에이든은 제품 로드맵, 시장 진출 전략, 플랫폼 결정, 그리고 기술 능력과 비즈니스 가치의 일치가 결정하는 조직적 트레이드 오프를 분석합니다. 그는 특히 배포 현실, 사용자 채택, 인프라 제약, 그리고 기술 능력과 비즈니스 가치의 일치에 주의를 기울입니다.
에이든 크로스에 의해 작성된 기사들은 유나이트.AI의 편집 팀에 의해 검토되어 실제 세계에서 AI 제품이 구축되고, 출하되고, 확장되는 방식에 대한 명확성, 정확성, 그리고 책임 있는 보도를 보장하기 위해 AI로 생성됩니다.