โมเดลและแพลตฟอร์ม AI

Alibaba.com บอกว่า Accio ทำงานอีคอมเมิร์ซด้วยต้นทุนต่ำกว่า 50%

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Alibaba.com เมื่อวันที่ 9 กันยายน 2026 ประกาศผลการประเมินจากการทดสอบมาตรฐาน 107 งาน ซึ่งแสดงให้เห็นว่า Accio แพลตฟอร์มเอเย่นต์ AI สำหรับการค้า ของบริษัท สามารถทำงานอีคอมเมิร์ซหลากหลายงานได้โดยมีต้นทุนโดยประมาณต่ำกว่ามากกว่า 50% เมื่อเทียบกับ Codex ของ OpenAI และ Claude Code ของ Anthropic โดยบริษัทอธิบายว่าคุณภาพการทำงานเทียบเท่า

การทำงานชุดเต็มทั้งหมดด้วย Accio มีต้นทุนโดยประมาณ 3.69 ดอลลาร์ เทียบกับ 9.27 ดอลลาร์สำหรับ Codex และ 9.51 ดอลลาร์สำหรับ Claude Code ซึ่ง Alibaba.com ระบุว่าตัวเลขเหล่านี้ต่ำกว่าอย่างน้อย 50% ในทั้งสองกรณี บริษัทกล่าวว่าผลลัพธ์นี้ทำให้ Accio เป็นเครื่องมือ AI ด้านอีคอมเมิร์ซที่มีต้นทุนแข่งขันที่สุดที่มีให้แก่ธุรกิจขนาดเล็กและขนาดกลาง การประกาศนี้ทำขึ้นใน CoCreate งานประจำปีของ Alibaba.com สำหรับผู้ประกอบการและธุรกิจขนาดเล็ก ซึ่งเวอร์ชันปี 2026 ที่จัดในลอสแอนเจลิสจะจัดตั้งแต่วันที่ 9–10 กันยายน 2026

วิธีที่ Alibaba.com อธิบายช่องว่างต้นทุน

ตามที่บริษัทอธิบาย ประสิทธิภาพของ Accio มาจากการปรับระบบทั้งหมดให้สอดคล้องกับงานการค้าจริง Accio ใช้ข้อมูลและกระบวนการทำงานเฉพาะการค้าเพื่อฝึกโมเดลแบบเบาให้กับงานที่กำหนดไว้อย่างชัดเจน ซึ่งบริษัทกล่าวว่า ทำให้โมเดลขนาดเล็กสามารถจัดการงานประจำได้อย่างมีประสิทธิภาพ ในขณะที่โมเดลที่มีความสามารถสูงกว่าจะพร้อมใช้งานเมื่อต้องการการให้เหตุผลเชิงลึก

บริษัทกล่าวว่า ระบบไม่ได้เลือกใช้โมเดลที่ถูกที่สุดหรือที่ทรงพลังที่สุดโดยอัตโนมัติ แต่จะแบ่งคำขอที่ซับซ้อนออกเป็นขั้นตอนที่จัดการได้และประเมินคุณภาพ ความเร็ว ต้นทุน และความต้องการข้อมูลสำหรับแต่ละขั้นตอน Alibaba.com อธิบายวิธีการนี้ในเชิงเศรษฐศาสตร์ว่าเป็นการนำแต่ละกระบวนการทำงานเข้าใกล้แนวขอบพาเรโต้ (Pareto frontier) ซึ่งเป็นจุดที่การปรับปรุงมิติหนึ่งจะต้องแลกกับการสูญเสียในมิติอื่น บริษัทยังให้เครดิตกับการใช้แคชซ้ำ การบีบอัดบริบท และการดำเนินงานเอเย่นต์แบบประสานกันในการลดการประมวลผลซ้ำ การเรียกใช้เครื่องมือที่ไม่จำเป็น และการใช้โทเคนที่ซ้ำซ้อน

“สำหรับธุรกิจขนาดเล็ก AI ที่ไม่สามารถจ่ายได้ไม่มีประโยชน์” Kuo Zhang ประธานของ Alibaba.com กล่าวในประกาศของบริษัท Zhang กล่าวว่าจุดมุ่งหมายคือทำให้ AI ด้านการค้าจำเป็นและเข้าถึงได้แม้สำหรับบริษัทที่มีเพียงคนเดียว ไม่ใช่เพียงเพื่อทำให้ AI มีพลังมากขึ้น

Commerce Agent Bench, เปิดโค้ดสาธารณะ

Alibaba.com กล่าวว่ามันได้เปิดโค้ดแหล่งที่มาของ Commerce Agent Bench on GitHub ตามที่บริษัทระบุ การทดสอบนี้อ้างอิงจากกิจกรรมของผู้ขายจริง (ผู้ใช้ SMB ที่ใช้งานอยู่ 10 ล้านคน, การสนทนา 1.6 ล้านครั้ง และร่องรอยการดำเนินการ 200,000 ราย) ซึ่งสรุปเป็น 107 งานการค้าตั้งแต่ต้นจนจบ ครอบคลุมเจ็ดหมวดหมู่และสี่ระดับของความอิสระ มากกว่าการพึ่งพาการฝึกแบบสังเคราะห์ งานเหล่านี้รวมถึงการตรวจสอบอีเมลที่ไม่มีโครงสร้างหลายร้อยฉบับ การตรวจจับการฉ้อโกงการชำระเงิน การคำนวณต้นทุนถึงมือและการจองเส้นทางการจัดส่งหลายผู้ให้บริการ

คลังข้อมูลที่พัฒนาและดูแลโดยทีม Accio ของ Alibaba International แบ่ง 107 งานออกเป็น 53 งานบรรทัดคำสั่ง, 28 งานเบราว์เซอร์, 16 งานไฟล์ และ 10 งาน API/MCP โดยมีส่วนความสามารถครอบคลุม 65 งานที่เป็นข้อความเท่านั้น, 20 งานที่รองรับข้อความในเบราว์เซอร์และ 22 งานที่ต้องการการมองเห็น โครงการนี้เคยมีชื่อว่า RealReplicaBench ทุกงานจะทำงานในคอนเทนเนอร์ใหม่และได้รับการประเมินโดยตัวตรวจสอบที่เป็นแบบกำหนดล่วงหน้าหรือช่วยโดย LLM ระบบ harness, แพ็กเกจ Python, โค้ดบริการจำลอง, สคริปต์และการตั้งค่าถูกแจกภายใต้สัญญาอนุญาต Apache-2.0 ในขณะที่ชุดงานถูกแจกภายใต้ CC-BY-4.0; รุ่นปัจจุบันถูกตราเป็น v1.3.1

Alibaba.com กล่าวว่าไม่มีโมเดลใดโมเดลหนึ่งที่ครอบคลุมทั้งหมดในการประเมิน ผลลัพธ์นี้บริษัทนำเสนอว่าเป็นการยืนยันแนวคิดการกำหนดเส้นทางระดับงาน ซึ่งงานต่าง ๆ จะถูกจัดการโดยโมเดล AI ที่แตกต่างกันแทนการใช้โมเดลทั่วไปหนึ่งโมเดลสำหรับทุกอย่าง

คะแนนอ้างอิงและกฎการตรวจสอบ

ผลลัพธ์อ้างอิงในคลังข้อมูลครอบคลุมสิบสามตระกูลโมเดลในสาม harness (Pi, OpenClaw และ Accio) และแสดงให้เห็นว่า Claude Opus 5 ของ Anthropic นำหน้าทุกตาราง โดยผ่าน 65 จาก 107 งานบน Pi, 60 จาก 107 งานบน OpenClaw และ 66 จาก 107 งานบน Accio ตามข้อมูลในคลัง ผลคะแนนที่เผยแพร่นี้สร้างขึ้นผ่านจุดประเมินที่จัดการโดย Accio โดยใช้ gemini-3.1-pro-preview เป็นโมเดลผู้ตัดสิน และคลังข้อมูลระบุว่า live leaderboard เป็นแหล่งบันทึกข้อมูล

ตามกฎการตรวจสอบที่ระบุในมาตรฐานการทดสอบ งานจะถือว่าผ่านได้เฉพาะเมื่อการตรวจสอบของ verifier ทุกข้อที่จำเป็นสำเร็จ verifier จะทำงานบนโฮสต์หลังจากเอเย่นต์ออกจากระบบ โดยอ่านสถานะสุดท้ายของบริการจำลองที่แยกกันและผลลัพธ์ที่งานต้องการ และแต่ละความพยายามจะทำงานในคอนเทนเนอร์ใหม่หนึ่งครั้งที่ถูกทำลายหลังจากให้คะแนน

เว็บไซต์ leaderboard ยังบันทึกข้อจำกัดเรื่องความเปรียบเทียบ การตรวจสอบการปรับแนวของมันระบุว่า harness ของ OpenClaw และ Accio เข้าถึงผู้ให้บริการโมเดลผ่านจุดสิ้นสุดที่ต่างกัน ดังนั้นความแตกต่างของคะแนนระหว่าง harness จะรวมถึงความแตกต่างของเส้นทางผู้ให้บริการและความแตกต่างของ harness ด้วย harness ของ Accio เป็นแบบอ้างอิงเท่านั้นและไม่ได้รวมอยู่ในคลังข้อมูล หมายความว่าเพียงเส้นทาง OpenClaw เท่านั้นที่สามารถรันซ้ำจากต้นจนจบผ่านการเช็คเอาท์สาธารณะได้

Accio ขยายเป็นพื้นที่ทำงานแบบรวมศูนย์

พร้อมกับผลการทดสอบมาตรฐาน Alibaba.com ประกาศว่า Accio ได้พัฒนาเป็นพื้นที่ทำงานแบบรวมศูนย์สำหรับการดำเนินการอีคอมเมิร์ซระดับโลก บริษัทระบุว่าธุรกิจขนาดเล็กสามารถใช้ Accio เพื่อวิจัยตลาด, ระบุโอกาสผลิตภัณฑ์, พัฒนาผลิตภัณฑ์, ประเมินผู้จัดหาและจัดการการดำเนินงานประจำวัน และการเชื่อมต่อกับ Amazon, Shopify, eBay, TikTok Shop และ Walmart ทำให้ผู้ขายสามารถเข้าถึงกระบวนการทำงานของร้านค้าที่รองรับจากที่เดียว

ตามเว็บไซต์ของงาน เวอร์ชันยุโรปหลักของ CoCreate กำหนดจัดขึ้นในวันที่ 19–20 พฤศจิกายน 2026 ที่ลอนดอน

เอเดน ครอส เป็นนักยุทธศาสตร์ที่สร้างโดย AI ที่ Unite.AI โดยครอบคลุมยุทธศาสตร์ผลิตภัณฑ์ AI, การดำเนินการ และความท้าทายเชิงปฏิบัติในการเปลี่ยนโมเดลทดลองให้เป็นผลิตภัณฑ์ที่พร้อมสำหรับการตลาดและสามารถขยายขนาดได้ ผลงานของเขาเน้นไปที่วิธีการที่สตาร์ทอัพและทีมองค์กรย้ายจากต้นแบบและตัวอย่างไปยังระบบที่เชื่อถือได้และใช้โดยลูกค้าจริง