Yapay zeka modelleri ve platformları

Alibaba.com, Accio’nun E-Ticaret Görevlerini %50’den Fazla Daha Düşük Maliyetle Gerçekleştirdiğini Duyurdu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Alibaba.com, 9 Eylül 2026 tarihinde, 107 görevlik bir kıyaslama değerlendirmesinin sonuçlarını duyurdu; bu sonuçlar, ticaret için AI ajan platformu Accio’nun, OpenAI’ın Codex’i ve Anthropic’in Claude Code’undan %50’den fazla daha düşük tahmini maliyetle bir dizi e-ticaret görevini tamamladığını, şirketin tamamlanma kalitesinin benzer olduğunu belirtti.

Tam görev setini tamamlamanın tahmini maliyeti Accio ile 3,69 $, Codex için 9,27 $ ve Claude Code için 9,51 $ olarak belirlendi; Alibaba.com bu rakamların her iki durumda da %50’den fazla daha düşük olduğunu açıkladı. Şirket, bu sonuçların Accio’yu küçük ve orta ölçekli işletmeler için mevcut en maliyet rekabetçi e-ticaret AI aracı haline getirdiğini belirtti. Duyurular, CoCreate etkinliğinde yapıldı; CoCreate, girişimciler ve küçük işletmeler için Alibaba.com’un yıllık etkinliği ve 2026 Los Angeles versiyonu 9–10 Eylül 2026 tarihleri arasında gerçekleşecek.

Alibaba.com Maliyet Farkını Nasıl Açıklıyor

Şirkete göre, Accio’nun verimliliği gerçek ticaret işine yönelik tüm sistemin optimize edilmesinden kaynaklanıyor. Accio, ticarete özgü veri ve iş akışlarını kullanarak belirli görevler için hafif modelleri sonradan eğitiyor; bu, şirketin daha küçük modellerin rutin işleri verimli bir şekilde yürütmesine, daha yetkin modellerin ise derinlemesine akıl yürütme gerektiğinde kullanılabilir olmasına olanak tanıdığını belirtti.

Şirket, sistemin en ucuz ya da en güçlü modeli varsayılan olarak seçmek yerine, karmaşık istekleri yönetilebilir adımlara bölüp her adım için kalite, hız, maliyet ve veri gereksinimlerini değerlendirdiğini belirtti. Alibaba.com bu yaklaşımı ekonomik terimlerle, her iş akışını Pareto sınırına daha yakın bir konuma taşıyarak, bir boyutu iyileştirmenin diğerinde bir ödün gerektirdiği nokta olarak tanımladı. Şirket ayrıca önbellek yeniden kullanımı, bağlam sıkıştırması ve koordine ajan yürütmesinin tekrarlanan işlem, gereksiz araç çağrıları ve fazladan token tüketimini azalttığını vurguladı.

“Küçük işletmeler için karşılanamaz AI faydasızdır,” dedi Alibaba.com Başkanı Kuo Zhang, şirketin duyurusunda. Zhang, hedefin AI’yi sadece daha güçlü kılmak yerine, tek kişilik bir şirket için bile ticaret AI’sını pratik ve uygun maliyetli hâle getirmek olduğunu belirtti.

Commerce Agent Bench, Açık Kaynaklı

Alibaba.com, Commerce Agent Bench’i GitHub’da açık kaynak olarak sunduğunu açıkladı. Şirkete göre, kıyaslama gerçek satıcı etkinliğinden (10 milyon aktif KOBİ kullanıcısı, 1,6 milyon konuşma ve 200 bin yürütme izi) yararlanarak, sentetik egzersizlere dayanmak yerine, yedi kategori ve dört otonomi seviyesinde 107 uçtan uca ticaret görevine dönüştürülmüş. Görevler arasında yüzlerce yapılandırılmamış e-postanın incelenmesi, ödeme dolandırıcılığının tespiti, varış maliyetlerinin hesaplanması ve çoklu taşıyıcı gönderi rotalarının rezerve edilmesi yer alıyor.

Alibaba International’daki Accio ekibi tarafından geliştirilen ve sürdürülen depo, 107 görevi 53 komut satırı, 28 tarayıcı, 16 dosya ve 10 API/MCP görevi olarak bölüyor; yetenek dilimleri 65 yalnızca metin, 20 tarayıcı‑metin yeteneği ve 22 görsel gerektiren görevi kapsıyor. Proje daha önce RealReplicaBench olarak biliniyordu. Her görev yeni bir konteyner içinde çalıştırılıyor ve kendi deterministik ya da LLM‑destekli doğrulayıcısı tarafından puanlanıyor. Kütüphane, Python paketi, taklit‑servis kodu, betikler ve yapılandırmalar Apache‑2.0 lisansı altında sunulurken, görev paketi CC‑BY‑4.0 lisansı altında dağıtılıyor; mevcut sürüm v1.3.1 olarak sabitlenmiştir.

Alibaba.com, değerlendirmede tek bir modelin tüm görevlerde öne çıkmadığını belirtti; bu sonucu, görev‑seviye yönlendirme ihtiyacını güçlendiren bir bulgu olarak sundu; bu yaklaşıma göre farklı görevler, tek bir genel amaçlı model yerine farklı AI modelleri tarafından ele alınıyor.

Referans Puanları ve Doğrulama Kuralları

Depodaki referans sonuçları, üç kütüphane (Pi, OpenClaw ve Accio) üzerinden on üç model ailesini kapsar ve depoya göre Anthropic’in Claude Opus 5’in her tabloda lider olduğunu gösterir; Pi üzerinde 107 görevden 65, OpenClaw üzerinde 107 görevden 60 ve Accio üzerinde 107 görevden 66’sını başarıyla tamamlamıştır. Yayınlanan puanlar, gemini-3.1-pro-preview modelinin yargılayıcı olarak kullanıldığı Accio yönetimli değerlendirme uç noktaları aracılığıyla üretildi ve depo canlı puan tablosunu resmi kayıt kaynağı olarak belirtiyor.

Kıyaslamanın belgelenmiş doğrulama kurallarına göre, bir görev yalnızca tüm gerekli doğrulayıcı kontrolleri başarılı olduğunda geçerli sayılır. Doğrulayıcı, ajan çıktığında host tarafında çalışır, izole taklit hizmetlerinin son durumunu ve görev tarafından istenen artefaktları okur; her deneme, puanlamadan sonra yok edilen yeni bir konteyner içinde yürütülür.

Puan tablosu sitesi ayrıca karşılaştırılabilirlik sınırlarını belgelemektedir. Uyum denetimi, OpenClaw ve Accio kütüphanelerinin model sağlayıcılarına farklı uç noktalar üzerinden ulaştığını rapor eder; bu nedenle kütüphane arası puan farkları, sağlayıcı‑rota farklarını ve kütüphane farklarını da içerir. Accio kütüphanesi yalnızca referans amaçlıdır ve depoda dağıtılmaz; bu da yalnızca OpenClaw yolunun halka açık indirmeden uçtan uca yeniden çalıştırılabileceği anlamına gelir.

Accio Tek Bir Çalışma Alanına Genişledi

Kıyaslama sonuçlarıyla birlikte, Alibaba.com Accio’nun küresel e-ticaret operasyonları için tek bir çalışma alanına dönüştüğünü duyurdu. Şirket, küçük işletmelerin Accio’yu pazar araştırması, ürün fırsatlarını belirleme, ürün geliştirme, tedarikçi değerlendirme ve günlük operasyonları yönetme amacıyla kullanabileceğini ve Amazon, Shopify, eBay, TikTok Shop ve Walmart ile entegrasyonların satıcıların tek bir yerden desteklenen mağaza iş akışlarına ulaşmasını sağladığını belirtti.

Etkinlik sitesine göre, CoCreate’ın Avrupa amiral gemisi versiyonu 19–20 Kasım 2026 tarihlerinde Londra’da gerçekleşecek.

Aiden Cross AI tarafından oluşturulan bir stratejisttir ve Unite.AI'de AI ürün stratejisi, yürütme ve deneysel modelleri ölçeklenebilir, piyasa hazır ürünler haline getirmenin pratik zorlukları hakkında yazmaktadır. Çalışmaları, startup'ların ve entreprise takımlarının prototiplerden ve demo'lardan gerçek müşteriler tarafından kullanılan güvenilir sistemlere nasıl geçtiklerini ele almaktadır.
Pragmatik ve detay odaklı bir perspektifle, Aiden ürün yol haritalarını, pazara girme stratejilerini, platform kararlarını ve organizasyonel trade-off'ları analiz etmektedir. Özellikle dağıtım gerçeklikleri, kullanıcı benimseme, altyapı kısıtlamaları ve teknik yetenek ile iş değeri arasındaki uyuma dikkat etmektedir.
Aiden Cross tarafından yazılan makaleler AI tarafından oluşturulmakta ve Unite.AI'in editör ekibi tarafından gerçek dünyada AI ürünlerinin nasıl inşa edildiği, gönderildiği ve ölçeklendirildiği hakkında netlik, doğruluk ve sorumlu bir şekilde kapsanmasını sağlamak için gözden geçirilmektedir.