Μοντέλα και πλατφόρμες AI
Alibaba.com δηλώνει ότι το Accio εκτέλεσε εργασίες ηλεκτρονικού εμπορίου με κόστος πάνω από 50% χαμηλότερο

Η Alibaba.com στις 9 Σεπτεμβρίου 2026 ανακοίνωσε τα αποτελέσματα μιας αξιολόγησης benchmark 107 εργασιών, δείχνοντας ότι το Accio, η πλατφόρμα AI agents της για το εμπόριο, ολοκλήρωσε μια σειρά εργασιών ηλεκτρονικού εμπορίου με εκτιμώμενο κόστος πάνω από 50% χαμηλότερο από το Codex της OpenAI και το Claude Code της Anthropic, με την ποιότητα ολοκλήρωσης που περιέγραψε η εταιρεία ως συγκρίσιμη.
Η ολοκλήρωση του πλήρους συνόλου εργασιών κόστισε περίπου 3,69 $, με το Accio, ενώ το Codex κόστισε 9,27 $ και το Claude Code 9,51 $, αριθμοί που η Alibaba.com περιέγραψε ως πάνω από 50 % χαμηλότερους και στις δύο περιπτώσεις. Η εταιρεία δήλωσε ότι τα αποτελέσματα καθιστούν το Accio το πιο οικονομικά ανταγωνιστικό εργαλείο AI για το ηλεκτρονικό εμπόριο διαθέσιμο σε μικρές και μεσαίες επιχειρήσεις. Οι ανακοινώσεις έγιναν στο CoCreate, το ετήσιο γεγονός της Alibaba.com για επιχειρηματίες και μικρές επιχειρήσεις, της εκδοχής του Λος Άντζελες 2026, που διεξάγεται στις 9–10 Σεπτεμβρίου 2026.
Πώς η Alibaba.com Εξηγεί τη Διαφορά Κόστους
Σύμφωνα με την εταιρεία, η αποδοτικότητα του Accio προέρχεται από τη βελτιστοποίηση ολόκληρου του συστήματος γύρω από πραγματική εμπορική εργασία. Το Accio χρησιμοποιεί δεδομένα και ροές εργασίας ειδικές για το εμπόριο ώστε να εκπαιδεύει ελαφριά μοντέλα για σαφώς καθορισμένες εργασίες, κάτι που, όπως δήλωσε η εταιρεία, επιτρέπει στα μικρότερα μοντέλα να διαχειρίζονται τις καθημερινές εργασίες αποδοτικά, ενώ πιο ισχυρά μοντέλα παραμένουν διαθέσιμα όταν απαιτείται πιο βαθιά λογική.
Αντί να προεπιλέγει είτε το φθηνότερο είτε το πιο ισχυρό μοντέλο, το σύστημα διασπά σύνθετα αιτήματα σε διαχειρίσιμα βήματα και αξιολογεί την ποιότητα, την ταχύτητα, το κόστος και τις απαιτήσεις δεδομένων για κάθε βήμα, όπως ανέφερε η εταιρεία. Η Alibaba.com περιέγραψε αυτήν την προσέγγιση, σε οικονομικούς όρους, ως μετακίνηση κάθε ροής εργασίας πιο κοντά στο όριο του Pareto, το σημείο όπου η βελτίωση μιας διάστασης απαιτεί συμβιβασμό σε άλλη. Η εταιρεία επίσης αποδίδει την επαναχρησιμοποίηση κρυφής μνήμης, τη συμπίεση περιεχομένου και την συντονισμένη εκτέλεση των agents στη μείωση επαναλαμβανόμενης επεξεργασίας, περιττών κλήσεων εργαλείων και περιττής κατανάλωσης token.
«Για τις μικρές επιχειρήσεις, η μη προσιτή τεχνητή νοημοσύνη είναι άχρηστη», δήλωσε ο Kuo Zhang, Πρόεδρος της Alibaba.com, στην ανακοίνωση της εταιρείας. Ο Zhang τόνισε ότι ο στόχος είναι να καταστήσει την AI εμπορίου πρακτική και προσιτή ακόμη και για μια εταιρεία ενός ατόμου, αντί απλώς να κάνει την AI πιο ισχυρή.
Commerce Agent Bench, Ανοιχτού Κώδικα
Η Alibaba.com δήλωσε ότι έχει ανοίξει τον κώδικα του Commerce Agent Bench στο GitHub. Σύμφωνα με την εταιρεία, το benchmark βασίζεται σε πραγματική δραστηριότητα εμπόρων (10 εκατομμύρια ενεργούς χρήστες ΜΜΕ, 1,6 εκατομμύρια συνομιλίες και 200 000 ίχνη εκτέλεσης) που έχει μετασχηματιστεί σε 107 ολοκληρωμένες εμπορικές εργασίες σε επτά κατηγορίες και τέσσερα επίπεδα αυτονομίας, αντί να βασίζεται σε συνθετικές ασκήσεις. Οι εργασίες περιλαμβάνουν την εξέταση εκατοντάδων μη δομημένων email, την ανίχνευση απάτης στις πληρωμές, τον υπολογισμό του συνολικού κόστους και την κράτηση διαδρομών αποστολής πολλαπλών μεταφορέων.
Το αποθετήριο, που αναπτύχθηκε και συντηρείται από την ομάδα Accio της Alibaba International, χωρίζει τις 107 εργασίες σε 53 εντολές γραμμής, 28 εργασίες προγράμματος περιήγησης, 16 εργασίες αρχείων και 10 εργασίες API/MCP, με τμήματα ικανοτήτων που καλύπτουν 65 εργασίες μόνο κειμένου, 20 εργασίες με δυνατότητα κειμένου προγράμματος περιήγησης και 22 εργασίες που απαιτούν όραση. Το έργο ήταν προηγουμένως γνωστό ως RealReplicaBench. Κάθε εργασία εκτελείται σε ένα νέο κοντέινερ και αξιολογείται από τον δικό της ντετερμινιστικό ή LLM‑υποστηριζόμενο επαληθευτή. Η υποδομή, το πακέτο Python, ο κώδικας mock‑service, τα σενάρια και οι ρυθμίσεις διανέμονται υπό την άδεια Apache‑2.0, ενώ η σειρά εργασιών διανέμεται υπό CC‑BY‑4.0· η τρέχουσα έκδοση είναι η v1.3.1.
Η Alibaba.com δήλωσε ότι κανένα μοντέλο δεν ηγήθηκε συνολικά στην αξιολόγηση, ένα αποτέλεσμα που παρουσίασε ως ενίσχυση της προσέγγισης δρομολόγησης επιπέδου εργασίας, όπου διαφορετικές εργασίες διαχειρίζονται από διαφορετικά μοντέλα AI αντί για ένα γενικού σκοπού μοντέλο για όλα.
Βαθμολογίες Αναφοράς και Κανόνες Επαλήθευσης
Τα αποτελέσματα αναφοράς στο αποθετήριο καλύπτουν δεκατρείς οικογένειες μοντέλων σε τρία περιβάλλοντα (Pi, OpenClaw και Accio) και δείχνουν το Claude Opus 5 της Anthropic να ηγείται κάθε πίνακα, πετυχαίνοντας 65 από 107 εργασίες στο Pi, 60 από 107 στο OpenClaw και 66 από 107 στο Accio, σύμφωνα με το αποθετήριο. Οι δημοσιευμένες βαθμολογίες δημιουργήθηκαν μέσω σημείων αξιολόγησης που διαχειρίζεται το Accio, με το gemini‑3.1‑pro‑preview ως μοντέλο κριτή, και το αποθετήριο προσδιορίζει την ζωντανή κατάταξη ως την επίσημη πηγή.
Σύμφωνα με τους τεκμηριωμένους κανόνες επαλήθευσης του benchmark, μια εργασία θεωρείται περασμένη μόνο εάν επιτύχουν όλοι οι απαιτούμενοι έλεγχοι επαλήθευσης. Ο επαληθευτής εκτελείται στο host μετά την έξοδο του agent, διαβάζοντας την τελική κατάσταση των απομονωμένων mock‑services και των τεχνουργημάτων που απαιτούνται από την εργασία, και κάθε προσπάθεια εκτελείται σε ένα νέο κοντέινερ που καταστρέφεται μετά τη βαθμολόγηση.
Ο ιστότοπος της κατάταξης τεκμηριώνει επίσης περιορισμούς στη συγκρισιμότητα. Η αναφορά ελέγχου ευθυγράμμισης δηλώνει ότι τα περιβάλλοντα OpenClaw και Accio έφτασαν στους παρόχους μοντέλων μέσω διαφορετικών σημείων πρόσβασης, έτσι οι διαφορές βαθμολογίας μεταξύ περιβαλλόντων ενσωματώνουν διαφορές διαδρομής παρόχου καθώς και διαφορές περιβάλλοντος. Το περιβάλλον Accio είναι μόνο αναφοράς και δεν διανέμεται στο αποθετήριο, πράγμα που σημαίνει ότι μόνο η διαδρομή OpenClaw μπορεί να επαναληφθεί από άκρο σε άκρο μέσω του δημόσιου checkout.
Το Accio Επεκτείνεται σε Ενιαίο Χώρο Εργασίας
Παράλληλα με τα αποτελέσματα του benchmark, η Alibaba.com ανακοίνωσε ότι το Accio έχει εξελιχθεί σε ενιαίο χώρο εργασίας για παγκόσμιες λειτουργίες ηλεκτρονικού εμπορίου. Η εταιρεία δήλωσε ότι οι μικρές επιχειρήσεις μπορούν να χρησιμοποιούν το Accio για έρευνα αγορών, εντοπισμό ευκαιριών προϊόντων, ανάπτυξη προϊόντων, αξιολόγηση προμηθευτών και διαχείριση καθημερινών λειτουργιών, ενώ οι συνδέσεις με Amazon, Shopify, eBay, TikTok Shop και Walmart επιτρέπουν στους πωλητές να προσεγγίσουν υποστηριζόμενες ροές εργασίας καταστημάτων από ένα ενιαίο σημείο.
Η ευρωπαϊκή εκδοχή του CoCreate προγραμματίζεται για τις 19–20 Νοεμβρίου 2026, στο Λονδίνο, σύμφωνα με τον ιστότοπο της εκδήλωσης.












