Μοντέλα και πλατφόρμες AI

Η Abacus.AI κυκλοφορεί τρία μοντέλα Smaug ανοιχτού βάρους για εργασίες με πράκτορες

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Abacus.AI στις 10 Σεπτεμβρίου 2026 παρουσίασε τη σειρά Smaug, τρία μοντέλα γλώσσας ανοιχτού βάρους που έχουν βελτιστοποιηθεί για επιχειρησιακές εργασίες με πράκτορες: Smaug Agentic, Smaug Flash και Smaug Mini. Και τα τρία είναι διαθέσιμα για λήψη στο Hugging Face και μπορούν επίσης να χρησιμοποιηθούν μέσω του RouteLLM API της εταιρείας.

Τα μοντέλα παρουσιάστηκαν στην πλατφόρμα enterprise agentic AI της Abacus.AI και στο Super Assistant. Η εταιρεία δήλωσε ότι οι επιχειρήσεις μπορούν να φιλοξενήσουν τα μοντέλα στο δικό τους περιβάλλον cloud VPC, παρέχοντάς τους πλήρη έλεγχο των δεδομένων τους και του πού φιλοξενείται η AI, και ότι οργανισμοί που ανησυχούν για την ασφάλεια και την ιδιωτικότητα των δεδομένων μπορούν να φιλοξενήσουν το Smaug Agentic σε εσωτερικό σύστημα GPU.

Η Abacus.AI περιγράφει το Smaug ως τεχνική λεπτοπροσαρμογής που μπορεί να εφαρμοστεί σε οποιοδήποτε ανοιχτού κώδικα βασικό μοντέλο, και ανέφερε ότι βελτιώνει την απόδοση των μακροχρόνιων βρόχων με πράκτορες κατά 15–20% χωρίς αύξηση κόστους. Η εταιρεία προσθέτει ότι αυτό επιτρέπει στις επιχειρήσεις να αναπτύξουν αυτοβελτιούμενους AI πράκτορες σε μεγάλη κλίμακα με κόστος μοντέλων ανοιχτού κώδικα, το οποίο περιγράφεται ως τυπικά 10–100× χαμηλότερο από εκείνο των μοντέλων αιχμής της Anthropic και της OpenAI.

«Τα μοντέλα ανοιχτού βάρους κλείνουν γρήγορα το χάσμα με τα κλειστά μοντέλα αιχμής, αλλά εξακολουθούν να υπολείπονται σε μακροχρόνιους βρόχους πράκτορα», δήλωσε η Bindu Reddy, Διευθύνων Σύμβουλος της Abacus.AI, στην ανακοίνωση της εταιρείας. Η Reddy πρόσθεσε ότι η σειρά Smaug αντιμετωπίζει αυτό το ελάττωμα ενώ παραμένει 10–100× φθηνότερη από τα κλειστά μοντέλα.

Σύμφωνα με το τεχνικό σημείωμα της εταιρείας, η σειρά προέκυψε από το κόστος και την αναποτελεσματικότητα της εκτέλεσης μεγάλων βρόχων με πράκτορες που απαιτούν μεγάλα συμφραζόμενα και επαναλαμβανόμενες κλήσεις εργαλείων, επιδεινωμένα από τη διακοπή της προσωρινής αποθήκευσης προτροπών σε χρονικά κενά. Η μεθοδολογία συνδυάζει ανθρώπινα επιμελημένα, πραγματικά σενάρια πράκτορων με συνθετικά δεδομένα βασισμένα σε δύσκολα παραδείγματα, και το σημείωμα αναφέρει σταθερές βελτιώσεις σε κωδικοποίηση πράκτορων, χρήση εργαλείων σε πραγματικό κόσμο, αυτοματοποίηση, και λογική μεγάλου συμφραζόμενου καθώς και ακολούθηση οδηγιών όταν εφαρμόζεται σε μια σειρά μοντέλων ανοιχτού βάρους.

Smaug Agentic

Το Smaug Agentic, το μεγαλύτερο μοντέλο της σειράς, είναι μια επιβλεπόμενη λεπτοπροσαρμογή του Kimi K3 της Moonshot AI, ενός μοντέλου mixture-of-experts με 2,8 τρισεκατομμύρια συνολικές παραμέτρους, 104 δισεκατομμύρια ενεργές παραμέτρους, μήκος συμφραζομένων 1.048.576 token και τον κωδικοποιητή όρασης MoonViT-V2, σύμφωνα με την κάρτα μοντέλου. Η λεπτοπροσαρμογή δεν αλλάζει αρχιτεκτονικές παραμέτρους, και το μοντέλο κυκλοφορεί υπό την άδεια Kimi K3 License που κληρονομείται από το βασικό μοντέλο, των όρων των οποίων πρέπει να συμμορφωθούν οι χρήστες. Η κάρτα αναφέρει ότι η εκπαίδευση χρησιμοποίησε επιμελημένα πολυ-στροφικά, εργαλεία‑χρησιμοποιούντα σενάρια κωδικοποίησης με μάσκα λογικής στα tokens απώλειας, ώστε η εκπαίδευση να καθοδηγεί τις ενέργειες του μοντέλου ενώ διατηρεί αμετάβλητη τη διανομή λογικής του βασικού μοντέλου· το περιεχόμενο του συνόλου δεδομένων δεν αποκαλύπτεται.

Η κάρτα αναφέρει σκορ 94,1 στο GPQA Diamond, 75,7 στο AA‑LCR, 69,9 στο DeepSWE, 86,5 στο Terminal‑Bench 2.1, 60,8 στο SciCode, 64,6 στο LiveBench κωδικοποίηση πράκτορα, 31,0 στο AutomationBench και 81,0 στο MMMU‑Pro. Δηλώνει κέρδη έναντι του βασικού Kimi K3 κατά 2,4 μονάδες στο DeepSWE, 2,4 στο LiveBench κωδικοποίηση πράκτορα, 2,1 στο SciCode, 1,0 στο AA‑LCR και 0,6 στο GPQA Diamond.

Η κάρτα επίσης αναφέρει ότι το p99 μήκος λογικής μειώνεται σε περίπου 0,6× του βασικού μοντέλου στο SciCode και το AA‑LCR, ενώ το ορατό μήκος απάντησης παραμένει στατιστικά αδιάφορο από το Kimi K3. Σε 113 εργασίες DeepSWE και πάνω από επτά ώρες συνεχούς εργασίας, η εταιρεία ανέφερε μηδενικά σφάλματα υποδομής και μηδενικά timeouts. Επειδή η αρχιτεκτονική παραμένει αμετάβλητη, το Smaug Agentic τρέχει όπου τρέχει το Kimi K3, με δημοσιευμένες συνταγές εξυπηρέτησης για vLLM, SGLang και TokenSpeed. Η ανακοίνωση τοποθετεί το μοντέλο ως οικονομικά αποδοτική αντικατάσταση των μοντέλων τύπου Opus.

Smaug Flash and Smaug Mini

Το Smaug Flash είναι λεπτοπροσαρμοσμένο στο DeepSeek V4 Flash 0731 και στοχεύει σε επιχειρησιακούς αυτοβελτιούμενους πράκτορες. Το σημείωμα λέει ότι το βασικό μοντέλο είναι επιρρεπές σε «σπιν και σύγχυση» σε μακροχρόνια χρήση εργαλείων με πράκτορες, και ότι το Smaug Flash αντιμετωπίζει αυτό το πρόβλημα διατηρώντας τα πλεονεκτήματα κόστους και ταχύτητας του βασικού μοντέλου. Η ανακοίνωση περιγράφει το Smaug Flash ως βελτιστοποιημένο για προσωπικούς πράκτορες που μπορούν να συνδεθούν με εφαρμογές μηνυμάτων όπως WhatsApp, Telegram και Slack και να διατηρούν μακροχρόνιες συνομιλίες με χρήστες. Οι αναφερόμενες βαθμολογίες σε σύγκριση με το βασικό DeepSeek V4 Flash 0731, με το Claude Sonnet 5 ως αναφορά, είναι 77,4 έναντι 74,2 στο LiveBench συνολικά, 61,1 έναντι 46,8 στο LiveBench κωδικοποίηση πράκτορα, 56,6 έναντι 54,4 στο DeepSWE 1.1, 38,83 έναντι 25,1 στο AutomationBench public 600 υπό αυστηρό πέρασμα, και 73,3 έναντι 54,2 στο NL2repo‑bench.

Το Smaug Mini είναι μοντέλο 27 δισεκατομμυρίων παραμέτρων, λεπτοπροσαρμοσμένο στο Qwen3.8 27B, προορισμένο για πολυμορφικές περιπτώσεις χρήσης και μικρότερα φορτία λογικής. Το σημείωμα αναφέρει 76,9 έναντι 75,3 του βασικού μοντέλου στο LiveBench συνολικά, 82,0 στο IFBench, 41,8 έναντι 37,3 στο AutomationBench, 50,5 έναντι 33,4 στο JobBench επίσημο πρωτόκολλο 65‑εργασιών, και 55,8 έναντι 42,3 στο NL2repo‑bench, με το Claude Sonnet 5, Claude Opus 4.6 και GPT‑5.6 Luna ως στήλες αναφοράς. Η ανακοίνωση περιγράφει το Smaug Mini ως κατάλληλο για απλές εργασίες και επιχειρησιακά chatbot, και δηλώνει ότι οι επιχειρήσεις μπορούν να το λεπτοπροσαρμόσουν περαιτέρω με τα δικά τους δεδομένα.

Πρωτόκολλο Αξιολόγησης και Οδικός Χάρτης

Το τεχνικό σημείωμα δηλώνει ότι οι αξιολογήσεις πραγματοποιήθηκαν από την Abacus.AI με την ίδια πλατφόρμα για κάθε μοντέλο, εκτός αν σημειώνονται με σπαθί ως βαθμολογία που δεν προέρχεται από την πλατφόρμα, και ότι οι γραμμές LiveBench προέρχονται από τον δημοσιευμένο πίνακα κατάταξης LiveBench της 25ης Ιουνίου 2026. Η κάρτα Smaug Agentic αναφέρει ότι τα αποτελέσματά της παραγλήθηκαν σε μια αφιερωμένη εγκατάσταση 8×B300 σε θερμοκρασία 1,0 με μέγιστη προσπάθεια λογικής, και ότι η αξιολόγηση SciCode περιλαμβάνει διόρθωση ενός ανώτερου ελαττώματος που άφησε 12 υποπροβλήματα αδυνατότητα επίλυσης. Η εταιρεία ανέφερε ότι τα μοντέλα εμφανίζονται στο LiveBench υπό το φίλτρο finetunes του πίνακα κατάταξης.

Η Abacus.AI δήλωσε ότι η σειρά Smaug είναι τόσο μια κυκλοφορία προϊόντος όσο και μια απόδειξη της θεωρίας της ότι, με τη σωστή μεθοδολογία λεπτοπροσαρμογής, τα μοντέλα ανοιχτού βάρους μπορούν να ανταγωνιστούν και να ξεπεράσουν τα μοντέλα αιχμής σε εργασίες agentic AI. Η εταιρεία προσθέτει ότι προβλέπει τη συνέχιση της εξέλιξης της σειράς καθώς εξελίσσονται τα βασικά μοντέλα και μεγαλώνει η βιβλιοθήκη των traces πράκτορων.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.