Ηγέτες σκέψης
Τα Ανοιχτά Μοντέλα Συνεχίζουν να Βελτιώνονται. Η Οικονομία Γίνονται Πιο Πολύπλοκη.

Τα μοντέλα AI είναι προφανώς καλύτερα από ό,τι ήταν πριν 18 μήνες. Αλλά όταν άρχισα να εμβαθύνω, οι συνηθισμένες εξηγήσεις για αυτή την πρόοδο δεν έδωσαν λογική.
Δεν βελτιώθηκαν απλώς επειδή έγιναν μεγαλύτερα. Το «Το ανοιχτό λογισμικό κερδίζει» είναι μόνο κατά το ήμισυ σωστό. Και η συμβουλή να κοιτάζουμε τις βαθμολογίες των benchmarks αποδείχθηκε πολύ λιγότερο χρήσιμη από ό,τι περίμενα. Αυτό μου πήρε χρόνο να το αποδεχτώ.
Έτσι, συνέλεξα 18 μήνες δεδομένων από 46 μοντέλα από οκτώ εργαστήρια. Ήθελα να καταλάβω αν η νοημοσύνη γίνεται εμπορευματικό, αν τα ανοιχτά μοντέλα κερδίζουν το προβάδισμα, και τι πρέπει οι εταιρείες να μετρήσουν όταν επιλέγουν τα συστήματα πάνω στα οποία θα χτίσουν.
Το βασικό συμπέρασμα ήταν απλό: μια βαθμολογία benchmark δεν είναι πραγματικά ιδιότητα ενός μοντέλου. Αντιπροσωπεύει το μοντέλο, το λογισμικό και το πλαίσιο που το περιβάλλει, καθώς και το χρόνο και την υπολογιστική ισχύ που του επιτράπηκε να χρησιμοποιήσει. Δημοσιεύεις έναν αριθμό και κρύβεις τα άλλα δύο.
Οι συνέπειες, ωστόσο, είναι πολύ ευρύτερες. Οι εταιρείες συγκρίνουν μεμονωμένα μοντέλα όταν θα έπρεπε να αξιολογούν ολόκληρο το σύστημα που πρέπει να εκτελεί τη δουλειά.
Τα Benchmarks Κρύβουν το Σύστημα
Όταν σταμάτησα να κοιτάζω τις σύνθετες βαθμολογίες και συνέκρινα τα μοντέλα δοκιμή προς δοκιμή, το χάσμα μεταξύ κορυφαίων ανοιχτών και ιδιόκτητων μοντέλων δεν ήταν ένας μόνος αριθμός.
Στο SWE-bench Verified, μια παλαιότερη δοκιμή που εμφανίζεται σε αμέτρητες ανακοινώσεις μοντέλων, το χάσμα ήταν 0,2 μονάδες. Στο SWE-bench Pro, μια νεότερη δοκιμή σχεδιασμένη γύρω από ρεαλιστική, πολυγλωσσική λογισμική εργασία με τυποποιημένη ρύθμιση, ήταν 18,2 μονάδες.
Το προφανές χάσμα μοντέλων εξαρτάται από το benchmark
| Benchmark | Gap | Status |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Saturated, contamination flagged |
| GPQA Diamond | 2.0 pts | Saturated, ceiling around 92–95% |
| Terminal-Bench 2.1 | 4.9 pts | Live, agentic |
| Humanity’s Last Exam | 9.8 pts | Live, frontier reasoning |
| SWE-bench Pro | 18.2 pts | Live, standardized scaffold |
Πηγή: η ανάλυση του Jaspreet Singh για τα κορυφαία μοντέλα ανοιχτού βάρους και ιδιόκτητα, Ιούλιος 2026.
Το ίδιο μοντέλο μπορεί επίσης να λάβει διαφορετικές βαθμολογίες ανάλογα με το ποιος εκτελεί τη δοκιμή. Το Kimi K3 πέτυχε 80,9 % στο Terminal-Bench 2.1 σε ανεξάρτητη αξιολόγηση και 88,3 % όταν ο κατασκευαστής του ανέφερε το αποτέλεσμα. Αυτή η διαφορά των 7,4 μονάδων είναι μεγαλύτερη από το χάσμα ανοιχτό‑εναντίον‑προηγμένου σε τρία από τα πέντε benchmarks που ανέλυσα.
Ένα μοντέλο λαμβάνει οδηγίες μέσω του περιβάλλοντος λογισμικού, αντλεί από το πλαίσιο που του παρέχεται, χρησιμοποιεί τα εργαλεία που μπορεί να προσπελάσει και λειτουργεί εντός ενός προϋπολογισμού λογικής που ορίζει ο προγραμματιστής. Αλλάζετε αυτές τις συνθήκες και το αποτέλεσμα αλλάζει μαζί τους.
Τα δημόσια benchmarks είναι χρήσιμα για την κατανόηση της κατεύθυνσης της προόδου. Αποτελούν όμως κακή βάση για την απόφαση τι θα λειτουργήσει μέσα στην εταιρεία σας.
Η Αξιοπιστία των Agentic Αλλαγές τα Μαθηματικά
Αυτό γίνεται πιο σημαντικό καθώς η AI μεταβαίνει από την απάντηση ερωτήσεων στην ολοκλήρωση μιας σειράς ενεργειών.
Σκεφτείτε μια ροή εργασίας με 20 βήματα, όπου η AI εκτελεί σωστά κάθε βήμα το 95 % των φορών. Αυτό ακούγεται αξιόπιστο. Σε όλη τη σειρά, όμως, η ροή εργασίας ολοκληρώνεται μόνο το 36 % των φορών.
Ένα καλύτερο μοντέλο μπορεί να βελτιώσει τις πιθανότητες σε κάθε βήμα, ειδικά σε δύσκολες agentic εργασίες. Η περιβάλλουσα μηχανική είναι αυτή που καθορίζει αν ένα λάθος βήμα χαλάσει όλη τη δουλειά. Η αποθήκευση προόδου, η επαλήθευση των αποτελεσμάτων, η ασφαλής επανάληψη και η ανάκτηση από αποτυχία συχνά διαχωρίζουν μια εντυπωσιακή επίδειξη από ένα αξιόπιστο προϊόν.
Η επιλογή μοντέλου εξακολουθεί να μετράει. Αλλά το μοντέλο με την υψηλότερη βαθμολογία δεν παράγει αυτόματα το πιο αξιόπιστο σύστημα.
Επιλέξτε Μοντέλα βάσει της Εργασίας
Τα δεδομένα υποστηρίζουν ένα πιο στενό συμπέρασμα από ό,τι συνήθως προβάλλουν τα δύο άκρα της συζήτησης ανοιχτό‑εναντίον‑ιδιόκτητου.
Τα ανοιχτά μοντέλα είναι ανταγωνιστικά για καλά ορισμένες, βραχυπρόθεσμες εργασίες όπου το αποτέλεσμα μπορεί να μετρηθεί άμεσα. Η ταξινόμηση, η εξαγωγή, η περίληψη και η δομημένη παραγωγή εντάσσονται όλο και περισσότερο σε αυτή την κατηγορία.
Τα μοντέλα frontier εξακολουθούν να δικαιολογούν το premium τους σε πιο μακροπρόθεσμες agentic εργασίες, στην τήρηση οδηγιών υπό πίεση, και σε εργασίες όπου η αποτυχία είναι ακριβή να εντοπιστεί μετά το γεγονός. Εκεί δείχνουν τα νεότερα benchmarks ένα χάσμα κοντά στα 18 σημεία αντί για μηδέν, και εκεί η στρώση ασφαλείας που παρέχει ο προμηθευτής του μοντέλου έχει αξία.
Οι εταιρείες θα πρέπει να επιλέγουν μοντέλα ανά εργασία, αλλά δεν πρέπει να υποθέτουν ότι η εναλλαγή είναι δωρεάν. Το πλαίσιο, η λογική και οι προσωρινές μνήμες προτροπών δεν μετακινούνται ομαλά μεταξύ προμηθευτών. Ένα φθηνότερο μοντέλο μπορεί να γίνει πιο ακριβό εάν η αλλαγή συστημάτων αναγκάσει την εργασία να ξεκινήσει ξανά ή προσθέσει επίπεδα μηχανικής και διακυβέρνησης.
Η επιλογή μοντέλου γίνεται όλο και λιγότερο μόνιμη. Η εναλλαγή παραμένει ακόμη μια αρχιτεκτονική απόφαση.
Καθώς η νοημοσύνη γίνεται φθηνότερη, η κρίση παραμένει δαπανηρή
Η ικανότητα γενικού σκοπού με επάρκεια γίνεται εξαιρετικά φθηνή. Στην κορυφή της καμπύλης, ωστόσο, κάθε επιπλέον μονάδα απόδοσης κοστίζει περισσότερο από την προηγούμενη. Τα τελευταία εννέα σημεία ικανότητας κοστίζουν περίπου δέκα φορές ό,τι κοστίζει ό,τι βρίσκεται κάτω από αυτά.
Οι περισσότερες εταιρείες δεν χρειάζονται το πιο ισχυρό μοντέλο για κάθε αίτημα. Χρειάζεται όμως να γνωρίζουν ποια εργασία το αξίζει.
Η σύνοψη, η εξαγωγή, η ταξινόμηση, η σύνταξη και η μετάφραση προχωρούν προς την ικανότητα χρηστικότητας. Αυτό που παραμένει σπάνιο είναι η κρίση: να γνωρίζουμε ποια από τις πέντε πιθανές απαντήσεις είναι σωστή, να παρατηρούμε ότι η ερώτηση ήταν λανθασμένη και να αποφασίζουμε πότε να σταματήσουμε και να ζητήσουμε παρέμβαση ανθρώπου.
Η κρίση προέρχεται από ιδιόκτητο πλαίσιο, επιχειρηματικούς κανόνες, ροές εργασίας, ιστορική γνώση και τη μηχανική που επαληθεύει την εργασία και περιορίζει τις αποτυχίες.
Δημιουργήστε την αξιολόγηση που κανείς άλλος δεν μπορεί να εκτελέσει
Για μια επιχείρηση, το πιο πολύτιμο benchmark δημιουργείται από τη δική της εργασία.
Δημιουργήστε ένα ιδιωτικό σύνολο αξιολόγησης με 50 έως 200 πραγματικές εργασίες από την επιχείρησή σας. Διατηρήστε το περιβάλλον σύστημα σταθερό, εκτελέστε τα τεστ επανειλημμένα και αξιολογήστε αν η εργασία ολοκληρώθηκε σωστά, αντί για το πόσο γυαλισμένη ακούγεται η απάντηση.
Εφαρμόστε την ίδια πειθαρχία στο κόστος. Το κόστος ανά token μπορεί να παραπλανά όταν ένα μοντέλο λογίζεται περισσότερο, απαιτεί περισσότερες επαναλήψεις ή δημιουργεί περισσότερη εργασία για έναν ανθρώπινο ελεγκτή. Μετρήστε το κόστος ανά αποδεκτό αποτέλεσμα αντί για αυτό.
Ξεκινήστε με μικρό αριθμό μοντέλων. Κατευθύνετε την εργασία στην αρχή ενός έργου αντί να αλλάζετε προμηθευτές στη μέση του. Υπολογίστε το βάρος ασφαλείας, διακυβέρνησης και λειτουργίας κάθε επιπλέον προμηθευτή μαζί με την τιμή που διαφημίζεται.
Η αγορά θα συνεχίσει να παράγει νέους νικητές benchmark, και οι εταιρείες θα εξακολουθούν να δελεάζονται να ξαναχτίσουν τη στρατηγική AI τους γύρω από καθέναν από αυτούς. Μια καλύτερη προσέγγιση είναι να επιλέγετε μοντέλα για τη δουλειά, έπειτα να αξιολογείτε ολόκληρο το σύστημα υπό τις συνθήκες που πρέπει να λειτουργήσει.
Το benchmark που πρέπει να καθοδηγεί την αρχιτεκτονική σας είναι αυτό που μόνο η δική σας εταιρεία μπορεί να εκτελέσει.












