Μοντέλα και πλατφόρμες AI

Η Anthropic κυκλοφορεί το Claude Sonnet 5.5 με αμετάβλητες τιμές του Sonnet 5

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Anthropic κυκλοφόρησε το Claude Sonnet 5.5 στις 28 Σεπτεμβρίου 2026, το δεύτερο μοντέλο στην οικογένεια Claude 5.5. Το μοντέλο διατηρεί την τιμολόγηση του Claude Sonnet 5 στα $2 ανά εκατομμύριο εισερχόμενα tokens και $10 ανά εκατομμύριο εξερχόμενα tokens, και η Anthropic αναφέρει ότι παράγει έξοδο πιο από 30 % γρηγορότερα ενώ κοστίζει έως και 30 % λιγότερο ανά εργασία στις δοκιμές της.

Στην ανακοίνωση κυκλοφορίας, η Anthropic περιέγραψε το Sonnet 5.5 ως ένα ταχύτερο, πιο οικονομικό συμπλήρωμα του Claude Opus 5.5, το οποίο, σύμφωνα με την εταιρεία, έχει σχεδιαστεί για σύνθετη εργασία που απαιτεί προσεκτική κρίση. Το Sonnet 5.5 είναι πιο ισχυρό σε καλά ορισμένα καθημερινά καθήκοντα, στην διόρθωση σφαλμάτων και στην παραγωγή επεξεργασμένων εγγράφων, διαφανειών και λογιστικών φύλλων, δήλωσε η Anthropic, προσθέτοντας ότι διαθέτει επίσης οξύ μάτι για το σχεδιασμό.

Το Claude Sonnet 5.5 είναι διαθέσιμο σε όλες τις πλατφόρμες, συμπεριλαμβανομένων των Amazon Web Services, Google Cloud και Microsoft Azure, με το αναγνωριστικό μοντέλου claude-sonnet-5-5, και προσφέρεται με μηδενική διατήρηση δεδομένων, όπως και το Opus 5.5 και το Sonnet 5.

Αναφερόμενα Αποτελέσματα Δοκιμών Απόδοσης

Η Anthropic αναφέρει ότι το Sonnet 5.5 σημειώνει 70,6 % στο Terminal-Bench 4.0, μια αξιολόγηση κωδικοποίησης με πράκτορα, σε σύγκριση με το 10,3 % του Sonnet 5, με το καταγεγραμμένο σκορ του Opus 5.5 να είναι 66,4 % και να αντικατοπτρίζει το αποτέλεσμα Xhigh‑effort. Στο κύριο σύνολο του FrontierCode 1.1, το Sonnet 5.5 καταγράφει 46,2 % στο Max effort και 52,1 % στο Xhigh, σε σύγκριση με 42,4 % για το Sonnet 5, 54,4 % για το Opus 5.5 και 49,3 % για το GPT‑6 Sol της OpenAI. Τα αναφερόμενα σκορ του CursorBench 4.0 είναι 55,5 % για το Sonnet 5.5, 34,1 % για το Sonnet 5 και 57,8 % για το Opus 5.5.

Σε αξιολογήσεις εργασίας γνώσης, η εταιρεία αναφέρει σκορ GDPval‑AA v2.1 1844 για το Sonnet 5.5, δύο μονάδες κάτω από το 1846 του Opus 5.5 και περίπου 400 μονάδες πάνω από το 1449 του Sonnet 5, καθώς και σκορ AA‑Briefcase v1.1 1811 σε σύγκριση με 1822 για το Opus 5.5 και 1359 για το Sonnet 5. Η ανακοίνωση αναφέρει επίσης 64,5 % με εργαλεία στο Humanity’s Last Exam, 80,1 % μερική βαθμολογία στο OSWorld 2.1, και 61,6 % χωρίς εργαλεία στο Chartography, ένα τεστ αναγνώρισης οπτικών διαγραμμάτων. Η Anthropic δηλώνει ότι το Sonnet 5.5 είναι το πρώτο μοντέλο Sonnet που ξεπερνά το Pokémon Red λειτουργώντας μόνο από στιγμιότυπα οθόνης.

Η εταιρεία προειδοποιεί ότι τα σκορ των δοκιμών αποτυπώνουν μόνο μία πλευρά των δυνατοτήτων ενός μοντέλου και δηλώνει ότι στις δικές της δοκιμές και σε αυτές εξωτερικών ελεγκτών, το Opus 5.5 παραμένει σαφώς πιο ισχυρό σε σύνθετη, ανοιχτή εργασία που απαιτεί διαρκή κρίση. Μια υποσημείωση αναφέρει ότι η Artificial Analysis εκτέλεσε το GDPval‑AA και το AA‑Briefcase σε μια προ‑κυκλοφοριακή ανάπτυξη με σφάλμα δομημένων εξόδων που έχει διορθωθεί και που, αν και αν υπάρχει, θα υποτιμούσε την απόδοση του Sonnet 5.5. Μια άλλη υποσημείωση σημειώνει ότι η OpenAI διόρθωσε πρόσφατα σφάλμα κατανόησης εικόνας στο GPT‑6 Sol, το οποίο ενδέχεται να μην έχουν ακόμη αντικατοπτρίσει τα σκορ τρίτων.

Αποτελέσματα Πρώιμων Δοκιμαστών

Ο αντιπρόεδρος AI της CodeRabbit, David Loker, δήλωσε ότι το Sonnet 5.5 δείχνει καλύτερη κρίση από το Sonnet 5 σε όλα τα επίπεδα πολυπλοκότητας ενώ χρησιμοποιεί σημαντικά λιγότερα tokens εξόδου, και ότι η CodeRabbit σχεδιάζει να μεταφέρει τις απλές και μετρίως σύνθετες αξιολογήσεις στο μοντέλο άμεσα, με περισσότερες τις επόμενες εβδομάδες. Ο επικεφαλής μηχανικής AI της Base44, Gabriel Grinberg, ανέφερε ότι σε 118 πραγματικές κατασκευές εφαρμογών, το Sonnet 5.5 είχε κατά μέσο όρο 3,6 επαναλήψεις ανά κατασκευή σε σύγκριση με τις 7,7 του Opus 5, με τον μικρότερο αριθμό αποτυχημένων κλήσεων εργαλείων από οποιοδήποτε μοντέλο που συγκρίνατε η Base44.

Ο κύριος μηχανικός του Slack, Curtis Allen, ανέφερε περίπου 14 % λιγότερα tokens εξόδου σε αξιολογήσεις εκτός σύνδεσης του Slackbot χωρίς αλλαγές στο prompt. Ο διευθυντής AI της Zendesk, Abhinay Kathuria, δήλωσε ότι τα εισιτήρια επεξεργάστηκαν 20 % πιο γρήγορα σε σύγκριση με τα μοντέλα Claude που χρησιμοποιεί η Zendesk σε παραγωγή. Η Balyasny Asset Management ανέφερε περίπου 121.000 tokens ανά απάντηση έναντι των 497.000 του Sonnet 5 σε ένα ιδιωτικό σύνολο 2.441 χρηματοοικονομικών εργασιών. Η Box ανέφερε αποτελέσματα 2,4 φορές πιο γρήγορα με 12 % λιγότερα συνολικά tokens, και η Atlassian δήλωσε ότι οι πελάτες μπορούν να εκτελούν τους Rovo Agents έως και 30 % πιο γρήγορα από το Sonnet 5.

Τιμολόγηση, Ταχύτητα και Μετάβαση

Οι καταγεγραμμένες τιμές του Sonnet 5.5 ταιριάζουν ακριβώς με αυτές του Sonnet 5: $2 ανά εκατομμύριο εισερχόμενα tokens, $10 ανά εκατομμύριο εξερχόμενα tokens, $0,20 ανά εκατομμύριο tokens ανάγνωσης cache και $2,50 ανά εκατομμύριο tokens εγγραφής cache. Το Opus 5.5 αναγράφει $4 για τα εισερχόμενα, $20 για τα εξερχόμενα και $5 για τις εγγραφές cache. Η Anthropic δηλώνει ότι το Sonnet 5.5 συνήθως χρειάζεται πολύ λιγότερα tokens για την ίδια εργασία και είναι το ταχύτερο μοντέλο Sonnet μέχρι σήμερα.

Το μοντέλο προσφέρει πέντε επαναρυθμισμένα επίπεδα προσπάθειας: χαμηλό, μεσαίο, υψηλό, xhigh και max. Οι προεπιλογές είναι Μεσαίο στο Claude Code και στις εφαρμογές Claude και Υψηλό στην Πλατφόρμα Claude, η οποία είναι επίσης η προεπιλογή του API.

Ο οδηγός μετάβασης της Anthropic παραθέτει αλλαγές που διακόπτουν τη λειτουργία για προγραμματιστές που μεταβαίνουν από το Sonnet 5. Η προσαρμοστική σκέψη εκτελείται πλέον εξ ορισμού, η απενεργοποιημένη ρύθμιση σκέψης επιστρέφει σφάλμα 400, και οι προγραμματιστές που χρησιμοποίησαν το Sonnet με απενεργοποιημένη σκέψη πρέπει να μεταβούν στη νέα μεταξύ ρύθμιση εργαλείων, η χαμηλότερη διαθέσιμη, πριν από τη μετάβαση. Η επιβολή επιλογής εργαλείου απορρίπτεται υπέρ αυτόματης επιλογής εργαλείου σε συνδυασμό με αυστηρά εργαλεία, και το ελάχιστο prompt που μπορεί να αποθηκευτεί στη μνήμη cache μειώνεται στα 512 tokens από 1.024 στο Sonnet 5. Η τεκμηρίωση επίσης παραθέτει πέντε κατηγορίες λόγων απόρριψης, καλύπτοντας cyber, bio, frontierllm, συλλογισμόςεξαγωγή, και γενικάβλάβες, και σημειώνει ότι οι επαναπροσπάθειες fallback στην πλευρά του διακομιστή επαναλαμβάνονται μόνο για απορρίψεις cyber και frontier_llm στο Sonnet 5.

Αποτελέσματα Ασφαλείας και Μέτρα Προστασίας

Δεδομένου ότι οι κυβερνοδυνατότητες του Sonnet 5.5 είναι συγκρίσιμες με αυτές του Opus 5, δήλωσε η Anthropic, πρόκειται για το πρώτο μοντέλο Sonnet που κυκλοφορεί με τα κυβερνοπροστατευτικά μέτρα και εναλλακτικές λύσεις που χρησιμοποιούνται στα πιο ικανά μοντέλα της εταιρείας. Η κάρτα συστήματος αναφέρει ότι με τα μέτρα ασφαλείας απενεργοποιημένα, το Sonnet 5.5 παρουσίασε μέσο όρο 11,53 σημαίες ικανότητας και ποσοστό σύλληψης 80% στο ExploitBench και παρήγαγε 178 πλήρη εκμεταλλεύσεις εκτέλεσης αυθαίρετου κώδικα, έναντι ενός για το Sonnet 5. Ολοκλήρωσε το 46,1% των προκλήσεων του CyScenarioBench σε σύγκριση με το 0,7% του Sonnet 5 και παρήγαγε 50 παραβιάσεις ελέγχου ροής στο Binary Exploitation Benchmark σε σύγκριση με 3 του Sonnet 5.

Τα κυβερνοπροστατευτικά μέτρα λειτουργούν σε τρία στάδια: μια έρευνα στις εσωτερικές ενεργοποιήσεις του μοντέλου, ένας ελαφρύς ταξινομητής εντός του μοντέλου και ένας ξεχωριστός εκπαιδευμένος ταξινομητής LLM. Η κάρτα αναφέρει ότι η ανάκληση είναι 99,43% στο σύνολο κάλυψης κυβερνοβλαβών και το ποσοστό επιτυχίας επίθεσης είναι 21,0% στην αξιολόγηση ανθεκτικότητας επαναφοράς-επιτιθέμενου, βελτιωμένο από 57,2% για το Sonnet 5, ενώ προειδοποιεί τους χρήστες να αναμένουν αυξημένες απορρίψεις ακόμη και σε αθώα καθήκοντα κυβερνοασφάλειας. Τα αιτήματα υψηλότερου κινδύνου επιστρέφουν ορατά στο Sonnet 5, και ένα επεκταμένο Πρόγραμμα Επαλήθευσης Κυβερνοασφάλειας θα προσφέρει σύντομα σε ελεγμένους υπερασπιστές επιβαθμισμένη πρόσβαση σε προχωρημένες δυνατότητες στο Sonnet 5.5, Opus 5.5 και μοντέλα Claude Mythos.

Τα βιολογικά μέτρα ασφαλείας είναι οι ίδιοι ταξινομητές επιβλαβούς κακής χρήσης που έχουν αναπτυχθεί για το Opus 5, χωρίς εναλλακτικό μοντέλο, και το Πρόγραμμα Επαλήθευσης Βιοεπιστημών της Anthropic καλύπτει την πρόσβαση για όλο το φάσμα της βιολογικής εργασίας. Το Sonnet 5.5 είναι επίσης το πρώτο μοντέλο Sonnet με ταξινομητές ασφαλείας που εμποδίζουν την εξαγωγή λογικής, και επεκτείνει τη διατηρημένη σκέψη ώστε η σκέψη ενός μοντέλου να μην μπορεί να αποσυνδεθεί από τον λογαριασμό που το δημιούργησε.

Στην αυτοματοποιημένη αξιολόγηση συμπεριφοράς περίπου 1.850 σεναρίων της Anthropic, η εταιρεία αναφέρει ότι το Sonnet 5.5 βελτιώνεται ή ισούται με το Sonnet 5 στα περισσότερα μέτρα ευθυγράμμισης, αντοχής σε κακή χρήση και ειλικρίνειας, καταγράφει το χαμηλότερο ποσοστό απόπειρας διαφυγής από sandbox μεταξύ των δοκιμασμένων μοντέλων, και παρουσιάζει πιο ακατανόητη σκέψη από πολλά προηγούμενα μοντέλα. Η κάρτα συστήματος δηλώνει ότι το Sonnet 5.5 δεν υπερβαίνει νέες κατώφλες της Πολιτικής Υπεύθυνης Κλιμάκωσης, θεωρείται ότι πληροί τις κατώφλες CB-1 και Autonomy-1 της πολιτικής, και φέρει χαμηλό εκτιμημένο κίνδυνο καταστροφικής μη ευθυγράμμισης. Το αξιόπιστο όριο γνώσης του μοντέλου είναι ο Ιούνιος 2026.

Η Anthropic δήλωσε ότι το Claude Haiku 5.5, σχεδιασμένο για εφαρμογές υψηλού όγκου και ευαίσθητες στο κόστος, θα ενταχθεί στην οικογένεια Claude 5.5 τις επόμενες εβδομάδες.

Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.