Μοντέλα και πλατφόρμες AI

Το Gemini 3.1 Pro Καταρρίπτει Ρεκόρ Στη Λογική Ανάλυση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Google (GOOGL ) κυκλοφόρησε το Gemini 3.1 Pro στις 19 Φεβρουαρίου, μια ενημέρωση του旗艦 μοντέλου AI που διπλασιάζει την απόδοση της λογικής ανάλυσης ενώ διατηρεί τις ίδιες τιμές με τον προκάτοχό του.

Το πιο εντυπωσιακό νούμερο: στο ARC-AGI-2, ένα βENCHMARK που δοκιμάζει αν τα μοντέλα μπορούν να λύσουν εντελώς νέες λογικές προτύπους αντί να θυμάται τα δεδομένα εκπαίδευσης, το Gemini 3.1 Pro σκοράρει 77.1%. Το Gemini 3 Pro σκοράρει 31.1%. Αυτή η αύξηση 46 ποσοστιαίων μονάδων είναι η μεγαλύτερη αύξηση σε μια γενιά μοντέλων.

Το μοντέλο είναι διαθέσιμο αμέσως σε όλες τις πλατφόρμες καταναλωτών και αναπτυξιακών της Google. Οι χρήστες της εφαρμογής Gemini που έχουν συνδρομή AI Pro και AI Ultra έχουν πρόσβαση με υψηλότερα όρια χρήσης, ενώ οι dévelopπεurs possono να έχουν πρόσβαση στο 3.1 Pro μέσω του API Gemini στο AI Studio, Vertex AI, Gemini CLI, Antigravity και Android Studio. Το NotebookLM επίσης λαμβάνει την ενημέρωση για τους συνδρομητές Pro και Ultra.

ΒENCHMARK Απόδοση Σε Όλα Τα Πεδία

Η κάρτα μοντέλου δείχνει ότι το Gemini 3.1 Pro κατατάσσεται πρώτο σε 12 από τα 18 παρακολουθούμενα βENCHMARK. Πέρα από το ARC-AGI-2, τα εξαιρετικά αποτελέσματα περιλαμβάνουν 94.3% στο GPQA Diamond, ένα τεστ λογικής ανάλυσης σε επίπεδο μεταπτυχιακών σπουδών, και 2,887 Elo στο LiveCodeBench Pro, το υψηλότερο σκορ σε όλα τα μοντέλα για ανταγωνιστική προγραμματιστική.

Στο Humanity’s Last Exam—ένα βENCHMARK που προέρχεται από ερωτήσεις εμπειρογνωμόνων σε διάφορες ακαδημαϊκές дисципλίνες—το 3.1 Pro φτάνει στο 44.4%, ανεβαίνοντας από 37.5% για το Gemini 3 Pro και προηγούμενο του GPT-5.2 στο 34.5%. Το multilingual MMLU βENCHMARK δείχνει 92.6%, και η ακρίβεια σε μεγάλο контекστό στο 128,000 tokens διατηρείται στο 84.9%.

Το μοντέλο διατηρεί ένα παράθυρο εισαγωγής 1 εκατομμυρίου tokens και παράγει μέχρι 64,000 tokens εξόδου, ταιριάζοντας με τις προδιαγραφές των εργαλείων κωδικοποίησης AI που χρειάζονται να καταναλώσουν ολόκληρες βάσεις κώδικα και να παράγουν σημαντικά τμήματα κώδικα σε μια seule συνεδρία.

Όπου το 3.1 Pro δεν προηγείται είναι επίσης ενδιαφέρον. Στο SWE-Bench Verified, ένα τεστ πραγματικών εργασιών προγραμματισμού λογισμικού, σκοράρει 80.6%—λιγότερο από το Anthropic’s Claude Opus 4.6 στο 80.8%. Η διαφορά είναι ελάχιστη, αλλά δείχνει ότι το Anthropic διατηρεί μια στενή προηγουμένη στις πρακτικές εργασίες προγραμματισμού που οδηγούν στην υιοθέτηση επιχειρήσεων.

Τι Αλλάζει Η Δυναμική Σκέψη

Το Gemini 3.1 Pro χρησιμοποιεί δυναμική σκέψη ως προεπιλογή, μια προσέγγιση όπου το μοντέλο điều chỉnhει πόσο εσωτερική λογική εφαρμόζει με βάση τη σύνθετη κάθε ερώτησης. Απλές ερωτήσεις λαμβάνουν γρήγορες απαντήσεις. Σύνθετα προβλήματα πολλαπλών βημάτων ενεργοποιούν βαθύτερες αλυσίδες επεξεργασίας πριν το μοντέλο παράγει την απάντησή του.

Οι dévelopπεurs possono να ελέγχουν αυτή τη συμπεριφορά μέσω eines παραμέτρου thinking_level στο API, ορίζοντας το μέγιστο βάθος της εσωτερικής λογικής. Αυτό αντιμετωπίζει μια ένταση στα μοντέλα λογικής: η επέκταση της σκέψης βελτιώνει την ακρίβεια σε δύσκολα προβλήματα αλλά προσθέτει καθυστέρηση και κόστος για απλές ερωτήσεις. Η δυναμική σκέψη προσπαθεί να αυτοματοποιήσει αυτή τη συμφωνία.

Το Ανταγωνιστικό Πεδίο Στενεύει

Το Gemini 3.1 Pro έρχεται σε μια αγορά όπου η ηγεσία των βENCHMARK αλλάζει χέρια μηνιαίως. Το Gemini 3 της Google προκάλεσε ένα “κώδικας κόκκινος” στο OpenAI που παρήγαγε το GPT-5.2 σε λιγότερο από einen μήνα. Το Anthropic έχει κυκλοφορήσει ενημερώσεις του Claude με επιταχυνόμενο ρυθμό. Κάθε κυκλοφορία στενεύει τη διαφορά μεταξύ των μοντέλων, καθιστώντας την επιλογή μεταξύ πλατφορμών όλο και περισσότερο εξαρτημένη από το οικοσύστημα και τις τιμές παρά από την ακαδημαϊκή ικανότητα.

Το πλεονέκτημα της Google παραμένει η διανομή. Το Gemini 3.1 Pro τοποθετείται απευθείας σε προϊόντα που χρησιμοποιούν εκατοντάδες εκατομμύρια άνθρωποι: Gmail, Docs, Search, και τα Προσωπικά Παράμετρα που συνδέουν το μοντέλο με τα προσωπικά δεδομένα των χρηστών. Το μοντέλο επίσης τροφοδοτεί το Gemini Enterprise και Gemini CLI, δίνοντας στους développeurs και τις επιχειρήσεις πρόσβαση μέσω εργαλείων που ήδη χρησιμοποιούν.

Για τους développeurs που επιλέγουν μεταξύ μοντέλων, η απόφαση τιμής έχει γίνει ευκολότερη. Σε 2 δολάρια ανά εκατομμύριο tokens εισαγωγής, το Gemini 3.1 Pro ξεπερνά cả το OpenAI και το Anthropic σε τιμές για αντίστοιχη ικανότητα. Η δωρεάν ενημέρωση από το 3 Pro αφαιρεί οποιαδήποτε τριβή μετανάστευσης για τους υφιστάμενους χρήστες.

Οι κέρδη λογικής ανάλυσης έχουν τη μεγαλύτερη σημασία για τις εφαρμογές agentic—συστήματα AI που σχεδιάζουν, εκτελούν πολύπλοκες εργασίες και χρησιμοποιούν εργαλεία αυτόνομα. Το ARC-AGI-2 δοκιμάζει ειδικά το είδος αναγνώρισης προτύπων που τα agentic χρειάζονται όταν συναντούν προβλήματα που δεν καλύπτονται από τα δεδομένα εκπαίδευσής τους. Ένα μοντέλο που σκοράρει 77.1% σε αυτό το τεστ χειρίζεται άγνωστες καταστάσεις πολύ πιο αξιόπιστα από ένα που σκοράρει 31.1%.

Εάν αυτά τα κέρδη βENCHMARK μεταφραστούν σε αναλογικές βελτιώσεις στον πραγματικό κόσμο είναι το ερώτημα που η Google θα πρέπει να απαντήσει τις επόμενες εβδομάδες. Τα βENCHMARK καταγράφουν συγκεκριμένες ικανότητες υπό ελεγχόμενες συνθήκες. Η πραγματική εμπειρία του χρήστη εξαρτάται από το πώς το μοντέλο εκτελείται σε μια απρόβλεπτη σειρά εργασιών που οι άνθρωποι του ζητούν. Η αύξηση του ARC-AGI-2 δείχνει ότι το 3.1 Pro χειρίζεται την καινοτομία καλύτερα από οποιοδήποτε μοντέλο πριν. Τι οι χρήστες θα κάνουν με αυτή τη δυνατότητα θα καθορίσει εάν τα νούμερα έχουν σημασία.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.