Modele i platformy AI

Gemini 3.1 Pro osiąga rekordowe zyski w rozumowaniu

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma Google (GOOGL ) wydała Gemini 3.1 Pro w dniu 19 lutego, aktualizację swojego flagowego modelu AI, który ponad podwaja wydajność rozumowania, przy zachowaniu tej samej ceny co jego poprzednik.

Najbardziej uderzająca liczba to wynik na teście ARC-AGI-2, który sprawdza, czy modele mogą rozwiązać całkowicie nowe wzorce logiczne, zamiast przywoływać dane treningowe. Gemini 3.1 Pro uzyskał wynik 77,1%. Gemini 3 Pro uzyskał wynik 31,1%. Ten skok o 46 punktów procentowych jest największym jednorazowym zyskiem w rozumowaniu w jakiejkolwiek rodzinie modeli.

Model jest dostępny natychmiast na wszystkich platformach konsumenckich i developerskich Google. Użytkownicy aplikacji Gemini z planami AI Pro i AI Ultra mają dostęp do niego z wyższymi limitami użycia, a deweloperzy mogą uzyskać dostęp do 3.1 Pro za pośrednictwem interfejsu API Gemini w AI Studio, Vertex AI, Gemini CLI, Antigravity i Android Studio. NotebookLM również otrzymuje aktualizację dla subskrybentów Pro i Ultra.

Cena pozostaje na poziomie 2 dolarów za milion tokenów wejściowych dla poleceń krótszych niż 200 000 tokenów, zwiększając się do 4 dolarów dla dłuższych kontekstów. Koszt wyjściowy wynosi 12 dolarów za milion tokenów. Dla wszystkich, którzy już używali Gemini 3 Pro za pośrednictwem interfejsu API, aktualizacja jest bezpłatna.

Wydajność benchmarkowa we wszystkich obszarach

Karta modelu pokazuje, że Gemini 3.1 Pro zajmuje pierwsze miejsce w 12 z 18 śledzonych benchmarków. Poza ARC-AGI-2 wyróżniają się 94,3% w teście GPQA Diamond, teście rozumowania naukowego na poziomie studiów wyższych, oraz 2 887 Elo w LiveCodeBench Pro, najwyższy wynik we wszystkich modelach frontierowych dla programowania konkursowego.

W teście Humanity’s Last Exam, który jest benchmarkiem opracowanym z pytań ekspertów z różnych dziedzin akademickich, 3.1 Pro osiąga wynik 44,4%, w porównaniu z 37,5% dla Gemini 3 Pro i 34,5% dla GPT-5.2. W teście multilingual MMLU wynik wynosi 92,6%, a dokładność długiego kontekstu przy 128 000 tokenach wynosi 84,9%.

Model zachowuje okno kontekstu wejściowego o rozmiarze 1 miliona tokenów i generuje do 64 000 tokenów wyjściowych, co odpowiada specyfikacjom narzędzi do generowania kodu AI, które muszą przyjmować całe bazy kodu i wytwarzać znaczne bloki kodu w jednej sesji.

Miejsca, w których 3.1 Pro nie prowadzi, są również wymowne. W teście SWE-Bench Verified, który sprawdza zadania inżynierii oprogramowania w świecie rzeczywistym, osiąga wynik 80,6%, tuż za modelem Anthropic Claude Opus 4.6, który uzyskał wynik 80,8%. Przewaga jest niewielka, ale pokazuje, że Anthropic zachowuje wąską przewagę w zadaniach kodowania, które napędzają przyjęcie w przedsiębiorstwach.

Czy dynamiczne myślenie zmienia

Gemini 3.1 Pro używa dynamicznego myślenia jako domyślnego podejścia, gdzie model dostosowuje ilość wewnętrznego rozumowania w zależności od złożoności każdego polecenia. Proste pytania otrzymują szybkie odpowiedzi. Złożone, wieloetapowe problemy wyzwalają głębsze łańcuchy przetwarzania przed wygenerowaniem odpowiedzi przez model.

Deweloperzy mogą kontrolować to zachowanie za pomocą parametru thinking_level w interfejsie API, ustawiając maksymalną głębokość wewnętrznego rozumowania. To rozwiązuje napięcie w modelach rozumowania: przedłużone rozumowanie poprawia dokładność w trudnych problemach, ale dodaje opóźnienia i koszty dla prostych zapytań. Dynamiczne myślenie próbuje zautomatyzować ten kompromis.

Ta funkcja odzwierciedla szerszy trend w branży. Modele o-series OpenAI wprowadziły łańcuch myśli jako wybieralny tryb. Model Anthropic Claude używa rozszerzonego myślenia jako funkcji optycznej. Podejście Google, które czyni je domyślnym — z zmienną intensywnością — zakłada, że większość użytkowników woli pozostawić modelowi decyzję, jak bardzo myśleć, zamiast samodzielnie zarządzać tą decyzją.

Rynek staje się coraz bardziej konkurencyjny

Gemini 3.1 Pro pojawia się na rynku, gdzie przewodnictwo w benchmarkach zmienia się co miesiąc. Gemini 3 wywołał “czerwony alarm” w OpenAI, który wyprodukował GPT-5.2 w ciągu moins niż miesiąca. Anthropic wydaje aktualizacje Claude w przyspieszonym tempie. Każde wydanie zmniejsza lukę między modelami, sprawiając, że wybór między platformami coraz bardziej zależy od ekosystemu i ceny, a nie surowej zdolności.

Przewaga Google pozostaje dystrybucja. Gemini 3.1 Pro jest bezpośrednio wbudowany w produkty używane przez setki milionów ludzi: Gmail, Docs, Search i funkcje Personal Intelligence, które łączą model z danymi osobowymi użytkowników. Model napędza również Gemini Enterprise i Gemini CLI, dając deweloperom i firmom dostęp za pośrednictwem narzędzi, których już używają.

Dla deweloperów wybierających między modelami frontierowymi decyzja dotycząca ceny stała się łatwiejsza. Za 2 dolary za milion tokenów wejściowych Gemini 3.1 Pro jest tańszy niż flagowe ceny OpenAI i Anthropic za porównywalną zdolność. Bezpłatna aktualizacja z 3 Pro usuwa wszelkie tarcie migracyjne dla istniejących użytkowników.

Zyski w rozumowaniu mają największe znaczenie dla aplikacji agentywnych — systemów AI, które planują, wykonują wieloetapowe zadania i używają narzędzi w sposób autonomiczny. ARC-AGI-2 testuje specyficznie rodzaj rozpoznawania wzorców, który agenci potrzebują, gdy napotykają problemy, których ich dane treningowe nie obejmowały. Model, który uzyskuje wynik 77,1% w tym teście, radzi sobie znacznie bardziej niezawodnie z nieznanymi sytuacjami niż model, który uzyskuje wynik 31,1%.

Czy te zyski w benchmarkach przekładają się na proporcjonalne poprawy w świecie rzeczywistym, to pytanie, które Google będzie musiało odpowiedzieć w nadchodzących tygodniach. Benchmarki ujmują określone zdolności w kontrolowanych warunkach; rzeczywiste doświadczenie użytkownika zależy od tego, jak model wykonuje się w nieprzewidywalnym zakresie zadań, które ludzie mu przedstawiają. Skok w ARC-AGI-2 sugeruje, że 3.1 Pro radzi sobie lepiej z nowościami niż jakikolwiek model wcześniej. To, jak użytkownicy wykorzystają tę zdolność, zadecyduje o tym, czy liczby mają znaczenie.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.