AI-modeller og platforme
Gemini 3.1 Pro sætter rekord i forbedret tænkning
Google (GOOGL ) har udgivet Gemini 3.1 Pro den 19. februar, en opdatering til deres flagskibs AI-model, der mere end fordobler tænkningens præstation, samtidig med at prisen holdes identisk med forgængeren.
Det mest slående tal: på ARC-AGI-2, en benchmark, der tester, om modeller kan løse helt nye logiske mønstre i stedet for at huske træningsdata, scorer Gemini 3.1 Pro 77,1%. Gemini 3 Pro scorede 31,1%. Den 46 procentpoints jump er den største enkelt-generations tænkningsskridt i nogen frontier-model-familie.
Modellen er tilgængelig med det samme på tværs af Googles forbruger- og udviklerplatforme. Brugere af Gemini-appen på AI Pro- og AI Ultra-planer får adgang med højere brugsgrænser, mens udviklere kan få adgang til 3.1 Pro gennem Gemini-API’en i AI Studio, Vertex AI, Gemini CLI, Antigravity og Android Studio. NotebookLM får også opgraderingen til Pro- og Ultra-abonnenter.
Priserne holdes på 2 $ per million input-tegn for prompts under 200.000 tegn, stigende til 4 $ for længere sammenhænge. Udgående omkostninger 12 $ per million tegn. For alle, der allerede bruger Gemini 3 Pro gennem API’en, er opgraderingen gratis.
Benchmark-præstationer på tværs af brættet
Modelkortet viser, at Gemini 3.1 Pro kræver førstepladsen på 12 af 18 sporedde benchmarks. Ud over ARC-AGI-2 omfatter højdepunkterne 94,3% på GPQA Diamond, en videregået videnskabsrådgivningstest, og 2.887 Elo på LiveCodeBench Pro, den højeste score på tværs af alle frontier-modeller for konkurrenceprogrammering.
På Humanity’s Last Exam – en benchmark, der er draget fra crowdsourced ekspertspørgsmål på tværs af akademiske discipliner – når 3.1 Pro 44,4%, op fra 37,5% for Gemini 3 Pro og foran GPT-5.2’s 34,5%. Den multilinguale MMLU-benchmark viser 92,6%, og lang-kontekst-nøjagtighed på 128.000 tegn holder på 84,9%.
Modellen beholder en 1 million tegn input-kontekstvindue og genererer op til 64.000 output-tegn, svarende til specifikationerne for AI-kodningsværktøjer, der skal indtage hele kodebaser og producere betydelige kodeblokke i en enkelt session.
Hvor 3.1 Pro ikke fører, er også betydningsfuldt. På SWE-Bench Verified, en test af virkelige software-ingeniørtasks, scorer den 80,6% – lige bag Anthropics Claude Opus 4.6 på 80,8%. Gapet er marginalt, men det viser, at Anthropic stadig har en smal fordel i de praktiske kodningstasks, der driver virksomhedsadoption.
Hvad dynamisk tænkning ændrer
Gemini 3.1 Pro bruger dynamisk tænkning som standard, en tilgang, hvor modellen justerer, hvor meget internt tænkning den anvender, afhængigt af kompleksiteten af hver prompt. Simple spørgsmål får hurtige svar. Komplekse multi-trins-problemer udløser dybere behandlingskæder, før modellen genererer sit svar.
Udviklere kan kontrollere dette adfærd gennem en tænke_niveau-parameter i API’en, hvor de kan indstille den maksimale dybde af internt tænkning. Dette adresserer en spænding i tænkningmodeller: forlænget tænkning forbedrer nøjagtigheden på svære problemer, men tilføjer latency og omkostninger for straightforward-spørgsmål. Dynamisk tænkning forsøger at automatisere denne afvejning.
Funktionen afspejler en bredere industriel skift. OpenAI’s o-serie-modeller introducerede chain-of-thought-tænkning som en valgfri tilstand. Anthropics Claude bruger forlænget tænkning som en valgfri funktion. Googles tilgang til at gøre det til standard – med variabel intensitet – vædder på, at de fleste brugere hellere vil lade modellen afgøre, hvor hårdt den skal tænke, end selv at styre denne beslutning.
Konkurrencen på markedet bliver smallere
Gemini 3.1 Pro ankommer på et marked, hvor benchmark-lederskab skifter hænder månedligt. Googles Gemini 3 udløste en “kode-rød” hos OpenAI, der producerede GPT-5.2 på under en måned. Anthropic har været ved at udgive Claude-opdateringer i en accelererende takt. Hver udgivelse indsnævrer gapet mellem modellerne, hvilket gør valget mellem platforme mere og mere afhængigt af økosystem og priser snarere end rå kapacitet.
Googles fordel er distribution. Gemini 3.1 Pro passer direkte ind i produkter, der bruges af hundredvis af millioner af mennesker: Gmail, Docs, Search og Personlig Intelligens-funktionerne, der forbinder modellen til brugernes personlige data. Modellen driver også Gemini Enterprise og Gemini CLI, hvilket giver udviklere og virksomheder adgang gennem værktøjer, de allerede bruger.
For udviklere, der vælger mellem frontier-modeller, er priserne blevet lettere. Til 2 $ per million input-tegn underkutter Gemini 3.1 Pro både OpenAI’s og Anthropics flagskibspriser for sammenlignelig kapacitet. Den gratis opgradering fra 3 Pro fjerner enhver migrationsfriktion for eksisterende brugere.
Tænkningsskridtene betyder mest for agente anvendelser – AI-systemer, der planlægger, udfører multi-trins-opgaver og bruger værktøjer autonomt. ARC-AGI-2 tester specifikt den type ny mønster-genkendelse, som agenterne har brug for, når de møder problemer, deres træningsdata ikke dækkede. En model, der scorer 77,1% på den test, håndterer ukendte situationer langt mere pålideligt end en model, der scorer 31,1%.
Om disse benchmark-forbedringer oversætter til proportionale virkelige forbedringer, er det spørgsmål, Google skal besvare i de kommende uger. Benchmark-kapaciteter fanger bestemte evner under kontrollerede forhold; den faktiske brugeroplevelse afhænger af, hvordan modellen præsterer på tværs af det uforudsigelige udvalg af opgaver, mennesker kaster på den. ARC-AGI-2-springet antyder, at 3.1 Pro håndterer nyt bedre end nogen model før. Hvad brugerne gør med den kapacitet, vil bestemme, om tallene betyder noget.










