AI-modeller og plattformer

Gemini 3.1 Pro Setter Ny Rekord for Resonneringsgevinster

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Google (GOOGL ) lanserte Gemini 3.1 Pro den 19. februar, en oppdatering av sitt flaggskip AI-modell som mer enn doblerer resonneringsytelsen samtidig som den holder prisen identisk med forgjengeren.

Det mest slående tallet: på ARC-AGI-2, en benchmark som tester om modellene kan løse helt nye logiske mønster i stedet for å huske treningdata, scorer Gemini 3.1 Pro 77,1%. Gemini 3 Pro scoret 31,1%. Den 46 prosentpoengene hopp er den største enkelt-generasjons resonneringsgevinsten i noen grensemodell-familie.

Modellen er tilgjengelig umiddelbart på Google’s forbruker- og utviklerplattformer. Gemini-appbrukere på AI Pro og AI Ultra-planer får tilgang med høyere bruksgrenser, mens utviklere kan få tilgang til 3.1 Pro gjennom Gemini API i AI Studio, Vertex AI, Gemini CLI, Antigravity og Android Studio. NotebookLM får også oppgraderingen for Pro- og Ultra-abonnenter.

Prisingen holder seg på 2 dollar per million inndata-token for forespørsler under 200 000 token, og stiger til 4 dollar for lengre sammenhenger. Utgangskostnader 12 dollar per million token. For alle som allerede bruker Gemini 3 Pro gjennom API-et, er oppgraderingen gratis.

Benchmark-ytelse Over hele Borden

Modellkortet viser at Gemini 3.1 Pro hevder førsteplassen på 12 av 18 sporet benchmark. Foruten ARC-AGI-2 inkluderer høydepunktene 94,3% på GPQA Diamond, en vitenskapelig resonneringstest på universitetsnivå, og 2 887 Elo på LiveCodeBench Pro, den høyeste scoren blant alle grensemodeller for konkurransedyktig programmering.

På Humanity’s Last Exam – en benchmark tegnet fra crowdsourced ekspertspørsmål fra akademiske disipliner – når 3.1 Pro 44,4%, opp fra 37,5% for Gemini 3 Pro og foran GPT-5.2s 34,5%. Den flerspråklige MMLU-benchmarken viser 92,6%, og lang-sammenhengs-nøyaktighet på 128 000 token holder seg på 84,9%.

Modellen beholder et 1 million token inndata-kontekstvindu og genererer opp til 64 000 utgangstoken, noe som matcher spesifikasjonene til AI-kodegenereringsverktøy som må inngi hele kodebasen og produsere betydelige kodeblokker i en enkelt sesjon.

Hvor 3.1 Pro ikke leder, er også avslørende. På SWE-Bench Verified, en test av virkelige programvareutviklingsoppgaver, scorer den 80,6% – bare bak Anthropics Claude Opus 4.6 på 80,8%. Gapet er marginalt, men det viser at Anthropic beholder en smal forkjøpsret i de praktiske kodeoppgavene som driver bedriftsadoptsjon.

Hva Dynamisk Tenkning Endrer

Gemini 3.1 Pro bruker dynamisk tenkning som standard, en tilnærming der modellen justerer hvor mye intern resonnering den anvender basert på kompleksiteten til hver forespørsel. Enkle spørsmål får raskere svar. Komplekse flertrinnsproblemer utløser dypere prosesseringskjeder før modellen genererer svaret sitt.

Utviklere kan kontrollere dette ved å bruke en tenkings_nivå-parameter i API-et, og sette den maksimale dybden på intern resonnering. Dette løser en spenning i resonneringsmodeller: Utvidet tenkning forbedrer nøyaktigheten på vanskelige problemer, men legger til latency og kostnader for rett frem forespørsler. Dynamisk tenkning prøver å automatisere denne avveiingen.

Funksjonen reflekterer en bredere industriell skift. OpenAIs o-serie-modeller innførte kjede-av-tenkning som en valgbar modus. Anthropics Claude bruker utvidet tenkning som en valgfri funksjon. Googles tilnærming med å gjøre det til standard – med variabel intensitet – vedder på at de fleste brukerne heller vil la modellen bestemme hvordan hardt den skal tenke enn å håndtere den beslutningen selv.

Konkurransesfeltet Trekker Seg Sammen

Gemini 3.1 Pro ankommer en marked hvor benchmark-lederskap skifter hånd om måneden. Googles Gemini 3 utløste en “kode-rød” hos OpenAI som produserte GPT-5.2 på under en måned. Anthropic har vært i ferd med å levere Claude-oppdateringer i en økende takt. Hver utgivelse smalner gapet mellom modellene, og gjør valget mellom plattformene mer og mer avhengig av økosystem og prising enn rå kapasitet.

Googles fordel ligger i distribusjon. Gemini 3.1 Pro passer rett inn i produkter som brukes av hundredvis av millioner mennesker: Gmail, Docs, Søk og Personlig Intelligens-funksjonene som kobler modellen til brukernes personlige data. Modellen driver også Gemini Enterprise og Gemini CLI, og gir utviklere og bedrifter tilgang gjennom verktøy de allerede bruker.

For utviklere som velger mellom grensemodeller, har priseringsbeslutningen blitt enklere. Til 2 dollar per million inndata-token, underkutter Gemini 3.1 Pro både OpenAIs og Anthropics flaggskip-priser for sammenlignbar kapasitet. Den kostnadsfrie oppgraderingen fra 3 Pro fjerner alle migreringsproblemer for eksisterende brukere.

Resonneringsgevinstene betyr mest for agente applikasjoner – AI-systemer som planlegger, utfører flertrinnsoppgaver og bruker verktøy selvstendig. ARC-AGI-2 tester spesifikt den type ny mønsterkjennelse som agenter trenger når de møter problemer deres treningdata ikke dekket. En modell som scorer 77,1% på den testen håndterer ukjente situasjoner mye mer pålitelig enn en som scorer 31,1%.

Om disse benchmark-gevinstene oversettes til proporsjonale virkelige forbedringer, er det spørsmålet Google må svare på over de kommende ukene. Benchmark kaprer bestemte kapasiteter under kontrollerte forhold; den faktiske brukeropplevelsen avhenger av hvordan modellen ytter seg over det uforutsigbare spekteret av oppgaver mennesker kaster på den. ARC-AGI-2-hoppet antyder at 3.1 Pro håndterer nyskapning bedre enn noen modell før. Hva brukerne gjør med den kapasiteten, vil bestemme om tallene betyr noe.

Alex leder Unite.AI sine AI-drevne nyhetsoperasjoner, og kombinerer journalistikk, forskning og automatisering for å støtte rettidig og skalerbar dekning av kunstig intelligens. Arbeidet hans bidrar til å sikre at nye AI-utviklinger blir fremhevet effektivt samtidig som publikasjonens redaksjonelle standarder opprettholdes.