AI-modeller och plattformar
Gemini 3.1 Pro Sätter Rekord i Resonemangsförmåga
Google (GOOGL ) släppte Gemini 3.1 Pro den 19 februari, en uppdatering av deras flaggskeppmodell för artificiell intelligens som mer än dubblar resonemangsförmågan samtidigt som prissättningen förblir densamma som föregångaren.
Det mest slående numret: på ARC-AGI-2, en benchmark som testar om modeller kan lösa helt nya logiska mönster snarare än att komma ihåg träningsdata, får Gemini 3.1 Pro 77,1 %. Gemini 3 Pro fick 31,1 %. Den 46 procentenheters ökning är den största enskilda generationens resonemangsförbättring i någon modellfamilj.
Modellen är tillgänglig omedelbart på Googles konsument- och utvecklarplattformar. Användare av Gemini-appen på AI Pro- och AI Ultra-planer får tillgång med högre användningsgränser, medan utvecklare kan komma åt 3.1 Pro via Gemini API i AI Studio, Vertex AI, Gemini CLI, Antigravity och Android Studio. NotebookLM får också uppgraderingen för Pro- och Ultra-prenumeranter.
Prissättningen ligger kvar på 2 dollar per miljon indata-token för prompter under 200 000 token, och stiger till 4 dollar för längre sammanhang. Utdata kostar 12 dollar per miljon token. För de som redan använder Gemini 3 Pro via API är uppgraderingen gratis.
Benchmarkprestationer Över Hela Linjen
Modellkortet visar att Gemini 3.1 Pro tar första plats på 12 av 18 spårade benchmarkar. Utöver ARC-AGI-2 inkluderar utmärkelserna 94,3 % på GPQA Diamond, ett vetenskapligt resonemangstest på universitetsnivå, och 2 887 Elo på LiveCodeBench Pro, den högsta poängen bland alla modeller för konkurrenskraftig programmering.
På Humanity’s Last Exam – en benchmark hämtad från crowdsourcade expertfrågor från olika akademiska discipliner – når 3.1 Pro 44,4 %, upp från 37,5 % för Gemini 3 Pro och före GPT-5.2:s 34,5 %. Den multilingvala MMLU-benchmarken visar 92,6 %, och långsamtighetsnoggrannhet vid 128 000 token ligger kvar på 84,9 %.
Modellen behåller ett indatakontextfönster på 1 miljon token och genererar upp till 64 000 utdatatoken, vilket matchar specifikationerna för AI-kodgenereringsverktyg som måste mata in hela kodbasen och producera betydande kodblock i en enda session.
Där 3.1 Pro inte leder är också avslöjande. På SWE-Bench Verified, ett test av verkliga mjukvaruutvecklingsuppgifter, får den 80,6 % – bara strax efter Anthropics Claude Opus 4.6 på 80,8 %. Gapet är marginellt, men det visar att Anthropic fortfarande har en smal fördel när det gäller praktiska kodningsuppgifter som driver företagsadoption.
Vad Dynamiskt Tänkande Förändrar
Gemini 3.1 Pro använder dynamiskt tänkande som standard, ett tillvägagångssätt där modellen justerar hur mycket intern resonemang den tillämpar beroende på komplexiteten i varje prompt. Enkla frågor får snabba svar. Komplexa flerstegsproblem utlöser djupare bearbetningskedjor innan modellen genererar sitt svar.
Utvecklare kan styra detta beteende via en thinking_level-parameter i API:et, som anger den maximala djupet av intern resonemang. Detta hanterar en spänning i resonemangsmodeller: förlängt tänkande förbättrar noggrannheten på svåra problem, men lägger till latency och kostnad för enkla frågor. Dynamiskt tänkande försöker automatisera den avvägningen.
Funktionen speglar en bredare industriell förändring. OpenAIs o-seriemodeller introducerade kedjetänkande som ett valbart läge. Anthropics Claude använder förlängt tänkande som ett valfritt funktion. Googles tillvägagångssätt att göra det till standard – med variabel intensitet – satsar på att de flesta användare hellre låter modellen bestämma hur hårt den ska tänka än att hantera det beslutet själva.
Tävlingen Blir Allt Hårdare
Gemini 3.1 Pro anländer till en marknad där benchmarkledarskapet byter händer månadsvis. Googles Gemini 3 utlöste en “kodröd” hos OpenAI som producerade GPT-5.2 på mindre än en månad. Anthropic har varit i färd med att skicka ut uppdateringar av Claude i en accelererande takt. Varje utgåva minskar gapet mellan modellerna, vilket gör valet mellan plattformar alltmer beroende av ekosystem och prissättning snarare än ren kapacitet.
Googles fördel ligger kvar i distributionen. Gemini 3.1 Pro passar direkt in i produkter som används av hundratals miljoner människor: Gmail, Dokument, Sök och Personlig Intelligens-funktioner som kopplar modellen till användarnas personliga data. Modellen driver också Gemini Enterprise och Gemini CLI, vilket ger utvecklare och företag tillgång via verktyg de redan använder.
För utvecklare som väljer mellan frontmodeller har prissättningsbeslutet blivit enklare. Till 2 dollar per miljon indata-token underprissätter Gemini 3.1 Pro både OpenAIs och Anthropics flaggskeppsprissättning för motsvarande kapacitet. Uppgraderingen från 3 Pro utan extra kostnad tar bort all migrationsfriktion för befintliga användare.
Resonemangsförbättringarna betyder mest för agenter – AI-system som planerar, utför flerstegsåtgärder och använder verktyg på egen hand. ARC-AGI-2 testar specifikt den typ av ny mönsterigenkänning som agenter behöver när de möter problem som deras träningsdata inte täckte. En modell som får 77,1 % på den testen hanterar okända situationer mycket mer tillförlitligt än en som får 31,1 %.
Om dessa benchmarkförbättringar översätts till proportionella förbättringar i den verkliga världen är den fråga som Google måste besvara under de kommande veckorna. Benchmarkar fångar specifika förmågor under kontrollerade förhållanden; den faktiska användarupplevelsen beror på hur modellen presterar över den oförutsägbara mängden uppgifter som människor kastar på den. ARC-AGI-2-hoppet tyder på att 3.1 Pro hanterar nyhet bättre än någon modell tidigare. Vad användare gör med den förmågan kommer att avgöra om siffrorna betyder något.










