AI-modellen en platforms

Gemini 3.1 Pro behaalt recordbrekende redenatieverbeteringen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google (GOOGL ) heeft Gemini 3.1 Pro uitgebracht op 19 februari, een update van zijn vlaggenschip-AI-model dat de redenatieprestaties meer dan verdubbelt zonder dat de prijzen van zijn voorganger veranderen.

Het meest opvallende cijfer: op ARC-AGI-2, een benchmark die test of modellen ongekende logische patronen kunnen oplossen in plaats van trainingsgegevens te herinneren, scoort Gemini 3.1 Pro 77,1%. Gemini 3 Pro scoorde 31,1%. Die 46 procentpuntstijging is de grootste enkelgeneratie-redeenatieverbetering in een enkele frontiermodel-familie.

Het model is meteen beschikbaar op Google’s consumenten- en ontwikkelaarsplatforms. Gebruikers van de Gemini-app op AI Pro- en AI Ultra-plannen krijgen toegang met hogere gebruiksbeperkingen, terwijl ontwikkelaars toegang kunnen krijgen tot 3.1 Pro via de Gemini API in AI Studio, Vertex AI, Gemini CLI, Antigravity en Android Studio. NotebookLM krijgt ook de upgrade voor Pro- en Ultra-abonnees.

De prijzen blijven hetzelfde: $2 per miljoen invoertokens voor prompts onder de 200.000 tokens, en $4 voor langere contexten. De uitvoerkosten bedragen $12 per miljoen tokens. Voor iedereen die al Gemini 3 Pro gebruikt via de API, is de upgrade gratis.

Benchmarkprestaties over het hele bord

De modelkaart toont aan dat Gemini 3.1 Pro de eerste plaats inneemt op 12 van de 18 gevolgde benchmarks. Naast ARC-AGI-2 zijn de opvallende resultaten 94,3% op GPQA Diamond, een wetenschappelijke redenatietest op universitair niveau, en 2.887 Elo op LiveCodeBench Pro, de hoogste score onder alle frontiermodellen voor competitief programmeren.

Op Humanity’s Last Exam—a benchmark gebaseerd op crowdsourced expertvragen uit verschillende academische disciplines—bereikt 3.1 Pro 44,4%, een stijging ten opzichte van 37,5% voor Gemini 3 Pro en voor GPT-5.2 met 34,5%. De multilinguale MMLU-benchmark toont 92,6%, en de nauwkeurigheid bij lange contexten van 128.000 tokens blijft 84,9%.

Het model behoudt een invoercontextvenster van 1 miljoen tokens en genereert maximaal 64.000 uitvoertokens, wat overeenkomt met de specificaties van AI-codegeneratoren die hele codebases moeten kunnen verwerken en grote codeblokken in één sessie moeten kunnen produceren.

Waar 3.1 Pro niet leidt, is ook veelzeggend. Op SWE-Bench Verified, een test van real-world software-engineeringtaken, scoort het 80,6%—net achter Anthropic’s Claude Opus 4.6 met 80,8%. De kloof is marginaal, maar het toont aan dat Anthropic een kleine voorsprong behoudt in de praktische codetaak die de adoptie van ondernemingen aandrijft.

Wat dynamisch denken verandert

Gemini 3.1 Pro gebruikt dynamisch denken als standaard, een benadering waarbij het model aanpast hoeveel interne redenatie het toepast op basis van de complexiteit van elke prompt. Simpele vragen krijgen snelle antwoorden. Complexe, meerdere stappen omvattende problemen activeren diepere verwerkingketens voordat het model zijn antwoord genereert.

Ontwikkelaars kunnen dit gedrag controleren via een thinking_level-parameter in de API, waarbij ze de maximale diepte van interne redenatie instellen. Dit lost een spanning op in redenatiemodellen: uitgebreid denken verbetert de nauwkeurigheid bij moeilijke problemen, maar voegt latentie en kosten toe voor eenvoudige vragen. Dynamisch denken probeert deze afweging te automatiseren.

Deze functie weerspiegelt een bredere industriebeweging. OpenAI’s o-series-modellen introduceerden chain-of-thought-redeenatie als een selecteerbare modus. Anthropic’s Claude gebruikt uitgebreid denken als een opt-in-functie. Google’s benadering om het standaard te maken—met variabele intensiteit—wedt dat de meeste gebruikers liever het model laten beslissen hoe hard het moet denken dan dat ze die beslissing zelf nemen.

Het concurrerende veld wordt smaller

Gemini 3.1 Pro arriveert in een markt waarin de leiderschap van benchmarks maandelijks van handen wisselt. Google’s Gemini 3 heeft een “code red” bij OpenAI getriggerd, wat GPT-5.2 in minder dan een maand opleverde. Anthropic heeft Claude-updates op een versnellend tempo uitgebracht. Elke release verkleint de kloof tussen modellen, waardoor de keuze tussen platforms steeds meer afhankelijk wordt van ecosysteem en prijs in plaats van ruwe capaciteit.

Google’s voordeel blijft distributie. Gemini 3.1 Pro past direct in producten die door honderden miljoenen mensen worden gebruikt: Gmail, Docs, Search en de Personal Intelligence-functies die het model verbinden met de persoonlijke gegevens van gebruikers. Het model drijft ook Gemini Enterprise en Gemini CLI aan, waardoor ontwikkelaars en bedrijven toegang krijgen via tools die ze al gebruiken.

Voor ontwikkelaars die kiezen tussen frontiermodellen, is de prijsbeslissing gemakkelijker geworden. Bij $2 per miljoen invoertokens onderbiedt Gemini 3.1 Pro zowel OpenAI als Anthropic’s vlaggenschip-prijzen voor vergelijkbare capaciteit. De gratis upgrade van 3 Pro verwijdert elke migratiefrictie voor bestaande gebruikers.

De redenatieverbeteringen zijn het belangrijkst voor agente-toepassingen—AI-systemen die plannen, meerdere stappen uitvoeren en tools autonoom gebruiken. ARC-AGI-2 test specifiek het soort ongekende patroonherkenning dat agenten nodig hebben wanneer ze problemen tegenkomen die hun trainingsgegevens niet hebben gedekt. Een model dat 77,1% scoort op die test, houdt onbekende situaties veel betrouwbaarder dan een model dat 31,1% scoort.

Of deze benchmarkverbeteringen zich vertalen in evenredige verbeteringen in de praktijk, is de vraag die Google in de komende weken moet beantwoorden. Benchmarks vangen specifieke capaciteiten onder gecontroleerde omstandigheden; de daadwerkelijke gebruikerservaring hangt af van hoe het model presteert over het onvoorspelbare bereik van taken die mensen eraan geven. De ARC-AGI-2-sprong suggereert dat 3.1 Pro beter omgaat met noviteit dan enig ander model tot nu toe. Wat gebruikers met die capaciteit doen, zal bepalen of de cijfers ertoe doen.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.