Modele și platforme AI

Gemini 3.1 Pro obține recorduri de performanță în raționament

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Google (GOOGL ) a lansat Gemini 3.1 Pro pe 19 februarie, o actualizare a modelului său de inteligență artificială care dublează performanța de raționament, menținând în același timp prețurile identice cu cele ale predecesorului său.

Cel mai izbitor număr: pe ARC-AGI-2, un benchmark care testează dacă modelele pot rezolva modele logice complet noi, și nu doar să-și amintească datele de antrenament, Gemini 3.1 Pro obține 77,1%. Gemini 3 Pro a obținut 31,1%. Acest salt de 46 de puncte procentuale reprezintă cea mai mare creștere a performanței de raționament dintr-o singură generație de modele de frontieră.

Modelul este disponibil imediat pe toate platformele de consumatori și dezvoltatori ale Google. Utilizatorii aplicației Gemini care au planurile AI Pro și AI Ultra au acces la el, cu limite de utilizare mai mari, în timp ce dezvoltatorii pot accesa 3.1 Pro prin intermediul API-ului Gemini în AI Studio, Vertex AI, Gemini CLI, Antigravity și Android Studio. NotebookLM primește, de asemenea, actualizarea pentru abonații Pro și Ultra.

Prețurile rămân la 2 dolari pe milion de tokeni de intrare pentru prompturi sub 200.000 de tokeni, crescând la 4 dolari pentru contexte mai lungi. Costul de ieșire este de 12 dolari pe milion de tokeni. Pentru cei care utilizează deja Gemini 3 Pro prin API, actualizarea este gratuită.

Performanță de benchmark pe tot parcursul

Cardul modelului arată că Gemini 3.1 Pro ocupă locul I pe 12 din cele 18 benchmark-uri urmărite. Dincolo de ARC-AGI-2, exemplele notabile includ 94,3% pe GPQA Diamond, un test de raționament științific de nivel universitar, și 2.887 Elo pe LiveCodeBench Pro, cel mai mare punctaj dintre toate modelele de frontieră pentru programare competitivă.

La Humanity’s Last Exam – un benchmark creat din întrebări experte crowdsourcate din diverse discipline academice – 3.1 Pro ajunge la 44,4%, în creștere de la 37,5% pentru Gemini 3 Pro și mai mare decât 34,5% pentru GPT-5.2. Benchmark-ul multilingv MMLU arată 92,6%, iar acuratețea contextului lung la 128.000 de tokeni rămâne la 84,9%.

Modelul păstrează o fereastră de context de intrare de 1 milion de tokeni și generează până la 64.000 de tokeni de ieșire, ceea ce corespunde specificațiilor uneltelor de codare AI care trebuie să ingereze întregi baze de cod și să producă blocuri de cod substanțiale într-o singură sesiune.

Unde 3.1 Pro nu conduce este, de asemenea, relevant. Pe SWE-Bench Verified, un test de sarcini de inginerie software din lumea reală, obține 80,6% – doar în spatele lui Anthropic’s Claude Opus 4.6, care are 80,8%. Diferența este marginală, dar arată că Anthropic păstrează o margine îngustă în sarcinile practice de codare care determină adoptarea la nivel de întreprindere.

Ce schimbă gândirea dinamică

Gemini 3.1 Pro utilizează gândirea dinamică în mod implicit, o abordare în care modelul ajustează cantitatea de raționament intern pe care o aplică în funcție de complexitatea fiecărui prompt. Întrebările simple primesc răspunsuri rapide. Problemele complexe multi-pași declanșează lanțuri de procesare mai profunde înainte ca modelul să genereze răspunsul său.

Dezvoltatorii pot controla acest comportament prin intermediul unui parametru thinking_level în API, setând adâncimea maximă a raționamentului intern. Acest lucru abordează o tensiune în modelele de raționament: gândirea prelungită îmbunătățește acuratețea pe probleme grele, dar adaugă latență și cost pentru întrebări directe. Gândirea dinamică încearcă să automatizeze acest compromis.

Caracteristica reflectă o schimbare mai largă în industrie. Modelele o-series de la OpenAI au introdus raționamentul în lanț de gândire ca mod selectabil. Anthropic’s Claude utilizează gândirea prelungită ca o caracteristică opțională. Abordarea Google de a o face implicită – cu intensitate variabilă – pariază că majoritatea utilizatorilor ar prefera să lase modelul să decidă cât de greu să gândească, în loc să ia acea decizie singuri.

Competiția se strânge

Gemini 3.1 Pro sosește pe o piață în care conducerea benchmark-urilor se schimbă lunar. Gemini 3 al Google a declanșat un “cod roșu” la OpenAI care a produs GPT-5.2 în mai puțin de o lună. Anthropic a lansat actualizări ale lui Claude la un ritm accelerat. Fiecare lansare reduce diferența dintre modele, făcând alegerea dintre platforme din ce în ce mai dependentă de ecosistem și preț, mai degrabă decât de capacitatea brută.

Avantajul Google rămâne distribuția. Gemini 3.1 Pro se integrează direct în produse utilizate de sute de milioane de oameni: Gmail, Docs, Search și Caracteristicile de inteligență personală care conectează modelul la datele personale ale utilizatorilor. Modelul alimentează, de asemenea, Gemini Enterprise și Gemini CLI, oferind dezvoltatorilor și întreprinderilor acces prin intermediul uneltelor pe care le utilizează deja.

Pentru dezvoltatorii care aleg între modelele de frontieră, decizia de preț a devenit mai ușoară. La 2 dolari pe milion de tokeni de intrare, Gemini 3.1 Pro este sub prețul de top al OpenAI și Anthropic pentru o capacitate similară. Actualizarea gratuită de la 3 Pro elimină orice fricțiune de migrare pentru utilizatorii existenți.

Creșterile de raționament contează cel mai mult pentru aplicațiile agenților – sistemele AI care planifică, execută sarcini multi-pași și utilizează unelte în mod autonom. ARC-AGI-2 testează în special tipul de recunoaștere a pattern-urilor noi pe care agenții au nevoie atunci când se confruntă cu probleme pe care datele de antrenament nu le-au acoperit. Un model care obține 77,1% la acest test gestionează situații nefamiliare mult mai fiabil decât unul care obține 31,1%.

Întrebarea dacă aceste creșteri ale benchmark-urilor se traduc în îmbunătățiri reale din lumea reală este cea la care Google va trebui să răspundă în următoarele săptămâni. Benchmark-urile capturează capacități specifice în condiții controlate; experiența reală a utilizatorilor depinde de modul în care modelul performează pe o gamă imprevizibilă de sarcini pe care oamenii le aruncă în el. Saltul ARC-AGI-2 sugerează că 3.1 Pro gestionează mai bine noutatea decât orice model dinainte. Ce vor face utilizatorii cu această capacitate va determina dacă numerele contează.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.