Modely a platformy AI

Gemini 3.1 Pro dosahuje rekordních zisků v oblasti uvažování

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Společnost Google (GOOGL ) vydala Gemini 3.1 Pro dne 19. února, aktualizaci své vlajkové AI modely, která více než zdvojnásobuje výkon uvažování, zatímco zachovává stejné ceny jako její předchůdce.

Nejpříznivější číslo: na ARC-AGI-2, benchmarku, který testuje, zda modely mohou řešit zcela nové logické vzory, spíše než připomínat trénovací data, Gemini 3.1 Pro dosahuje 77,1 %. Gemini 3 Pro dosáhl 31,1 %. Ten 46 procentní bodový skok je největší jednorázový zisk uvažování v jakékoli modelové rodině.

Model je okamžitě k dispozici napříč platformami Google pro spotřebitele a vývojáře. Uživatelé aplikace Gemini s plány AI Pro a AI Ultra získají přístup s vyššími limity použití, zatímco vývojáři mohou získat přístup k 3.1 Pro prostřednictvím Gemini API v AI Studio, Vertex AI, Gemini CLI, Antigravity a Android Studio. NotebookLM také získá upgrade pro předplatitele Pro a Ultra.

Ceny zůstávají na 2 USD za milion vstupních tokenů pro podněty kratší než 200 000 tokenů, se zvyšováním na 4 USD pro delší kontexty. Výstup stojí 12 USD za milion tokenů. Pro každého, kdo již používá Gemini 3 Pro prostřednictvím API, je upgrade zdarma.

Výkon benchmarků napříč všemi oblastmi

Karta modelu ukazuje, že Gemini 3.1 Pro dosahuje první místo v 12 z 18 sledovaných benchmarků. Kromě ARC-AGI-2 patří mezi výjimečné výsledky 94,3 % na GPQA Diamond, testu uvažování na úrovni vysokoškolského studia, a 2 887 Elo na LiveCodeBench Pro, nejvyšší skóre mezi všemi modely pro soutěžní programování.

Na Humanity’s Last Exam – benchmarku vytvořeném z otázek odborníků z různých akademických oborů – 3.1 Pro dosahuje 44,4 %, oproti 37,5 % u Gemini 3 Pro a před GPT-5.2 s 34,5 %. Multijazyčný benchmark MMLU ukazuje 92,6 %, a přesnost dlouhých kontextů při 128 000 tokenech zůstává na 84,9 %.

Model si zachovává okno vstupního kontextu o velikosti 1 milionu tokenů a generuje až 64 000 výstupních tokenů, což odpovídá specifikacím AI nástrojů pro generování kódu, které potřebují zpracovat celý kód a vygenerovat podstatné kódové bloky v jedné relaci.

Kde 3.1 Pro není vedoucí, je také důležité. Na SWE-Bench Verified, testu reálných softwarových inženýrských úloh, dosahuje 80,6 % – těsně za Anthropic’s Claude Opus 4.6 s 80,8 %. Rozdíl je malý, ale ukazuje, že Anthropic si zachovává úzkou výhodu v praktických úkolech programování, které pohánějí podnikové přijetí.

Co se mění dynamické myšlení

Gemini 3.1 Pro používá dynamické myšlení jako výchozí, přístup, při kterém se model přizpůsobuje množství vnitřního uvažování na základě složitosti každého podnětu. Jednoduché otázky získají rychlé odpovědi. Složité více-krokové problémy spustí hlubší procesy zpracování předtím, než model vygeneruje odpověď.

Vývojáři mohou ovládat toto chování prostřednictvím parametru thinking_level v API, nastavující maximální hloubku vnitřního uvažování. Toto řeší napětí v modelech uvažování: prodloužené uvažování zlepšuje přesnost u složitých problémů, ale přidává latenci a náklady pro přímé dotazy. Dynamické myšlení se snaží automatizovat tento kompromis.

Tato funkce odráží širší průmyslovou změnu. Modely o-series od OpenAI zavedly chain-of-thought uvažování jako vybratelný režim. Anthropic’s Claude používá prodloužené uvažování jako volitelnou funkci. Přístup Google, který z něj dělá výchozí – s proměnlivou intenzitou – vsází, že většina uživatelů raději nechá model rozhodnout, jak tvrdě myslet, než aby sami řídili toto rozhodnutí.

Competitivní pole se zužuje

Gemini 3.1 Pro přichází na trh, kde se vedení v benchmarku mění měsíčně. Gemini 3 od Google spustila “kódový červený poplach” u OpenAI, který vedl k vydání GPT-5.2 za méně než měsíc. Anthropic uvolňuje aktualizace Claude v zrychleném tempu. Každé vydání zužuje mezery mezi modely, což činí výběr mezi platformami stále více závislým na ekosystému a cenách než na syrové schopnosti.

Google si zachovává výhodu v distribuci. Gemini 3.1 Pro se přímo zařazuje do produktů, které používají stovky milionů lidí: Gmail, Docs, Search a Osobní inteligence funkce, které propojují model s osobními údaji uživatelů. Model také pohání Gemini Enterprise a Gemini CLI, poskytující vývojářům a podnikům přístup prostřednictvím nástrojů, které již používají.

Pro vývojáře, kteří si vybírají mezi modely na hranici, se rozhodnutí o ceně stalo jednodušší. Za 2 USD za milion vstupních tokenů Gemini 3.1 Pro podkopává ceny vlajkových modelů OpenAI a Anthropic pro srovnatelnou schopnost. Bezplatný upgrade z 3 Pro odstraňuje jakoukoli migraci tření pro stávající uživatele.

Zisky uvažování mají největší význam pro agenty – AI systémy, které plánují, vykonávají více-krokové úkoly a používají nástroje autonomně. ARC-AGI-2 specificky testuje typ nového rozpoznávání vzorů, které agenti potřebují, když narazí na problémy, které jejich trénovací data neobsahovala. Model, který dosahuje 77,1 % na tomto testu, zpracovává neznámé situace mnohem spolehlivěji než ten, který dosahuje 31,1 %.

Otázkou je, zda se tyto benchmarkové zisky přeloží do proporcionálních reálných zlepšení. Benchmarky zachycují specifické schopnosti za kontrolovaných podmínek; skutečná uživatelská zkušenost závisí na tom, jak model funguje napříč nepředvídatelným rozsahem úkolů, které lidé na něj házejí. Skok na ARC-AGI-2 naznačuje, že 3.1 Pro zpracovává novinky lépe než jakýkoli předchozí model. To, co uživatelé s touto schopností udělají, určí, zda čísla mají význam.

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojuje žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje v oblasti AI objevily efektivně a zároveň zachovávala redakční standardy publikace.