Моделі та платформи ШІ

Gemini 3.1 Pro встановлює рекордні показники розумових здібностей

mm
Додайте Unite.AI до бажаних джерел у Google

Google (GOOGL ) випустив Gemini 3.1 Pro 19 лютого, оновлення своєї флагманської моделі штучного інтелекту, яке більше ніж вдвічі підвищує показники розумових здібностей, зберігаючи ціни ідентичні попереднику.

Найбільш вражаюча цифра: на ARC-AGI-2, бенчмарку, який перевіряє, чи можуть моделі розв’язувати абсолютно нові логічні закономірності, а не згадувати навчальні дані, Gemini 3.1 Pro набирає 77,1%. Gemini 3 Pro набрав 31,1%. Це збільшення на 46 процентних пунктів є найбільшим одноразовим підвищенням розумових здібностей у будь-якій сім’ї моделей.

Модель доступна негайно на всіх споживчих та розробницьких платформах Google. Користувачі додатка Gemini на планах AI Pro і AI Ultra отримують доступ з вищими лімітами використання, тоді як розробники можуть отримати доступ до 3.1 Pro через API Gemini в AI Studio, Vertex AI, Gemini CLI, Antigravity та Android Studio. NotebookLM також отримує оновлення для абонентів Pro і Ultra.

Ціни залишаються на рівні 2 долари за мільйон вхідних токенів для запитів менших за 200 000 токенів, зростаючи до 4 доларів для довших контекстів. Вихідні дані коштують 12 доларів за мільйон токенів. Для тих, хто вже використовує Gemini 3 Pro через API, оновлення безкоштовне.

Бенчмарк-показники по всьому борту

Картка моделі показує, що Gemini 3.1 Pro займає перше місце на 12 з 18 відстежуваних бенчмарків. Окрім ARC-AGI-2, видатними є 94,3% на GPQA Diamond, тесті наукового розуміння на рівні магістратури, і 2 887 Elo на LiveCodeBench Pro, найвищий бал серед усіх моделей для конкурентного програмування.

На Humanity’s Last Exam – бенчмарку, створеному з питань експертів з різних академічних дисциплін, 3.1 Pro досягає 44,4%, що вище, ніж 37,5% у Gemini 3 Pro, і випереджає GPT-5.2 з 34,5%. Мультимовний бенчмарк MMLU показує 92,6%, а точність довгих контекстів на рівні 128 000 токенів залишається на рівні 84,9%.

Модель зберігає вікно контексту вхідних даних розміром 1 мільйон токенів і генерує до 64 000 вихідних токенів, що відповідає специфікаціям інструментів генерації коду AI, яким потрібно обробляти цілі кодові бази та генерувати суттєві кодові блоки за одну сесію.

Там, де 3.1 Pro не лідирує, також інформативно. На SWE-Bench Verified, тесті реальних завдань програмування, він набирає 80,6% – трохи менше, ніж у Anthropic’s Claude Opus 4.6 з 80,8%. Розрив незначний, але він показує, що Anthropic зберігає вузьку перевагу у практичних завданнях програмування, які стимулюють прийняття рішень на рівні підприємств.

Що змінює динамічне мислення

Gemini 3.1 Pro використовує динамічне мислення за замовчуванням, підхід, при якому модель регулює кількість внутрішніх розумових процесів залежно від складності кожного запиту. Прості питання отримують швидкі відповіді. Складні багатокрокові завдання запускають глибші ланцюги обробки перед тим, як модель генерує свою відповідь.

Розробники можуть керувати цим поведінкою через параметр thinking_level у API, встановлюючи максимальну глибину внутрішніх розумових процесів. Це вирішує напруженість у моделях розуміння: розширення розумових процесів покращує точність у складних завданнях, але додає затримку та витрати для прямих запитів. Динамічне мислення намагається автоматизувати цей компроміс.

Ця функція відображає ширший індустріальний зсув. Моделі o-серії OpenAI ввели ланцюгове мислення як вибрану функцію. Модель Anthropic’s Claude використовує розширені розумові процеси як опціональну функцію. Підхід Google, який робить його за замовчуванням – з змінною інтенсивністю, – ставить на те, що більшість користувачів хочуть, щоб модель вирішувала, як сильно думати, а не керувати цим рішенням самостійно.

Конкурентне поле стає щільнішим

Gemini 3.1 Pro з’являється на ринку, де лідерство у бенчмарках змінюється щомісяця. Gemini 3 спровокував “код червоного” у OpenAI, який створив GPT-5.2 менш ніж за місяць. Anthropic випускає оновлення моделі Claude з прискореним темпом. Кожен реліз звужує розрив між моделями, роблячи вибір між платформами все більш залежним від екосистеми та ціни, а не сутої здатності.

Перевага Google залишається розподілом. Gemini 3.1 Pro безпосередньо входить до продуктів, які використовують сотні мільйонів людей: Gmail, Docs, Search та функції Personal Intelligence, які з’єднують модель з особистими даними користувача. Модель також живить Gemini Enterprise і Gemini CLI, надаючи розробникам та підприємствам доступ через інструменти, які вони вже використовують.

Для розробників, які вибирають між моделями, рішення щодо ціни стало простішим. За 2 долари за мільйон вхідних токенів Gemini 3.1 Pro піднімає ціну нижче, ніж у OpenAI та Anthropic, за порівнянну здатність. Безкоштовне оновлення з 3 Pro усуває будь-який фрикційний перехід для існуючих користувачів.

Показники розумових здібностей мають найбільше значення для агентських застосунків – систем штучного інтелекту, які планують, виконують багатокрокові завдання та використовують інструменти автономно. ARC-AGI-2 конкретно перевіряє тип визнання нових закономірностей, який агенти потребують, коли зустрічають проблеми, яких їхні навчальні дані не покривають. Модель, яка набирає 77,1% на цьому тесті, обробляє незнайомі ситуації набагато надійніше, ніж та, яка набирає 31,1%.

Чи ці бенчмарк-показники перекладуться у пропорційні реальні покращення, це питання, яке Google буде потрібно відповісти у найближчі тижні. Бенчмарки захоплюють конкретні можливості у контрольованих умовах; фактичний досвід користувача залежить від того, як модель працює по всій непередбачуваній кількості завдань, які люди кидають їй. Скачок ARC-AGI-2 свідчить про те, що 3.1 Pro обробляє новизну краще, ніж будь-яка попередня модель. Що користувачі робитимуть з цією можливістю, визначить, чи мають значення ці цифри.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.