Модели и платформы ИИ
Gemini 3.1 Pro Достигает Рекордных Уровней Рассуждений
Google (GOOGL ) выпустила Gemini 3.1 Pro 19 февраля, обновление своего флагманского модели ИИ, которое более чем удваивает производительность рассуждений, сохраняя при этом идентичную цену с предыдущей версией.
Самая поразительная цифра: на ARC-AGI-2, тесте, который проверяет способность моделей решать совершенно новые логические закономерности, а не вспоминать обучающие данные, Gemini 3.1 Pro набирает 77,1%. Gemini 3 Pro набирал 31,1%. Этот скачок на 46 процентных пунктов является самым большим одноразовым приростом рассуждений в любой семье моделей.
Модель доступна сразу на всех платформах Google для потребителей и разработчиков. Пользователи приложения Gemini на планах AI Pro и AI Ultra получают доступ с более высокими лимитами использования, а разработчики могут получить доступ к 3.1 Pro через API Gemini в AI Studio, Vertex AI, Gemini CLI, Antigravity и Android Studio. NotebookLM также получает обновление для подписчиков Pro и Ultra.
Цена остается на уровне 2 доллара за миллион входных токенов для запросов длиной менее 200 000 токенов, увеличиваясь до 4 долларов для более длинных контекстов. Стоимость вывода составляет 12 долларов за миллион токенов. Для тех, кто уже использует Gemini 3 Pro через API, обновление бесплатно.
Производительность На Всех Фронтах
Карта модели показывает, что Gemini 3.1 Pro занимает первое место на 12 из 18 отслеживаемых тестов. Помимо ARC-AGI-2, выделяются 94,3% на GPQA Diamond, тесте рассуждений на уровне аспирантуры, и 2887 Elo на LiveCodeBench Pro,最高ший балл среди всех моделей для конкурентного программирования.
На Humanity’s Last Exam – тесте, составленном из вопросов экспертов из различных академических дисциплин, 3.1 Pro набирает 44,4%, что выше, чем 37,5% у Gemini 3 Pro и 34,5% у GPT-5.2. Мультимедийный тест MMLU показывает 92,6%, а точность контекста на уровне 128 000 токенов остается на уровне 84,9%.
Модель сохраняет контекстное окно входных данных размером 1 миллион токенов и может генерировать до 64 000 токенов вывода, что соответствует спецификациям инструментов кодирования ИИ, которым необходимо обрабатывать整个 код и производить значительные блоки кода в одном сеансе.
Где 3.1 Pro не лидирует, также информативно. На SWE-Bench Verified, тесте реальных задач программирования, он набирает 80,6%, что чуть ниже, чем у Anthropic’s Claude Opus 4.6, набравшего 80,8%. Разрыв незначителен, но он показывает, что Anthropic сохраняет небольшое преимущество в практических задачах программирования, которые стимулируют корпоративное внедрение.
Что Изменяет Динамическое Мышление
Gemini 3.1 Pro использует динамическое мышление по умолчанию, подход, при котором модель регулирует количество внутренних рассуждений в зависимости от сложности каждого запроса. Простые вопросы получают быстрые ответы. Сложные многоступенчатые проблемы запускают более глубокие цепочки обработки перед тем, как модель сгенерирует ответ.
Разработчики могут контролировать это поведение через параметр thinking_level в API, устанавливая максимальную глубину внутренних рассуждений. Это решает напряженность в моделях рассуждений: продленное мышление улучшает точность на сложных задачах, но добавляет задержку и стоимость для прямых запросов. Динамическое мышление пытается автоматизировать этот компромисс.
Эта функция отражает более широкий сдвиг в отрасли. Модели o-series от OpenAI ввели цепочку рассуждений как выбираемый режим. Модель Anthropic’s Claude использует продленное мышление как опциональную функцию. Подход Google, который делает его значением по умолчанию – с переменной интенсивностью, – ставит на то, что большинство пользователей предпочтут позволить модели решить, как сильно думать, а не управлять этим решением сами.
Конкурентное Поле Сужается
Gemini 3.1 Pro появляется на рынке, где лидерство в тестах меняется каждый месяц. Google’s Gemini 3 спровоцировал “код красный” в OpenAI, который произвел GPT-5.2 менее чем за месяц. Anthropic выпускает обновления Claude с ускоряющейся скоростью. Каждый релиз сужает разрыв между моделями, что делает выбор между платформами все более зависим от экосистемы и цены, а не сырой способности.
Преимущество Google остается в распределении. Gemini 3.1 Pro вписывается непосредственно в продукты, используемые сотнями миллионов людей: Gmail, Docs, Search и Personal Intelligence функции, которые соединяют модель с личными данными пользователей. Модель также питает Gemini Enterprise и Gemini CLI, давая разработчикам и бизнесу доступ через инструменты, которые они уже используют.
Для разработчиков, выбирающих между моделями, решение о цене стало проще. При цене 2 доллара за миллион входных токенов Gemini 3.1 Pro обгоняет как OpenAI, так и Anthropic по цене для сравнимой способности. Бесплатное обновление с 3 Pro удаляет любую фрикцию миграции для существующих пользователей.
Приросты рассуждений имеют значение прежде всего для агентных приложений – систем ИИ, которые планируют, выполняют многоступенчатые задачи и используют инструменты автономно. ARC-AGI-2 конкретно тестирует способность к новым закономерностям, которые агенты нуждаются при столкновении с проблемами, не покрытыми их обучающими данными. Модель, набирающая 77,1% на этом тесте, обрабатывает незнакомые ситуации намного более надежно, чем та, которая набирает 31,1%.
Вопрос в том, переводятся ли эти приросты тестов в пропорциональные реальные улучшения, – это вопрос, который Google будет должен ответить в течение ближайших недель. Тесты захватывают конкретные способности в контролируемых условиях; фактический пользовательский опыт зависит от того, как модель работает на непредсказуемом диапазоне задач, которые люди бросают ей. Скачок ARC-AGI-2 предполагает, что 3.1 Pro обрабатывает новизну лучше, чем любая модель до нее. То, что пользователи делают с этой возможностью, определит, имеют ли числа значение.










