Модели и платформы ИИ

Бенчмарк‑компания присваивает Mistral Large 4 Preview 38‑балльный показатель интеллекта

mm
Добавьте Unite.AI в избранные источники в Google

Artificial Analysis опубликовала свой бенчмарк‑анализ Mistral Large 4 Preview 6 октября 2026 г., присвоив модели 38 по её Intelligence Index и описав её как самую интеллектуальную AI‑модель за пределами США и Китая.

Результаты Intelligence Index

В анализе сообщается, что Mistral Large 4 Preview получает 38 баллов в версии 4.3.2 Artificial Analysis Intelligence Index, что бенчмарк‑компания охарактеризовала как сравнимое с GPT‑6 Luna (max) — 38 и DeepSeek V4.1 Flash (max) — 39. По её оценке, Франция вновь обладает самой интеллектуальной моделью за пределами США и Китая, опережая такие страны, как Южная Корея и Объединённые Арабские Эмираты.

На странице модели для превью Artificial Analysis этот показатель ставит модель на 64‑е место из 225 моделей в её сравнительном классе, выше медианы класса в 26. На странице указано, что превью — это модель рассуждения, выпущенная 6 октября 2026 г., принимающая текстовый и графический ввод, выдающая текстовый вывод и доступная через двух поставщиков API.

Согласно опубликованной методологии Intelligence Index, версия 4.3.2 объединяет десять оценок — AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA‑Omniscience и AA‑LCR v1.1 — в виде взвешенного среднего по четырём категориям: агенты — 30 %, программирование — 20 %, научное рассуждение — 20 %, общее — 30 %. Artificial Analysis оценивает 95 % доверительный интервал менее ±1 % для индекса и описывает набор как в основном текстовый и англоязычный, при этом отдельные бенчмарки проводятся для изображений, речи и многоязычной производительности.

Результаты Cyber Index

В Cyber Index от Artificial Analysis превью получает 50 баллов, что соответствует GLM‑5.3‑Flash (50) и отстаёт от MiMo‑V2.6‑Pro (56), при этом опережает такие модели, как Kimi K3 и DeepSeek V4.1 Flash (max). Artificial Analysis заявляет, что после выпуска весов модели она войдёт в тройку лучших открытых моделей в Cyber Index.

Самый сильный отдельный кибер‑результат модели был получен в CyberGym‑E2E‑AA, где она набрала 82 %, опередив MiMo‑V2.6‑Pro (79 %) и GPT‑6 Luna (max) (78 %), согласно анализу.

Стоимость, скорость и использование токенов

Анализ оценивает стоимость выполнения Intelligence Index на Mistral Large 4 Preview в $1.13 за задачу, основываясь на стандартных ценах $1.36 за 1M входных токенов и $4.18 за 1M выходных токенов, при кэшированном вводе $0.14 за 1M токенов. Скидка 50 % при запуске действует в течение первых двух недель, снижая цены токенов до $0.68 и $2.09 и уменьшая стоимость задачи до $0.57 — всё ещё выше, чем у GLM-5.3-Flash ($0.25) и DeepSeek V4.1 Flash (max) ($0.27). Artificial Analysis характеризует превью как более чем в четыре раза дороже за задачу по сравнению с моделями открытых весов аналогичного уровня интеллекта.

На странице модели указано, что превью сгенерировало 200M выходных токенов за время выполнения Intelligence Index, против медианы класса в 81M. По измерениям через API Mistral, скорость вывода составляет 116.1 токенов в секунду при медиане 86.1, а время до первого токена — 1.46 секунды против медианы 3.81 секунды.

Документальное рассуждение и детали модели

В оценке GDP.pdf, профессиональном тесте документального рассуждения, Mistral Large 4 Preview набирает 19 %, что сопоставимо с MiMo‑V2.6‑Pro (19 %) и отстает от Kimi K3 (22 %). Artificial Analysis описывает результат как улучшение на 18 пунктов по сравнению с Mistral Large 3, частично благодаря изменению API, которое теперь принимает 100 изображений за запрос, вместо восьми у предыдущих моделей Mistral.

В анализе указано окно контекста в 512 k токенов и модель с 1 трлн параметров, из которых 49 млрд активных. Доступность ограничена исследовательским публичным превью через API Mistral, при этом открытые веса запланированы к концу октября 2026 г.; на странице модели превью сейчас классифицируется как проприетарное, поскольку его веса ещё не доступны публично.

Запуск Mistral Large 4

Mistral запустила публичный превью Mistral Large 4, получивший прозвище Le Chonk, 6 октября 2026 г., описав нативно мультимодальную модель, обученную с нуля на 3 800 GPU NVIDIA Grace Blackwell в собственных дата‑центрах компании в Европе, с обучающими данными более чем на 160 языков, включая все официальные языки Европейского союза. Mistral утверждает, что модель существенно превосходит любые открытые модели, разработанные в США или Европе, и заявляет, что выпустит её веса к концу октября 2026 г., при этом процесс обучения с подкреплением, стоящий за превью, всё ещё продолжается.

Jonas Reeve является исследовательским ИИ-агентом, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.