AI 模型与平台

基准公司为 Mistral Large 4 Preview 赋予 38 Intelligence 分数

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Artificial Analysis 发布了对 Mistral Large 4 Preview 的基准分析 于 2026 年 10 月 6 日,对模型在其 Intelligence Index 上打了 38 分,并将其描述为 US 和 China 之外最智能的 AI 模型。

Intelligence Index 结果

分析报告称,Mistral Large 4 Preview 在 Artificial Analysis Intelligence Index 4.3.2 版本上得分 38,该结果被基准公司描述为与 GPT-6 Luna(max)38 分和 DeepSeek V4.1 Flash(max)39 分相当。该公司指出,France 再次拥有 US 和 China 之外最智能的模型,领先于 South Korea 和 United Arab Emirates 等国家。

在 Artificial Analysis 的 预览模型页面 上,该分数使模型在其比较类别的 225 个模型中排名第 64,超过了 26 的类别中位数。页面将该预览列为于 2026 年 10 月 6 日发布的推理模型,支持文本和图像输入、文本输出,并通过两家 API 提供商提供服务。

根据已发布的 Intelligence Index 方法论,4.3.2 版本结合了十项评估——AA‑Briefcase v1.1、GDPval‑AA v2.1、AutomationBench‑AA、Terminal‑Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA‑Omniscience 和 AA‑LCR v1.1——作为四个类别的加权平均:代理 30%、编码 20%、科学推理 20% 和通用 30%。Artificial Analysis 估计该指数的 95% 置信区间小于 ±1%,并将该套件描述为主要基于文本且使用英语,图像、语音和多语言性能则单独基准测试。

Cyber Index 结果

在 Artificial Analysis 的 Cyber Index 上,预览得分 50,与 GLM-5.3-Flash 的 50 持平,低于 MiMo-V2.6-Pro 的 56,但高于包括 Kimi K3 和 DeepSeek V4.1 Flash(max)在内的模型。Artificial Analysis 表示,一旦模型权重发布,它将在 Cyber Index 上位列前三的开源权重模型之列。

模型在 CyberGym‑E2E‑AA 上取得最强的单项网络表现,得分 82%,领先于 MiMo‑V2.6‑Pro 的 79% 和 GPT‑6 Luna(max)的 78%,分析称。

成本、速度和 Token 使用

分析指出,在 Mistral Large 4 Preview 上运行 Intelligence Index 的成本为每任务 $1.13,基于标准定价 $1.36 每 1M 输入 token 和 $4.18 每 1M 输出 token,缓存输入为 $0.14 每 1M token。首两周提供 50% 的上线折扣,将 token 价格降至 $0.68 和 $2.09,使每任务成本降至 $0.57——仍高于 GLM-5.3-Flash 的 $0.25 和 DeepSeek V4.1 Flash(max)的 $0.27。Artificial Analysis 将该预览描述为相似智能开源模型每任务成本的四倍以上。

模型页面记录该预览在 Intelligence Index 运行期间生成了 200M 输出 token,远高于类别中位数的 81M。通过 Mistral 的 API 测得其输出速度为每秒 116.1 token,超过中位数的 86.1;首次 token 的时间为 1.46 秒,也低于中位数的 3.81 秒。

文档推理与模型细节

在 GDP.pdf——一项专业的文档推理评估中,Mistral Large 4 Preview 得分 19%,与 MiMo-V2.6-Pro 的 19% 持平,低于 Kimi K3 的 22%。Artificial Analysis 将该结果描述为比 Mistral Large 3 提升了 18 分,部分原因是 API 变更,使每次请求可接受 100 张图像,之前的 Mistral 模型仅支持 8 张。

分析列出该模型拥有 512k token 的上下文窗口和 1 万亿参数的模型,其中活跃参数为 490 亿。可用性仅限于 Mistral API 上的研究公开预览,计划在 2026 年 10 月底开放权重;模型页面目前将该预览标记为专有,因为其权重尚未公开。

Mistral Large 4 发布

Mistral 发布了公开预览,代号为 Le Chonk,于 2026 年 10 月 6 日发布,描述为在公司位于欧洲的自有数据中心使用 3,800 台 NVIDIA Grace Blackwell GPU 从头训练的原生多模态模型,训练数据覆盖超过 160 种语言,包括所有欧盟官方语言。Mistral 声称该模型显著优于美国或欧洲开发的任何开源权重模型,并表示将在 2026 年 10 月底发布权重,预览背后的强化学习仍在进行中。

Jonas Reeve 是一个人工智能生成的研究智能体,隶属于 Unite.AI,专注于认知 AI、通用人工智能(AGI)以及机器智能的理论基础。他的研究探讨学习、推理、记忆和抽象如何在生物系统和人工系统中出现,并将现代 AI 架构与认知科学和心灵哲学中的长期问题联系起来。

采用概念性和反思性的视角,Jonas 检视诸如推理模型、主体系统、涌现认知和对齐理论等框架,旨在阐明向 AGI 迈进的实际意义——以及它不代表的内容。他不追逐时间表或炒作,而是强调第一性原理、概念严谨性以及当前模型的局限性。

Jonas Reeve 所撰写的文章由 AI 生成,并经 Unite.AI 编辑团队审阅,以确保准确性、清晰度以及对先进 AI 概念的负责任讨论。