AI 模型与平台
思维机器实验室推出Inkling,首个开放权重的多模态AI模型

思维机器实验室发布了Inkling,其首个通用人工智能模型,允许开发人员访问一个几乎达到一万亿参数的系统,可以处理文本、图像和音频。2026年7月15日的发布代表了这家由前OpenAI首席技术官Mira Murati创立的AI公司迄今为止最重要的产品里程碑。
思维机器实验室并没有声称自己建造了世界上最强大的模型,而是将Inkling定位为一个可定制的基础,供希望对其AI行为有更多控制权的公司、研究人员和开发人员使用。其权重可以通过Hugging Face下载,采用Apache 2.0许可证,同时该模型也可以通过思维机器实验室的Tinker训练平台进行微调。
这种定位可能很重要,因为AI市场正分裂为由少数公司控制的专有前沿系统和开放权重的替代品,组织可以修改、托管和将其集成到自己的基础设施中。
一个9750亿参数的模型,只使用了一小部分
Inkling包含9750亿个参数,使其成为迄今为止发布的最大的开放权重模型之一。然而,它使用了稀疏的专家混合架构,这意味着在处理任何单个令牌时,只有410亿个参数被激活。
该模型包含66个变换器层和256个路由专家。每个令牌都会被发送到六个专家,以及两个始终保持活跃的共享专家。这种方法旨在提供一个非常大的模型的知识容量,而无需在每个推理操作中使用每个参数。
思维机器实验室表示,专家混合设计在很大程度上遵循DeepSeek-V3中引入的思想,包括其路由和负载平衡方法。Inkling还使用滑动窗口和全局注意力层的组合,以及相对位置嵌入,而不是现代语言模型中常用的旋转位置嵌入。
该模型支持最多一百万令牌的上下文窗口。通过Tinker,开发人员目前可以访问64,000令牌和256,000令牌的配置,而完整的上下文容量可以通过兼容的下载权重部署获得。
跨文本、图像和音频的原生推理
Inkling是原生多模态的,接受文本、图像和音频作为输入,并生成文本作为输出。图像使用分层补丁编码器进行处理,而音频被转换为离散令牌并放入与文本和视觉信息相同的共享表示空间中。
思维机器实验室在45万亿令牌的数据上预训练了该模型,数据来自文本、图像、音频和视频。该公司表示,数据包括公开可用的材料、许可或收购的第三方来源以及合成或增强的内容。然而,模型卡并不提供完整的数据集清单,使“开放权重”比完全开源更为准确的描述。
该公司还引入了一个可控推理系统,允许开发人员调整Inkling在产生答案之前应用多少计算。较低的推理设置可以降低延迟和令牌消耗,而较高的设置可以用于更困难的编码、数学、科学或工具使用任务。
除了主模型外,思维机器实验室还预览了Inkling-Small,一个2760亿参数的专家混合模型,具有120亿活跃参数。该公司表示,其数据和训练配方的改进使较小的模型在几个评估中匹配或超过了较大的版本,尽管Inkling-Small尚未获得相同的完整发布处理。
通过Tinker进行定制
Inkling与Tinker密切相关,思维机器实验室于2025年推出的基于云的训练平台。Tinker允许开发人员在本地编写训练程序,同时平台管理分布式GPU基础设施,以微调从相对较小的系统到万亿参数的专家混合架构的模型。
该平台支持监督微调、强化学习、直接偏好优化、蒸馏和低秩适应。客户可以下载生成的检查点,思维机器实验室表示,客户的训练数据仅用于微调客户的模型,而不是被纳入其自身的基础模型中。
为了演示此定制过程,该公司要求Inkling将自己微调为一个永远不会使用字母“e”的模型。Inkling生成了自己的训练数据和评估方法,通过Tinker创建并运行了微调作业,测试了更新的检查点,然后将修改后的权重加载到其工作环境中。
这种演示故意狭窄,但它说明了更广泛的战略。思维机器实验室希望开发人员将基础模型视为起点,可以根据组织的术语、工作流程、数据、政策和首选行为进行适应,而不是将其视为完全由原始模型提供商控制的成品。
具有竞争力的性能,而无需声称基准测试冠军
思维机器实验室公开承认Inkling并不是在每个类别中都具有最强大的模型。其基准测试结果通常将其列为更强大的开放权重系统之一,而来自Anthropic、Google和OpenAI等公司的领先专有模型仍然保持着整体优势。
Inkling 在2026年美国数学邀请考试基准测试中获得了97.1%,在GPQA Diamond中获得了87.2%的成绩,GPQA Diamond评估研究生级科学推理能力。它在SWE-bench Verified中获得了77.6%的成绩,在SWE-bench Pro Public中获得了54.3%的成绩,后两项基准测试用于评估编码代理解决实际软件工程问题的能力。
在人类最后的考试中,Inkling在没有工具的情况下获得了29.7%的成绩,当提供工具时获得了46%的成绩。其工具启用的性能与几个开放模型具有竞争力,但仍低于Thinking Machines比较中包含的最强的封闭系统。
Inkling还在Design Arena的Agentic Web开发领先者榜中获得了1257的成绩,人类评估员在此比较了不同模型创建的应用程序。该成绩将其置于几个专有系统附近,并领先于多个成熟的开放权重竞争对手。
与任何供应商发布的基准测试集一样,结果需要独立复制。思维机器实验室在可能的情况下使用了外部评分,但几个评估依赖于内部测试、配置或竞争模型提供商的自我报告结果。
较低的成本带来显著的硬件要求
Inkling的成本论点主要基于其稀疏架构和可控推理。激活410亿个参数而不是所有9750亿个参数,应该使推理比运行类似大小的密集模型更高效,同时允许开发人员为不需要的请求禁用扩展推理。
通过Tinker,64,000令牌版本的价格为每百万预填令牌1.87美元,每百万采样令牌4.68美元,每百万训练令牌5.61美元。256,000令牌配置的价格更高,为预填7.48美元,采样12.24美元,训练14.71美元,对于缓存输入,价格会更低。
这些数字使大型模型实验比组装专用训练集群更容易获取,但Inkling并不是大多数开发人员可以在普通工作站上运行的模型。完整的BF16检查点需要至少两个聚合图形内存,相当于八个Nvidia B300 GPU或16个H200 GPU。
量化的NVFP4检查点将要求降低到大约600 GB,但仍需要四个B300 GPU或八个H200 GPU的基础设施。在实践中,许多组织可能更有可能通过Tinker或第三方推理提供商访问Inkling,而不是直接托管完整模型。
平衡抗审查与安全控制
Inkling的一个更不寻常的设计目标是思维机器实验室所说的抗审查。该公司表示,它专门训练了该模型来回答可能在政治或制度上敏感的主题的问题,而不是自动拒绝它们。
认知评估使用其宣传和审查基准测试评估了Inkling,思维机器实验室报告称该模型表现出强烈的“审查不遵守”模式。其背后的想法是,一个开放的模型不应该仅仅因为这些偏好被其原始开发者嵌入,就继承不必要的政治限制或标准化的意见。
这并不意味着Inkling被设计为回答每个请求。该公司还单独训练了该模型,以拒绝与武器、暴力、网络虐待、化学或生物威胁、操纵以及其他危险活动相关的指令。
Inkling在FORTRESS安全基准测试的对抗部分获得了78%的成绩,并正确回答了95.9%的类似于有害请求的良性问题。它还在StrongREJECT中获得了98.6%的成绩,StrongREJECT衡量模型拒绝明显有害指令的能力。思维机器实验室表示,这种组合表明该模型可以在不过度阻止合法问题的情况下维持安全控制,尽管随后第三方微调的影响仍然是一个开放的研究问题。
从OpenAI领导到120亿美元的初创公司
思维机器实验室于2025年2月正式成立,在Mira Murati离开OpenAI几个月后。她曾在OpenAI担任首席技术官,期间推出了包括ChatGPT、DALL-E以及公司早期的语音和多模态系统在内的多个产品。
最初的团队包括大约30名来自OpenAI、Meta、Mistral和其他AI组织的研究人员和工程师。该公司成立时的员工中,大约有三分之二曾在OpenAI工作。创始团队包括OpenAI联合创始人John Schulman、Barret Zoph、Lilian Weng、Andrew Tulloch和Luke Metz,他们在强化学习、模型对齐、多模态AI、预训练和后训练等领域拥有经验。
仅在成立五个月后,思维机器实验室筹集了约20亿美元,估值为120亿美元。Andreessen Horowitz领投了这一轮融资,Nvidia (NVDA ) 、Accel、ServiceNow (NOW ) 、Cisco、AMD和量化交易公司Jane Street也参与了投资。
Nvidia随后通过多年战略合作扩大了与该公司的关系。 宣布于2026年3月,协议要求部署至少一千万瓦的下一代Nvidia Vera Rubin系统,以支持思维机器实验室的模型训练和可定制的AI平台。Nvidia还在公司中进行了额外投资。
Inkling反映了对去中心化AI的更广泛投注
思维机器实验室认为,大多数AI系统都是由少数公司训练的,然后作为基本固定的产品分发。其替代方案是一个生态系统,企业和个人可以使用自己的知识、偏好和判断不断适应模型。
这种理念有助于解释为什么Inkling被发布为可下载的权重,而不是仅通过专有界面提供。它还将模型与Tinker联系起来,Tinker提供了修改行为所需的训练基础设施,而无需每个组织都组装自己的大型GPU集群。
然而,这一愿景与发布的实际情况仍然存在紧张关系。Inkling足够开放,可以下载和修改,但其规模足够大,仅有资金充足的组织才能现实地托管完整的模型。其训练数据以广泛的类别进行描述,而不是完全记录,定制可能会削弱原始检查点中构建的安全控制。
发布给西方开发人员提供了另一个大型开放权重选项,当时许多最具竞争力的可定制模型来自中国实验室,如DeepSeek、Alibaba、Moonshot AI和Zhipu AI。路透社注意到,随着几家领先的美国公司转向更专有的战略,西方的开放权重开发已经失去了动力。
Inkling对AI的意义
Inkling的意义可能取决于开发人员是否能够将其转化为在狭窄领域内超越通用模型的专用系统。
金融、医疗保健、工程、网络安全、科学研究和软件开发等公司通常拥有在公共训练数据中没有很好代表的宝贵内部知识。一个强大的开放权重基础模型,加上可访问的强化学习和微调基础设施,可能会使这些组织能够将更多的专业知识直接编码到模型行为中。
同时,该模型需要证明其效率主张可以转化为更低的总部署成本,特别是考虑到基础设施、推理量、微调、监控和安全测试时。独立研究人员还需要检查其基准性能、多语言能力、政治中立性、幻觉率和自定义后安全性降级的抵抗力。
思维机器实验室以一个异常有经验的团队、可观的投资者支持和通常与更老的AI实验室相关的基础设施承诺进入了市场。Inkling是该公司首次机会,证明这些资源可以产生比雄心勃勃的研究计划和训练平台更有价值的东西。
该模型并没有取代领先的专有系统,思维机器实验室也不声称它做到了。相反,Inkling提供了一个不同的主张:先进AI的未来可能不仅仅由谁训练最强大的通用模型决定,还由谁为开发人员提供构建自己的模型的最强基础决定。












