AI 模型与平台

Moonshot AI 的 Kimi K3 在 Amazon Bedrock 上线,拥有 1M Token 上下文

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Moonshot AI 的 Kimi K3 是一种开放权重模型,开发者称其为首个参数规模达到 2.8 万亿的开放模型,于 2026 年 9 月 18 日在 Amazon Bedrock 上线,为编码和知识工作提供了新的选择。

亚马逊网络服务在 AWS Machine Learning Blog 上宣布了此项发布。Moonshot AI 表示,Kimi K3 是其最强大的模型,结合了原生视觉能力和 1 百万 Token 上下文窗口,并在扩展效率上相较于 Kimi K2 提升约 2.5 倍。

在 Moonshot AI 的 Kimi K3 技术文章 中,公司称该模型基于两项架构更新,分别称为 Kimi Delta Attention 和 Attention Residuals,旨在提升信息在序列长度和模型深度上的流动。Kimi K3 采用公司称为 Stable LatentMoE 的混合专家设计,实际激活了 896 位专家中的 16 位,并从监督微调阶段起使用量化感知训练,采用 MXFP4 权重和 MXFP8 激活。公司将相较于早期模型约 2.5 倍的扩展效率提升归因于这些结构性改进以及精细化的训练和数据配方。

Moonshot AI 表示,Kimi K3 的整体性能仍落后于专有的 Claude Fable 5 和 GPT 5.6 Sol 模型,但报告称 Kimi K3 在其评估套件中实现了前沿水平的结果,并始终优于其他测试模型。公司还列出了局限性:模型在保留思考历史模式下进行训练,如果代理工具未能返回历史思考内容,生成质量可能会变得不稳定;并且其对长期任务的强调可能导致在指令模糊时为用户做出意外决策,公司称这可能需要在系统提示中加入更明确的行为约束。

Moonshot AI 最初于 2026 年 7 月推出 Kimi K3,并当时声明完整模型权重将在 2026 年 7 月 27 日前发布。在该发布会上,模型通过 Moonshot AI 自有渠道提供:Kimi 应用、Kimi Work 桌面应用、Kimi Code 终端工具以及 Kimi API。

Amazon Bedrock 上的开放权重模型与数据处理

AWS 表示,此次发布体现了对服务上开放权重模型的持续投资。自 2025 年起,Bedrock 已新增数十种来自 DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI 和 Qwen 等供应商的开放权重模型。2026 年,Bedrock 为工具调用、结构化输出、推理、响应流式传输以及 Responses 和 Chat Completions API 提供了平台级功能,而非针对单个模型的集成,使得新开放权重模型能够在可用时直接使用这些功能。

AWS 表示,和 Amazon Bedrock 上的所有开放权重模型一样,客户数据在 AWS 数据边界内处理,不会与模型提供商共享,也不会用于训练底层模型。推理请求始终启用零数据保留,且零运维访问权限阻止 AWS 运维人员在推理过程中访问提示和完成内容。

Amazon Bedrock 文档 将 Kimi K3 列为服务中的三款 Moonshot AI 模型之一,另外还有 Kimi K2.5——一款在推理、编码和多语言能力上有所提升的多模态模型,以及 Kimi K2 Thinking——一款具备链式思考能力的推理模型,可用于数学、编码和逻辑等复杂问题求解。

控制台访问、API 与推理配置文件

用户可以在 Amazon Bedrock 控制台的 Test > Playground 中尝试 Kimi K3,或通过 bedrock-runtime endpoint 以编程方式调用它。该 endpoint 支持 OpenAI 兼容的 Responses 和 Chat Completions API,以及 Amazon Bedrock Invoke 和 Converse API。

模型通过跨区域推理配置文件进行调用。对于没有地区限制的工作负载,AWS 推荐使用全局配置文件 global.moonshotai.kimi-k3,该配置将每个请求路由至全球任何受支持的商业 AWS 区域,并且据 AWS 称,其费用约比地域配置文件低 10%。美国地域配置文件 us.moonshotai.kimi-k3 则在美国境内处理,以满足数据驻留要求。

AWS 列出的前置条件包括拥有 Amazon Bedrock 访问权限的有效 AWS 账户、Python 3.10 或更高版本,以及对 bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream 和 bedrock:CreateInference 的 AWS 身份与访问管理权限。

显式提示缓存与开发者工具

根据 AWS,Kimi K3 是 Amazon Bedrock 上首个支持显式提示缓存的开放权重模型,旨在针对需要反复发送稳定上下文(如仓库指令、工具定义或参考文档)的长期编码和知识工作流。一个 prompt缓存断点标记可以在至少 1,024 Token 后指定可重用提示前缀的确切结束位置。显式模式下,写入缓存的 Token 按更高费率计费,但缓存至少保留 30 分钟。随后匹配缓存前缀的请求将按折扣输入费率计费,并且不计入每分钟输入 Token 配额。

除了直接使用 API 外,该模型还可通过支持 Amazon Bedrock 的工具使用。AWS 强调 OpenCode,这是一款开源且模型无关的编码代理,拥有原生 amazon-bedrock 提供程序,使用 Converse API;以及 Hermes Agent,这是一款开源的生产力助理,原生支持 Amazon Bedrock 上的模型。AWS 还在 GitHub 上发布了 Moonshot AI on AWS 示例仓库,提供了更多示例。

Kimi K3 可通过美国地区(US Geo)和全球跨区域(Global cross-Region)推理配置文件使用,完整的支持区域列表请参见 Bedrock 文档。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。