精选
5 个最佳开源 LLM (2026年8月)

开源和开源权重的大型语言模型现在涵盖从紧凑的本地助手到为长期软件工作而设计的万亿参数系统。最强的选择不仅仅是参数最多的模型。部署硬件、上下文长度、模式、工具支持、许可条款和团队需要的操作控制程度也同样重要。
本列表重点介绍五个当前的模型家族,它们提供了异常强大的功能,同时为开发人员提供了有意义的权重访问权限。一些模型使用宽松的软件许可证,而其他模型使用自定义模型条款,因此组织应该在部署之前审查适用的许可证。该系列还区分了总参数和激活参数,因为专家混合模型可以非常大,但只使用了一小部分权重来处理每个令牌。
对于大多数团队来说,实际的决定取决于工作量。DeepSeek V4 和 GLM-5.2针对大规模的推理和代理工作。Kimi K3 将本地视觉与异常长的上下文窗口相结合。Qwen3.6-35B-A3B 提供了更易于部署的多模态混合专家设计,而 OpenAI 的 gpt-oss 家族提供了两个文本专注的选项,具有透明的推理控制和广泛的工具支持。
最佳开源 LLM 对比
| AI 工具 | 最适合 | 功能 |
|---|---|---|
| DeepSeek V4 | 大规模编码和代理推理 | 1M 令牌上下文,混合注意力,配置推理模式 |
| GLM-5.2 | 长期专业和软件任务 | 753B 参数,1M 令牌上下文,调整思考努力 |
| Kimi K3 | 多模态研究和扩展代理工作流 | 2.8T 参数,本地视觉,1M 令牌上下文 |
| Qwen3.6-35B-A3B | 高效多模态代理和本地部署 | 35B 总参数和 3B 激活参数,本地 262K 上下文,视觉 |
| gpt-oss | 可控文本推理在自管理硬件上 | 120B 和 20B 变体,128K 上下文,本地工具使用 |
1. DeepSeek V4
DeepSeek V4 是一个大型混合专家模型家族,用于困难的编码、推理、工具使用和代理工作。V4-Pro 配置有 1.6 万亿总参数,同时激活 49 亿参数,每个令牌,并且更高效的 V4-Flash 配置使用 284 亿总参数,同时激活 13 亿参数。两者都设计为一百万令牌上下文窗口,为开发人员提供了跨大型存储库、广泛文档和长交互历史工作的空间。
其混合注意力架构旨在平衡长上下文容量与实际推理,同时多个推理模式使团队能够根据任务的不同调整行为。这种灵活性对于需要在直接响应、故意解决问题、工具执行和扩展软件工作之间交替的系统很有用。DeepSeek 还强调函数调用和代理可靠性,使 V4 对于需要计划、执行、检查结果和修订方法的助手特别相关。
该模型以 MIT 许可证发布,这使得它对希望广泛部署的组织有吸引力。然而,操作规模是一个权衡:即使使用稀疏激活,完整的检查点也很大,需要严重的基础设施、量化或一个有能力的托管合作伙伴。团队应该在自己的工作负载上评估延迟、内存要求和工具调用行为,而不是将大上下文窗口视为检索和仔细上下文管理的替代品。
优点和缺点
- 一百万令牌上下文支持大型存储库和扩展研究工作流
- 强烈关注编码、推理、工具使用和多步代理执行
- 多个推理模式为开发人员提供了更多对响应行为的控制
- V4-Pro 和 V4-Flash 提供了不同能力和部署复杂性的平衡
- MIT 许可证支持广泛的商业和研究使用
- 全尺寸部署需要大量计算和工程专业知识
- 非常长的提示仍然需要仔细组织以防止分心和上下文稀释
- 代理使用需要许可、监控和对后果性操作的评估
2. GLM-5.2
GLM-5.2 是 Z.ai 的旗舰开源模型,用于长期专业工作、复杂推理、软件工程和工具使用代理。该模型具有 753 亿参数和一百万令牌上下文窗口,使其适合大型代码库、深入文档分析和需要在多个操作中保持一致目标的工作流程。其架构和训练强调了可靠的执行而不仅仅是孤立的基准式答案。
一个显著的优势是可调节的思考努力。开发人员可以根据任务的难度和延迟选择不同的推理深度,这对于同一个应用程序同时处理常规请求和困难规划很有用。GLM-5.2 还支持函数调用和代理工作流,使其能够与开发环境、研究工具和结构化业务系统交互,同时保持扩展的工作上下文。
该模型以 MIT 许可证分发。即使如此,其参数数量使自托管成为一个严重的基础设施决策,生产团队需要考虑服务架构、内存、可观察性和安全控制。GLM-5.2 最适合长上下文推理和持续任务执行是核心要求的情况,而不是很少使用的功能。
优点和缺点
- 为长期推理、编码、研究和专业工作流而设计
- 一百万令牌上下文可以容纳非常大的工作集
- 可调节的思考努力有助于平衡深度和响应速度
- 强大的工具使用和代理能力,适用于多步系统
- MIT 许可证提供了灵活的部署选项
- 大型检查点需要高级服务基础设施
- 复杂代理需要严格的评估和行动级安全措施
- 较小的模型可能更适合狭窄或高容量任务
3. Kimi K3
Kimi K3 是 Moonshot AI 的开源多模态模型,用于扩展编码、研究、推理和知识工作代理。该模型于 2026 年 7 月发布,结合了 2.8 万亿参数、本地视觉和一百万令牌上下文窗口,使其能够在不将视觉作为单独插件的情况下跨文本、代码、屏幕截图、图表、文档和长交互历史进行推理。
该模型特别适合需要许多中间决策的长期代理任务。Kimi 的代理环境旨在协调工具并在扩展会话中维持工作,而大上下文窗口可以容纳广泛的项目状态和支持材料。本地视觉还使其在界面检查、视觉文档分析和将源代码与渲染输出混合的软件工作流中具有优势。
Kimi K3 使用自定义模型条款,而不是标准的宽松软件许可证,因此团队应该检查许可证以满足其部署和分发要求。其规模意味着大多数组织将依赖于优化的服务堆栈或托管基础设施。该模型在多模态和长期执行同时重要时具有吸引力,但较轻的工作负载可能不会从中受益足以证明运营开销。
优点和缺点
- 本地视觉支持混合文本、代码、图像和界面工作流
- 一百万令牌上下文适合扩展研究和项目状态
- 为长期代理编码和知识工作而构建
- 大型模型容量支持具有挑战性的多学科任务
- 开源权重允许团队检查和适应部署行为
- 自定义许可证需要仔细审查每个预期用途
- 模型规模创建了重大服务和优化要求
- 长期自治工作流仍然需要明确的批准门和监控
4. Qwen3.6-35B-A3B
Qwen3.6-35B-A3B 是一个高效的多模态混合专家模型,具有 35 亿总参数和仅 3 亿每个令牌的激活参数。它集成了一个视觉编码器,用于图像和文本理解,同时比上述万亿参数系统更易于部署。该模型具有 262,144 令牌的本地上下文窗口,并支持扩展到大约一百万令牌的工作负载,这些工作负载真正需要额外的覆盖范围。
Qwen 将该模型定位为代理编码、工具使用、视觉推理和一般助手任务。思考状态保存可以帮助多步骤工作流在交互中继续推理,同时与 Qwen-Agent 和模型上下文协议集成的兼容性使得将模型连接到外部工具和数据变得更加容易。其相对较低的激活参数数量特别适合希望在不承诺旗舰级模型基础设施配置文件的情况下具有多模态行为的团队。
Apache 2.0 许可证支持广泛的实验和部署。与任何混合专家模型一样,实际性能取决于服务堆栈和任务,超出本地窗口的上下文扩展可能会增加内存使用和降低焦点。团队应该在基准和扩展上下文配置中都进行基准测试,而不是假设最大窗口是最佳默认值。
优点和缺点
- 仅 3 亿激活参数创建了一个高效的能力配置文件
- 本地多模态支持涵盖图像、文本、代码和视觉推理
- 适合工具调用、代理编码和 MCP 连接的应用程序
- 本地 262K 上下文可以扩展到异常大的工作负载
- Apache 2.0 许可证支持灵活的采用
- 扩展上下文操作需要额外的资源和仔细测试
- 较小的激活能力可能会在最困难的任务中落后于更大的模型
- 代理框架增加了超出基础模型的集成和可观察性工作
5. gpt-oss
OpenAI 的 gpt-oss 家族由两个文本专注的推理模型组成,用于本地、专用和可定制的部署。较大的 gpt-oss-120b 具有 117 亿总参数,每个令牌激活 5.1 亿参数,旨在在 80GB 内存中运行。较小的 gpt-oss-20b 具有 21 亿总参数,每个令牌激活 3.6 亿参数,可以在 16GB 内运行,使其能够在更广泛的工作站和边缘系统上运行。
两个变体都提供 128,000 令牌的上下文窗口、可配置的推理努力、 本地工具使用和结构化输出。它们特别适合开发人员,他们希望对推理堆栈、专用数据处理或更大应用程序中的可适应推理组件具有透明的控制。这些模型与 ChatGPT 或通过 OpenAI API 提供的模型不同;它们是用于独立部署的可下载权重。
在 Apache 2.0 下发布,gpt-oss 提供了研究和商业开发的直接条款。其仅文本设计是应用程序需要本地图像或音频理解的限制,团队仍然负责提供服务、更新、安全层和监控。两个变体中,20b 模型是受限硬件的实际起点,而 120b 更适合能够支持更大内存占用的工作负载,这些工作负载可以从更强的推理中受益。
优点和缺点
- 两个模型大小适应工作站规模和更大规模的部署
- 可配置的推理努力和本地工具使用支持代理应用程序
- 128K 上下文提供了大量文档和代码的空间
- 本地部署可以支持专用和受控工作流
- Apache 2.0 许可证允许广泛的适应和分发
- 仅文本模型不支持本地图像、音频或视频处理
- 独立部署使操作员负责服务和保障
- 较大的变体仍然需要大量内存和优化的推理
选择合适的开源 LLM
DeepSeek V4 是大规模编码和灵活推理模式的最强选择,而 GLM-5.2 强调了持续的专业和软件工作流。 Kimi K3 在需要本地视觉和长期代理工作流一起工作时脱颖而出,跨越一百万令牌上下文。
对于更高效的多模态部署, Qwen3.6-35B-A3B 结合了低激活参数计数、视觉、工具和大型本地上下文。 gpt-oss 是该组中最易访问的可控文本推理模型,适用于自管理硬件。 在提交之前,请在代表性提示上测试每个候选项,验证预期使用的许可证,并评估延迟、内存、输出质量、工具可靠性和操作保障作为一个完整的系统。













