AI 模型与平台
Cohere 推出开放权重 2180 亿专家混合机器翻译模型

Cohere 于2026年9月10日发布了North Small Translate,这是一款开放权重的专家混合机器翻译模型,拥有2180 亿总参数和250 亿活跃参数,采用 CC BY-NC 4.0 许可证,仅供研究和非商业用途。
Cohere 将 North Small Translate 描述为其 North 系列模型中的首款翻译模型,基于从 Tiny Aya 系列到 Command A Translate 的多语言翻译血脉。该模型仅支持文本双向翻译,输入上下文为 16K 令牌,输出上限亦为 16K 令牌,且支持超过 50 种语言。最低硬件要求为一块 B200 GPU 或两块 H100 GPU,采用 W4A4 量化。
Cohere 报告的基准、吞吐量和成本
Cohere 报告称,North Small Translate 在 WMT26 全语言测试中得分 83.60,使用公司称能够发现并修正翻译错误的自主多遍变体后得分提升至 84.36。在 Cohere 的评估中,评判模型为 GPT-5.6-Sol,Qwen 3.5 397B A17B 得分 81.56,DeepL NextGen 为 81.37,Gemma 4 31B (on) 为 79.46,GLM 5.2 FP8 为 76.50,Google Translate 为 68.20。
WMT 基准评估机器翻译系统在多语言、不同领域、体裁和模态下的整体能力,其评分方法将 80 到 100 分视为完美或仅有轻微错误。Cohere 将 North Small Translate 描述为该评估中表现最佳的专用机器翻译模型(无论开源或闭源),在所有语言上的平均表现均居首,并指出其在 32 种高资源语言和另外 18 种语言上表现出色。
在地区层面,Cohere 报告称该模型在欧洲以 82.2 对 73.9 超越 Gemma 4 31B (on),而在南亚则基本持平,分别为 86.2 对 86.7。Cohere 还表示,两种版本在所有非欧洲测试地区均优于 DeepL NextGen:在南亚和中东北非地区约高出 8 至 10 分,东南亚约高出 4 至 5 分,东亚则高出 1 至 3 分,而标准模型的得分接近 DeepL 的 85.41 分:
在 Cohere 的长上下文评估中,该评估衡量模型在一次调用中翻译一本书的两章并通过 xComet-XL 对每段质量打分,North Small Translate 获得 48.9 分,而 Google Translate 为 21.3 分,Gemma 4 31B 为 19.4 分。Cohere 将此结果描述为超过两倍的基线分数,并领先于其测试的所有通用大模型。
在相同并发水平和硬件配置下的内部吞吐量测试中,Cohere 测得相较于 Gemma 4 31B TP1 的输出吞吐量高出约 1.4 倍: 低并发时每秒输出 112 个令牌对比 81 个,高并发时为 39 对比 30,公司的计算显示每秒生成的令牌提升了 30% 至 38%。
对于评估商业授权的企业,Cohere 报告称其在平均使用 661 个令牌的情况下,每任务费用为 $0.000676,得分为 80.1。公司列出 Gemini 3.1 Pro Preview(高)每任务费用 $0.038928,约高出 5,762%;以及 Qwen 3.5 397B A17B 和自家的 Command A+,每任务费用分别为 $0.004525 和 $0.005158,采用模型提供商网站上的按令牌或按字符计价方式。
架构与语言覆盖
模型卡片将 North Small Translate 描述为仅解码器的稀疏专家混合 Transformer,拥有 128 位专家,每个令牌激活其中八位,同时还有适用于所有令牌的共享专家。注意力层交替使用滑动窗口注意力(窗口大小 4096,采用 Rotary 位置嵌入)和不含位置嵌入的全局注意力层,比例为 3:1,此设计首次出现在 Command A 中。路由器对专家 logits 进行 sigmoid 激活并在选定的 top‑k 上归一化。该模型经过专门的后训练,以提升翻译质量。
公告中提到支持超过 50 种语言,而模型卡片列出了恰好 50 种语言,包括英语、阿拉伯语、法语、德语、印地语、日语、韩语、俄语、乌克兰语、越南语以及简体中文和繁体中文。Cohere 的文档将覆盖范围描述为英语加上超过 50 种语言和地区变体,称现代标准阿拉伯语、德语、法语、日语、韩语、俄语和乌克兰语为一级语言,并列出地区变体,如埃及阿拉伯语、现代标准阿拉伯语、沙特阿拉伯语、葡萄牙葡语、西里尔字母塞尔维亚语以及挪威 Bokmål。
授权、访问方式与 RWS 合作伙伴关系
模型权重在 Hugging Face: 上受限下载,下载者必须同意提供联系信息,使用受 CC BY-NC 4.0 许可证以及 Cohere Labs 可接受使用政策约束。提供三种量化变体: BF16(四块 B200 或八块 H100 GPU)、FP8(两块 B200 或四块 H100)以及 NVFP4 W4A16(一块 B200 或两块 H100),模型卡片声明这些即为 Cohere 在生产环境中提供的检查点。Hugging Face Space 托管的空间提供了模型演示。
该模型亦通过 Cohere 的 API 免费层在 Chat V2 API 中提供,模型 ID 为 north-small-translate-1-0,免费使用直至达到速率限制;商业授权和部署可通过 Cohere 的 Model Vault 获得,建议硬件为两块 H100 GPU 或一块 B200。Cohere 文档列出的使用场景包括知识管理、安全与运营文档、内部沟通以及本地化和客户支持。
Cohere 表示 North Small Translate 是与 RWS 合作开发的,RWS 是一家专注于语言技术和服务的 AI 解决方案公司,其 Language Weaver 研究与科学团队以及语言专家在整个开发过程中帮助塑造了模型的真实翻译性能。该公司称 RWS 与全球前 100 大品牌中超过 80% 有合作,企业若需要专用的翻译与本地化平台,可通过 RWS 的 Language Weaver 产品获取该模型。
根据 Cohere 于2026 年 6 月 1 日发布的合作报道,Cohere 于 2025 年 7 月邀请 RWS 测试 Command A Translate,至 2025 年 9 月,两支团队开始研发一种专用翻译模型,文章称该模型为 RWS 的 Language Weaver Pro 提供动力。Cohere 报告称,Language Weaver Pro 在人工评估中相较于 DeepL NextGen 在整体句子层面取得 55% 的胜率,并在 32 种企业常用语言中有 31 种的自动基准测试中超越竞争对手。RWS CEO Ben Faes 将 Language Weaver Pro 背后的模型描述为该产品的“大脑”。












