Modèles et plateformes d’IA

Cohere lance un modèle de traduction automatique à poids ouvert de 218 milliards d’experts mixtes

mm
Ajouter Unite.AI à vos sources préférées sur Google

Cohere a publié North Small Translate le 10 septembre 2026, un modèle de traduction automatique à poids ouvert de type mixture‑of‑experts machine translation comportant 218 milliards de paramètres au total et 25 milliards de paramètres actifs, sous licence CC BY‑NC 4.0 pour la recherche et l’usage non commercial.

Cohere a décrit North Small Translate comme son premier modèle de traduction de la famille North, s’appuyant sur une lignée multilingue et de traduction allant de la famille de modèles Tiny Aya à Command A Translate. Le modèle ne traite que du texte dans les deux sens, avec un contexte d’entrée de 16 K jetons et une limite de sortie de 16 K jetons, et Cohere indique prendre en charge plus de 50 langues. Le matériel minimal requis est un GPU B200 ou deux GPU H100 avec quantification W4A4.

Benchmarks, Débit et Coût rapportés par Cohere

Cohere a indiqué un score WMT26 toutes langues de 83,60 pour North Small Translate, qui passe à 84,36 pour une variante multi‑pass agentique que l’entreprise affirme pouvoir détecter et corriger les erreurs de traduction. Dans l’évaluation de Cohere, qui utilisait GPT‑5.6‑Sol comme juge, Qwen 3.5 397B A17B a obtenu 81,56, DeepL NextGen 81,37, Gemma 4 31B (on) 79,46, GLM 5.2 FP8 76,50 et Google Translate 68,20.

Le benchmark WMT évalue les capacités générales des systèmes de traduction automatique sur un large éventail de langues, de domaines, de genres et de modalités, et sa méthodologie de notation considère les scores de 80 à 100 comme parfaits ou ne comportant que de légères erreurs. Cohere a décrit North Small Translate comme le modèle de traduction automatique dédié le plus performant dans cette évaluation, qu’il soit ouvert ou fermé, en moyenne sur l’ensemble des langues, et a indiqué qu’il offre de solides performances sur 32 langues à forte ressource et 18 langues supplémentaires.

Au niveau régional, Cohere a indiqué que le modèle devançait Gemma 4 31B (on) en Europe, avec 82,2 contre 73,9, tout en étant pratiquement à égalité en Asie du Sud, 86,2 contre 86,7. Cohere a déclaré que les deux versions surpassaient également DeepL NextGen dans toutes les régions hors Europe testées : d’environ 8 à 10 points en Asie du Sud et MENA, environ 4 à 5 points en Asie du Sud‑Est, et 1 à 3 points en Asie de l’Est, où le modèle standard s’approchait du score de 85,41 de DeepL.

Dans l’évaluation à long contexte de Cohere, qui mesure la capacité d’un modèle à traduire deux chapitres d’un livre en un seul appel avec une qualité évaluée paragraphe par paragraphe via xComet‑XL, North Small Translate a obtenu 48,9 contre 21,3 pour Google Translate et 19,4 pour Gemma 4 31B. Cohere a qualifié ce résultat de plus du double des deux références et supérieur à tous les LLM à usage général testés.

Lors de tests internes de débit avec des niveaux de concurrence et des configurations matérielles identiques, Cohere a mesuré un débit de sortie jusqu’à 1,4 fois supérieur à celui de Gemma 4 31B TP1 : 112 contre 81 jetons produits par seconde en faible concurrence et 39 contre 30 en forte concurrence, ce qui représente, selon l’entreprise, 30 à 38 % de jetons supplémentaires générés par seconde.

Pour les entreprises évaluant des licences commerciales, Cohere a indiqué un score de 80,1 à 0,000676 $ par tâche en utilisant en moyenne 661 jetons. L’entreprise a répertorié Gemini 3.1 Pro Preview (high) à 0,038928 $ par tâche, soit 5 762 % de plus, ainsi que Qwen 3.5 397B A17B et son propre Command A+ à 0,004525 $ et 0,005158 $ par tâche, en se basant sur les tarifs par jeton ou par caractère des fournisseurs de modèles.

Architecture et Couverture Linguistique

The model card describes North Small Translate as a decoder-only sparse mixture-of-experts Transformer with 128 experts, of which eight activate per token, alongside shared experts applied to every token. Attention layers interleave sliding-window attention (window size 4096, using Rotary Positional Embeddings) with global attention layers without positional embeddings in a 3:1 ratio, a design first introduced in Command A. The router applies a sigmoid activation over the expert logits and normalizes over the selected top-k. The model was post-trained specifically for translation quality.

Alors que l’annonce indique une prise en charge de plus de 50 langues, la fiche modèle énumère exactement 50 langues, dont l’anglais, l’arabe, le français, l’allemand, l’hindi, le japonais, le coréen, le russe, l’ukrainien, le vietnamien ainsi que le chinois simplifié et traditionnel. La documentation de Cohere décrit la couverture comme l’anglais plus plus de 50 variantes de langues et de paramètres régionaux, désigne l’arabe standard moderne, l’allemand, le français, le japonais, le coréen, le russe et l’ukrainien comme langues de premier niveau, et répertorie des variantes régionales telles que l’arabe égyptien, standard moderne et saoudien, le portugais du Portugal, le serbe cyrillique et le norvégien bokmål.

Licence, Accès et Partenariat avec RWS

The weights are gated on Hugging Face: downloaders must agree to share their contact information, and use is governed by the CC BY-NC 4.0 license together with Cohere Labs’ Acceptable Use Policy. Three quantization variants are available: BF16 (four B200 or eight H100 GPUs), FP8 (two B200 or four H100), and NVFP4 W4A16 (one B200 or two H100), which the model card states are the checkpoints Cohere serves in production. A hosted Hugging Face Space offers a demo of the model.

Les poids sont protégés sur Hugging Face: les téléchargeurs doivent accepter de partager leurs coordonnées, et l’utilisation est régie par la licence CC BY‑NC 4.0 ainsi que par la Politique d’utilisation acceptable de Cohere Labs. Trois variantes de quantification sont disponibles: BF16 (quatre GPU B200 ou huit GPU H100), FP8 (deux B200 ou quatre H100), et NVFP4 W4A16 (un B200 ou deux H100), que la fiche modèle indique comme les points de contrôle que Cohere met en production. Un Hugging Face Space hébergé propose une démonstration du modèle.

Le modèle est également disponible sur le niveau gratuit de l’API de Cohere via l’API Chat V2 sous l’ID de modèle north-small-translate-1-0, gratuit jusqu’à ce que les limites de taux soient atteintes, avec des licences commerciales et un déploiement disponibles via le Model Vault de Cohere, le matériel recommandé étant deux GPU H100 ou un B200. La documentation de Cohere répertorie des cas d’usage tels que la gestion des connaissances, la documentation de sécurité et d’opérations, la communication interne, ainsi que la localisation et le support client.

Cohere a indiqué que North Small Translate a été développé en partenariat avec RWS, une société de solutions d’IA dans la technologie et les services linguistiques dont les équipes de recherche et de science de Language Weaver ainsi que les experts linguistiques ont contribué à façonner les performances de traduction du modèle dans le monde réel tout au long du développement. L’entreprise affirme que RWS collabore avec plus de 80 % des 100 plus grandes marques mondiales, et que les entreprises nécessitant une plateforme dédiée de traduction et de localisation peuvent accéder au modèle via le produit Language Weaver de RWS.

Selon le compte rendu de la collaboration publié par Cohere le 1 juin 2026 dans cet article, Cohere a demandé à RWS de tester Command A Translate en juillet 2025, et d’ici septembre 2025 les deux équipes avaient commencé à travailler sur un modèle de traduction spécialisé que le billet a indiqué comme étant à l’origine de Language Weaver Pro de RWS. Cohere a rapporté que Language Weaver Pro a obtenu 55 % de victoires globales au niveau des phrases face à DeepL NextGen dans les évaluations humaines et a surpassé les concurrents dans les benchmarks automatisés dans 31 des 32 langues couramment utilisées dans les domaines d’entreprise. Le PDG de RWS, Ben Faes, a décrit le modèle derrière Language Weaver Pro comme le cerveau du produit.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.