KI-Modelle und Plattformen
Cohere präsentiert Open-Weight 218B Mixture-of-Experts-Maschinenübersetzungsmodell

Cohere veröffentlichte North Small Translate am 10. September 2026, ein Open‑Weight Mixture‑of‑Experts Maschinenübersetzungsmodell mit insgesamt 218 Milliarden Parametern und 25 Milliarden aktiven Parametern, lizenziert für Forschung und nicht‑kommerzielle Nutzung unter CC BY‑NC 4.0.
Cohere beschreibt North Small Translate als sein erstes Übersetzungsmodell der North‑Modellfamilie, das auf einer mehrsprachigen und Übersetzungslinie aufbaut, die von der Tiny‑Aya‑Modellfamilie über Command A Translate reicht. Das Modell arbeitet in beiden Richtungen rein mit Text, verfügt über einen Eingabekontext von 16 K‑Token und ein Ausgabelimit von 16 K‑Token, und Cohere gibt an, mehr als 50 Sprachen zu unterstützen. Die minimale Hardware besteht aus einer B200‑GPU oder zwei H100‑GPUs bei W4A4‑Quantisierung.
Cohere‑gemeldete Benchmarks, Durchsatz und Kosten
Cohere meldete für North Small Translate einen WMT26‑All‑Languages‑Score von 83,60, der für eine agentische Multi‑Pass‑Variante auf 84,36 anstieg, von der das Unternehmen sagt, dass sie Fehler in Übersetzungen finden und beheben kann. In Coheres Bewertung, bei der GPT‑5.6‑Sol als Richter eingesetzt wurde, erzielte Qwen 3.5 397B A17B 81,56, DeepL NextGen 81,37, Gemma 4 31B (on) 79,46, GLM 5.2 FP8 76,50 und Google Translate 68,20.
Der WMT‑Benchmark bewertet die allgemeinen Fähigkeiten von Maschinenübersetzungssystemen über ein breites Spektrum an Sprachen, Domänen, Genres und Modalitäten, und seine Bewertungsmethodik betrachtet Scores von 80 bis 100 als perfekt bzw. nur mit geringfügigen Fehlern. Cohere beschrieb North Small Translate als das leistungsstärkste dedizierte Maschinenübersetzungsmodell in der Bewertung, offen oder geschlossen, im Durchschnitt über alle Sprachen hinweg, und sagte, es zeige starke Leistungen in 32 ressourcenreichen Sprachen und weiteren 18 Sprachen.
Auf regionaler Ebene berichtete Cohere, dass das Modell Gemma 4 31B (on) in Europa mit 82,2 zu 73,9 übertroffen habe, während es in Südasien mit 86,2 zu 86,7 praktisch gleich liege. Cohere sagte, beide Versionen hätten DeepL NextGen in jeder getesteten nicht‑europäischen Region übertroffen: um etwa 8 bis 10 Punkte in Südasien und MENA, etwa 4 bis 5 Punkte in Südostasien und 1 bis 3 Punkte in Ostasien, wo das Standardmodell an DeepLs Score von 85,41 heranreichte.
In Coheres Langzeit‑Kontext‑Bewertung, die misst, wie gut ein Modell zwei Kapitel eines Buches in einem einzigen Aufruf mit pro‑Absatz‑Qualität über xComet‑XL übersetzt, erzielte North Small Translate 48,9 gegenüber 21,3 für Google Translate und 19,4 für Gemma 4 31B. Cohere bezeichnete dieses Ergebnis als mehr als das Doppelte beider Baselines und als besser als jedes getestete General‑Purpose‑LLM.
Bei internen Durchsatztests unter identischen Parallelitäts‑ und Hardware‑Konfigurationen maß Cohere bis zu 1,4‑mal höheren Ausgabedurchsatz als Gemma 4 31B TP1: 112 gegenüber 81 Ausgabetoken pro Sekunde bei niedriger Parallelität und 39 gegenüber 30 bei hoher Parallelität, was das Unternehmen mit 30 % bis 38 % mehr pro Sekunde generierten Token angab.
Für Unternehmen, die kommerzielle Lizenzen evaluieren, meldete Cohere einen Score von 80,1 bei $0,000676 pro Aufgabe bei durchschnittlich 661 Token. Das Unternehmen listete Gemini 3.1 Pro Preview (hoch) mit $0,038928 pro Aufgabe, angegeben als 5 762 % mehr, sowie Qwen 3.5 397B A17B und das eigene Command A+ mit $0,004525 bzw. $0,005158 pro Aufgabe, wobei die Preisgestaltung pro Token oder pro Zeichen von den Websites der Modellanbieter stammt.
Architektur und Sprachabdeckung
Die Model‑Card beschreibt North Small Translate als einen rein decoder‑basierten, spärlichen Mixture‑of‑Experts‑Transformer mit 128 Experten, von denen pro Token acht aktiviert werden, zusätzlich zu gemeinsamen Experten, die auf jedes Token angewendet werden. Aufmerksamkeits‑Schichten wechseln Sliding‑Window‑Attention (Fenstergröße 4096, mit Rotary Positional Embeddings) mit globalen Attention‑Schichten ohne Positions‑Embeddings im Verhältnis 3 : 1, ein Design, das erstmals in Command A eingeführt wurde. Der Router wendet eine Sigmoid‑Aktivierung auf die Expert‑Logits an und normalisiert über die ausgewählten Top‑k. Das Modell wurde speziell für Übersetzungsqualität nachtrainiert.
Während die Ankündigung von Unterstützung für mehr als 50 Sprachen spricht, listet die Model‑Card exakt 50 auf, darunter Englisch, Arabisch, Französisch, Deutsch, Hindi, Japanisch, Koreanisch, Russisch, Ukrainisch, Vietnamesisch sowie vereinfachtes und traditionelles Chinesisch. Coheres Dokumentation beschreibt die Abdeckung als Englisch plus mehr als 50 Sprach‑ und Gebietsschema‑Varianten, nennt Modernes Standard‑Arabisch, Deutsch, Französisch, Japanisch, Koreanisch, Russisch und Ukrainisch als Tier‑1‑Sprachen und führt Gebietsschema‑Varianten wie Ägyptisch‑, Modernes‑Standard‑ und Saudi‑Arabisch, Portugal‑Portugiesisch, kyrillisches Serbisch und Norwegisch Bokmål auf.
Lizenzierung, Zugang und die RWS‑Partnerschaft
Die Gewichte sind auf Hugging Face: gesperrt; Downloader müssen zustimmen, ihre Kontaktdaten zu teilen, und die Nutzung unterliegt der Lizenz CC BY‑NC 4.0 zusammen mit Cohere Labs’ Acceptable Use‑Policy. Drei Quantisierungs‑Varianten stehen zur Verfügung: BF16 (vier B200‑ oder acht H100‑GPUs), FP8 (zwei B200‑ oder vier H100‑GPUs) und NVFP4 W4A16 (eine B200‑ oder zwei H100‑GPUs), die laut Model‑Card die von Cohere in Produktion bereitgestellten Checkpoints sind. Ein gehosteter Hugging Face Space bietet eine Demo des Modells.
Das Modell wird zudem über Coheres kostenlose API‑Stufe im Chat V2‑API mit der Modell‑ID north-small-translate-1-0 bereitgestellt, kostenlos bis zu Erreichen der Rate‑Limits, wobei kommerzielle Lizenzierung und Bereitstellung über Coheres Model Vault bei empfohlener Hardware von zwei H100‑GPUs oder einer B200‑GPU möglich ist. Coheres Dokumentation führt Anwendungsfälle wie Wissensmanagement, Sicherheits‑ und Betriebsdokumentation, interne Kommunikation sowie Lokalisierung und Kundensupport auf.
Cohere erklärte, dass North Small Translate in Zusammenarbeit mit RWS entwickelt wurde, einem KI‑Lösungsunternehmen im Bereich Sprach‑Technologie und -Dienstleistungen, dessen Language‑Weaver‑Forschungs‑ und Wissenschaftsteams sowie Sprachexperten die reale Übersetzungsleistung des Modells während der Entwicklung prägten. Das Unternehmen gibt an, dass RWS mit mehr als 80 % der weltweit führenden 100 Marken zusammenarbeitet und dass Unternehmen, die eine dedizierte Übersetzungs‑ und Lokalisierungsplattform benötigen, über RWSs Language‑Weaver‑Produkt auf das Modell zugreifen können.
Gemäß Coheres Juni‑1‑2026‑Bericht über die Zusammenarbeit bat Cohere RWS im Juli 2025, Command A Translate zu testen, und bis September 2025 hatten die beiden Teams mit der Arbeit an einem spezialisierten Übersetzungsmodell begonnen, das laut Beitrag RWSs Language Weaver Pro antreibt. Cohere berichtete, dass Language Weaver Pro in menschlichen Bewertungen 55 % der Gesamtsatz‑Gewinne gegenüber DeepL NextGen erzielte und in automatisierten Benchmarks in 31 von 32 häufig in Unternehmensdomänen genutzten Sprachen die Konkurrenz übertraf. RWS‑CEO Ben Faes beschrieb das Modell hinter Language Weaver Pro als das Gehirn des Produkts.












