AI 모델 및 플랫폼
Cohere, 오픈-웨이트 218B 전문가 혼합 기계 번역 모델 출시

Cohere는 2026년 9월 10일에 North Small Translate를 출시했으며, 이는 2180억 개의 총 파라미터와 250억 개의 활성 파라미터를 가진 오픈-웨이트 전문가 혼합 기계 번역 모델이며, 연구 및 비상업적 사용을 위해 CC BY-NC 4.0 라이선스로 제공됩니다.
Cohere는 North Small Translate를 North 모델 패밀리의 첫 번째 번역 모델이라고 설명했으며, Tiny Aya 모델 패밀리에서 Command A Translate에 이르는 다국어 및 번역 계보를 기반으로 합니다. 이 모델은 양방향 텍스트 전용이며, 16K 토큰 입력 컨텍스트와 16K 토큰 출력 제한을 가지고 있으며, 50개 이상의 언어를 지원한다고 밝혔습니다. 최소 하드웨어 사양은 W4A4 양자화에서 B200 GPU 1대 또는 H100 GPU 2대입니다.
Cohere가 보고한 벤치마크, 처리량 및 비용
Cohere는 North Small Translate에 대해 WMT26 전체 언어 점수가 83.60이라고 보고했으며, 번역 오류를 찾아 수정할 수 있다고 회사가 말하는 에이전트형 다중 패스 변형에서는 84.36으로 상승했습니다. Cohere의 평가에서는 판단 기준으로 GPT-5.6-Sol을 사용했으며, Qwen 3.5 397B A17B는 81.56, DeepL NextGen은 81.37, Gemma 4 31B (on)은 79.46, GLM 5.2 FP8은 76.50, Google Translate는 68.20을 기록했습니다.
WMT 벤치마크는 다양한 언어, 도메인, 장르 및 양식에 걸쳐 기계 번역 시스템의 일반적인 역량을 평가하며, 80점에서 100점 사이의 점수를 완벽하거나 사소한 오류만 있는 것으로 간주합니다. Cohere는 North Small Translate를 평가에서 개방형이든 폐쇄형이든 모든 언어에 대해 평균적으로 가장 높은 성능을 보이는 전용 기계 번역 모델이라고 설명했으며, 32개의 고자원 언어와 추가 18개 언어에서 강력한 성능을 나타낸다고 밝혔습니다.
지역별로는 Cohere가 모델이 유럽에서 Gemma 4 31B (on)을 82.2 대 73.9로 앞섰으며, 남아시아에서는 거의 동등한 86.2 대 86.7 수준을 보였다고 보고했습니다. Cohere는 두 버전 모두 유럽 외 모든 지역에서 DeepL NextGen보다 우수했으며, 테스트된: 남아시아와 MENA에서는 약 8~10점, 동남아시아에서는 약 4~5점, 동아시아에서는 1~3점 차이로 DeepL의 85.41점에 근접했다고 밝혔습니다.
Cohere의 장문 컨텍스트 평가에서는, 모델이 한 번의 호출로 책의 두 챕터를 번역하고 각 문단의 품질을 xComet-XL을 통해 점수화하는 방식을 측정했습니다. North Small Translate는 Google Translate의 21.3점과 Gemma 4 31B의 19.4점을 크게 앞서 48.9점을 기록했습니다. Cohere는 이 결과가 두 기준선보다 두 배 이상 높으며, 테스트한 모든 범용 LLM보다 앞선다고 설명했습니다.
동일한 동시성 수준과 하드웨어 구성에서 내부 처리량 테스트를 수행한 결과, Cohere는 Gemma 4 31B TP1: 대비 최대 1.4배 높은 출력 처리량을 측정했습니다. 낮은 동시성에서는 초당 112 토큰 대비 81 토큰, 높은 동시성에서는 39 토큰 대비 30 토큰을 기록했으며, 이는 초당 생성 토큰이 30~38% 더 많다는 의미입니다.
상업 라이선스를 평가하는 기업을 위해, Cohere는 평균 661 토큰당 작업당 $0.000676에 80.1점의 점수를 보고했습니다. 회사는 Gemini 3.1 Pro Preview (high)를 작업당 $0.038928로 제시했으며, 이는 5,762% 더 높은 비용이라고 밝혔고, Qwen 3.5 397B A17B와 자체 Command A+는 각각 작업당 $0.004525와 $0.005158로, 모델 제공업체 웹사이트의 토큰당 또는 문자당 가격을 사용했습니다.
아키텍처 및 언어 지원
모델 카드에 따르면 North Small Translate는 128명의 전문가를 가진 디코더 전용 희소 전문가 혼합 Transformer이며, 토큰당 8명의 전문가가 활성화되고 모든 토큰에 적용되는 공유 전문가도 존재합니다. 어텐션 레이어는 슬라이딩 윈도우 어텐션(윈도우 크기 4096, Rotary Positional Embeddings 사용)과 위치 임베딩이 없는 전역 어텐션 레이어를 3:1 비율로 교차합니다. 이 설계는 Command A에서 처음 도입되었습니다. 라우터는 전문가 로짓에 시그모이드 활성화를 적용하고 선택된 top‑k에 대해 정규화합니다. 모델은 번역 품질을 위해 사후 학습되었습니다.
발표에서는 50개 이상의 언어를 지원한다고 했지만, 모델 카드에서는 정확히 50개를 열거하고 있으며, 여기에는 영어, 아랍어, 프랑스어, 독일어, 힌디어, 일본어, 한국어, 러시아어, 우크라이나어, 베트남어, 그리고 간체·번체 중국어가 포함됩니다. Cohere의 문서에서는 커버리지를 영어와 50개 이상의 언어 및 로케일 변형으로 설명하고, 현대 표준 아랍어, 독일어, 프랑스어, 일본어, 한국어, 러시아어, 우크라이나어를 1등 언어로 명시하며, 이집트 아랍어, 현대 표준 아랍어, 사우디 아랍어, 포르투갈 포르투갈어, 키릴 문자 세르비아어, 노르웨이 보크몰 등 로케일 변형을 나열합니다.
라이선스, 접근 및 RWS 파트너십
가중치는 Hugging Face:에서 게이트되며, 다운로드자는 연락처 정보를 공유하는 데 동의해야 하고, 사용은 CC BY‑NC 4.0 라이선스와 Cohere Labs의 허용 사용 정책에 의해 규정됩니다. 세 가지 양자화 변형이 제공됩니다: BF16( B200 4대 또는 H100 8대), FP8( B200 2대 또는 H100 4대), NVFP4 W4A16( B200 1대 또는 H100 2대)이며, 모델 카드는 이것이 Cohere가 프로덕션에서 제공하는 체크포인트라고 명시합니다. 호스팅된 Hugging Face Space에서 모델 데모를 제공합니다.
이 모델은 Cohere의 API 무료 티어에서도 Chat V2 API를 통해 모델 ID north-small-translate-1-0으로 제공되며, 속도 제한에 도달할 때까지 무료이며, 상업적 라이선스와 배포는 Cohere의 Model Vault를 통해 제공되고 권장 하드웨어는 H100 GPU 2대 또는 B200 1대입니다. Cohere의 문서에서는 지식 관리, 안전 및 운영 문서, 내부 커뮤니케이션, 현지화 및 고객 지원 등을 활용 사례로 나열하고 있습니다.
Cohere는 North Small Translate가 언어 기술 및 서비스 분야의 AI 솔루션 기업인 RWS와의 파트너십을 통해 개발되었으며, RWS의 Language Weaver 연구·과학 팀과 언어 전문가들이 개발 전반에 걸쳐 모델의 실제 번역 성능을 형성하는 데 기여했다고 밝혔습니다. RWS는 전 세계 상위 100대 브랜드 중 80% 이상과 협력하고 있으며, 전용 번역·현지화 플랫폼이 필요한 기업은 RWS의 Language Weaver 제품을 통해 모델에 접근할 수 있다고 설명했습니다.
Cohere의 2026년 6월 1일 협업 기사에 따르면, Cohere는 2025년 7월에 RWS에게 Command A Translate를 테스트해 달라고 요청했으며, 2025년 9월까지 양팀은 RWS의 Language Weaver Pro에 동력을 제공한 특수 번역 모델 작업을 시작했습니다. Cohere는 Language Weaver Pro가 인간 평가에서 DeepL NextGen 대비 전체 문장 수준에서 55%의 승률을 기록했으며, 기업 도메인에서 일반적으로 사용되는 32개 언어 중 31개에서 자동 벤치마크에서 경쟁자를 앞섰다고 보고했습니다. RWS CEO Ben Faes는 Language Weaver Pro 뒤의 모델을 제품의 두뇌라고 설명했습니다.












