Modelos e plataformas de IA

Cohere lança modelo de tradução automática de mistura de especialistas de peso aberto com 218 bilhões de parâmetros

mm
Adicione Unite.AI às suas fontes preferidas no Google

Cohere lançou North Small Translate em 10 de setembro de 2026, um modelo de tradução automática de mistura de especialistas de peso aberto com 218 bilhões de parâmetros totais e 25 bilhões de parâmetros ativos, licenciado para pesquisa e uso não comercial sob CC BY-NC 4.0.

Cohere descreveu o North Small Translate como seu primeiro modelo de tradução na família de modelos North, baseado em uma linhagem multilíngue e de tradução que vai da família Tiny Aya até o Command A Translate. O modelo funciona apenas com texto em ambas as direções, com um contexto de entrada de 16 K tokens e um limite de saída de 16 K tokens, e a Cohere indica suporte a mais de 50 idiomas. O hardware mínimo é uma GPU B200 ou duas GPUs H100 com quantização W4A4.

Métricas, Vazão e Custo Relatados pela Cohere

A Cohere relatou uma pontuação de 83,60 no WMT26 em todos os idiomas para o North Small Translate, subindo para 84,36 em uma variante multi‑passo agente que a empresa afirma ser capaz de encontrar e corrigir erros de tradução. Na avaliação da Cohere, que utilizou o GPT-5.6-Sol como juiz, o Qwen 3.5 397B A17B obteve 81,56, o DeepL NextGen 81,37, o Gemma 4 31B (on) 79,46, o GLM 5.2 FP8 76,50 e o Google Translate 68,20.

O benchmark WMT avalia as capacidades gerais dos sistemas de tradução automática em uma ampla variedade de idiomas, domínios, gêneros e modalidades, e sua metodologia de pontuação considera notas de 80 a 100 como perfeitas ou com apenas erros menores. A Cohere descreveu o North Small Translate como o modelo de tradução automática dedicado de melhor desempenho na avaliação, aberto ou fechado, em média em todos os idiomas, e afirmou que ele tem desempenho sólido em 32 idiomas de alto recurso e em mais 18 idiomas adicionais.

Em nível regional, a Cohere relatou que o modelo superou o Gemma 4 31B (on) na Europa, 82,2 contra 73,9, enquanto ficou praticamente empatado na Ásia do Sul, 86,2 contra 86,7. A Cohere afirmou que ambas as versões também superaram o DeepL NextGen em todas as regiões não europeias testadas: cerca de 8 a 10 pontos na Ásia do Sul e MENA, aproximadamente 4 a 5 pontos no Sudeste Asiático e de 1 a 3 pontos no Leste Asiático, onde o modelo padrão se aproximou da pontuação 85,41 da DeepL.

Na avaliação de longo contexto da Cohere, que mede o quão bem um modelo traduz dois capítulos de um livro em uma única chamada com qualidade por parágrafo avaliada pelo xComet-XL, o North Small Translate obteve 48,9 contra 21,3 do Google Translate e 19,4 do Gemma 4 31B. A Cohere descreveu esse resultado como mais do que o dobro de ambas as linhas de base e à frente de todos os LLMs de uso geral que testou.

Em testes internos de vazão sob níveis idênticos de simultaneidade e configurações de hardware, a Cohere mediu até 1,4 vezes maior vazão de saída que o Gemma 4 31B TP1: 112 contra 81 tokens de saída por segundo em baixa simultaneidade e 39 contra 30 em alta simultaneidade, o que a empresa estimou em 30 a 38 % a mais de tokens gerados por segundo.

Para empresas que avaliam licenças comerciais, a Cohere relatou uma pontuação de 80,1 a US$ 0,000676 por tarefa, usando em média 661 tokens. A empresa listou o Gemini 3.1 Pro Preview (high) a US$ 0,038928 por tarefa, indicado como 5 762 % a mais, e o Qwen 3.5 397B A17B e seu próprio Command A+ a US$ 0,004525 e US$ 0,005158 por tarefa, utilizando preços por token ou por caractere das páginas dos provedores de modelo.

Arquitetura e Cobertura de Idiomas

O model card descreve o North Small Translate como um Transformer de mistura de especialistas esparso apenas decodificador, com 128 especialistas, dos quais oito são ativados por token, além de especialistas compartilhados aplicados a todos os tokens. As camadas de atenção intercalam atenção de janela deslizante (tamanho da janela 4096, usando Rotary Positional Embeddings) com camadas de atenção global sem embeddings posicionais numa proporção de 3:1, um design introduzido inicialmente no Command A. O roteador aplica uma ativação sigmoide sobre os logits dos especialistas e normaliza sobre os top‑k selecionados. O modelo foi pós‑treinado especificamente para qualidade de tradução.

Embora o anúncio mencione suporte a mais de 50 idiomas, o model card enumera exatamente 50, incluindo Inglês, Árabe, Francês, Alemão, Hindi, Japonês, Coreano, Russo, Ucraniano, Vietnamita e Chinês Simplificado e Tradicional. A documentação da Cohere descreve a cobertura como Inglês mais mais de 50 variantes de idiomas e localidades, nomeia Árabe Moderno Padrão, Alemão, Francês, Japonês, Coreano, Russo e Ucraniano como idiomas de primeira camada, e lista variantes de localidades como Árabe Egípcio, Árabe Moderno Padrão e Árabe Saudita, Português de Portugal, Sérvio em alfabeto cirílico e Norueguês Bokmål.

Licenciamento, Acesso e a Parceria com a RWS

Os pesos são controlados no Hugging Face: os usuários que baixam devem concordar em compartilhar suas informações de contato, e o uso é regido pela licença CC BY-NC 4.0 juntamente com a Política de Uso Aceitável da Cohere Labs. Três variantes de quantização estão disponíveis: BF16 (quatro B200 ou oito H100 GPUs), FP8 (duas B200 ou quatro H100), e NVFP4 W4A16 (uma B200 ou duas H100), que o model card indica como os checkpoints que a Cohere oferece em produção. Um Hugging Face Space hospedado oferece uma demonstração do modelo.

O modelo também é disponibilizado na camada gratuita da API da Cohere por meio da API Chat V2 sob o ID de modelo north-small-translate-1-0, gratuito até que os limites de taxa sejam atingidos, com licenciamento comercial e implantação disponíveis através do Model Vault da Cohere, com hardware sugerido de duas GPUs H100 ou uma B200. A documentação da Cohere lista casos de uso incluindo gestão de conhecimento, documentação de segurança e operações, comunicação interna e localização e suporte ao cliente.

A Cohere afirmou que o North Small Translate foi desenvolvido em parceria com a RWS, uma empresa de soluções de IA em tecnologia e serviços de linguagem, cujas equipes de pesquisa e ciência do Language Weaver e especialistas linguísticos ajudaram a moldar o desempenho de tradução do modelo no mundo real ao longo do desenvolvimento. A empresa declara que a RWS trabalha com mais de 80 % das 100 maiores marcas globais, e que empresas que precisam de uma plataforma dedicada de tradução e localização podem acessar o modelo através do produto Language Weaver da RWS.

De acordo com o relato da Cohere de 1º de junho de 2026 sobre a colaboração, a Cohere solicitou à RWS que testasse o Command A Translate em julho de 2025 e, em setembro de 2025, as duas equipes iniciaram o trabalho em um modelo de tradução especializado que, segundo a postagem, passou a alimentar o Language Weaver Pro da RWS. A Cohere relatou que o Language Weaver Pro alcançou 55 % de vitórias globais ao nível de sentença contra o DeepL NextGen em avaliações humanas e superou os concorrentes em benchmarks automatizados em 31 de 32 idiomas comumente usados em domínios empresariais. O CEO da RWS, Ben Faes, descreveu o modelo por trás do Language Weaver Pro como o cérebro do produto.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.