Modelos e plataformas de IA
Moonshot Abre os Pesos de Kimi K3 sob uma Licença com Níveis de Receita

A Moonshot AI publicou os pesos completos do modelo Kimi K3 em 27 de julho de 2026, onze dias após o laboratório de Pequim lançar o modelo como um serviço hospedado. Os pesos e o relatório técnico foram publicados juntos no Hugging Face e no GitHub, sob um conjunto personalizado de termos que a empresa chama de Licença Kimi K3.
Kimi K3 é um modelo de mistura de especialistas com 2,8 trilhões de parâmetros totais, dos quais 104 bilhões são ativados em qualquer token dado. Ele possui uma janela de contexto de 1 milhão de tokens, aceita texto e imagens nativamente por meio de um codificador de visão chamado MoonViT-V2 e encaminha cada token para 16 de 896 especialistas. A Moonshot o descreve como o primeiro modelo aberto na classe de 3 trilhões de parâmetros.
A arquitetura é onde o laboratório concentrou seu trabalho. A atenção delta de Kimi lida com 69 das 93 camadas do modelo, com 24 camadas de atenção latente portão ao lado e um mecanismo que o laboratório chama de Resíduos de Atenção, que recupera representações seletivamente em profundidade em vez de acumulá-las uniformemente. A Moonshot relata que essa combinação, combinada com sua rota de LatentMoE estável, resultou em uma melhoria de cerca de 2,5 vezes na eficiência de escalabilidade em comparação com o Kimi K2.
O que a licença permite
A Licença Kimi K3 se assemelha à licença MIT na maior parte de sua extensão. Ela concede a qualquer pessoa, gratuitamente, o direito de usar, copiar, modificar, distribuir, sublicenciar e vender o software, e de executar, implantar, ajustar ou construir obras derivadas a partir dos pesos.
Dois condições se aplicam acima de uma linha de receita:
- Um licenciado que executa um negócio de “Modelo como um Serviço”, definido na licença como dar a terceiros acesso a inferência ou ajuste com controle significativo sobre entradas, parâmetros ou dados de treinamento, deve assinar um acordo separado com a Moonshot uma vez que a receita do licenciado e de suas afiliadas ultrapasse US$ 20 milhões em qualquer período de 12 meses consecutivos.
- Qualquer produto ou serviço comercial com mais de 100 milhões de usuários ativos por mês, ou mais de US$ 20 milhões em receita mensal, deve exibir “Kimi K3” proeminente em sua interface.
Nenhuma das condições se aplica a uso puramente interno, ou a acesso por meio dos próprios produtos da Moonshot e de seus parceiros de inferência certificados. Produtos que incorporam o modelo dentro de uma funcionalidade ou conjunto específico, ou que simplesmente retransmitem solicitações para um modelo hospedado por outra entidade, ficam fora da definição de serviço.
O efeito prático é uma divisão por modelo de negócios em vez de por usuário. Uma equipe que ajusta o K3 em sua própria infraestrutura não tem nenhuma obrigação. Um provedor de nuvem que revende inferência do K3 em larga escala precisa de um contrato com a Moonshot antes de fazê-lo.
O lançamento também cai dentro de um argumento já em andamento em Washington. A Nvidia e a Microsoft apoiaram a inteligência artificial de pesos abertos (MSFT ) (NVDA ) em uma carta conjunta em 24 de julho de 2026, e o diretor executivo da OpenAI, Sam Altman, levou a próxima família de modelos da OpenAI a legisladores e funcionários da administração em Washington no mesmo dia em que os pesos foram lançados. Um modelo de 2,8 trilhões de parâmetros baixável de um laboratório chinês agora é um ponto fixo nesse debate.
Onde as avaliações o colocam
A Análise Artificial avaliou o Kimi K3 em 57 no Índice de Inteligência enquanto o modelo ainda era apenas uma API, colocando-o em terceiro lugar geral e empatado com o Claude Opus 4.8 e o GPT-5.5, atrás do Claude Fable 5 e do GPT-5.6 Sol. As alternativas de pesos abertos mais fortes nesse índice estavam bem abaixo: GLM-5.2 em 51 e DeepSeek V4 Pro em 44.
Os números agênticos foram a parte mais forte dessa avaliação. A Análise Artificial mediu o K3 em 1668 Elo no GDPval-AA v2, subindo de 1190 para o Kimi K2.6, e o colocou em primeiro lugar no AutomationBench-AA com 53%. O custo por tarefa foi de US$ 0,94, próximo ao GPT-5.6 Sol e cerca de metade do preço do Opus 4.8.
A própria tabela de benchmark da Moonshot relata 93,5% no GPQA Diamond e 91,2 no BrowseComp, com notas de rodapé divulgando que diferentes modelos foram executados sob diferentes conjuntos de agente. O post de lançamento do laboratório diz que o desempenho geral ainda está atrás do Fable 5 e do GPT-5.6 Sol, e nomeia uma lacuna de experiência do usuário contra ambos como uma limitação. Agora que o próprio checkpoint é baixável, esses números podem ser reexecutados por qualquer pessoa em vez de serem aceitos a partir do conjunto do fornecedor.
O que é necessário para executá-lo
A Moonshot recomenda implantar o K3 em configurações de supernóde com 64 ou mais aceleradores, e aponta para o vLLM, SGLang e TokenSpeed como motores de inferência suportados. Como a atenção delta de Kimi quebra o cache de prefixo convencional, o laboratório contribuiu com sua própria implementação de cache para o projeto vLLM junto com o lançamento. Os pesos são enviados quantizados nativamente, com treinamento com quantização aplicado desde a etapa de ajuste supervisionado em diante.
Um detalhe de implantação é mais importante do que sua posição na carta do modelo sugere. O K3 foi treinado no que a Moonshot chama de modo de histórico de pensamento preservado, que exige que um conjunto de agente passe a mensagem completa do modelo anterior, conteúdo de raciocínio e chamadas de ferramenta incluídas, de volta à conversa. Equipes que a largam, ou que mudam uma sessão em execução de outro modelo no meio de uma tarefa, devem esperar saída instável.
A API hospedada da Moonshot permanece em US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de tokens de saída, com entrada em cache a US$ 0,30. O que o lançamento adiciona é uma alternativa a essa medição: os pesos, a licença e o relatório que descreve como o modelo foi treinado estão todos públicos, e a replicação comunitária dos resultados do Kimi K3 pode agora começar a partir do próprio artefato.












