Modelos e plataformas de IA

Kimi K3 da Moonshot AI chega ao Amazon Bedrock com contexto de 1 milhão de tokens

mm
Adicione Unite.AI às suas fontes preferidas no Google

Kimi K3 da Moonshot AI, um modelo de peso aberto que seu desenvolvedor descreve como o primeiro modelo aberto a alcançar 2,8 trilhões de parâmetros, tornou‑se disponível no Amazon Bedrock em 18 de setembro de 2026, adicionando uma nova opção para codificação e trabalho de conhecimento.

Amazon Web Services anunciou o lançamento no AWS Machine Learning Blog. Segundo a Moonshot AI, Kimi K3 é seu modelo mais avançado, combinando recursos nativos de visão com uma janela de contexto de 1 milhão de tokens e proporcionando uma melhoria aproximada de 2,5 x na eficiência de escalonamento em relação ao Kimi K2.

Na publicação técnica sobre o Kimi K3 da Moonshot AI, a empresa afirma que o modelo foi construído sobre duas atualizações arquiteturais que chama de Kimi Delta Attention e Attention Residuals, projetadas para melhorar como a informação flui ao longo do comprimento da sequência e da profundidade do modelo. Kimi K3 usa um design mixture‑of‑experts que a empresa denomina Stable LatentMoE, ativando efetivamente 16 de 896 especialistas, e aplica treinamento consciente de quantização a partir da fase de ajuste fino supervisionado, usando pesos MXFP4 com ativações MXFP8. A empresa atribui o ganho de aproximadamente 2,5 x na eficiência de escalonamento em relação ao seu modelo anterior a essas mudanças estruturais, juntamente com treinamento e receitas de dados refinados.

A Moonshot AI afirma que o desempenho geral do Kimi K3 ainda fica atrás dos modelos proprietários Claude Fable 5 e GPT 5.6 Sol, embora relate que o Kimi K3 entregou resultados de nível de fronteira em toda a sua suíte de avaliação e superou consistentemente outros modelos testados. A empresa também enumera limitações: o modelo foi treinado em um modo de histórico de pensamento preservado, de modo que a qualidade da geração pode tornar‑se instável se um agente falhar ao devolver o conteúdo histórico de pensamento, e sua ênfase em tarefas de longo horizonte pode levá‑lo a tomar decisões inesperadas em nome do usuário quando as instruções são ambíguas, o que a empresa diz que pode exigir restrições comportamentais mais explícitas no prompt do sistema.

A Moonshot AI apresentou originalmente o Kimi K3 em julho de 2026, afirmando na época que os pesos completos do modelo seriam lançados até 27 de julho de 2026. Naquela apresentação, o modelo foi oferecido pelos próprios canais da Moonshot AI: o aplicativo Kimi, o aplicativo desktop Kimi Work, a ferramenta de terminal Kimi Code e a Kimi API.

Modelos de Peso Aberto e Manipulação de Dados no Amazon Bedrock

A AWS afirmou que o lançamento reflete um investimento contínuo em modelos de peso aberto no serviço. Desde 2025, o Bedrock adicionou dezenas de modelos de peso aberto de provedores como DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI e Qwen. Em 2026, o Bedrock adicionou suporte para chamada de ferramentas, saída estruturada, raciocínio, streaming de respostas e as APIs Responses e Chat Completions como capacidades da plataforma, em vez de integrações por modelo, permitindo que novos modelos de peso aberto as utilizem à medida que se tornam disponíveis.

A AWS declara que, assim como em todos os modelos de peso aberto no Amazon Bedrock, os dados dos clientes são processados dentro da fronteira de dados da AWS, não são compartilhados com o provedor do modelo e não são usados para treinar o modelo subjacente. A retenção zero de dados está sempre ativada para solicitações de inferência, e o acesso zero de operadores impede que operadores da AWS acessem prompts e conclusões durante a inferência.

A documentação do Amazon Bedrock lista o Kimi K3 como um dos três modelos da Moonshot AI no serviço, ao lado do Kimi K2.5, um modelo multimodal com raciocínio, codificação e capacidades multilíngues aprimorados, e Kimi K2 Thinking, um modelo de raciocínio com recursos de cadeia de pensamento para resolução de problemas complexos em matemática, codificação e lógica.

Acesso ao Console, APIs e Perfis de Inferência

Usuários podem experimentar o Kimi K3 no console do Amazon Bedrock em Test > Playground, ou chamá-lo programaticamente através do endpoint bedrock-runtime. O endpoint suporta as APIs OpenAI-compatible Responses and Chat Completions, bem como as APIs Amazon Bedrock Invoke e Converse.

O modelo é invocado por meio de perfis de inferência cross‑Region. Para cargas de trabalho sem restrições regionais, a AWS recomenda o perfil global, global.moonshotai.kimi-k3, que encaminha cada solicitação a qualquer região comercial da AWS suportada mundialmente e, segundo a AWS, custa aproximadamente 10 % menos que um perfil geográfico. O perfil geográfico dos EUA, us.moonshotai.kimi-k3, mantém o processamento dentro da geografia dos EUA para atender aos requisitos de residência de dados.

Os pré‑requisitos listados pela AWS incluem uma conta AWS ativa com acesso ao Amazon Bedrock, Python 3.10 ou superior, e permissões do AWS Identity and Access Management para bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream e bedrock:CreateInference.

Cache Explícito de Prompt e Ferramentas para Desenvolvedores

De acordo com a AWS, o Kimi K3 é o primeiro modelo de peso aberto no Amazon Bedrock a suportar cache explícito de prompt, que visa fluxos de trabalho de codificação e conhecimento de longa duração que reenviam repetidamente contexto estável, como instruções de repositório, definições de ferramentas ou documentos de referência. Um marcador de ponto de interrupção de promptcache pode designar o fim exato de um prefixo de prompt reutilizável após pelo menos 1 024 tokens. No modo explícito, os tokens gravados no cache são cobrados a uma tarifa mais alta, mas permanecem em cache por pelo menos 30 minutos. Solicitações subsequentes que correspondam a um prefixo em cache são cobradas a uma tarifa de entrada descontada e não contam contra as cotas de tokens de entrada por minuto.

Além do uso direto da API, o modelo funciona por meio de ferramentas que suportam o Amazon Bedrock. A AWS destaca o OpenCode, um agente de codificação de código aberto e agnóstico ao modelo, com um provedor nativo amazon-bedrock que usa a API Converse, e o Hermes Agent, um assistente de produtividade de código aberto que suporta nativamente modelos no Amazon Bedrock. A AWS também publicou um repositório de amostras Moonshot AI on AWS no GitHub com exemplos adicionais.

Kimi K3 está disponível através dos perfis de inferência US Geo e Global cross-Region, com a lista completa de regiões suportadas na documentação do Bedrock.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.