Modèles et plateformes d’IA
Kimi K3 de Moonshot AI arrive sur Amazon Bedrock avec un contexte de 1 M de tokens

Le Kimi K3 de Moonshot AI, un modèle à poids ouvert que son développeur décrit comme le premier modèle ouvert à atteindre 2,8 billion de paramètres, est devenu disponible sur Amazon Bedrock le 18 septembre 2026, offrant une nouvelle option pour le codage et le travail de connaissance.
Amazon Web Services a annoncé le lancement sur le Blog d’apprentissage automatique AWS. Selon Moonshot AI, Kimi K3 est son modèle le plus performant, combinant des capacités de vision natives avec une fenêtre de contexte d’un million de tokens et offrant une amélioration d’environ 2,5 fois de l’efficacité de mise à l’échelle par rapport à Kimi K2.
Dans le article technique sur Kimi K3 de Moonshot AI, l’entreprise indique que le modèle repose sur deux mises à jour architecturales qu’elle appelle Kimi Delta Attention et Attention Residuals, conçues pour améliorer la circulation de l’information à travers la longueur de séquence et la profondeur du modèle. Kimi K3 utilise une conception mixture‑of‑experts que l’entreprise nomme Stable LatentMoE, activant efficacement 16 des 896 experts, et applique un entraînement conscient de la quantification dès l’étape de réglage fin supervisé, en utilisant des poids MXFP4 avec des activations MXFP8. L’entreprise attribue le gain d’environ 2,5 fois d’efficacité de mise à l’échelle par rapport à son modèle précédent à ces changements structurels ainsi qu’à un entraînement et des recettes de données raffinés.
Moonshot AI indique que les performances globales de Kimi K3 restent inférieures aux modèles propriétaires Claude Fable 5 et GPT 5.6 Sol, tout en signalant que Kimi K3 a fourni des résultats de niveau frontier à travers sa suite d’évaluation et a constamment surpassé les autres modèles testés. L’entreprise énumère également des limitations : le modèle a été entraîné en mode d’historique de pensée préservé, de sorte que la qualité de génération peut devenir instable si le harnais d’un agent ne parvient pas à renvoyer le contenu de pensée historique, et son accent sur les tâches à long terme peut le conduire à prendre des décisions inattendues au nom de l’utilisateur lorsque les instructions sont ambiguës, ce que l’entreprise estime pouvoir nécessiter des contraintes comportementales plus explicites dans l’invite système.
Moonshot AI a présenté initialement Kimi K3 en juillet 2026, déclarant à l’époque que les poids complets du modèle seraient publiés d’ici le 27 juillet 2026. Lors de cette introduction, le modèle était proposé via les propres canaux de Moonshot AI : l’application Kimi, l’application de bureau Kimi Work, l’outil terminal Kimi Code et l’API Kimi.
Modèles à poids ouvert et gestion des données sur Amazon Bedrock
AWS a déclaré que ce lancement reflète un investissement soutenu dans les modèles à poids ouvert sur le service. Depuis 2025, Bedrock a ajouté des dizaines de modèles à poids ouvert provenant de fournisseurs tels que DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI et Qwen. En 2026, Bedrock a ajouté la prise en charge des appels d’outils, des sorties structurées, du raisonnement, du streaming de réponses, ainsi que des API Responses et Chat Completions en tant que fonctionnalités de la plateforme plutôt que comme intégrations propres à chaque modèle, permettant aux nouveaux modèles à poids ouvert de les utiliser dès leur disponibilité.
AWS indique que, comme pour tous les modèles à poids ouvert sur Amazon Bedrock, les données des clients sont traitées à l’intérieur de la frontière de données d’AWS, ne sont pas partagées avec le fournisseur du modèle et ne sont pas utilisées pour entraîner le modèle sous‑jacent. La rétention zéro des données est toujours activée pour les requêtes d’inférence, et l’accès nul des opérateurs empêche les opérateurs d’AWS d’accéder aux invites et aux réponses pendant l’inférence.
documentation d’Amazon Bedrock liste Kimi K3 comme l’un des trois modèles Moonshot AI dans le service, aux côtés de Kimi K2.5, un modèle multimodal avec un raisonnement, un codage et des capacités multilingues améliorés, et Kimi K2 Thinking, un modèle de raisonnement avec des capacités de chaîne de pensée pour la résolution de problèmes complexes en mathématiques, codage et logique.
Accès à la console, API et profils d’inférence
Les utilisateurs peuvent essayer Kimi K3 dans la console Amazon Bedrock sous Test > Playground, ou l’appeler programmatiquement via le point de terminaison bedrock-runtime. Le point de terminaison prend en charge les API Responses et Chat Completions compatibles OpenAI ainsi que les API Invoke et Converse d’Amazon Bedrock.
Le modèle est invoqué via des profils d’inférence inter‑régionaux. Pour les charges de travail sans restrictions géographiques, AWS recommande le profil global, global.moonshotai.kimi-k3, qui dirige chaque requête vers n’importe quelle région commerciale AWS prise en charge dans le monde et, selon AWS, coûte environ 10 % de moins qu’un profil géographique. Le profil géographique US, us.moonshotai.kimi-k3, maintient le traitement au sein de la géographie américaine pour répondre aux exigences de résidence des données.
Les prérequis indiqués par AWS comprennent un compte AWS actif avec accès à Amazon Bedrock, Python 3.10 ou supérieur, et des autorisations IAM (Identity and Access Management) pour bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream et bedrock:CreateInference.
Mise en cache explicite des invites et outils pour développeurs
Selon AWS, Kimi K3 est le premier modèle à poids ouvert sur Amazon Bedrock à prendre en charge la mise en cache explicite des invites, destinée aux flux de travail de codage et de connaissance de longue durée qui renvoient de façon répétée un contexte stable tel que les instructions de dépôt, les définitions d’outils ou les documents de référence. Un marqueur de point d’arrêt de cache d’invite peut désigner la fin exacte d’un préfixe d’invite réutilisable après au moins 1 024 tokens. En mode explicite, les tokens écrits dans le cache sont facturés à un tarif plus élevé mais restent en cache pendant au moins 30 minutes. Les requêtes ultérieures correspondant à un préfixe mis en cache sont facturées à un tarif d’entrée réduit et ne comptent pas dans les quotas de tokens d’entrée par minute.
Au-delà de l’utilisation directe de l’API, le modèle fonctionne via des outils qui prennent en charge Amazon Bedrock. AWS met en avant OpenCode, un agent de codage open source et agnostique vis‑à‑vis des modèles, doté d’un fournisseur natif amazon‑bedrock qui utilise l’API Converse, ainsi que Hermes Agent, un assistant de productivité open source qui supporte nativement les modèles sur Amazon Bedrock. AWS a également publié un référentiel d’échantillons Moonshot AI on AWS sur GitHub avec des exemples supplémentaires.
Kimi K3 est disponible via les profils d’inférence US Geo et Global cross‑Region, la liste complète des régions prises en charge étant disponible dans la documentation de Bedrock.












