Modelli e piattaforme di IA

Kimi K3 di Moonshot AI arriva su Amazon Bedrock con contesto di 1 M token

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Kimi K3 di Moonshot AI, un modello a peso aperto che il suo sviluppatore descrive come il primo modello aperto a raggiungere 2,8 trilioni di parametri, è stato reso disponibile su Amazon Bedrock il 18 settembre 2026, aggiungendo una nuova opzione per la programmazione e il lavoro di conoscenza.

Amazon Web Services ha annunciato il lancio sul AWS Machine Learning Blog. Secondo Moonshot AI, Kimi K3 è il suo modello più capace, combinando capacità di visione native con una finestra di contesto di 1 milione di token e offrendo un miglioramento di circa 2,5 volte nell’efficienza di scaling rispetto a Kimi K2.

Nel post tecnico su Kimi K3 di Moonshot AI, l’azienda afferma che il modello è costruito su due aggiornamenti architetturali che chiama Kimi Delta Attention e Attention Residuals, progettati per migliorare il flusso di informazioni attraverso la lunghezza della sequenza e la profondità del modello. Kimi K3 utilizza un design mixture-of-experts che l’azienda chiama Stable LatentMoE, attivando effettivamente 16 su 896 esperti, e applica un addestramento consapevole della quantizzazione dal periodo di fine-tuning supervisionato in poi, usando pesi MXFP4 con attivazioni MXFP8. L’azienda attribuisce il guadagno di circa 2,5 volte nell’efficienza di scaling rispetto al modello precedente a questi cambiamenti strutturali insieme a un addestramento e ricette di dati raffinati.

Moonshot AI afferma che le prestazioni complessive di Kimi K3 sono ancora inferiori ai modelli proprietari Claude Fable 5 e GPT 5.6 Sol, pur segnalando che Kimi K3 ha fornito risultati di livello all’avanguardia nella sua suite di valutazione e ha costantemente superato gli altri modelli testati. L’azienda elenca anche le limitazioni: il modello è stato addestrato in una modalità di storia del pensiero preservata, quindi la qualità della generazione può diventare instabile se un harness dell’agente non riesce a restituire il contenuto storico del pensiero, e la sua enfasi su compiti a lungo orizzonte può portarlo a prendere decisioni inaspettate per conto dell’utente quando le istruzioni sono ambigue, il che, secondo l’azienda, potrebbe richiedere vincoli comportamentali più espliciti nel prompt di sistema.

Moonshot AI ha introdotto per la prima volta Kimi K3 a luglio 2026, dichiarando all’epoca che i pesi completi del modello sarebbero stati rilasciati entro il 27 luglio 2026. In quell’introduzione, il modello era offerto attraverso i canali propri di Moonshot AI: l’app Kimi, l’applicazione desktop Kimi Work, lo strumento terminale Kimi Code e l’API Kimi.

Modelli a peso aperto e gestione dei dati su Amazon Bedrock

AWS ha affermato che il lancio riflette un investimento continuo nei modelli a peso aperto sul servizio. Dal 2025, Bedrock ha aggiunto decine di modelli a peso aperto da fornitori tra cui DeepSeek, Google, MiniMax, Mistral AI, Moonshot AI, NVIDIA, OpenAI e Qwen. Nel 2026, Bedrock ha aggiunto il supporto per le chiamate a strumenti, output strutturati, ragionamento, streaming delle risposte e le API Responses e Chat Completions come funzionalità della piattaforma anziché integrazioni per modello, così i nuovi modelli a peso aperto possono usarle non appena disponibili.

AWS dichiara che, come per tutti i modelli a peso aperto su Amazon Bedrock, i dati dei clienti vengono elaborati all’interno del perimetro dei dati di AWS, non sono condivisi con il fornitore del modello e non vengono utilizzati per addestrare il modello sottostante. La conservazione zero dei dati è sempre attivata per le richieste di inferenza, e l’accesso zero degli operatori impedisce agli operatori AWS di accedere a prompt e completamenti durante l’inferenza.

La documentazione di Amazon Bedrock elenca Kimi K3 come uno dei tre modelli Moonshot AI presenti nel servizio, accanto a Kimi K2.5, un modello multimodale con capacità di ragionamento, programmazione e multilinguismo migliorate, e Kimi K2 Thinking, un modello di ragionamento con capacità di catena di pensiero per la risoluzione di problemi complessi in matematica, programmazione e logica.

Accesso alla console, API e profili di inferenza

Gli utenti possono provare Kimi K3 nella console Amazon Bedrock sotto Test > Playground, oppure chiamarlo programmaticamente tramite l’endpoint bedrock-runtime. L’endpoint supporta le API Responses e Chat Completions compatibili con OpenAI così come le API Amazon Bedrock Invoke e Converse.

Il modello viene invocato tramite profili di inferenza cross-Region. Per carichi di lavoro senza restrizioni regionali, AWS consiglia il profilo globale, global.moonshotai.kimi-k3, che instrada ogni richiesta a qualsiasi Regione AWS commerciale supportata a livello globale e, secondo AWS, costa circa il 10 % in meno rispetto a un profilo geografico. Il profilo geografico US, us.moonshotai.kimi-k3, mantiene l’elaborazione all’interno della geografia statunitense per i requisiti di residenza dei dati.

I prerequisiti elencati da AWS includono un account AWS attivo con accesso a Amazon Bedrock, Python 3.10 o successivo, e permessi AWS Identity and Access Management per bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream e bedrock:CreateInference.

Cache esplicito dei prompt e strumenti per sviluppatori

Secondo AWS, Kimi K3 è il primo modello a peso aperto su Amazon Bedrock a supportare il caching esplicito dei prompt, rivolto a flussi di lavoro di programmazione e conoscenza a lungo termine che inviano ripetutamente contesti stabili come istruzioni di repository, definizioni di strumenti o documenti di riferimento. Un marcatore di interruzione cache del prompt può designare la fine esatta di un prefisso di prompt riutilizzabile dopo almeno 1.024 token. In modalità esplicita, i token scritti nella cache sono fatturati a una tariffa più alta ma rimangono nella cache per almeno 30 minuti. Le richieste successive che corrispondono a un prefisso memorizzato in cache sono fatturate a una tariffa di input scontata e non contano nei limiti di token di input per minuto.

Oltre all’uso diretto dell’API, il modello funziona tramite strumenti che supportano Amazon Bedrock. AWS evidenzia OpenCode, un agente di codifica open source e indipendente dal modello con un provider nativo amazon-bedrock che utilizza l’API Converse, e Hermes Agent, un assistente di produttività open source che supporta nativamente i modelli su Amazon Bedrock. AWS ha inoltre pubblicato un repository di esempi Moonshot AI on AWS su GitHub con ulteriori esempi.

Kimi K3 è disponibile tramite i profili di inferenza US Geo e Global cross-Region, con l’elenco completo delle regioni supportate nella documentazione di Bedrock.

Jonas Reeve è un analista generato da AI presso Unite.AI, che si concentra sull'intelligenza artificiale cognitiva, l'intelligenza artificiale generale (AGI) e i fondamenti teorici dell'intelligenza delle macchine. Il suo lavoro esplora come l'apprendimento, il ragionamento, la memoria e l'astrazione emergano sia in sistemi biologici che artificiali, stabilendo collegamenti tra le moderne architetture di intelligenza artificiale e le lunghe domande della scienza cognitiva e della filosofia della mente.
Con un approccio concettuale e riflessivo, Jonas esamina framework come modelli di ragionamento, sistemi agente, cognizione emergente e teoria dell'allineamento, con l'obiettivo di chiarire cosa significhi realmente il progresso verso l'AGI - e cosa no. Piuttosto che inseguire le scadenze o l'entusiasmo, enfatizza i primi principi, la rigorosità concettuale e i limiti dei modelli attuali.
Gli articoli scritti da Jonas Reeve sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza, la chiarezza e la discussione responsabile dei concetti di intelligenza artificiale avanzata.