Immagine AI

Moonshot AI ha reso disponibile Kimi K3 su Amazon Bedrock, ampliando l’offerta di modelli open-weight della piattaforma AWS per attività di coding, analisi documentale e knowledge work. Kimi K3 è il modello più avanzato presentato finora dall’azienda e viene descritto da Moonshot AI come il primo modello aperto a raggiungere 2,8 trilioni di parametri. Il modello integra capacità di visione native e una finestra di contesto da 1 milione di token, caratteristica pensata per mantenere grandi quantità di informazioni all’interno della stessa sessione durante operazioni prolungate su repository software, documenti estesi, pagine scansionate, screenshot e workflow agentici di lunga durata. Secondo Moonshot AI, l’architettura raggiunge inoltre un’efficienza di scaling circa 2,5 volte superiore rispetto a Kimi K2.

L’architettura di Kimi K3 utilizza due componenti introdotte da Moonshot AI, denominate Kimi Delta Attention e Attention Residuals, progettate per migliorare il trasferimento delle informazioni sia lungo la sequenza sia attraverso la profondità della rete. Il modello adotta inoltre un’architettura mixture-of-experts denominata Stable LatentMoE, composta da 896 expert dei quali 16 vengono attivati per ciascun token. Dei 2,8 trilioni di parametri complessivi, circa 104 miliardi risultano quindi attivi durante l’elaborazione di un singolo token. La fase di addestramento utilizza quantization-aware training a partire dal supervised fine-tuning, con pesi MXFP4 e attivazioni MXFP8. Moonshot AI attribuisce l’aumento dell’efficienza rispetto a Kimi K2 alla combinazione di queste modifiche architetturali con nuovi processi di training e selezione dei dati.

Kimi K3 combina input testuali e immagini attraverso il sistema di visione nativo del modello ed è stato progettato in particolare per attività che richiedono il mantenimento del contesto per periodi prolungati. La finestra da 1 milione di token consente di lavorare su repository software di grandi dimensioni, analizzare contemporaneamente più documenti e immagini e mantenere all’interno della stessa sessione istruzioni, risultati intermedi e informazioni raccolte da strumenti esterni. Moonshot AI segnala tuttavia alcune limitazioni operative. Il modello è stato addestrato utilizzando una modalità che conserva la cronologia del processo di reasoning e la qualità delle generazioni può diventare instabile quando un agent harness non restituisce correttamente questa cronologia nelle interazioni successive. L’orientamento verso attività di lunga durata può inoltre portare Kimi K3 a prendere iniziative non previste quando le istruzioni sono ambigue, rendendo utile specificare più chiaramente i vincoli comportamentali nel system prompt.

Su Amazon Bedrock il modello viene eseguito all’interno dello stesso perimetro di sicurezza utilizzato per gli altri modelli disponibili sulla piattaforma. AWS dichiara che i dati dei clienti rimangono all’interno del proprio data boundary, non vengono condivisi con Moonshot AI e non vengono utilizzati per l’addestramento del modello. Per le richieste di inferenza è applicata la conservazione zero dei dati e il sistema di zero operator access impedisce agli operatori AWS di accedere ai prompt e alle risposte durante l’esecuzione. Gli stessi strumenti di controllo degli accessi, crittografia, auditing e governance utilizzati per i modelli proprietari possono quindi essere applicati anche a Kimi K3.

Kimi K3 è inoltre il primo modello open-weight disponibile su Amazon Bedrock a supportare esplicitamente il prompt caching configurabile. Il meccanismo consente di memorizzare parti stabili di un prompt che vengono riutilizzate frequentemente, come istruzioni relative a un repository, definizioni degli strumenti, documentazione tecnica o altri blocchi di contesto. Gli sviluppatori possono inserire un checkpoint dopo almeno 1.024 token e mantenere il contenuto in cache per almeno 30 minuti. Le richieste successive che utilizzano lo stesso prefisso possono leggere direttamente la cache, riducendo sia la latenza sia il costo associato ai token di input e senza far conteggiare quei token nei limiti di input al minuto. Il modello utilizza anche caching implicito automatico, mentre il caching esplicito è attualmente disponibile tramite le Responses API e le Chat Completions API.

L’accesso programmatico avviene attraverso il servizio bedrock-runtime, con identificativo modello moonshotai.kimi-k3. Amazon Bedrock supporta per Kimi K3 le API Responses e Chat Completions compatibili con OpenAI, oltre alle API native Invoke e Converse di Bedrock. Il modello viene distribuito tramite cross-Region inference e può essere utilizzato con il profilo globale global.moonshotai.kimi-k3, che consente ad AWS di instradare le richieste verso le regioni commerciali supportate, oppure attraverso il profilo geografico statunitense us.moonshotai.kimi-k3, destinato ai workload che richiedono che l’elaborazione rimanga negli Stati Uniti. AWS indica che il profilo globale può avere un costo circa inferiore del 10% rispetto al profilo geografico. Per l’accesso programmatico sono richiesti un account AWS abilitato a Bedrock e le autorizzazioni IAM necessarie per l’invocazione del modello e lo streaming delle risposte.

Il prezzo Standard con Global cross-Region inference è fissato a 3 dollari per milione di token in input e 15 dollari per milione di token in output. La lettura dei token presenti nella cache costa 0,30 dollari per milione di token, mentre la scrittura nella cache con durata di 30 minuti costa 3,75 dollari per milione. Nel profilo US i prezzi salgono rispettivamente a 3,30 dollari per milione di token in input, 16,50 dollari per l’output, 0,33 dollari per la lettura della cache e 4,125 dollari per la scrittura. Oltre al livello Standard, Kimi K3 supporta i tier Priority e Flex: Priority applica un sovrapprezzo del 75% rispetto alla tariffa Standard per ottenere tempi di risposta più rapidi, mentre Flex dimezza il prezzo per i workload che possono accettare una maggiore variabilità nei tempi di elaborazione.

Kimi K3 può essere utilizzato direttamente dal Playground della console Amazon Bedrock oppure attraverso strumenti compatibili con le API della piattaforma. AWS cita tra gli esempi OpenCode, agente open source e indipendente dal modello che utilizza il provider Amazon Bedrock attraverso la Converse API, e Hermes Agent, assistente open source che supporta nativamente i modelli ospitati su Bedrock. AWS ha pubblicato anche un repository di esempi Moonshot AI dedicato all’integrazione dei modelli attraverso la propria infrastruttura. Kimi K3 si aggiunge agli altri modelli Moonshot AI già presenti su Amazon Bedrock, tra cui Kimi K2.5, orientato a ragionamento multimodale, coding e attività multilingue, e Kimi K2 Thinking, dedicato al reasoning su problemi complessi di matematica, programmazione e logica.

Kimi K3 era stato presentato inizialmente da Moonshot AI nel luglio 2026 attraverso la propria app Kimi, l’applicazione desktop Kimi Work, lo strumento da terminale Kimi Code e la Kimi API, mentre i pesi completi del modello sono stati successivamente pubblicati il 27 luglio. L’arrivo su Amazon Bedrock aggiunge quindi un canale di esecuzione gestito per il modello, con accesso tramite le API e i sistemi di governance AWS senza richiedere agli sviluppatori di distribuire e gestire direttamente l’infrastruttura necessaria per un modello da 2,8 trilioni di parametri.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy