Cos'è Kimi K3? Benchmark, prezzi, finestra di contesto e piani di open-weight

Avatar
Lisa Ernst · 23.07.2026 · Intelligenza Artificiale · 9 min

Kimi K3 è il nuovo modello di punta di Moonshot AI per la codifica a lungo termine, il lavoro di conoscenza agentico, la comprensione visiva e il ragionamento profondo. Annunciato il 16 luglio 2026, combina un'architettura Mixture-of-Experts da 2.8 trilioni di parametri con una finestra di contesto di un milione di token e un design di routing insolitamente scarso.

Le specifiche principali sono impressionanti, ma i dettagli contano. I risultati di benchmark più forti provengono attualmente dalla valutazione di lancio di Moonshot, l'output API è significativamente più costoso rispetto ai precedenti modelli Kimi, e i pesi scaricabili promessi non erano ancora disponibili quando questo articolo è stato pubblicato il 23 luglio 2026. Questa guida separa ciò che è già utilizzabile da ciò che rimane un piano di rilascio.

Punti chiave

Cos'è Kimi K3?

Kimi K3 è il successore della generazione Kimi K2 di Moonshot AI e il modello più grande dell'azienda finora. Moonshot lo descrive come il primo modello aperto nella classe da tre trilioni di parametri. È progettato meno come un modello di chat leggero e più come un agente sempre attivo nel ragionamento che può mantenere lo stato attraverso lunghi flussi di lavoro di ingegneria, ricerca, documenti e utilizzo di strumenti.

Il modello è nativamente multimodale. Accetta testo, immagini e video tramite i prodotti Kimi supportati e i formati di input API, quindi produce testo e chiamate a strumenti. Moonshot posiziona K3 attorno a tre carichi di lavoro principali: ingegneria del software a lungo termine, lavoro di conoscenza end-to-end e attività che combinano feedback visivi con codice o strumenti strutturati.

Kimi K3 è disponibile tramite Kimi.com, le applicazioni mobili Kimi, Kimi Work, Kimi Code e l'API Kimi. Gli sviluppatori utilizzano l'ID modello API kimi-k3. La documentazione API afferma che l'accesso alla versione flagship viene sbloccato dopo una ricarica dell'account di almeno $1, con limiti di velocità determinati dal livello dell'account.

I lettori che necessitano di un contesto più ampio sulla famiglia di prodotti possono iniziare con la guida di Zerlo su Kimi AI e Moonshot AI. . K3 è il rilascio del modello; Kimi è il più ampio ecosistema di assistenti, applicazioni e sviluppatori.

Architettura Kimi K3: perché 2.8 trilioni di parametri non significano 2.8 trilioni di parametri attivi

Kimi K3 utilizza un design Mixture-of-Experts sparso. La rete contiene 896 esperti instradati, ma solo 16 vengono selezionati per ogni token. Ciò consente al modello di memorizzare una quantità molto grande di capacità specializzata senza eseguire ogni esperto su ogni passaggio forward. Il checkpoint completo deve comunque essere memorizzato e distribuito su un cluster di inferenza, quindi l'attivazione sparsa riduce il calcolo più di quanto riduca la sfida di archiviazione.

Moonshot evidenzia quattro componenti architetturali:

L'azienda afferma che questi cambiamenti, combinati con metodi di training aggiornati e ricette di dati, forniscono circa 2.5 volte l'efficienza complessiva di scalabilità di Kimi K2. Questo dato è un'affermazione di Moonshot piuttosto che una misurazione riprodotta in modo indipendente. K3 utilizza anche il training consapevole della quantizzazione con pesi MXFP4 e attivazioni MXFP8, e Moonshot raccomanda implementazioni di supernodi con almeno 64 acceleratori.

Un semplice calcolo di archiviazione illustra la scala. Con quattro bit per parametro, 2.8 trilioni di parametri rappresentano circa 1.4 terabyte di dati grezzi di peso prima dei metadati, delle strutture di routing, dei buffer di runtime, della cache KV, della ridondanza e dell'overhead del framework. Questo è il motivo per cui un eventuale rilascio di pesi aperti sarà prezioso per i ricercatori e le aziende di hosting, ma non renderà Kimi K3 un modello desktop normale.

Benchmark Kimi K3

I materiali di lancio di Moonshot confrontano Kimi K3 con GPT-5.6 Sol, GPT-5.5, Claude Fable 5, Claude Opus 4.8 e GLM-5.2. Il riassunto dell'azienda è relativamente contenuto: K3 è ancora in ritardo rispetto ai sistemi proprietari più capaci in generale, ma raggiunge prestazioni a livello di frontiera e primeggia in molti singoli compiti.

Benchmark Punteggio Kimi K3 Posizione nel grafico di lancio di Moonshot
DeepSWE 67.5 Dietro GPT-5.6 Sol e Claude Fable 5
Terminal Bench 2.1 88.3 Secondo, 0.5 punti dietro GPT-5.6 Sol
Program Bench 77.8 Punteggio più alto riportato nella classifica
SWE Marathon 42.0 Punteggio più alto riportato nella classifica
FrontierSWE 81.2 Secondo, dietro Claude Fable 5
BrowseComp 91.2 Punteggio più alto riportato nella classifica
SpreadsheetBench 2 34.8 Il più alto di 0.1 punti rispetto a Claude Fable 5
AutomationBench 30.8 Punteggio più alto riportato nella classifica
Grafico ufficiale dei benchmark di codifica di Kimi K3 che confronta DeepSWE, Terminal Bench, FrontierSWE, Program Bench, Kimi Code Bench e SWE Marathon

Fonte: kimi.com

Moonshot riporta risultati particolarmente forti per gli agenti di codifica. K3 è in testa a Program Bench e SWE Marathon nella classifica di lancio, mentre si posiziona vicino alla vetta su Terminal Bench 2.1 e FrontierSWE.

Come leggere le affermazioni sui benchmark

Questi numeri non dovrebbero essere trattati come una classifica perfettamente controllata. Moonshot ha utilizzato Kimi Code, Claude Code o harness Codex a seconda del benchmark. Alcuni risultati dei concorrenti provenivano da classifiche ufficiali o post di rilascio, mentre altri modelli sono stati rieseguiti da Moonshot. La tabella di lancio nota anche un possibile comportamento di fallback per Claude Fable 5 e interruzioni di guardrail per GPT-5.6 Sol su alcuni compiti.

Tutti i risultati principali di K3 sono stati ottenuti con il massimo sforzo di ragionamento. Questa impostazione può migliorare la qualità ma può anche aumentare la latenza e il consumo di token di output. Diverse valutazioni sono interne, tra cui Kimi Code Bench 2.0 e parti della valutazione del lavoro di conoscenza. Fino a quando i pesi e gli strumenti di valutazione non saranno pubblici, terze parti non potranno riprodurre completamente l'intero set di risultati.

La lettura più utile non è quindi “K3 batte ogni modello chiuso”. Una conclusione migliore è che K3 sembra altamente competitivo per la codifica a lungo termine e i flussi di lavoro degli agenti, con risultati di prima parte eccezionali nell'ingegneria del software, nella navigazione, nell'automazione, nei fogli di calcolo e nei compiti di documenti visivi. La qualità reale del prodotto dipenderà comunque dalla conformità alle istruzioni, dalla latenza, dall'integrazione degli strumenti, dal comportamento di sicurezza e dalla stabilità durante sessioni prolungate.

Grafico ufficiale dei benchmark Kimi K3 per agenti generici e agenti visivi, inclusi BrowseComp, AutomationBench, SpreadsheetBench 2, CharXiv e Zerobench

Fonte: kimi.com

K3 registra anche forti risultati il giorno del lancio al di fuori della pura codifica, incluso il primo posto nei confronti mostrati di BrowseComp, AutomationBench e SpreadsheetBench 2.

Prezzi di Kimi K3

L'API ufficiale di Kimi utilizza tre tariffe token. I prezzi escludono le tasse e utilizzano un milione di token decimali come unità di fatturazione.

Categoria token Prezzo per 1M token Quando si applica
Input con cache hit $0.30 Un prefisso di richiesta ripetuto viene servito dalla cache di contesto automatica di Kimi
Input con cache miss $3.00 Input nuovo o modificato che deve essere elaborato normalmente
Output $15.00 Ragionamento generato e token di risposta fatturati come output

K3 ha una tariffazione fissa per token su tutta la sua gamma di contesto. Non c'è alcun sovrapprezzo separato una volta che una richiesta supera una soglia di 200K o simile. Tuttavia, i prompt lunghi possono comunque essere costosi in termini assoluti, e un modello sempre attivo nel pensiero può produrre un output consistente. Una richiesta con un milione di token di input non memorizzati nella cache costerebbe $3 prima dell'output; lo stesso prefisso memorizzato nella cache costerebbe $0.30.

La memorizzazione automatica nella cache non richiede un ID cache o un'impostazione API separata. La documentazione afferma che il prompt precedente deve superare i 256 token e che le richieste successive dovrebbero preservare il prefisso lungo invariato per avere la possibilità di accedere alla cache. Questo rende K3 più economico per l'analisi ripetuta dello stesso repository, raccolta di documenti o base di conoscenza rispetto a prompt usa e getta in continua evoluzione.

Quanto è grande la finestra di contesto di Kimi K3?

Kimi K3 supporta 1.048.576 token di contesto. In termini pratici, può contenere codebase molto grandi, vaste raccolte di documenti, lunghe storie di agenti o combinazioni di input testuali e visivi. Il numero esatto di parole, pagine o file varia perché la tokenizzazione dipende dalla lingua, dalla formattazione, dal codice sorgente e dai dati incorporati.

La documentazione API elenca un valore predefinito di max_completion_tokens pari a 131.072 e consente di aumentarlo fino a 1.048.576. Questo limite massimo non deve essere interpretato come una raccomandazione per generare risposte da un milione di token. È principalmente un limite architettonico per flussi di lavoro insolitamente lunghi.

Una finestra di contesto ampia non garantisce neanche un richiamo perfetto. Moonshot avverte esplicitamente che K3 è stato addestrato a preservare la sua cronologia di pensiero. I framework degli agenti dovrebbero passare il messaggio completo dell'assistente ai turni successivi. Interrompere la cronologia di ragionamento, cambiare modelli a metà sessione o utilizzare un harness incompatibile può rendere instabile la qualità della generazione.

Kimi K3 è open source o open weight?

Moonshot definisce Kimi K3 un modello “aperto” e “open-source” di classe a tre trilioni, ma la tempistica è cruciale. L'azienda ha annunciato che i pesi completi sarebbero stati rilasciati entro il 27 luglio 2026, insieme a maggiori dettagli tecnici. Questo articolo è stato pubblicato quattro giorni prima di tale scadenza.

Al 23 luglio, K3 era utilizzabile tramite i prodotti Kimi e l'API ufficiale, ma il checkpoint completo non era ancora elencato sulla pagina pubblica dell'organizzazione Hugging Face di Moonshot. La licenza finale del modello, gli shard di peso, i checksum, l'ingombro esatto di archiviazione, i motori di inferenza supportati e le procedure di deployment testate dalla comunità non potevano quindi essere ancora verificati.

La descrizione precisa al momento della pubblicazione è un modello hosted proprietario con una promessa di rilascio open-weight. Dopo la comparsa del checkpoint, la licenza determinerà se l'uso commerciale, la modifica, la ridistribuzione e i servizi hosted sono consentiti. I pesi aperti non significano automaticamente che verranno pubblicati anche i dati di training, il codice di training completo o una pipeline di training riproducibile.

Questa distinzione è trattata più in dettaglio nella panoramica di Zerlo sull' ecosistema AI open-weight cinese. . K3 è anche un utile confronto di scala con GLM-5 e il suo approccio di codifica agentica open-weight.

Dove puoi usare Kimi K3?

Chi dovrebbe considerare Kimi K3?

K3 è più interessante per i team che necessitano di un agente per operare su set di lavoro insolitamente grandi: repository complessi, lunghe cronologie tecniche, grandi raccolte di PDF, ricerche ad alto contenuto di dati, flussi di lavoro software visivi o query ripetute su una base di conoscenza stabile. La sua tariffazione della cache è progettata per premiare questo modello di prefisso ripetuto.

È meno adatto a brevi e poco costosi completamenti di chat. Il modello ragiona sempre, l'output costa $15 per milione di token e l'esecuzione con il massimo sforzo può essere più lenta di un modello leggero che non ragiona. i team dovrebbero confrontare il costo totale del compito piuttosto che solo il prezzo di input: i tentativi, le lunghe tracce di ragionamento, le chiamate agli strumenti e il runtime dell'agente possono contare più del prezzo nominale dei token.

Le organizzazioni interessate principalmente all'implementazione open dovrebbero attendere il rilascio effettivo dei pesi e della licenza prima di prendere decisioni relative all'infrastruttura o alla conformità. Anche se il checkpoint è concesso in licenza permissiva, un modello da 2.8T sarà probabilmente consumato tramite fornitori di inferenza specializzati anziché essere scaricato su normali workstation.

Limitazioni e domande aperte

FAQ

Cos'è Kimi K3?

Kimi K3 è il modello multimodale di punta di Moonshot AI da 2.8 trilioni di parametri. È progettato per la codifica a lungo termine, la ricerca, l'uso di strumenti, il ragionamento visivo e il lavoro di conoscenza, con una finestra di contesto di un milione di token.

Quanto costa l'API Kimi K3?

Il prezzo ufficiale è di $0.30 per milione di token di input con cache hit, $3.00 per milione di token di input senza cache e $15.00 per milione di token di output, escluse le tasse applicabili.

Qual è la finestra di contesto di Kimi K3?

Kimi K3 supporta 1.048.576 token di contesto. L'API imposta per impostazione predefinita un limite massimo di completamento di 131.072 token, che può essere aumentato a 1.048.576 per carichi di lavoro specializzati.

Kimi K3 è disponibile su Hugging Face?

Non ancora al momento della pubblicazione del 23 luglio 2026. Moonshot ha dichiarato che i pesi completi sarebbero stati rilasciati entro il 27 luglio. La pagina ufficiale dell'organizzazione di Hugging Face dovrebbe essere controllata nuovamente dopo tale data.

Kimi K3 può essere eseguito localmente?

Non è un modello locale pratico per l'hardware consumer. Un semplice calcolo del peso a quattro bit è di circa 1,4 TB solo prima dell'overhead di runtime, e Moonshot raccomanda configurazioni di implementazione con almeno 64 acceleratori.

Kimi K3 è migliore di GPT o Claude?

Dai dati di lancio non si può stabilire un vincitore universale. K3 è in testa a diversi benchmark di codifica e agenti riportati, mentre Moonshot stessa afferma che il modello è ancora in ritardo rispetto ai sistemi proprietari più forti in generale. Test indipendenti dopo il rilascio dei pesi saranno più informativi.

Kimi K3 supporta immagini e video?

Sì. K3 ha una comprensione visiva nativa e supporta l'input di immagini e video tramite prodotti Kimi documentati e formati API. L'API richiede formati di input supportati caricati o codificati anziché URL di immagini pubbliche arbitrari.

Conclusione

Kimi K3 è uno dei lanci di modelli AI più ambiziosi del 2026: un MoE sparso da 2.8T con visione nativa, una finestra di contesto da un milione di token, forti benchmark di codifica e agenti di prima parte e prezzi competitivi per l'input in cache. È già disponibile come modello ospitato, ma la storia del peso aperto era ancora una promessa il 23 luglio piuttosto che un checkpoint scaricabile e con licenza.

Gli sviluppatori possono valutare l'API ora, specialmente per i flussi di lavoro a lungo contesto ripetuti che beneficiano del caching automatico. I ricercatori e i team infrastrutturali dovrebbero attendere il rilascio dei pesi del 27 luglio, quindi verificare la licenza, i file del modello, gli stack di servizio supportati e i risultati dei benchmark indipendenti prima di considerare K3 un'implementazione open-weight pronta per la produzione.

Condividi il nostro articolo!
Fonti