Kimi K3, la recensione: prestazioni da frontiera a metà del costo API, ma i pesi non ci sono ancora
Kimi K3 offre coding a lungo raggio e API convenienti, ma pesi e report tecnico non sono ancora pubblici. Recensione con prezzi, benchmark e limiti.

Kimi K3 è il modello da provare per attività di coding con cache e orizzonte lungo, non ancora quello su cui standardizzare. La sua API costa $3 per milione di token di input senza cache e $15 per milione di token di output, circa la metà del costo combinato di GPT-5.6 Sol, ma i pesi promessi e il report tecnico non sono ancora pubblici. La stessa documentazione di Kimi segnala inoltre cambi di sessione instabili, azioni intraprese con eccessiva facilità e un divario nell'esperienza utente.
Kimi K3 è stato lanciato il 16 luglio 2026 come modello di punta di Moonshot AI per coding, agenti e lavoro intellettuale end-to-end. È già disponibile tramite Kimi.com, Kimi Work, Kimi Code o l'API kimi-k3.

Il lancio conta perché K3 entra nel confronto tra prezzo e prestazioni dei modelli di frontiera senza fingere di primeggiare in ogni dimensione. Kimi stessa afferma che, nel complesso, il modello è ancora dietro a Claude Fable 5 e GPT-5.6 Sol. Questa trasparenza rende più credibile il vantaggio specifico: K3 offre capacità solide sui lavori a lungo orizzonte a un costo API sensibilmente inferiore.
Recensione Kimi K3: il verdetto in una tabella
Kimi K3 merita una prova controllata in produzione, non la migrazione del modello predefinito. Costa abbastanza poco da essere testato su attività reali ed è abbastanza capace da vincere su alcuni flussi, ma i limiti della versione di lancio rendono prematuro un passaggio generalizzato.
La regola decisionale è semplice: provare K3 quando il costo limita un flusso agente con contesto lungo; mantenere Sol o Fable quando un errore costa più del risparmio sui token. Se il requisito è il self-hosting, conviene aspettare i pesi effettivi e la licenza.
Che cos'è davvero Kimi K3
Kimi K3 è un modello mixture-of-experts su scala infrastrutturale, non un enorme modello denso che attiva tutti i 2.8 trilioni di parametri per ogni token. Un modello mixture-of-experts instrada ogni token attraverso un piccolo gruppo di sottoreti specializzate. K3 usa Stable LatentMoE per attivare 16 esperti su 896: è così che un modello di queste dimensioni riesce a fornire risposte a un prezzo API inferiore rispetto ai leader proprietari di frontiera.
Il quickstart ufficiale fissa le specifiche principali:
- 2.8 trilioni di parametri complessivi.
- 1,048,576 token di contesto, con prezzo per token invariato anziché una tariffa separata per il contesto lungo.
- Comprensione visiva nativa, con input di testo e immagini e output testuale.
- Kimi Delta Attention, un'architettura ibrida dell'attenzione progettata per trasportare le informazioni in modo efficiente lungo sequenze estese.
- Attention Residuals, un metodo che recupera rappresentazioni utili attraverso la profondità del modello invece di accumulare uniformemente ogni livello.
- Cache automatica del contesto, senza richiedere ID della cache, impostazioni di scadenza o parametri aggiuntivi nella richiesta.
Kimi attribuisce a queste modifiche di architettura e addestramento un miglioramento di circa 2.5x nell'efficienza di scalabilità rispetto a K2. Va considerata un'affermazione del produttore sull'architettura, non un benchmark applicativo. La conseguenza pratica per chi acquista è più facile da verificare: K3 offre uno spazio di lavoro da un milione di token e, quando il prefisso va in cache, applica un decimo della tariffa di input senza cache.
K3 è già disponibile in quattro forme. Kimi.com è l'interfaccia di chat. Kimi Work, dalla versione 3.1.0 in poi, lo porta su Windows e sui Mac con Apple silicon. In Kimi Code si seleziona dal terminale con /model. Gli sviluppatori possono richiamare il modello kimi-k3 tramite l'API di Kimi.
L'API supporta chiamate agli strumenti, JSON Mode, output strutturato, vincoli sulla scelta degli strumenti e strumenti caricati dinamicamente. L'input visivo ha un limite scomodo: gli URL pubblici delle immagini non sono accettati, quindi le applicazioni devono inviare dati base64 o un riferimento a un file Kimi.
I benchmark mostrano un modello competitivo alla frontiera, non il migliore in assoluto
Le misurazioni indipendenti collocano Kimi K3 vicino ai primi posti, ma rivelano anche il costo nascosto dietro un listino conveniente: il modello è lento e prolisso. Artificial Analysis assegna a K3 un punteggio di 57 e lo posiziona al #4 su 189 modelli. Misura 62.0 token di output al secondo, #91 su 189, e registra 130M token di output nel suo Intelligence Index contro una media di 63M.
Questa verbosità conta perché l'output è la componente costosa della fattura di K3. Artificial Analysis dichiara di aver speso $2,709.75 per valutare il modello. Un modello può costare poco per token e diventare comunque caro per risultato accettato, se produce circa il doppio del volume di output rispetto al gruppo di confronto.
La tabella dei benchmark di Kimi mostra un quadro più articolato:
Sono risultati importanti, ma non costituiscono un unico confronto diretto e uniforme. Kimi ha eseguito K3 con ragionamento max, temperatura 1.0 e top-p 1.0. Il runner di valutazione cambia tra le varie righe, alternando Kimi Code, Claude Code e Codex. Alcuni risultati di Fable 5 possono includere il fallback a Opus 4.8. La tabella giustifica la definizione di K3 come competitivo alla frontiera, non quella di vincitore universale.
Le evidenze indipendenti e quelle del produttore convergono sulla conclusione utile. K3 è abbastanza capace da contendere un flusso di produzione, ma non abbastanza collaudato da sostituire gli altri modelli su ogni flusso.
- K3 costa $3 per l'input e $15 per l'output per milione di token senza cache, molto meno di Sol e Fable 5.
- Con un cache hit, l'input scende a $0.30 per milione di token grazie alla cache automatica del prefisso.
- Il contesto da 1,048,576 token non è soggetto a una tariffa separata per il contesto lungo.
- Visione nativa, output strutturato, chiamate agli strumenti e caricamento dinamico degli strumenti coprono le funzioni essenziali di un agente.
- Le misurazioni indipendenti collocano K3 al #4 su 189 modelli in un ampio indice di intelligenza.
- I pesi completi, la licenza definitiva e il report tecnico non sono ancora pubblici.
- È disponibile solo l'effort di ragionamento max, quindi non esiste un'impostazione più economica o veloce a cui assegnare le attività semplici.
- Kimi avverte che l'assenza dello storico di ragionamento o il cambio di modello durante una sessione possono destabilizzare la qualità.
- Lo strumento di ricerca web di Kimi è in aggiornamento e non è consigliato nel breve periodo.
- Le misurazioni indipendenti rilevano che K3 è più lento e molto più prolisso della media di confronto.
Il vero motivo per provare Kimi K3 è il costo dell'API
Il primo argomento di Kimi K3 per l'uso in produzione è il costo, soprattutto quando una sessione di coding riutilizza un prefisso stabile del repository. Il listino ufficiale prevede $0.30 per milione di token di input con cache hit, $3 per milione di token di input con cache miss e $15 per milione di token di output.
Per un milione di token di input senza cache più un milione di token di output, il confronto diretto è questo:
- Kimi K3: $18
- GPT-5.6 Sol: $35
- Claude Fable 5: $60
Su questo carico volutamente semplice, K3 costa il 48.6% in meno di Sol e il 70% in meno di Fable.
Un esempio più realistico per un agente di coding è un mese con 10M token di input e 1M token di output, in cui 9M token di input sono abbastanza stabili da finire in cache. Kimi afferma che la sua API ufficiale supera un tasso di cache hit del 90% sui carichi di coding, anche se saranno la struttura del repository e la stabilità del prefisso a determinare se l'applicazione riuscirà a replicarlo.
- K3: 9 x $0.30 input in cache + 1 x $3 input senza cache + 1 x $15 output = $20.70.
- Sol: 9 x $0.50 input in cache + 1 x $5 input senza cache + 1 x $30 output = $39.50.
- Fable: 9 x $1 input in cache + 1 x $10 input senza cache + 1 x $50 output = $69.00.
Senza alcun cache hit, lo stesso carico costa $45 su K3, $80 su Sol e $150 su Fable. La cache non crea il vantaggio di prezzo di K3, ma lo conserva durante le sessioni lunghe.

Il rischio è ottimizzare il prezzo dei token invece del costo per risultato accettato. Artificial Analysis ha osservato che K3 ha generato 130M token di output contro una media di confronto di 63M. Se il flusso richiede più revisione, generazioni più lunghe o correzioni ripetute, la tariffa di output da $15 può erodere parte del risparmio dichiarato.
L'abbonamento per gli utenti è un canale d'acquisto separato dall'API. Il listino ufficiale degli abbonamenti di Kimi include il piano gratuito Adagio con 6 crediti Agent e un'attività Agent simultanea, ma senza crediti Kimi Code. Moderato parte da $19 al mese, oppure $15 al mese con fatturazione annuale, e include 60 crediti Agent e 1x crediti Kimi Code. I piani mensili superiori sono Allegretto a $39, Allegro a $99 e Vivace a $199.
Il piano gratuito è quindi adatto a osservare l'interfaccia e lo stile di output di K3. Non sostituisce una valutazione API per un carico di produzione, perché i crediti dell'abbonamento e la fatturazione a token dell'API usano contatori diversi.
I limiti in produzione contano più della demo
Il rischio di Kimi K3 in produzione non riguarda l'intelligenza pura. Nasce dall'interazione tra stato della sessione, effort di ragionamento fisso, autorizzazioni degli strumenti e un'esperienza di prodotto ancora acerba.
Conservare l'intero storico di ragionamento
K3 è stato addestrato a lavorare con l'intero storico di ragionamento conservato per tutta la sessione. Kimi avverte che la qualità può diventare molto instabile se il runtime di un agente elimina quello storico o sposta a K3 una sessione già avviata con un altro modello. Non è un semplice dettaglio di formattazione del prompt: un esperimento con un router di modelli può far sembrare K3 peggiore di quanto sia davvero se il passaggio avviene a conversazione iniziata.
La valutazione di K3 dovrebbe partire da una sessione nuova e mantenere intatto l'intero storico dell'assistente. Il confronto non va eseguito cambiando soltanto l'ID del modello a metà di un percorso con Sol o Fable.
Max è l'unico livello di effort
K3 ragiona sempre e, al momento, reasoning_effort accetta soltanto max. Sono previsti controlli inferiori e superiori, ma non sono ancora disponibili. Viene così a mancare una leva utile in produzione: le attività semplici non possono passare dallo stesso endpoint con un effort più rapido ed economico.
Per il fondatore di una startup finanziata che sta risolvendo una migrazione difficile, l'effort max obbligatorio può essere accettabile. Per il CTO di un'azienda mid-market che instrada migliaia di comuni attività di classificazione, è uno spreco. Conviene affiancare a K3 un modello più economico invece di affidargli ogni richiesta.
Vincolare le azioni più dei prompt
Kimi spiega che K3 può prendere decisioni impreviste quando le istruzioni sono ambigue, perché è stato addestrato a portare avanti attività a lungo orizzonte. La soluzione pratica non è un prompt di personalità più lungo, ma una serie di regole operative esplicite: strumenti in allowlist, conferma prima delle scritture esterne, limiti di spesa, percorsi dei file circoscritti e rollback.
Un agente che scrive un'ottima patch ma modifica anche una configurazione non correlata non è autonomo in modo utile. Il comportamento proattivo va trattato come una capacità che richiede un raggio d'azione più ristretto.
Non progettare il sistema attorno alla ricerca web, per ora
La documentazione API di Kimi afferma che la ricerca web è in aggiornamento e non è consigliata nel breve periodo. Per gli agenti di ricerca significa usare un livello separato di ricerca o retrieval, invece di dare per pronto lo strumento ufficiale di K3.
Kimi dichiara inoltre un divario evidente nell'esperienza utente rispetto a Fable 5 e Sol. L'espressione è ampia, ma i limiti circostanti la rendono concreta: la compatibilità delle sessioni è fragile, il routing dell'effort è incompleto e uno strumento ufficiale è in fase di transizione. Nessuno di questi difetti invalida il modello, ma tutti delimitano la portata di una prova ragionevole.
I pesi aperti restano una promessa fino al 27 luglio
Il 17 luglio 2026, Kimi K3 non è ancora una scelta disponibile per il self-hosting. Kimi promette i pesi completi del modello entro il 27 luglio e il report tecnico insieme a essi. Finché questi artefatti e la licenza definitiva non saranno pubblici, "open" indica la destinazione annunciata, non una risorsa di produzione scaricabile.
Le dimensioni cambiano anche il significato pratico di open weight. Con 2.8 trilioni di parametri, i soli pesi occupano circa 1.4 TB a 4 bit per parametro o 5.6 TB a 16 bit per parametro, prima di considerare overhead del runtime, cache, attivazioni e ridondanza. Kimi consiglia installazioni su supernodi con 64 o più acceleratori.
È un'infrastruttura da data center, non un modello da workstation. Per un singolo sviluppatore tecnico ha più senso noleggiare l'API. Un'azienda mid-market interessata all'inferenza privata dovrebbe calcolare il costo di cluster, rete, personale addetto al serving e capacità di riserva prima di considerare il self-hosting un piano di risparmio.
La distinzione è importante:
- Open weight significa che i parametri addestrati possono essere scaricati.
- Open source richiede anche codice e termini di licenza che consentano l'uso previsto.
- Self-hosting praticabile significa che il modello rientra in un'infrastruttura e in un budget operativo sostenibili.
L'attuale panorama dei modelli open-weight include già alternative più piccole e più semplici da distribuire. K3 potrebbe affiancarle al vertice delle capacità, ma prima devono arrivare i file della release e la licenza.
Chi dovrebbe scegliere Kimi K3, GPT-5.6 Sol o Claude Fable 5
La scelta va fatta in base al costo di un errore, non al miglior risultato del modello in un benchmark.
Kimi K3 è la prova sul rapporto prezzo-prestazioni
Kimi K3 è l'esperimento giusto quando il contesto lungo, il lavoro sui repository con cache o la visione nativa offrono un vantaggio concreto sul carico. Con $3 per l'input, $0.30 per l'input in cache e $15 per l'output per milione di token, può perdere un po' di efficienza e battere comunque i leader di frontiera sul costo. È meglio evitarlo se l'infrastruttura di sessione non riesce a conservare lo storico, se la ricerca web ufficiale è essenziale o se un'azione prematura potrebbe costare cara.
GPT-5.6 Sol è il riferimento da battere in produzione
GPT-5.6 Sol resta la scelta predefinita più solida quando il flusso dipende da strumenti maturi e da un comportamento collaudato su attività diverse. Supporta function calling, output strutturato, ricerca web e nei file, esecuzione di codice, shell ospitata, uso del computer, MCP e ricerca degli strumenti. Le tariffe di $5 per l'input, $0.50 per l'input in cache e $30 per l'output sono superiori a quelle di K3, ma un minor carico di revisione può giustificare il sovrapprezzo. L'attuale guida al routing di GPT-5.6 spiega come distribuire il lavoro tra Sol, Terra e Luna.

Sol va escluso quando un flusso stabile e ripetibile produce su K3 lo stesso risultato accettato. Continuare a pagare il sovrapprezzo di frontiera dopo che il modello più economico ha superato la valutazione è abitudine, non gestione del rischio.
Claude Fable 5 è il sovrapprezzo per la capacità di giudizio
Claude Fable 5 è il modello generalmente disponibile più capace di Anthropic per progetti ambiziosi di coding e knowledge work. Costa $10 per l'input e $50 per l'output per milione di token, con uno sconto del 90% sulla prompt cache dell'input. Anthropic lo posiziona per progetti di lunga durata che pianificano, delegano, testano e controllano autonomamente il proprio lavoro.

I limiti sono il prezzo e la prevedibilità del routing. Le richieste sensibili in ambito cybersecurity e biologia possono passare a Opus 4.8. Fable giustifica il sovrapprezzo solo quando meno correzioni, un giudizio migliore o un'autonomia affidabile più duratura producono più lavoro accettato rispetto a K3 o Sol.
Un piano reversibile per valutare Kimi K3
Il percorso più sicuro per adottare K3 modifica un flusso alla volta e mantiene pronto il modello precedente. Il lancio di un modello va trattato come l'aggiornamento di una dipendenza: osservabile, reversibile e abbastanza circoscritto da consentire una diagnosi.

Scegliere un solo flusso costoso
Si parte da un'attività in cui il costo di Sol o Fable è rilevante e K3 offre un vantaggio plausibile, come il debugging su repository di grandi dimensioni, l'analisi di documenti lunghi o la correzione frontend guidata dalla visione. Non da ogni chiamata AI del prodotto.
Fissare le condizioni del confronto
Vanno usati gli stessi prompt, file, strumenti, limiti delle autorizzazioni e criteri di accettazione. Dove possibile, il runtime dell'agente deve restare invariato, così una differenza tra modelli non viene confusa con una differenza negli strumenti.
Partire da zero e conservare lo storico
Occorre creare nuove sessioni K3, mantenere l'intero storico di ragionamento dell'assistente richiesto dall'API e conservare prefissi stabili abbastanza coerenti a livello di byte da ottenere cache hit. Una sessione in corso non va mai spostata da un altro modello a K3.
Limitare le azioni all'esterno del modello
Gli strumenti vanno inseriti in allowlist, con approvazione obbligatoria per scritture esterne e modifiche distruttive, limiti di spesa e possibilità di rollback. Il confine deve stare nel codice e nelle autorizzazioni, non soltanto nel prompt di sistema.
Misurare i risultati accettati
Vanno registrati input, input in cache, output, tempo trascorso, tentativi, lavoro rifiutato e impegno di revisione. La spesa totale divisa per i risultati accettati riunisce in un'unica metrica la tariffa bassa di K3 e la sua tendenza a produrre output più lunghi.
Promuovere solo i flussi che K3 vince
Un flusso passa a K3 quando il modello soddisfa lo standard qualitativo a un costo totale inferiore. Sol o Fable restano un percorso di escalation esplicito per i casi difficili, mentre le attività semplici e ad alto volume rimangono su un modello più economico.
Questo piano non richiede di credere che K3 sia migliore in generale. Richiede di dimostrare che K3 è migliore per una sola attività. È l'unico livello al quale una decisione sul modello di produzione continua a essere vera nel tempo.
Che cos'è Kimi K3?
Kimi K3 è il modello di punta di Moonshot AI da 2.8 trilioni di parametri per coding a lungo orizzonte, knowledge work e ragionamento. Accetta testo e immagini, offre una finestra di contesto da 1,048,576 token ed è disponibile tramite le app, lo strumento di coding e l'API di Kimi.
Kimi K3 sarà open source?
Kimi afferma che i pesi completi del modello saranno pubblicati entro il 27 luglio 2026. Al 17 luglio, i pesi, la licenza definitiva e il report tecnico non sono pubblici; diritti commerciali e self-hosting riproducibile andranno quindi valutati quando questi artefatti saranno disponibili.
È possibile eseguire Kimi AI in locale?
K3 non è un normale modello locale. I suoi 2.8 trilioni di parametri occupano circa 1.4 TB anche a 4 bit per parametro, prima dell'overhead del runtime, e Kimi consiglia supernodi con 64 o più acceleratori. Per la maggior parte dei team è preferibile valutare K3 tramite API.
Kimi è completamente gratuito?
No. L'abbonamento Adagio è gratuito e include 6 crediti Agent, ma nessun credito Kimi Code. Gli abbonamenti a pagamento partono da Moderato a $19 al mese, mentre l'API di Kimi viene fatturata separatamente in base ai token di input e output.
Kimi K3 è migliore di GPT-5.6 Sol o Claude Fable 5?
Non nel complesso. K3 guida alcuni risultati dichiarati dal produttore e costa meno, ma Kimi afferma che resta dietro a Sol e Fable nel complesso. La domanda pratica è se K3 soddisfa lo standard di accettazione del proprio flusso a un costo totale inferiore.
Vuoi una mappa aggiornata dei modelli più adatti ai diversi lavori? Ricevi gratis la guida agli strumenti AI per imprenditori.
Ricevi la guida agli strumenti AI per imprenditori
Una mappa chiara dei modelli e degli strumenti AI più adatti a ogni lavoro, aggiornata al variare di prezzi e funzionalità. Gratis per gli iscritti.
3 set 2026







