Kimi K3, la recensione: prestazioni da frontiera a metà del costo API, ma i pesi non ci sono ancora

Kimi K3 offre coding a lungo raggio e API convenienti, ma pesi e report tecnico non sono ancora pubblici. Recensione con prezzi, benchmark e limiti.

Thursday, September 3, 2026Omid Saffari
Kimi K3, la recensione: prestazioni da frontiera a metà del costo API, ma i pesi non ci sono ancora

Kimi K3 è il modello da provare per attività di coding con cache e orizzonte lungo, non ancora quello su cui standardizzare. La sua API costa $3 per milione di token di input senza cache e $15 per milione di token di output, circa la metà del costo combinato di GPT-5.6 Sol, ma i pesi promessi e il report tecnico non sono ancora pubblici. La stessa documentazione di Kimi segnala inoltre cambi di sessione instabili, azioni intraprese con eccessiva facilità e un divario nell'esperienza utente.

Kimi K3 è stato lanciato il 16 luglio 2026 come modello di punta di Moonshot AI per coding, agenti e lavoro intellettuale end-to-end. È già disponibile tramite Kimi.com, Kimi Work, Kimi Code o l'API kimi-k3.

Pagina di lancio di Kimi K3 con dettagli sul modello e grafici dei benchmark
Kimi K3

Il lancio conta perché K3 entra nel confronto tra prezzo e prestazioni dei modelli di frontiera senza fingere di primeggiare in ogni dimensione. Kimi stessa afferma che, nel complesso, il modello è ancora dietro a Claude Fable 5 e GPT-5.6 Sol. Questa trasparenza rende più credibile il vantaggio specifico: K3 offre capacità solide sui lavori a lungo orizzonte a un costo API sensibilmente inferiore.

Recensione Kimi K3: il verdetto in una tabella

Kimi K3 merita una prova controllata in produzione, non la migrazione del modello predefinito. Costa abbastanza poco da essere testato su attività reali ed è abbastanza capace da vincere su alcuni flussi, ma i limiti della versione di lancio rendono prematuro un passaggio generalizzato.

ModelloIdeale perPrezzo API per 1M, input / outputInput in cacheRiscontro attualeLimite principale
Kimi K3Coding con contesto lungo e cache, lavoro sui repository, test di agenti attenti ai costi$3 / $15$0.3057 nell'Artificial Analysis Intelligence Index, #4 su 189Pesi e report tecnico non sono pubblici; è disponibile solo l'effort max
GPT-5.6 SolUso maturo degli strumenti, decisioni difficili, routing ampio in produzione$5 / $30$0.50Modello di frontiera con un contesto da 1,050,000 token e un ecosistema di strumenti maturoPrezzo di output più alto
Claude Fable 5Lavori di lunga durata in cui autonomia e capacità di giudizio giustificano il sovrapprezzo$10 / $50$1 dopo lo sconto cache del 90%Il modello più capace di Anthropic tra quelli generalmente disponibiliPrezzo più alto; alcune richieste sensibili passano a Opus 4.8

La regola decisionale è semplice: provare K3 quando il costo limita un flusso agente con contesto lungo; mantenere Sol o Fable quando un errore costa più del risparmio sui token. Se il requisito è il self-hosting, conviene aspettare i pesi effettivi e la licenza.

Che cos'è davvero Kimi K3

Kimi K3 è un modello mixture-of-experts su scala infrastrutturale, non un enorme modello denso che attiva tutti i 2.8 trilioni di parametri per ogni token. Un modello mixture-of-experts instrada ogni token attraverso un piccolo gruppo di sottoreti specializzate. K3 usa Stable LatentMoE per attivare 16 esperti su 896: è così che un modello di queste dimensioni riesce a fornire risposte a un prezzo API inferiore rispetto ai leader proprietari di frontiera.

Il quickstart ufficiale fissa le specifiche principali:

  • 2.8 trilioni di parametri complessivi.
  • 1,048,576 token di contesto, con prezzo per token invariato anziché una tariffa separata per il contesto lungo.
  • Comprensione visiva nativa, con input di testo e immagini e output testuale.
  • Kimi Delta Attention, un'architettura ibrida dell'attenzione progettata per trasportare le informazioni in modo efficiente lungo sequenze estese.
  • Attention Residuals, un metodo che recupera rappresentazioni utili attraverso la profondità del modello invece di accumulare uniformemente ogni livello.
  • Cache automatica del contesto, senza richiedere ID della cache, impostazioni di scadenza o parametri aggiuntivi nella richiesta.

Kimi attribuisce a queste modifiche di architettura e addestramento un miglioramento di circa 2.5x nell'efficienza di scalabilità rispetto a K2. Va considerata un'affermazione del produttore sull'architettura, non un benchmark applicativo. La conseguenza pratica per chi acquista è più facile da verificare: K3 offre uno spazio di lavoro da un milione di token e, quando il prefisso va in cache, applica un decimo della tariffa di input senza cache.

K3 è già disponibile in quattro forme. Kimi.com è l'interfaccia di chat. Kimi Work, dalla versione 3.1.0 in poi, lo porta su Windows e sui Mac con Apple silicon. In Kimi Code si seleziona dal terminale con /model. Gli sviluppatori possono richiamare il modello kimi-k3 tramite l'API di Kimi.

L'API supporta chiamate agli strumenti, JSON Mode, output strutturato, vincoli sulla scelta degli strumenti e strumenti caricati dinamicamente. L'input visivo ha un limite scomodo: gli URL pubblici delle immagini non sono accettati, quindi le applicazioni devono inviare dati base64 o un riferimento a un file Kimi.

I benchmark mostrano un modello competitivo alla frontiera, non il migliore in assoluto

Le misurazioni indipendenti collocano Kimi K3 vicino ai primi posti, ma rivelano anche il costo nascosto dietro un listino conveniente: il modello è lento e prolisso. Artificial Analysis assegna a K3 un punteggio di 57 e lo posiziona al #4 su 189 modelli. Misura 62.0 token di output al secondo, #91 su 189, e registra 130M token di output nel suo Intelligence Index contro una media di 63M.

Questa verbosità conta perché l'output è la componente costosa della fattura di K3. Artificial Analysis dichiara di aver speso $2,709.75 per valutare il modello. Un modello può costare poco per token e diventare comunque caro per risultato accettato, se produce circa il doppio del volume di output rispetto al gruppo di confronto.

La tabella dei benchmark di Kimi mostra un quadro più articolato:

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolLettura
DeepSWE67.570.073.0K3 resta dietro a entrambi in questo test di ingegneria del software
Program Bench77.876.877.6K3 è in leggero vantaggio
Terminal-Bench 2.188.384.688.8K3 quasi eguaglia Sol e supera il risultato indicato per Fable
FrontierSWE81.286.671.3K3 si colloca tra i leader
SWE Marathon42.035.039.0K3 guida questa prova a orizzonte più lungo
GDPval-AA v2, Elo166817601748K3 è dietro a entrambi nel lavoro professionale generalista
BrowseComp91.288.090.4K3 è primo nel browsing nella tabella del produttore

Sono risultati importanti, ma non costituiscono un unico confronto diretto e uniforme. Kimi ha eseguito K3 con ragionamento max, temperatura 1.0 e top-p 1.0. Il runner di valutazione cambia tra le varie righe, alternando Kimi Code, Claude Code e Codex. Alcuni risultati di Fable 5 possono includere il fallback a Opus 4.8. La tabella giustifica la definizione di K3 come competitivo alla frontiera, non quella di vincitore universale.

Le evidenze indipendenti e quelle del produttore convergono sulla conclusione utile. K3 è abbastanza capace da contendere un flusso di produzione, ma non abbastanza collaudato da sostituire gli altri modelli su ogni flusso.

I punti di forza
Cosa fa bene
10 points

  • K3 costa $3 per l'input e $15 per l'output per milione di token senza cache, molto meno di Sol e Fable 5.
  • Con un cache hit, l'input scende a $0.30 per milione di token grazie alla cache automatica del prefisso.
  • Il contesto da 1,048,576 token non è soggetto a una tariffa separata per il contesto lungo.
  • Visione nativa, output strutturato, chiamate agli strumenti e caricamento dinamico degli strumenti coprono le funzioni essenziali di un agente.
  • Le misurazioni indipendenti collocano K3 al #4 su 189 modelli in un ampio indice di intelligenza.
  • I pesi completi, la licenza definitiva e il report tecnico non sono ancora pubblici.
  • È disponibile solo l'effort di ragionamento max, quindi non esiste un'impostazione più economica o veloce a cui assegnare le attività semplici.
  • Kimi avverte che l'assenza dello storico di ragionamento o il cambio di modello durante una sessione possono destabilizzare la qualità.
  • Lo strumento di ricerca web di Kimi è in aggiornamento e non è consigliato nel breve periodo.
  • Le misurazioni indipendenti rilevano che K3 è più lento e molto più prolisso della media di confronto.

Il vero motivo per provare Kimi K3 è il costo dell'API

Il primo argomento di Kimi K3 per l'uso in produzione è il costo, soprattutto quando una sessione di coding riutilizza un prefisso stabile del repository. Il listino ufficiale prevede $0.30 per milione di token di input con cache hit, $3 per milione di token di input con cache miss e $15 per milione di token di output.

Per un milione di token di input senza cache più un milione di token di output, il confronto diretto è questo:

  • Kimi K3: $18
  • GPT-5.6 Sol: $35
  • Claude Fable 5: $60

Su questo carico volutamente semplice, K3 costa il 48.6% in meno di Sol e il 70% in meno di Fable.

Un esempio più realistico per un agente di coding è un mese con 10M token di input e 1M token di output, in cui 9M token di input sono abbastanza stabili da finire in cache. Kimi afferma che la sua API ufficiale supera un tasso di cache hit del 90% sui carichi di coding, anche se saranno la struttura del repository e la stabilità del prefisso a determinare se l'applicazione riuscirà a replicarlo.

  • K3: 9 x $0.30 input in cache + 1 x $3 input senza cache + 1 x $15 output = $20.70.
  • Sol: 9 x $0.50 input in cache + 1 x $5 input senza cache + 1 x $30 output = $39.50.
  • Fable: 9 x $1 input in cache + 1 x $10 input senza cache + 1 x $50 output = $69.00.

Senza alcun cache hit, lo stesso carico costa $45 su K3, $80 su Sol e $150 su Fable. La cache non crea il vantaggio di prezzo di K3, ma lo conserva durante le sessioni lunghe.

Diagramma decisionale che confronta i costi dei carichi con cache su Kimi K3, GPT-5.6 Sol e Claude Fable 5
Con un tasso di cache hit sull'input del 90%, K3 è la soluzione più economica per un test serio.

Il rischio è ottimizzare il prezzo dei token invece del costo per risultato accettato. Artificial Analysis ha osservato che K3 ha generato 130M token di output contro una media di confronto di 63M. Se il flusso richiede più revisione, generazioni più lunghe o correzioni ripetute, la tariffa di output da $15 può erodere parte del risparmio dichiarato.

L'abbonamento per gli utenti è un canale d'acquisto separato dall'API. Il listino ufficiale degli abbonamenti di Kimi include il piano gratuito Adagio con 6 crediti Agent e un'attività Agent simultanea, ma senza crediti Kimi Code. Moderato parte da $19 al mese, oppure $15 al mese con fatturazione annuale, e include 60 crediti Agent e 1x crediti Kimi Code. I piani mensili superiori sono Allegretto a $39, Allegro a $99 e Vivace a $199.

Il piano gratuito è quindi adatto a osservare l'interfaccia e lo stile di output di K3. Non sostituisce una valutazione API per un carico di produzione, perché i crediti dell'abbonamento e la fatturazione a token dell'API usano contatori diversi.

I limiti in produzione contano più della demo

Il rischio di Kimi K3 in produzione non riguarda l'intelligenza pura. Nasce dall'interazione tra stato della sessione, effort di ragionamento fisso, autorizzazioni degli strumenti e un'esperienza di prodotto ancora acerba.

Conservare l'intero storico di ragionamento

K3 è stato addestrato a lavorare con l'intero storico di ragionamento conservato per tutta la sessione. Kimi avverte che la qualità può diventare molto instabile se il runtime di un agente elimina quello storico o sposta a K3 una sessione già avviata con un altro modello. Non è un semplice dettaglio di formattazione del prompt: un esperimento con un router di modelli può far sembrare K3 peggiore di quanto sia davvero se il passaggio avviene a conversazione iniziata.

La valutazione di K3 dovrebbe partire da una sessione nuova e mantenere intatto l'intero storico dell'assistente. Il confronto non va eseguito cambiando soltanto l'ID del modello a metà di un percorso con Sol o Fable.

Max è l'unico livello di effort

K3 ragiona sempre e, al momento, reasoning_effort accetta soltanto max. Sono previsti controlli inferiori e superiori, ma non sono ancora disponibili. Viene così a mancare una leva utile in produzione: le attività semplici non possono passare dallo stesso endpoint con un effort più rapido ed economico.

Per il fondatore di una startup finanziata che sta risolvendo una migrazione difficile, l'effort max obbligatorio può essere accettabile. Per il CTO di un'azienda mid-market che instrada migliaia di comuni attività di classificazione, è uno spreco. Conviene affiancare a K3 un modello più economico invece di affidargli ogni richiesta.

Vincolare le azioni più dei prompt

Kimi spiega che K3 può prendere decisioni impreviste quando le istruzioni sono ambigue, perché è stato addestrato a portare avanti attività a lungo orizzonte. La soluzione pratica non è un prompt di personalità più lungo, ma una serie di regole operative esplicite: strumenti in allowlist, conferma prima delle scritture esterne, limiti di spesa, percorsi dei file circoscritti e rollback.

Un agente che scrive un'ottima patch ma modifica anche una configurazione non correlata non è autonomo in modo utile. Il comportamento proattivo va trattato come una capacità che richiede un raggio d'azione più ristretto.

Non progettare il sistema attorno alla ricerca web, per ora

La documentazione API di Kimi afferma che la ricerca web è in aggiornamento e non è consigliata nel breve periodo. Per gli agenti di ricerca significa usare un livello separato di ricerca o retrieval, invece di dare per pronto lo strumento ufficiale di K3.

Kimi dichiara inoltre un divario evidente nell'esperienza utente rispetto a Fable 5 e Sol. L'espressione è ampia, ma i limiti circostanti la rendono concreta: la compatibilità delle sessioni è fragile, il routing dell'effort è incompleto e uno strumento ufficiale è in fase di transizione. Nessuno di questi difetti invalida il modello, ma tutti delimitano la portata di una prova ragionevole.

I pesi aperti restano una promessa fino al 27 luglio

Il 17 luglio 2026, Kimi K3 non è ancora una scelta disponibile per il self-hosting. Kimi promette i pesi completi del modello entro il 27 luglio e il report tecnico insieme a essi. Finché questi artefatti e la licenza definitiva non saranno pubblici, "open" indica la destinazione annunciata, non una risorsa di produzione scaricabile.

Le dimensioni cambiano anche il significato pratico di open weight. Con 2.8 trilioni di parametri, i soli pesi occupano circa 1.4 TB a 4 bit per parametro o 5.6 TB a 16 bit per parametro, prima di considerare overhead del runtime, cache, attivazioni e ridondanza. Kimi consiglia installazioni su supernodi con 64 o più acceleratori.

È un'infrastruttura da data center, non un modello da workstation. Per un singolo sviluppatore tecnico ha più senso noleggiare l'API. Un'azienda mid-market interessata all'inferenza privata dovrebbe calcolare il costo di cluster, rete, personale addetto al serving e capacità di riserva prima di considerare il self-hosting un piano di risparmio.

La distinzione è importante:

  • Open weight significa che i parametri addestrati possono essere scaricati.
  • Open source richiede anche codice e termini di licenza che consentano l'uso previsto.
  • Self-hosting praticabile significa che il modello rientra in un'infrastruttura e in un budget operativo sostenibili.

L'attuale panorama dei modelli open-weight include già alternative più piccole e più semplici da distribuire. K3 potrebbe affiancarle al vertice delle capacità, ma prima devono arrivare i file della release e la licenza.

Chi dovrebbe scegliere Kimi K3, GPT-5.6 Sol o Claude Fable 5

La scelta va fatta in base al costo di un errore, non al miglior risultato del modello in un benchmark.

SituazioneSceltaPerchéDa evitare quando
Un agente di coding legge ripetutamente un repository grande e stabileProva di Kimi K3La cache automatica e l'input in cache a $0.30 rendono economiche le sessioni lungheIl runtime non riesce a conservare l'intero storico di ragionamento
Un agente in produzione richiede strumenti ampi e maturi e decisioni difficiliGPT-5.6 SolCapacità generaliste solide, strumenti web e computer maturi e un ecosistema di produzione attualeLa spesa per l'output domina e K3 offre la stessa qualità su quel flusso
Un'attività ad alto impatto e di più giorni premia la capacità di giudizio rispetto al prezzoClaude Fable 5Pensato per attività ambiziose e di lunga durata, con validazioneIl prezzo di output da $50 non viene recuperato con un minor numero di correzioni
I dati devono restare su un'infrastruttura controllata direttamenteAspettare o scegliere un altro modello apertoI pesi di K3 e la licenza definitiva non sono pubbliciUn'API è accettabile durante la valutazione
Attività semplici ad alto volume richiedono bassa latenza e poca spesa di ragionamentoNessun flagship come scelta predefinitaK3 dispone solo dell'effort max; Sol e Fable sono opzioni premiumUn tasso di errore misurato dimostra che il flagship ripaga il costo

Kimi K3 è la prova sul rapporto prezzo-prestazioni

Kimi K3 è l'esperimento giusto quando il contesto lungo, il lavoro sui repository con cache o la visione nativa offrono un vantaggio concreto sul carico. Con $3 per l'input, $0.30 per l'input in cache e $15 per l'output per milione di token, può perdere un po' di efficienza e battere comunque i leader di frontiera sul costo. È meglio evitarlo se l'infrastruttura di sessione non riesce a conservare lo storico, se la ricerca web ufficiale è essenziale o se un'azione prematura potrebbe costare cara.

GPT-5.6 Sol è il riferimento da battere in produzione

GPT-5.6 Sol resta la scelta predefinita più solida quando il flusso dipende da strumenti maturi e da un comportamento collaudato su attività diverse. Supporta function calling, output strutturato, ricerca web e nei file, esecuzione di codice, shell ospitata, uso del computer, MCP e ricerca degli strumenti. Le tariffe di $5 per l'input, $0.50 per l'input in cache e $30 per l'output sono superiori a quelle di K3, ma un minor carico di revisione può giustificare il sovrapprezzo. L'attuale guida al routing di GPT-5.6 spiega come distribuire il lavoro tra Sol, Terra e Luna.

Pagina di lancio di OpenAI GPT-5.6 con Sol, Terra e Luna
GPT-5.6 Sol

Sol va escluso quando un flusso stabile e ripetibile produce su K3 lo stesso risultato accettato. Continuare a pagare il sovrapprezzo di frontiera dopo che il modello più economico ha superato la valutazione è abitudine, non gestione del rischio.

Claude Fable 5 è il sovrapprezzo per la capacità di giudizio

Claude Fable 5 è il modello generalmente disponibile più capace di Anthropic per progetti ambiziosi di coding e knowledge work. Costa $10 per l'input e $50 per l'output per milione di token, con uno sconto del 90% sulla prompt cache dell'input. Anthropic lo posiziona per progetti di lunga durata che pianificano, delegano, testano e controllano autonomamente il proprio lavoro.

Pagina del prodotto e dei prezzi Anthropic Claude Fable 5
Claude Fable 5

I limiti sono il prezzo e la prevedibilità del routing. Le richieste sensibili in ambito cybersecurity e biologia possono passare a Opus 4.8. Fable giustifica il sovrapprezzo solo quando meno correzioni, un giudizio migliore o un'autonomia affidabile più duratura producono più lavoro accettato rispetto a K3 o Sol.

Un piano reversibile per valutare Kimi K3

Il percorso più sicuro per adottare K3 modifica un flusso alla volta e mantiene pronto il modello precedente. Il lancio di un modello va trattato come l'aggiornamento di una dipendenza: osservabile, reversibile e abbastanza circoscritto da consentire una diagnosi.

Percorso in quattro fasi per valutare Kimi K3 in produzione, con avvisi sui rischi legati a sessione e strumenti
K3 dovrebbe superare i controlli su storico, autorizzazioni e risultati prima di gestire un flusso di produzione.
  1. Scegliere un solo flusso costoso

    Si parte da un'attività in cui il costo di Sol o Fable è rilevante e K3 offre un vantaggio plausibile, come il debugging su repository di grandi dimensioni, l'analisi di documenti lunghi o la correzione frontend guidata dalla visione. Non da ogni chiamata AI del prodotto.

  2. Fissare le condizioni del confronto

    Vanno usati gli stessi prompt, file, strumenti, limiti delle autorizzazioni e criteri di accettazione. Dove possibile, il runtime dell'agente deve restare invariato, così una differenza tra modelli non viene confusa con una differenza negli strumenti.

  3. Partire da zero e conservare lo storico

    Occorre creare nuove sessioni K3, mantenere l'intero storico di ragionamento dell'assistente richiesto dall'API e conservare prefissi stabili abbastanza coerenti a livello di byte da ottenere cache hit. Una sessione in corso non va mai spostata da un altro modello a K3.

  4. Limitare le azioni all'esterno del modello

    Gli strumenti vanno inseriti in allowlist, con approvazione obbligatoria per scritture esterne e modifiche distruttive, limiti di spesa e possibilità di rollback. Il confine deve stare nel codice e nelle autorizzazioni, non soltanto nel prompt di sistema.

  5. Misurare i risultati accettati

    Vanno registrati input, input in cache, output, tempo trascorso, tentativi, lavoro rifiutato e impegno di revisione. La spesa totale divisa per i risultati accettati riunisce in un'unica metrica la tariffa bassa di K3 e la sua tendenza a produrre output più lunghi.

  6. Promuovere solo i flussi che K3 vince

    Un flusso passa a K3 quando il modello soddisfa lo standard qualitativo a un costo totale inferiore. Sol o Fable restano un percorso di escalation esplicito per i casi difficili, mentre le attività semplici e ad alto volume rimangono su un modello più economico.

Questo piano non richiede di credere che K3 sia migliore in generale. Richiede di dimostrare che K3 è migliore per una sola attività. È l'unico livello al quale una decisione sul modello di produzione continua a essere vera nel tempo.

Che cos'è Kimi K3?

Kimi K3 è il modello di punta di Moonshot AI da 2.8 trilioni di parametri per coding a lungo orizzonte, knowledge work e ragionamento. Accetta testo e immagini, offre una finestra di contesto da 1,048,576 token ed è disponibile tramite le app, lo strumento di coding e l'API di Kimi.

Kimi K3 sarà open source?

Kimi afferma che i pesi completi del modello saranno pubblicati entro il 27 luglio 2026. Al 17 luglio, i pesi, la licenza definitiva e il report tecnico non sono pubblici; diritti commerciali e self-hosting riproducibile andranno quindi valutati quando questi artefatti saranno disponibili.

È possibile eseguire Kimi AI in locale?

K3 non è un normale modello locale. I suoi 2.8 trilioni di parametri occupano circa 1.4 TB anche a 4 bit per parametro, prima dell'overhead del runtime, e Kimi consiglia supernodi con 64 o più acceleratori. Per la maggior parte dei team è preferibile valutare K3 tramite API.

Kimi è completamente gratuito?

No. L'abbonamento Adagio è gratuito e include 6 crediti Agent, ma nessun credito Kimi Code. Gli abbonamenti a pagamento partono da Moderato a $19 al mese, mentre l'API di Kimi viene fatturata separatamente in base ai token di input e output.

Kimi K3 è migliore di GPT-5.6 Sol o Claude Fable 5?

Non nel complesso. K3 guida alcuni risultati dichiarati dal produttore e costa meno, ma Kimi afferma che resta dietro a Sol e Fable nel complesso. La domanda pratica è se K3 soddisfa lo standard di accettazione del proprio flusso a un costo totale inferiore.

Vuoi una mappa aggiornata dei modelli più adatti ai diversi lavori? Ricevi gratis la guida agli strumenti AI per imprenditori.

Ultimo aggiornamento

3 set 2026

CategoriaAI

Preferisca questo sito su Google

Aggiungi omidsaffari.com come fonte preferita nella Ricerca Google

Segni omidsaffari.com come fonte preferita e Google lo mette in evidenza per lei in Top Stories, AI Overviews e AI Mode.

Newsletter

Una lettera, ogni domenica. Sistemi che funzionano, non hot take.

Build log, sistemi in produzione e note dal campo da un portafoglio di venture AI.

Settimanale. Niente spam. Si cancella quando vuole.