Ecco una suddivisione completa A–Z di cosa è realmente Kimi K3, cosa può fare e perché sta silenziosamente diventando il modello di coding più importante di cui nessuno parla ancora.
Segna questa pagina per non perdere questo articolo.
2,8 trilioni di parametri. 1 milione di token di contesto.
Ecco tutto ciò che contiene.
Prima di parlare dei benchmark, parliamo di ciò che è appena successo
Per gli ultimi tre anni la storia è stata sempre la stessa: i laboratori americani costruiscono la frontiera, i laboratori cinesi costruiscono la copia economica sei mesi dopo.
Il 16 luglio, Moonshot AI ha rilasciato Kimi K3.
https://x.com/Kimi_Moonshot/status/2077830229968683203
2,8 trilioni di parametri totali — circa il 75% in più rispetto a DeepSeek V4 Pro e quasi 4 volte la serie GLM 5 di Zhipu. Il modello open-source più grande mai rilasciato.
Supera Claude Opus 4.8. Supera GPT-5.6 Sol. E nei benchmark di Moonshot, è alla pari con Fable 5 — il modello più capace attualmente disponibile al pubblico.
La storia della copia è finita.
I numeri

Quell'ultima riga è quella che le persone fraintendono. Affrontiamola correttamente.
La realtà dei prezzi — leggila attentamente
Kimi K3 non è un modello economico. A $3/$15 per milione di token, ha un prezzo simile a Claude Sonnet — non ai profondi sconti delle precedenti versioni di Moonshot.
Quindi da dove viene "5 volte più economico di Fable 5"?
Costo per attività, non prezzo per token.
K3 utilizza sostanzialmente meno token di output per completare lo stesso lavoro. In un'attività di coding rappresentativa: Fable 5 costa circa $1,30. K3 costa circa $0,25.
Stesso livello di output. Meno token. Conto totale più basso.
L'inquadramento onesto: prezzo Sonnet, esperienza Fable. Non stai comprando i token più economici sul mercato. Stai comprando capacità di frontiera a un prezzo medio, e ci arrivi in meno passaggi.
Se confronti i prezzi grezzi dei token, K3 sembra insignificante. Se confronti quanto costa portare a termine un lavoro, è un discorso completamente diverso.
Dove Kimi K3 è all'avanguardia
Secondo i benchmark pubblicati da Moonshot, K3 stabilisce lo stato dell'arte su:
- HLE con strumenti — L'Esame Finale dell'Umanità, con supporto di strumenti
- SWE-Bench Pro — ingegneria del software nel mondo reale
- SWE-Bench Multilingue — ingegneria in più linguaggi
- BrowseComp — navigazione web e ricerca
- Toolathlon — uso di strumenti su larga scala
- CharXiv con Python — ragionamento su grafici e figure
- MathVision con Python — matematica visiva

Rispetto alla concorrenza: supera Opus 4.8 e GPT-5.6 Sol, alla pari con Fable 5.
Nei test alla cieca dell'AI evaluator Arena, gli sviluppatori hanno preferito Kimi rispetto a ogni modello americano leader.
Le due innovazioni architetturali che contano davvero
Questa è la parte che la maggior parte delle coperture sta saltando, ed è la cosa più interessante del rilascio.

- Kimi Delta Attention (KDA)
Un meccanismo di attenzione lineare ibrido. Il risultato: fino a 6,3x più veloce nella decodifica in contesti di milioni di token.
Una finestra di contesto da 1M è utile solo se puoi effettivamente lavorarci senza aspettare per sempre. KDA è ciò che rende la finestra di contesto pratica invece che teorica.
- Residui di Attenzione (AttnRes)
Un sostituto drop-in per le connessioni residue. Offre circa il 25% in più di efficienza di addestramento a un costo aggiuntivo inferiore al 2%.
Entrambe le tecniche sono state pubblicate come ricerca aperta dal team di Moonshot su GitHub prima che il modello fosse rilasciato. Non è marketing — è un lavoro verificabile dai pari.
E combinate, spiegano l'efficienza dei token: K3 utilizza il 21% in meno di token di output rispetto a K2.6 su attività equivalenti.
La parte che dovrebbe farti sobbalzare: K3 ha ottimizzato la propria architettura
Moonshot ha dato a K3 l'implementazione dei Residui di Attenzione — il suo stesso componente architetturale — e un obiettivo: renderlo più veloce sull'hardware H200 senza cambiare il comportamento numerico.
Poi lo hanno lasciato fare.
20 ore di esperimenti. Zero intervento umano. 1,6x di accelerazione.
In un'esecuzione separata, K3 ha ridotto il tempo forward/backward di FLA Triton AttnRes da 283,6ms a 114,4ms — un'accelerazione di 2,48x — ancora una volta senza cambiare i numeri.

E ha iterato più velocemente di Fable 5 nello stesso compito.
Leggilo di nuovo. Il modello ha migliorato il meccanismo che fa funzionare il modello. Autonomamente. Durante la notte.
Questo è ciò che "auto-miglioramento ricorsivo" significa in pratica — non uno scenario fantascientifico, un lavoro di 20 ore con un risultato misurabile. È la stessa capacità che Anthropic ha segnalato come motivo di cautela settimane fa, in esecuzione in un modello open-weight che chiunque può scaricare il 27 luglio.
Il coding a lungo orizzonte è il punto centrale
L'inquadramento di Moonshot: "K3 è il modello di coding open-source più potente di Moonshot AI fino ad oggi. Operando con una supervisione umana minima, può sostenere lunghe sessioni di ingegneria, navigare in repository massicci e orchestrare strumenti da terminale."
Le tre cose che contano per il lavoro di ingegneria reale:
- Sessioni sostenute — l'esperimento autonomo di 20 ore non è una demo. È il target di progettazione.
- Repository massicci — una finestra di contesto da 1M con decodifica 6,3x più veloce significa che puoi mettere un vero codebase nel contesto e lavorarci effettivamente.
- Orchestrazione di strumenti — SOTA su Toolathlon e BrowseComp significa che gestisce il terminale, il browser e le chiamate API senza crollare.
Il coding frontend raggiunge il livello di Fable 5. Scene di gioco di qualità AAA da un singolo prompt. WebGPU, Three.js, shader, fisica — cose che prima richiedevano uno studio.
Vibe Coding con Kimi K3
Qui è dove il modello smette di essere un numero di benchmark e inizia a essere chiaramente utile.
Il coding frontend di K3 è al livello di Fable 5. In pratica, ciò significa che il muro tra una descrizione e un prodotto 3D funzionante è ora un solo prompt.
Cosa le persone hanno effettivamente pubblicato da singoli prompt:
Giochi — Arene di combattimento WebGPU con effetti visivi. Esplorazione di città 3D basata su browser con meccaniche di rampino.
- Zombie FPS.
- Corsa multiplayer.
- Un emulatore GBA 3D funzionante.
- Impalcatura completa di MMORPG.
Non "una demo simile a un gioco" — scene giocabili con reazioni ai colpi, feedback d'impatto e fisica che si comporta correttamente.

Oggetti 3D con un vero lavoro sui materiali — Un Rolex con corretta lucentezza e comportamento della luce. Un'arma CSGO che si assembla e si smonta in 33 parti modellate singolarmente. Uno smontaggio di una fotocamera Sony. Un buco nero con lente gravitazionale. Simulazione oceanica con dinamiche delle onde reali.

Scene fisiche — Simulazione di tessuti. Collasso strutturale. Collisioni veicolari con trasferimento di quantità di moto che sembra giusto invece di sembrare scriptato.
La cosa che rende questo diverso dalle precedenti demo "AI costruisce un sito web": K3 gestisce i dettagli che di solito si rompono. Illuminazione. Ombre. Lucentezza dei materiali. Le 20 piccole cose che separano "chiaramente generato dall'AI" da "qualcuno lo ha costruito."
Un prompt. Quattro milioni di token. Una scena che prima richiedeva un team.
4 Prompt Collaudati (Pronti per Copia-Incolla)
Sono strutturati per sfruttare ciò in cui K3 è davvero bravo: lavoro a lungo orizzonte, uso di strumenti e mantenimento di un grande contesto senza deviare.
Prompt 1 — Il Test di Stress Fisico
Questo è il prompt che separa le capacità reali dalla lucidatura da demo. Se un modello riesce a fare tutte e tre le scene con qualità, è reale.
1Costruisci tre scene canvas HTML5 autonome con fisica reale.2Niente librerie esterne. Tutto in un file per scena.34Scena 1: Un treno che deraglia da un ponte rotto nell'acqua.5Includi: quantità di moto dei vagoni, cedimento strutturale del ponte,6spostamento d'acqua all'impatto.78Scena 2: Due auto che saltano da rampe e si scontrano a mezz'aria9su un canyon. Includi: traiettorie ad arco corrette,10trasferimento di quantità di moto alla collisione, detriti.1112Scena 3: Un monster truck che schiaccia una fila di auto parcheggiate.13Includi: compressione delle sospensioni, deformazione della lamiera,14distribuzione del peso.1516Requisiti per tutte e tre:17- La fisica deve essere calcolata, non animata18- Target 60fps19- Includi un pulsante di reset20- Commenta la matematica della fisica così posso verificarla2122Costruisci tutte e tre. Non fare domande di chiarimento.
Prompt 2 — Il Compito su Repository a Lungo Orizzonte
Questo è ciò per cui K3 è stato effettivamente costruito. Puntalo su un vero codebase e dagli un risultato, non un compito.
1Leggi tutto questo codebase prima di scrivere qualsiasi cosa.23[incolla il tuo repo, o puntalo sulla directory]45Obiettivo: [dichiara un risultato misurabile — es. "riduci6il tempo di risposta API p95 del 30%" o "elimina tutte le7query N+1 nel livello dati"]89Regole:10- Profila prima. Mostrami dove va effettivamente il tempo11 prima di cambiare qualsiasi cosa.12- Non cambiare interfacce pubbliche o comportamento numerico.13- Esegui la suite di test esistente dopo ogni modifica.14- Se una modifica peggiora le cose, annullala e dimmi perché.15- Lavora fino a quando l'obiettivo non viene raggiunto o puoi dimostrare16 che non è realizzabile senza infrangere le regole.1718Riporta alla fine: cosa hai cambiato, cosa hai ottenuto,19cosa hai provato che non ha funzionato.
La riga "cosa hai provato che non ha funzionato" è importante. È ciò che trasforma l'output da un diff a un registro di ingegneria.
Prompt 3 — La Costruzione di un Prodotto 3D
Per chiunque faccia frontend, pagine di atterraggio o visualizzazione di prodotti.
1Costruisci un [oggetto] 3D interattivo nel browser.2Un singolo file HTML. Three.js.34L'oggetto: [descrivilo precisamente — materiali,5numero di parti, cosa si muove]67Deve includere:8- Proprietà dei materiali corrette (lucentezza, rugosità,9 metallicità dove rilevante)10- Illuminazione a tre punti con ombre reali11- Controlli orbitali12- [Qualsiasi interazione — assemblaggio/smontaggio, animazione,13 stati hover]1415Livello di qualità: questo dovrebbe assomigliare a un render di prodotto,16non a una demo WebGL. Se un dettaglio sarebbe visibile nella vita reale,17modellalo.1819Costruisci tutto. Mostrami il file.
La riga "livello di qualità" fa più lavoro di qualsiasi altra cosa nel prompt. K3 risponde agli standard, non solo alle istruzioni.
Prompt 4 — Funzionalità in Tempo Reale con una Parte Mobile
Il CRUD full-stack è una forma di app. Il tempo reale è una forma completamente diversa — lo stato deve rimanere sincronizzato tra i client, non solo persistere in un database. Qui è dove molti modelli crollano silenziosamente.
1Aggiungi una funzionalità in tempo reale a un'app esistente: un sistema2di cursore collaborativo live + commenti, come quello di Figma.34REQUISITI:5- Connessione WebSocket (usa Socket.io o ws nativo)6- Mostra le posizioni del cursore degli altri utenti connessi in tempo reale7- Clicca ovunque per lasciare un pin di commento8- I commenti si aggiornano in tempo reale per tutti i client connessi9- Gestisci disconnessione/riconnessione con grazia — niente cursori fantasma10- Debounce degli aggiornamenti del cursore per non sovraccaricare il socket1112COSTRUISCI:131. Configura il server WebSocket142. Costruisci la connessione lato client con auto-riconnessione153. Implementa la trasmissione del cursore con debouncing164. Implementa il sistema di pin dei commenti175. Aggiungi un semplice indicatore di presenza (chi è online)186. Testa con almeno 2 client simulati per confermare la sincronizzazione1920Mostrami come hai testato la sincronizzazione multi-client prima di dichiararlo finito.
Risultato atteso: Un livello in tempo reale funzionante in 15-30 minuti, con prova visibile che è stato testato contro più di un client.

L'ultima riga è la parte importante. I bug in tempo reale non si mostrano con una scheda del browser aperta — si mostrano con due. Un modello che salta i test multi-client ti darà codice che sembra finito ma non lo è.
Quando K3 sbaglia: Guida alla risoluzione dei problemi
È un modello nuovo con veri spigoli. Ecco cosa si rompe e cosa fare.
- Problema: Brucia token su compiti banali
Questo è il più grosso, ed è strutturale.
K3 attualmente viene fornito con un solo livello di sforzo di ragionamento — 'max'. Non esiste una modalità "rispondi e basta velocemente." I tester indipendenti hanno cronometrato 13.241 token di ragionamento per generare un semplice SVG — circa $0,25 per qualcosa che dovrebbe costare frazioni di centesimo.
La soluzione:
non instradare lavori semplici a K3. È un modello di frontiera con una sola marcia, e quella marcia è "pensa a fondo su tutto." Usa K2.7 o un modello più piccolo per boilerplate, formattazione e tutto ciò che è meccanico. Riserva K3 per lavori che giustifichino il ragionamento.
Questo è l'errore più grande che la gente farà nel primo mese: rendere K3 il predefinito per tutto e poi essere sorpresi dal conto.
- Problema: La finestra di contesto si riempie comunque
1M di token sembra infinito finché non ci metti un vero repo e non lo è.
La soluzione:
non scaricare tutto. Puntalo sulle directory che contano. La forza di K3 nel lavoro a lungo orizzonte viene dalla concentrazione sostenuta, non dall'avere ogni file nel contesto. Un contenuto di 200K ben mirato batte un intero monorepo gonfiato di 900K.
- Problema: Deriva in esecuzioni autonome molto lunghe
L'esperimento autonomo di 20 ore è reale, ma ha funzionato perché l'obiettivo era misurabile — "rendi questo più veloce su H200 senza cambiare i numeri." Dagli un obiettivo vago e una lunga libertà e si perderà.
La soluzione:
ogni prompt a lungo orizzonte ha bisogno di una condizione di successo verificabile. Non "migliora il codice." Un numero, un test che passa, un benchmark che si muove. Se non puoi dire come verificheresti se ha avuto successo, deriverà.
- Problema: Non riesci a riprodurre il risultato del benchmark di qualcuno
Nessuno al di fuori di Moonshot ha verificato questo modello. I pesi non vengono rilasciati fino al 27 luglio. Ogni numero che circola ora — incluso in questo articolo — è riportato dal fornitore.
La soluzione:
aspetta il 27 luglio, oppure testa sui tuoi compiti e fidati di quello invece. I tuoi cinque compiti reali valgono più della tabella dei benchmark di chiunque.
- Problema: Errori di integrazione dopo il passaggio da OpenAI o Anthropic
K3 è compatibile con l'SDK di OpenAI, il che gestisce il 90% della migrazione. Il restante 10% è di solito il comportamento di ragionamento — K3 pensa per impostazione predefinita e restituisce token di ragionamento che potresti non aspettarti nella gestione delle risposte.
La soluzione:
controlla la tua contabilità dei token e il parsing delle risposte prima di presumere che il modello sia rotto. La maggior parte delle lamentele "K3 è costoso" sono in realtà "ho dimenticato che i token di ragionamento sono token di output."
Il contesto che nessuno dovrebbe ignorare
Moonshot ha sede a Pechino, fondata da Yang Zhilin, ex ricercatore di Google, e supportata da Alibaba.
https://x.com/kirillk_web3/status/2057528102368977328
Hanno costruito un modello di frontiera da 2,8 trilioni di parametri sotto tre anni di crescenti controlli all'esportazione degli Stati Uniti sui chip avanzati.
Gli analisti di Bank of America lo hanno detto direttamente: "Nonostante i persistenti vincoli di capacità hardware/computazionale in Cina, K3 dimostra che lo scaling pre-addestrativo, abbinato all'innovazione architetturale, può ancora fornire miglioramenti radicali per i modelli cinesi di punta."
E il tempismo non è casuale: K3 è arrivato giorni prima della Conferenza Mondiale sull'Intelligenza Artificiale 2026 a Shanghai.
La domanda del 27 luglio
I pesi vengono rilasciati il 27 luglio. Quella data conta più della data di lancio.
Fino ad allora, K3 è un modello di frontiera che puoi usare tramite API — impressionante.
Il 27 luglio, diventa qualcos'altro: un modello di classe frontiera che chiunque può scaricare, ispezionare, modificare ed eseguire sul proprio hardware. Nessuna API. Nessun limite di utilizzo. Nessun termine di servizio. Nessuna conservazione dei prompt per 30 giorni.
Questa è la vera storia. Non "La Cina ha raggiunto."
La Cina ha raggiunto e lo ha regalato.

Vale la pena notare: i regolatori cinesi hanno discusso di propri controlli all'esportazione dell'AI. Se K3 sia l'ultimo rilascio open-weight di frontiera dalla Cina o il primo di molti è genuinamente poco chiaro in questo momento.
Come provarlo
Chat: kimi.com — K3 è live ora
API: Compatibile con l'SDK di OpenAI, quindi se stai già costruendo su toolchain OpenAI o Anthropic, l'integrazione è un cambio di configurazione, non una riscrittura
Pesi: 27 luglio
La compatibilità con l'SDK è più importante di quanto sembri. Cambiare modello di solito significa riscrivere il livello di integrazione. Qui significa cambiare un URL di base e una stringa del modello.
Come installare Kimi Code (L'Agente Terminale)
Se vuoi K3 in esecuzione all'interno del tuo codebase effettivo invece di una finestra di chat, questa è la configurazione.

Requisiti:
- Un computer (Mac, Windows o Linux)
- Accesso al terminale
- Account Kimi — kimi.com
Passo 1 — Installa Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows (PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
Su Windows, installa prima Git per Windows — la CLI di Kimi Code usa il suo Git Bash integrato come ambiente shell.
Verifica l'installazione:
1kimi --version
A causa di macOS Gatekeeper, il primo avvio potrebbe richiedere molto più tempo. Aggiungi la tua app terminale in Impostazioni di Sistema → Privacy e Sicurezza → Strumenti per sviluppatori per velocizzare gli avvii successivi.
Se hai già uv installato, puoi installare direttamente:
1uv tool install --python 3.13 kimi-cli
La CLI di Kimi Code supporta Python 3.12–3.14, con 3.13 raccomandato per la migliore compatibilità.
Passo 2 — Naviga nel tuo progetto e avvia
1cd tuo-progetto2kimi
Al primo avvio, esegui /login all'interno della sessione per configurare la tua fonte API — si apre una finestra del browser per l'OAuth.
Passo 3 — Dagli un compito
Kimi Code è ora in esecuzione all'interno del tuo progetto, con accesso diretto in lettura/scrittura a ogni file. Descrivi un compito in inglese semplice — pianifica i passaggi, modifica il codice, esegue i test e riporta cosa ha fatto.
Cosa significa realmente
Se stai eseguendo carichi di lavoro di produzione:
Testalo prima di cambiare. I benchmark dei fornitori e le prestazioni nel mondo reale divergono costantemente. Scegli cinque compiti reali, esegui K3 e il tuo modello attuale fianco a fianco, misura il costo per lavoro completato — non il costo per token.

Il calcolo per attività è l'intero argomento. A $3/$15 K3 non è economico sulla carta. Con il 21% in meno di token e output di livello Fable, è economico dove conta.
Il 27 luglio cambia le carte in tavola. I pesi aperti significano self-hosting, fine-tuning e zero dipendenza dall'API di qualcuno che rimanga online o dai termini di qualcuno che rimangano favorevoli. Per qualsiasi cosa sensibile, non è una cosa da poco.
Conclusione
La frontiera era un posto che i laboratori americani costruivano e tutti gli altri visitavano sei mesi dopo.
2,8 trilioni di parametri. 1M di contesto. Coding di livello Fable 5 al prezzo di Sonnet. Costruito sotto controlli all'esportazione, dal laboratorio con la valutazione più bassa nella stanza, e regalato il 27 luglio.
La domanda interessante non è se K3 batta Fable 5 su qualche benchmark. È cosa succede all'economia dei modelli di frontiera chiusi quando uno open-weight li eguaglia.
Link
- Kimi K3: https://www.kimi.com
- Il mio Telegram: https://t.me/kirillk_web3
- Il mio Twitter/X: https://x.com/kirillk_web3
- Hosting Partner: https://ishosting.com/affiliate/NzE0MiM2
Segui per altre informazioni su Vibe Coding. Grazie per aver letto!





