Il numero principale non è la storia
Il 27 luglio, Moonshot AI pubblica i pesi completi di Kimi K3 sotto una licenza MIT modificata. La scheda tecnica è un'ostentazione: 2,8 trilioni di parametri, una finestra di contesto di un milione di token e il titolo di modello open-weight più grande mai rilasciato, circa il 75% più grande di DeepSeek V4 Pro.
Ma la dimensione è un'esca. La vera storia è uno spostamento in chi controlla l'accesso all'intelligenza di frontiera. Per tre anni, i migliori modelli sono vissuti dietro un'API. Pagavi un affitto, il proprietario stabiliva le condizioni, e se il fornitore ritariffava l'endpoint o cambiava silenziosamente il comportamento del modello, il tuo prodotto assorbiva il danno.
I pesi aperti rompono quell'accordo. Una volta che i file sono pubblici, nessun laboratorio può riprendersi la capacità. Questo singolo fatto cambia l'economia per tutti, comprese le persone che non scaricheranno mai un singolo shard.
La scheda tecnica a colpo d'occhio
Specifica
Valore
Parametri
2,8 trilioni
Esperti
896 totali, 16 attivi per token
Finestra di contesto
1.048.576 token
Licenza
MIT modificata
Rilascio dei pesi
27 luglio
Dimensioni vs DeepSeek V4 Pro
~75% più grande
Efficienza di scaling vs K2
~2,5x
Prezzi
Tariffa
Input (cache hit)
$0,30 / 1M token
Input (cache miss)
$3,00 / 1M token
Output
$15,00 / 1M token
Come un modello da 2,8T evita un conto da 2,8T
Un modello denso di queste dimensioni sarebbe inutilizzabile. Eseguire ogni parametro su ogni token è il muro che tutti i modelli su scala trilione incontrano: troppo lento, troppo costoso, nessun modo per aggirare la fisica.
K3 lo aggira con un design Mixture-of-Experts aggressivo. All'interno del modello vivono 896 sottoreti specializzate. Su ogni dato token, solo 16 di esse si attivano. Ottieni la conoscenza memorizzata di 2,8 trilioni di parametri pagando il costo di inferenza di un modello di una frazione di quella dimensione.
Questa è la scarsità (sparsity), e K3 ci punta più di qualsiasi altro modello open prima di esso. K2 ha dimostrato che l'approccio funzionava. K3 lo trasforma nella scommessa centrale.

Due articoli di ricerca che hanno fatto il lavoro pesante
Due cambiamenti architetturali rendono possibile il resto, ed entrambi sono stati pubblicati come ricerca aperta prima che il modello fosse rilasciato, il che ha fatto guadagnare a Moonshot credibilità tra i ricercatori prima ancora che apparisse un singolo benchmark.
Il primo è Kimi Delta Attention, un meccanismo di attenzione lineare ibrido. I costi dell'attenzione standard crescono in modo quadratico man mano che il contesto si allunga, motivo per cui le finestre da un milione di token di solito rimangono nelle presentazioni di marketing. KDA scala in modo diverso, e quella differenza è l'unica ragione per cui esiste una finestra da 1M a un prezzo che chiunque possa effettivamente pagare.
Il secondo è Attention Residuals, un sostituto per le connessioni residue standard. Moonshot lo accredita dei guadagni di scaling coerenti, permettendo loro di costruire modelli più profondi senza il solito degrado. Secondo i loro stessi numeri, la combinazione offre circa 2,5 volte l'efficienza di scaling di K2.
Cosa uccidono un milione di token

La maggior parte dell'infrastruttura di recupero nell'IA in produzione esiste come soluzione alternativa. Frammentazione, embeddings, database vettoriali, pipeline RAG: tutto questo compensa modelli che non possono contenere abbastanza nella memoria di lavoro contemporaneamente.
Un milione di token cambia le impostazioni predefinite. Un intero codebase entra in un singolo prompt. Un anno di documenti interni. Cinquanta trascrizioni video. Tutto siede nell'attenzione simultaneamente, e il modello ragiona sull'intero corpus invece di cucire insieme frammenti recuperati e sperare che le cuciture tengano.
La visione nativa amplia ulteriormente la superficie di input. Screenshot, foto di lavagne, diagrammi architetturali e grafici sono leggibili nello stesso contesto del codice e del testo che li circonda. Non è un caso che i più forti successi di benchmark di K3 siano arrivati nel coding front-end: il modello vede il design e scrive l'implementazione all'interno di una finestra di contesto.
La tabella dei prezzi che conta più dei benchmark
Le tariffe elencate: $0,30 per milione di token di input in caso di cache hit, $3,00 in caso di cache miss, $15,00 per milione di token di output, con un contesto di 1.048.576 token.
Il numero della cache è quello da fissare. Moonshot riporta tassi di cache hit superiori al 90% in sessioni di coding lunghe. Pensa a cosa fa effettivamente un agente: rilegge lo stesso repository più e più volte per ore. Senza cache, paga il prezzo intero dell'input su ogni passaggio. Con essa, il costo di una sessione lunga crolla di circa 4 volte.
Gli agenti a lungo orizzonte vivono o muoiono esattamente su questa matematica. K3 è costruito per sessioni che durano ore con supervisione minima, navigando un repo, orchestrando strumenti da terminale, controllando il proprio lavoro. La struttura dei prezzi è il prodotto.
Il problema che nessuno dovrebbe ignorare
K3 non ha una modalità economica. Il ragionamento è permanentemente attivo e fissato al massimo. I tester indipendenti lo hanno visto bruciare oltre 13.000 token di pensiero per una richiesta SVG banale, circa $0,25 per una query usa e getta.
La lezione è il routing. Le chiamate veloci, economiche e ad alto volume appartengono a modelli più piccoli. K3 guadagna il suo costo solo quando la dimensione del contesto e la complessità del compito giustificano un ragionamento sempre attivo. Usarlo come endpoint di chat generico è come dare fuoco ai soldi.
Collegarlo richiede cinque minuti
L'API è compatibile con OpenAI. Sostituisci base_url e chiave, mantieni il tuo codice esistente:
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Introduce Kimi K3 in one sentence."}],12)13print(completion.choices[0].message.content)
Il ragionamento viene configurato tramite un campo di primo livello, che attualmente accetta solo "max":
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "Prove that the square root of 2 is irrational."}],5)6print(completion.choices[0].message.content)
Lo streaming funziona in modo standard, con il ragionamento che arriva in un campo delta separato, così puoi renderizzare il pensiero e la risposta in modo indipendente:
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "Explain why the sky is blue."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
L'input visivo accetta immagini codificate in base64 insieme al testo nello stesso messaggio. Questo è il flusso di lavoro da screenshot a codice nella sua interezza:
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "Rebuild this landing page in HTML and Tailwind."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
Perché questo raggiunge persone che non toccano mai i pesi
Ecco la parte onesta: quasi nessuno ospiterà da sé 2,8 trilioni di parametri. Anche con la scarsità, il conto hardware è ben oltre la portata degli hobbisti, e anche oltre la maggior parte delle aziende.
Non è mai stato questo il punto. I pesi pubblici mettono un tetto a ciò che i laboratori chiusi possono addebitare per capacità comparabili. Gli host di terze parti si faranno gara per servire K3 a margini di commodity, la stessa dinamica che si è verificata con ogni importante rilascio open prima di esso. I prezzi in tutto il mercato tendono verso la linea di base aperta.
Il beneficio ti raggiunge attraverso la fattura del fornitore che già usi, che tu scarichi o meno un file.
Un manuale pratico
Alimentalo con cose intere. Repository completi per la revisione, intere cartelle di contratti, un'intera libreria di contenuti. Smetti di frammentare ciò che non richiede più frammentazione.
Eseguilo a lungo. Metti in coda sessioni di ingegneria di più ore e controlla i risultati più tardi. La cache assorbe il costo di ogni rilettura.
Punta una fotocamera sui problemi. Fai uno screenshot di una landing page e chiedi la ricostruzione. Fotografa una lavagna e chiedi l'implementazione.
Tieni il traffico banale lontano da esso. Un modello che ragiona sempre al massimo è lo strumento sbagliato per chiamate veloci e ad alto volume. Instradale altrove e riserva K3 per il lavoro che lo merita.
Il conto alla rovescia di dieci giorni
Per tre anni, la frontiera è stata qualcosa che affittavi, a condizioni che non stabilivi tu, a prezzi che potevano cambiare senza preavviso.
Il 27 luglio diventa un file. E un file, a differenza di un abbonamento, è qualcosa che possiedi.





