Uno dei dettagli che ha catturato l'immaginazione della community di X è che Kimi K3 ha uno stato costante. In altre parole, non ha una cache KV che cresce linearmente all'aumentare del contesto o della conversazione (per la maggior parte – vedremo presto dettagli e avvertenze).
I casi d'uso con contesto lungo – ad esempio il coding agentico – hanno aumentato enormemente la domanda di memoria, portando a un incremento da 10 a 30 volte dei prezzi dei titoli del settore memoria. Se non serve tanta memoria per archiviare la cache KV, questo aumento di prezzo è giustificato? Su X è in corso un vivace dibattito su questo argomento.
I detrattori dicono che l'attenzione lineare ibrida (Hybrid Linear) usata da Kimi K3, chiamata Kimi Delta Attention (KDA), esiste da un po' di tempo. Quindi è già stata scontata nei prezzi dei titoli della memoria.
Tuttavia, si perdono il punto: a differenza dei tentativi precedenti, Kimi K3 ha dimostrato che l'ibrido lineare può funzionare così bene a una scala di oltre 1T parametri e offrire prestazioni di frontiera. **Questa è un'informazione COMPLETAMENTE NUOVA e merita seria attenzione. Prima di Kimi K3, si credeva che l'ibrido lineare non fosse una tecnica per la frontiera, ma solo un trucco carino usato da
- Qwen (che non arriva mai veramente alla frontiera) o
- Nvidia (che prova tutto sotto il sole, solo perché ha GPU infinite).
Immergiamoci!
(Voglio essere chiaro – QUESTO NON È UN CONSIGLIO DI INVESTIMENTO).
Breve storia dell'Hybrid Linear:
I modelli lineari hanno sempre promesso grandi cose sulla carta, proprio come il comunismo.
Invece di una cache KV in costante crescita all'aumentare del contesto, hanno uno stato costante che viene aggiornato. La dimensione dello stato è costante sia che tu abbia mille token o un milione di token.
Sembra troppo bello per essere vero, e lo è! I modelli lineari hanno problemi nel richiamare perfettamente i contenuti delle parti precedenti della conversazione – ad esempio un numero di telefono dall'inizio della conversazione.
Perché? Perché tali modelli aggiornano costantemente il loro 'riassunto' interno (chiamato stato) del contesto. Tuttavia, poiché questo riassunto/contesto ha una dimensione fissa (ad esempio 128\128 nel caso di Kimi K3, per testa), la sua capacità di archiviazione è limitata. Comprime le informazioni per essere efficiente (questo è ciò che il modello impara durante l'addestramento), ma deve sicuramente perdere alcune informazioni. In altre parole, la compressione è con perdita.*
Un modo per risolvere il problema è passare all'"ibrido lineare", in cui si combinano strati lineari (tipicamente il 75%) con strati di attenzione completa (25%). L'ibrido lineare può anche avere una versione efficiente dell'attenzione completa (ad esempio lo stile MLA di DeepSeek nel caso di Kimi K3). Sebbene sia stato tentato, i precedenti modelli ibridi lineari non avevano prestazioni a livello di frontiera!
Ciò che Kimi K3 ha mostrato è che – con la loro variante chiamata Kimi Delta Linear Attention (KDA) – puoi ottenere un richiamo quasi perfetto, buono quanto quello dei modelli che usano attenzione completa in tutti gli strati. Questa è un'enorme svolta, qualunque cosa ti sia stato detto di credere...
Come ha fatto Kimi K3 a raggiungerlo?
Moonshot non è la prima a usare l'ibrido lineare, ma ha sviluppato una variante estremamente efficace. Permette un controllo granulare sul decadimento della memoria.
Ovviamente hanno fatto molte altre cose, coinvolgendo ingegneria dei dati, sviluppo di kernel, uso di residui di attenzione, MoE latente stabile, ecc. (li capiremo verso la fine). Ma hanno fatto qualcosa di apparentemente semplice che ha portato a un guadagno di prestazioni eccezionale nella parte dell'attenzione.
Lo stato KDA del modello può essere essenzialmente pensato come una pila di memorie (versione eccessivamente semplificata). Ad ogni nuova posizione di token viene calcolata una matrice diagonale e lo stato viene moltiplicato per essa. Ciò risulta nell'oblio di alcune memorie più e di altre meno (gergo: decadimento per canale). Nelle versioni precedenti si dimenticavano tutte le memorie in egual misura. Questo trucco di dimenticare selettivamente e giudiziosamente ha migliorato significativamente le prestazioni!

Questa è una bellissima visualizzazione che mostra come avvengono gli aggiornamenti della matrice di stato. Avrò un altro blog in arrivo che spiega come questo porti al santo graal dell'‘apprendimento continuo'.

Quanto risparmio di memoria c'è con Kimi K3?
K3 ha 93 strati e 96 teste. KDA ha dimensioni dv e dk di 128.

Vediamo cosa serve per elaborare 128K token e 1 milione di token in termini di stato e archiviazione KV. Consideriamo due casi:
1) 93 strati di attenzione completa MLA (All-MLA) vs
2) 69 KDA + 24 attenzione completa MLA (modello Kimi K3 effettivo come mostrato sopra)
In fondo all'articolo ho pubblicato i calcoli.
Osservazioni chiave:
- Per All-MLA, l'archiviazione della cache KV cresce da 13,7 GB a 107 GB da 128K a 1M token.
- Come puoi vedere, lo stato KDA per Kimi K3 è costante a 0,22 GB indipendentemente dalla lunghezza del contesto. Solo la parte MLA cresce da 3,5 GB a 29 GB per contesto da 128K a 1M token.
In entrambi i casi, c'è un risparmio di circa il 73%. La bellezza è che KDA non compromette le prestazioni di frontiera offrendo questi risparmi. MLA è già un risparmio massiccio rispetto a MHA e GQA (quasi il 90%), KDA risparmia il 73%!
Alcuni sosterranno che i risparmi con l'architettura DeepSeek V4 alla scala di Kimi K3 sarebbero ancora maggiori. Vero, DeepSeek V4 non è ancora alla frontiera. E anche se raggiungesse la frontiera, migliorerà esattamente nella stessa direzione: meno archiviazione.

Questa bellissima visualizzazione prodotta dallo stesso Kimi K3 mostra i risparmi:

Kimi K3 è unico nel settore per quanto riguarda un risparmio di memoria così drastico?
DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) ha fatto un lavoro eccezionale nel tagliare la cache KV del 98%, ma nessuno li considera vicini alla frontiera. Quando DeepSeek V4 è stato lanciato, hai osservato lo stesso livello di attività su X?
Inoltre, per tutta la loro brillantezza, tutti gli strati di DeepSeek V4 sono o CSA (Compressed Sparse Attention) o HCA (Highly Compressed Attention) – entrambi i tipi sono compressi lungo la dimensione della sequenza e sono con perdita. Non c'è un solo strato che abbia informazioni non compresse, cioè tutti gli strati sono con perdita – mentre in Kimi K3 il 25% degli strati ha attenzione completa.
La mia ipotesi è che Kimi K3 avrà una migliore capacità di recuperare informazioni specifiche da contesti precedenti in scenari di contesto lungo. Quindi, prevedo che l'architettura di Kimi K3 sarà ampiamente adottata anche da altri laboratori (es. ZAI, MiniMax, Qwen, Tencent, Xiomi, ecc.), proprio come DeepSeek V3 (MLA) e successivamente DeepSeek V3.2 (MLA + DSA) sono diventati diffusi nel settore.

CSA di DeepSeek. Nota la compressione lungo la dimensione della sequenza. Risulta in 1 token compresso ogni 4 token.

HCA di DeepSeek. Nota la compressione lungo la dimensione della sequenza. Risulta in 1 token compresso ogni 128 token.
E per quanto riguarda il punto di Funda AI secondo cui è necessario mettere in cache lo stato KDA più volte, poiché non è additivo come la cache KV? Inoltre, i subagenti non avranno bisogno di archiviazione cache KV?
Ricorda l'esempio precedente, lo stato KDA totale su 69 strati è 0,22 GB. Quindi, anche quando lo si mette in cache/snapshot ogni 20K token durante una sessione lunga, sono 50 volte in un contesto di 1M.
Quindi questi 50 snapshot occuperanno 50*0,22 GB. Il totale è solo 11 GB – il totale (29,22 GB + 11 GB) rimane ben al di sotto dei 107 GB richiesti per All-MLA con contesto di 1M token.
Secondo, il punto di Funda AI era che gli agenti principali possono generare subagenti. Le persone genereranno molti subagenti. Ma tipicamente, una volta che un subagente restituisce il controllo al principale, il suo lavoro è finito. Il suo KV + stato viene cancellato. Quindi anche se le persone lanciano agenti che lanciano centinaia di subagenti, le esigenze di KV + stato non sono a lungo termine. Lo stato della sessione principale/agente principale deve essere preservato molto più a lungo; ed è qui che KDA risparmia moltissimo!
Ci sono pattern in cui ci sono agenti asincroni a lunga esecuzione, in quei casi il loro KV + stato dovrebbe essere mantenuto. Ma vedo questi pattern implementati raramente. Questo non vuol dire che non cambierà in futuro.
Subagenti sincroni (un pattern molto comune):

Subagenti asincroni (un pattern relativamente raro):

L'adozione di KDA avrà quindi un impatto al ribasso sulla domanda di memoria?
Non sono un veggente, ma c'è una piccola probabilità non nulla che possa far scoppiare la bolla della memoria.
Primo, perché potrebbe non avere alcun impatto sulla domanda di memoria:
- Sebbene i risparmi siano reali, se l'AI open source viene ampiamente adottata, la maggior parte delle implementazioni non sarà efficiente come nei laboratori di frontiera chiusi. Quindi, eventuali guadagni a livello di modello andranno persi a livello di settore. Avremo un gran numero di piccole implementazioni non molto efficienti. Ad esempio, per la maggior parte delle imprese e dei governi, l'uso avviene per 12 ore al giorno. Cosa faranno di notte la loro infrastruttura di modelli open source e la loro memoria? L'infrastruttura nei grandi laboratori viene utilizzata 24 ore su 24, 7 giorni su 7 grazie a una base di clienti globale.
- Inoltre, stiamo facendo una grande supposizione che i laboratori leader non abbiano già approcci simili. OpenAI, Anthropic, DeepMind impiegano alcune delle persone più intelligenti del mondo. Quindi ci sono buone probabilità che tali innovazioni siano già in uso e siano state incorporate nella domanda di memoria.
Detto questo, ogni tanto arriva una SpaceX che mostra ai leader del settore quanto i loro approcci fossero inefficienti. Pensano partendo dai primi principi. Gli incumbent, a causa di problemi di struttura organizzativa o per non essere abbastanza affamati, non innovano su dimensioni chiave. La storia del capitalismo è piena di migliaia di tali esempi....

Quindi è uno scenario improbabile, ma comunque con una probabilità non nulla, che se i grandi laboratori non fossero stati così a corto di risorse, potrebbero non aver esplorato l'intero spazio di progettazione per ridurre la domanda di memoria in tale misura.
Nell'industria dell'AI stessa, è già successo molte volte che grandi laboratori abbiano mostrato una grossolana incompetenza:
- La pipeline di addestramento di XAI aveva un MFU scarso (utilizzo della GPU) – a causa dell'abitudine di gettare risorse computazionali sul problema, oltre ad altri problemi di configurazione del cluster e a livello organizzativo.
- Nonostante tutte le risorse a loro disposizione, Meta ha addestrato una versione di merda del MoE di DeepSeek per Llama 4.
- Google ha impiegato 1,5 anni dal lancio di ChatGPT per portare Gemini in primo piano, e non è ancora il modello preferito di nessuno per il caso d'uso più popolare: la programmazione AI.

I vincoli forzano l'innovazione, quindi non è improbabile che piccoli team molto ben organizzati superino team grandi e ricchi di risorse. E ora che K3 è uscito e la sua architettura è ben nota, se una tecnica simile a KDA – che ora ha avuto successo alla scala della frontiera – viene adottata anche dai laboratori chiusi, significa una riduzione del 75% della domanda di memoria almeno per alcuni laboratori, e sono piuttosto grandi individualmente, quindi l'impatto potrebbe essere dell'ordine di decine di miliardi.
Questi risparmi di memoria potrebbero essere consumati da un aumento dell'uso dovuto alla riduzione dei costi, sicuramente (paradosso di Jevons), ma non è garantito che la crescita del consumo superi sempre i risparmi....

Diffusione di altre innovazioni: l'innovazione principale di Kimi K3 non è solo KDA!
Kimi K3 elimina completamente la codifica posizionale: le codifiche posizionali informano qual è il numero di sequenza di ogni token nel contesto. I suoi strati KDA, per la loro natura ricorrente, non hanno bisogno di codifiche posizionali. Le eliminano anche per gli strati MLA e non fa male. Benefici? Non richiede alcuno sforzo speciale per estendere la lunghezza del contesto del modello rispetto ai modelli precedenti. Elegante.
Kimi K3 implementa residui di attenzione alla scala di 2,8T: garantisce, efficacemente, che gli strati superiori siano in grado di prestare attenzione selettiva agli input degli strati inferiori. Negli approcci precedenti, gli strati superiori non potevano distinguere tra input degli strati inferiori in una data posizione di token, poiché tutti i valori venivano aggregati. Questo nuovo approccio conferisce al modello una capacità di discernimento molto più elevata. (https://arxiv.org/pdf/2603.15031
Kimi K3 implementa il Stable Latent MoE di Nvidia: il principale vantaggio di un'architettura stabile latente Mixture-of-Experts (LatentMoE) è una maggiore accuratezza del modello e una maggiore capacità degli esperti allo stesso costo di inferenza o inferiore. Raggiunge questo proiettando le rappresentazioni dei token in uno spazio latente più piccolo prima di eseguire il routing e il calcolo degli esperti. Lo hanno preso dal paper di Nvidia del gennaio 2026 (https://arxiv.org/pdf/2601.18089v1

Con tutte queste innovazioni messe insieme, il team di MoonShot ottiene un'efficienza di addestramento 2,5 volte superiore rispetto alla loro precedente architettura Kimi K2. Vale a dire, ottengono la stessa perdita di validazione con 2,5 volte meno FLOPs. Questo è un risparmio massiccio anche per il calcolo di addestramento!!!! Questo permetterà a molti più laboratori di addestrare modelli di scala così elevata con risorse computazionali limitate.....

Con K3, Moonshot ha sbloccato nuove leggi di scaling. Kimi K3 ottiene un guadagno di 2,5× nell'efficienza di scaling rispetto a Kimi K2
MoonShot ha anche open source il loro kernel GPU FlashKDA per il calcolo veloce dello stato KDA e MoonMoE per il dispatch e il combine dei token. Sono piuttosto fiduciosi nel condividere così tanta conoscenza, perché sono già sulla prossima serie di innovazioni che li porterà ancora più avanti (in fondo, anche loro sono capitalisti).

Le leggi di scaling non sono leggi di natura, possiamo sempre scoprire di meglio
Inoltre, potremmo scoprire nuove leggi di scaling con architetture e paradigmi di addestramento più recenti, offrendo un'intelligenza ancora più densa. Le leggi di scaling sono osservazioni statistiche, non sono leggi di natura che non possono essere cambiate. Ciò significa che con modelli più recenti, per dimensioni inferiori (e KV e stato inferiori) possiamo avere prestazioni migliori. Quindi l'esplosione della domanda non significa far funzionare gli stessi modelli grandi per sempre. I modelli continueranno a diventare più densi in termini di intelligenza.**
Abbiamo un ecosistema sotto forma di laboratori cinesi che è altamente vincolato e altamente capace – un mix molto potente, come discusso. Stanno scoprendo angoli dello spazio di progettazione che non sono stati scoperti da laboratori più finanziati. Fanno rapidi progressi grazie alla condivisione aperta della conoscenza. Questo evita ad altri di sprecare i loro sforzi e reinventare la ruota. L'evoluzione dell'architettura avviene molto più rapidamente che altrimenti....
Inoltre, questo successo del team MoonShot ispirerà sicuramente altri team altrettanto capaci in DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED e anche attori emergenti come Baidu, Ant Ling, Xiomi Mimo, Meituan e molti altri a essere i migliori, non solo come modello open source, ma a essere i migliori in assoluto.
Molte nuove innovazioni avverranno anche nei laboratori emergenti in Occidente, che sia a xAI o MSL, ora che hanno messo ordine e hanno iniziato a fornire ottimi modelli.
Detto questo, come continuo a sottolineare, la Cina ha il maggior numero di giovani ricercatori di AI basati sulle statistiche NEURIPS. I contributi in questo campo provengono in modo sproporzionato più da ricercatori giovani (il thread di origine), quindi è probabile che emergano molte più scoperte da quella parte del mondo.

La Cina ha anche 3 grandi centri urbani con una densità di talenti AI che rivaleggia con quella della Silicon Valley, che agiscono come crogioli di mescolanza di idee (il thread di origine).

Vietare l'AI open source non aiuterà:
Una conclusione sfortunata di questa discussione potrebbe essere che dobbiamo vietare l'AI open source per proteggere i mercati occidentali. Ma questo sarebbe altamente controproducente.
Che l'AI open source sia vietata o meno nel mondo occidentale, questi spazi di progettazione verranno esplorati e i paper verranno pubblicati. Anche in Occidente stanno emergendo molti nuovi grandi laboratori. Scopriranno anche molte nuove idee, ora che si è capito che potrebbero esserci ancora molti guadagni di efficienza possibili.
La cosa migliore è incoraggiare e adottare queste innovazioni ed essere responsabili con gli investimenti ed evitare speculazioni selvagge.
Il futuro è molto molto luminoso grazie a questa tecnologia, ma dobbiamo stare attenti a non essere speculatori pazzi che ricevono una margin call.
Non abbiamo usato tutta l'AI che avremmo potuto: sia nel mondo aziendale, nell'istruzione, nella ricerca o nell'intrattenimento.
- Mentre la programmazione è stata il pilastro dell'uso dei token GenAI, applicazioni come CoWorker sono appena iniziate.
- Mi piacerebbe che ogni studente in India avesse accesso illimitato a modelli di livello Opus 4.8 o Kimi K3. Hanno accesso, ma solo a modelli più deboli.
- Inoltre, potremmo avere casi d'uso di AI di valore molto più alto in Scienza, Ingegneria e Medicina.
- Inoltre, abbiamo un mondo che invecchia di cui dobbiamo prenderci cura. L'AI sarà di grande beneficio lì. Esistono così tante possibilità anche nell'intrattenimento e nei giochi. Come ha menzionato Jensen Huang: "ogni pixel che vediamo sullo schermo per l'intrattenimento sarà generato."
Conclusione:


Il crollo del mercato azionario del 1929 – la Grande Depressione – non è stato il risultato di una distruzione della domanda. È stato il risultato di eccessi speculativi. Il mondo intero ha sofferto per due decenni. Ha portato, probabilmente, all'ascesa del fascismo e della Seconda Guerra Mondiale.
Mentre il futuro è incerto, ciò che è chiaro nelle mie osservazioni è che i tori dell'AI e i tori della memoria, in particolare, non tengono conto delle innovazioni algoritmiche e della scoperta di nuove leggi di scaling. Per loro tutto viene mangiato dal paradosso di Jevons, quindi non interessante. Questo atteggiamento è filtrato anche negli investitori retail e ha portato a comportamenti insani che hanno il potenziale di far crollare le economie di diversi paesi. Voglio introdurre nuove angolazioni nella loro analisi. Loro hanno informazioni molto migliori sulle situazioni della catena di approvvigionamento e sugli utili aziendali. Voglio armarli con una prospettiva più tecnica.
Per far crollare i titoli della memoria e dell'AI, non abbiamo bisogno di una riduzione massiccia della domanda, come [ha sottolineato Jaya Gupta](https://x.com/JayaGup10/status/2082301754872369331). Anche una piccola riduzione della domanda può innescare una concorrenza di teoria dei giochi in cui i possessori esistenti iniziano a realizzare profitti con l'intenzione di acquistare azioni in seguito, questo può far crollare l'intero mercato. E questo sembra essere iniziato.....
È importante non lasciare che bolle così grandi si formino e scoppino in modo catastrofico per la società. Nel complesso, rimango molto ottimista sul potenziale di questa tecnologia (e persino sulla domanda di memoria) e sulla futura costruzione di infrastrutture. È il momento più emozionante per essere vivi!
(NON È UN CONSIGLIO DI INVESTIMENTO)
Appendice
Calcolo dettagliato dei risparmi di memoria:
Per mostrare quanto è bravo Kimi K3, ho fatto fare questi calcoli allo stesso K3 e ho verificato che siano corretti. Come accennato in precedenza, consideriamo due casi:
1) Kimi K3: 69 KDA + 24 attenzione completa Gated MLA vs
2) Full MLA: 93 attenzione completa MLA








