L'un des détails qui a captivé l'imagination de la communauté X est que Kimi K3 possède un état constant. Autrement dit, il n'a pas de cache KV qui croît linéairement avec la taille du contexte ou la longueur de votre conversation (pour la plupart – nous verrons les détails et les mises en garde bientôt).
Les cas d'utilisation de longs contextes – par exemple le codage agentique – ont considérablement augmenté la demande de mémoire, entraînant une multiplication par 10 à 30 du prix des actions des fabricants de mémoire. Si vous n'avez pas besoin d'autant de mémoire pour stocker le cache KV, cette augmentation de prix est-elle justifiée ? Un débat animé a lieu sur ce sujet sur X.
Les détracteurs disent que l'attention linéaire hybride utilisée par Kimi K3, appelée Kimi Delta Attention (KDA), existe depuis un certain temps. Elle est donc déjà prise en compte dans les prix des actions mémoires.
Cependant, ils oublient que – contrairement aux tentatives précédentes – Kimi K3 a prouvé que l'attention linéaire hybride pouvait fonctionner aussi bien à l'échelle de 1 000 milliards de paramètres et atteindre des performances de pointe. Il s'agit d'une information NETTEMENT NOUVELLE qui mérite une attention sérieuse. Avant Kimi K3, on pensait que l'attention linéaire hybride n'était pas une technique de pointe, mais juste une astuce pratique utilisée par des acteurs comme
- Qwen (qui n'atteint jamais vraiment la frontière) ou
- Nvidia (qui essaie tout ce qui existe sous le soleil, simplement parce qu'ils ont des GPU en quantité infinie).
Plongeons-nous dedans !
(Je veux être clair – CECI N'EST PAS UN CONSEIL EN INVESTISSEMENT).
Brève histoire de l'attention linéaire hybride :
Les modèles linéaires ont toujours été très prometteurs sur le papier, tout comme le communisme.
Au lieu d'un cache KV qui augmente constamment avec le contexte, ils possèdent un état constant qui se met à jour. La taille de l'état est constante, que vous ayez mille tokens ou un million de tokens.
Cela semble trop beau pour être vrai, parce que ça l'est ! Les modèles linéaires ont du mal à rappeler parfaitement le contenu des parties antérieures de la conversation – par exemple un numéro de téléphone du début de la conversation.
Pourquoi ? Parce que ces modèles mettent constamment à jour leur « résumé » interne (appelé état) du contexte. Cependant, comme ce contexte/résumé a une taille fixe (par exemple 128\128 dans le cas de Kimi K3, par tête), sa capacité de stockage est limitée. Il compresse l'information pour être efficace (c'est ce que le modèle apprend pendant son entraînement), mais il doit forcément perdre certaines informations. En d'autres termes, la compression est avec pertes.*
Une façon de résoudre le problème est d'opter pour une approche « linéaire hybride » où l'on combine des couches linéaires (généralement 75 %) avec des couches d'attention totale (25 %). L'attention linéaire hybride peut également avoir une version efficace de l'attention totale (par exemple le style MLA de DeepSeek dans le cas de Kimi K3). Bien que cela ait été tenté, les modèles linéaires hybrides précédents n'avaient pas de performances au niveau de la frontière !
Ce que Kimi K3 a montré, c'est qu'avec leur variante appelée Kimi Delta Linear Attention (KDA), on peut atteindre un rappel quasi parfait, aussi bon que celui des modèles utilisant l'attention totale dans toutes les couches. C'est une avancée massive, quoi que l'on vous ait fait croire à ce sujet…
Comment Kimi K3 y est-il parvenu ?
Moonshot n'est pas le premier à utiliser l'attention linéaire hybride, mais ils ont développé une variante très efficace. Elle permet un contrôle granulaire de l'oubli de la mémoire.
Bien sûr, ils ont fait beaucoup d'autres choses, impliquant l'ingénierie des données, le développement de noyaux, l'utilisation de résidus d'attention, le MoE latent stable, etc. (nous les comprendrons vers la fin). Mais ils ont fait quelque chose d'apparemment simple qui a entraîné un gain de performance exceptionnel du côté de l'attention.
L'état KDA du modèle peut essentiellement être considéré comme une pile de souvenirs (version très simplifiée). À chaque nouvelle position de token, une matrice diagonale est calculée et l'état est multiplié par celle-ci. Cela entraîne l'oubli de certains souvenirs plus que d'autres (jargon : décroissance par canal). Dans les versions précédentes, on oubliait tous les souvenirs dans la même mesure. Cette astuce d'oubli sélectif et judicieux a considérablement amélioré les performances !

C'est une belle visualisation qui montre comment les mises à jour de la matrice d'état se produisent. J'aurai un autre article de blog qui expliquera comment cela mène au Saint Graal : « l'apprentissage continu ».

Quelle est l'économie de mémoire avec Kimi K3 ?
K3 a 93 couches et 96 têtes. KDA a des dimensions dv et dk de 128.

Voyons ce qu'il faut pour traiter 128 000 tokens et 1 million de tokens en termes de stockage d'état et de KV. Examinons deux cas :
1) 93 couches d'attention totale MLA (All-MLA) vs
2) 69 KDA + 24 couches d'attention totale MLA (modèle réel Kimi K3 comme illustré ci-dessus)
En bas de l'article, j'ai publié les calculs.
Observations clés :
1. Pour All-MLA, le stockage du cache KV passe de 13,7 Go à 107 Go entre 128 000 et 1 million de tokens.
- Comme vous pouvez le voir, l'état KDA de Kimi K3 est constant à 0,22 Go, quelle que soit la longueur du contexte. Seule la partie MLA passe de 3,5 Go à 29 Go entre 128 000 et 1 million de tokens de contexte.
Dans les deux cas, l'économie est d'environ 73 %. La beauté de KDA est qu'il ne compromet pas les performances de pointe tout en offrant ces économies. MLA représente déjà une économie massive par rapport à MHA et GQA (près de 90 %), et KDA économise 73 % !
Certains diront que les économies avec l'architecture DeepSeek V4 à l'échelle de Kimi K3 seraient encore plus élevées. C'est vrai, DeepSeek V4 n'est pas encore à la frontière. Et même s'il y parvient, il évoluera exactement dans la même direction : moins de stockage.

Cette belle visualisation produite par Kimi K3 lui-même montre les économies :

Kimi K3 est-il unique dans l'industrie en matière d'économies de mémoire aussi spectaculaires ?
DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) a fait un travail exceptionnel en réduisant le cache KV de 98 %, mais personne ne le considère comme proche de la frontière. Lorsque DeepSeek V4 a été lancé, avez-vous observé le même niveau d'activité sur X ?
De plus, pour tout leur génie, toutes les couches de DeepSeek V4 sont soit CSA (Compressed Sparse Attention) soit HCA (Highly Compressed Attention) – les deux types sont compressés le long de la dimension de la séquence et sont avec pertes. Il n'y a pas une seule couche qui ait des informations non compressées, c'est-à-dire que toutes les couches sont avec pertes – rappelez-vous que dans Kimi K3, 25 % des couches ont une attention totale**.
Mon hypothèse est que Kimi K3 aura une meilleure capacité à récupérer des informations spécifiques du contexte antérieur dans les scénarios de long contexte. Par conséquent, je prévois que l'architecture de Kimi K3 sera largement adoptée par d'autres laboratoires également (par exemple ZAI, MiniMax, Qwen, Tencent, Xiaomi, etc.), tout comme DeepSeek V3 (MLA) et plus tard DeepSeek V3.2 (MLA + DSA) sont devenus répandus dans l'industrie.

CSA de DeepSeek. Remarquez la compression le long de la dimension de la séquence. Cela donne 1 token compressé pour 4 tokens.

HCA de DeepSeek. Remarquez la compression le long de la dimension de la séquence. Cela donne 1 token compressé pour 128 tokens.
Qu'en est-il du point de Funda AI selon lequel vous devez mettre en cache l'état KDA plusieurs fois, car il n'est pas additif comme le cache KV ? De plus, les sous-agents n'auront-ils pas besoin de stockage de cache KV ?
Rappelez l'exemple précédent : l'état total KDA sur 69 couches est de 0,22 Go. Ainsi, même si vous le mettez en cache/instantané tous les 20 000 tokens lors d'une longue session, cela représente 50 fois sur un contexte de 1 million de tokens.
Ces 50 instantanés prendront donc 50 * 0,22 Go. Cela donne un total de 11 Go seulement – le total (29,22 Go + 11 Go) reste bien en dessous des 107 Go requis pour All MLA avec un contexte de 1 million de tokens.
Deuxièmement, le point de Funda AI était que les agents principaux peuvent engendrer des sous-agents. Les gens lanceront de nombreux sous-agents. Mais généralement, une fois qu'un sous-agent rend la main à l'agent principal, son travail est terminé. Son KV + état sont supprimés. Donc même si les gens lancent des agents qui lancent des centaines de sous-agents, les besoins en KV + état ne sont pas à long terme. L'état de la session principale / de l'agent principal doit être conservé beaucoup plus longtemps ; et c'est là que KDA économise énormément !!!
Il existe des schémas où il y a des agents asynchrones de longue durée ; dans ces cas, leur KV + état doivent être maintenus. Mais je vois ces schémas rarement implémentés. Cela ne veut pas dire que cela ne changera pas à l'avenir.
Sous-agents synchrones (un schéma très courant) :

Sous-agents asynchrones (un schéma relativement rare) :

L'adoption de KDA aura-t-elle alors un impact à la baisse sur la demande de mémoire ?
Je ne suis pas un voyant, mais il y a une probabilité faible et non nulle que cela fasse éclater la bulle de la mémoire.
D'abord, pourquoi cela pourrait ne pas avoir d'impact sur la demande de mémoire :
- Bien que les économies soient réelles, si l'IA open source est largement adoptée, la plupart des déploiements ne seront pas aussi efficaces que ceux des laboratoires de pointe fermés. Par conséquent, tous les gains au niveau du modèle seront perdus au niveau de l'industrie. Nous aurons un grand nombre de petits déploiements qui ne sont pas très efficaces. Par exemple, pour la plupart des entreprises et des gouvernements, l'utilisation se fait sur 12 heures par jour. Que va faire leur infrastructure de modèle open source et sa mémoire la nuit ? L'infrastructure des grands laboratoires est utilisée 24 h/24 et 7 j/7 en raison d'une clientèle mondiale.
- De plus, nous faisons une grande hypothèse selon laquelle les grands laboratoires n'ont pas déjà des approches similaires. OpenAI, Anthropic, DeepMind emploient certaines des personnes les plus intelligentes du monde. Il y a donc de fortes chances que de telles innovations soient déjà utilisées et aient déjà été intégrées dans la demande de mémoire.
Cela dit, de temps en temps, il y a un SpaceX qui arrive et montre aux leaders de l'industrie que leurs approches étaient inefficaces. Ils pensent à partir des premiers principes. Les acteurs établis – en raison de problèmes de structure organisationnelle, ou parce qu'ils n'ont pas assez faim – n'innovent pas sur les dimensions clés. L'histoire du capitalisme est remplie de milliers d'exemples de ce genre…

C'est donc un scénario peu probable – mais avec une probabilité non nulle – que si les grands laboratoires n'avaient pas été aussi affamés de ressources, ils n'auraient peut-être pas exploré tout l'espace de conception pour réduire la demande de mémoire à un tel point.
Dans l'industrie de l'IA elle-même, cela s'est produit plusieurs fois auparavant, où de grands laboratoires ont fait preuve d'une incompétence flagrante :
- Le pipeline d'entraînement de XAI avait un faible MFU (utilisation des GPU) – en raison de l'habitude de jeter du calcul sur le problème, ainsi que d'autres problèmes de configuration de cluster et de problèmes organisationnels.
- Malgré toutes les ressources à leur disposition, Meta a entraîné une version merdique du MoE de DeepSeek pour Llama 4.
- Google a mis 1 an et demi depuis le lancement de ChatGPT pour amener Gemini au premier plan, et ce n'est toujours le modèle préféré de personne pour le cas d'utilisation le plus populaire : le codage IA.

Les contraintes forcent l'innovation, il n'est donc pas improbable que de petites équipes très bien organisées surpassent les grandes équipes riches en ressources. Et maintenant que K3 est sorti et que son architecture est bien connue, si une technique de type KDA – qui a maintenant réussi à l'échelle de la frontière – est également adoptée par les laboratoires fermés, cela signifie une réduction de 75 % de la demande de mémoire au moins pour quelques laboratoires, et ils sont assez grands individuellement, donc l'impact pourrait être de plusieurs dizaines de milliards.
Ces économies de mémoire pourraient être englouties par une utilisation accrue due à la réduction des coûts, bien sûr (paradoxe de Jevons), mais il n'est pas garanti que la croissance de la consommation dépasse toujours les économies…

Diffusion d'autres innovations : la principale innovation de Kimi K3 n'est pas seulement KDA !
Kimi K3 se débarrasse complètement de l'encodage positionnel : Les encodages positionnels indiquent le numéro de séquence de chaque token dans le contexte. Ses couches KDA, de par leur nature récurrente, n'ont pas besoin d'encodages positionnels. Ils s'en débarrassent même pour les couches MLA et cela ne nuit pas. Avantages ? Il ne nécessite aucun effort particulier pour étendre la longueur de contexte du modèle par rapport aux modèles précédents. Élégant.
Kimi K3 implémente des résidus d'attention à l'échelle de 2,8 T : Cela garantit, en pratique, que les couches supérieures peuvent prêter une attention sélective aux entrées des couches inférieures. Dans les approches précédentes, les couches supérieures ne pouvaient pas distinguer les entrées des couches inférieures à une position de token donnée, car toutes les valeurs étaient agrégées. Cette nouvelle approche donne au modèle une bien meilleure discernabilité. (https://arxiv.org/pdf/2603.15031
Kimi K3 implémente le Stable Latent MoE de Nvidia : Le principal avantage d'une architecture latent Mixture-of-Experts (LatentMoE) stable est une plus grande précision du modèle et une plus grande capacité d'expert à un coût d'inférence identique ou inférieur. Il y parvient en projetant les représentations des tokens dans un espace latent plus petit avant d'exécuter le routage et le calcul des experts. Ils l'ont tiré de l'article de Nvidia de janvier 2026 (https://arxiv.org/pdf/2601.18089v1

Avec toutes ces innovations réunies, l'équipe MoonShot a atteint une efficacité d'entraînement 2,5 fois supérieure par rapport à leur architecture précédente, Kimi K2. Cela signifie qu'ils atteignent la même perte de validation avec 2,5 fois moins de FLOPs. C'est une économie massive même pour le calcul d'entraînement !!! Cela permettra à de nombreux autres laboratoires d'entraîner des modèles à si grande échelle avec un calcul limité…

Avec K3, Moonshot a débloqué de nouvelles lois d'échelle. Kimi K3 atteint un gain de 2,5× en efficacité d'échelle par rapport à Kimi K2.
MoonShot a également open sourcé leur noyau GPU FlashKDA pour le calcul rapide de l'état KDA et MoonMoE pour la répartition et la combinaison des tokens. Ils sont assez confiants pour partager autant de connaissances, car ils sont déjà sur la prochaine série d'innovations qui les mèneront encore plus loin (en fin de compte, ce sont aussi des capitalistes).

Les lois d'échelle ne sont pas des lois de la nature, nous pouvons toujours en découvrir de meilleures
De plus, nous pourrions découvrir de nouvelles lois d'échelle avec de nouvelles architectures et de nouveaux paradigmes d'entraînement, offrant une intelligence encore plus dense. Les lois d'échelle sont des observations statistiques, ce ne sont pas des lois de la nature qui ne peuvent pas être modifiées. Cela signifie qu'avec des modèles plus récents, pour une taille plus petite (et un KV et un état plus faibles), nous pouvons avoir de meilleures performances. Donc, l'explosion de la demande ne signifie pas que nous utiliserons éternellement les mêmes grands modèles. Les modèles continueront à devenir plus denses en termes d'intelligence.**
Nous avons un écosystème sous la forme de laboratoires chinois qui est hautement contraint et hautement capable – un mélange très puissant, comme discuté. Ils découvrent des coins de l'espace de conception qui n'ont pas été découverts par des laboratoires mieux financés. Ils progressent rapidement grâce au partage ouvert des connaissances. Cela évite aux autres de gaspiller leurs efforts et de réinventer la roue. L'évolution de l'architecture se produit beaucoup plus rapidement qu'autrement…
De plus, ce succès de l'équipe MoonShot est sûr d'inspirer d'autres équipes tout aussi capables chez DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED et même des acteurs émergents comme Baidu, Ant Ling, Xiaomi Mimo, Meituan et bien d'autres à être les meilleurs, non seulement en tant que modèle open source, mais à être les meilleurs globalement.
Beaucoup de nouvelles innovations se produiront également dans les laboratoires émergents de l'Ouest, que ce soit chez xAI ou MSL maintenant qu'ils ont repris leurs esprits et ont commencé à livrer d'excellents modèles.
Cela dit, comme je le souligne constamment, la Chine compte le plus grand nombre de jeunes chercheurs en IA, selon les statistiques de NEURIPS. Les contributions dans ce domaine viennent de manière disproportionnée des jeunes chercheurs (le fil source), donc beaucoup plus de percées sont susceptibles d'émerger de cette partie du monde.

La Chine possède également trois grands centres urbains avec une densité de talents en IA rivalisant avec celle de la Silicon Valley ; ils agissent comme des creusets de mélange d'idées (le fil source).

Interdire l'IA open source n'aidera pas :
Une conclusion malheureuse de cette discussion pourrait être que nous devons interdire l'IA open source pour protéger les marchés occidentaux. Mais cela serait hautement contre-productif.
Que l'IA open source soit interdite ou non dans le monde occidental, ces espaces de conception seront explorés et des articles seront publiés. L'Ouest a aussi beaucoup de nouveaux grands laboratoires qui émergent. Ils découvriront aussi beaucoup de nouvelles idées, maintenant qu'il est devenu évident qu'il reste encore beaucoup de gains d'efficacité possibles.
La meilleure chose à faire est d'encourager et d'adopter ces innovations, d'être responsable dans les investissements et d'éviter les spéculations sauvages.
L'avenir est très, très brillant grâce à cette technologie, mais nous devons faire attention à ne pas être des spéculateurs fous qui se font appeler sur marge.
Nous n'avons pas utilisé autant d'IA que nous le pourrions : que ce soit dans le monde de l'entreprise, l'éducation, la recherche ou le divertissement.
- Bien que le codage ait été le principal cas d'utilisation des tokens GenAI, des applications comme CoWorker ne font que commencer.
- J'aimerais que chaque étudiant en Inde ait un accès illimité à des modèles de niveau Opus 4.8 ou Kimi K3. Ils y ont accès, mais seulement à des modèles plus faibles.
- De plus, nous pourrions avoir des cas d'utilisation de l'IA beaucoup plus précieux dans les sciences, l'ingénierie et la médecine.
- En outre, nous avons un monde vieillissant dont nous devons prendre soin. L'IA y sera grandement bénéfique. Il existe tant de possibilités aussi dans le divertissement et les jeux vidéo. Comme l'a mentionné Jensen Huang : « chaque pixel que nous voyons à l'écran pour le divertissement sera généré ».
Conclusion :


Le krach boursier de 1929 – la Grande Dépression – n'était pas le résultat d'une destruction de la demande. C'était le résultat d'excès spéculatifs. Le monde entier a souffert pendant deux décennies. Cela a sans doute conduit à la montée du fascisme et à la Seconde Guerre mondiale.
Bien que l'avenir soit incertain, ce qui est clair dans mes observations, c'est que les bulls de l'IA et de la mémoire, en particulier, ne prennent pas en compte les innovations algorithmiques et la découverte de nouvelles lois d'échelle. Pour eux, tout est englouti par le paradoxe de Jevons, donc sans intérêt. Cette attitude a également imprégné les investisseurs particuliers et a conduit à un comportement insensé qui pourrait potentiellement faire s'effondrer les économies de plusieurs pays. Je veux introduire de nouveaux angles dans leur analyse.** Ils ont des informations bien meilleures sur les situations de la chaîne d'approvisionnement et les résultats d'entreprise. Je veux les armer d'une perspective plus technique.
Pour faire chuter les actions mémoire et IA, nous n'avons pas besoin d'une réduction massive de la demande, comme l'a souligné Jaya Gupta. Une réduction même modeste de la demande peut déclencher une compétition de théorie des jeux où les détenteurs existants commencent à prendre leurs bénéfices avec l'intention de racheter des actions plus tard, ce qui peut faire chuter tout le marché. Et cela semble avoir commencé…
Il est important de ne pas laisser de telles bulles se former et éclater de manière catastrophique pour la société. Globalement, je reste très optimiste quant au potentiel de cette technologie (et même de la demande de mémoire) et à la construction future de l'infrastructure. C'est la période la plus excitante pour être en vie !
(PAS UN CONSEIL EN INVESTISSEMENT)
Annexe
Calcul détaillé des économies de mémoire :
Pour montrer à quel point Kimi K3 est bon, j'ai demandé à K3 lui-même de faire ces calculs. Je les ai vérifiés et ils sont corrects. Comme mentionné précédemment, nous considérons deux cas :
1) Kimi K3 : 69 KDA + 24 Gated MLA attention totale vs
2) Full MLA : 93 MLA attention totale








