Le chiffre principal n'est pas l'histoire
Le 27 juillet, Moonshot AI publie les poids complets de Kimi K3 sous une licence MIT modifiée. La fiche technique se lit comme un coup de force : 2,8 billions de paramètres, une fenêtre de contexte d'un million de tokens, et le titre de plus grand modèle à poids ouverts jamais publié, environ 75 % plus grand que DeepSeek V4 Pro.
Mais la taille n'est qu'un appât. La véritable histoire réside dans un changement de contrôle de l'accès à l'intelligence de pointe. Pendant trois ans, les meilleurs modèles vivaient derrière une API. Vous payiez un loyer, le propriétaire fixait les conditions, et si le fournisseur modifiait le prix du point d'accès ou changeait discrètement le comportement du modèle, votre produit en subissait les dégâts.
Les poids ouverts brisent cet arrangement. Une fois les fichiers publics, aucun laboratoire ne peut reprendre la capacité. Ce seul fait change l'économie pour tout le monde, y compris ceux qui ne téléchargeront jamais un seul fragment.
La fiche technique en un coup d'œil
Spécification
Valeur
Paramètres
2,8 billions
Experts
896 au total, 16 actifs par token
Fenêtre de contexte
1 048 576 tokens
Licence
MIT modifiée
Lancement des poids
27 juillet
Taille vs DeepSeek V4 Pro
~75 % plus grand
Efficacité d'échelle vs K2
~2,5x
Tarification
Tarif
Entrée (cache hit)
0,30 $ / 1M tokens
Entrée (cache miss)
3,00 $ / 1M tokens
Sortie
15,00 $ / 1M tokens
Comment un modèle de 2,8 T évite une facture de 2,8 T
Un modèle dense de cette taille serait inutilisable. Exécuter chaque paramètre sur chaque token est le mur que tous les modèles à l'échelle du trillion rencontrent : trop lent, trop cher, aucun moyen de contourner la physique.
K3 le contourne avec une conception agressive de Mixture-of-Experts. À l'intérieur du modèle vivent 896 sous-réseaux spécialisés. Sur un token donné, seulement 16 d'entre eux s'activent. Vous obtenez la connaissance stockée de 2,8 billions de paramètres tout en payant le coût d'inférence d'un modèle d'une fraction de cette taille.
C'est la parcimonie, et K3 s'appuie dessus plus fortement que tout modèle ouvert avant lui. K2 a prouvé que l'approche fonctionnait. K3 en fait le pari central.

Deux articles de recherche qui ont fait le gros du travail
Deux changements architecturaux rendent le reste possible, et tous deux ont été publiés comme recherche ouverte avant le lancement du modèle, ce qui a valu à Moonshot une crédibilité auprès des chercheurs avant même qu'un seul benchmark n'apparaisse.
Le premier est Kimi Delta Attention, un mécanisme d'attention linéaire hybride. Les coûts d'attention standard croissent quadratiquement à mesure que le contexte s'allonge, ce qui explique pourquoi les fenêtres d'un million de tokens restent généralement dans les présentations marketing. KDA évolue différemment, et cette différence est la seule raison pour laquelle une fenêtre de 1M existe à un prix que tout le monde peut réellement payer.
Le second est Attention Residuals, un remplacement des connexions résiduelles standard. Moonshot l'attribue aux gains d'échelle constants, leur permettant de construire des modèles plus profonds sans la dégradation habituelle. Selon leurs propres chiffres, la combinaison offre environ 2,5 fois l'efficacité d'échelle de K2.
Ce que tue un million de tokens

La plupart de l'infrastructure de récupération dans l'IA en production existe comme une solution de contournement. Le découpage, les embeddings, les bases de données vectorielles, les pipelines RAG : tout cela compense les modèles qui ne peuvent pas contenir assez de mémoire de travail à la fois.
Un million de tokens change la donne. Une base de code entière tient dans un seul prompt. Une année de documents internes. Cinquante transcriptions vidéo. Tout se trouve dans l'attention simultanément, et le modèle raisonne sur l'ensemble du corpus au lieu d'assembler des fragments récupérés en espérant que les joints tiennent.
La vision native élargit encore la surface d'entrée. Les captures d'écran, les photos de tableau blanc, les diagrammes d'architecture et les graphiques sont lisibles dans le même contexte que le code et le texte qui les entourent. Ce n'est pas un hasard si les meilleurs résultats de K3 dans les benchmarks sont venus du codage front-end : le modèle voit le design et écrit l'implémentation à l'intérieur d'une seule fenêtre de contexte.
Le tableau de tarification qui compte plus que les benchmarks
Les tarifs listés : 0,30 $ par million de tokens d'entrée en cas de cache hit, 3,00 $ en cas de cache miss, 15,00 $ par million de tokens de sortie, avec un contexte de 1 048 576 tokens.
Le chiffre du cache est celui sur lequel se concentrer. Moonshot rapporte des taux de cache hit supérieurs à 90 % dans les longues sessions de codage. Pensez à ce que fait réellement un agent : il relit le même dépôt encore et encore pendant des heures. Sans mise en cache, il paie le plein tarif d'entrée à chaque passage. Avec, le coût d'une longue session s'effondre d'environ 4x.
Les agents à long horizon vivent ou meurent exactement sur ces calculs. K3 est conçu pour des sessions qui durent des heures avec une supervision minimale, naviguant dans un dépôt, orchestrant des outils de terminal, vérifiant son propre travail. La structure de tarification est le produit.
L'écueil que personne ne devrait ignorer
K3 n'a pas de mode économique. Le raisonnement est en permanence activé et fixé au maximum. Des testeurs indépendants l'ont vu brûler plus de 13 000 tokens de réflexion sur une demande triviale de SVG, environ 0,25 $ pour une requête jetable.
La leçon est le routage. Les appels rapides, bon marché et à grand volume appartiennent à des modèles plus petits. K3 ne justifie son coût que lorsque la taille du contexte et la complexité de la tâche justifient un raisonnement toujours actif. L'utiliser comme point d'accès de chat à usage général, c'est jeter l'argent par les fenêtres.
Le brancher prend cinq minutes
L'API est compatible OpenAI. Remplacez le base_url et la clé, gardez votre code existant :
1from openai import OpenAI2import os34client = OpenAI(5 api_key=os.environ["MOONSHOT_API_KEY"],6 base_url="https://api.moonshot.ai/v1",7)89completion = client.chat.completions.create(10 model="kimi-k3",11 messages=[{"role": "user", "content": "Présentez Kimi K3 en une phrase."}],12)13print(completion.choices[0].message.content)
Le raisonnement est configuré via un champ de haut niveau, n'acceptant pour l'instant que "max" :
1completion = client.chat.completions.create(2 model="kimi-k3",3 reasoning_effort="max",4 messages=[{"role": "user", "content": "Prouvez que la racine carrée de 2 est irrationnelle."}],5)6print(completion.choices[0].message.content)
Le streaming fonctionne de manière standard, le raisonnement arrivant dans un champ delta séparé afin que vous puissiez afficher la réflexion et la réponse indépendamment :
1stream = client.chat.completions.create(2 model="kimi-k3",3 messages=[{"role": "user", "content": "Expliquez pourquoi le ciel est bleu."}],4 stream=True,5)67for chunk in stream:8 delta = chunk.choices[0].delta9 reasoning = getattr(delta, "reasoning_content", None)10 if reasoning:11 print(reasoning, end="", flush=True)12 if delta.content:13 print(delta.content, end="", flush=True)
L'entrée vision prend des images encodées en base64 avec du texte dans le même message. Voici le workflow complet de capture d'écran vers code :
1import base642from pathlib import Path34image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()56completion = client.chat.completions.create(7 model="kimi-k3",8 messages=[9 {10 "role": "user",11 "content": [12 {13 "type": "image_url",14 "image_url": {"url": f"data:image/png;base64,{image_data}"},15 },16 {"type": "text", "text": "Reconstruisez cette page d'atterrissage en HTML et Tailwind."},17 ],18 }19 ],20)21print(completion.choices[0].message.content)
Pourquoi cela touche les gens qui ne touchent jamais aux poids
Voici la partie honnête : presque personne n'hébergera lui-même 2,8 billions de paramètres. Même avec la parcimonie, la facture matérielle se situe bien au-delà de la portée des amateurs, et aussi au-delà de la plupart des entreprises.
Ce n'était jamais le but. Les poids publics plafonnent ce que les laboratoires fermés peuvent facturer pour une capacité comparable. Les hébergeurs tiers se feront concurrence pour servir K3 à des marges de commodité, la même dynamique qui s'est jouée avec chaque grande version ouverte avant lui. Les prix sur l'ensemble du marché dérivent vers la référence ouverte.
Le bénéfice vous parvient via la facture de votre fournisseur actuel, que vous téléchargiez ou non un fichier.
Un guide pratique
Nourrissez-le d'ensembles complets. Des dépôts entiers à réviser, des dossiers de contrats complets, une bibliothèque de contenu entière. Arrêtez de découper ce qui ne nécessite plus de découpage.
Lancez-le longtemps. Mettez en file d'attente des sessions d'ingénierie de plusieurs heures et vérifiez les résultats plus tard. Le cache absorbe le coût de chaque relecture.
Pointez une caméra sur les problèmes. Capturez une page d'atterrissage et demandez sa reconstruction. Photographiez un tableau blanc et demandez l'implémentation.
Gardez le trafic trivial loin de lui. Un modèle qui raisonne toujours au maximum est le mauvais outil pour les appels rapides et à grand volume. Acheminez-les ailleurs et réservez K3 pour un travail qui le mérite.
Le compte à rebours de dix jours
Pendant trois ans, la frontière était quelque chose que vous louiez, selon des conditions que vous ne fixiez pas, à des prix qui pouvaient changer sans préavis.
Le 27 juillet, il devient un fichier. Et un fichier, contrairement à un abonnement, est quelque chose que vous possédez.





