Kimi K3 : Le guide complet de A à Z sur le modèle ouvert qui a surpassé Fable 5

@kirillk_web3
ANGLAISil y a 2 jours · 19 juil. 2026
235K
78
16
13
156

TL;DR

Kimi K3 est un modèle open-source de 2,8 billions de paramètres développé par Moonshot AI, rivalisant avec les meilleurs modèles propriétaires comme Fable 5. Il se distingue par une architecture innovante permettant un codage rapide, une gestion de contexte étendue et une auto-amélioration autonome.

Voici la traduction en français du texte fourni, en respectant toutes les consignes (structure, balises, codes, ton naturel, etc.).


Ceci est une analyse complète, de A à Z, de ce qu'est réellement Kimi K3, de ce qu'il peut faire, et pourquoi il devient tranquillement le modèle de codage le plus important dont personne ne parle encore.

Ajoutez cette page à vos favoris pour ne pas perdre cet article.

2,8 billions de paramètres. 1 million de tokens de contexte.

Voici tout ce qu'il contient.

Avant de parler des benchmarks, parlons de ce qui vient de se passer

Depuis trois ans, l'histoire est la même : les laboratoires américains construisent la frontière, les laboratoires chinois construisent la copie bon marché six mois plus tard.

Le 16 juillet, Moonshot AI a publié Kimi K3.

https://x.com/Kimi_Moonshot/status/2077830229968683203

2,8 billions de paramètres au total — environ 75% de plus que DeepSeek V4 Pro et près de 4 fois la série GLM 5 de Zhipu. Le plus grand modèle open-source jamais publié.

Il surpasse Claude Opus 4.8. Il surpasse GPT-5.6 Sol. Et selon les benchmarks de Moonshot, il se situe au niveau de Fable 5 — le modèle le plus performant accessible au public aujourd'hui.

L'histoire de la copie est terminée.

Les chiffres

Kirill - inline image

Cette dernière ligne est celle que les gens interprètent mal. Traitons-la correctement.

La réalité des prix — lisez ceci attentivement

Kimi K3 n'est pas un modèle discount. À 3$/15$ par million de tokens, son prix est comparable à celui de Claude Sonnet — pas les réductions profondes que les premières versions de Moonshot offraient.

Alors, d'où vient le « 5x moins cher que Fable 5 » ?

Coût par tâche, pas prix par token.

K3 utilise nettement moins de tokens de sortie pour accomplir le même travail. Pour une tâche de codage représentative : Fable 5 coûte environ 1,30$. K3 coûte environ 0,25$.

Même niveau de sortie. Moins de tokens. Facture totale plus basse.

Le cadrage honnête : Prix Sonnet, expérience Fable. Vous n'achetez pas les tokens les moins chers du marché. Vous achetez des capacités de pointe à un prix intermédiaire, et vous y arrivez en moins d'étapes.

Si vous comparez les prix bruts des tokens, K3 semble quelconque. Si vous comparez le coût pour terminer un travail, c'est une conversation totalement différente.

Où Kimi K3 est à l'état de l'art

Selon les benchmarks publiés par Moonshot, K3 établit de nouveaux standards sur :

  • HLE avec outils — L'examen final de l'humanité, augmenté par des outils
  • SWE-Bench Pro — génie logiciel réel
  • SWE-Bench Multilingue — ingénierie multilingue
  • BrowseComp — navigation web et recherche
  • Toolathlon — utilisation d'outils à grande échelle
  • CharXiv avec Python — raisonnement sur graphiques et figures
  • MathVision avec Python — mathématiques visuelles
Kirill - inline image

Face à la concurrence : surpasse Opus 4.8 et GPT-5.6 Sol, égal à Fable 5.

Lors des tests en aveugle par l'évaluateur IA Arena, les développeurs ont préféré Kimi à tous les grands modèles américains.

Les deux innovations architecturales qui comptent vraiment

C'est la partie que la plupart des articles ignorent, et c'est la chose la plus intéressante de cette publication.

Kirill - inline image
  • Kimi Delta Attention (KDA)

Un mécanisme d'attention linéaire hybride. Résultat : jusqu'à 6,3x de décodage plus rapide dans des contextes d'un million de tokens.

Une fenêtre de contexte de 1M n'est utile que si vous pouvez réellement y travailler sans attendre indéfiniment. KDA est ce qui rend la fenêtre de contexte pratique plutôt que théorique.

  • Attention Residuals (AttnRes)

Un remplacement direct des connexions résiduelles. Offre environ 25% d'efficacité d'entraînement supplémentaire pour moins de 2% de coût additionnel.

Les deux techniques ont été publiées en tant que recherche ouverte par l'équipe Moonshot sur GitHub avant que le modèle ne soit livré. Ce n'est pas du marketing — c'est un travail vérifiable par les pairs.

Et combinées, elles expliquent l'efficacité des tokens : K3 utilise 21% moins de tokens de sortie que K2.6 sur des tâches équivalentes.

La partie qui devrait vous faire réfléchir : K3 a optimisé sa propre architecture

Moonshot a donné à K3 l'implémentation des Attention Residuals — son propre composant architectural — et un seul objectif : l'accélérer sur le matériel H200 sans changer le comportement numérique.

Ensuite, ils l'ont laissé tranquille.

20 heures d'expériences. Zéro intervention humaine. Accélération de 1,6x.

Dans une exécution séparée, K3 a réduit le temps aller/retour de FLA Triton AttnRes de 283,6 ms à 114,4 ms — une accélération de 2,48x — toujours sans modifier les numériques.

Kirill - inline image

Et il a itéré plus vite que Fable 5 faisant la même tâche.

Relisez cela. Le modèle a amélioré le mécanisme qui fait fonctionner le modèle. De manière autonome. Du jour au lendemain.

C'est à quoi ressemble « l'auto-amélioration récursive » en pratique — pas un scénario de science-fiction, un travail de 20 heures avec un résultat mesurable. C'est la même capacité qu'Anthropic a signalée comme motif de prudence il y a quelques semaines, fonctionnant dans un modèle en open-weight que n'importe qui peut télécharger le 27 juillet.

Le codage à long horizon est tout l'intérêt

Le cadrage de Moonshot : « K3 est le modèle de codage open-source le plus puissant de Moonshot AI à ce jour. Fonctionnant avec une supervision humaine minimale, il peut soutenir de longues sessions d'ingénierie, naviguer dans des dépôts massifs et orchestrer des outils de terminal. »

Les trois choses qui comptent pour un vrai travail d'ingénierie :

  1. Sessions prolongées — l'expérience autonome de 20 heures n'est pas une démo. C'est l'objectif de conception.
  2. Dépôts massifs — une fenêtre de contexte de 1M avec un décodage 6,3x plus rapide signifie que vous pouvez mettre un vrai codebase dans le contexte et y travailler réellement.
  3. Orchestration d'outils — SOTA sur Toolathlon et BrowseComp signifie qu'il gère le terminal, le navigateur et les appels API sans se désintégrer.

Le codage frontend atteint le niveau de Fable 5. Des scènes de jeu de qualité AAA à partir d'une seule invite. WebGPU, Three.js, shaders, physique — tout ce qui nécessitait auparavant un studio.

Vibe Coding avec Kimi K3

C'est là que le modèle cesse d'être un chiffre de benchmark et devient clairement utile.

Le codage frontend de K3 se situe au niveau de Fable 5. En pratique, cela signifie que le mur entre une description et un produit 3D fonctionnel est désormais une seule invite.

Ce que les gens ont réellement livré à partir d'invites uniques :

Jeux — Arènes de combat WebGPU avec effets visuels. Traversée de ville 3D dans le navigateur avec mécaniques de grappin.

  1. Zombie FPS.
  2. Course multijoueur.
  3. Un émulateur GBA 3D fonctionnel.
  4. Échafaudage complet de MMORPG.

Pas « une démo ressemblant à un jeu » — des scènes jouables avec des réactions aux coups, des retours d'impact et une physique qui se comporte correctement.

Kirill - inline image

Objets 3D avec un vrai travail de matériau — Une Rolex avec une brillance et un comportement lumineux corrects. Une arme CSGO qui s'assemble et se désassemble sur 33 pièces modélisées individuellement. Un démontage d'appareil photo Sony. Un trou noir avec lentille gravitationnelle. Simulation océanique avec une dynamique des vagues réaliste.

Kirill - inline image

Scènes physiques — Simulation de tissu. Effondrement structurel. Collisions de véhicules avec transfert de momentum qui semble juste plutôt que scripté.

Ce qui rend cette approche différente des précédentes démos « l'IA construit un site web » : K3 gère les détails qui cassent normalement. L'éclairage. Les ombres. La brillance des matériaux. Les 20 petites choses qui séparent « clairement généré par IA » de « quelqu'un a construit ça ».

Une invite. Quatre millions de tokens. Une scène qui nécessitait auparavant une équipe.

4 invites éprouvées (prêtes à copier-coller)

Ces invites sont structurées pour exploiter ce que K3 fait de mieux : le travail à long horizon, l'utilisation d'outils et la gestion d'un grand contexte sans dérive.

Invite 1 — Le test de résistance physique

C'est l'invite qui sépare la capacité réelle du vernis de démo. Si un modèle peut réaliser les trois scènes avec qualité, il est réel.

text
1Crée trois scènes HTML5 autonomes avec une physique réelle.
2Aucune bibliothèque externe. Tout dans un seul fichier par scène.
3
4Scène 1 : Un train déraillant d'un pont cassé dans l'eau.
5Inclure : l'élan des wagons, la rupture structurelle du pont,
6le déplacement de l'eau à l'impact.
7
8Scène 2 : Deux voitures sautant de rampes et entrant en collision
9en plein air au-dessus d'un canyon. Inclure : les arcs de trajectoire
10corrects, le transfert de momentum de la collision, les débris.
11
12Scène 3 : Un monster truck écrasant une rangée de voitures garées.
13Inclure : la compression de la suspension, la déformation de la
14tôle, la répartition du poids.
15
16Exigences pour les trois :
17- La physique doit être calculée, pas animée
18- Cible 60fps
19- Inclure un bouton de réinitialisation
20- Commentez les calculs physiques pour que je puisse les vérifier
21
22Construisez les trois. Ne posez pas de questions de clarification.

Invite 2 — La tâche de dépôt à long horizon

C'est pour cela que K3 a été réellement construit. Pointez-le vers un vrai codebase et donnez-lui un résultat, pas une tâche.

text
1Lisez l'intégralité de ce codebase avant d'écrire quoi que ce soit.
2
3[collez votre dépôt, ou pointez-le vers le répertoire]
4
5Objectif : [énoncez un résultat mesurable — par exemple « réduire
6le temps de réponse API p95 de 30% » ou « éliminer toutes les
7requêtes N+1 dans la couche de données »]
8
9Règles :
10- Profilez d'abord. Montrez-moi où le temps va réellement
11 avant de changer quoi que ce soit.
12- Ne modifiez pas les interfaces publiques ou le comportement numérique.
13- Exécutez la suite de tests existante après chaque modification.
14- Si une modification empire les choses, annulez-la et dites-moi pourquoi.
15- Travaillez jusqu'à ce que l'objectif soit atteint ou que vous puissiez
16 prouver qu'il n'est pas réalisable sans enfreindre les règles.
17
18Rapport à la fin : ce que vous avez changé, ce que cela a apporté,
19ce que vous avez essayé qui n'a pas fonctionné.

La ligne « ce que vous avez essayé qui n'a pas fonctionné » est importante. C'est ce qui transforme la sortie d'un diff en un journal d'ingénierie.

Invite 3 — La construction de produit 3D

Pour tous ceux qui travaillent sur le frontend, les pages de destination ou la visualisation de produits.

text
1Construisez un [objet] 3D interactif dans le navigateur.
2Un seul fichier HTML. Three.js.
3
4L'objet : [décrivez-le précisément — matériaux,
5nombre de pièces, ce qui bouge]
6
7Doit inclure :
8- Propriétés de matériau correctes (brillance, rugosité,
9 métallicité si pertinent)
10- Éclairage à trois points avec de vraies ombres
11- Contrôles d'orbite
12- [Toute interaction — assemblage/désassemblage, animation,
13 états de survol]
14
15Niveau de qualité : cela doit ressembler à un rendu produit,
16pas à une démo WebGL. Si un détail serait visible dans la vraie vie,
17modélisez-le.
18
19Construisez le tout. Montrez-moi le fichier.

La ligne « niveau de qualité » fait plus de travail que tout le reste de l'invite. K3 répond aux standards, pas seulement aux instructions.

Invite 4 — Fonctionnalité en temps réel avec une partie mobile

Le CRUD complet est une forme d'application. Le temps réel en est une forme totalement différente : l'état doit rester synchronisé entre les clients, pas seulement persister dans une base de données. C'est là que beaucoup de modèles échouent silencieusement.

text
1Ajoutez une fonctionnalité en temps réel à une application existante :
2un système de curseur collaboratif en direct + commentaires,
3comme celui de Figma.
4
5EXIGENCES :
6- Connexion WebSocket (utilisez Socket.io ou ws natif)
7- Afficher les positions des curseurs des autres utilisateurs connectés
8 en temps réel
9- Cliquez n'importe où pour déposer une épingle de commentaire
10- Les commentaires se mettent à jour en direct pour tous les clients
11 connectés
12- Gérer la déconnexion/reconnexion gracieusement — pas de
13 curseurs fantômes
14- Debounce des mises à jour de curseur pour ne pas inonder le socket
15
16CONSTRUCTION :
171. Mettez en place le serveur WebSocket
182. Construisez la connexion côté client avec reconnexion automatique
193. Implémentez la diffusion des curseurs avec debouncing
204. Implémentez le système d'épingles de commentaires
215. Ajoutez un indicateur de présence simple (qui est en ligne)
226. Testez avec au moins 2 clients simulés pour confirmer la synchronisation
23
24Montrez-moi comment vous avez testé la synchronisation multi-client
25avant de considérer cela comme terminé.

Résultat attendu : Une couche temps réel fonctionnelle en 15 à 30 minutes, avec une preuve visible qu'elle a été testée avec plus d'un client.

Kirill - inline image

La dernière ligne est la partie importante. Les bugs en temps réel n'apparaissent pas avec un seul onglet de navigateur ouvert — ils apparaissent avec deux. Un modèle qui saute les tests multi-clients vous remettra un code qui semble terminé mais ne l'est pas.

Quand K3 se trompe : guide de dépannage

C'est un nouveau modèle avec de véritables aspérités. Voici ce qui casse et quoi faire.

  • Problème : Il brûle des tokens sur des tâches triviales

C'est le gros problème, et il est structurel.

K3 n'est actuellement livré qu'avec un seul niveau d'effort de raisonnement — 'max'. Il n'y a pas de mode « réponds vite ». Des testeurs indépendants ont mesuré 13 241 tokens de raisonnement pour générer un simple SVG — environ 0,25$ pour quelque chose qui devrait coûter des fractions de cent.

La solution :

n'utilisez pas K3 pour du travail simple. C'est un modèle de pointe avec un seul rapport de vitesse, et ce rapport est « réfléchis beaucoup à tout ». Utilisez K2.7 ou un modèle plus petit pour le code standard, le formatage et tout ce qui est mécanique. Réservez K3 pour le travail qui justifie le raisonnement.

C'est la plus grande erreur que les gens feront au cours du premier mois : faire de K3 le modèle par défaut pour tout, puis être surpris par la facture.

  • Problème : La fenêtre de contexte se remplit quand même

1M de tokens semble infini jusqu'à ce que vous y mettiez un vrai dépôt et que ça ne le soit pas.

La solution :

ne jetez pas tout. Pointez-le vers les répertoires qui comptent. La force de K3 sur le travail à long horizon vient de la concentration soutenue, pas du fait d'avoir tous les fichiers dans le contexte. Un bon 200K du bon code vaut mieux qu'un 900K gonflé de tout le monorepo.

  • Problème : Il dérive lors de très longues exécutions autonomes

L'expérience autonome de 20 heures est réelle, mais elle a fonctionné parce que l'objectif était mesurable — « rends ça plus rapide sur H200 sans changer les numériques ». Donnez-lui un objectif vague et une longue laisse, et il va vagabonder.

La solution :

chaque invite à long horizon a besoin d'une condition de succès vérifiable. Pas « améliore le code ». Un chiffre, un test qui passe, un benchmark qui bouge. Si vous ne pouvez pas dire comment vous vérifieriez s'il a réussi, il dérivera.

  • Problème : Vous ne pouvez pas reproduire le résultat de benchmark de quelqu'un

Personne en dehors de Moonshot n'a audité ce modèle. Les poids ne tombent que le 27 juillet. Tous les chiffres qui circulent actuellement — y compris dans cet article — sont rapportés par le vendeur.

La solution :

attendez le 27 juillet, ou testez sur vos propres tâches et faites confiance à cela. Vos cinq tâches réelles valent plus que le tableau de benchmark de quiconque.

  • Problème : Erreurs d'intégration après être passé d'OpenAI ou Anthropic

K3 est compatible avec le SDK OpenAI, ce qui couvre 90% de la migration. Les 10% restants concernent généralement le comportement de raisonnement — K3 réfléchit par défaut et renvoie des tokens de raisonnement que vous n'attendez peut-être pas dans votre gestion des réponses.

La solution :

vérifiez votre comptabilité de tokens et votre analyse des réponses avant de supposer que le modèle est cassé. La plupart des plaintes « K3 est cher » sont en fait « j'ai oublié que les tokens de raisonnement sont des tokens de sortie. »

Le contexte que personne ne devrait ignorer

Moonshot est basé à Pékin, fondé par Yang Zhilin, un ancien chercheur de Google, et soutenu par Alibaba.

https://x.com/kirillk_web3/status/2057528102368977328

Ils ont construit un modèle de frontière de 2,8 billions de paramètres sous trois ans de contrôles à l'exportation américains de plus en plus stricts sur les puces avancées.

Les analystes de Bank of America l'ont dit directement : « Malgré les contraintes persistantes de capacité matérielle/de calcul en Chine, K3 démontre que le pré-entraînement à grande échelle, associé à l'innovation architecturale, peut encore offrir des gains significatifs pour les modèles chinois phares. »

Et le timing n'est pas accidentel : K3 est arrivé quelques jours avant la World Artificial Intelligence Conference 2026 à Shanghai.

La question du 27 juillet

Les poids tombent le 27 juillet. Cette date compte plus que la date de lancement.

Jusque-là, K3 est un modèle de frontière que vous pouvez utiliser via une API — impressionnant.

Le 27 juillet, il devient autre chose : un modèle de classe frontière que n'importe qui peut télécharger, inspecter, modifier et exécuter sur son propre matériel. Pas d'API. Pas de limites d'utilisation. Pas de conditions d'utilisation. Pas de conservation des invites de 30 jours.

C'est la véritable histoire. Pas « la Chine a rattrapé son retard. »

La Chine a rattrapé son retard et l'a donné gratuitement.

Kirill - inline image

À noter : les régulateurs chinois discutent de leurs propres contrôles à l'exportation de l'IA. On ne sait pas vraiment si K3 est la dernière version open-weight de frontière en provenance de Chine ou la première d'une longue série.

Comment essayer

Chat : kimi.com — K3 est en ligne maintenant

API : Compatible avec le SDK OpenAI, donc si vous construisez déjà sur les chaînes d'outils OpenAI ou Anthropic, l'intégration est un changement de configuration, pas une réécriture

Poids : 27 juillet

La compatibilité SDK est un plus gros problème qu'il n'y paraît. Changer de modèle nécessite généralement de réécrire votre couche d'intégration. Ici, cela signifie changer une URL de base et une chaîne de modèle.

Comment installer Kimi Code (l'agent de terminal)

Si vous voulez que K3 fonctionne dans votre codebase réel plutôt que dans une fenêtre de chat, voici la configuration.

Kirill - inline image

Prérequis :

  • Un ordinateur (Mac, Windows ou Linux)
  • Accès au terminal
  • Compte Kimi — kimi.com

Étape 1 — Installer Kimi Code

Mac/Linux :

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell) :

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

Sur Windows, installez d'abord Git pour Windows — le CLI Kimi Code utilise son Git Bash intégré comme environnement shell.

Vérifiez l'installation :

bash
1kimi --version

En raison de Gatekeeper sur macOS, le premier lancement peut prendre sensiblement plus de temps. Ajoutez votre application de terminal dans Réglages Système → Confidentialité et sécurité → Outils de développement pour accélérer les lancements ultérieurs.

Si vous avez déjà uv installé, vous pouvez installer directement :

bash
1uv tool install --python 3.13 kimi-cli

Le CLI Kimi Code prend en charge Python 3.12–3.14, avec 3.13 recommandé pour une meilleure compatibilité.

Étape 2 — Naviguez vers votre projet et lancez

bash
1cd votre-projet
2kimi

Au premier lancement, exécutez /login dans la session pour configurer votre source API — cela ouvre une fenêtre de navigateur pour OAuth.

Étape 3 — Donnez-lui une tâche

Kimi Code fonctionne maintenant dans votre projet, avec un accès direct en lecture/écriture à chaque fichier. Décrivez une tâche en anglais simple — il planifie les étapes, édite le code, exécute les tests et signale ce qu'il a fait.

Ce que cela signifie réellement

Si vous gérez des charges de travail de production :

Testez-le avant de changer. Les benchmarks des vendeurs et les performances réelles divergent constamment. Choisissez cinq tâches réelles, exécutez K3 et votre modèle actuel côte à côte, mesurez le coût par travail terminé — pas le coût par token.

Kirill - inline image

Le calcul par tâche est tout l'argument. À 3$/15$, K3 n'est pas bon marché sur le papier. Avec 21% de tokens en moins et une sortie de niveau Fable, il est bon marché là où ça compte.

Le 27 juillet change la donne. Les poids ouverts signifient auto-hébergement, fine-tuning et zéro dépendance à l'égard de l'API de quiconque restant en ligne ou des conditions de quiconque restant favorables. Pour tout ce qui est sensible, ce n'est pas une petite chose.

Conclusion

La frontière était autrefois un endroit que les laboratoires américains construisaient et que tout le monde visitait six mois plus tard.

2,8 billions de paramètres. 1M de contexte. Un codage de niveau Fable 5 au prix de Sonnet. Construit sous des contrôles à l'exportation, par le laboratoire le moins valorisé de la pièce, et donné gratuitement le 27 juillet.

La question intéressante n'est pas de savoir si K3 bat Fable 5 sur un benchmark. C'est ce qui arrive à l'économie des modèles fermés de pointe lorsqu'un modèle open-weight les égalise.

Liens

Suivez pour plus d'informations sur le Vibe Coding. Merci de votre lecture !

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux