Anthropic a récemment supprimé environ 80 % du prompt système de Claude Code pour ses modèles les plus récents.
Le raisonnement est intuitif : à mesure que les modèles deviennent plus intelligents, ils ont besoin de moins de directives, de moins de contraintes et de moins d'exemples. Au-delà d'un certain niveau de capacité, les exemples cessent d'aider et commencent à enfermer le modèle.
Nous croyons que la décision d'Anthropic est étayée par des données, mais ces preuves ne s'appliquent qu'à ses modèles les plus récents.
La question évidente qui suit est : cela fonctionne-t-il sur le modèle de travail banal et populaire comme Deep Seek v4 ?
Les modèles petits, rapides et peu coûteux sont exactement ceux dont on s'attendrait à ce qu'ils dépendent d'un guidage détaillé. Si on réduit leur prompt de moitié, la sagesse conventionnelle dit qu'ils devraient s'effondrer.
Nous avons mené l'expérience pour que vous n'ayez pas à le faire.
Configuration
Notre agent de codage, Ante, inclut un mode --short-prompt.
Il consolide le prompt système d'environ 5 000 à 2 300 caractères et raccourcit les descriptions des outils. Ensemble, ces changements réduisent le prompt complet par requête d'environ 34 000 à 18 000 caractères.
Nous avons testé en A/B les deux versions sur :
- Tâches : Suite complète de 89 tâches de Terminal-Bench 2.1
- Modèle : DeepSeek V4 Flash
- Tentatives : Une par tâche
- Variable modifiée : Un indicateur CLI
Tout le reste est resté constant : la même version de l'agent, le même résumé de jeu de données épinglé, le pool de sandbox, le niveau d'effort et les indicateurs d'exécution.
Résultat

Performance : parité. Le prompt court a en réalité obtenu un score de +2,3 points plus élevé, mais avec une seule tentative par tâche, cela se situe dans le niveau de bruit.
Jetons d'entrée : 32 % de moins dans le sous-ensemble de résultats identiques.
Vingt tâches ont changé de résultat (réussite/échec) entre les exécutions, ce qui a également modifié la durée de travail de ces agents et rendu leurs comptes de jetons peu comparables. Nous excluons ces 20 tâches, laissant les 69 dont le résultat est resté le même, puis comparons les deux médianes indépendantes : 509 498 jetons d'entrée avec le prompt long contre 346 409 avec le prompt court. Soit 32 % de moins. Il s'agit d'un sous-ensemble délibérément sélectionné, pas d'une estimation du coût de l'ensemble de la suite.

Les totaux agrégés de jetons d'entrée sur l'ensemble des 89 tâches sont presque plats, et il faut être honnête à ce sujet : l'historique de la conversation domine l'utilisation des jetons, et quelques tâches où l'exécution avec le prompt court a pris un chemin de solution plus long écrasent les économies par requête dans la somme. Le coût d'exécution a également changé légèrement, passant de 4,25 à 4,18.
Ce que nous avons surveillé et n'avons pas trouvé : une rupture de capacité. Vingt tâches ont inversé leurs résultats entre les exécutions – 11 nouvellement réussies, 9 nouvellement échouées – mais cette variation est caractéristique de la variance à une seule tentative sur ce benchmark, pas un modèle. Aucune catégorie de tâche ne s'est effondrée.
Ce que cette expérience ne prouve pas
C'était :
- Un modèle
- Un benchmark
- Une tentative par tâche
Le résultat de 32 % de jetons provient d'un sous-ensemble sélectionné de résultats identiques. Le degré de variation des tâches entre les exécutions démontre également pourquoi la validation à plusieurs tentatives est importante.
Avec un niveau de bruit estimé à environ ±5 points de pourcentage, une petite régression pourrait encore se cacher dans ces résultats. Nous effectuerions une évaluation à plusieurs tentatives avant de modifier la valeur par défaut pour tout le monde.
La conclusion
Pour ce modèle, sur ce benchmark, nous avons réduit le prompt d'environ la moitié et n'avons rien mesuré de pire.
Parmi les 69 tâches dont le résultat est resté identique, le nombre médian de jetons d'entrée de l'exécution avec le prompt court était inférieur d'environ un tiers.
Le résultat correspond à la direction qu'Anthropic a observée un cran au-dessus :
Quand une nouvelle génération de modèle arrive, votre premier geste ne devrait pas être d'ajouter au prompt. Il devrait être de supprimer.
Quelle partie de votre prompt système est encore là parce qu'un modèle d'il y a deux générations en avait besoin ?





