Anthropic recientemente eliminó aproximadamente el 80% del prompt del sistema de Claude Code para sus modelos más nuevos.
El razonamiento es intuitivo: a medida que los modelos se vuelven más inteligentes, necesitan menos dirección, menos restricciones y menos ejemplos. Más allá de cierto nivel de capacidad, los ejemplos dejan de ayudar y empiezan a limitar al modelo.
Creemos que la decisión de Anthropic está respaldada por datos, pero esa evidencia aplica solo a sus modelos más recientes.
La pregunta obvia que sigue es: ¿funciona en un modelo de trabajo común y popular como Deep Seek v4?
Los modelos pequeños, rápidos y económicos son exactamente aquellos de los que esperarías que dependieran de una guía detallada. Si reduces su prompt a la mitad, la sabiduría convencional dice que deberían fracasar.
Realizamos el experimento para que tú no tengas que hacerlo.
La configuración
Nuestro agente de codificación, Ante, incluye un modo --short-prompt.
Consolida el prompt del sistema de aproximadamente 5,000 a 2,300 caracteres y acorta las descripciones de las herramientas. En conjunto, esos cambios reducen el prompt completo por solicitud de aproximadamente 34,000 a 18,000 caracteres.
Probamos A/B las dos versiones en:
- Tareas: Terminal-Bench 2.1 suite completa de 89 tareas
- Modelo: DeepSeek V4 Flash
- Intentos: Uno por tarea
- Variable cambiada: Un flag de CLI
Todo lo demás permaneció constante: la misma compilación del agente, el resumen del conjunto de datos fijado, el grupo de sandbox, el nivel de esfuerzo y los flags de ejecución.
El resultado

Rendimiento: paridad. El prompt corto en realidad obtuvo +2.3 puntos más, pero con un intento por tarea, eso está dentro del margen de ruido.
Tokens de entrada: 32% menos en el subconjunto de mismo resultado.
Veinte tareas cambiaron su resultado de aprobado/fallido entre ejecuciones, lo que también cambió cuánto tiempo trabajaron esos agentes y dificultó las comparaciones equiparables de tokens. Excluimos esas 20 tareas, dejando las 69 cuyo resultado se mantuvo igual, luego comparamos las dos medianas independientes: 509,498 tokens de entrada con el prompt largo frente a 346,409 con el prompt corto. Eso es un 32% menos. Este es un subconjunto deliberadamente seleccionado, no una estimación de costo de toda la suite.

Los totales agregados de tokens de entrada en las 89 tareas son casi planos, y vale la pena ser honestos al respecto: el historial de conversación domina el uso de entrada, y algunas tareas donde la ejecución con prompt corto tomó un camino de solución más largo eclipsan los ahorros por solicitud en la suma. El costo de ejecución también cambió solo ligeramente, de $4.25 a $4.18.
Lo que observamos y no encontramos: un precipicio de capacidad. Veinte tareas cambiaron de resultado entre las ejecuciones — 11 nuevas aprobadas, 9 nuevas fallidas — pero esa rotación es característica de la varianza de un solo intento en este punto de referencia, no un patrón. No colapsó ninguna categoría de tarea.
Lo que este experimento no demuestra
Esto fue:
- Un modelo
- Un punto de referencia
- Un intento por tarea
El resultado del 32% de tokens proviene de un subconjunto seleccionado de mismo resultado. La cantidad de cambios de tareas entre ejecuciones también demuestra por qué es importante la validación con múltiples intentos.
Con un margen de ruido estimado de aproximadamente ±5 puntos porcentuales, aún podría esconderse una pequeña regresión en estos resultados. Realizaríamos una evaluación con múltiples intentos antes de cambiar el valor predeterminado para todos.
La conclusión
Para este modelo, en este punto de referencia, redujimos el prompt aproximadamente a la mitad y no medimos nada peor.
Entre las 69 tareas cuyo resultado se mantuvo igual, la mediana de tokens de entrada de la ejecución con prompt corto fue aproximadamente un tercio menor.
El resultado coincide con la dirección que Anthropic observó un nivel arriba:
Cuando llega una nueva generación de modelos, tu primer movimiento no debería ser agregar al prompt. Debería ser eliminar.
¿Cuánto de tu prompt del sistema sigue ahí porque un modelo de hace dos generaciones alguna vez lo necesitó?





