Anthropic recientemente eliminó aproximadamente el 80 % del prompt de sistema de Claude Code para sus modelos más recientes.
El razonamiento es intuitivo: a medida que los modelos se vuelven más inteligentes, necesitan menos dirección, menos restricciones y menos ejemplos. Más allá de cierto nivel de capacidad, los ejemplos dejan de ayudar y comienzan a limitar al modelo.
Creemos que la decisión de Anthropic está respaldada por datos, pero esa evidencia aplica solo a sus modelos más recientes.
La pregunta obvia que surge es: ¿funciona en el modelo de trabajo popular y común como DeepSeek V4?
Los modelos pequeños, rápidos y económicos son exactamente aquellos de los que esperarías que dependan de una guía detallada. Si reduces su prompt a la mitad, la sabiduría convencional dice que deberían fallar.
Realizamos el experimento para que no tengas que hacerlo.
La configuración
Nuestro agente de codificación, Ante, incluye un modo --short-prompt.
Consolida el prompt de sistema de aproximadamente 5,000 a 2,300 caracteres y acorta las descripciones de herramientas. Juntos, esos cambios reducen el prompt completo por solicitud de aproximadamente 34,000 a 18,000 caracteres.
Probamos A/B las dos versiones en:
- Tareas: suite completa de 89 tareas de Terminal-Bench 2.1
- Modelo: DeepSeek V4 Flash
- Intentos: uno por tarea
- Variable cambiada: una bandera de CLI
Todo lo demás se mantuvo constante: la misma compilación del agente, el resumen del conjunto de datos fijado, el grupo de sandbox, el nivel de esfuerzo y las banderas de tiempo de ejecución.
El resultado

Rendimiento: paridad. El prompt corto en realidad obtuvo +2.3 puntos más, pero con un intento por tarea, eso está dentro del margen de ruido.
Tokens de entrada: 32 % más bajos en el subconjunto de mismo resultado.
Veinte tareas cambiaron el resultado de aprobado/fallido entre las ejecuciones, lo que también cambió cuánto tiempo trabajaron esos agentes e hizo que sus conteos de tokens fueran comparaciones pobres. Excluimos esas 20 tareas, dejando las 69 cuyo resultado se mantuvo igual, luego comparamos las dos medianas independientes: 509,498 tokens de entrada con el prompt largo frente a 346,409 con el prompt corto. Eso es un 32 % menos. Este es un subconjunto deliberadamente seleccionado, no una estimación de costo de todo el conjunto.

Los totales agregados de tokens de entrada en las 89 tareas son casi planos, y vale la pena ser honesto al respecto: el historial de conversación domina el uso de entrada, y algunas tareas donde la ejecución con prompt corto tomó un camino de solución más largo ahogan los ahorros por solicitud en la suma. El costo de ejecución también cambió solo ligeramente, de $4.25 a $4.18.
Lo que observamos y no encontramos: un precipicio de capacidad. Veinte tareas cambiaron de resultado entre las ejecuciones — 11 recién aprobadas, 9 recién fallidas — pero esa fluctuación es característica de la varianza de un solo intento en este benchmark, no un patrón. Ninguna categoría de tarea colapsó.
Lo que este experimento no prueba
Esto fue:
- Un modelo
- Un benchmark
- Un intento por tarea
El resultado del 32 % de tokens proviene de un subconjunto seleccionado de mismo resultado. La cantidad de cambio de tareas entre ejecuciones también demuestra por qué la validación con múltiples intentos es importante.
Con un margen de ruido estimado de aproximadamente ±5 puntos porcentuales, una pequeña regresión aún podría estar oculta en estos resultados. Ejecutaríamos una evaluación con múltiples intentos antes de cambiar el valor predeterminado para todos.
La conclusión
Para este modelo, en este benchmark, redujimos el prompt aproximadamente a la mitad y no medimos nada peor.
Entre las 69 tareas cuyo resultado se mantuvo igual, el conteo mediano de tokens de entrada de la ejecución con prompt corto fue aproximadamente un tercio más bajo.
El resultado coincide con la dirección que Anthropic observó un nivel arriba:
Cuando llega una nueva generación de modelo, tu primer movimiento no debería ser agregar al prompt. Debería ser eliminar.
¿Cuánto de tu prompt de sistema sigue ahí porque un modelo de hace dos generaciones alguna vez lo necesitó?





