O Claude Code reduziu seu prompt de sistema em 80%. Isso também funciona para modelos pequenos?

@antigma_labs
INGLÊShá 2 dias · 26/07/2026
230K
15
2
0
2

TL;DR

Testar a redução de prompts no DeepSeek V4 Flash revela que modelos menores nem sempre precisam de instruções extensas, alcançando paridade de desempenho com prompts muito mais curtos.

Anthropic recentemente removeu cerca de 80% do prompt de sistema do Claude Code para seus modelos mais recentes.

A lógica é intuitiva: conforme os modelos ficam mais inteligentes, eles precisam de menos direcionamento, menos restrições e menos exemplos. A partir de um certo nível de capacidade, os exemplos deixam de ajudar e começam a limitar o modelo.

Acreditamos que a decisão da Anthropic é baseada em dados — mas essa evidência se aplica apenas aos seus modelos mais recentes.

A pergunta óbvia que surge é: isso funciona em um modelo de trabalho popular e comum como o Deep Seek v4?

Modelos pequenos, rápidos e baratos são exatamente aqueles que você esperaria que dependessem de instruções detalhadas. Corte o prompt deles pela metade, e o senso comum diz que eles devem falhar.

Fizemos o experimento para que você não precise.

A configuração

Nosso agente de codificação, Ante, inclui um modo --short-prompt.

Ele consolida o prompt de sistema de aproximadamente 5.000 para 2.300 caracteres e encurta as descrições das ferramentas. Juntas, essas mudanças reduzem o prompt completo por requisição de aproximadamente 34.000 para 18.000 caracteres.

Fizemos um teste A/B das duas versões em:

  • Tarefas: Conjunto completo de 89 tarefas do Terminal-Bench 2.1
  • Modelo: DeepSeek V4 Flash
  • Tentativas: Uma por tarefa
  • Variável alterada: Um sinalizador de CLI

Todo o resto permaneceu constante: a mesma versão do agente, o resumo do conjunto de dados fixo, o pool de sandbox, o nível de esforço e os sinalizadores de tempo de execução.

O resultado

Antigma - inline image

Desempenho: paridade. O prompt curto na verdade pontuou +2,3 pontos a mais, mas com uma tentativa por tarefa, isso está dentro da margem de ruído.

Tokens de entrada: 32% menores no subconjunto de mesmo resultado.

Vinte tarefas mudaram o resultado (passou/falhou) entre as execuções, o que também alterou o tempo de trabalho desses agentes e tornou suas contagens de tokens comparações inadequadas. Excluímos essas 20 tarefas, deixando as 69 cujo resultado permaneceu o mesmo, e então comparamos as duas medianas independentes: 509.498 tokens de entrada com o prompt longo contra 346.409 com o prompt curto. Isso é 32% menor. Este é um subconjunto deliberadamente selecionado, não uma estimativa de custo para todo o conjunto.

Antigma - inline image

Os totais agregados de tokens de entrada em todas as 89 tarefas são quase estáveis, e vale a pena ser honesto sobre isso: o histórico da conversa domina o uso de entrada, e algumas tarefas onde a execução com prompt curto seguiu um caminho de solução mais longo ofuscam a economia por requisição na soma. O custo de execução também mudou apenas ligeiramente, de US$ 4,25 para US$ 4,18.

O que procuramos e não encontramos: um precipício de capacidade. Vinte tarefas mudaram de resultado entre as execuções — 11 recém-aprovadas, 9 recém-reprovadas — mas essa variação é característica da variância de tentativa única neste benchmark, não um padrão. Nenhuma categoria de tarefa colapsou.

O que este experimento não prova

Isto foi:

  • Um modelo
  • Um benchmark
  • Uma tentativa por tarefa

O resultado de 32% nos tokens vem de um subconjunto selecionado de mesmo resultado. A quantidade de variação de tarefas entre as execuções também demonstra por que a validação com múltiplas tentativas é importante.

Com uma margem de ruído estimada de aproximadamente ±5 pontos percentuais, uma pequena regressão ainda pode estar escondida nesses resultados. Faríamos uma avaliação com múltiplas tentativas antes de alterar o padrão para todos.

A conclusão

Para este modelo, neste benchmark, cortamos o prompt aproximadamente pela metade e não medimos nada pior.

Entre as 69 tarefas cujo resultado permaneceu o mesmo, a mediana da contagem de tokens de entrada da execução com prompt curto foi aproximadamente um terço menor.

O resultado corresponde à direção que a Anthropic observou um nível acima:

Quando uma nova geração de modelos chega, seu primeiro movimento não deve ser adicionar ao prompt. Deve ser deletar.

Quanto do seu prompt de sistema ainda está lá porque um modelo de duas gerações atrás precisou dele?

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais