Claude Code 将系统提示词缩减了 80%。这对小型模型也适用吗?

@antigma_labs
英语2天前 · 2026年7月26日
230K
15
2
0
2

TL;DR

针对 DeepSeek V4 Flash 进行的提示词缩减测试表明,小型模型并不总是需要冗长的引导,使用更短的提示词也能达到同等的性能表现。

Anthropic 最近删除了 Claude Code 约 80% 的系统提示词,适用于其最新模型。

这个思路很直观:随着模型变得更强,它们需要的指令、约束和示例就更少。超过某个能力阈值后,示例非但不再有帮助,反而会限制模型的表现。

我们相信 Anthropic 的决策有数据支撑——但这一证据 仅适用于其最新模型

随之而来的问题是:这种策略对像 DeepSeek v4 这样的主流主力模型是否同样有效?

小巧、快速、成本低廉的模型正是那种需要详细指导的类型。按常理来说,如果把它们提示词砍掉一半,表现应该会大幅下滑。

我们替你做了这个实验,你就不用自己动手了。

实验设置

我们的编码 Agent Ante 包含了一个 --short-prompt 模式。

它将系统提示词从约 5,000 个字符压缩到 2,300 个字符,并缩短了工具描述。这些改动共同将每个请求的完整提示词从约 34,000 个字符减少到 18,000 个字符。

我们对两个版本进行了 A/B 测试:

  • 任务: Terminal-Bench 2.1 完整 89 个任务集
  • 模型: DeepSeek V4 Flash
  • 尝试次数: 每个任务一次
  • 变更变量: 一个 CLI 标志

其他所有条件保持不变:相同的 Agent 构建、固定的数据集摘要、沙盒池、投入水平以及运行时标志。

实验结果

Antigma - inline image

性能: 两者持平。短提示词版本实际上得分高出 2.3 分,但每个任务只尝试一次,这属于正常波动范围内。

输入 Token:在结果相同的子集中降低了 32%。

有 20 个任务在两次运行中通过/失败的结果发生了变化,这也改变了这些 Agent 的工作时长,使得它们的 Token 计数无法进行同类比较。我们排除了这 20 个任务,保留 69 个结果保持不变的,然后比较两个独立的中位数:长提示词版本为 509,498 个输入 Token,短提示词版本为 346,409 个。这降低了 32%。这是一个特意选择的子集,而非整个任务集的成本估算。

Antigma - inline image

所有 89 个任务的总输入 Token 数几乎持平,这点值得坦诚说明:对话历史占据了输入使用量的主导地位,而且少数几个短提示词运行采用了更长解决路径的任务,在总和中抵消了每次请求节省的 Token。运行成本也仅略有变化,从 4.25 美元变为 4.18 美元。

我们观察且未发现的问题: 能力断崖。有 20 个任务在两次运行中结果发生翻转——11 个新通过,9 个新失败——但这是该基准测试中单次尝试的典型波动,并非某种模式。没有任务类别出现崩溃。

这个实验不能证明什么

这只是:

  • 一个模型
  • 一个基准测试
  • 每个任务一次尝试

32% 的 Token 结果来自一个经过选择的相同结果子集。两次运行之间的任务结果变化也说明了多次尝试验证的重要性。

考虑到大约 ±5 个百分点的估算噪声水平,这些结果中可能仍隐藏着小幅性能下降。我们在改变所有人的默认设置之前,会进行多次尝试的评估。

结论

对于这个模型,在这个基准测试上,我们将提示词大约砍掉了一半,没有发现任何负面效果。

在结果保持不变的 69 个任务中,短提示词运行的中位输入 Token 数大约低了三分之一。

这个结果与 Anthropic 在更高一层模型上观察到的方向一致:

当新一代模型问世时,你的第一步不应该是往提示词里添加内容,而应该是删除内容。

你的系统提示词中,有多少内容还是因为两代前的模型曾经需要它而保留至今的?

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章