Anthropic 最近删除了 Claude Code 约 80% 的系统提示词,适用于其最新模型。
这个思路很直观:随着模型变得更强,它们需要的指令、约束和示例就更少。超过某个能力阈值后,示例非但不再有帮助,反而会限制模型的表现。
我们相信 Anthropic 的决策有数据支撑——但这一证据 仅适用于其最新模型。
随之而来的问题是:这种策略对像 DeepSeek v4 这样的主流主力模型是否同样有效?
小巧、快速、成本低廉的模型正是那种需要详细指导的类型。按常理来说,如果把它们提示词砍掉一半,表现应该会大幅下滑。
我们替你做了这个实验,你就不用自己动手了。
实验设置
我们的编码 Agent Ante 包含了一个 --short-prompt 模式。
它将系统提示词从约 5,000 个字符压缩到 2,300 个字符,并缩短了工具描述。这些改动共同将每个请求的完整提示词从约 34,000 个字符减少到 18,000 个字符。
我们对两个版本进行了 A/B 测试:
- 任务: Terminal-Bench 2.1 完整 89 个任务集
- 模型: DeepSeek V4 Flash
- 尝试次数: 每个任务一次
- 变更变量: 一个 CLI 标志
其他所有条件保持不变:相同的 Agent 构建、固定的数据集摘要、沙盒池、投入水平以及运行时标志。
实验结果

性能: 两者持平。短提示词版本实际上得分高出 2.3 分,但每个任务只尝试一次,这属于正常波动范围内。
输入 Token:在结果相同的子集中降低了 32%。
有 20 个任务在两次运行中通过/失败的结果发生了变化,这也改变了这些 Agent 的工作时长,使得它们的 Token 计数无法进行同类比较。我们排除了这 20 个任务,保留 69 个结果保持不变的,然后比较两个独立的中位数:长提示词版本为 509,498 个输入 Token,短提示词版本为 346,409 个。这降低了 32%。这是一个特意选择的子集,而非整个任务集的成本估算。

所有 89 个任务的总输入 Token 数几乎持平,这点值得坦诚说明:对话历史占据了输入使用量的主导地位,而且少数几个短提示词运行采用了更长解决路径的任务,在总和中抵消了每次请求节省的 Token。运行成本也仅略有变化,从 4.25 美元变为 4.18 美元。
我们观察且未发现的问题: 能力断崖。有 20 个任务在两次运行中结果发生翻转——11 个新通过,9 个新失败——但这是该基准测试中单次尝试的典型波动,并非某种模式。没有任务类别出现崩溃。
这个实验不能证明什么
这只是:
- 一个模型
- 一个基准测试
- 每个任务一次尝试
32% 的 Token 结果来自一个经过选择的相同结果子集。两次运行之间的任务结果变化也说明了多次尝试验证的重要性。
考虑到大约 ±5 个百分点的估算噪声水平,这些结果中可能仍隐藏着小幅性能下降。我们在改变所有人的默认设置之前,会进行多次尝试的评估。
结论
对于这个模型,在这个基准测试上,我们将提示词大约砍掉了一半,没有发现任何负面效果。
在结果保持不变的 69 个任务中,短提示词运行的中位输入 Token 数大约低了三分之一。
这个结果与 Anthropic 在更高一层模型上观察到的方向一致:
当新一代模型问世时,你的第一步不应该是往提示词里添加内容,而应该是删除内容。
你的系统提示词中,有多少内容还是因为两代前的模型曾经需要它而保留至今的?





