Anthropic gần đây đã loại bỏ khoảng 80% system prompt của Claude Code cho các mô hình mới nhất của họ.
Lý do rất trực quan: khi các mô hình ngày càng thông minh, chúng cần ít chỉ dẫn hơn, ít ràng buộc hơn và ít ví dụ hơn. Vượt qua một mức năng lực nhất định, các ví dụ không còn hữu ích nữa mà bắt đầu giới hạn mô hình.
Chúng tôi tin rằng quyết định của Anthropic được hỗ trợ bởi dữ liệu — nhưng bằng chứng đó chỉ áp dụng cho các mô hình mới nhất của họ.
Câu hỏi tiếp theo hiển nhiên là: liệu điều này có hiệu quả trên mô hình phổ biến thông thường như Deep Seek v4 không?
Các mô hình nhỏ, nhanh, giá rẻ chính là những mô hình mà bạn thường kỳ vọng sẽ phụ thuộc vào sự hướng dẫn chi tiết. Cắt giảm prompt của chúng xuống một nửa, và theo lẽ thường, chúng sẽ gặp vấn đề.
Chúng tôi đã chạy thử nghiệm để bạn không phải làm điều đó.
Thiết lập
Coding agent của chúng tôi, Ante, bao gồm chế độ --short-prompt.
Nó hợp nhất system prompt từ khoảng 5.000 ký tự xuống còn 2.300 ký tự và rút ngắn các mô tả công cụ. Cùng nhau, những thay đổi này giảm prompt hoàn chỉnh cho mỗi yêu cầu từ khoảng 34.000 xuống 18.000 ký tự.
Chúng tôi đã thử nghiệm A/B hai phiên bản trên:
- Nhiệm vụ: Bộ 89 tác vụ hoàn chỉnh của Terminal-Bench 2.1
- Mô hình: DeepSeek V4 Flash
- Số lần thử: Một lần cho mỗi tác vụ
- Biến thay đổi: Một cờ CLI
Mọi thứ khác đều không đổi: cùng một bản build agent, digest dataset cố định, pool sandbox, mức độ nỗ lực và các cờ runtime.
Kết quả

Hiệu suất: ngang bằng. Thực tế, short prompt đã đạt điểm cao hơn 2,3 điểm, nhưng với một lần thử cho mỗi tác vụ, điều đó nằm trong mức nhiễu.
Token đầu vào: thấp hơn 32% trong tập con có cùng kết quả.
20 tác vụ đã thay đổi kết quả đậu/rớt giữa các lần chạy, điều này cũng thay đổi thời gian làm việc của các agent và khiến số lượng token của chúng khó so sánh công bằng. Chúng tôi loại trừ 20 tác vụ đó, giữ lại 69 tác vụ có kết quả không thay đổi, sau đó so sánh hai giá trị trung vị độc lập: 509.498 token đầu vào với long prompt so với 346.409 với short prompt. Đó là thấp hơn 32%. Đây là một tập con được chọn có chủ đích, không phải ước tính chi phí cho toàn bộ bộ.

Tổng số token đầu vào gộp trên tất cả 89 tác vụ gần như không đổi, và điều đó đáng để thành thật: lịch sử hội thoại chiếm ưu thế trong việc sử dụng đầu vào, và một vài tác vụ mà lần chạy short prompt mất đường dẫn giải pháp dài hơn đã lấn át khoản tiết kiệm trên mỗi yêu cầu trong tổng số. Chi phí chạy cũng chỉ thay đổi nhẹ, từ $4,25 đến $4,18.
Điều chúng tôi đã theo dõi và không tìm thấy: một vách đá năng lực. 20 tác vụ đã đảo ngược kết quả giữa các lần chạy — 11 tác vụ mới đậu, 9 tác vụ mới rớt — nhưng sự thay đổi đó là đặc trưng của phương sai một lần thử trên benchmark này, không phải một mô hình. Không có danh mục tác vụ nào sụp đổ.
Điều thử nghiệm này không chứng minh
Đây là:
- Một mô hình
- Một benchmark
- Một lần thử cho mỗi tác vụ
Kết quả token 32% đến từ một tập con có cùng kết quả được chọn. Số lượng tác vụ thay đổi giữa các lần chạy cũng cho thấy lý do tại sao việc xác thực nhiều lần thử lại quan trọng.
Với mức nhiễu ước tính khoảng ±5 điểm phần trăm, một sự suy giảm nhỏ vẫn có thể ẩn trong các kết quả này. Chúng tôi sẽ chạy đánh giá nhiều lần thử trước khi thay đổi mặc định cho mọi người.
Kết luận
Đối với mô hình này, trên benchmark này, chúng tôi đã cắt prompt khoảng một nửa và không đo được điều gì tồi tệ hơn.
Trong số 69 tác vụ có kết quả không thay đổi, số lượng token đầu vào trung vị của lần chạy short prompt thấp hơn khoảng một phần ba.
Kết quả phù hợp với hướng mà Anthropic đã quan sát ở một cấp độ cao hơn:
Khi một thế hệ mô hình mới ra mắt, bước đầu tiên của bạn không nên là thêm vào prompt. Mà nên là xóa bỏ.
Bao nhiêu phần trong system prompt của bạn vẫn còn ở đó vì một mô hình từ hai thế hệ trước đã từng cần nó?





