Anthropic เพิ่ง ลบ system prompt ของ Claude Code ออกไปประมาณ 80% สำหรับโมเดลรุ่นใหม่ล่าสุด
เหตุผลนั้นเข้าใจได้ไม่ยาก: ยิ่งโมเดลฉลาดขึ้นเท่าไหร่ พวกมันก็ยิ่งต้องการคำแนะนำ ข้อจำกัด และตัวอย่างน้อยลง เมื่อถึงระดับความสามารถหนึ่ง ตัวอย่างจะหยุดช่วยเหลือและเริ่มจำกัดกรอบการทำงานของโมเดล
เราเชื่อว่าการตัดสินใจของ Anthropic มีข้อมูลสนับสนุน — แต่หลักฐานนั้นใช้ได้กับ โมเดลรุ่นล่าสุดเท่านั้น
คำถามต่อมาที่ชัดเจนคือ: มันใช้ได้กับโมเดลยอดนิยมที่ใช้งานทั่วไปอย่าง Deep Seek v4 หรือไม่?
โมเดลขนาดเล็ก เร็ว ราคาถูก เป็นโมเดลที่คุณคาดหวังว่าจะต้องพึ่งพาคำแนะนำแบบละเอียด ถ้าตัด prompt ของพวกมันลงครึ่งหนึ่ง ตามภูมิปัญญาทั่วไปแล้ว พวกมันควรจะล้มเหลว
เราทำการทดลองนี้ให้คุณแล้ว เพื่อที่คุณจะได้ไม่ต้องทำเอง
การตั้งค่า
เอเจนต์เขียนโค้ดของเรา Ante มีโหมด --short-prompt
มันรวม system prompt จากประมาณ 5,000 ตัวอักษรเหลือ 2,300 ตัวอักษร และย่อคำอธิบายเครื่องมือ โดยรวมแล้ว การเปลี่ยนแปลงเหล่านี้ลด prompt ต่อคำขอทั้งหมดจากประมาณ 34,000 ตัวอักษรเหลือ 18,000 ตัวอักษร
เรา A/B ทดสอบสองเวอร์ชันบน:
- งาน: ชุดงาน 89 งานของ Terminal-Bench 2.1
- โมเดล: DeepSeek V4 Flash
- จำนวนครั้งที่ลอง: หนึ่งครั้งต่องาน
- ตัวแปรที่เปลี่ยน: แฟล็ก CLI หนึ่งตัว
ทุกอย่างอื่นคงที่: บิลด์เอเจนต์เดียวกัน, digest ของชุดข้อมูลที่ตรึงไว้, พูล sandbox, ระดับความพยายาม และแฟล็ก runtime
ผลลัพธ์

ประสิทธิภาพ: เท่าเทียมกัน prompt สั้นทำคะแนนสูงกว่า +2.3 จุด แต่ด้วยการลองหนึ่งครั้งต่องาน ค่านี้อยู่ในช่วงความผันผวน
Input tokens: ลดลง 32% ในกลุ่มย่อยที่ผลลัพธ์เหมือนกัน
งาน 20 งานเปลี่ยนผลลัพธ์ผ่าน/ไม่ผ่านระหว่างการรัน ซึ่งเปลี่ยนระยะเวลาที่เอเจนต์ทำงานและทำให้การเปรียบเทียบจำนวน token ตรงไปตรงมาไม่ได้ เราจึงไม่รวม 20 งานนั้น เหลือ 69 งานที่ผลลัพธ์เหมือนกัน จากนั้นเปรียบเทียบค่ามัธยฐานอิสระสองค่า: 509,498 input tokens กับ prompt ยาว และ 346,409 กับ prompt สั้น ซึ่งต่ำกว่า 32% นี่เป็นกลุ่มย่อยที่เลือกมาโดยเจตนา ไม่ใช่การประมาณต้นทุนทั้งชุด

ยอดรวม input token ในทุก 89 งานเกือบเท่าเดิม และนั่นเป็นสิ่งที่ควรพูดตามตรง: ประวัติการสนทนาครองการใช้งาน input และงานสองสามงานที่การรันด้วย prompt สั้นใช้เส้นทางแก้ปัญหาที่ยาวกว่า ทำให้การประหยัดต่อคำขอถูกกลบในผลรวม ค่าใช้จ่ายในการรันก็เปลี่ยนเพียงเล็กน้อย จาก 4.25 to 4.18
สิ่งที่เรามองหาแต่ไม่พบ: จุดตกของความสามารถ งาน 20 งานเปลี่ยนผลลัพธ์ระหว่างการรัน — 11 งานผ่านใหม่ 9 งานล้มเหลวใหม่ — แต่การเปลี่ยนแปลงนั้นเป็นลักษณะความแปรปรวนของการลองครั้งเดียวบน benchmark นี้ ไม่ใช่รูปแบบที่ชัดเจน ไม่มีหมวดหมู่งานใดพังทลาย
สิ่งที่การทดลองนี้ไม่ได้พิสูจน์
นี่คือ:
- โมเดลเดียว
- benchmark เดียว
- หนึ่งครั้งต่องาน
ผล token 32% มาจากกลุ่มย่อยที่ผลลัพธ์เหมือนกันที่เลือกมา จำนวนงานที่เปลี่ยนระหว่างการรันยังแสดงให้เห็นว่าทำไมการตรวจสอบหลายครั้งจึงสำคัญ
ด้วยระดับความผันผวนโดยประมาณที่ ±5 เปอร์เซ็นต์ การถดถอยเล็กน้อยอาจยังซ่อนอยู่ในผลลัพธ์เหล่านี้ เราจะทำการประเมินหลายครั้งก่อนที่จะเปลี่ยนค่าเริ่มต้นสำหรับทุกคน
ข้อสรุป
สำหรับโมเดลนี้ บน benchmark นี้ เราตัด prompt ลงประมาณครึ่งหนึ่งและไม่พบอะไรที่แย่ลง
ใน 69 งานที่ผลลัพธ์เหมือนกัน ค่ามัธยฐานของ input token ในการรันด้วย prompt สั้นต่ำกว่าประมาณหนึ่งในสาม
ผลลัพธ์สอดคล้องกับทิศทางที่ Anthropic สังเกตเห็นในระดับที่สูงกว่า:
เมื่อโมเดลเจเนอเรชันใหม่มาถึง สิ่งแรกที่คุณควรทำไม่ใช่การเพิ่ม prompt แต่ควรเป็นการลบ
system prompt ของคุณยังมีส่วนที่ถูกเก็บไว้เพราะโมเดลจากสองเจเนอเรชันที่แล้วเคยต้องการมันมากน้อยแค่ไหน?





