Anthropic нещодавно вилучив приблизно 80% системного промпту Claude Code для своїх новітніх моделей.
Логіка інтуїтивно зрозуміла: чим розумнішими стають моделі, тим менше їм потрібно вказівок, обмежень і прикладів. Після певного рівня можливостей приклади перестають допомагати й починають обмежувати модель.
Ми віримо, що рішення Anthropic підкріплене даними — але ці докази стосуються лише їхніх новітніх моделей.
Очевидне наступне питання: чи працює це на звичайній популярній робочій конячці, як-от Deep Seek v4?
Невеликі, швидкі, недорогі моделі — саме ті, які, як очікується, потребують детального наставництва. Скоротіть їхній промпт удвічі, і традиційна мудрість каже, що вони мають впасти.
Ми провели експеримент, щоб вам не довелося цього робити.
Налаштування
Наш кодуючий агент Ante має режим --short-prompt.
Він скорочує системний промпт приблизно з 5 000 до 2 300 символів і зменшує описи інструментів. Разом ці зміни зменшують повний промпт на запит приблизно з 34 000 до 18 000 символів.
Ми провели A/B-тестування двох версій на:
- Завдання: Terminal-Bench 2.1, повний набір із 89 завдань
- Модель: DeepSeek V4 Flash
- Спроби: Одна на завдання
- Змінна, що змінювалася: Один прапорець CLI
Решта залишилася незмінною: та сама збірка агента, фіксований дайджест набору даних, пул пісочниці, рівень зусиль та прапорці середовища виконання.
Результат

Продуктивність: паритет. Короткий промпт фактично набрав на +2,3 бала більше, але при одній спробі на завдання це в межах шумового порогу.
Вхідні токени: на 32% нижче в підмножині з однаковим результатом.
Двадцять завдань змінили результат проходження/непроходження між запусками, що також змінило час роботи агентів і зробило порівняння кількості токенів некоректним. Ми виключаємо ці 20 завдань, залишаючи 69, чий результат залишився незмінним, а потім порівнюємо дві незалежні медіани: 509 498 вхідних токенів з довгим промптом проти 346 409 з коротким. Це на 32% нижче. Це цілеспрямовано обрана підмножина, а не оцінка вартості всього набору.

Загальна кількість вхідних токенів за всіма 89 завданнями майже не змінилася, і про це варто чесно сказати: історія розмови домінує у використанні вхідних токенів, а кілька завдань, де запуск з коротким промптом пішов довшим шляхом, нівелюють економію на запит у загальній сумі. Вартість запуску також змінилася незначно: з $4,25 до $4,18.
На що ми звертали увагу і чого не знайшли: обриву можливостей. Двадцять завдань змінили результат між запусками — 11 нових пройдених, 9 нових непройдених — але така зміна є характерною варіативністю одноразових спроб на цьому бенчмарку, а не закономірністю. Жодна категорія завдань не зазнала краху.
Чого цей експеримент не доводить
Це було:
- Одна модель
- Один бенчмарк
- Одна спроба на завдання
Результат у 32% токенів походить із вибраної підмножини з однаковим результатом. Обсяг змін завдань між запусками також демонструє, чому важлива багаторазова перевірка.
Враховуючи оціночний шумовий поріг приблизно ±5 відсоткових пунктів, невелика регресія все ще може ховатися в цих результатах. Ми б провели багаторазову оцінку перед тим, як змінювати стандартні налаштування для всіх.
Висновок
Для цієї моделі на цьому бенчмарку ми скоротили промпт приблизно вдвічі і не виявили жодного погіршення.
Серед 69 завдань, чий результат залишився незмінним, медіанна кількість вхідних токенів у запуску з коротким промптом була приблизно на третину нижчою.
Результат збігається з напрямком, який Anthropic спостеріг на один рівень вище:
Коли з'являється нове покоління моделей, ваш перший крок має бути не додавання до промпту, а видалення.
Скільки вашого системного промпту все ще існує лише тому, що це колись було потрібно моделі з двох поколінь тому?





