Claude Code скоротили свій системний промпт на 80%. Чи працює це для малих моделей?

@antigma_labs
АНГЛІЙСЬКА2 дні тому · 26 лип. 2026 р.
230K
15
2
0
2

Коротко

Тестування скорочення промптів на DeepSeek V4 Flash показує, що менші моделі не завжди потребують детальних інструкцій, досягаючи паритету продуктивності з набагато коротшими промптами.

Anthropic нещодавно вилучив приблизно 80% системного промпту Claude Code для своїх новітніх моделей.

Логіка інтуїтивно зрозуміла: чим розумнішими стають моделі, тим менше їм потрібно вказівок, обмежень і прикладів. Після певного рівня можливостей приклади перестають допомагати й починають обмежувати модель.

Ми віримо, що рішення Anthropic підкріплене даними — але ці докази стосуються лише їхніх новітніх моделей.

Очевидне наступне питання: чи працює це на звичайній популярній робочій конячці, як-от Deep Seek v4?

Невеликі, швидкі, недорогі моделі — саме ті, які, як очікується, потребують детального наставництва. Скоротіть їхній промпт удвічі, і традиційна мудрість каже, що вони мають впасти.

Ми провели експеримент, щоб вам не довелося цього робити.

Налаштування

Наш кодуючий агент Ante має режим --short-prompt.

Він скорочує системний промпт приблизно з 5 000 до 2 300 символів і зменшує описи інструментів. Разом ці зміни зменшують повний промпт на запит приблизно з 34 000 до 18 000 символів.

Ми провели A/B-тестування двох версій на:

  • Завдання: Terminal-Bench 2.1, повний набір із 89 завдань
  • Модель: DeepSeek V4 Flash
  • Спроби: Одна на завдання
  • Змінна, що змінювалася: Один прапорець CLI

Решта залишилася незмінною: та сама збірка агента, фіксований дайджест набору даних, пул пісочниці, рівень зусиль та прапорці середовища виконання.

Результат

Antigma - inline image

Продуктивність: паритет. Короткий промпт фактично набрав на +2,3 бала більше, але при одній спробі на завдання це в межах шумового порогу.

Вхідні токени: на 32% нижче в підмножині з однаковим результатом.

Двадцять завдань змінили результат проходження/непроходження між запусками, що також змінило час роботи агентів і зробило порівняння кількості токенів некоректним. Ми виключаємо ці 20 завдань, залишаючи 69, чий результат залишився незмінним, а потім порівнюємо дві незалежні медіани: 509 498 вхідних токенів з довгим промптом проти 346 409 з коротким. Це на 32% нижче. Це цілеспрямовано обрана підмножина, а не оцінка вартості всього набору.

Antigma - inline image

Загальна кількість вхідних токенів за всіма 89 завданнями майже не змінилася, і про це варто чесно сказати: історія розмови домінує у використанні вхідних токенів, а кілька завдань, де запуск з коротким промптом пішов довшим шляхом, нівелюють економію на запит у загальній сумі. Вартість запуску також змінилася незначно: з $4,25 до $4,18.

На що ми звертали увагу і чого не знайшли: обриву можливостей. Двадцять завдань змінили результат між запусками — 11 нових пройдених, 9 нових непройдених — але така зміна є характерною варіативністю одноразових спроб на цьому бенчмарку, а не закономірністю. Жодна категорія завдань не зазнала краху.

Чого цей експеримент не доводить

Це було:

  • Одна модель
  • Один бенчмарк
  • Одна спроба на завдання

Результат у 32% токенів походить із вибраної підмножини з однаковим результатом. Обсяг змін завдань між запусками також демонструє, чому важлива багаторазова перевірка.

Враховуючи оціночний шумовий поріг приблизно ±5 відсоткових пунктів, невелика регресія все ще може ховатися в цих результатах. Ми б провели багаторазову оцінку перед тим, як змінювати стандартні налаштування для всіх.

Висновок

Для цієї моделі на цьому бенчмарку ми скоротили промпт приблизно вдвічі і не виявили жодного погіршення.

Серед 69 завдань, чий результат залишився незмінним, медіанна кількість вхідних токенів у запуску з коротким промптом була приблизно на третину нижчою.

Результат збігається з напрямком, який Anthropic спостеріг на один рівень вище:

Коли з'являється нове покоління моделей, ваш перший крок має бути не додавання до промпту, а видалення.

Скільки вашого системного промпту все ще існує лише тому, що це колись було потрібно моделі з двох поколінь тому?

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей