Claude Code, Sistem İstemlerini %80 Oranında Azalttı. Bu Küçük Modeller İçin de İşe Yarar mı?

@antigma_labs
İNGILIZCE2 gün önce · 26 Tem 2026
230K
15
2
0
2

TL;DR

DeepSeek V4 Flash üzerinde yapılan istem azaltma testi, küçük modellerin her zaman kapsamlı yönlendirmelere ihtiyaç duymadığını ve çok daha kısa istemlerle performans eşitliği sağlayabildiğini ortaya koyuyor.

Anthropic, en yeni modelleri için Claude Code'un sistem bilgi isteminin yaklaşık %80'ini kaldırdı.

Bu kararın mantığı sezgisel: modeller daha akıllı hale geldikçe daha az yönergeye, daha az kısıtlamaya ve daha az örneğe ihtiyaç duyarlar. Belli bir yetenek seviyesinin ötesinde, örnekler yardımcı olmayı bırakır ve modeli sınırlamaya başlar.

Anthropic'in kararının verilerle desteklendiğine inanıyoruz, ancak bu kanıt yalnızca en yeni modelleri için geçerli.

Akla gelen bariz soru şu: Bu durum, Deep Seek v4 gibi sıradan, popüler ve çalışkan modellerde de işe yarıyor mu?

Küçük, hızlı ve ucuz modeller, tam da ayrıntılı rehberliğe bağımlı olmasını beklediğiniz modellerdir. Bilgi istemlerini yarıya indirin ve geleneksel bilgelik, çökmeleri gerektiğini söyler.

Bu deneyi sizin yapmanıza gerek kalmasın diye biz yaptık.

Kurulum

Kodlama ajanımız Ante, bir --short-prompt (kısa bilgi istemi) modu içerir.

Bu mod, sistem bilgi istemini yaklaşık 5.000 karakterden 2.300 karaktere düşürür ve araç açıklamalarını kısaltır. Bu değişiklikler birlikte, istek başına düşen tam bilgi istemini yaklaşık 34.000 karakterden 18.000 karaktere indirir.

İki sürümü A/B testine tabi tuttuk:

  • Görevler: Terminal-Bench 2.1 eksiksiz 89 görev paketi
  • Model: DeepSeek V4 Flash
  • Deneme sayısı: Görev başına bir
  • Değiştirilen değişken: Bir CLI bayrağı

Diğer her şey sabit kaldı: aynı ajan yapısı, sabitlenmiş veri kümesi özeti, sanal alan havuzu, çaba seviyesi ve çalışma zamanı bayrakları.

Sonuç

Antigma - inline image

Performans: eşitlik. Kısa bilgi istemi aslında +2,3 puan daha yüksek puan aldı, ancak görev başına bir denemeyle bu, gürültü tabanı içinde kalıyor.

Giriş token'ları: aynı sonuç alt kümesinde %32 daha düşük.

Yirmi görev, çalıştırmalar arasında başarılı/başarısız sonucunu değiştirdi, bu da bu ajanların ne kadar süre çalıştığını etkiledi ve token sayılarını birebir karşılaştırma için zayıf hale getirdi. Bu 20 görevi hariç tuttuk, sonucu aynı kalan 69 görevi bıraktık ve ardından iki bağımsız medyanı karşılaştırdık: uzun bilgi istemiyle 509.498 giriş token'ına karşı kısa bilgi istemiyle 346.409 giriş token'ı. Bu %32 daha düşük. Bu, bilinçli olarak seçilmiş bir alt kümedir, tüm paket için bir maliyet tahmini değildir.

Antigma - inline image

Tüm 89 görevdeki toplam giriş token'ı toplamları neredeyse aynıdır ve bu konuda dürüst olmakta fayda var: konuşma geçmişi, giriş kullanımına hakimdir ve kısa bilgi istemi çalıştırmasının daha uzun bir çözüm yolu izlediği birkaç görev, toplamda istek başına tasarrufu silip süpürür. Çalıştırma maliyeti de 4,25$'dan 4,18$'a sadece hafifçe değişti.

Aradığımız ve bulamadığımız şey: bir yetenek uçurumu. Yirmi görev, çalıştırmalar arasında sonuç değiştirdi — 11 yeni başarılı, 9 yeni başarısız — ancak bu dalgalanma, bu kıyaslamada karakteristik tek denemelik varyanstır, bir desen değil. Hiçbir görev kategorisi çökmedi.

Bu deneyin kanıtlamadığı şeyler

Bu şunlardı:

  • Tek bir model
  • Tek bir kıyaslama
  • Görev başına tek bir deneme

%32'lik token sonucu, seçilmiş bir aynı-sonuç alt kümesinden gelmektedir. Çalıştırmalar arasındaki görev dalgalanmasının miktarı, çoklu deneme doğrulamasının neden önemli olduğunu da göstermektedir.

Yaklaşık ±5 yüzde puanlık tahmini bir gürültü tabanıyla, bu sonuçlarda hala küçük bir gerileme gizleniyor olabilir. Herkes için varsayılanı değiştirmeden önce çoklu denemeli bir değerlendirme yapardık.

Çıkarılacak ders

Bu model için, bu kıyaslamada, bilgi istemini kabaca yarıya indirdik ve daha kötü bir şey ölçmedik.

Sonucu aynı kalan 69 görev arasında, kısa bilgi istemi çalıştırmasının medyan giriş token'ı sayısı yaklaşık üçte bir oranında daha düşüktü.

Sonuç, Anthropic'in bir seviye yukarıda gözlemlediği yönle eşleşiyor:

Yeni bir model nesli geldiğinde, ilk hamleniz bilgi istemine bir şey eklemek olmamalıdır. İlk hamleniz silmek olmalıdır.

Sistem bilgi isteminizin ne kadarı, hala iki nesil önceki bir modelin bir zamanlar buna ihtiyaç duyması nedeniyle duruyor?

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet