Bir iş için en iyi model, neredeyse hiçbir zaman liderlik tablosundaki en iyi model değildir.
Yapay zeka dünyasında, Noel haftada bir kez gelir gibidir. Yeni bir model çıkar, herkes aynı yanıltıcı hassasiyetteki kıyaslama tablolarına bakar ve gelecek hafta aynı şeyi tekrar yapana kadar, hep birlikte bunun en iyi şey olduğu konusunda hemfikir oluruz.
Ancak bu tabloların hiçbiri önemli olan tek soruyu yanıtlamaz. Model, günlük brifinginizi gerçekten çalıştırabilir veya bir müşteriye teklif gönderebilir mi? Hyperagent'te, size tüm bu modellere, en iyi sınıf bir ajanın üzerinde erişim imkanı sunuyoruz. Bu yüzden onları kendimiz çalıştırdık. Müşterilerimizin her gün ajanlara emanet ettiği gerçek bilgi işleri üzerinde on dört model, kırk iki çalışma. Üç şey öne çıktı.
- Fatura, aynı iş için 50 kata kadar değişti. Aynı test bataryası Qwen 3.7 Plus'ta 1,48$'a, Fable 5'te ise 75,16$'a mal oldu.
- Kıyaslama kazananı, iş kazananı değildi. GPT 5.6 Sol, temel testlerimizde zirvedeydi ancak Hyperagent içinde gerçek işleri çalıştırmaya başladığında ilk üçe giremedi. Grok 4.5, temel testlerde orta sıralardayken bitmiş iş, hız ve maliyet açısından birinci oldu.
- Ve hiçbir model her şeyi kazanmadı. Doğru seçim, işe göre değişti.
Çıkarım, yeni bir favori model değil. İşten işe hangisinin maliyetini hak ettiğine karar vermenin bir yolu.
Bilgi işleri için yapay zeka model haritası
Bir ajana vereceğiniz her iş iki soruya indirgenebilir: Ne kadar muhakeme gerektiriyor ve ne sıklıkta çalışıyor? Bu iki ekseni çizdiğinizde, bilgi işleri her biri farklı bir model türü isteyen dört bölgeye ayrılır.

Hacim işleri (sol üst). Triyaj, izleme, yönlendirme, veri senkronizasyonu. Net prosedür, sürekli çalışır ve bir hata düzeltmesi ucuzdur. Bu iş, hızlı ve ucuz bir şey ister.
Günlük zanaat (sağ üst). Taslak hazırlama, raporlama, araştırma, müşteri iletişimi. Haftanın çoğunu dolduran yinelenen bilgi işleri - gerçek sentez ve iyi bir yazma sesi gerektirir, güvenilir ve sık yapılır.
Yüksek risk (sağ alt). Sözleşme incelemesi, fiyatlandırma kararları, derinlemesine analizler. Nadirdir, ancak yanlış bir cevap bir müşteriye, bir sözleşmeye veya bir çeyreğin marjına mal olur. Burada, dezavantaj model faturasını gölgede bırakır ve en pahalı modeller ücretlerini burada kazanır.
Optimize etme (sol alt). Ara sıra yapılan, herhangi bir yetenekli modelin çıtayı geçtiği ve fiyat farkının bir kararı hak edemeyecek kadar küçük olduğu basit istekler. Haritada insanlara düşünmemelerini söylediğimiz tek karedir.
Üç model sınıfı
Haritadan üç çalışma sınıfı ortaya çıkıyor. Bunlar, bir modeli iyi veya kötü olarak derecelendirmekten ziyade işin ekonomisini ve muhakeme profilini tanımlar.
Sprintçiler hacim işleri için üretilmiştir - prosedür net olduğunda ve bir hata düzeltmesi kolay olduğunda hızlı, ucuz ve tutarlıdır. Haiku 4.5, Gemini 3.5 Flash ve DeepSeek V4 Pro.
Orta sıkletler günlük zanaatı yürütür. Kaynakları sentezler, çok adımlı bir planı tutar ve her rapor için en üst düzey ücretleri talep etmeden iyi yazarlar. Sonnet 5, GPT 5.6 Terra, Grok 4.5 ve GLM 5.2 - çoğu bilgi işinin ait olduğu yer.
Ağır sıkletler yüksek riskli kararları alır, yanlış bir cevabın model faturasından çok daha fazlasına mal olduğu işlerde daha güçlü muhakeme ve daha fazla akıl yürütme süresi getirir. Opus 4.8, GPT 5.6 Sol ve Fable 5.
Çoğu insanın içgüdüsü yüksekten başlayıp aşağıya doğru inmektir - her şeyi bir Fable 5 veya Opus 4.8'de çalıştırın, istediğiniz çıktıyı alın, ardından kalite düşene kadar daha ucuz modelleri deneyin. İşe yarar, ancak çoğu işin buna ihtiyacı olmadığını gördük. İşi adlandırabilir ve haritaya yerleştirebilirseniz, genellikle en başından doğru sınıfta başlayabilirsiniz. Yaptığınız işlerin çoğunu oluşturan günlük zanaat için bu, Sonnet 5 gibi sağlam bir orta sıklette başlamak anlamına gelir. Yukarıdan aşağıya aramaya yalnızca bir iş gerçekten yüksek riskli uçta olduğunda başvurursunuz.
Saha Claude, GPT ve Gemini'den daha geniş
Çoğu ekip, halihazırda bildikleri bir avuç model adına yönelir. Bu başlamak için makul bir yerdir, ancak listenin büyük bir kısmına dokunulmaz - ve Hyperagent'te en yararlı işleri yapan modellerden bazıları herkesin bildiği isimler değildir. Bunlar, bataryadan ve günlük kullanımdan edindiğimiz operasyonel izlenimlerimiz ve müşterilerin çalıştırdığını izlediğimiz işlerdir.
Grok 4.5 hızlı, gerçek zamanlı araştırmadır. Araç yoğun araştırmalarda hızlı hareket eder ve özellikle Hyperagent'ın yerel Exa Search'i ile eşleştirildiğinde iyi performans gösterdi. Ayrıca X'e yerel bir bağlantısı vardır, bu nedenle canlı duyarlılık hakkındaki bir soru, cevabın arkasındaki gerçek gönderilerle birlikte gelebilir. Tam çalışma için 9,71$'lık maliyetiyle bitmiş iş puanımızda liderdi.
Muse Spark 1.1 temiz yazar ve kendini kontrol eder. Koşum takımında ikinci oldu ve ilk izlenimimiz, işi geri vermeden önce kendi çalışmasını denetleme gibi yararlı bir alışkanlığa sahip, özlü, iyi yapılandırılmış bir düzyazıdır. Hala yeni, bu yüzden uzun, gözetimsiz işlerden önce denetimli günlük işlerde başlatmanızı öneririz.
Kimi K2.6, açık model fiyatında derin araştırmadır. Aramaları paralel olarak yürütür ve amiral gemisi ücretleri talep etmeden kanıtları tek bir cevaba çeker, bu da onu güçlü bir araştırma uzmanı yapar. Tek gerçek sınırlaması, 256.000 token ile sınırlı olan bağlam penceresiyle belge boyutudur.
GLM 5.2 değer tercihidir. Rutin araştırma, taslak hazırlama ve uzun belge işlerinde, kabaca üçte biri fiyata kapalı orta sıkletlere şaşırtıcı derecede yaklaştı ve düzyazısı Sonnet ve Opus dışındaki en güçlüler arasında yer alıyor. Hyperagent ekibinin çoğu için günlük bir sürücü haline geldi.
Qwen 3.7 Plus ekran işçisidir. İşlenmiş sayfalarda düğmeleri, alanları ve menüleri bulmada özellikle iyidir ve yapılandırılmış çıkarma için ucuzdur - bataryamızda en düşük maliyetli tam çalışmayı üretti. İş bir arayüzle çalışmak veya veri taşımak olduğunda, sesin önemli olduğu durumlarda değil, ona yönelin.
DeepSeek V4 Pro, çok düşük maliyetle yapılandırılmış analizdir. En güçlü olduğu alanlar mutabakat, veri temizliği, planlı sayısal işler ve benzer yapılandırılmış görevlerdir. Yazısı gerçekçi ve kısadır, bu da dahili açıklamalara iyi hizmet eder, ancak müşteriye yönelik düzyazıya kötü hizmet eder. Bir uzman ve oldukça ekonomik bir uzman.
Her zaman açık ajanlarınızı doğru fiyata personellendirme
Steve Juba altı kişilik bir seyahat şirketi işletiyor. Günde birkaç kez çalışan, sekiz canlı veri kaynağına bağlı bir brifing ajanı kurdu ve bu, sabah bağlam toplama süresini sekiz sekme üzerinden üç saatten fazladan on beş dakikaya indirdi.
Bunun gibi bir ajan, yazdığından çok daha fazlasını okur ve aynı işi yılda yüzlerce kez yapar, bu nedenle çalışma başına küçük bir fiyat farkı yuvarlama hatası olmaktan çıkar ve gerçek bir bütçe kalemi haline gelir. Her gün 100.000 token okuyan ve 2.000 token yazan bir brifing düşünün. Temmuz 2026 liste fiyatlarında, bu şekildeki bir iş yaklaşık olarak şu şekilde çalışır:
- Yılda 16$ Qwen 3.7 Plus'ta (sprintçi)
- Yılda 38$ Kimi K2.6'da (orta sıklet)
- Yılda 40$ Haiku 4.5'te (sprintçi)
- Yılda 80$ Sonnet 5'te (orta sıklet)

Açık ağırlıklı seçenekler, bunun gibi okuma ağırlıklı işlerde matematiği değiştiriyor. Kimi K2.6, bu işte 38$'a orta sıklet kalitesinde araştırma ve sentez yapıyor - Sonnet 5'in yarısından az ve Haiku sprintçisini çalıştırmakla hemen hemen aynı. Muhakeme için maliyetten ödün vermiyorsunuz; sprintçi parasına orta sıklet işi alıyorsunuz. İş, muhakeme gerektirmeyen saf çıkarma olsaydı, Qwen onu 16$'a çalıştırırdı - ancak gerçek sentez gerektiği anda, Kimi bunu size neredeyse aynı fiyata sunuyor.
Modeli değiştirin, ajanı koruyun
Model değiştirmek, ajanı yeniden inşa etmek anlamına geliyorsa bunların hiçbiri önemli değildir. Hyperagent içinde öyle değildir, çünkü model sadece bir ayardır ve rol onun üstünde yer alır. Modeli değiştirin ve ajan, onu yararlı kılan her şeyi korur:
- Talimatları ve kapsamı
- Becerileri, komut dosyaları ve çalışma prosedürleri
- Düzeltmelerin hafızası
- Referans dosyaları ve şirket bağlamı
- İşin yaşadığı sistemlere bağlantıları
- Kaliteyi değerlendirme kriterleri

Bu, model seçimini bir geçişten ziyade bir teste dönüştürür. Aynı ajan, yeniden inşa edilmeden aynı işi iki modelde çalıştırabilir, böylece tahmin yapmak yerine çıtanızı geçen en ucuz modeli bulabilirsiniz.
Ayrıca, zorlu bir iş akışının pahalı kısmının bir kez kendini amorti etmesini sağlar. Bir iş gerçekten ihtiyaç duyduğunda, iş akışını tasarlamak ve hata ayıklamak için daha ağır bir model kullanın - ardından prosedürü bir beceri olarak kodlayın, böylece bir orta sıklet veya sprintçi onu her gün maliyetin çok daha düşük bir kısmıyla çalıştırabilir.
Ancak dikkat edilmesi gereken gizli bir maliyet var. Düşük faturalı daha ucuz bir model, her çıktının düzeltilmesi gerekiyorsa ucuz değildir - insan inceleme süresi ve bir hata maliyeti, gerçek fiyatın bir parçasıdır. Buna inceleme vergisi diyelim. Ne kadar hafif gidebileceğinizin tabanını belirler. Hyperagent'te farklı olan şey, incelemenin sadece ödenmemesi, aynı zamanda birikmesidir: ajan, düzeltmelerinizden hafıza aracılığıyla öğrendikçe, bu inceleme çabası koşum takımı tarafından yakalanır ve bir sonraki çalıştırmada daha iyi bir ajan üretir.
Müşteriler ajanları zaten bu şekilde personellendiriyor. Ankit Das, muhakeme çağrılarını yapan Sonnet 5'te bir Büyüme Orkestratörü ve yinelenen kanal çalışmalarını üreten GLM 5.2'de sekiz kanal uzmanıyla bir pazarlama operasyonu kurdu; ayrı bir QA ajanları marka uyumu ve yazma kalitesini kontrol ediyor - tümü tek bir iş parçacığından başlatıldı. Eli Weiss bölünmeyi daha basit bir şekilde tanımlıyor: becerileri ve rutinleri arasında kabaca %85 Sonnet ve %15 Opus. Çoğu iş günlük sürücüde çalışır; Opus, ek muhakemenin maliyetini hak ettiği daha küçük iş grubunu alır.
Hyperagent içinde model seçiminin pratik değeri budur. İş genelinde bilinçli harcama yapın ve ekstra dolarları, ek muhakemenin sonucu değiştirdiği işler için ayırın.
İşi seçtikten sonra modeli seçin
Halihazırda çalıştırdığınız bir ajan için bu sırayı kullanın:
- İşi adlandırın. "Pazartesi müşteri raporunu hazırla", "raporlamaya yardım et"ten daha kullanışlıdır.
- Haritaya yerleştirin. Ne kadar muhakeme gerektirdiğine ve ne sıklıkta çalışacağına karar verin.
- Haritanın koyduğu yerden başlayın. Çoğu iş için bu, yetenekli bir orta sıklettir - işin uç durumlarını anlayana ve süreci becerilere kodlayana kadar kullanın.
- Beş gerçek çalışma için bir sınıf daha hafifini test edin. Talimatları, becerileri, hafızayı, kaynakları ve kriterleri değiştirmeden bırakın.
- Toplam maliyeti karşılaştırın. Bitmiş kaliteyi, tutarlılığı, süreyi, olgusal hataları, model faturasını ve insan inceleme süresini izleyin.
- Amaçlı olarak yükseltin. İnceleme yükü veya yanlış bir cevabın maliyeti model primini aştığında bir ağır sıklet getirin.
- Önemli işleri incelemek için farklı bir model kullanın. Hatayı yapan model, genellikle onu görme olasılığı en düşük olan modeldir.
Standardınızı güvenilir bir şekilde karşılayan en ucuz modeli kullanın. Ardından farkı, bunu hak eden kararlar için harcayın.





