Bir ay önce GLM-5.2 yayınlandı. Sıfırıncı gün desteğimiz kapsamında, GLM-5.2 için dünyanın en hızlı API'sini oluşturduk ve saniyede 280 token ile zirve hızlara, ortalama olarak da saniyede 100 token civarına ulaştık. Bugün, GLM-5.2 API'miz Artificial Analysis tarafından yapılan kıyaslamada lansman günündeki API performansının iki katından fazlasını gösteriyor. İyileştirilmiş API performansımızın hem kıyaslamalarda hem de gerçek dünya kullanımında kendini gösterdiğini görüyoruz.

Baseten’in GLM-5.2 API'si, hem TTFT hem de TPS açısından lider performans sunuyor
GLM-5.2 gibi modeller piyasada sürekli bir popülerlik gösterirken, kullanıcılarımız için daha iyi gecikme süresi ve verimlilik elde etmek adına modele özgü optimizasyon çalışmalarına daha fazla yatırım yapıyoruz. GLM-5.2 API'mizi iyileştirmenin yanı sıra, model için başka bir API daha oluşturduk: GLM-5.2-Fast.
Bazı performans çalışmaları her iki API'ye de fayda sağlıyor. Geçtiğimiz ay boyunca zamanlayıcıyı optimize ederek verimi hafifçe artırdık, ayrıca iyileştirilmiş NVFP4 ağırlıkları ve güncellenmiş bir spekülatif kod çözme profili yayınladık. Ayrıca çıkarım motorumuzda ve tüm yığın boyunca hem kalite hem de performansla ilgili hataları düzelttik.
Hızlı API için, kodlama ve aracı gecikmesini azaltmaya odaklandık. Çıkarım mühendisliği, gecikme süresi ve verimlilik arasındaki Pareto sınırında çeşitli takas fırsatları sunar. Piyasadan daha fazla performans için ödeme yapma isteği olduğuna dair güçlü bir sinyal alan Baseten'in model performans ekibi, sistemi mümkün olduğunca düşük gecikme süresine doğru itmek için paralellik, toplu işleme ve önbelleğe alma ayarlarını yeniden gözden geçirdi. En büyük etkiyi yaratan iki değişiklik oldu:
- Genel API, verimi artırmak için Dikkat Veri Paralelliği (ADP) kullanırken, hızlı API yalnızca gecikme süresine göre seçilmiş yapılandırmalarla Tensor ve Uzman Paralelliğini kullanır.
- Maksimum toplu iş boyutundaki önemli azalma, daha az isteğin kaynaklar için rekabet etmesi anlamına gelir.
Bu hızlı API, genel API ile aynı NVIDIA B200 GPU'larında çalışır. Ancak performans optimizasyonları, gecikme süresini iyileştirmek için verimden ödün verdiğinden, hızlı API'de girdi ve çıktı token fiyatları %50 daha yüksektir.
Bu performans çalışmaları, 25 Temmuz 2026 Cumartesi günü Pasifik Saati ile yaklaşık 19:00'da ölçülen en son Artificial Analysis kıyaslamalarında kendini gösteriyor.

Uçtan uca yanıt süresi, kullanıcı deneyimi için önemli bir metriktir

TPS cinsinden saf çıktı hızı, özellikle bir sorguyu yanıtlamadan önce düşünen akıl yürütme modelleri için önemlidir
LLM performansı, bir sistemdeki trafik miktarına, bu trafiğin desenine ve girdi ile çıktı dizi uzunluklarına bağlı olarak büyük ölçüde değişir. Artificial Analysis kıyaslaması, yaklaşık 1.000 çıktı token'ı üretmek için yaklaşık 10.000 girdi token'ı içeren istemler gönderir. API'mizin sadece kıyaslamalarda değil, gerçek dünya kullanımında da lider performansı hakkında piyasadan olumlu geri bildirimler aldık.
GLM-5.2'in performansını optimize etme işimiz bitmedi. Yakında spekülatif kod çözme algoritmamıza başka bir iyileştirme daha yayınlamayı planlıyoruz. Ayrıca Kimi K3 için bir API oluşturma sürecinden çok şey öğreniyoruz ve bu öğrenimleri GLM-5.2 gibi diğer açık modellere uygulamak için sabırsızlanıyoruz.
GLM-5.2 için yeni hızlı API, Baseten'de herkese açıktır. Hemen şimdi https://www.baseten.co/library/glm-52-fast/ adresinde deneyin.





