GLM-5.2 için en hızlı API'yi nasıl oluşturduk

@philipkiely
İNGILIZCE2 gün önce · 26 Tem 2026
162K
459
42
26
484

TL;DR

Baseten, zamanlayıcı iyileştirmeleri, paralellik ayarlamaları ve B200 GPU kullanımı sayesinde GLM-5.2 API'sini sektör lideri hızlara ulaştırmak için nasıl optimize ettiklerini açıklıyor.

Bir ay önce GLM-5.2 yayınlandı. Sıfırıncı gün desteğimiz kapsamında, GLM-5.2 için dünyanın en hızlı API'sini oluşturduk ve saniyede 280 token ile zirve hızlara, ortalama olarak da saniyede 100 token civarına ulaştık. Bugün, GLM-5.2 API'miz Artificial Analysis tarafından yapılan kıyaslamada lansman günündeki API performansının iki katından fazlasını gösteriyor. İyileştirilmiş API performansımızın hem kıyaslamalarda hem de gerçek dünya kullanımında kendini gösterdiğini görüyoruz.

Philip Kiely - inline image

Baseten’in GLM-5.2 API'si, hem TTFT hem de TPS açısından lider performans sunuyor

GLM-5.2 gibi modeller piyasada sürekli bir popülerlik gösterirken, kullanıcılarımız için daha iyi gecikme süresi ve verimlilik elde etmek adına modele özgü optimizasyon çalışmalarına daha fazla yatırım yapıyoruz. GLM-5.2 API'mizi iyileştirmenin yanı sıra, model için başka bir API daha oluşturduk: GLM-5.2-Fast.

Bazı performans çalışmaları her iki API'ye de fayda sağlıyor. Geçtiğimiz ay boyunca zamanlayıcıyı optimize ederek verimi hafifçe artırdık, ayrıca iyileştirilmiş NVFP4 ağırlıkları ve güncellenmiş bir spekülatif kod çözme profili yayınladık. Ayrıca çıkarım motorumuzda ve tüm yığın boyunca hem kalite hem de performansla ilgili hataları düzelttik.

Hızlı API için, kodlama ve aracı gecikmesini azaltmaya odaklandık. Çıkarım mühendisliği, gecikme süresi ve verimlilik arasındaki Pareto sınırında çeşitli takas fırsatları sunar. Piyasadan daha fazla performans için ödeme yapma isteği olduğuna dair güçlü bir sinyal alan Baseten'in model performans ekibi, sistemi mümkün olduğunca düşük gecikme süresine doğru itmek için paralellik, toplu işleme ve önbelleğe alma ayarlarını yeniden gözden geçirdi. En büyük etkiyi yaratan iki değişiklik oldu:

  • Genel API, verimi artırmak için Dikkat Veri Paralelliği (ADP) kullanırken, hızlı API yalnızca gecikme süresine göre seçilmiş yapılandırmalarla Tensor ve Uzman Paralelliğini kullanır.
  • Maksimum toplu iş boyutundaki önemli azalma, daha az isteğin kaynaklar için rekabet etmesi anlamına gelir.

Bu hızlı API, genel API ile aynı NVIDIA B200 GPU'larında çalışır. Ancak performans optimizasyonları, gecikme süresini iyileştirmek için verimden ödün verdiğinden, hızlı API'de girdi ve çıktı token fiyatları %50 daha yüksektir.

Bu performans çalışmaları, 25 Temmuz 2026 Cumartesi günü Pasifik Saati ile yaklaşık 19:00'da ölçülen en son Artificial Analysis kıyaslamalarında kendini gösteriyor.

Philip Kiely - inline image

Uçtan uca yanıt süresi, kullanıcı deneyimi için önemli bir metriktir

Philip Kiely - inline image

TPS cinsinden saf çıktı hızı, özellikle bir sorguyu yanıtlamadan önce düşünen akıl yürütme modelleri için önemlidir

LLM performansı, bir sistemdeki trafik miktarına, bu trafiğin desenine ve girdi ile çıktı dizi uzunluklarına bağlı olarak büyük ölçüde değişir. Artificial Analysis kıyaslaması, yaklaşık 1.000 çıktı token'ı üretmek için yaklaşık 10.000 girdi token'ı içeren istemler gönderir. API'mizin sadece kıyaslamalarda değil, gerçek dünya kullanımında da lider performansı hakkında piyasadan olumlu geri bildirimler aldık.

GLM-5.2'in performansını optimize etme işimiz bitmedi. Yakında spekülatif kod çözme algoritmamıza başka bir iyileştirme daha yayınlamayı planlıyoruz. Ayrıca Kimi K3 için bir API oluşturma sürecinden çok şey öğreniyoruz ve bu öğrenimleri GLM-5.2 gibi diğer açık modellere uygulamak için sabırsızlanıyoruz.

GLM-5.2 için yeni hızlı API, Baseten'de herkese açıktır. Hemen şimdi https://www.baseten.co/library/glm-52-fast/ adresinde deneyin.

YouMind’da yeniden üret

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet