Comment nous avons conçu l'API la plus rapide pour GLM-5.2

@philipkiely
ANGLAISil y a 2 jours · 26 juil. 2026
162K
459
42
26
484

TL;DR

Baseten explique comment ils ont optimisé l'API GLM-5.2 pour atteindre des vitesses de pointe grâce à des améliorations du planificateur, des ajustements de parallélisme et l'utilisation des GPU B200.

Il y a un mois, GLM-5.2 a été lancé. Dans le cadre de notre support dès le premier jour, nous avons construit l'API la plus rapide au monde pour GLM-5.2, avec des vitesses de pointe de 280 tokens par seconde et des vitesses moyennes autour de 100 tokens par seconde. Aujourd'hui, notre API GLM-5.2 selon les benchmarks d'Artificial Analysis montre plus du double de performance par rapport à l'API du jour de lancement. Nous constatons que cette amélioration de performance se manifeste à la fois dans les benchmarks et dans l'utilisation réelle.

Philip Kiely - inline image

L'API GLM-5.2 de Baseten atteint des performances de premier plan à la fois en TTFT et en TPS.

Alors que des modèles comme GLM-5.2 démontrent une popularité soutenue sur le marché, nous approfondissons nos investissements dans l'optimisation spécifique aux modèles pour offrir une meilleure latence et un meilleur débit à nos utilisateurs. En plus d'améliorer notre API GLM-5.2, nous avons construit une autre API pour ce modèle : GLM-5.2-Fast.

Certains travaux d'optimisation profitent aux deux API. Au cours du mois dernier, nous avons optimisé le planificateur, augmentant légèrement le débit, et déployé des poids NVFP4 améliorés ainsi qu'un profil de décodage spéculatif mis à jour. Nous avons également corrigé des bugs à la fois sur la qualité et la performance dans notre moteur d'inférence et dans l'ensemble de la stack.

Pour l'API rapide, nous nous sommes concentrés sur la réduction de la latence pour le codage et les agents. L'ingénierie d'inférence offre de multiples opportunités de faire des compromis le long de la frontière de Pareto entre latence et débit. Sur la base d'un signal fort du marché indiquant une volonté de payer pour plus de performances, l'équipe performance des modèles de Baseten a réexaminé les options de configuration en matière de parallélisme, de batching et de cache pour pousser le système autant que possible vers la latence. Deux changements ont eu le plus grand impact :

  • Alors que l'API générale utilise le parallélisme des données d'attention (ADP) pour améliorer le débit, l'API rapide utilise uniquement le parallélisme tensoriel et d'experts avec des configurations sélectionnées pour la latence.
  • Une réduction substantielle de la taille maximale des lots signifie que moins de requêtes sont en compétition pour les ressources.

Cette API rapide fonctionne sur les mêmes GPU NVIDIA B200 que l'API générale. Cependant, comme les optimisations de performance sacrifient le débit pour améliorer la latence, les prix des tokens d'entrée et de sortie sont 50 % plus élevés sur l'API rapide.

Ces travaux de performance se reflètent dans les derniers benchmarks d'Artificial Analysis, mesurés à environ 19h00 heure du Pacifique le samedi 25 juillet 2026.

Philip Kiely - inline image

Le temps de réponse de bout en bout est une métrique importante pour l'expérience utilisateur.

Philip Kiely - inline image

La vitesse de sortie pure, en termes de TPS, est particulièrement importante pour les modèles de raisonnement qui réfléchissent avant de répondre à une requête.

Les performances des LLM varient considérablement en fonction du volume de trafic dans un système, du schéma de ce trafic et des longueurs des séquences d'entrée et de sortie. Le benchmark d'Artificial Analysis envoie des prompts d'environ 10 000 tokens d'entrée pour générer des réponses d'environ 1 000 tokens de sortie. Nous avons reçu des retours positifs du marché concernant les performances de pointe de notre API en utilisation réelle, et pas seulement dans les benchmarks.

Nous n'avons pas fini d'optimiser les performances de GLM-5.2. Nous prévoyons de déployer prochainement une autre amélioration de notre algorithme de décodage spéculatif. Nous apprenons également beaucoup du processus de construction d'une API pour Kimi K3, et nous avons hâte d'appliquer ces apprentissages à d'autres modèles ouverts comme GLM-5.2.

La nouvelle API rapide pour GLM-5.2 est disponible publiquement sur Baseten. Essayez-la dès aujourd'hui sur https://www.baseten.co/library/glm-52-fast/.

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux