Hace un mes, se lanzó GLM-5.2. Como parte de nuestro soporte desde el día cero, construimos la API más rápida del mundo para GLM-5.2, con velocidades máximas de 280 tokens por segundo y velocidades promedio de alrededor de 100 tokens por segundo. Hoy, nuestra API de GLM-5.2, según el benchmark de Artificial Analysis, muestra más del doble de rendimiento que la API del día de lanzamiento. Descubrimos que el rendimiento mejorado de nuestra API se refleja tanto en los benchmarks como en el uso real.

La API de GLM-5.2 de Baseten logra un rendimiento líder tanto en TTFT como en TPS
A medida que modelos como GLM-5.2 demuestran una popularidad sostenida en el mercado, profundizamos nuestra inversión en trabajo de optimización específico para el modelo para ofrecer mejor latencia y rendimiento a nuestros usuarios. Además de mejorar nuestra API de GLM-5.2, construimos otra API para el modelo: GLM-5.2-Fast.
Algunos trabajos de rendimiento benefician a ambas APIs. Durante el último mes, hemos optimizado el planificador (scheduler), aumentando ligeramente el rendimiento, así como implementado pesos NVFP4 mejorados y un perfil de decodificación especulativa actualizado. También hemos corregido errores tanto de calidad como de rendimiento en nuestro motor de inferencia y en toda la pila tecnológica.
Para la API rápida, nos enfocamos en reducir la latencia para codificación y agentes. La ingeniería de inferencia ofrece múltiples oportunidades para intercambiar a lo largo de la frontera de Pareto entre latencia y rendimiento. Basándonos en una señal fuerte del mercado de que existe disposición a pagar por más rendimiento, el equipo de rendimiento de modelos de Baseten revisó las opciones de configuración en paralelismo, batching y caching para llevar el sistema lo más lejos posible hacia la latencia. Hubo dos cambios que tuvieron el mayor impacto:
- Mientras que la API general utiliza Paralelismo de Datos de Atención (ADP) para mejorar el rendimiento, la API rápida utiliza únicamente Paralelismo de Tensores y Expertos con configuraciones seleccionadas para latencia.
- Una reducción sustancial en el tamaño máximo de lote (batch) significa que menos solicitudes compiten por los recursos.
Esta API rápida se ejecuta en las mismas GPU NVIDIA B200 que la API general. Sin embargo, debido a que las optimizaciones de rendimiento intercambian rendimiento por latencia, los precios de los tokens de entrada y salida son un 50% más altos en la API rápida.
Este trabajo de rendimiento se refleja en los últimos benchmarks de Artificial Analysis, medidos aproximadamente a las 7:00 p.m. (hora del Pacífico) del sábado, 25 de julio de 2026.

El tiempo de respuesta de extremo a extremo es una métrica importante para la experiencia del usuario

La velocidad pura de salida, en términos de TPS, es especialmente importante para los modelos de razonamiento que piensan antes de responder una consulta
El rendimiento de los LLM varía sustancialmente según la cantidad de tráfico en un sistema, el patrón de dicho tráfico y las longitudes de secuencia de entrada y salida. El benchmark de Artificial Analysis envía indicaciones (prompts) de aproximadamente 10,000 tokens de entrada para generar respuestas de aproximadamente 1,000 tokens de salida. Hemos recibido comentarios positivos del mercado sobre el rendimiento líder de nuestra API en el uso real, no solo en los benchmarks.
No hemos terminado de optimizar el rendimiento de GLM-5.2. Tenemos planes de implementar otra mejora en nuestro algoritmo de decodificación especulativa próximamente. También estamos aprendiendo mucho del proceso de construir una API para Kimi K3, y esperamos aplicar estos aprendizajes a otros modelos abiertos como GLM-5.2.
La nueva API rápida para GLM-5.2 está disponible públicamente en Baseten. Pruébala hoy en https://www.baseten.co/library/glm-52-fast/.





