Hace un mes, se lanzó GLM-5.2. Como parte de nuestro soporte desde el día cero, construimos la API más rápida del mundo para GLM-5.2, con velocidades máximas de 280 tokens por segundo y velocidades promedio alrededor de 100 tokens por segundo. Hoy, nuestra API de GLM-5.2 según el benchmark de Artificial Analysis muestra más del doble de rendimiento que la API del día de lanzamiento. Encontramos que nuestra mejora en el rendimiento de la API se refleja tanto en los benchmarks como en el uso real.

La API de GLM-5.2 de Baseten logra un rendimiento líder tanto en TTFT como en TPS.
A medida que modelos como GLM-5.2 demuestran una popularidad sostenida en el mercado, profundizamos nuestra inversión en trabajos de optimización específicos del modelo para desbloquear mejor latencia y rendimiento para nuestros usuarios. Además de mejorar nuestra API de GLM-5.2, construimos otra API para el modelo: GLM-5.2-Fast.
Algunos trabajos de rendimiento benefician a ambas APIs. Durante el último mes, hemos optimizado el planificador, aumentando ligeramente el rendimiento, además de implementar pesos NVFP4 mejorados y un perfil de decodificación especulativa actualizado. También hemos corregido errores tanto de calidad como de rendimiento en nuestro motor de inferencia y en toda la pila.
Para la API rápida, nos enfocamos en reducir la latencia para codificación y agentes. La ingeniería de inferencia ofrece múltiples oportunidades para negociar a lo largo de la frontera de Pareto entre latencia y rendimiento. Basándonos en una fuerte señal del mercado de que hay disposición a pagar por más rendimiento, el equipo de rendimiento de modelos de Baseten revisó las opciones de configuración en paralelismo, batching y almacenamiento en caché para llevar el sistema lo más lejos posible hacia la latencia. Hubo dos cambios que tuvieron el mayor impacto:
- Mientras que la API general usa Attention Data Parallelism (ADP) para mejorar el rendimiento, la API rápida usa únicamente Tensor and Expert Parallelism con configuraciones seleccionadas para latencia.
- Una reducción sustancial en el tamaño máximo de lote significa que menos solicitudes compiten por los recursos.
Esta API rápida se ejecuta en las mismas GPU NVIDIA B200 que la API general. Sin embargo, debido a que las optimizaciones de rendimiento intercambian rendimiento por latencia, los precios de tokens de entrada y salida son un 50% más altos en la API rápida.
Este trabajo de rendimiento se refleja en los últimos benchmarks de Artificial Analysis, medidos aproximadamente a las 7:00 PM hora del Pacífico del sábado 25 de julio de 2026.

El tiempo de respuesta de extremo a extremo es una métrica importante para la experiencia del usuario.

La velocidad de salida pura, en términos de TPS, es especialmente importante para modelos de razonamiento que piensan antes de responder una consulta.
El rendimiento de los LLM varía sustancialmente según la cantidad de tráfico en un sistema, el patrón de dicho tráfico y las longitudes de secuencia de entrada y salida. El benchmark de Artificial Analysis envía prompts de aproximadamente 10,000 tokens de entrada para generar respuestas de aproximadamente 1,000 tokens de salida. Hemos recibido comentarios positivos del mercado sobre el rendimiento líder de nuestra API en uso real, no solo en benchmarks.
No hemos terminado de optimizar el rendimiento de GLM-5.2. Tenemos planes de implementar otra mejora en nuestro algoritmo de decodificación especulativa próximamente. También estamos aprendiendo mucho del proceso de construir una API para Kimi K3, y esperamos aplicar estos aprendizajes a otros modelos abiertos como GLM-5.2.
La nueva API rápida para GLM-5.2 está disponible públicamente en Baseten. Pruébala hoy en https://www.baseten.co/library/glm-52-fast/.





