Cómo construimos la API más rápida para GLM-5.2

@philipkiely
INGLÉShace 3 días · 26 jul 2026
168K
466
42
26
486

TL;DR

Baseten explica cómo optimizaron la API de GLM-5.2 para lograr velocidades líderes en la industria mediante mejoras en el programador, ajustes de paralelismo y el uso de GPU B200.

Hace un mes, se lanzó GLM-5.2. Como parte de nuestro soporte desde el día cero, construimos la API más rápida del mundo para GLM-5.2, con velocidades máximas de 280 tokens por segundo y velocidades promedio alrededor de 100 tokens por segundo. Hoy, nuestra API de GLM-5.2 según el benchmark de Artificial Analysis muestra más del doble de rendimiento que la API del día de lanzamiento. Encontramos que nuestra mejora en el rendimiento de la API se refleja tanto en los benchmarks como en el uso real.

Philip Kiely - inline image

La API de GLM-5.2 de Baseten logra un rendimiento líder tanto en TTFT como en TPS.

A medida que modelos como GLM-5.2 demuestran una popularidad sostenida en el mercado, profundizamos nuestra inversión en trabajos de optimización específicos del modelo para desbloquear mejor latencia y rendimiento para nuestros usuarios. Además de mejorar nuestra API de GLM-5.2, construimos otra API para el modelo: GLM-5.2-Fast.

Algunos trabajos de rendimiento benefician a ambas APIs. Durante el último mes, hemos optimizado el planificador, aumentando ligeramente el rendimiento, además de implementar pesos NVFP4 mejorados y un perfil de decodificación especulativa actualizado. También hemos corregido errores tanto de calidad como de rendimiento en nuestro motor de inferencia y en toda la pila.

Para la API rápida, nos enfocamos en reducir la latencia para codificación y agentes. La ingeniería de inferencia ofrece múltiples oportunidades para negociar a lo largo de la frontera de Pareto entre latencia y rendimiento. Basándonos en una fuerte señal del mercado de que hay disposición a pagar por más rendimiento, el equipo de rendimiento de modelos de Baseten revisó las opciones de configuración en paralelismo, batching y almacenamiento en caché para llevar el sistema lo más lejos posible hacia la latencia. Hubo dos cambios que tuvieron el mayor impacto:

  • Mientras que la API general usa Attention Data Parallelism (ADP) para mejorar el rendimiento, la API rápida usa únicamente Tensor and Expert Parallelism con configuraciones seleccionadas para latencia.
  • Una reducción sustancial en el tamaño máximo de lote significa que menos solicitudes compiten por los recursos.

Esta API rápida se ejecuta en las mismas GPU NVIDIA B200 que la API general. Sin embargo, debido a que las optimizaciones de rendimiento intercambian rendimiento por latencia, los precios de tokens de entrada y salida son un 50% más altos en la API rápida.

Este trabajo de rendimiento se refleja en los últimos benchmarks de Artificial Analysis, medidos aproximadamente a las 7:00 PM hora del Pacífico del sábado 25 de julio de 2026.

Philip Kiely - inline image

El tiempo de respuesta de extremo a extremo es una métrica importante para la experiencia del usuario.

Philip Kiely - inline image

La velocidad de salida pura, en términos de TPS, es especialmente importante para modelos de razonamiento que piensan antes de responder una consulta.

El rendimiento de los LLM varía sustancialmente según la cantidad de tráfico en un sistema, el patrón de dicho tráfico y las longitudes de secuencia de entrada y salida. El benchmark de Artificial Analysis envía prompts de aproximadamente 10,000 tokens de entrada para generar respuestas de aproximadamente 1,000 tokens de salida. Hemos recibido comentarios positivos del mercado sobre el rendimiento líder de nuestra API en uso real, no solo en benchmarks.

No hemos terminado de optimizar el rendimiento de GLM-5.2. Tenemos planes de implementar otra mejora en nuestro algoritmo de decodificación especulativa próximamente. También estamos aprendiendo mucho del proceso de construir una API para Kimi K3, y esperamos aplicar estos aprendizajes a otros modelos abiertos como GLM-5.2.

La nueva API rápida para GLM-5.2 está disponible públicamente en Baseten. Pruébala hoy en https://www.baseten.co/library/glm-52-fast/.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales