Cómo construimos la API más rápida para GLM-5.2

@philipkiely
INGLÉShace 3 días · 26 jul 2026
168K
466
42
26
486

TL;DR

Baseten explica cómo optimizaron la API de GLM-5.2 para alcanzar velocidades líderes en la industria mediante mejoras en el programador, ajustes de paralelismo y el uso de GPUs B200.

Hace un mes, se lanzó GLM-5.2. Como parte de nuestro soporte desde el día cero, construimos la API más rápida del mundo para GLM-5.2, con velocidades máximas de 280 tokens por segundo y velocidades promedio de alrededor de 100 tokens por segundo. Hoy, nuestra API de GLM-5.2, según el benchmark de Artificial Analysis, muestra más del doble de rendimiento que la API del día de lanzamiento. Descubrimos que el rendimiento mejorado de nuestra API se refleja tanto en los benchmarks como en el uso real.

Philip Kiely - inline image

La API de GLM-5.2 de Baseten logra un rendimiento líder tanto en TTFT como en TPS

A medida que modelos como GLM-5.2 demuestran una popularidad sostenida en el mercado, profundizamos nuestra inversión en trabajo de optimización específico para el modelo para ofrecer mejor latencia y rendimiento a nuestros usuarios. Además de mejorar nuestra API de GLM-5.2, construimos otra API para el modelo: GLM-5.2-Fast.

Algunos trabajos de rendimiento benefician a ambas APIs. Durante el último mes, hemos optimizado el planificador (scheduler), aumentando ligeramente el rendimiento, así como implementado pesos NVFP4 mejorados y un perfil de decodificación especulativa actualizado. También hemos corregido errores tanto de calidad como de rendimiento en nuestro motor de inferencia y en toda la pila tecnológica.

Para la API rápida, nos enfocamos en reducir la latencia para codificación y agentes. La ingeniería de inferencia ofrece múltiples oportunidades para intercambiar a lo largo de la frontera de Pareto entre latencia y rendimiento. Basándonos en una señal fuerte del mercado de que existe disposición a pagar por más rendimiento, el equipo de rendimiento de modelos de Baseten revisó las opciones de configuración en paralelismo, batching y caching para llevar el sistema lo más lejos posible hacia la latencia. Hubo dos cambios que tuvieron el mayor impacto:

  • Mientras que la API general utiliza Paralelismo de Datos de Atención (ADP) para mejorar el rendimiento, la API rápida utiliza únicamente Paralelismo de Tensores y Expertos con configuraciones seleccionadas para latencia.
  • Una reducción sustancial en el tamaño máximo de lote (batch) significa que menos solicitudes compiten por los recursos.

Esta API rápida se ejecuta en las mismas GPU NVIDIA B200 que la API general. Sin embargo, debido a que las optimizaciones de rendimiento intercambian rendimiento por latencia, los precios de los tokens de entrada y salida son un 50% más altos en la API rápida.

Este trabajo de rendimiento se refleja en los últimos benchmarks de Artificial Analysis, medidos aproximadamente a las 7:00 p.m. (hora del Pacífico) del sábado, 25 de julio de 2026.

Philip Kiely - inline image

El tiempo de respuesta de extremo a extremo es una métrica importante para la experiencia del usuario

Philip Kiely - inline image

La velocidad pura de salida, en términos de TPS, es especialmente importante para los modelos de razonamiento que piensan antes de responder una consulta

El rendimiento de los LLM varía sustancialmente según la cantidad de tráfico en un sistema, el patrón de dicho tráfico y las longitudes de secuencia de entrada y salida. El benchmark de Artificial Analysis envía indicaciones (prompts) de aproximadamente 10,000 tokens de entrada para generar respuestas de aproximadamente 1,000 tokens de salida. Hemos recibido comentarios positivos del mercado sobre el rendimiento líder de nuestra API en el uso real, no solo en los benchmarks.

No hemos terminado de optimizar el rendimiento de GLM-5.2. Tenemos planes de implementar otra mejora en nuestro algoritmo de decodificación especulativa próximamente. También estamos aprendiendo mucho del proceso de construir una API para Kimi K3, y esperamos aplicar estos aprendizajes a otros modelos abiertos como GLM-5.2.

La nueva API rápida para GLM-5.2 está disponible públicamente en Baseten. Pruébala hoy en https://www.baseten.co/library/glm-52-fast/.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales