Há um mês, o GLM-5.2 foi lançado. Como parte do nosso suporte de lançamento, criamos a API mais rápida do mundo para o GLM-5.2, com velocidades de pico de 280 tokens por segundo e médias em torno de 100 tokens por segundo. Hoje, nossa API GLM-5.2 conforme avaliada pela Artificial Analysis mostra mais que o dobro do desempenho da API do dia do lançamento. Constatamos que a melhora no desempenho da nossa API aparece tanto nos benchmarks quanto no uso real.

A API GLM-5.2 da Baseten alcança desempenho líder tanto em TTFT quanto em TPS
À medida que modelos como o GLM-5.2 demonstram popularidade sustentada no mercado, aprofundamos nosso investimento em otimizações específicas para cada modelo, a fim de desbloquear melhor latência e taxa de transferência para nossos usuários. Além de melhorar nossa API GLM-5.2, criamos outra API para o modelo: GLM-5.2-Fast.
Alguns trabalhos de desempenho beneficiam ambas as APIs. No último mês, otimizamos o escalonador, aumentando ligeiramente a taxa de transferência, além de implementar pesos NVFP4 aprimorados e um perfil atualizado de decodificação especulativa. Também corrigimos bugs, tanto de qualidade quanto de desempenho, em nosso mecanismo de inferência e em toda a pilha.
Para a API rápida, focamos em reduzir a latência para codificação e agentes. A engenharia de inferência oferece múltiplas oportunidades de trade-off ao longo da fronteira de Pareto entre latência e taxa de transferência. Com base em um forte sinal do mercado de que há disposição para pagar por mais desempenho, a equipe de desempenho de modelos da Baseten revisitou as opções de configuração em paralelismo, loteamento e cache para levar o sistema o mais longe possível em direção à latência. Houve duas mudanças que causaram o maior impacto:
- Enquanto a API geral usa Paralelismo de Dados com Atenção (ADP) para melhorar a taxa de transferência, a API rápida usa exclusivamente Paralelismo de Tensor e Especialista com configurações selecionadas para latência.
- Uma redução substancial no tamanho máximo do lote significa que menos solicitações estão competindo por recursos.
Esta API rápida é executada nas mesmas GPUs NVIDIA B200 que a API geral. No entanto, como as otimizações de desempenho trocam taxa de transferência por melhoria na latência, os preços dos tokens de entrada e saída são 50% mais altos na API rápida.
Este trabalho de desempenho aparece nos benchmarks mais recentes da Artificial Analysis, medidos aproximadamente às 19:00, horário do Pacífico, no sábado, 25 de julho de 2026.

O tempo de resposta ponta a ponta é uma métrica importante para a experiência do usuário

A velocidade pura de saída, em termos de TPS, é especialmente importante para modelos de raciocínio que pensam antes de responder a uma pergunta
O desempenho de LLMs varia substancialmente com base na quantidade de tráfego em um sistema, no padrão desse tráfego e nos comprimentos das sequências de entrada e saída. O benchmark da Artificial Analysis envia prompts de aproximadamente 10.000 tokens de entrada para gerar respostas de aproximadamente 1.000 tokens de saída. Recebemos feedback positivo do mercado sobre o desempenho líder da nossa API em uso real, não apenas em benchmarks.
Ainda não terminamos de otimizar o desempenho do GLM-5.2. Temos planos de implementar em breve outra melhoria em nosso algoritmo de decodificação especulativa. Também estamos aprendendo muito com o processo de construção de uma API para o Kimi K3, e estamos ansiosos para aplicar esses aprendizados de volta a outros modelos abertos, como o GLM-5.2.
A nova API rápida para o GLM-5.2 está disponível publicamente na Baseten. Experimente hoje mesmo em https://www.baseten.co/library/glm-52-fast/.





