Como construímos a nova API mais rápida para o GLM-5.2

@philipkiely
INGLÊShá 3 dias · 26/07/2026
168K
466
42
26
486

TL;DR

A Baseten explica como otimizaram a API GLM-5.2 para alcançar velocidades líderes no setor por meio de melhorias no escalonador, ajustes de paralelismo e utilização de GPUs B200.

Há um mês, o GLM-5.2 foi lançado. Como parte do nosso suporte de lançamento, criamos a API mais rápida do mundo para o GLM-5.2, com velocidades de pico de 280 tokens por segundo e médias em torno de 100 tokens por segundo. Hoje, nossa API GLM-5.2 conforme avaliada pela Artificial Analysis mostra mais que o dobro do desempenho da API do dia do lançamento. Constatamos que a melhora no desempenho da nossa API aparece tanto nos benchmarks quanto no uso real.

Philip Kiely - inline image

A API GLM-5.2 da Baseten alcança desempenho líder tanto em TTFT quanto em TPS

À medida que modelos como o GLM-5.2 demonstram popularidade sustentada no mercado, aprofundamos nosso investimento em otimizações específicas para cada modelo, a fim de desbloquear melhor latência e taxa de transferência para nossos usuários. Além de melhorar nossa API GLM-5.2, criamos outra API para o modelo: GLM-5.2-Fast.

Alguns trabalhos de desempenho beneficiam ambas as APIs. No último mês, otimizamos o escalonador, aumentando ligeiramente a taxa de transferência, além de implementar pesos NVFP4 aprimorados e um perfil atualizado de decodificação especulativa. Também corrigimos bugs, tanto de qualidade quanto de desempenho, em nosso mecanismo de inferência e em toda a pilha.

Para a API rápida, focamos em reduzir a latência para codificação e agentes. A engenharia de inferência oferece múltiplas oportunidades de trade-off ao longo da fronteira de Pareto entre latência e taxa de transferência. Com base em um forte sinal do mercado de que há disposição para pagar por mais desempenho, a equipe de desempenho de modelos da Baseten revisitou as opções de configuração em paralelismo, loteamento e cache para levar o sistema o mais longe possível em direção à latência. Houve duas mudanças que causaram o maior impacto:

  • Enquanto a API geral usa Paralelismo de Dados com Atenção (ADP) para melhorar a taxa de transferência, a API rápida usa exclusivamente Paralelismo de Tensor e Especialista com configurações selecionadas para latência.
  • Uma redução substancial no tamanho máximo do lote significa que menos solicitações estão competindo por recursos.

Esta API rápida é executada nas mesmas GPUs NVIDIA B200 que a API geral. No entanto, como as otimizações de desempenho trocam taxa de transferência por melhoria na latência, os preços dos tokens de entrada e saída são 50% mais altos na API rápida.

Este trabalho de desempenho aparece nos benchmarks mais recentes da Artificial Analysis, medidos aproximadamente às 19:00, horário do Pacífico, no sábado, 25 de julho de 2026.

Philip Kiely - inline image

O tempo de resposta ponta a ponta é uma métrica importante para a experiência do usuário

Philip Kiely - inline image

A velocidade pura de saída, em termos de TPS, é especialmente importante para modelos de raciocínio que pensam antes de responder a uma pergunta

O desempenho de LLMs varia substancialmente com base na quantidade de tráfego em um sistema, no padrão desse tráfego e nos comprimentos das sequências de entrada e saída. O benchmark da Artificial Analysis envia prompts de aproximadamente 10.000 tokens de entrada para gerar respostas de aproximadamente 1.000 tokens de saída. Recebemos feedback positivo do mercado sobre o desempenho líder da nossa API em uso real, não apenas em benchmarks.

Ainda não terminamos de otimizar o desempenho do GLM-5.2. Temos planos de implementar em breve outra melhoria em nosso algoritmo de decodificação especulativa. Também estamos aprendendo muito com o processo de construção de uma API para o Kimi K3, e estamos ansiosos para aplicar esses aprendizados de volta a outros modelos abertos, como o GLM-5.2.

A nova API rápida para o GLM-5.2 está disponível publicamente na Baseten. Experimente hoje mesmo em https://www.baseten.co/library/glm-52-fast/.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais