Come abbiamo creato la nuova API più veloce per GLM-5.2

@philipkiely
INGLESE2 giorni fa · 26 lug 2026
162K
459
42
26
484

TL;DR

Baseten spiega come ha ottimizzato l'API GLM-5.2 per raggiungere velocità leader del settore grazie a miglioramenti dello scheduler, regolazioni del parallelismo e l'utilizzo della GPU B200.

Un mese fa, GLM-5.2 è stato rilasciato. Come parte del nostro supporto day-zero, abbiamo costruito l'API più veloce al mondo per GLM-5.2, con velocità di picco di 280 token al secondo e velocità medie di circa 100 token al secondo. Oggi, la nostra API per GLM-5.2, come benchmarkata da Artificial Analysis, mostra prestazioni più che doppie rispetto all'API del giorno del lancio. Riteniamo che le prestazioni migliorate della nostra API si riflettano sia nei benchmark che nell'uso reale.

Philip Kiely - inline image

L'API GLM-5.2 di Baseten raggiunge prestazioni leader sia in TTFT che in TPS

Poiché modelli come GLM-5.2 dimostrano una popolarità sostenuta sul mercato, approfondiamo il nostro investimento nel lavoro di ottimizzazione specifica per modello per sbloccare una migliore latenza e throughput per i nostri utenti. Oltre a migliorare la nostra API per GLM-5.2, abbiamo costruito un'altra API per il modello: GLM-5.2-Fast.

Alcuni lavori sulle prestazioni avvantaggiano entrambe le API. Nell'ultimo mese, abbiamo ottimizzato lo scheduler, aumentando leggermente il throughput, oltre a implementare pesi NVFP4 migliorati e un profilo di decodifica speculativa aggiornato. Abbiamo anche risolto bug sia sulla qualità che sulle prestazioni nel nostro motore di inferenza e in tutto lo stack.

Per la API veloce, ci siamo concentrati sulla riduzione della latenza per coding e agenti. L'ingegneria dell'inferenza offre molteplici opportunità di scambio lungo la frontiera di Pareto tra latenza e throughput. Basandoci su un forte segnale dal mercato che c'è disponibilità a pagare per più prestazioni, il team di prestazioni del modello di Baseten ha rivisitato le opzioni di configurazione su parallelismo, batching e caching per spingere il sistema il più possibile verso la latenza. Ci sono state due modifiche che hanno avuto il maggior impatto:

  • Mentre l'API generale utilizza Attention Data Parallelism (ADP) per migliorare il throughput, la API veloce utilizza esclusivamente Tensor e Expert Parallelism con configurazioni selezionate per la latenza.
  • Una riduzione sostanziale della dimensione massima del batch significa che meno richieste competono per le risorse.

Questa API veloce viene eseguita sulle stesse GPU NVIDIA B200 dell'API generale. Tuttavia, poiché le ottimizzazioni delle prestazioni scambiano throughput per migliorare la latenza, i prezzi dei token di input e output sono del 50% più alti sulla API veloce.

Questo lavoro sulle prestazioni si riflette negli ultimi benchmark di Artificial Analysis, misurati approssimativamente alle 19:00 ora del Pacifico di sabato 25 luglio 2026.

Philip Kiely - inline image

Il tempo di risposta end-to-end è una metrica importante per l'esperienza utente

Philip Kiely - inline image

La velocità di output pura, in termini di TPS, è particolarmente importante per i modelli di ragionamento che pensano prima di rispondere a una query

Le prestazioni degli LLM variano sostanzialmente in base alla quantità di traffico in un sistema, al modello di detto traffico e alle lunghezze delle sequenze di input e output. Il benchmark Artificial Analysis invia prompt di circa 10.000 token di input per generare risposte di circa 1.000 token di output. Abbiamo ricevuto feedback positivi dal mercato riguardo alle prestazioni leader della nostra API nell'uso reale, non solo nei benchmark.

Non abbiamo finito di ottimizzare le prestazioni di GLM-5.2. Abbiamo intenzione di implementare un altro miglioramento al nostro algoritmo di decodifica speculativa a breve. Stiamo anche imparando molto dal processo di costruzione di un'API per Kimi K3, e non vediamo l'ora di applicare questi apprendimenti ad altri modelli aperti come GLM-5.2.

La nuova API veloce per GLM-5.2 è disponibile pubblicamente su Baseten. Provatela oggi stesso su https://www.baseten.co/library/glm-52-fast/.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali