Un mese fa, GLM-5.2 è stato rilasciato. Come parte del nostro supporto day-zero, abbiamo costruito l'API più veloce al mondo per GLM-5.2, con velocità di picco di 280 token al secondo e velocità medie di circa 100 token al secondo. Oggi, la nostra API per GLM-5.2, come benchmarkata da Artificial Analysis, mostra prestazioni più che doppie rispetto all'API del giorno del lancio. Riteniamo che le prestazioni migliorate della nostra API si riflettano sia nei benchmark che nell'uso reale.

L'API GLM-5.2 di Baseten raggiunge prestazioni leader sia in TTFT che in TPS
Poiché modelli come GLM-5.2 dimostrano una popolarità sostenuta sul mercato, approfondiamo il nostro investimento nel lavoro di ottimizzazione specifica per modello per sbloccare una migliore latenza e throughput per i nostri utenti. Oltre a migliorare la nostra API per GLM-5.2, abbiamo costruito un'altra API per il modello: GLM-5.2-Fast.
Alcuni lavori sulle prestazioni avvantaggiano entrambe le API. Nell'ultimo mese, abbiamo ottimizzato lo scheduler, aumentando leggermente il throughput, oltre a implementare pesi NVFP4 migliorati e un profilo di decodifica speculativa aggiornato. Abbiamo anche risolto bug sia sulla qualità che sulle prestazioni nel nostro motore di inferenza e in tutto lo stack.
Per la API veloce, ci siamo concentrati sulla riduzione della latenza per coding e agenti. L'ingegneria dell'inferenza offre molteplici opportunità di scambio lungo la frontiera di Pareto tra latenza e throughput. Basandoci su un forte segnale dal mercato che c'è disponibilità a pagare per più prestazioni, il team di prestazioni del modello di Baseten ha rivisitato le opzioni di configurazione su parallelismo, batching e caching per spingere il sistema il più possibile verso la latenza. Ci sono state due modifiche che hanno avuto il maggior impatto:
- Mentre l'API generale utilizza Attention Data Parallelism (ADP) per migliorare il throughput, la API veloce utilizza esclusivamente Tensor e Expert Parallelism con configurazioni selezionate per la latenza.
- Una riduzione sostanziale della dimensione massima del batch significa che meno richieste competono per le risorse.
Questa API veloce viene eseguita sulle stesse GPU NVIDIA B200 dell'API generale. Tuttavia, poiché le ottimizzazioni delle prestazioni scambiano throughput per migliorare la latenza, i prezzi dei token di input e output sono del 50% più alti sulla API veloce.
Questo lavoro sulle prestazioni si riflette negli ultimi benchmark di Artificial Analysis, misurati approssimativamente alle 19:00 ora del Pacifico di sabato 25 luglio 2026.

Il tempo di risposta end-to-end è una metrica importante per l'esperienza utente

La velocità di output pura, in termini di TPS, è particolarmente importante per i modelli di ragionamento che pensano prima di rispondere a una query
Le prestazioni degli LLM variano sostanzialmente in base alla quantità di traffico in un sistema, al modello di detto traffico e alle lunghezze delle sequenze di input e output. Il benchmark Artificial Analysis invia prompt di circa 10.000 token di input per generare risposte di circa 1.000 token di output. Abbiamo ricevuto feedback positivi dal mercato riguardo alle prestazioni leader della nostra API nell'uso reale, non solo nei benchmark.
Non abbiamo finito di ottimizzare le prestazioni di GLM-5.2. Abbiamo intenzione di implementare un altro miglioramento al nostro algoritmo di decodifica speculativa a breve. Stiamo anche imparando molto dal processo di costruzione di un'API per Kimi K3, e non vediamo l'ora di applicare questi apprendimenti ad altri modelli aperti come GLM-5.2.
La nuova API veloce per GLM-5.2 è disponibile pubblicamente su Baseten. Provatela oggi stesso su https://www.baseten.co/library/glm-52-fast/.





