Wie wir die bisher schnellste API für GLM-5.2 entwickelt haben

@philipkiely
ENGLISCHvor 2 Tagen · 26. Juli 2026
162K
459
42
26
484

TL;DR

Baseten erklärt, wie sie die GLM-5.2 API optimiert haben, um durch Verbesserungen am Scheduler, Anpassungen der Parallelisierung und die Nutzung von B200 GPUs branchenführende Geschwindigkeiten zu erzielen.

Vor einem Monat wurde GLM-5.2 veröffentlicht. Im Rahmen unseres Day-Zero-Supports haben wir die schnellste API der Welt für GLM-5.2 entwickelt, mit Spitzengeschwindigkeiten von 280 Tokens pro Sekunde und Durchschnittsgeschwindigkeiten von etwa 100 Tokens pro Sekunde. Heute zeigt unsere GLM-5.2-API, wie von Artificial Analysis getestet, mehr als die doppelte Leistung im Vergleich zur API zum Starttag. Wir stellen fest, dass sich unsere verbesserte API-Leistung sowohl in Benchmarks als auch in der realen Nutzung bemerkbar macht.

Philip Kiely - inline image

Die GLM-5.2-API von Baseten erzielt führende Leistung sowohl bei TTFT als auch bei TPS.

Da Modelle wie GLM-5.2 eine anhaltende Beliebtheit auf dem Markt zeigen, verstärken wir unsere Investitionen in modellspezifische Optimierungsarbeiten, um unseren Benutzern eine bessere Latenz und höheren Durchsatz zu ermöglichen. Zusätzlich zur Verbesserung unserer GLM-5.2-API haben wir eine weitere API für das Modell entwickelt: GLM-5.2-Fast.

Einige Leistungsoptimierungen kommen beiden APIs zugute. Im letzten Monat haben wir den Scheduler optimiert und den Durchsatz leicht erhöht, sowie verbesserte NVFP4-Gewichte und ein aktualisiertes spekulatives Dekodierungsprofil ausgerollt. Wir haben auch Fehler in Bezug auf Qualität und Leistung in unserer Inference-Engine und im gesamten Stack behoben.

Für die schnelle API konzentrierten wir uns darauf, die Latenz für Code und Agenten zu reduzieren. Inference Engineering bietet mehrere Möglichkeiten, entlang der Pareto-Grenze zwischen Latenz und Durchsatz abzuwägen. Basierend auf einem starken Signal aus dem Markt, dass eine Zahlungsbereitschaft für mehr Leistung besteht, hat das Modellleistungsteam von Baseten die Konfigurationsoptionen in Bezug auf Parallelität, Batching und Caching überarbeitet, um das System so weit wie möglich in Richtung Latenz zu treiben. Es gab zwei Änderungen mit der größten Auswirkung:

  • Während die allgemeine API Attention Data Parallelism (ADP) zur Verbesserung des Durchsatzes verwendet, nutzt die schnelle API ausschließlich Tensor- und Expert-Parallelität mit für die Latenz ausgewählten Konfigurationen.
  • Eine erhebliche Reduzierung der maximalen Batch-Größe bedeutet, dass weniger Anfragen um Ressourcen konkurrieren.

Diese schnelle API läuft auf denselben NVIDIA B200 GPUs wie die allgemeine API. Da die Leistungsoptimierungen jedoch Durchsatz gegen Latenz eintauschen, sind die Preise für Eingabe- und Ausgabe-Tokens bei der schnellen API um 50 % höher.

Diese Leistungsoptimierungen zeigen sich in den neuesten Benchmarks von Artificial Analysis, gemessen am Samstag, 25. Juli 2026, um ca. 19:00 Uhr Pacific Time.

Philip Kiely - inline image

Die End-to-End-Antwortzeit ist eine wichtige Metrik für die Benutzererfahrung.

Philip Kiely - inline image

Die reine Ausgabegeschwindigkeit in Bezug auf TPS ist besonders wichtig für Reasoning-Modelle, die vor der Beantwortung einer Anfrage nachdenken.

Die Leistung von LLMs variiert erheblich je nach Verkehrsaufkommen in einem System, dem Muster dieses Verkehrs und den Längen der Eingabe- und Ausgabesequenzen. Der Artificial Analysis Benchmark sendet Prompts von etwa 10.000 Eingabe-Tokens, um Antworten von etwa 1.000 Ausgabe-Tokens zu generieren. Wir haben positives Feedback aus dem Markt zur führenden Leistung unserer API in der realen Nutzung erhalten, nicht nur in Benchmarks.

Wir sind noch nicht fertig mit der Optimierung der Leistung von GLM-5.2. Wir haben Pläne, in Kürze eine weitere Verbesserung unseres spekulativen Dekodierungsalgorithmus auszurollen. Außerdem lernen wir viel aus dem Prozess der Entwicklung einer API für Kimi K3 und freuen uns darauf, diese Erkenntnisse auf andere offene Modelle wie GLM-5.2 anzuwenden.

Die neue schnelle API für GLM-5.2 ist öffentlich auf Baseten verfügbar. Testen Sie sie noch heute unter https://www.baseten.co/library/glm-52-fast/.

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken