一個月前,GLM-5.2 發布了。作為我們提供即時支援的一部分,我們打造了全世界最快的 GLM-5.2 API,峰值速度達到每秒 280 個 token,平均速度約為每秒 100 個 token。今天,我們的 GLM-5.2 API 經過 Artificial Analysis 的基準測試,效能比起上線當天的 API 提升超過一倍。我們發現,API 效能的改善同時反映在基準測試與實際使用情境中。

Baseten 的 GLM-5.2 API 在 TTFT 與 TPS 兩項指標上都達到領先效能
隨著 GLM-5.2 這類模型在市場上持續展現人氣,我們也加深了針對特定模型的優化投入,以為使用者解鎖更低的延遲與更高的吞吐量。除了改善 GLM-5.2 API 之外,我們還為該模型建立了另一個 API:GLM-5.2-Fast。
有些效能優化工作對兩個 API 都有幫助。過去一個月來,我們優化了排程器,小幅提升吞吐量,同時也推出了改進的 NVFP4 權重與更新的推測解碼設定檔。我們也修復了推論引擎及整個技術堆疊中關於品質與效能的各項錯誤。
針對快速 API,我們專注於降低程式碼生成與 Agent 的延遲。推論工程提供了多種在延遲與吞吐量之間的帕累托前沿上進行取捨的機會。基於市場上強烈的訊號——使用者願意為更高效能付費——Baseten 的模型效能團隊重新檢視了平行處理、批次處理與快取的配置選項,將系統盡可能推向低延遲。其中影響最大的兩項變更如下:
- 一般 API 使用注意力資料平行處理(ADP)來提升吞吐量,而快速 API 則完全使用張量與專家平行處理,並選用針對延遲優化的配置。
- 大幅降低最大批次大小,使較少請求競爭資源。
這個快速 API 與一般 API 一樣,都運行在相同的 NVIDIA B200 GPU 上。然而,由於效能優化犧牲了吞吐量來換取延遲改善,因此快速 API 的輸入與輸出 token 價格比一般 API 高出 50%。
這項效能優化成果已反映在 Artificial Analysis 最新的基準測試中,數據測量時間為 2026 年 7 月 25 日(星期六)太平洋時間約晚上 7:00。

端到端回應時間是使用者體驗的重要指標

純粹的輸出速度(以 TPS 衡量)對於需要先思考再回答查詢的推理模型尤其重要
LLM 的效能會因系統中的流量多寡、流量模式以及輸入與輸出序列長度而有顯著差異。Artificial Analysis 的基準測試會送出約 10,000 個輸入 token 的提示詞,並要求模型產生約 1,000 個輸出 token 的回應。我們已收到市場對於我們 API 在實際使用情境中(而非僅在基準測試中)展現領先效能的正面回饋。
我們還沒停止優化 GLM-5.2 的效能。我們計劃在近期內推出另一項針對推測解碼演算法的改進。同時,我們也從建立 Kimi K3 API 的過程中學到很多,並期待將這些經驗應用回 GLM-5.2 等其他開放模型。
新的 GLM-5.2 快速 API 已於 Baseten 上公開提供。立即試用:https://www.baseten.co/library/glm-52-fast/。





