Cách chúng tôi xây dựng API nhanh nhất cho GLM-5.2

@philipkiely
TIẾNG ANH2 ngày trước · 26 thg 7, 2026
162K
459
42
26
484

TL;DR

Baseten giải thích cách họ tối ưu hóa API GLM-5.2 để đạt tốc độ dẫn đầu ngành thông qua các cải tiến về bộ lập lịch, điều chỉnh tính song song và tận dụng GPU B200.

Một tháng trước, GLM-5.2 đã được phát hành. Như một phần trong hỗ trợ ngay từ ngày đầu ra mắt, chúng tôi đã xây dựng API nhanh nhất thế giới cho GLM-5.2, với tốc độ đỉnh 280 token mỗi giây và tốc độ trung bình khoảng 100 token mỗi giây. Hôm nay, API GLM-5.2 của chúng tôi được Artificial Analysis đánh giá cho thấy hiệu suất cao hơn gấp đôi so với API ngày ra mắt. Chúng tôi nhận thấy rằng hiệu suất API được cải thiện của chúng tôi thể hiện rõ trong cả điểm chuẩn lẫn sử dụng thực tế.

Philip Kiely - inline image

API GLM-5.2 của Baseten đạt hiệu suất dẫn đầu cả về TTFT và TPS

Khi các mô hình như GLM-5.2 thể hiện sự phổ biến bền vững trên thị trường, chúng tôi tăng cường đầu tư vào công việc tối ưu hóa dành riêng cho từng mô hình để mang lại độ trễ và thông lượng tốt hơn cho người dùng. Ngoài việc cải thiện API GLM-5.2, chúng tôi còn xây dựng một API khác cho mô hình này: GLM-5.2-Fast.

Một số công việc tối ưu hiệu suất mang lại lợi ích cho cả hai API. Trong tháng qua, chúng tôi đã tối ưu hóa bộ lập lịch, tăng nhẹ thông lượng, đồng thời triển khai các trọng số NVFP4 được cải tiến và một hồ sơ suy luận đầu cơ (speculative decoding) được cập nhật. Chúng tôi cũng đã sửa các lỗi về cả chất lượng và hiệu suất trong engine suy luận và xuyên suốt toàn bộ hệ thống.

Đối với API nhanh, chúng tôi tập trung vào việc giảm độ trễ cho lập trình và tác nhân. Kỹ thuật suy luận mang đến nhiều cơ hội để đánh đổi trên đường biên Pareto giữa độ trễ và thông lượng. Dựa trên tín hiệu mạnh mẽ từ thị trường rằng sẵn sàng trả thêm tiền cho hiệu suất cao hơn, đội ngũ hiệu suất mô hình của Baseten đã xem xét lại các tùy chọn cấu hình về song song hóa, xử lý theo lô và bộ nhớ đệm để đẩy hệ thống về phía độ trễ càng nhiều càng tốt. Có hai thay đổi tạo ra tác động lớn nhất:

  • Trong khi API thông thường sử dụng Song song hóa Dữ liệu Chú ý (ADP) để cải thiện thông lượng, API nhanh chỉ sử dụng Song song hóa Tensor và Chuyên gia với các cấu hình được chọn cho độ trễ.
  • Việc giảm đáng kể kích thước lô tối đa đồng nghĩa với việc ít yêu cầu hơn phải cạnh tranh tài nguyên.

API nhanh này chạy trên cùng các GPU NVIDIA B200 như API thông thường. Tuy nhiên, vì các tối ưu hiệu suất đánh đổi thông lượng để cải thiện độ trễ, giá token đầu vào và đầu ra trên API nhanh cao hơn 50%.

Công việc tối ưu hiệu suất này thể hiện trong các điểm chuẩn mới nhất từ Artificial Analysis, được đo lường vào khoảng 7:00 PM Giờ Thái Bình Dương, Thứ Bảy, ngày 25 tháng 7 năm 2026.

Philip Kiely - inline image

Thời gian phản hồi đầu cuối là một chỉ số quan trọng cho trải nghiệm người dùng

Philip Kiely - inline image

Tốc độ đầu ra thuần túy, tính theo TPS, đặc biệt quan trọng đối với các mô hình suy luận vốn phải suy nghĩ trước khi trả lời truy vấn

Hiệu suất LLM thay đổi đáng kể dựa trên lượng lưu lượng truy cập trong hệ thống, mẫu hình của lưu lượng đó, cũng như độ dài chuỗi đầu vào và đầu ra. Điểm chuẩn của Artificial Analysis gửi các prompt với khoảng 10.000 token đầu vào để tạo ra phản hồi với khoảng 1.000 token đầu ra. Chúng tôi đã nhận được phản hồi tích cực từ thị trường về hiệu suất dẫn đầu của API trong sử dụng thực tế, chứ không chỉ ở điểm chuẩn.

Chúng tôi chưa dừng lại ở việc tối ưu hiệu suất của GLM-5.2. Chúng tôi có kế hoạch triển khai một cải tiến khác cho thuật toán suy luận đầu cơ của mình trong thời gian tới. Chúng tôi cũng đang học hỏi được rất nhiều từ quá trình xây dựng API cho Kimi K3, và chúng tôi mong muốn áp dụng những bài học này trở lại cho các mô hình mở khác như GLM-5.2.

API nhanh mới cho GLM-5.2 hiện có sẵn công khai trên Baseten. Hãy dùng thử ngay hôm nay tại https://www.baseten.co/library/glm-52-fast/.

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral