한 달 전, GLM-5.2가 출시되었습니다. 저희는 출시 당일부터 제로데이 지원의 일환으로 GLM-5.2를 위한 업계 최고 속도의 API를 구축했으며, 최고 속도는 초당 280 토큰, 평균 속도는 초당 약 100 토큰을 기록했습니다. 오늘, Artificial Analysis의 벤치마크 결과에 따르면 저희의 GLM-5.2 API는 출시 당일 대비 2배 이상의 성능을 보여주고 있습니다. 개선된 API 성능은 벤치마크뿐만 아니라 실제 사용 환경에서도 확인할 수 있습니다.

Baseten의 GLM-5.2 API는 TTFT와 TPS 모두에서 업계 선도적인 성능을 달성했습니다.
GLM-5.2와 같은 모델이 시장에서 지속적인 인기를 얻음에 따라, 저희는 모델별 최적화 작업에 투자를 강화하여 사용자에게 더 나은 지연 시간과 처리량을 제공하고 있습니다. GLM-5.2 API를 개선하는 것 외에도, 해당 모델을 위한 또 다른 API인 GLM-5.2-Fast를 구축했습니다.
일부 성능 개선 작업은 두 API 모두에 혜택을 줍니다. 지난 한 달 동안 저희는 스케줄러를 최적화하여 처리량을 소폭 증가시켰고, 개선된 NVFP4 가중치와 업데이트된 추측 디코딩 프로필을 도입했습니다. 또한 추론 엔진과 전체 스택에서 품질 및 성능 관련 버그를 수정했습니다.
고속 API의 경우, 코딩 및 에이전트의 지연 시간을 줄이는 데 집중했습니다. 추론 엔지니어링은 지연 시간과 처리량 간의 파레토 프론티어를 따라 여러 트레이드오프 기회를 제공합니다. 시장에서 더 나은 성능에 대한 지불 의사가 있다는 강력한 신호를 바탕으로, Baseten의 모델 성능 팀은 병렬 처리, 배치 처리, 캐싱 전반의 구성 옵션을 재검토하여 시스템을 지연 시간 측면에서 최대한 최적화했습니다. 가장 큰 영향을 미친 두 가지 변경 사항은 다음과 같습니다.
- 일반 API는 처리량 향상을 위해 Attention Data Parallelism (ADP)을 사용하는 반면, 고속 API는 지연 시간에 최적화된 설정으로 Tensor 및 Expert Parallelism만 사용합니다.
- 최대 배치 크기를 대폭 줄여 리소스 경합을 최소화했습니다.
이 고속 API는 일반 API와 동일한 NVIDIA B200 GPU에서 실행됩니다. 그러나 성능 최적화가 처리량을 희생하여 지연 시간을 개선하므로, 입력 및 출력 토큰 가격이 고속 API에서 50% 더 높습니다.
이러한 성능 개선은 2026년 7월 25일 토요일 오후 7시(태평양 표준시)경에 측정된 최신 Artificial Analysis 벤치마크에 반영되어 있습니다.

종단 간 응답 시간은 사용자 경험에 중요한 지표입니다.

순수 출력 속도(TPS)는 질문에 답변하기 전에 사고하는 추론 모델에 특히 중요합니다.
LLM 성능은 시스템 내 트래픽 양, 트래픽 패턴, 입력 및 출력 시퀀스 길이에 따라 크게 달라집니다. Artificial Analysis 벤치마크는 약 10,000개의 입력 토큰으로 구성된 프롬프트를 보내 약 1,000개의 출력 토큰으로 구성된 응답을 생성합니다. 저희는 벤치마크뿐만 아니라 실제 사용 환경에서도 API의 선도적인 성능에 대해 시장으로부터 긍정적인 피드백을 받았습니다.
저희는 GLM-5.2의 성능 최적화를 계속 진행 중입니다. 곧 추측 디코딩 알고리즘에 대한 또 다른 개선 사항을 도입할 계획입니다. 또한 Kimi K3용 API를 구축하는 과정에서 많은 것을 배우고 있으며, 이러한 학습 내용을 GLM-5.2와 같은 다른 오픈 모델에도 적용할 수 있기를 기대합니다.
GLM-5.2용 새로운 고속 API는 Baseten에서 공개적으로 사용할 수 있습니다. 지금 https://www.baseten.co/library/glm-52-fast/에서 직접 사용해보세요.





