
미국 워싱턴대 SyFI 연구진이 24일 공개한 원문에 따르면, 'ServingStudio'는 대규모언어모델(LLM) 추론 시스템의 성능을 예측하는 시뮬레이터와 개선안을 구현·검증하는 에이전트를 결합한 도구다. 모델과 하드웨어, 요청 분포, 병렬화 방식이 달라질 때 어떤 설정이 유리한지 실제 GPU 실험에 앞서 살펴보도록 설계됐다.
시뮬레이터는 측정한 GPU 커널 실행 시간을 바탕으로 처리량과 실행 비용을 예측한다. 연구진은 접두부 캐싱, 추측 디코딩, 프리필과 디코드의 분리 등 여러 서빙 기능을 모델링하고, 예측 결과를 SGLang과 vLLM의 실제 측정값에 맞춰 검증한다고 설명했다. 에이전트는 분석 결과를 토대로 변경안을 코드에 반영한 뒤 GPU 프로파일링과 정확성 검사, 하드웨어 벤치마크로 효과를 확인한다.
연구진이 제시한 사례에서는 SGLang의 MoE 자동 튜닝 경로를 바꿔 입력 처리량을 5.6% 높였다. 또 vLLM의 CUDA 그래프 설정을 조정한 별도 실험에서 출력 처리량이 10.8% 증가했다고 밝혔다. 두 수치는 각각 연구진이 정한 모델·장비·요청 조건에서 얻은 결과로, 모든 서비스 환경에 같은 개선 폭이 적용된다는 뜻은 아니다.
공개 저장소에는 시뮬레이터, 에이전트, 결과 시각화 UI가 함께 정리돼 있다. ServingStudio의 의미는 단순히 더 빠른 설정을 찾는 데 그치지 않는다. 시뮬레이션이 제안한 변경을 실제 프레임워크에서 측정하고, 예측과 실측의 차이를 다음 분석에 반영하는 반복 절차를 한 작업 흐름으로 묶었다는 점에 있다.
출처: 워싱턴대 SyFI 연구진 원문 https://syfi.cs.washington.edu/blog/2026-09-24-introducing-servingstudio/ ; ServingStudio 공식 저장소 https://github.com/SyFI-ServingStudio/ServingStudio