
NVIDIA 공식 기술 블로그에 따르면 회사는 대규모 언어모델(LLM)의 자동회귀 디코딩 단계를 빠르게 처리하기 위한 추측 디코딩(speculative decoding) 설계 가이드를 공개했다. 작은 초안 모델이 여러 개의 다음 토큰을 먼저 제안하고, 더 큰 대상 모델이 이를 한 번의 연산으로 병렬 검증하는 방식이다.
대상 모델이 받아들인 토큰만 최종 결과에 남기 때문에, NVIDIA는 허용 기준을 완화하지 않는 한 일반 디코딩과 같은 출력 시퀀스를 유지할 수 있다고 설명했다. 핵심은 대상 모델의 검증 시간과 초안 생성 비용, 실제로 받아들여지는 토큰 수 사이의 균형을 찾는 데 있다.
이번 글은 초안 길이를 정할 때 그래픽처리장치(GPU)의 연산과 메모리 접근 특성, 배치 크기, 키-값(KV) 캐시 압력을 함께 고려해야 한다고 제시했다. 초안 길이를 무조건 늘리기보다, 검증 연산이 메모리 병목에서 연산 중심 구간으로 이동하는 지점과 초안 모델의 지연 시간을 함께 측정해야 한다는 것이다.
NVIDIA는 외부 초안 모델, EAGLE-3, MTP, DFlash, DSpark, 접미사·n-gram 방식 등을 비교 대상으로 들었다. 각각 학습 비용과 서빙 메모리, 초안 생성 비용이 달라 모델 배포 환경과 작업 유형에 맞춰 선택해야 한다고 밝혔다. 회사는 실제 프롬프트 작업군에서 수용 길이를 측정할 수 있는 SPEED-Bench와 Model-Optimizer의 학습·양자화 예시도 함께 안내했다.
생성형 AI 서비스에서 응답 지연과 처리량은 운영 비용 및 사용자 경험과 직결된다. 이번 가이드는 모델 자체의 크기 경쟁과 별개로, 모델·추론 엔진·하드웨어 특성을 함께 조정하는 방식이 LLM 서비스 성능 개선의 한 축이 되고 있음을 보여준다.
출처: NVIDIA Technical Blog https://developer.nvidia.com/blog/co-designing-ai-models-using-speculative-decoding-for-faster-llm-inference/




