
Cloudflare 공식 기술 블로그에 따르면 회사는 Workers AI에서 대형 오픈 모델인 Kimi K2.6과 GLM 5.2를 운영하기 위해 KV 캐시와 모델 가중치의 정밀도를 낮추고, 여러 요청이 공유하는 캐시의 무결성을 검사하는 방식을 적용했다. 대형 모델 추론에서 GPU 메모리 부족을 줄이면서 처리량과 안전성을 함께 확보하려는 시도다.
대규모언어모델은 답변을 생성할 때 이미 처리한 토큰의 어텐션 키와 값을 KV 캐시에 저장한다. 문맥이 길어질수록 이 캐시가 빠르게 커져 모델 가중치보다 먼저 GPU 메모리를 채우기도 한다. Cloudflare는 기본 16비트 부동소수점 형식인 BF16 대신 8비트 FP8 형식으로 KV 캐시를 저장했다.
이 변경으로 캐시가 차지하는 공간은 절반으로 줄었다. Kimi K2.6을 H200 기반 분리형 추론 환경에서 운용할 때 메모리에 담을 수 있는 문맥 규모는 약 68만6000토큰에서 137만토큰으로 늘었다. 다만 FP8 값을 읽는 과정에 변환 연산이 추가되므로 요청 한 건의 순수 처리 속도가 빨라지는 방식은 아니다. 같은 GPU에 더 많은 요청과 문맥을 유지할 수 있다는 점이 핵심이다.
GLM 5.2에는 가중치를 FP8에서 4비트 정수인 INT4로 압축하는 방법을 적용했다. 체크포인트 크기는 705GB에서 421GB로 약 40% 줄었고, 8개 GPU에 텐서 병렬로 배치했을 때 GPU당 가중치 메모리는 약 88GB에서 52GB로 감소했다. 남은 공간에는 약 118만토큰 규모의 KV 캐시를 추가로 둘 수 있었다.
압축 효과는 추론 단계에 따라 달랐다. 토큰을 한 개씩 생성하는 디코드 단계에서는 메모리에서 읽어야 할 가중치가 줄어 INT4가 더 유리했다. 동시 요청 한 건 기준 처리량은 초당 60토큰에서 92토큰으로 55% 늘었다. 반면 입력 문맥을 처음 처리하는 프리필 단계에서는 INT4 가중치를 다시 확장하는 비용이 발생해 FP8이 더 빨랐다. Cloudflare는 디코드에는 INT4, 프리필에는 FP8을 사용하는 분리 전략을 택했다.
정밀도를 낮추면서 모델 품질이 떨어질 가능성도 점검했다. Cloudflare는 자체 평가에서 INT4 모델과 FP8 모델의 차이가 모든 벤치마크에서 0.8점 이내였다고 밝혔다. Kimi의 FP8 KV 캐시도 수학 문제와 코드 생성, 도구 호출 유효성 평가에서 BF16과 비슷한 결과를 보였다고 설명했다.
동시에 더 많은 요청이 하나의 물리적 KV 캐시를 공유하게 되면서 잘못된 캐시 페이지를 읽는 위험도 커진다. 회사는 페이지가 재할당될 때마다 태그를 바꾸고, 요청이 기대하는 페이지와 태그가 일치하는지 디코드 전에 확인하는 무결성 검사를 추가했다. 불일치가 발견되면 다른 요청의 데이터를 반환하지 않고 해당 요청을 중단한다. 측정된 처리량과 95번째 백분위 지연시간의 변화는 모두 1% 미만이었다.
이번 결과는 대형 모델 추론 비용을 줄이기 위해 단일 압축 형식을 일괄 적용하기보다 프리필과 디코드의 계산 특성을 나눠 최적화할 필요가 있음을 보여준다. 다만 수치는 Cloudflare의 H200 배포와 자체 평가 환경에서 나온 만큼 다른 GPU 구성이나 요청 패턴에서도 같은 폭의 개선을 보장하는 것은 아니다.
출처: Cloudflare 공식 기술 블로그 https://blog.cloudflare.com/smaller-faster-safer-models/








![[속보] CISA, LiteLLM·Check Point VPN 취약점 KEV 등재…활성 악용 확인](/_next/image?url=https%3A%2F%2Fdevfive-file.s3.ap-northeast-2.amazonaws.com%2Fdev-letter%2F20260608_201258_security-vulnerability-alert.jpg&w=3840&q=75)
