pile·
AI / ML·cloudflare-blogCloudflare Blog·

더 작고 빠르고 안전하게: Kimi와 GLM 대규모 서빙 최적화

Cloudflare Workers AI가 Moonshot의 Kimi K-시리즈와 Z.ai의 GLM처럼 메모리 제약이 큰 대형 MoE(Mixture-of-Experts) 모델을 효율적으로 서빙하기 위해 적용한 세 가지 최적화 기법을 다룬다. KV 캐시 양자화, 모델 가중치 압축, 공유 KV 캐시 무결성 검사를 계층적으로 적용해 처리량을 크게 높이고 비용을 낮췄다.

핵심 포인트
  • KV 캐시를 BF16에서 FP8(e4m3)로 양자화해 크기를 절반으로 줄이고, Kimi K2.6의 컨텍스트 용량을 686K → 1.37M 토큰으로 2배 확장했다.
  • FP8 KV 캐시에서 64 동시 요청 기준 처리량이 2,192 tokens/sec — BF16 대비 41% 향상, 토큰당 비용은 약 30% 절감.
  • GLM 5.2 가중치를 FP8 → INT4로 압축해 체크포인트 크기를 705GB → 421GB(40% 감소)로 줄였다.
  • prefill(compute-bound)은 BF16/FP8, decode(memory-bandwidth-bound)는 INT4를 각각 적용하는 분리 서빙 전략을 사용한다.
  • 수백 요청이 GPU KV 캐시를 공유할 때 페이지 태그 기반 무결성 검사로 잘못된 데이터 반환을 방지하며, 오버헤드는 처리량과 tail latency 모두 1% 미만이다.
상세 정리
  • 배경: Workers AI는 Kimi K-시리즈, GLM 같은 대형 MoE 모델을 prefill/decode 분리 인프라 위에서 운영 중이다. 이 위에 3가지 기법을 추가로 적용했다.
  • KV 캐시 FP8 양자화: attention 키·값을 기본 BF16 대신 FP8 e4m3 포맷으로 저장해 캐시 크기를 절반으로 줄인다. Kimi K2.6 기준 최대 컨텍스트 길이가 2배로 늘었다.
  • FP8 처리량 실험: 동시 요청 64개 기준 FP8 캐시는 BF16보다 41% 높은 처리량(2,192 vs 1,555 tokens/sec)을 보이며, 토큰당 비용은 약 30% 낮다.
  • prefill은 BF16 유지: prefill은 compute-bound라 메모리 절감 효과가 없으므로 BF16을 그대로 유지하고, memory-bandwidth-bound인 decode만 FP8/INT4를 적용한다.
  • GLM 가중치 INT4 압축: GLM 5.2를 FP8에서 INT4로 추가 압축하면 체크포인트 크기 705GB → 421GB, GPU당 메모리 사용 88GB → 52GB로 줄어 KV 캐시 공간이 약 1.18M 토큰 확보된다.
  • 정확도 영향: FP8 캐시와 BF16 캐시 품질은 평가상 구분 불가능. INT4 가중치도 모든 벤치마크에서 정확도 차이 0.8점 이내다.
  • KV 캐시 무결성 보호: 수백 요청이 동일 GPU의 물리 KV 캐시를 공유하기 때문에, 각 물리 캐시 페이지에 재할당 시 변경되는 태그를 부여하고 decode 전 매핑을 검증한다. 불일치 시 잘못된 데이터 반환 대신 요청을 중단한다.
  • 오버헤드: 무결성 검사 비용은 처리량과 tail latency 모두 1% 미만이다.
  • 인프라: 모든 실험과 프로덕션 트래픽은 오픈소스 inference 서빙 프레임워크 SGLang 위에서 운영된다.
왜 읽나대형 MoE 모델을 GPU 클러스터에서 비용 효율적으로 서빙해야 하는 ML 인프라 엔지니어에게 KV 캐시 양자화와 가중치 압축의 실전 수치를 보여주는 레퍼런스다.
cloudflare-blog
Cloudflare Blog 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·cloudflare-blogCloudflare Blog·

    AI 에이전트에는 컨테이너보다 경량 컴퓨트가 — @cloudflare/computer 소개

    Cloudflare가 AI 에이전트 런타임 패키지 @cloudflare/computer 얼리 프리뷰를 공개했다. 에이전트마다 컨테이너를 할당하는 방식이 수십억 동시 에이전트 규모로 확장되지 않는 문제를 해결하기 위해, 경량 isolate와 풀 Linux 컨테이너를 작업 복잡도에 따라 동적으로 선택하는 하이브리드 아키텍처를 제안한다.

    #agent-engineering#serverless#cloudflare-workers+2