pile·

LLM 서빙하기

kakao tech·if-kakao-2024 ··
#vllm#llm-serving#paged-attention#continuous-batching#gpu-inference#triton-inference-server

챕터별 상세

010:11 – 4:50

Local LLM을 직접 Serving하는 이유

금융 domain의 보안·비용·성능 요구 때문에 외부 API만 사용하지 않고 model을 자체 GPU server에 배포해야 하는 상황을 다룬다. 카카오페이의 요약·FAQ·보험 진단 service를 예로 들어, 사용자 요청과 RAG 문서를 inference server로 전달하고 실시간 응답을 만드는 serving layer의 역할을 정의한다.