pile·

지연 시간 순삭! LLM 추론 구조와 효율적 Application 설계

kakao tech·if-kakao-2024 ··
#rag#continuous-batching#kv-cache#latency-optimization#llm-inference#structured-output#prefix-caching

챕터별 상세

010:14 – 5:00

실시간 Character Persona의 Latency

작품 속 character와 대화하는 service는 personality와 story knowledge를 지키면서 사람이 답하는 듯 빠르게 반응해야 한다. 첫 token까지의 시간과 전체 generation 시간을 나눠 보고, model 교체만 기다리지 않고 prompt·task·output과 serving architecture를 함께 최적화하는 접근을 제시한다.