pile·

GenAI를 위한 Gateway

kakao tech·if(kakao)25 2025··
#kubernetes#gpu#observability#envoy#ai-gateway#llm-serving#load-balancing

챕터별 상세

010:10 – 4:58

GenAI 서빙이 기존 웹과 다른 이유

모델별 전용 인프라에서 여러 open·closed model과 tool을 조합하는 공통 플랫폼으로 흐름이 바뀌었다. LLM 요청은 prompt·history·tool 결과에 따라 크기가 크게 달라지고 token streaming과 초 단위 지연을 가진다. 같은 QPS라도 input·output token 수에 따라 prefill 연산과 KV cache가 달라져 요청 한 건을 같은 비용으로 보는 전통 gateway 가정이 깨진다.