pile·

메시지 광고 추천 Deep Learning Inference Server 개선: JVM ONNX Runtime에서 NVIDIA Triton까지

kakao tech·if-kakao-2024 ··
#model-serving#inference-optimization#performance-testing#nvidia-triton#onnx-runtime#recommendation-system

챕터별 상세

010:11 – 5:49

메시지 광고 Inference Server의 변화

사용자 반응으로 model을 빠르게 학습하고 channel별 광고 후보를 ranking하는 system에 LLM 기반 embedding feature가 추가되면서 기존 JVM inference server의 한계가 드러났다. 발표는 추천 domain과 online model 특성, 기존 최적화, Triton 전환 benchmark와 운영 중 마주친 문제를 순서대로 설명한다.