pile·
AI / ML·카카오페이카카오페이·

모델 서빙 최적화를 위한 프레임워크 선정과 서빙 성능 극대화하기

문제얼굴 인식·OCR 등 실시간 딥러닝 서비스를 운영하면서 다양한 모델 포맷과 언어 간 변환, 직접 서빙 서버 튜닝 비용이 큰 부담이었다.
접근FastAPI, TensorFlow Serving, NVIDIA Triton을 G4dn GPU + ResNet50으로 비교했다. 선정된 Triton에 TensorRT, Dynamic Batching, Concurrent Model Execution, Model Analyzer를 조합 적용했다.
결과단일 모델 처리량을 150 RPS에서 약 500 RPS까지 330% 이상 끌어올렸고, Python 단일 언어로 운영을 통일했다. Dynamic Batching이 가장 큰 레버였다.
카카오페이
카카오페이 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2