pile·
AI / ML·카카오페이카카오페이·

[if kakao 2022] ML 모델 학습 파이프라인 설계 (feat. MLOps 플랫폼)

문제FDS·CSS·페이프로필 등 여러 ML 모델을 서빙할 때마다 서빙 서버와 피처 테이블을 중복 구축해 개발 부채가 누적됐다.
접근워크플로우는 Airflow·SageMaker Pipelines와 비교 후 AWS Step Functions, 모델 레지스트리는 MLflow 대신 SageMaker Model Registry를 채택했다. Git→Jenkins→S3→Lambda→Step Functions 파이프라인을 구성했다.
결과데이터 사이언티스트가 train.py·preprocessing.py·evaluation.py·config.yaml만 제공하면 학습 워크플로우가 자동 생성돼 표준화와 진입 장벽 완화를 달성했다.
카카오페이
카카오페이 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2