카카오클라우드에서 data 수집·정제·lake 저장부터 Kubeflow 기반 model 개발·학습·tuning·registry·KServe 배포·monitoring까지 MLOps pipeline을 구성하는 방법을 소개한다. model 개발만이 아니라 반복 학습과 지속 관찰을 안정적으로 연결해야 실제 AI service를 운영할 수 있다는 관점에서 출발한다.
핵심 포인트- 다양한 source에서 data를 수집·정제해 lake에 저장하는 DataOps와, 준비된 data로 model을 개발·학습·평가·serving하고 성능을 관찰하는 ML 흐름을 구분해 하나의 반복 가능한 운영 cycle로 결합
- 실시간·batch 수집은 Kafka·ingestion, 저장은 Object Storage, 정제·catalog는 data platform, 분석·ML은 query engine·Kubeflow·model registry·KServe로 각 lifecycle 단계를 managed service에 mapping
- 외부·내부 stream을 Kafka로 수집해 Object Storage에 보관하고 metadata·품질을 관리한 뒤, notebook·Kubeflow pipeline에서 학습·tuning을 실행해 최적 model을 registry에 기록하고 KServe endpoint로 배포
- load balancer access log를 Druid 실시간 집계·Superset 시각화하는 traffic prediction 예제에서, Kubeflow가 최근 7일 data로 기존 model과 비교 평가해 더 나을 때만 KServe·registry를 교체하는 자동 lifecycle 구현
왜 읽나managed 서비스로 MLOps를 구성하려는 팀에게, 수집부터 자동 교체까지 end-to-end 파이프라인을 클라우드 컴포넌트에 어떻게 매핑하는지 보여주는 실전 예제.