pile·
인프라 / DevOps·뷰노뷰노·

Resource Monitoring Tool with Prometheus + Grafana

뷰노가 AI 모델 학습용 GPU 클러스터의 잉여 리소스를 줄이기 위한 첫 단계로 Prometheus 와 Grafana 기반 리소스 모니터링을 구축한 기록이다. 도커로 두 도구를 띄우고, python-prometheus-client 로 GPU 점유율을 직접 보고하는 커스텀 리포터를 만드는 데까지 다룬다.

핵심 포인트
  • 목적은 GPU 클러스터를 효율적으로 할당해 잉여 리소스를 최소화하는 것이고, 그 첫 단계가 서버 리소스 관측이다.
  • Prometheus 는 리포터의 데이터를 시간별로 저장하고 PromQL 로 불러와 가시화할 수 있는 오픈소스다.
  • 설정 파일에서 global 의 수집 주기와 scrape_configs 의 job 이름, 리포터 전송 포트를 지정한다.
  • Grafana 는 Prometheus 에서 추출한 시계열 데이터를 대화형으로 다룰 수 있어 관리 툴로 적합하다. Data Sources 에서 Prometheus 를 URL 로 등록하면 연동된다.
  • 커스텀 리포터는 python-prometheus-client 로 만든다. 원하는 데이터만 골라 일정 주기로 보고할 수 있고, 주기로 시스템 부하를 조절한다.
상세 정리
  • Prometheus 와 Grafana 모두 도커 이미지를 받아 컨테이너로 실행하는 방식으로 설치한다.
  • Prometheus 실행 시 작성한 설정 파일을 컨테이너 안의 경로로 마운트하고 config.file 인자로 지정한다.
  • 설정 예시에서는 여러 서버 IP 와 포트를 targets 로 나열해 수집 대상을 지정한다.
  • python-prometheus-client 는 네 가지 데이터 포맷을 지원한다.
  • 첫 번째 예제는 변하지 않는 값을 보고하는 경우로, nvidia-smi 로 GPU 이름 목록을 세어 개수를 Gauge 로 노출한다.
  • 두 번째 예제는 사용 중인 GPU 비율을 보고한다. nvidia-smi 로 전체 GPU 의 pci bus id 목록과 연산 프로세스가 붙은 bus id 목록을 각각 뽑아 점유 여부를 표시하고 비율로 환산한다.
  • 이 예제를 확장하면 GPU 의 전력 소비량과 사용률도 함께 볼 수 있다.
  • 최종 목표는 유휴 리소스를 관측하고 클러스터 신규 인원 할당 같은 작업을 자동화해 자원을 공유하는 클러스터를 만드는 것이다.
왜 읽나GPU 클러스터의 놀고 있는 자원을 파악해야 하는 ML 인프라 담당자에게, 표준 exporter 로는 안 잡히는 지표를 직접 만들어 보고하는 최소 구성을 보여주는 글.
뷰노
뷰노 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. 인프라 / DevOps·AWS KoreaAWS Korea Tech·

    엔터프라이즈 보안 요구사항을 충족하는 프라이빗 Amazon Bedrock AgentCore 구축하기

    Amazon Bedrock AgentCore의 VPC egress 기능(2026년 4월 추가)을 활용해 온프레미스 LLM·사내 IdP·사내 MCP 서버에 인터넷 노출 없이 연결하는 방법을 다룬다. 규제 산업 엔터프라이즈가 기존 사내 자산을 그대로 유지하면서 Bedrock AgentCore를 안전하게 구축하기 위한 구성 가이드다.

    요약 이어보기
    #mcp#amazon-bedrock#vpc+2
  2. 인프라 / DevOps·gitlab-engGitLab Blog·

    OpenTofu와 Argo CD로 구성하는 GitLab 기반 AWS 제어 플레인

    GitLab을 단일 제어 플레인으로 삼아 OpenTofu로 AWS 인프라를 프로비저닝하고, Argo CD로 GitOps 기반 애플리케이션 배포까지 자동화하는 엔드투엔드 튜토리얼이다. VPC·EKS 클러스터 구성부터 Helm 기반 툴 설치, 샘플 앱 배포까지 모든 과정이 GitLab CI/CD 파이프라인으로 연결된다.

    요약 이어보기
    #kubernetes#aws-eks#gitops+2
  3. 인프라 / DevOps·AWS KoreaAWS Korea Tech·

    Amazon Bedrock 기반 사내 LLM, 키 발급부터 비용 차단까지: F&F의 LiteLLM 게이트웨이 운영 사례

    패션 기업 F&F가 Amazon Bedrock과 LiteLLM 프록시를 결합해 구축한 사내 LLM 플랫폼 운영 사례다. API 키 셀프서비스 발급, 모델별 접근 승인 워크플로, 사용자·프로젝트별 예산 자동 차단까지 전 과정을 직접 구현한 아키텍처 결정과 운영 교훈을 공유한다.

    요약 이어보기
    #kubernetes#amazon-bedrock#litellm+2