pile·
인프라 / DevOps·AWS KoreaAWS Korea Tech·

분산 학습을 위한 AWS 컴퓨트 선택 가이드 (1편: 모델 규모와 하드웨어 선택)

대규모 LLM 분산 학습에서 잘못된 컴퓨트 선택은 곧바로 비용 낭비와 성능 저하로 이어진다. 이 1편은 모델 규모에 따른 스케일업/스케일아웃 기준, AWS GPU 인스턴스 포트폴리오, NVLink/NVSwitch/EFA 인터커넥트 구조, 병렬화 전략, GPU 메모리 계산법까지 분산 학습 컴퓨트 선택의 기초를 ML/인프라 엔지니어 관점에서 체계적으로 정리한다.

핵심 포인트
  • 모델 규모별 전략: 10B 이하 → 단일 인스턴스(NVLink 도메인 충분), 10B~100B → 멀티노드 EFA 클러스터, 100B~1T+ → 울트라서버(확장 NVLink 도메인)
  • 노드 내 NVLink(집계 7,200GB/s) vs 노드 간 EFA(400GB/s) 약 18배 격차 → 통신이 잦은 Tensor Parallel은 반드시 동일 노드 NVLink 도메인 안에서만 사용
  • 70B 모델 모델 상태(fp32)만 약 1,120GB 필요 → 단일 p5.48xlarge(640GiB) 불가, 2~3노드 이상 및 모델 병렬화 필수
  • MoE의 All-to-All 통신은 AllReduce보다 숨기기 어렵고 부하 불균형 발생 → 울트라서버 확장 NVLink 도메인이 유리
  • EFA 미동작 시 NCCL이 오류 없이 TCP로 폴백해 성능만 급락하므로 사전 검증 필수
상세 정리
  • P계열 NVL8 인스턴스: p5(H100×8, 640GiB, 3,200Gbps), p5en(H200×8, ~1.1TiB, EFAv3로 레이턴시 35% 개선), p6-b200(B200×8, ~1.4TiB, 6,400Gbps), p6-b300(B300×8, ~2.1TiB, RAM 4TiB)
  • G계열은 GPU 간 NVLink 없이 PCIe만 사용 → 대규모 분산 학습 부적합
  • NVLink: GPU 직결 고속 통신(p5 기준 GPU당 양방향 900GB/s), NVSwitch가 중앙 스위치로 any-to-any 균일 대역폭 보장(All-to-All 패브릭)
  • 혼합 정밀도(bf16 forward + fp32 master): model state는 16→18 bytes/param으로 소폭 증가, 이점은 연산 속도와 activation 절감
  • CUDA/cuDNN/NCCL/PyTorch 버전 불일치 시 오류 없이 성능만 저하 → AWS Deep Learning AMI(아랫층) + DLC/NGC 컨테이너(윗층) 조합이 표준
  • SageMaker HyperPod 자동 복구: 헬스체크 → 불량 노드 격리 → 최근 체크포인트 자동 재시작 루프
  • AllReduce vs All-to-All: AllReduce는 reduction 후 동일 결과 브로드캐스트; All-to-All은 personalized 통신으로 숨기기 어렵고 latency 민감
  • 클라우드 과금: 유휴 GPU도 과금 → Slurm/PCS power-saving으로 잡 큐 비면 노드 0으로 스케일다운
  • 데이터 파이프라인: S3 + FSx for Lustre + 샤딩 + data loader prefetch/num_workers 튜닝으로 GPU idle 방지
  • 진짜 SM 활용률: nvidia-smi GPU-Util이 아닌 DCGM_FI_PROF_SM_ACTIVE / DCGM_FI_PROF_PIPE_TENSOR_ACTIVE로 측정
왜 읽나AWS에서 LLM 분산 학습을 설계하는 ML/인프라 엔지니어가 모델 규모, 병렬화 전략, 인스턴스 선택, GPU 메모리 계산까지 한 번에 정리할 수 있는 실전 가이드다.
AWS Korea
AWS Korea Tech 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. 인프라 / DevOps·AWS KoreaAWS Korea Tech·

    Claude Apps Gateway on AWS 자세히 알아보기

    Anthropic의 Claude Code 바이너리에 내장된 LLM 게이트웨이 솔루션 Claude Apps Gateway의 AWS 인프라 배포 방법과 엔터프라이즈 기능을 다룬다. API 키 대신 IdP(Identity Provider) 기반 SSO를 사용해 Okta, Microsoft Entra ID, Keycloak과 연동하며, 그룹별 권한 정책, 예산 관리, OpenTelemetry 기반 관측성을 제공한다.

    #claude#bedrock#opentelemetry+2
  2. 인프라 / DevOps·AWS KoreaAWS Korea Tech·

    금융 클라우드 길라잡이 A to Z Part 2 – 연구개발망 예외와 망분리 개선 로드맵

    2024년 8월 금융위원회의 망분리 개선 로드맵에 따라 허용된 연구개발망(R&D 망)을 AWS 멀티 계정 아키텍처로 구현하는 방법을 다룬다. 물리적 망분리 대신 논리적 분리로 전환되면서 생성형 AI와 SaaS 서비스 사용이 R&D 망에서 허용됐다. 3계층 VPC 설계, AI 도구 통합, 아티팩트 이전 파이프라인 등 실무 구현 사례를 포함한다.

    #aws#network-security#compliance+2