pile·
DB / 데이터·aws-architectureAWS Architecture·

Amazon SageMaker Unified Studio로 금융 분석 인프라 현대화하기

인도 교육대출 핀테크 Avanse Financial Services가 기존 외부 분석 애플리케이션의 4시간 배치 동기화 병목을 Amazon SageMaker Unified Studio 기반 레이크하우스 아키텍처로 30분 미만으로 단축한 마이그레이션 사례다. 라이선스 비용 완전 제거, S3 인텔리전트 티어링 비용 자동 최적화, 사용량 기반 서버리스 과금 모델로 전환했다.

핵심 포인트
  • 외부 분석 애플리케이션을 제거하고 Athena 직접 쿼리로 전환해 매일 4시간의 S3→외부 애플리케이션 배치 복사 병목을 완전히 제거했다.
  • 3계층 레이크하우스: S3(Parquet/Delta Lake) + Athena/EMR/Glue(컴퓨팅) + IAM Identity Center/SageMaker Catalog/DataZone(거버넌스)으로 구성.
  • 비즈니스 기능별로 격리된 프로젝트 작업 공간을 부여하고, 각 프로젝트에 독립적 IAM 실행 역할로 접근 제어와 비용 배분을 구분했다.
  • 컴플라이언스 감사 시간이 자동화된 계보(lineage) 보고서로 수 주에서 수 일로 단축됐다.
  • 72시간 기술 검증 워크숍으로 SQL/Python/PySpark 역량을 기존 Athena 테이블에 대해 검증 후 단계별 마이그레이션을 진행했다.
상세 정리
  • 기존 문제: 두 시스템(S3 + 외부 분석 앱) 사이에 4시간 배치 동기화 의무. 고정 연간 라이선스 비용(사용량 무관). 공유 서버로 부서별 감사 추적 불가. AWS Glue 데이터 카탈로그 접근 불가. NFS에 남은 데이터셋.
  • 컴퓨팅 계층 분리: Collections팀은 Athena 기반 SQL 쿼리 에디터, Risk Reporting은 JupyterLab, MIS는 EMR Serverless 대규모 Spark 잡으로 워크로드별 최적 도구 선택.
  • 5단계 마이그레이션: (1)72시간 기술 검증→(2)NFS 포함 데이터 S3 통합 + S3 인텔리전트 티어링→(3)공유 서버에서 격리된 프로젝트 기반 컴퓨팅으로 전환→(4)SageMaker Catalog로 중앙 거버넌스 구현→(5)워크플로우 순차 마이그레이션.
  • 코드 마이그레이션 접근: 레거시 스크립트를 라인 단위 번역 대신 실용적으로 전환. 기본 연산은 Athena SQL, 복잡한 비즈니스 로직은 PySpark, 통계 처리는 pandas/scikit-learn으로.
  • 성과: 포트폴리오 MIS 보고서 4시간 이상→30분 미만. 대규모 규제 조인(수백만 행) EMR Serverless로 수 시간→수 분. 라이선스 비용 완전 제거. 사용량 기반 서버리스 과금으로 전환.
  • SageMaker Catalog 활용: 분석가가 폴더 구조 탐색 대신 비즈니스 용어(예: 'collection efficiency')로 검색. 소스 테이블→변환→중간 데이터셋으로 이어지는 계보 추적.
왜 읽나레거시 분석 인프라(고정 라이선스, 배치 복사 병목)를 AWS 레이크하우스로 교체하거나 SageMaker Unified Studio 기반 데이터 플랫폼 현대화를 고민하는 데이터/클라우드 엔지니어에게 실전 마이그레이션 로드맵.
aws-architecture
AWS Architecture 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. DB / 데이터·여기어때 (GC컴퍼니)여기어때 (GC컴퍼니)·

    데이터 통합— MongoDB 원칙으로 document를 통합하고 동기화를 재설계하다 (3/3)

    여기어때 전시개발팀은 ES 단일 대문서 → MongoDB v1 RDB 1:1 파편화 → v2 도메인 단위 통합이라는 세 차례 구조 전환을 거쳐 전체 동기화 시간을 약 1시간에서 10분으로 단축했다. 이 글은 3부작의 마지막으로, v2 통합 문서 구조에 맞춰 "$set/$unset 필드 단위 부분 갱신 + 이벤트 발행" 기반 동기화를 어떻게 재설계했는지 구체적인 MongoDB 패턴과 함께 설명한다.

    #denormalization#data-sync#mongodb+2
  2. DB / 데이터·pinterest-engPinterest Engineering·

    Pinterest 차세대 DB 수집 프레임워크의 자동화된 스키마 진화

    Pinterest의 CDC 기반 DB 수집 파이프라인은 MySQL에서 Kafka, Flink, Spark, Iceberg를 거치는 다층 구조다. 스키마 변경이 생기면 모든 계층을 동시에 업데이트해야 해 드리프트, 배포 실패, 데이터 불일치가 반복됐다. Pinterest 엔지니어링 팀은 이를 해결하기 위해 가산적 변경만 자동화하는 스키마 진화 프레임워크를 구축하고, PR 기반 롤아웃과 SLA 기반 일관성 모델을 도입했다.

    #data-pipeline#apache-flink#cdc+2