발표 소개와 데이터 과학팀
NHN 테코라스 데이터 과학팀의 발표자가 일본에서 전개하는 AWS 클라우드 브로커 사업과 이를 지원하는 데이터 처리 기반, 기계학습 활용 예를 소개한다는 개요를 밝힌다. 데이터 분석 기반 구축·운영과 기계학습 도입을 담당한다는 배경을 전한다.
AWS·GCP를 파트너를 통해 계약해 이점을 받는 클라우드 재판매 서비스를 설명한다. 다수 고객의 AWS 사용량을 모아 볼륨 할인을 받고 차액을 고객에게 환원하는 방식으로 C-Chorus 브랜드의 사용량 할인을 실현하는 구조를 소개한다.
데이터 과학팀이 고객 데이터 활용 지원과 자사 데이터 활용에 어떻게 노력해왔는지 정리한다. 분석 기반 구축·마이그레이션, 이상 탐지, 자연어 처리 기사 요약 등 실적으로 2019년 AWS 데이터·분석 역량 파트너 인증을 받은 이력을 언급한다.
AWS가 제공하는 비용·사용 보고서(CUR)를 S3에 CSV로 하루 한 번 이상 갱신되는 데이터로 설명한다. 270개 이상 컬럼에 100GB를 넘는 대용량이라, RI·SP 사용률과 요금을 정확히 계산하려면 독자적으로 집계·분석해야 하는 이유를 짚는다.
개발 중인 SaaS 제품이 웹 애플리케이션과 데이터 기반으로 나뉘고, 데이터 기반은 ETL·데이터 웨어하우스·기계학습으로 구성됨을 소개한다. BI는 브라우저 기반 Looker를 사용해 LookML로 SQL을 의식하지 않고 대시보드를 구축하는 방식을 설명한다.
데이터 레이크에 S3, 웨어하우스에 Redshift, ETL에 EMR/Spark와 Lambda를 쓰고 Step Functions로 워크플로를 오케스트레이션하는 아키텍처를 소개한다. 인프라는 CloudFormation, 시크릿은 KMS·Secrets Manager로 관리하며 대용량 데이터 처리 시 주의점을 언급한다.
기계학습 모델 훈련·배포에 SageMaker를 쓰고 VPC 엔드포인트로 접근하는 구조를 설명한다. 비용 절감을 위한 RI·SP 구매량 시계열 예측 추천, 클라우드 리소스 이상 탐지, 문의 데이터를 활용한 자연어 처리 챗봇 세 가지 활용 사례를 소개한다.
AWS 사용량을 모아 볼륨 할인을 고객에게 환원하는 사업, CUR을 독자 집계·분석해 시각화하는 SaaS 제품, CloudFormation과 Step Functions로 재이용성·내구성을 높인 ETL 파이프라인, 기계학습 기반 추천·이상탐지·챗봇을 한 번에 요약하며 발표를 마무리한다.