pile·
백엔드·모두싸인모두싸인·

로그 인리치먼트(Log Enrichment)

모두사인이 하루 수억 건의 감사 로그에 메타데이터와 컨텍스트를 추가하는 로그 인리치먼트 시스템을 비동기 아키텍처로 구현한 과정을 다룬다. 동기 방식은 서비스 성능에 직접적인 영향을 주기 때문에 비동기 파이프라인을 선택했고, CDC·Kafka·S3를 조합해 중복·삭제·컴플라이언스 요구사항을 모두 해결했다.

핵심 포인트
  • 로그 인리치먼트를 비동기로 설계해 서비스 메인 경로에 지연을 추가하지 않고 하루 수억 건을 처리한다.
  • 서비스를 직접 호출하지 않고 CDC로 별도 메타데이터 저장소를 동기화해 서비스 간 의존성과 삭제 리소스 문제를 동시에 해결했다.
  • Kafka 스트리밍 → 중간 표현 인리치먼트 → S3 파티셔닝 저장의 파이프라인으로 조회 효율을 높였다.
  • 오프셋 기반 파일 네이밍으로 Kafka 리플레이 시 발생하는 중복 로그를 제거한다.
  • ISMS-P와 CSAP 보안 인증 요구사항을 이 아키텍처로 충족한다.
상세 정리
  • 문제: 하루 수억 건 로그에 사용자·워크스페이스 메타데이터를 실시간으로 붙여야 하는데, 동기 방식은 로그 기록마다 서비스를 호출해 레이턴시 증가와 장애 연쇄 위험이 있었다.
  • 비동기 선택 이유: 로그 생성 시점과 인리치먼트 시점을 분리해 메인 서비스에 지연을 추가하지 않고, 트래픽 급증 시에도 파이프라인이 독립적으로 동작한다.
  • CDC 기반 메타데이터 저장소: 원본 서비스에 직접 쿼리하는 대신 CDC로 변경 데이터를 별도 저장소에 복제. 리소스가 삭제된 후에도 인리치먼트 완료가 가능하다.
  • Kafka 파이프라인: 로그 이벤트를 Kafka로 수신 → 중간 표현(intermediate representation)으로 인리치먼트 처리 → 결과를 S3에 저장하는 3단계 흐름.
  • S3 파티셔닝: 워크스페이스·시간 기준으로 분할해 특정 워크스페이스의 특정 기간 감사 로그를 최소 파일 읽기로 추출할 수 있다.
  • 중복 제거: Kafka 리플레이 발생 시 같은 로그가 재처리될 수 있는데, 오프셋 기반 파일 네이밍으로 동일 오프셋 파일을 덮어써 중복을 제거한다.
  • 컴플라이언스: ISMS-P(정보보호 관리체계)와 CSAP(클라우드 보안 인증) 요구사항을 이 아키텍처로 충족한다.
왜 읽나대규모 감사 로그 파이프라인을 설계하거나 CDC/Kafka/S3 기반 로그 인리치먼트를 구축하려는 백엔드 엔지니어에게 실제 운영 아키텍처와 설계 근거를 확인할 수 있다.
모두싸인
모두싸인 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. 백엔드·twilio-engTwilio Engineering·

    Programmable Messaging에서 Verify API로 마이그레이션하기

    Twilio의 Programmable Messaging API로 자체 OTP 솔루션을 운영하던 서비스가 Verify API로 전환하는 방법을 코드 예시와 함께 설명한다. Verify는 OTP 전송·검증을 위한 전용 API로, 전화번호 구매, 토큰 생성, DB 저장·만료 관리를 내부에서 처리해 개발자가 직접 구현할 코드를 크게 줄인다.

    요약 이어보기
    #authentication#twilio#sms+2
  2. 백엔드·포스타입포스타입·

    포스타입이 개인화 추천을 하는 방법 2부

    포스타입 백엔드 엔지니어가 벡터 기반 개인화 추천 시스템을 실제 운영하며 맞닥뜨린 성능 장애와 용량 문제를 해결한 과정을 담은 2부다. 수백만 개의 벡터 KNN 검색이 피크 시간대에 전체 Elasticsearch 검색 성능을 흔드는 문제부터 클러스터 OOM 사태까지, 쿼리 최적화와 인프라 분리 두 가지 경로로 근본 해결에 이른다.

    요약 이어보기
    #elasticsearch#vector-search#recommendation-system+2
  3. 백엔드·포스타입포스타입·

    포스타입이 개인화 추천을 하는 방법 1부

    포스타입이 태그 기반 추천의 한계를 극복하고 벡터 임베딩 기반 개인화 추천 시스템을 구축한 과정을 담은 1부다. 유사한 콘텐츠가 다른 용어를 쓰거나 동일한 태그가 전혀 다른 톤의 콘텐츠를 가리키는 문제를 임베딩 벡터로 해결하고, OpenSearch의 HNSW ANN 검색으로 수백만 벡터를 실시간 검색하는 시스템을 구축해 구매율 15% 향상을 달성했다.

    요약 이어보기
    #opensearch#vector-search#recommendation-system+2