pile·
백엔드·포스타입포스타입·

포스타입이 개인화 추천을 하는 방법 1부

포스타입이 태그 기반 추천의 한계를 극복하고 벡터 임베딩 기반 개인화 추천 시스템을 구축한 과정을 담은 1부다. 유사한 콘텐츠가 다른 용어를 쓰거나 동일한 태그가 전혀 다른 톤의 콘텐츠를 가리키는 문제를 임베딩 벡터로 해결하고, OpenSearch의 HNSW ANN 검색으로 수백만 벡터를 실시간 검색하는 시스템을 구축해 구매율 15% 향상을 달성했다.

핵심 포인트
  • 포스트와 유저를 임베딩 벡터로 표현, 코사인 유사도(크기가 아닌 방향)로 취향 매칭
  • 유저 벡터는 인터랙션(좋아요·구매 등)의 가중합으로 누적 구성, 선호도 패턴을 하나의 벡터로 압축
  • OpenSearch + HNSW 알고리즘으로 ANN 검색, 핵심 파라미터: m(연결 수)·ef_construction(그래프 품질)·ef_search(쿼리 속도)
  • BM25 키워드 검색 + KNN 벡터 검색의 하이브리드, 점수 정규화 후 결합, Sigmoid-weighted IDF로 흔한 태그 과대표현 방지
  • 콘텐츠 기반 추천(유저 벡터와 유사한 포스트)과 협업 필터링(취향이 비슷한 유저가 선호한 포스트) 두 방식 모두 지원
  • A/B 테스트로 효과 검증 후 프로덕션 배포, 전체 구매율 15% 향상 달성
상세 정리
  • 기존 문제: 태그 기반 추천의 두 가지 한계 — 유사 콘텐츠가 다른 용어를 사용하거나, 동일 태그가 전혀 다른 톤의 콘텐츠를 가리킴
  • 해결책: 포스트를 임베딩 벡터로 변환해 표면적 용어 차이를 넘어 의미적 유사성 캡처
  • 유저 벡터 구성: 좋아요·구매 등 인터랙션을 가중치 적용해 누적 합산, 선호도를 단일 벡터로 표현
  • 코사인 유사도 선택 이유: 벡터의 크기가 아닌 방향(취향 패턴)을 기준으로 매칭하기 위해
  • ANN 검색 인프라: OpenSearch + HNSW 알고리즘
  • HNSW 파라미터 튜닝: m(그래프 연결 수)·ef_construction(인덱스 품질 vs 빌드 시간)·ef_search(검색 정확도 vs 속도)
  • 샤딩 전략으로 데이터를 균등 분산해 특정 노드 부하 집중 방지
  • 하이브리드 검색: BM25(키워드)와 KNN(벡터) 점수를 정규화 후 결합
  • Sigmoid-weighted IDF: 흔한 태그가 추천 결과를 지배하는 문제 방지
  • 추천 방식 1: 콘텐츠 기반 — 유저 선호 벡터와 가장 가까운 포스트 추천
  • 추천 방식 2: 협업 필터링 — 취향 벡터가 유사한 다른 유저들이 선호한 포스트 추천
  • A/B 테스트로 효과 검증 후 프로덕션 배포, 전체 구매율 15% 향상 달성
왜 읽나태그 기반 추천에서 벡터 임베딩 + HNSW ANN 검색으로 전환하는 실제 구현 과정을 구체적 수치와 함께 확인할 수 있다. OpenSearch HNSW 파라미터 튜닝·하이브리드 BM25+KNN·협업 필터링 조합을 현장에서 검증한 아키텍처 결정들이 핵심이다.
포스타입
포스타입 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. 백엔드·twilio-engTwilio Engineering·

    Programmable Messaging에서 Verify API로 마이그레이션하기

    Twilio의 Programmable Messaging API로 자체 OTP 솔루션을 운영하던 서비스가 Verify API로 전환하는 방법을 코드 예시와 함께 설명한다. Verify는 OTP 전송·검증을 위한 전용 API로, 전화번호 구매, 토큰 생성, DB 저장·만료 관리를 내부에서 처리해 개발자가 직접 구현할 코드를 크게 줄인다.

    요약 이어보기
    #authentication#twilio#sms+2
  2. 백엔드·포스타입포스타입·

    포스타입이 개인화 추천을 하는 방법 2부

    포스타입 백엔드 엔지니어가 벡터 기반 개인화 추천 시스템을 실제 운영하며 맞닥뜨린 성능 장애와 용량 문제를 해결한 과정을 담은 2부다. 수백만 개의 벡터 KNN 검색이 피크 시간대에 전체 Elasticsearch 검색 성능을 흔드는 문제부터 클러스터 OOM 사태까지, 쿼리 최적화와 인프라 분리 두 가지 경로로 근본 해결에 이른다.

    요약 이어보기
    #elasticsearch#vector-search#recommendation-system+2
  3. 백엔드·여기어때 (GC컴퍼니)여기어때 (GC컴퍼니)·

    실패한 메시지는 어디로 가야 할까?- Kafka Retry/DLT 설계와 운영에서 밟은 3가지 함정

    여기어때 정산개발팀 백엔드 개발자가 Kafka 컨슈머의 실패 처리를 non-blocking 재시도와 공통 DLT(Dead Letter Topic)로 표준화한 공통 라이브러리 구현 과정을 공유한다. 정산 시스템의 각 Kafka 컨슈머가 제각각 다른 방식으로 실패를 처리하던 상황을 @CommonKafkaRetry 어노테이션 하나로 일관되게 표준화하고, 그 과정에서 Spring Kafka의 3가지 숨겨진 함정을 발굴해 해결한 실전 기록이다.

    요약 이어보기
    #kafka#message-queue#spring-kafka+2