LEVER Xpert AI팀이 구현한 자연어 기반 광고 소재 이미지 검색 시스템의 설계 결정과 실험 결과를 담은 PoC 리포트. 이미지라는 modality를 텍스트 공간으로 변환해 Hybrid Search로 처리하는 접근을 채택했으며, 세 가지 Deep Dive를 통해 직관과 반대로 작동한 발견들과 핵심 결정 과정을 실측 수치와 함께 기록한다.
핵심 포인트- Offline Pipeline: LLM이 광고 소재 이미지 → 구조화된 Description 텍스트 생성 → Dense(Gemini Embedding) + Sparse(BM25) 이중 인덱싱을 동일 Milvus Vector DB에 저장
- CLIP 대신 Description 기반 선택 이유 4가지: 다면적 특성 구조화(표현력), Hybrid Search 자연 확장(유연성), 추출 프롬프트로 도메인 어휘 직접 주입 가능, 해석 가능성 + 빠른 반복 개선
- Query Rewrite 비교 실험: Augmentation(Recall@30 0.51) vs Expansion(0.66) vs HyDE(0.59) — Expansion 채택
- 강화학습의 Exploitation vs Exploration을 Query Expansion 가중치 설계에 적용: exploration_weight=0.2일 때 최고 Recall@30 0.86 달성 (원본만 0.80, 동등 가중치 0.77)
- 직관 역행 발견 1: Description 길이 강제(최소 3문장)가 Recall@30 0.85 → 0.82 하락 (핵심 신호 대비 노이즈 증가)
- 직관 역행 발견 2: Description 어휘 힌트 추가가 NDCG@10 0.55 → 0.44 하락 (Expansion의 다양성 제약)
상세 정리- Online Pipeline: LLM 질의 이해(검색어 추출 + 변형 쿼리 생성) → Hybrid Search(Dense+Sparse 동시 실행) → LLM Reranking으로 최종 순위 결정
- 핵심 설계 과제: 마케터의 자연어 질의(텍스트)와 검색 대상(이미지) 간 modality 불일치 해소
- CLIP의 한계: 다면적 광고 소재 특성을 하나의 벡터로 압축, 마케팅 도메인 어휘(소구점, 비포애프터형) 통제 어려움
- Description의 강점: 한 이미지를 소재 형식·소구점·등장 객체 등 카테고리별로 분리 표현 가능, 각 측면이 별도 검색 단위로 작동
- Weighted RRF(Reciprocal Rank Fusion): 원본 쿼리 가중치 1.0 고정, 확장 쿼리는 exploration_weight로 조정
- exploration_weight 0.5: Recall@30 0.83 / 0.7: 0.81 — 원본 의도 보존이 핵심 변수
- "여름 소재" 같은 짧은 질의 문제: Expansion으로 "해변 리조트 분위기", "청량한 파란 하늘", "자외선 차단" 등 다양한 표현을 의미 공간에서 동시 탐색
- LLM 출력 특성 교훈: 긴 텍스트는 임베딩 신호보다 노이즈로 작용, 어휘 힌트는 출력을 편향시켜 탐색 다양성을 좁힘
- PoC 반복 교훈: "빠르게 가설을 세우되 실측 없이 채택하지 않는다" — 직관이 빗나가는 지점일수록 더 깊은 통찰이 숨어있음
- Exploitation vs Exploration 프레임: 검색 도메인에서 원본 쿼리(확실한 의도)와 확장 쿼리(탐색)의 비중 조율 문제를 RL 개념으로 해결
왜 읽나이미지 검색에 Hybrid Search를 접목하면서 CLIP을 선택하지 않은 이유, Query Expansion 가중치 설계에서 강화학습 개념을 응용한 과정, 그리고 LLM 시스템에서 직관이 빗나가는 패턴을 실측 수치와 함께 배울 수 있는 실전 PoC 보고서다.