RAG 기반 AI Agent 시스템에서 검색 품질을 정량적으로 측정하는 방법을 실제 구축 경험으로 다룬다. NDCG@10·Recall@10 지표, LLM Judge 검증, BM25·시멘틱·하이브리드 세 방식의 BEIR 벤치마크 비교까지 포함한다. "시멘틱이 좋다", "하이브리드가 답"이라는 통념이 데이터셋에 따라 달라짐을 실측으로 보여주며, 직접 평가하지 않으면 최적 방식을 알 수 없다고 결론 짓는다.
핵심 포인트- RAG 시스템에서 검색 품질이 LLM 답변의 상한선 — Agent가 쿼리를 자동 생성하므로 검색 실패가 곧 오답으로 이어진다.
- NDCG@10(순위 가중 정밀도)과 Recall@10(정답 커버리지)을 함께 써야 한다 — TREC-COVID에서 NDCG 0.789이면서 Recall 0.020인 사례로 단독 지표의 한계를 증명했다.
- LLM Judge(Claude)로 관련성을 자동 채점하되, Gold Qrels에 긍정·부정 샘플이 모두 있어야 Cohen's Kappa가 유효하다.
- BM25·시멘틱·하이브리드 중 어느 방식이 좋은지는 데이터 특성에 따라 다르다 — 직접 평가해야만 최적 방식을 알 수 있다.
- 한국어 BM25는 Nori 형태소 분석기 적용 후 NDCG@10이 0.017→0.032로 87% 상승 — 키워드 검색에 언어별 전처리가 결정적이다.
상세 정리- 배경: Agent가 쿼리를 자동 생성하므로 개발자가 통제할 수 없고, LLM이 검색 결과를 직접 읽기 때문에 부실한 문서가 곧 오답으로 이어진다.
- 평가 지표 설계: NDCG@10은 상위 결과의 순위 가중 정밀도, Recall@10은 정답 커버리지다. 두 지표가 서로 다른 정보를 제공하므로 둘 다 측정해야 한다.
- TREC-COVID 함정: k-NN NDCG@10이 0.789로 우수했지만 Recall@10은 0.020 — 정답의 98%를 놓쳤다. 순위 품질과 망라성은 별개임을 보여주는 대표 사례다.
- 아키텍처: Amazon OpenSearch Service(BM25+k-NN 하이브리드) + Amazon Bedrock(Cohere Embed Multilingual v3 임베딩, Claude LLM Judge) + BEIR 공개 벤치마크로 파이프라인 검증.
- LLM Judge 검증: 100개 샘플로 Gold Qrels와 비교. MIRACL 한국어에서 Spearman 0.94, Cohen's Kappa 0.50(중간 수준 일치).
- SciFact 함정: Gold Qrels에 긍정 레이블만 포함했을 때 Cohen's Kappa가 0이 나왔다 — 검증 데이터에 긍정·부정 샘플을 모두 넣어야 한다는 교훈.
- AgentCore 교차 검증: OpenSearch LLM Judge와 AgentCore ContextRelevance의 상관이 0.64로, 각각 Gold 대비 상관(0.41, 0.38)보다 높다 — 두 Judge가 서로 일관됨을 확인.
- RRF 하이브리드 구현: 점수 체계가 다른 BM25와 k-NN을 "1/(k+순위)" 형태로 순위 기반 결합. 가중치 튜닝 부담 없이 두 방식의 장점을 결합한다.
- 데이터셋별 비교: SciFact에서 k-NN이 BM25보다 24% 우수(NDCG 0.693 vs 0.560). 반면 Touche-2020(논쟁적 주제)에서는 BM25(0.778)이 k-NN(0.756)을 앞섰다.
- 한국어 처리: MIRACL 벤치마크에서 BM25에 Nori 형태소 분석기를 적용하자 NDCG@10이 87% 상승. 시멘틱 검색은 전처리로부터 자유롭지만, BM25·하이브리드는 언어별 분석기가 필수다.
- 데이터 특성별 추천: 동의어·paraphrase가 많으면 시멘틱(k-NN), 전문 용어·고유 키워드가 핵심이면 BM25, 판단이 어려우면 하이브리드(RRF)를 기본값으로 쓴다.
- LLM Judge 운영: 캐싱으로 중복 채점 방지, 정규식으로 파싱 실패 처리, 동시성 제어로 TPM 쿼터 관리가 실전에서 필요한 고려사항이다.
- 2부 예고: Cohere Rerank의 데이터셋별 극명한 차이(+22% vs -11%), 하이브리드 가중치 자동 튜닝, AI 코딩 어시스턴트 활용 자동화, 운영 환경 지속적 모니터링.
왜 읽나RAG/AI Agent 기반 서비스의 검색 파이프라인을 정량적으로 평가하고 개선하려는 ML 엔지니어·백엔드 개발자에게 평가 시스템 구축 실전 레퍼런스.