pile·
AI / ML·AWS KoreaAWS Korea Tech·

AI Agent를 위한 OpenSearch 검색 품질 평가하기 (Part 1)

RAG 기반 AI Agent 시스템에서 검색 품질을 정량적으로 측정하는 방법을 실제 구축 경험으로 다룬다. NDCG@10·Recall@10 지표, LLM Judge 검증, BM25·시멘틱·하이브리드 세 방식의 BEIR 벤치마크 비교까지 포함한다. "시멘틱이 좋다", "하이브리드가 답"이라는 통념이 데이터셋에 따라 달라짐을 실측으로 보여주며, 직접 평가하지 않으면 최적 방식을 알 수 없다고 결론 짓는다.

핵심 포인트
  • RAG 시스템에서 검색 품질이 LLM 답변의 상한선 — Agent가 쿼리를 자동 생성하므로 검색 실패가 곧 오답으로 이어진다.
  • NDCG@10(순위 가중 정밀도)과 Recall@10(정답 커버리지)을 함께 써야 한다 — TREC-COVID에서 NDCG 0.789이면서 Recall 0.020인 사례로 단독 지표의 한계를 증명했다.
  • LLM Judge(Claude)로 관련성을 자동 채점하되, Gold Qrels에 긍정·부정 샘플이 모두 있어야 Cohen's Kappa가 유효하다.
  • BM25·시멘틱·하이브리드 중 어느 방식이 좋은지는 데이터 특성에 따라 다르다 — 직접 평가해야만 최적 방식을 알 수 있다.
  • 한국어 BM25는 Nori 형태소 분석기 적용 후 NDCG@10이 0.017→0.032로 87% 상승 — 키워드 검색에 언어별 전처리가 결정적이다.
상세 정리
  • 배경: Agent가 쿼리를 자동 생성하므로 개발자가 통제할 수 없고, LLM이 검색 결과를 직접 읽기 때문에 부실한 문서가 곧 오답으로 이어진다.
  • 평가 지표 설계: NDCG@10은 상위 결과의 순위 가중 정밀도, Recall@10은 정답 커버리지다. 두 지표가 서로 다른 정보를 제공하므로 둘 다 측정해야 한다.
  • TREC-COVID 함정: k-NN NDCG@10이 0.789로 우수했지만 Recall@10은 0.020 — 정답의 98%를 놓쳤다. 순위 품질과 망라성은 별개임을 보여주는 대표 사례다.
  • 아키텍처: Amazon OpenSearch Service(BM25+k-NN 하이브리드) + Amazon Bedrock(Cohere Embed Multilingual v3 임베딩, Claude LLM Judge) + BEIR 공개 벤치마크로 파이프라인 검증.
  • LLM Judge 검증: 100개 샘플로 Gold Qrels와 비교. MIRACL 한국어에서 Spearman 0.94, Cohen's Kappa 0.50(중간 수준 일치).
  • SciFact 함정: Gold Qrels에 긍정 레이블만 포함했을 때 Cohen's Kappa가 0이 나왔다 — 검증 데이터에 긍정·부정 샘플을 모두 넣어야 한다는 교훈.
  • AgentCore 교차 검증: OpenSearch LLM Judge와 AgentCore ContextRelevance의 상관이 0.64로, 각각 Gold 대비 상관(0.41, 0.38)보다 높다 — 두 Judge가 서로 일관됨을 확인.
  • RRF 하이브리드 구현: 점수 체계가 다른 BM25와 k-NN을 "1/(k+순위)" 형태로 순위 기반 결합. 가중치 튜닝 부담 없이 두 방식의 장점을 결합한다.
  • 데이터셋별 비교: SciFact에서 k-NN이 BM25보다 24% 우수(NDCG 0.693 vs 0.560). 반면 Touche-2020(논쟁적 주제)에서는 BM25(0.778)이 k-NN(0.756)을 앞섰다.
  • 한국어 처리: MIRACL 벤치마크에서 BM25에 Nori 형태소 분석기를 적용하자 NDCG@10이 87% 상승. 시멘틱 검색은 전처리로부터 자유롭지만, BM25·하이브리드는 언어별 분석기가 필수다.
  • 데이터 특성별 추천: 동의어·paraphrase가 많으면 시멘틱(k-NN), 전문 용어·고유 키워드가 핵심이면 BM25, 판단이 어려우면 하이브리드(RRF)를 기본값으로 쓴다.
  • LLM Judge 운영: 캐싱으로 중복 채점 방지, 정규식으로 파싱 실패 처리, 동시성 제어로 TPM 쿼터 관리가 실전에서 필요한 고려사항이다.
  • 2부 예고: Cohere Rerank의 데이터셋별 극명한 차이(+22% vs -11%), 하이브리드 가중치 자동 튜닝, AI 코딩 어시스턴트 활용 자동화, 운영 환경 지속적 모니터링.
왜 읽나RAG/AI Agent 기반 서비스의 검색 파이프라인을 정량적으로 평가하고 개선하려는 ML 엔지니어·백엔드 개발자에게 평가 시스템 구축 실전 레퍼런스.
AWS Korea
AWS Korea Tech 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2