채널톡 AI팀이 상담 에이전트 ALF의 RAG 검색 품질을 평가하려고 자체 리트리벌 벤치마크를 만든 과정이다. 외부 벤치마크 성능이 올랐다고 ALF 성능도 오른다고 장담할 수 없어, 자기 도메인에 맞는 평가 데이터와 시스템을 구축해 의사결정 근거로 삼았다. 이 벤치마크로 hybrid search가 기존 벡터 검색보다 나은지 실제로 검증했다.
핵심 포인트- 벤치마크는 평가 데이터, 모델, 메트릭 세 요소로 구성되며 리더보드가 있어야 모델 선택의 근거가 된다.
- 청크가 아니라 문서 단위로 레이블을 만들었다. 청킹 전략이 바뀌어도 재레이블링 없이 데이터를 다시 구축할 수 있기 때문이다.
- LLM이 cue sentence를 뽑아 silver label을 만들고, 사람이 잘못된 것을 고치고 놓친 문장을 추가하는 방식으로 레이블링 비용을 줄였다.
- 청킹 후 그 청크 안에 cue sentence가 있으면 query와 relevant하다고 판단하는 규칙으로 최종 데이터를 만들었다.
- hybrid search가 dense와 sparse 단독보다 좋았고, 정성 분석에서 의미론적으로 파악하기 어려운 회사 이름이나 내부 키워드를 더 잘 찾아냈다.
상세 정리- 벤치마크의 정의: 비교와 평가에 쓰이는 표준 시험지이며, MMLU처럼 57개 주제의 다지선다 문제로 LLM을 평가하는 것이 가장 익숙한 예다. 이런 것이 없으면 시스템 비교도 모델 의사결정도 어렵다.
- 자체 제작 이유: 외부 벤치마크 점수 상승이 곧 자기 제품 성능 상승을 뜻하지 않으므로, 도메인에 가장 적합한 평가 데이터와 시스템을 구축해 그것으로 결정해야 한다.
- 평가 대상: ALF가 채널톡 도큐먼트를 참조해 RAG로 상담하므로, 그 검색 단계를 평가하는 리트리벌 벤치마크를 1편으로 잡았다.
- 데이터 형식: query와 chunk의 연관성을 확인하는 구조로, 같은 질의에 대해 관련 있는 청크와 없는 청크가 쌍으로 구성된다.
- 1단계 쿼리 선정: 다양한 주제를 담기 위해 사용자들이 실제로 자주 묻는 질의를 직접 선별했다. 시트 종류별 권한 차이, 시트 비활성화 시 과금 영향, 자동 배정이 안 되는 문제 같은 실사용 질문들이다.
- 2단계 후보 수집: vector database에 query를 검색해 top-20 청크를 가져오고, 그 청크의 source 문서를 끌어와 query와 document 쌍으로 만든다.
- 문서 단위로 만든 이유를 Q&A 형식으로 밝힌다. 청킹 알고리즘은 전략이 바뀔 수 있는데 문서 단위로 만들어두면 전략이 바뀌어도 재레이블링 없이 다시 구축할 수 있다.
- 3단계 자동 레이블링: 모든 문서의 연관성을 사람이 확인하기 어려워 LLM으로 query와 관련 있는 cue sentence를 추출했다.
- 4단계 사람 검수: LLM이 잘못 만든 silver label을 고치고 찾지 못한 문장도 추가로 레이블링했다. 문장을 드래그해 연관 부분을 표시하는 오픈소스 툴을 썼다.
- 5단계 정제: 이상한 query와 너무 많은 문서가 연관되는 일반적인 query를 제거하고 article을 다시 청킹한 뒤, 청크 안에 cue sentence가 있으면 relevant로 판정한다.
- hybrid search 설명: sparse retrieval인 BM25와 dense retrieval인 벡터 검색을 결합하는 방식으로, 두 점수를 합산하거나 가중 평균하거나 BM25로 먼저 검색한 뒤 dense로 reranking하는 형태가 있다.
- 사용한 메트릭 셋: 상위 k개에 정답이 하나라도 있는지 보는 Hit@k, 관련 문서 중 몇 개를 찾았는지 보는 Recall@k, 관련 문서를 얼마나 위쪽에 랭크했는지 보는 nDCG@k다.
- 결과 해석: hybrid가 dense와 sparse 각각보다 좋았고, hybrid는 잘 찾았는데 vector search가 놓친 샘플을 보니 의미론으로 파악하기 어려운 회사 이름이나 내부 키워드였다. sparse의 키워드 기반 매칭이 기여한 것으로 봤다.
- 마무리: 좋은 LLM이 계속 나오면서 기존 벤치마크를 쓸모없게 만드는 일이 반복되는 상황이라, 상담 도메인에 맞는 Agent와 TTS 벤치마크를 제작 중이며 다음 편에서 다룬다고 예고한다.
왜 읽나자사 RAG의 검색 품질을 재고 싶은 ML 엔지니어에게 쿼리 선별부터 LLM 자동 레이블링과 사람 검수, 청킹 전략 변경에 강한 데이터 설계까지 벤치마크 제작 절차를 그대로 준다.