pile·
AI / ML·channel-talk채널톡·

채널 AI팀은 왜 새로운 ML 모델 벤치마크가 필요로 했을까?

문제외부 벤치마크 성능 향상이 RAG 기반 챗봇(ALF)의 실서비스 개선으로 이어지지 않아 상담 도메인 특화 리트리벌 벤치마크가 필요했다.
접근실 사용자 쿼리 선별 → LLM Silver Label(cue sentence) 생성 → Label Studio 사람 검증 → Recall@k·nDCG@k 지표로 Vector Search·BM25·Hybrid Search를 비교했다.
결과Hybrid Search가 Recall@20 기준 0.65→0.70, nDCG@20 기준 0.52→0.59로 모든 지표 최고치. 회사명·내부 키워드 검색에서 sparse retrieval의 키워드 매칭이 강점을 보였다.
channel-talk
채널톡 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·LY CorporationLY Corporation·

    Grafana에서 자연어로 장애 원인을 분석하기: LLM 에이전트 기반 SRELens 개발기

    LY Corporation Home SRE 팀이 장애 분석 시 메트릭·로그·트레이스가 각각 다른 화면에 흩어져 있는 문제를 해결하기 위해 Grafana 플러그인 SRELens를 개발했다. SRELens는 LLM 에이전트가 자연어 질의를 받아 실제 관측성 데이터를 조회하고, 근거와 함께 장애 원인 후보를 정리해 주는 도구다. LGTM-P 스택(Loki·Grafana·Tempo·Mimir·Pyroscope)과 FlavaMCP 게이트웨이를 통합해 단일 채팅 인터페이스에서 멀티시그널 분석이 가능하다.

    #llm-app#mcp#observability+2