pile·
AI / ML·dropbox-techDropbox Tech·

LLM 으로 사람 라벨링을 증폭해 Dash 검색 관련성 개선

문제Dropbox Dash의 RAG 답변 품질은 enterprise search ranking에 의존하지만, 충분한 relevance label을 사람이 모두 만들기 어렵다.
접근XGBoost 기반 ranking model 학습에 human labeling과 LLM evaluation을 결합했다. 사용자 행동 신호는 보조로 쓰고, query-document relevance judgment를 확장했다.
결과적은 내부 라벨을 LLM 보조 평가로 증폭해 검색 관련성 학습 데이터를 늘리고, Dash 답변의 grounding 품질을 개선했다.
dropbox-tech
Dropbox Tech 블로그
원문은 여기서 이어서 읽을 수 있어요
원문 읽기
읽음 (0)

이 글과 비슷한

  1. AI / ML·stackoverflow-blogStack Overflow Blog·

    에이전틱 SDLC를 QA 엔지니어링 마인드셋으로 구축하기

    Motorola Solutions의 테스트 엔지니어링 선임 매니저 Suneet Malhotra가 Stack Overflow 팟캐스트에 출연해 MCP(Model Context Protocol) 기반 에이전틱 SDLC 파이프라인 구축과 LLM-as-judge 평가 방법론을 소개했다. QA 엔지니어링 관점을 소프트웨어 개발 생애 전반에 적용하고, 설계 단계 직후 스펙을 강화해 결함 비용을 줄이는 'QA shift-left' 접근을 다룬다.

    요약 이어보기
    #llm-agent#mcp#test-automation+2
  2. AI / ML·LINE EngineeringLINE Engineering·

    보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LY Corporation Security Development Division이 보안 업무용 AI 에이전트 플랫폼 SAGE의 개발 과정을 공개했다. "완전 자동화"와 "도입 미루기" 양 극단 사이에서 "판단은 사람에게 남기는 설계"를 핵심 원칙으로 삼고, 3단계 점진적 도입 전략(AI 보조→에이전트 협업→자동화)을 채택했다. 현재는 1단계를 중심으로 파일럿·실운영 중이다.

    요약 이어보기
    #llm-app#opensearch#mcp+2