공공 법령 문서를 근거로 답하는 RAG를 구현하며, 검색 품질과 hallucination을 좌우하는 요소들을 단계별로 설명한다. 긴 문서를 그대로 넣거나 임의 길이로 자를 때 생기는 문맥 손실을 어떻게 막고 근거 기반 답변으로 잇는지가 핵심이다.
핵심 포인트- 검색·chunking·질의 변환·reranking·근거 기반 생성을 하나의 RAG 품질 system으로 정의하고, 문단·문장 경계 대신 최소한의 동질적 의미를 유지하는 최대 text 단위를 sequence model이 topic·semantic transition을 학습해 chunk로 분리
- chunk만 떼면 title·author·상위 section 맥락이 사라지므로 공통 metadata를 연결하고 parent-child relation·summary 같은 virtual meta chunk로 chunk-level 정밀 검색과 document-level context를 함께 제공
- 일반 synthetic QA를 뒤집어 각 chunk가 답할 수 있는 질문을 미리 만들어 함께 색인하고, 대화의 생략·지시어는 독립 search query로 rewrite해 법률 표현과 일상 표현의 gap 축소
- keyword+vector hybrid retrieval 후보를 LLM reranker가 적합성으로 재평가해 상위 chunk만 남기고, 제공 자료 밖 parametric memory 사용을 막고 citation과 함께 답하도록 강제, 생활 법령 demo로 검증
왜 읽나법령·규정 같은 긴 공공 문서 RAG의 검색 품질과 사실성을 끌어올리려는 이들에게, semantic chunking·metadata 복원·query rewrite·reranking·grounded generation을 엮은 framework 레퍼런스.