RAG의 문서 분할 방식이 검색 품질 저해한다
- •기존 RAG 파이프라인은 문서를 고정된 크기의 조각으로 나누어 인덱싱하는 방식의 한계를 가진다.
- •임의의 분할은 제목이나 섹션 등 의미 전달에 필수적인 구조적 단서를 무시하는 결과를 낳는다.
- •검색 과정에서 논리적 맥락이 파괴되면, 모델은 정보를 성공적으로 불러와도 실제 의미를 이해하지 못한다.
전통적인 검색 파이프라인은 문서를 인덱싱하기 전 256 혹은 512 토큰과 같은 임의의 고정된 크기로 분할한다. 이러한 방식은 코드 예제와 설명을 분리하거나 제목과 내용을 따로 떼어놓아 기술 문서 본연의 의미를 훼손하는 경우가 잦다. 검색 시스템이 높은 유사도 점수를 기록하더라도, 모델은 핵심 문맥과 추론 근거가 제거된 정보를 전달받게 되어 결과적으로 이해 실패로 이어진다.
문서의 구조인 제목, 섹션 경계, 목록 등은 정보가 어떻게 그룹화되고 이해되어야 하는지를 결정하는 핵심 요소이다. 검색 시스템은 글자 수에 집중하기보다 문서를 아이디어와 논리적 근거, 결과가 상호 연결된 하나의 일관된 주장으로 처리해야 한다. 저자는 고정 크기 분할 대신 콘텐츠의 의미가 유지되는 논리적 경계를 식별하는 방식으로 전환할 것을 제안한다. 이는 섹션 전체나 코드 블록과 설명, 다이어그램과 캡션을 하나의 단위로 유지하는 것을 의미한다.
문서를 파편화된 텍스트 문자열이 아닌 통합된 주장으로 다루는 것은 검색 엔진과 대규모 언어 모델 (LLM)이 원작자가 의도한 추론의 흐름을 유지하도록 돕는다. 인덱싱 단계에서 이러한 구조적 단서를 보존하지 못하면, 쿼리 과정에서 모델이 의도된 의미를 재구성하는 능력이 저하된다.
저자는 검색 엔진이 벡터 유사도에 기반해 관련 세그먼트를 찾더라도, 이것이 곧 완전한 진실을 제공함을 보장하지 않는다고 강조한다. 문서는 의도적인 구성을 통해 만들어지며, 인덱싱 전 구조가 해체되면 관계 데이터의 손실로 인해 모델이 정보 뒤에 숨겨진 '이유'를 파악할 수 없게 된다. 이는 문서의 의미적 무결성을 희생시키면서 인덱싱의 편의성을 추구하는 일반적인 검색 증강 생성 (RAG) 전략의 구조적 결함을 드러낸다.