GraphRAG 평가 결과, 채점자 따라 역전
- •GraphRAG는 LLM 평가에서는 이겼지만 ROUGE-2 정답 기준 점수에서는 일반 RAG에 밀렸다
- •GraphRAG는 모델이 평가한 범위형 질문에서 포괄성 72 to 83 percent를 기록했다
- •Novel split 쿼리 비용은 약 879 to 약 331,375 total tokens 범위였다
에드워드 이즈고로딘(Edward Izgorodin)은 August 29 GraphRAG 벤치마크 주장이 LLM 심판을 쓰는지, 정답 기반 지표를 쓰는지에 따라 뒤집힐 수 있다고 지적했다. 범위가 넓은 의미 파악 질문에서 GraphRAG community summaries는 포괄성 72 to 83 percent, 다양성 승률 62 to 82 percent를 기록했으며, root-level summaries는 answer tokens를 약 97 percent 줄였다. 다만 해당 수치는 gold answers 없이 LLM judge가 산출한 결과였다.
정답 기반 채점은 같은 비교에서 다른 결론을 냈다. ROUGE-2(reference answers와의 word-pair overlap) 기준으로 GraphRAG는 SQuALITY에서 6.99 대 10.08, QMSum에서 3.23 대 6.32로 plain RAG에 뒤졌다. 인용된 논문은 summary-ordering position bias만으로도 LLM judge의 선호가 뒤집힐 수 있다고 보고했다.
검색 성능도 평가 대상에 따라 갈렸다. GraphRAG-Bench에서 RAG (w rerank)는 fact retrieval에서 GraphRAG (local)을 60.92 대 49.29로 앞섰지만, HippoRAG2는 complex reasoning에서 RAG (w rerank)를 53.38 대 42.93으로 이겼다. 이즈고로딘은 같은 표라도 어느 행을 근거로 삼느냐에 따라 두 가지 결론을 모두 뒷받침할 수 있다고 말했다.
비용 비교 역시 균일하지 않았다. Novel split에서 total query tokens는 MS-GraphRAG(global) 약 331,375, LightRAG 약 100,832, Fast-GraphRAG 약 4,204, HippoRAG2 약 1,008, vanilla RAG 약 879였다. Index build는 HippoRAG2가 roughly 9.2 million tokens, GraphRAG가 roughly 115.5 million tokens로 약 twelvefold 차이를 보였지만, 이 수치들은 서로 다른 1차 출처에서 나온 것이며 하나의 통제된 비교는 아니었다.