LightRAG: Simple and Fast Retrieval-Augmented Generation

LightRAG가 문서를 엔티티–관계 그래프로 색인하고 세부 검색과 전역 검색을 결합하는 방법, EMNLP 2025 실험 결과, 그리고 평가 설계의 한계를 분석합니다.

Jiphyeonjeon Team2026-07-3017 min read
lightragraggraphragknowledge-graphretrievalincremental-update

Paper: Guo, Z., Xia, L., Yu, Y., Ao, T., & Huang, C. (2025). LightRAG: Simple and Fast Retrieval-Augmented Generation. Findings of the Association for Computational Linguistics: EMNLP 2025, 10746–10761. ACL Anthology · arXiv:2410.05779 · Official code

이 글은 사용자가 지정한 arXiv v3와 이후 공개된 EMNLP 2025 출판본을 함께 검토했다. 출판본에는 arXiv v3에 없던 질의시간·문서 삽입시간·저장공간 측정이 추가돼 있다.

Abstract: LightRAG는 문서 청크를 곧바로 검색하지 않는다. 먼저 LLM으로 엔티티와 관계를 추출해 그래프로 색인한다. 질문이 들어오면 구체적인 대상을 찾는 세부 키워드와 넓은 주제를 찾는 전역 키워드를 따로 뽑고, 벡터 검색 결과에 그래프 이웃 정보를 보탠다. 저자 보고 기준으로는 NaiveRAG보다 네 데이터셋의 종합 승률이 모두 높았고, GraphRAG와의 다양성 비교에서도 일관되게 앞섰다. 그렇다고 모든 조건에서 GraphRAG보다 우수했던 것은 아니다. Mix 데이터셋의 종합 승률은 49.6%였고, 주요 품질 평가는 검색 재현율이나 근거 정확도가 아니라 GPT-4o-mini의 답변 선호도를 측정했다. 출판본은 평균 질의시간 11.2초 대 23.6초, 저장공간 39.5MB 대 286.7MB도 보고한다. 그러나 반복 실험의 분산과 전체 비용 조건은 제시하지 않는다. 따라서 성능과 효율 주장은 평가된 조건 안에서 읽어야 한다.


핵심 요약

항목 설명
연구 질문 그래프의 문맥 연결은 유지하면서 GraphRAG의 커뮤니티 보고서 검색과 전체 재색인 비용을 줄일 수 있는가?
핵심 기여 엔티티–관계 그래프 색인, 그래프 요소의 키–값 프로파일, 세부·전역 이중 검색, 증분 그래프 병합을 하나의 RAG 파이프라인으로 묶었다.
작동 방식 질문에서 세부·전역 키워드를 추출한다. 전자는 엔티티에, 후자는 관계 키에 벡터 검색으로 연결한 뒤 1-hop 이웃과 원문 일부를 모아 답변 문맥을 만든다.
대표 결과 NaiveRAG 대비 종합 승률은 Agriculture 67.6%, CS 61.2%, Legal 84.8%, Mix 60.0%였다. GraphRAG 대비로는 54.8%, 52.0%, 52.8%, 49.6%다.
핵심 한계 데이터셋마다 LLM이 만든 질문 125개를 GPT-4o-mini로 자동 판정했다. 검색 정확도·근거 충실도·사람 평가는 보고하지 않았고, 비용 실험에도 분산·하드웨어 세부 정보가 부족하며, 비교 사례 표 하나에는 질문과 답변이 맞지 않는 오류도 있다.

TL;DR

  • LightRAG는 문서를 LLM으로 엔티티–관계 그래프로 색인하고 각 요소를 검색 가능한 키–값 프로파일로 만든 뒤, 질문의 세부(low-level) 키워드는 엔티티에, 전역(high-level) 키워드는 관계에 연결해 1-hop 이웃과 원문을 함께 가져오는 이중 검색 Graph RAG다(Findings of EMNLP 2025).
  • LightRAG는 NaiveRAG 대비 네 데이터셋 종합 승률 60.0–84.8%를 기록했고, 출판본 측정 기준 GraphRAG 대비 평균 질의시간 11.2초 대 23.6초·저장공간 39.5MB 대 286.7MB로 더 가볍지만, GraphRAG 대비 종합 승률은 근소(49.6–54.8%)해 Mix에서는 오히려 뒤졌다.
  • LightRAG의 평가는 LLM이 만든 데이터셋별 125개 질문을 GPT-4o-mini가 일대일 선호 판정한 것으로, 검색 재현율·근거 충실도·사람 평가가 없고 시간·저장공간 측정도 단일 구성의 단일 수치라 "모든 RAG를 대체하는 더 빠른 방법"이 아니라 그래프 검색 단위를 커뮤니티 보고서에서 엔티티·관계 프로파일로 바꾼 설계로 읽어야 한다.

목차

  1. LightRAG가 바꾸려는 검색 단위
  2. 문서를 그래프로 색인하는 과정
  3. 세부 검색과 전역 검색을 나누는 이유
  4. 수식으로 다시 본 LightRAG
  5. Naive RAG·GraphRAG와 무엇이 다른가
  6. 실험 결과와 그 의미
  7. 구성요소 제거 실험, 비용, 증분 갱신
  8. 주의해서 읽을 점과 한계
  9. 결론

1. LightRAG가 바꾸려는 검색 단위

일반적인 RAG는 문서를 청크로 나눈 뒤 질문과 임베딩이 가까운 청크를 찾는다. 구현이 단순하고 구체적인 사실을 찾는 데 효과적이지만, 여러 문서에 흩어진 엔티티와 관계를 한꺼번에 설명해야 할 때는 문맥이 조각날 수 있다.

논문의 예시는 “전기차 보급이 도시 대기질과 대중교통 인프라에 어떤 영향을 주는가?”라는 질문이다. 답을 만들려면 전기차, 배출가스, 대기질, 도시 계획, 교통 인프라의 연결을 함께 봐야 한다. 청크 검색은 각 주제와 가까운 문단을 찾을 수 있어도, 이들이 어떤 관계로 이어지는지 자체적으로 표현하지는 않는다.

Microsoft GraphRAG는 이런 문제를 엔티티–관계 그래프와 커뮤니티 요약으로 다룬다. 그러나 커뮤니티 보고서를 미리 만들고 질의 시점에 여러 보고서를 훑는 과정은 무겁다. 새 문서가 들어오면 커뮤니티 구조와 보고서를 다시 계산해야 하는 부담도 생긴다.

LightRAG는 그래프를 포기하지 않으면서 검색 단위를 더 작게 잡는다.

  • 원문에서 엔티티와 관계를 추출한다.
  • 각 엔티티와 관계를 검색 가능한 키–값 항목으로 만든다.
  • 질문의 구체적인 단서와 포괄적인 주제를 따로 찾는다.
  • 커뮤니티 보고서 대신 관련 엔티티·관계와 주변 구조를 바로 가져온다.

핵심은 “그래프를 쓰느냐”보다 그래프의 무엇을 검색 단위로 삼느냐에 있다.


2. 문서를 그래프로 색인하는 과정

LightRAG architecture

그림 1. LightRAG의 그래프 색인과 이중 검색 구조. 원문 청크에서 엔티티·관계를 추출하고 중복을 합친 뒤, 질문의 세부·전역 키워드로 그래프 요소와 원문을 검색한다. — 원논문 Figure 1을 주변 본문 없이 잘라 인용. 출처: Guo et al. (2025), CC BY 4.0.

2.1 엔티티와 관계 추출

문서는 먼저 여러 청크 D_i로 나뉜다. LLM은 각 청크에서 사람, 장소, 사건, 개념 같은 엔티티와 이들 사이의 관계를 뽑는다. 엔티티는 노드가 되고 관계는 간선이 된다.

이 단계는 고정된 스키마를 적용하는 전통적인 정보 추출이라기보다 LLM 기반의 개방형 그래프 구성에 가깝다. 어떤 엔티티와 관계가 그래프에 남는지는 모델, 프롬프트, 청크 경계에 영향을 받는다.

2.2 검색 가능한 키–값 프로파일

그래프를 만들었다고 바로 검색할 수 있는 것은 아니다. LightRAG는 각 그래프 요소에 검색용 키와 생성용 값을 붙인다.

그래프 요소 검색 키
엔티티 주로 엔티티 이름 유형, 설명, 원문 청크 ID
관계 연결된 엔티티와 전역 주제에서 만든 복수 키워드 관계 설명, 관련 원문

관계의 키에 더 넓은 주제를 넣는 이유는 “Pride and Prejudice의 저자는 누구인가?” 같은 구체적 질문과 “AI가 현대 교육에 어떤 영향을 주는가?” 같은 포괄적 질문이 서로 다른 검색 단서를 요구하기 때문이다.

2.3 중복 제거와 증분 병합

서로 다른 청크에서 같은 엔티티나 관계가 반복해서 추출될 수 있다. LightRAG는 프로파일링 이후 동일한 항목을 합쳐 그래프 크기와 중복을 줄인다.

새 문서가 들어오면 기존 말뭉치를 처음부터 다시 처리하지 않는다. 새 문서만 같은 방식으로 색인한 뒤 기존 노드·간선 집합과 합친다. 이 설계는 계속 바뀌는 사내 문서나 연구 자료처럼 추가가 잦은 지식베이스를 염두에 둔다.

다만 논문이 설명하는 병합은 추출과 합집합 수준이다. 동명이인, 별칭, 서로 충돌하는 설명, 시간에 따라 바뀐 관계를 얼마나 정확하게 해결하는지는 별도로 평가하지 않았다.


3. 세부 검색과 전역 검색을 나누는 이유

LightRAG는 질문 q에서 두 종류의 키워드를 추출한다. 논문은 이를 low-level과 high-level이라고 부른다.

  • 세부 키워드(low-level): 구체적인 엔티티, 속성, 사실을 찾는 단서
  • 전역 키워드(high-level): 넓은 주제, 관계, 관점을 찾는 단서

세부 키워드는 벡터 데이터베이스에서 엔티티 후보를 찾는다. 전역 키워드는 관계에 붙은 주제 키와 연결된다. 마지막으로 선택된 노드와 간선의 1-hop 이웃을 모아 구조적 문맥을 보강한다.

LightRAG retrieval and generation example

그림 2. 영화 추천 시스템의 평가 지표를 묻는 질문에서 high-level·low-level 키워드를 분리하고, 관련 엔티티·관계·원문을 모아 답을 생성하는 예시. — 출판본 Figure 2를 주변 본문 없이 잘라 인용. 출처: Guo et al. (2025), CC BY 4.0.

그림 2에서 Metrics, Movie recommendation systems, Evaluation methods는 넓은 관계를 찾는 전역 키워드다. Accuracy, Precision, Recall, F1 score는 세부 항목을 찾는 키워드다. 검색 결과에는 엔티티와 관계 설명뿐 아니라 출처 청크의 문장도 포함된다.

이 구조를 “그래프 탐색만으로 답한다”고 이해하면 정확하지 않다. 벡터 검색은 여전히 핵심이며, 그래프는 벡터 검색의 대상을 청크에서 엔티티와 관계로 확장한다. 최종 답변도 검색된 텍스트 값을 일반 LLM에 전달해 생성한다.


4. 수식으로 다시 본 LightRAG

4.1 RAG의 두 함수

문서 집합을 D, 질문을 q, 색인 함수를 \phi, 검색 함수를 \psi, 생성 모델을 \mathcal{G}라고 하자. 논문의 RAG 정의를 정리하면 다음과 같다.

\widehat{D}=\phi(D), \qquad \mathcal{M}(q;D) = \mathcal{G}\!\left(q,\psi(q;\widehat{D})\right)

LightRAG의 차이는 생성 모델보다 \phi\psi에 있다. \phi는 문서를 평면적인 청크 벡터 집합이 아니라 그래프 기반 색인으로 바꾸고, \psi는 질문을 두 수준의 키워드로 나눠 그래프 요소를 찾는다.

4.2 그래프 구성

논문의 Equation 2를 읽기 쉽게 쓰면 다음과 같다.

(\widehat{V},\widehat{E}) = \operatorname{Dedupe} \!\left( \operatorname{Prof}(V,E) \right), \qquad (V,E) = \bigcup_{D_i\in D} \operatorname{Recog}(D_i)

\operatorname{Recog}는 청크에서 엔티티와 관계를 추출하고, \operatorname{Prof}는 검색에 사용할 키–값 설명을 만든다. \operatorname{Dedupe}는 여러 청크에서 겹친 요소를 합친다.

여기서 주의할 점은 그래프의 품질이 수식만으로 보장되지 않는다는 것이다. 세 함수가 모두 LLM의 추출·요약·병합 판단에 기대므로, 잘못 빠진 엔티티나 틀린 관계는 이후 검색 단계까지 이어진다.

4.3 증분 갱신

새 문서 D'에서 만든 그래프를 (\widehat{V}',\widehat{E}')라고 하면 증분 갱신은 다음 합집합으로 표현할 수 있다.

\widehat{V}_{\text{new}} = \widehat{V}\cup\widehat{V}', \qquad \widehat{E}_{\text{new}} = \widehat{E}\cup\widehat{E}'

이 식은 기존 문서를 다시 추출하지 않는다는 장점을 보여준다. 반면 단순 합집합만으로는 충돌 해결과 전역적인 엔티티 정합성이 자동으로 해결되지 않는다. 실제 운영에서는 별칭 통합, 삭제 전파, 출처 추적이 별도 문제로 남는다.


5. Naive RAG·GraphRAG와 무엇이 다른가

방법 색인 단위 질의 시점 검색 갱신 특성
Naive RAG 텍스트 청크와 임베딩 질문과 가까운 청크 top-k 새 청크 임베딩 추가는 비교적 단순하다.
RQ-RAG 청크 색인 질문을 재작성·분해한 뒤 여러 검색 수행 색인은 평면적이며 질의 단계의 LLM 호출이 늘어난다.
HyDE 청크 색인 가상 답변 문서를 만든 뒤 유사 청크 검색 질문 표현은 넓어지지만 말뭉치 구조는 사용하지 않는다.
GraphRAG 엔티티–관계 그래프와 커뮤니티 보고서 포괄적 질문에서 관련 커뮤니티 보고서를 집계 새 데이터가 커뮤니티와 보고서 재계산을 유발할 수 있다.
LightRAG 엔티티·관계의 키–값 프로파일과 원문 세부 키워드는 엔티티, 전역 키워드는 관계를 검색하고 1-hop 이웃을 추가 새 문서의 그래프를 기존 그래프에 병합한다.

LightRAG가 GraphRAG보다 “가볍다”는 말은 그래프 자체가 작다는 뜻만은 아니다. 질의마다 커뮤니티 보고서 묶음을 읽는 대신, 질문과 가까운 엔티티·관계 프로파일을 벡터 검색으로 바로 찾는다는 뜻에 가깝다.

반대로 Naive RAG보다 색인 과정은 무겁다. 모든 청크에서 LLM으로 엔티티와 관계를 추출하고, 프로파일을 생성하며, 중복을 병합해야 한다. LightRAG의 효율 이점은 쓰기 비용이 없어서가 아니라, 비싼 그래프 색인을 감수한 뒤 읽기와 증분 갱신을 줄이는 구조에서 나온다.


6. 실험 결과와 그 의미

6.1 데이터와 평가 방식

저자들은 428개 대학 교재로 구성된 UltraDomain에서 네 분야를 골랐다.

데이터셋 문서 수 전체 토큰 수
Agriculture 12 2,017,886
CS 10 2,306,535
Legal 94 5,081,069
Mix 61 619,009

질문은 사람이 작성하지 않았다. 데이터셋마다 LLM이 사용자 5명, 사용자별 과제 5개, 과제별 질문 5개를 만들어 125개 질문을 생성했다. 질문은 개별 사실보다 전체 말뭉치의 이해를 요구하도록 설계됐다.

실험의 주요 설정은 다음과 같다.

설정
비교 방법 NaiveRAG, RQ-RAG, HyDE, GraphRAG
LLM GPT-4o-mini
청크 크기 1,200 tokens
GraphRAG·LightRAG gleaning 1
평가 GPT-4o-mini를 이용한 일대일 답변 비교
평가 차원 포괄성(Comprehensiveness), 다양성(Diversity), 유용성(Empowerment), 종합(Overall)

판정 순서의 영향을 줄이기 위해 두 답변의 위치는 번갈아 배치했다. 이 실험이 측정한 것은 정답률이나 검색 recall이 아니다. 자동으로 만든 고수준 질문에 대해 LLM 판정자가 어느 답변을 더 선호했는지를 측정했다.

6.2 전체 결과

LightRAG Table 1 win rates

그림 3. 네 데이터셋과 네 평가 차원에서 각 기준선과 LightRAG를 일대일로 비교한 승률. — 원논문 Table 1을 주변 본문 없이 잘라 인용. 출처: Guo et al. (2025), CC BY 4.0.

핵심 수치를 간추리면 다음과 같다.

비교 대상 Agriculture CS Legal Mix
NaiveRAG 대비 LightRAG 종합 승률 67.6% 61.2% 84.8% 60.0%
GraphRAG 대비 LightRAG 종합 승률 54.8% 52.0% 52.8% 49.6%
GraphRAG 대비 LightRAG 다양성 승률 77.2% 59.2% 73.6% 64.0%

NaiveRAG와 비교한 LightRAG의 종합 승률은 네 데이터셋에서 모두 50%를 넘는다. 가장 큰 차이는 토큰 수가 5,081,069인 Legal에서 나타난다. RQ-RAG와 HyDE를 상대로도 네 데이터셋의 종합 평가에서 모두 50%를 넘겼다.

GraphRAG와의 차이는 훨씬 작다. Agriculture, CS, Legal에서는 LightRAG가 근소하게 앞섰지만 Mix에서는 49.6%로 뒤졌다. 세부 항목에서도 Mix의 포괄성은 49.6%, 유용성은 49.2%다. 따라서 논문 본문의 “GraphRAG를 일관되게 능가한다”는 서술은 Table 1 전체와 맞지 않는다.

다양성 평가에서는 네 데이터셋 모두 LightRAG가 앞선다. 세부 엔티티와 넓은 관계를 함께 가져오는 구조가 답변의 관점 수를 늘렸다고 해석할 수 있다. 그러나 판정자는 여전히 GPT-4o-mini이며, 다양성이 곧 근거 정확성을 뜻하지는 않는다.


7. 구성요소 제거 실험, 비용, 증분 갱신

7.1 두 검색 수준이 모두 필요한가

Table 2는 NaiveRAG와 비교한 종합 승률을 기준으로 구성요소 제거 실험을 제시한다.

모델 Agriculture CS Legal Mix
LightRAG 67.6% 61.2% 84.8% 60.0%
-High 64.8% 56.0% 78.0% 57.6%
-Low 65.2% 56.4% 81.2% 64.8%
-Origin 74.4% 60.8% 84.4% 55.6%

전역 검색을 없앤 -High는 네 데이터셋에서 모두 전체 모델보다 낮다. 세부 검색을 없앤 -Low도 세 데이터셋에서는 낮지만 Mix에서는 64.8%로 전체 모델보다 높다. 두 검색을 함께 쓰는 구성이 대체로 유효했지만, 모든 말뭉치에서 최적이었던 것은 아니다.

-Origin은 원문을 검색 문맥에서 제거하고 그래프 프로파일만 사용한다. Agriculture에서는 74.4%로 전체 모델보다 높지만 Mix에서는 55.6%로 낮다. 그래프 요약이 원문의 잡음을 덜어낼 가능성은 보이지만, 이 실험만으로 원문을 제거해도 근거 충실도가 유지된다고 말할 수는 없다. 출처 인용이나 문장 단위의 근거 충실도를 평가하지 않았기 때문이다.

7.2 “빠르다”는 주장의 정확한 범위

LightRAG cost comparison

그림 4. Legal 데이터셋에서 GraphRAG와 LightRAG의 검색 및 증분 갱신 비용을 토큰과 API 호출 수로 비교한 계산. — 출판본 Table 3을 주변 본문 없이 잘라 인용. 출처: Guo et al. (2025), CC BY 4.0.

저자들의 Legal 데이터셋 계산에서 GraphRAG는 1,399개 커뮤니티를 만들고, 검색에 사용한 level-2 커뮤니티 610개의 보고서를 평균 1,000토큰씩 처리한다. 검색 문맥은 모두 610,000토큰이다. LightRAG는 키워드 생성과 검색에 100토큰 미만, API 호출 1회를 사용한다고 보고한다.

새로 추가되는 데이터가 기존 Legal 데이터셋과 같은 크기라고 가정하면 GraphRAG의 커뮤니티 보고서 재생성 비용은 다음처럼 제시된다.

1{,}399 \times 2 \times 5{,}000 + T_{\text{extract}}

LightRAG는 새 문서의 엔티티·관계 추출 비용인 T_{\text{extract}}만 추가된다고 본다.

그림 4의 수치는 GraphRAG의 특정 커뮤니티 구성과 보고서 길이를 전제로 계산한 토큰 수와 호출 횟수다. EMNLP 출판본의 부록에는 이 계산과 별도로 시간과 저장공간을 측정한 결과가 추가됐다.

측정값 LightRAG GraphRAG
평균 질의시간 11.2초 23.6초
최종 저장공간 39.5MB 286.7MB
문서 5개 삽입시간 범위 418–561초 642–953초

추가한 문서의 길이는 41,224–73,989토큰이었다. 이 측정에서는 LightRAG가 더 빨랐고 저장공간도 작았다. 그러나 표에는 하드웨어, 동시 요청 수, 반복 횟수, 오차 범위가 없다. 따라서 610,000 대 100이라는 토큰 계산과 11.2초 대 23.6초라는 측정값은 유용한 비교 근거지만, 모든 GraphRAG 구현과 운영 환경에 그대로 적용되는 상수는 아니다.


8. 주의해서 읽을 점과 한계

8.1 검색 성능을 직접 측정하지 않았다

논문은 “검색 정확도가 향상됐다”고 설명하지만, 주요 표가 보여주는 것은 답변을 일대일로 비교한 승률이다. 검색한 엔티티와 관계의 재현율·정밀도, 필요한 원문을 실제로 찾았는지, 잘못된 간선이 답변에 들어갔는지는 보고하지 않는다.

이 구분은 중요하다. 더 길고 다양한 답변이 LLM 판정자에게 선호될 수 있지만, 그 답변이 원문에 더 충실하다는 보장은 없다. 논문에서 빠진 핵심 평가 축은 다음과 같다.

  • 검색한 원문 청크의 재현율과 정밀도
  • 엔티티·관계 추출 정확도
  • 답변 문장별 출처 연결과 인용 정확도
  • 그래프 프로파일과 원문 사이의 의미 보존

8.2 질문 생성과 평가가 같은 모델 계열에 묶여 있다

질문은 LLM이 만들고, LightRAG의 엔티티·관계 추출과 키워드 생성에는 GPT-4o-mini가 쓰이며, 답변 비교도 GPT-4o-mini가 맡는다. 답변 순서를 바꾼 것은 위치 편향을 줄이지만, 같은 모델 계열의 표현 선호가 질문·생성·평가에 반복해서 들어가는 문제까지 없애지는 못한다.

이는 실험을 무효화하는 근거가 아니다. 다만 사람 평가, 다른 판정 모델, 정답이 있는 사실형 질문, 적대적 방해 문맥이 없으므로 결과의 외적 타당성은 제한된다.


9. 결론

LightRAG의 핵심은 지식 그래프를 만드는 데서 끝나지 않는다. 그래프의 엔티티와 관계를 검색 가능한 키–값 단위로 바꾸고, 질문의 세부 단서와 넓은 주제를 서로 다른 경로로 찾도록 설계한 데 있다. 이 덕분에 GraphRAG의 커뮤니티 보고서를 매번 훑지 않고도 그래프 문맥을 활용할 수 있으며, 새 문서도 기존 그래프에 덧붙일 수 있다.

저자들이 보고한 결과를 보면 이 설계는 특히 답변의 포괄성과 다양성을 높일 가능성이 있다. NaiveRAG와 비교한 종합 승률은 네 데이터셋에서 모두 50%를 넘었고, GraphRAG와 비교한 다양성 평가에서도 모두 앞섰다.

그보다 넓은 결론은 보류해야 한다. GraphRAG와 비교한 종합 결과는 세 데이터셋에서 근소한 우위였고, Mix에서는 49.6%로 뒤졌다. 질문 생성과 자동평가가 LLM에 의존하며, 검색 정확도와 근거 충실도를 직접 측정하지 않았다는 한계도 있다. 출판본의 시간·저장공간 측정 역시 한 구성의 단일 수치로 제시돼 변동성과 환경 의존성을 판단하기 어렵다.

따라서 LightRAG를 “모든 RAG를 대체하는 더 빠른 방법”으로 받아들이기보다는, 그래프의 검색 단위를 커뮤니티 보고서에서 엔티티·관계 프로파일로 바꾼 설계로 이해하는 편이 정확하다. 그래프 추출 품질과 출처 추적, 수정·삭제를 포함한 갱신, 동일한 예산을 적용한 독립 평가까지 확인해야 실제 가치를 판단할 수 있다.

References

Edge, D., Trinh, H., Cheng, N., Bradley, J., Chao, A., Mody, A., Truitt, S., & Larson, J. (2024). From local to global: A graph RAG approach to query-focused summarization [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2404.16130

Guo, Z., Xia, L., Yu, Y., Ao, T., & Huang, C. (2025). LightRAG: Simple and fast retrieval-augmented generation. In C. Christodoulopoulos, T. Chakraborty, C. Rose, & V. Peng (Eds.), Findings of the Association for Computational Linguistics: EMNLP 2025 (pp. 10746–10761). Association for Computational Linguistics. https://doi.org/10.18653/v1/2025.findings-emnlp.568

HKUDS. (n.d.). LightRAG [Computer software]. GitHub. https://github.com/HKUDS/LightRAG

Jaykumaran. (2024, November 12). LightRAG: Simple and fast alternative to GraphRAG for legal doc analysis. LearnOpenCV. https://learnopencv.com/lightrag/

Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., Küttler, H., Lewis, M., Yih, W.-T., Rocktäschel, T., Riedel, S., & Kiela, D. (2020). Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems, 33, 9459–9474. https://proceedings.neurips.cc/paper/2020/hash/6b493230205f780e1bc26945df7481e5-Abstract.html