RAG 与知识系统

graphrag

microsoft/graphrag

从文本构建实体关系与社区摘要,用图结构组织问答上下文,适合探索跨文档主题;当前上游已说明主要进入维护模式。

★ 35.9K星级
⑂ 3.8KFork 数
45未解决的问题
Python语言
MIT许可证
Q90编辑评分

概览

普通 RAG 擅长找到与问题相近的片段,但对“整个文档集合有哪些主要议题、不同实体如何相互影响”这类跨文档问题,孤立片段可能不够。GraphRAG 探索先抽取实体关系、形成图与社区摘要,再按问题组织上下文。其价值是提供另一种知识组织方式,而不是保证所有问答都优于向量检索。 当前 README 明确表示项目主要处于维护模式,不再接受新 PR 或实现新功能,会按需要修复问题和更新依赖。它是研究方法的实现示例,并非微软正式支持的产品;准备长期采用时应评估自行维护能力。

主要功能

  • 文本到结构化知识图流程
  • 社区层面的上下文组织
  • 实体关联问答
  • 面向语料的提示词调优

要求、安装和快速入门

从官方命令行 quickstart 创建独立项目目录、配置模型服务,并只放入少量测试文档进行首次索引。版本更新前查看 breaking-changes,保存现有配置与提示词;不要在未备份的工作目录直接覆盖初始化。

用法

准备一组项目复盘文档,同时提出局部事实问题和跨团队主题问题。与普通片段检索使用相同语料比较:答案覆盖哪些证据、是否混淆实体、是否遗漏反例,并记录首次索引及增量重建开销。确认收益后再扩大语料。

工作原理
索引流程将文本转化为结构化实体和关系,并生成用于检索的图组织信息及摘要。查询阶段结合实体附近的信息或更广泛的社区上下文生成回答。抽取提示词和语料领域会影响图质量,索引阶段本身会产生模型调用成本。

适用人群与环境
研究图检索的团队,以及需要跨文档分析且能承担维护工作的工程团队。 模型服务、索引存储、可控规模的文本语料与索引预算。

具体使用场景
• 跨文档主题分析:归纳多份报告的共同问题。
• 实体关联探索:追踪组织、人物或项目之间的联系。
• 图检索研究:比较图上下文与普通 RAG 的适用范围。

局限与选型边界
上游处于维护模式;索引成本可能较高。领域提示词通常需要调优,抽取错误可能扩散到社区摘要。图关系和模型生成内容都需要回查原文,不应把关联自动视作因果。

关联项目与选型分析
qdrant/qdrant:对照:用向量检索建立基线,判断图索引额外成本是否换来了更好的答案覆盖。

google/langextract:互补思路:显式字段抽取可以用于检查实体证据;两者之间需要自行实现数据转换。

资料说明
基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

模型兼容性与使用场景

需要按配置选择用于抽取、摘要和查询的模型;不同提供方和版本需按项目文档验证。

许可证与风险说明

仓库当前页面标注 MIT;完整条件请查看仓库 LICENSE,模型权重与数据集另查各自说明。

Editorial source review 2026-09-09T05:00:00.950Z. README and live repository page verified; current stars/forks from GitHub HTML. Last-push metadata retained from 2026-09-05 discovery snapshot. No runtime benchmark. Integration proposals are editorial analysis.

发布与维护

资料核对:2026-09-09。统计取自本次仓库页面;功能依据 README 与官方资料整理。版本变化请查看来源区的 Releases。 基于上游资料的编辑分析,未进行安装实测或性能基准;建议场景和项目搭配属于选型分析。

milvus

milvus-io/milvus

★ 45.7KGo

LanceDB

lancedb/lancedb

★ 11.1KRust

EvalScope

modelscope/evalscope

★ 3.2KPython

llm-app

pathwaycom/llm-app

★ 58.9KJupyter Notebook

onyx

onyx-dot-app/onyx

★ 32KPython

FastGPT

labring/FastGPT

★ 29.6KTypeScript