🔬 RAG 2.0:从向量搜索到图结构推理
🔍 RAG 2.0:从向量搜索到图结构推理
早期 RAG 是一条简单管道:搜索 + 生成。 RAG 2.0 是一套完整的知识推理系统——包含智能分块、混合搜索、重排序、图遍历和 Agentic 决策。
🔬 AI 深度解析专栏 · 第 20 期 📅 2026年4月15日 ✍️ 小敏说 AI
💡 本文要点:系统梳理基础 RAG 的五大坑、RAG 2.0 的核心改进方案(智能分块/混合搜索/重排序/图结构/Agentic),以及向量数据库选型和生产级最佳实践。
🎯 本文导读
- 🔹 基础 RAG 的工作原理:分块 → 向量化 → 搜索 → 生成
- 🔹 五大坑:分块策略、语义鸿沟、上下文丢失、噪声、多跳推理
- 🔹 RAG 2.0 的五项改进:智能分块、混合搜索、重排序、图结构、Agentic
- 🔹 GraphRAG:微软开源方案解析
- 🔹 RAG vs 长上下文:不是替代,是互补
- 🔹 向量数据库选型指南 + 生产最佳实践
一、📦 基础 RAG 是怎么工作的
大模型知识有截止日期,也不知道公司内部信息。RAG 的核心思路:在让模型回答之前,先帮它从外部数据库找到相关信息。
【离线阶段】
文档 → 分块(Chunking) → 向量化(Embedding) → 存入向量数据库
【在线阶段】
用户提问 → 向量化 → 向量数据库搜索相似文档 →
把问题+文档拼在一起 → 发给大模型 → 生成回答
向量化的原理:把文本转换成一串数字(向量),语义相似的文本在向量空间中距离更近。”猫在沙发上睡觉”和”小猫躺在沙发上”用词不同,但向量非常接近。
大模型就像一个百科全书式专家,RAG 给它配了一个”助手”——在他回答问题之前,助手先帮他从文件柜里找出相关资料。
💬 关键观点:基础 RAG 解决了大模型的两个天然缺陷——知识截止日期和私有知识盲区。这就是为什么几乎所有企业级 AI 助手都依赖 RAG。
二、🕳️ 基础 RAG 的五大坑
基础 RAG 看起来简单,用起来到处是坑:
坑一:分块策略不合理
最常见的做法是按固定字数切分(如每 500 字一块)。但这经常把完整论述从中间切断。
想象一份合同的第 7 条被切成两半——上半段说”如果发生违约”,下半段说”则需赔偿 100 万元”。检索到上半段时,你得不到完整信息。
坑二:语义鸿沟
用户问”怎么退货”,文档里写的是”商品退换政策”。向量搜索可能找不到这个匹配——用户的表达方式和文档的写法差异太大。
坑三:丢失上下文
检索到的 chunk 通常是孤立片段,缺少前后文。模型可能不知道”它”指的是谁,”上述方案”是什么方案。
坑四:检索数量的困境
检索太少,可能遗漏关键信息;检索太多,无关内容干扰判断(噪声淹没信号),还快速消耗上下文窗口。
坑五:多跳问题无能为力
有些问题需要综合多文档才能回答。比如”张三的直属上司负责的最大项目预算是多少?”——需要先找到张三的上司,再找那个人负责的项目,再找预算。基础 RAG 很难处理这类链式推理。
三、🔧 RAG 2.0 的五项核心改进
改进一:智能分块(Advanced Chunking)
| 分块策略 | 说明 | 适用场景 |
|---|---|---|
| 固定大小 | 按字数/token 数切分 | 最简单,效果一般 |
| 语义分块 | 检测语义边界来切分 | 叙述性文档 |
| 递归分块 | 按标题/段落/句子逐级切分 | 结构化文档 |
| 文档感知分块 | 理解文档结构(表格、列表等) | 复杂文档 |
| 父子分块 | 小块用于检索,大块用于上下文 | 兼顾精度和完整性 |
父子分块特别值得关注:用小 chunk 做精确检索(语义聚焦),返回时附带更多上下文的大 chunk(信息完整)。就像书里用精确索引找到关键段落,但给读者看的是整个章节。
改进二:混合搜索(Hybrid Search)
不要只用向量搜索!三种方式结合:
- 向量搜索:捕捉语义相似性
- 关键词搜索(BM25):精确匹配特定术语、型号、编号
- 元数据过滤:按时间、类别、来源过滤
实际案例:用户问”KB-2024-0531 错误怎么解决?”——向量搜索可能找不到这个编号,但关键词搜索可以精确匹配。两者结合效果最好。
改进三:重排序(Reranking)
检索到候选文档后,用专门的重排序模型重新排序:
查询 → 初始检索(Top-50) → 重排序模型 → 精选(Top-5) → 送给 LLM
初始检索追求”召回率”(尽可能多地找到相关文档),重排序追求”精确率”(把最相关的排到最前面)。常用重排序模型:Cohere Reranker、BGE-Reranker、Jina Reranker。
💬 关键观点:智能分块 + 混合搜索 + 重排序,这三项改进组合起来,能把 RAG 的检索准确率提升 30-50%。这是生产级 RAG 系统和原型系统的核心差距所在。
四、🕸️ 图结构 RAG:知识图谱的力量
这是 RAG 2.0 中最激动人心的方向——用知识图谱(Knowledge Graph)增强 RAG。
传统向量数据库存储的是孤立的文档块。但现实世界的知识是有关联的——人物之间有关系,事件之间有因果,概念之间有层级。
图结构 RAG:在向量数据库之上建立知识图谱,把实体关系显式存储起来。
传统 RAG:
[文档A] [文档B] [文档C] ...(孤立的块)
图结构 RAG:
[张三] --报告给-→ [李四]
[李四] --负责-→ [项目X]
[项目X] --预算-→ [500万]
[项目X] --使用-→ [技术Y]
当用户问多跳问题时,系统可以沿着图的边进行推理——先找到张三的上司是李四,再找到李四负责的项目 X,再找到项目 X 的预算。
GraphRAG(微软开源方案) 是目前最受关注的实现:
- 用 LLM 从文档中抽取实体和关系
- 构建知识图谱
- 对图谱进行社区检测(发现关联紧密的实体群组)
- 为每个社区生成摘要
- 查询时结合图谱遍历和社区摘要回答问题
💬 关键观点:图结构 RAG 专门解决了基础 RAG 最大的软肋——多跳推理。对于人事组织、知识库、法规体系这类有大量实体关系的场景,GraphRAG 的效果提升是质变级别的。
五、🤖 Agentic RAG:让 AI 自己决定怎么搜
另一个重要演进方向:Agentic RAG——让 AI Agent 控制整个检索过程。
基础 RAG 的检索策略是固定的:接收问题 → 搜索 → 生成。Agentic RAG 让模型自己决定:
- 需不需要检索?(有些问题模型本身就知道答案)
- 用什么方式检索?(关键词?向量?图谱?SQL 查询?)
- 检索结果够不够?要不要再搜一次?
- 要不要把问题分解成子问题分别检索?
用户提问 → Agent 判断
├→ 直接回答(不需要检索)
├→ 简单检索 → 回答
├→ 分解问题 → 多次检索 → 综合回答
└→ 检索 → 评估不够 → 修改查询 → 再检索 → 回答
这就像一个高效的研究助理——不是机械地执行搜索,而是根据问题复杂度灵活调整策略。
六、⚖️ RAG vs 长上下文:互补而非替代
现在模型上下文窗口越来越长—— Gemini 1.5 Pro 有 100 万 token,Claude 支持 20 万 token。有个自然的问题:上下文够长,还需要 RAG 吗?
| 维度 | RAG | 长上下文 |
|---|---|---|
| 成本 | 只处理相关部分,便宜 | 全部塞入,按 token 计费,贵 |
| 延迟 | 检索快 | 长上下文处理慢 |
| 精度 | 可能漏检 | “所有信息都在” |
| 数据量 | 可处理海量数据 | 受窗口限制 |
| 更新性 | 数据库随时更新 | 每次都要重新输入 |
两者不是替代关系,而是互补关系。
最佳实践:用 RAG 从海量数据中筛选相关内容,再利用长上下文窗口处理更多相关文档。就像做研究——先用搜索引擎找到相关论文(RAG),再仔细阅读这些论文(长上下文)。
七、🗄️ 向量数据库选型指南
| 数据库 | 类型 | 特点 |
|---|---|---|
| Pinecone | 托管云服务 | 开箱即用,无需运维 |
| Weaviate | 开源 | 内置混合搜索,功能丰富 |
| Milvus/Zilliz | 开源/云 | 高性能,大规模场景 |
| Qdrant | 开源 | Rust 编写,性能好 |
| Chroma | 开源 | 轻量级,适合原型 |
| pgvector | PostgreSQL 扩展 | 已有 PG 的团队首选 |
选择建议:
- 已有 PostgreSQL → pgvector
- 快速原型 → Chroma
- 生产级大规模部署 → Milvus 或 Pinecone
- 需要混合搜索 → Weaviate
八、✅ 生产级 RAG 的五条最佳实践
1. 评估驱动开发 必须建立评估 pipeline!核心指标:检索相关性、回答准确性、忠实度(回答是否基于检索内容而非模型编造)。
2. 查询改写(Query Rewriting) 在检索前,用 LLM 改写用户原始问题,使其更适合检索。把口语化问题转化为更精确的搜索查询。
3. 元数据是金矿 不要只存文本块。记录每个块来自哪个文档、哪个章节、什么时间、什么分类。检索时用元数据做过滤,大幅提升精度。
4. 持续迭代优化 RAG 不是一次性工程。部署后持续收集用户反馈,分析失败案例,改进分块策略、检索方式和提示词。
5. 缓存高频问题 对常见问题的回答做缓存,既能提速又能降成本。
🎯 一句话总结:生产级 RAG 的核心不在技术选型,在于评估体系。没有评估,你不知道优化方向;有了评估,每一次迭代都有依据。
🔮 趋势预判
1️⃣ GraphRAG 将成为企业知识库 RAG 的标配 向量搜索解决语义匹配,图结构解决关系推理——两者组合才是完整方案。
2️⃣ Agentic RAG 将取代固定管线 静态的”搜索-生成”管线终将被自适应的 Agent 所取代,灵活性和召回率都大幅提升。
3️⃣ RAG 和长上下文将深度融合 先用 RAG 筛选,再用长上下文深度处理——两者组合的模式会成为主流。
4️⃣ 评估体系将成为核心竞争力 技术方案逐渐趋同,谁的评估体系更完善、迭代更快,谁的 RAG 效果就更好。
📮 今日话题
💬 你在用 RAG 做项目时,最卡在哪个环节?分块策略、检索效果,还是回答质量评估?
欢迎留言分享踩坑经历,我会精选回复讨论。
🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。
🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。 📱 关注「小敏说 AI」公众号,深度解析不水文。