RAG技术的演进
如果你曾尝试或者已经将大模型应用于实际业务,大概率经历过这样的“至暗时刻”:明明喂给了它海量文档,它却依然对最新的内部数据一无所知;问它一个专业问题,它自信满满地编造了一个看似合理实则荒谬的答案;或者当你试图让它处理复杂任务时,它像个只会背书的书呆子,完全不懂变通。
这些问题的根源在于:**大模型虽然博学,但它没有“实时记忆”,也不懂“查证核实”。**
为了解决这个难题,**RAG(检索增强生成)** 应运而生。如果把大模型比作一个绝顶聪明但被关在小黑屋里的天才,那么RAG就是给他装上了一根网线、配了一个图书馆管理员,甚至组建了一支专家团队。它让AI从“闭卷瞎猜”变成了“开卷答题”,再到如今能够自主查资料、做推理、调工具的“智能体”。
从2020年学术界的一个理论雏形,到如今成为企业落地大模型的“标配基础设施”,RAG技术在短短五年间经历了怎样的演变?它是如何一步步解决幻觉、安全和复杂推理难题的?本文结合一些材料进行系统梳理,带你沿着 **Naive RAG → Advanced RAG → Modular RAG → Graph RAG → Agentic RAG** 的演进路线,作为知识科普用,内容并未详细展开。
1,RAG理论提出
大概在2020年之前,学术界已有将检索与生成结合的零星尝试,但尚未形成系统化的方法论。2020年,这一领域迎来了两个具有里程碑意义的工作:Facebook在论文Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks正式提出"RAG"概念并将其应用于知识密集型任务,同时Google的REALM通过在预训练阶段融入潜在知识检索器,显著提升了开放域问答的性能。
2,引入模型应用
2022年底ChatGPT发布后,迅速引爆大模型,然而在实际业务应用场景落地中,大模型所面临的问题,包括:
-
知识的局限性:模型的知识源于它的训练数据,而现有的主流大模型训练集都是基于现有的网络公开数据,对于一些实时性的、非公开的、离线的数据无法获取到,存在知识盲区;
-
幻觉问题:模型输出基于概率模型,存在知识边界感知不准确和因过度自信一本正经的胡说八道的情况,尤其在大模型自身不具备的某一方面的知识或者不擅长的场景该问题表现更明显;
-
数据安全性:对于企业来说,数据安全问题非常重要,如何保障自身私域数据的安全性是大模型应用中不得不面对的问题。
Agent代理应用中,知识库作为代理的LongMemory也是必不可少的一个基础设施。
3,快速发展
ChatGPT发布后,RAG研究更是进入了加速发展的黄金时期。在这个过程中,RAG技术逐渐从单一的检索-生成框架,演化为包含多跳推理、记忆增强和多模态等复杂功能的综合系统。

4,NaiveRAG,
2020年10月,Meta团队在论文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》中首次定义Naive RAG架构,确立了"索引-检索-生成"三阶段流程:
- 索引(Indexing):索引首先清理和提取各种格式的原始数据,如 PDF、 HTML、 Word 和 Markdown,然后将其转换为统一的纯文本格式。为了适应语言模型的上下文限制,文本被分割成更小的、可消化的块(chunk)。然后使用嵌入模型将块编码成向量表示,并存储在向量数据库中。这一步对于在随后的检索阶段实现高效的相似性搜索至关重要。
- 检索(Retrieval):在收到用户查询(Query)后,RAG 系统采用与索引阶段相同的编码模型将查询转换为向量表示,然后计算索引语料库中查询向量与块向量的相似性得分。该系统优先级和检索最高 k (Top-K)块,显示最大的相似性查询。这些块随后被用作 prompt 中的扩展上下文。
- 生成(Generation):提出的查询(Query)和选定的文档(Chunks)被合成为一个连贯的提示,大语言模型负责生成回复。
5,AdvancedRAG
Advanced RAG 的雏形源于对 Naive RAG(索引→检索→生成)的局限性突破。早期研究者发现单纯依赖向量检索存在 语义鸿沟 (如用户提问模糊或需多跳推理时检索失效)和 信息冗余 (检索结果重复或无关)等问题。为此,Meta、微软等团队开始探索全流程优化框架,提出 检索前预处理 、检索后精炼以及Embedding模型优化等方向:
关键性技术突破:
- 预索引优化
-
多粒度分块策略:引入滑动窗口分割、语义分块等策略,解决长文本切分导致的语义断裂问题(如将文档按段落、章节动态划分)
-
引入元数据:把元数据嵌入块中提升检索效率(标题、摘要、作者、时间、实体信息)
-
混合索引:结合 BM25关键词匹配 与 向量语义检索,平衡精确召回与语义理解能力。
-
假设性问题:让LLM为每个块生成一个问题,保存问题与文本块的映射关系,将这些问题存入向量数据库中。在检索时,先基于向量问题数据库进行查询搜索,找到相似问题后,然后在检索后路由到原始文本块,并将它们作为上下文发送给LLM以获得答案。这种方法通过查询与假设性问题之间更高的语义相似性,提高了搜索质量。
-
HyDE(Hypothetical Document Embeddings):通过逆向逻辑方法,让LLM给定查询生成一个假设性回应,然后使用其向量和查询向量来提高搜索质量。
- 后索引优化:
-
ReRank:重新排序以将最相关的信息重新定位到提示的边缘是一个简单的想法。
-
Prompt Compression:重点在于压缩不相关的上下文,突出关键段落,并减少整体上下文长度。
- Embedding:
-
Fine-tuning Embedding:微调的目的是增强检索内容和查询之间的相关性。通常,微调嵌入的方法分为在特定领域上下文中调整嵌入和优化检索步骤。特别是在处理进化或稀有术语的专业领域,这些定制的嵌入方法可以提高检索相关性。
-
Dynamic Embedding:动态嵌入根据单词出现的上下文进行调整,不同于为每个单词使用单个向量的静态嵌入,理想情况下,嵌入应该包含尽可能多的上下文,以确保“healthy”的结果。
- 查询转换:
- 查询转换利用LLM作为推理引擎来修改用户输入,以提高检索质量。对于更复杂的用户查询,可以基于LLM将其进行子查询拆解,分别得到子查询的关联上下文信息后整合到一起提供给LLM生成初始复杂问题的最终答案。当涉及到多轮上下文对话中,如果利用历史对话补齐当前对话信息完整性,以实现更准确的信息检索同样涉及到查询转换。
6,ModularRAG
Modular RAG是RAG范式的又一演变,强调灵活性、多样化和定制化。ModularRAG通过将检索和生成流程分解为独立、可重用的组件,实现了针对特定领域的优化和任务适应性。
Augmented Module

Augmented Process

技术特点:
- Modular RAG 将传统 RAG 系统的线性流程拆分为 独立可插拔的模块 (如检索器、预处理器、生成器等),每个模块专注于特定功能(如查询优化、混合检索、生成控制),支持像“乐高积木”一样自由组合。
- 动态流程编排能力:通过路由(Routing)、调度(Scheduling)和知识图谱融合机制,实现 多路径检索与智能决策。
- 混合检索策略与工具集成:支持 稀疏检索(BM25)与密集检索(向量模型)结合,并集成外部 API、数据库等工具。
7,GraphRAG,
Graph RAG 引入了知识图谱的概念,通过构建实体之间的关系网络,增强了对复杂知识的表示和检索能力。在索引阶段,Graph RAG 不仅提取文本中的实体和关系,还构建了知识图谱,将文档中的知识组织成一个结构化的网络;在查询阶段,利用知识图谱的语义信息,能够更准确地理解用户问题,检索到相关的知识。Graph RAG 在处理需要深层逻辑推理和知识关联的问题时表现出色。

Graph RAG的特点包括:
- 节点连接性:捕获并推理实体之间的关系。
- 层次知识管理:通过基于图的层次结构处理结构化和非结构化数据。
- 上下文丰富:通过利用基于图的路径添加关系理解。
Graph RAG局限性:
-
可扩展性有限:依赖图结构可能会限制可扩展性,特别是在数据源广泛时。
-
数据依赖:高质量的图数据对于有意义的输出至关重要,限制了其在非结构化或注释不佳的数据集中的适用性。
-
集成复杂性:将图数据与非结构化检索系统集成增加了设计和实现的复杂性。
Graph RAG适用于医疗诊断、法律研究等需要对结构化关系进行推理的应用领域。
8,AgenticRAG,
Agentic RAG,在RAG的基础上引入了AI“代理”(Agent)。在Agentic RAG中,AI代理模块负责协调检索和生成过程,而不是简单地遵循固定的单次检索-生成流程。通过将RAG的知识检索能力与AI代理的决策能力相结合,突破传统RAG在多源异构数据整合和多跳推理任务上的局限。

技术性突破:
-
Agentic RAG不再局限于单一知识源,可以聚合来自多个地方或服务的信息。通过代理可以访问各种工具或数据源,包括用于私有文档索引的向量搜索引擎、用于通用知识或实时信息的网络搜索API、用于计算的计算器,以及其他内部API(如数据库、电子邮件等);
-
Agentic RAG引入了迭代推理和验证,不再局限于单一次的检索。Agentic RAG系统围绕Agent代理核心组织,该代理负责协调这些步骤。代理实际上位于管道的中间,决定如何路由查询和数据。这意味着Agentic RAG通常涉及反馈循环或迭代过程,而不是单次通过。
-
此外,Agentic RAG支持多代理架构:你可以有一个路由代理,将复杂任务分配给多个专门的检索代理,每个代理负责不同的领域(一个代理负责内部文档,一个代理负责网络数据等),然后由一个协调(主)代理汇总发现结果;
-
更好的适应性:Agentic RAG体现了“计划和执行”的范式——它可以即时调整策略以应对新的或不断发展的查询。代理的包含记忆和规划能力意味着系统可以在没有明确重新编程的情况下适应上下文变化或不可预见的情况。从静态查找思维模式转变为自适应问题解决思维模式。Agentic RAG不受开发人员预期场景的限制;代理可以利用其一般推理能力来处理新的问题类型或数据源,使系统在需求增长时更加稳健。
回顾RAG的进化史,我们看到的不仅仅是技术的演进,更是AI应用的跨越。(下述是AI总结)
-
Naive RAG
解决了“从无到有”,让模型有了外挂知识库;
-
Advanced RAG
解决了“从有到优”,通过精细化打磨让检索更准、回答更稳;
-
Modular RAG
解决了“从优到活”,像搭积木一样适配千行百业的个性化需求;
-
Graph RAG
解决了“从点到面”,用知识图谱赋予了AI理解复杂关系的能力;
-
Agentic RAG
则实现了“从知到行”,让AI拥有了规划、反思和使用工具的“大脑”。
当下,RAG早已不再是单纯的“检索+生成”管道。业内的最佳实践告诉我们:没有银弹,只有最适合场景以及必须的大量知识准备与调整。 对于简单问答,轻量级的Advanced RAG足够;面对医疗、法律等强关联领域,Graph RAG的结构化推理是必要的;而在需要跨系统协作、多步决策的复杂业务流中,Agentic RAG正在成为有技术和能力的大团队最热的技术。
更重要的是,随着端侧模型能力的提升和隐私计算的发展,“安全”与“智能”正在从对立走向统一。未来的RAG系统将更像一位经验丰富的老员工:既懂业务规矩,又能灵活办事,还守口如瓶。
对于正在探索AI落地的你而言,我觉得不必盲目追逐最新的技术名词。理解你手里的数据并整理成高质量数据集,定义清楚业务边界,选择匹配当前阶段的RAG范式,并预留好模块化升级的空间才是关键。
最后
对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?
答案只有一个:人工智能(尤其是大模型方向)
当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右。
再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。
如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!
下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

最后
1、大模型学习路线

2、从0到进阶大模型学习视频教程
从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、 AI大模型最新行业报告
2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
-
硬件选型
-
带你了解全球大模型
-
使用国产大模型服务
-
搭建 OpenAI 代理
-
热身:基于阿里云 PAI 部署 Stable Diffusion
-
在本地计算机运行大模型
-
大模型的私有化部署
-
基于 vLLM 部署大模型
-
案例:如何优雅地在阿里云私有部署开源大模型
-
部署一套开源 LLM 项目
-
内容安全
-
互联网信息服务算法备案
-
…
👇👇扫码免费领取全部内容👇👇

3、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐

所有评论(0)