LangChain RAG核心详解(一):从文档检索到知识库构建的实践指南
在大语言模型(LLM)应用中,检索增强生成(RAG)技术已经成为突破模型局限的关键手段,今天,我们将从最基础的文档检索开始,深入探讨如何构建一个完整的知识库系统。
一、RAG核心价值:解决LLM的核心痛点
1: 为什么需要RAG?
大型语言模型虽然功能强大,但存在三个主要局限性:
- 上下文有限:无法一次性处理整个知识库
- 静态知识:训练数据被冻结在某个时间点
- 专业领域知识缺乏:通用模型对特定领域知识掌握有限
2:RAG的核心基础
检索功能通过在查询时获取相关的外部知识来解决这些问题,这就是检索增强生成(RAG)的基础:利用上下文信息增强语言学习模型(LLM)的答案。
二、构建知识库:数据准备的核心步骤
1:知识库的作用
知识库是用于检索过程的文档或结构化数据的存储库**,**如果您需要自定义知识库,可以使用 LangChain 的文档加载器和矢量存储,根据您自己的数据构建一个知识库。
2:从检索到RAG
检索功能使语言学习模型能够在运行时访问相关上下文,但大多数实际应用会更进一步:它们**将检索与生成相结合,**以生成基于上下文的、有理有据的答案,这就是检索增强生成(**RAG)**的核心思想。
3:构建知识库的标准步骤
一个典型的知识库构建流程包含以下关键步骤:

被红色框圈起来的步骤就是典型的知识库构建流程,包括:
数据源->文档加载->文本分割->向量化->向量存储
每个组件都是模块化的:你可以交换文档加载器、分割器、嵌入模型或向量库的不同实现,而不需重写应用程序的逻辑。
-
数据准备和向量化:使用文档加载器从你的各类数据源(PDF/Word/网页/数据库等)加载文档,将长文档切分成较短的文本片段(chunks),使用嵌入模型(如DeepSeek的text-embedding模型或者OpenAI的text-embedding-3-small或者bge-small-zh)将每个文本片段(chunks)转换为向量。
-
存储到向量库:将上一步生成的向量,连同原始的文本片段(作为原数据)一起,存入向量库
到这一步,知识库就已经创建好了,接下来,就可以使用知识库开发RAG应用程序。
-
查询/检索:当用户提出一个问题(例如:“DeepSeek-R1的上下文长度是多少?”),我们使用与构建知识库的同一个嵌入模型将这个问题也转换为一个向量,然后将这个"问题向量"送入向量库,执行相似性搜索,找出与问题最相关的几个片段。
-
增强生成:将检索到的相关文本片段(作为上下文)和用户的原始问题组合成一个详细的提示(prompt)发送给LLM(如DeepSeek),LLM基于你提供的"上下文"来生成答案,从而保证答案的准确性和相关性。
三、构建知识库的几个关键组件
1:文档加载器:多数据源接入
文档加载器提供了一个标准接口,用于将不同来源(例如Slack、Notion 或 Google Drive、PDF、Word)的数据读取为LangChain的文档格式,这确保了无论数据来源如何,都能以一致的方式处理数据,所有文档加载器种类都实现了BaseLoader接口,每种文档加载器都可能定义自己专属的参数,但他们都共享一组通用的API:
-
load():一次性加载所有的文档
-
lazy_load():延迟加载文档流,适用于大型数据集

两种加载模式对比:
-
load():一次性加载所有的文档,批量加载模式,适合小文件

-
lazy_load():延迟加载文档流,流式加载模式,适用于大型数据集
适用以下场景:
a:场景一:超大文档/海量文件
比如:**10 万个 markdown 文件、一个 5GB 的日志文件、一个超大的 PDF / HTML dump,如果你用 load(),内存直接就爆呢,而lazy_load() 可以边读→ 边切 → 边向量化 → 边入库,**内存占用几乎恒定

b:场景二:流式/在线索引(Streaming Indexing)
我们不知道“全部数据”什么时候到齐的情况下,例如:用户不断上传文档、爬虫一边爬一边建索引、消息队列里持续有新数据。在以上几种情况下不知道什么时候“全部文档”才算结束,甚至可能永远不会结束,那么使用load()方法是不可能的,我们举爬虫这个例子分析一下:
爬到一个页面→ 立刻解析→ 立刻入向量库→ 继续爬下一个
2:文本分割器
文本分割器将大型文档分割成更小的块,这些块可以:
- 单独检索
- 适合模型上下文窗口限制
- 提高检索精度
文档拆分有多种策略,每种策略都有其自身的优势。
LangChain根据不同的文档结构,分别提供不同的文本分割器,基于文本结构的有:RecursiveCharacterTextSplitter,基于文本长度的有:CharacterTextSplitter,基于文档结构的有:MarkdownHeaderTextSplitter,RecursiveJsonSplitter等,因篇幅有限,后面章节会陆续讲解这些分割器。
基于文本结构的分割:

基于文档结构的分割:

3:嵌入模型
嵌入模型将原始文本(例如句子、段落或推文)转换为固定长度的数字向量,该向量捕捉其原始文本语义含义,这些向量使机器能够基于语义而非精确的词语来比较和搜索文本,就是所谓的语义搜索。
把文档分割成适当大小的块之后,利用嵌入模型把每个文本块都转化为固定长度的数字向量,这个固定长度等于向量模型的维度数目,例如:BAAI/bge-small-zh嵌入模型的维度是512,把块使用嵌入模型向量化之后,就会被转换成512个浮点类型的数字,每一个维度对应一个浮点类型的数字。
LangChain通过Embeddings接口为文本嵌入模型(例如 OpenAI、Cohere、Hugging Face)提供标准接口。主要有两种方法:
- embed_documents(texts: List[str]) → List[List[float]]:嵌入文档列表,把文档列表批量向量化,每一个文档对应一个512维度的向量数据。
- embed_query(text: str) → List[float]:嵌入单个查询,这个说白了,就是单个文档进行向量化。

4:向量数据库
向量数据库存储向量数据并能执行相似性搜索,提供高效的最近邻搜索 能力。LangChain为向量库提供了一个统一的接口,使您能够:
-
add_documents- 将文档添加到向量库。
-
delete- 按ID删除已存储的文档。
-
similarity_search- 查询语义相似的文档。
这种抽象让你可以在不同的实现方式之间切换,而无需改变应用程序逻辑,下面这个是本篇文章完整的例子:

四:最佳实践与性能优化
在构建知识库进行分块的时候,chunk\_size和chunk\_overlap的大小设置没有万能最优值,只能在[召回率和性能/成本]之间取平衡,可以先按:
-
chunk_size:500~1000 tokens,
-
chunk_overlap: 50~150 tokens(约chunk_size的10~20%)
-
根据不同的文档类型正确选择不同的文档分割器。
以上这些措施都是为了在不增加块的大小情况下,尽可能保持文本块的
完整语义性,在实际实践中,可能要根据实际的文档情况做尽可能多的微调,以达到最佳解。
五:总结和下期预告
通过本文的介绍,我们了解了RAG技术从文档检索到知识库构建的完整流程。关键要点包括:
- 模块化设计:每个组件都可独立替换和优化
- 流式处理:支持海量数据的高效处理
- 统一接口:简化不同技术栈的集成
- 灵活扩展:支持多种数据源和向量数据库
在实际应用中,需要根据具体场景调整分块策略、嵌入模型和检索参数,才能构建出高效的RAG系统。
下期我们将探讨如何根据自建知识库构建RAG系统。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:

三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】

四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐

所有评论(0)