引言

大模型(LLM)技术的演进并非一蹴而就,而是逐步叠加层次,从最基础的序列建模能力出发,最终形成能够自主执行复杂任务的智能体(Agent)。这五个层次——Transformer + Token → Context + RAG → Prompt → Tool + MCP → Agent + Skill——构成了一条清晰的技术栈,每一层都解决了特定的核心问题,并为上一层提供能力支撑。

第 1 层:Transformer + Token —— 语言建模的基石

核心问题:如何让模型理解并生成自然语言?

Transformer:2017 年提出的自注意力机制架构,解决了长距离依赖建模难题,支持高效并行训练,成为几乎所有现代大语言模型(GPT、BERT、LLaMA 等)的基础。

Token:文本被切分为最小语义单元(子词、字符或单词),模型以 Token 序列作为输入和输出。Tokenization 决定了模型的词汇表、上下文长度限制和计算效率。

作用:这一层提供了最底层的语言理解与生成能力——模型能够根据前文预测下一个 Token,从而完成续写、翻译、摘要等基础任务。没有这一层,上层一切皆无可能。

依赖关系:完全独立,是其他所有层的根基。

第 2 层:Context + RAG —— 知识注入与动态扩展

核心问题:如何让模型掌握训练数据之外的知识,并避免“幻觉”?

Context(上下文):模型在推理时可处理的 Token 序列(如提示词和对话历史)。上下文窗口的大小(如 4K、128K、1M)决定了模型能“记住”多少即时信息。

RAG(检索增强生成):在生成回答前,先从外部知识库(向量数据库、搜索引擎、文档库)检索相关内容,拼接到上下文中,让模型基于检索到的证据生成回答。

作用:解决了大模型的两大痛点——知识时效性差和私有知识缺失。通过 RAG,模型可以访问最新数据、企业内部文档、专业资料,并显著降低编造事实的概率。

依赖关系:完全依赖第 1 层的 Transformer 生成能力,但扩展了其知识来源。Context 是模型的“工作记忆”,RAG 则不断向这个记忆中装入相关信息。

第 3 层:Prompt —— 任务引导与输出控制

核心问题:如何让模型按照我们的意图执行特定任务,并输出符合要求的格式?

Prompt Engineering:设计提示词来引导模型的行为,包括指令描述、少样本示例(Few-shot)、角色设定、输出格式约束(JSON、Markdown 等)。

系统提示与用户提示:分离不可变指令与可变输入,增强可控性。

作用:将通用的语言模型转化为专用任务执行器。通过精心设计的 Prompt,模型可以完成分类、信息抽取、代码生成、创意写作等多样化任务,而无需重新训练模型。

依赖关系:建立在第 1 层的生成能力之上,并结合第 2 层提供的上下文(如 RAG 检索结果)来构造更有效的提示。Prompt 是上层所有交互的入口。

第 4 层:Tool + MCP —— 连接外部世界

核心问题:如何让模型超越纯文本生成,执行实际操作(查数据库、调 API、控制设备)?

Tool(工具调用/Function Calling):模型被训练或提示输出结构化的函数调用请求(如 {"name": "search", "arguments": {"query": "天气"}}),由外部系统执行并返回结果。

MCP(Model Context Protocol):2024 年由 Anthropic 提出的开放协议,标准化了模型与外部工具、数据源之间的通信方式,类似“AI 应用的 USB-C 接口”。它使得任何模型可以无缝接入任何工具,避免重复开发适配层。

作用:赋予模型行动能力,使其从“说”扩展到“做”。例如查询实时股票价格、预订机票、操作浏览器、调用企业内部系统等。

依赖关系:依赖第 3 层的 Prompt 来触发工具调用(模型需理解何时调用哪个工具),同时工具返回的结果会作为新的上下文(第 2 层)继续参与生成。MCP 简化了工具集成的复杂度,为更上层的自动化铺路。

第 5 层:Agent + Skill —— 自主规划与复杂任务执行

核心问题:如何让模型自主完成一个多步骤、需要决策和迭代的复杂目标?

Agent(智能体):将大模型作为“大脑”,结合规划(Planning)、记忆(Memory)、工具使用(Tool Use)等能力,在环境中自主行动。Agent 能够分解任务、制定计划、调用工具、根据反馈调整策略,直至完成目标。

Skill(技能):封装好的可复用能力模块(如“发送邮件”“生成报告”“爬取网页”),Agent 可以按需调用或组合这些技能。Skill 通常包含 Prompt 模板、工具链、验证逻辑等,使得 Agent 的能力可以像乐高积木一样组装和扩展。

作用:实现了从“单轮问答”到“多轮自主执行”的跨越。例如,一个 Agent 可以自动完成“市场调研 → 抓取数据 → 分析趋势 → 生成 PPT 报告”的全流程,无需人类逐步干预。

依赖关系:Agent 依赖于所有下层能力:用第 3 层 Prompt 进行任务分解与指令理解;用第 4 层工具与外部世界交互;用第 2 层 Context + RAG 维护任务状态、获取知识;用第 1 层 Transformer 进行推理和生成。Skill 则是 Agent 能力的工程化封装,使得复杂行为可复用、可共享。

五层体系的依赖关系总览

  • 第 5 层 Agent + Skill ← 自主规划、多步执行、任务闭环
  • 第 4 层 Tool + MCP ← 执行具体动作、连接外部系统
  • 第 3 层 Prompt ← 任务定义、指令理解、输出控制
  • 第 2 层 Context + RAG ← 提供背景知识、动态信息、长期记忆
  • 第 1 层 Transformer + Token ← 基础语言模型、推理与生成能力

每一层都是上一层的基础,同时上层通过组合下层能力实现更高级的功能。层与层之间并非严格隔离,而是相互交织:RAG 的结果进入 Prompt,工具调用返回的结果又成为新的上下文,Agent 的规划过程依赖 Prompt 的质量等。

该体系对构建实用 AI 应用的意义

分层解耦,降低开发复杂度。开发者可以根据需求在某一层进行优化,而无需从零构建。例如,想要更好的知识注入就加强 RAG,想要模型执行操作就接入工具和 MCP,无需改动底层模型。

模块化与可组合性。每一层都可独立演进和替换:更换基础模型(如从 GPT 换到 Claude 或开源模型)不影响上层已设计的 Prompt 和工具;MCP 协议让工具生态跨模型通用。

渐进式构建路径。从最简单的 Prompt 应用开始,逐步引入 RAG、工具调用,最终演进为完整 Agent。这种路径符合实际项目迭代节奏,也便于团队逐步掌握复杂技术。

最大化利用现有模型能力。绝大多数实用 AI 应用不需要训练自己的大模型,而是通过 Prompt、RAG、工具等工程手段“调教”通用模型,成本低、见效快。

形成标准化生态。类似 MCP 的开放协议促进了工具和技能的共享,使得 AI 应用可以像搭积木一样集成第三方能力,加速创新。

为 Agent 时代奠定基础。五层结构天然导向智能体——最上层 Agent + Skill 正是当前 AI 应用的前沿方向,它整合了所有下层技术,让模型从“对话者”变为“执行者”。

总结

总之,这五层体系清晰地展示了从基础模型到实用智能系统的演进逻辑:底层提供智能,中层提供知识与工具,上层提供自主性与任务闭环。理解这一结构,有助于架构师和开发者更合理地设计 AI 应用,选择合适的技术组合,并随着模型能力的提升逐步向更高层次演进。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐