LLM 与AI Agent通俗对比: 

普通 LLM 对话:被动问答,一问一答,只会输出文字;  

AI Agent:数字助理,接收一个目标,自主拆解步骤、调用外部能力、迭代修正,直到任务完成。

维度

普通 LLM 单次调用

AI Agent

运行模式

开环,一问一答,单次调用结束

闭环,自主循环迭代执行

自主性

被动响应,依赖用户持续引导

目标驱动,自主决定下一步动作

工具能力

无法主动调用外部系统

自主选择工具、组装参数调用 API

记忆能力

仅临时上下文,对话结束即丢失

分层记忆,支持长期记忆检索

适用场景

简单文案、问答、代码生成

复杂多步骤业务自动化、运维、数据分析

AI Agent详解

AI Agent(智能体)是以大语言模型 LLM 作为推理大脑,具备目标理解、自主任务规划、记忆管理、工具调用能力,形成「思考→行动→观察」闭环,自主完成复杂任务的智能系统。

公式: AI Agent = LLM 大脑 + 规划模块 + 记忆系统 + 工具集 + 循环执行闭环

用户提出目标

      ↓

    Agent

      ↓

  理解任务

      ↓

  制定计划

      ↓

  选择工具

      ↓

  调用工具

      ↓

  获取结果

      ↓

  分析结果

      ↓

  决定下一步

      ↓

  继续执行

      ↓

   完成任务
       AI Agent

                    │

          ┌─────────┼─────────┐

          ↓         ↓         ↓

         LLM      Memory     Tools

          │         │         │

       理解推理    记忆       执行

          │                    │

          └─────────┬──────────┘

                    ↓

                 Planning

                    ↓

                 Action

                    ↓

               Observation

                    ↓

                再次推理

                    ↓

                  完成

LLM 是大脑,Tool 是手脚,Memory 是记忆,RAG 是知识来源,Planning 是计划,Agent Loop 是执行机制,而权限控制负责让这一切能够安全地落地。

五大核心组件

1. LLM 推理引擎(大脑)

负责理解用户意图、逻辑推理、生成执行计划、决策下一步动作; 依靠 Function Calling(函数调用) 输出结构化指令,实现工具调用。

GPT

Claude

Gemini

Qwen

DeepSeek

它本质上是一个经过大量数据训练的模型。

2. Planner 规划器

接收模糊目标,拆分为有序子任务。主流范式:

  • CoT 思维链:分步推理,只思考不执行动作

  • ReAct(最重要):Reasoning + Acting,思考与行动循环

  • Plan-and-Solve:先输出完整方案,再分步执行

3. Memory 三层记忆模型

  • 短期记忆:当前对话上下文,存放于模型上下文窗口;

  • 工作记忆:本次任务中间状态、工具返回结果;

  • 长期记忆:历史经验、知识库、用户偏好,存入向量数据库,按需检索召回。 痛点:上下文长度有限,需要摘要压缩、重要性过滤,解决信息溢出。

4. Tools 工具集(手脚)

Agent 连接外部世界的通道,把大模型能力从文本延伸到真实系统: 搜索引擎、SQL 查询、HTTP 接口、文件读写、RAG 知识库、第三方业务 API。 结合你的物联网项目:工具可以是「查询设备状态」「下发 MQTT 指令」「查询告警记录」。

5. 执行与反思闭环

执行工具 → 获取观测结果 → 交由 LLM 重新判断; 信息不足继续调用工具;任务达标输出答案;失败则重新规划。

主流范式:ReAct

ReAct = Thought(思考)→ Action(行动)→ Observation(观察)循环

完整运行流程

  • 用户输入业务目标;

  • Agent 理解目标,规划执行步骤;

  • 判断是否需要调用外部工具;

  • 通过 Function Calling 输出标准 JSON 指令;

  • 程序解析指令执行工具,拿到结果;

  • 将观测结果送入上下文,LLM 再次推理;

  • 循环迭代,直到判定任务完成;

  • 整合信息输出最终结论。

Function Calling 原理

大模型训练时学习函数定义规范;当判定需要外部信息,模型输出标准化 JSON,包含工具名称与入参;后端解析 JSON 执行对应工具,结果回传给模型继续推理。

单 Agent 和 Multi-Agent(多智能体)

  • 单 Agent:一个智能体独立完成全部任务,适合中等复杂度流程;

  • 多智能体:多个分工智能体(查询 Agent、分析 Agent、执行 Agent)相互协作;适合大型复杂系统。代表框架:AutoGen、CrewAI。

主流开发框架

  • LangChain / LangGraph:生态完善,LangGraph 支持循环状态机,适合生产级 Agent;

  • LlamaIndex:侧重 RAG 知识库检索场景;

  • AutoGen:主打多智能体协作。

AI Agent 落地普遍难点

  • 幻觉:错误判断是否需要调用工具、参数错误;

  • 无限循环:重复调用同一工具无法终止;

  • 上下文溢出:步骤越多,历史消息越长;

  • 安全风险:自动调用业务接口,存在越权操作风险;

  • 稳定性不可控,复杂流程难以全覆盖测试。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐