目录

1. 函数

2. 符号主义

3. 联结主义

4. 行为主义

5. 模型 Model

6. 权重 - Weight

7. 大模型 - Large Model

8. 大语言模型 - Large Language Model - LLM

9. 自然语言处理 - Natural Language Priocessing,NLP

10. 开源模型- Open Source Model

11. 闭源模型-Close SourceModel

12. 开放权重-Open Weight Model

13. 私有化部署-Private Deployment

14. PGC-Professionally Generated Content,专业生产内容

15. UGC-User GeneratedContent,用户生产内容

16. AIGC-Artificial Intelligence Generated Content,人工智能生成内容

17. AGI-Artificial Generated Intelligence,通用人工智能生成

18. 预训练 - Pretraining

19. 推理-Inference

20. 涌现-Emergence

21. 模型压缩 - Model Compression

22. 量化 - Quantization

23. 蒸馏-Distillation

24. 剪枝 - Pruning

25. 提示词 - Prompt

26. 上下文 - Content

27. token

28. 角色-role

29. 温度 - Temperature

30. Top-k

31. 流式结果返回 - Streaming Response

32. RAG - Retrieval-augmented Generation - 检索增强⽣成

33. 词嵌入 - Word Embedding

34. Function Calling

35. MCP - Model Context Protocol - 模型上下⽂协议

36. LangChain

37. AI智能体 - Agent

38. A2A-Agent to Agent

39. 工作流-WorkFlow

40. Manus

4.1 Coze


我们在上网看新闻、或浏览短视频时,经常会听到一些大模型相关的名词,感觉似曾相识却又一知半解,有时甚至会阻碍我们对AI知识的学习,下面解释一些常见的AI名词,希望对你们汲取AI之后有所帮助。

1. 函数

给一些输入数据,按照特定规则进行处理,得到期望的一些结果,这就是函数。

比如:(1,1)、(2,2)、(3,3)、(4,4)这些数字之间的关系,就可以用9=c来表示。

2. 符号主义

以“符号“为中心,将知识符号化,并通过一系列预设好的推理规则来实现人工智能。比如教AI识别苹果:

  • 符号定义
红色+圆形+ 有饼-—-> 苹果
  • 写规则
如果(颜色=红),且(形状=圆),且(有柄),那么就能推导出是苹果
  • 看结果
输入一个红圆的带病水果,AI输出"苹果"
输入一个青苹果,AI就懵了,因为规则里没有写青色也是苹果

优点:透明、精确
缺陷:死板、人工成本高、无法自主学习

3. 联结主义

智能行为和认知功能可以通过简单单元之间的复杂互联实现,每个单元都可以接收输入信号,处理信息,并通过输出信号与其他单元进行通信。在人工智能领域的主要应用是:神经网络、机器学等。

比如:教AI认识猫

符号主义:人工定制规则,"有尖耳朵+胡须+尾巴+四条腿=猫”

联结主义:

        直接给AI100万张猫狗照片
        让AI 自己学习:
                第一层神经元学:“边缘和颜色”
                中间层学:耳朵的形状、眼睛的颜色...
                最后输出层总结出猫的特征|
        最终结果:你扔给AI一张新的猫图片,AI就能识别出来
优势:
        自动学习:不用人工写规则,直接从数据中总结规律
        处理模糊信息:比如识别模糊照片、方言语音
        强大泛化能力:学会认猫后,稍微变个角度也能认出
缺点:
        黑箱问题:连开发者都不知道AI具体怎么学的(比如为什么认为某张图是猫)
        需要海量数据:像ChatGPT吃了全网文本才能聪明
        耗资源:训练大模型要成千上万张GPU

4. 行为主义

关注智能系统如何通过与环境的交互学习、适应和优化其行为,而不是深入探究其内部认知过程。不管AI内部怎么想,只要它行为正确就给奖励,错了就惩罚,想训狗一样。典型代表:广告推荐系统、自动驾驶等。

优势

  • 适应动态环境:比如游戏、机器人控制(不需要预设所有规则)
  • 目标导向:直奔最优解,不纠结中间过程
  • 能发现人类想不到的策略

缺点

  • 疯狂试错:可能要撞墙10000次才能学会(费电!)
  • 可能学歪:比如游戏AI发现卡Bug能刷分,就彻底摆烂卡Bug
  • 不解释:赢了也不告诉你为什么能赢

5. 模型 Model

模型通常表现为一个映射规则,它将输入数据(特征)映射到输出结果,达到对新的、未见过的数据做出准确的预测和分类。比如,在线性回归中,模型可以表示为一个线性函数f(c)=W*+b。在实践中,模型是通过算法实现的,这些算法利用数学函数来从数据中学习并做出预测。

天气预报模型

  • 输入:气压、湿度、风速
  • 模型:分析历史数据总结规律
  • 输出:明天降雨概率70%

6. 权重 - Weight

权重就是AI模型里的”偏好设置",决定它更关注数据的哪些部分。比如以识别猫为例:

输入特性 初始随机权重 训练后权重
耳朵形状 0.2 0.8
耳朵形状 0.1 0.7
背景操作 0.5 0.05

经过大量训练后,AI就知道原来猫耳朵和胡须比背景更加重要。

7. 大模型 - Large Model

大模型就是AI里的超级学霸,参数巨多、知识量爆炸的AI模型,像吃了百科全书+全网数据的“六边形战士”。大体现在:

  • 参数海量:GPT-3有1750亿个参数,而早期模型参数不到一百万。
  • 训练数据恐怖:吃掉整个互联网文本(书籍、论文、网页、代码...)
  • 训练一次GPT-3~190万度电(够5000个家庭用1年)

8. 大语言模型 - Large Language Model - LLM

大模型就是AI界的“超级话痨”,是一个吃掉整个互联网的文本,能读会写、知识渊博的AI大脑,专门处理人类语言,比如聊天、协作、翻译、编程等,但可能会胡说八道。

将整个互联网的数据喂给大模型后,大模型会通过神经网络分析词语之间的关系,例如将”猫”、“喵喵叫"、“毛茸茸“词归类到一起,但是它并不理解,当人类在提问的时候它会推测出最可能得回答

大模型的局限性

  • 可能会出现“幻觉”
  • 没有真正"理解”
  • 偏见与安全风险

9. 自然语言处理 - Natural Language Priocessing,NLP

自然语言是指人类日常交流所使用的语言,如汉语、英语,计算机只认识二进制,要让计算机能处理自然语言,就需要人教计算机理解、生成、操作自然语言的技术,就像是给计算机装上一个“语言大脑”。

自然语言处理的基本步骤:

  1. 词法分析:将连续文本字符串切分成一个个独立的词汇单元。例如:我爱吃苹果,拆成【我/爱/吃/苹果】
  2. 语法分析:分析句子中词语之间的依存关系。比如:我吃了苹果,我是主语,吃是谓语,苹果是宾语
  3. 语义分析:确定多义词在具体语境中的确切含义。比如:苹果可指水果,也可以苹果公司
  4. 语用分析
  5. 文本生成:机器翻译、文本摘要、聊天机器人

和C++语言的编译器有点类似。我们每天在网页上搜索、使用输入法打字、短视频推荐等,都是在使用NLP。

10. 开源模型- Open Source Model

源代码、训练数据、模型权重等关键组成部分被公开发布,允许用户自由访问、使用、修改和分发的机器学习或人工智能模型。

11. 闭源模型-Close SourceModel

源代码、训练数据、模型权重等关键组成部分未公开发布,用户无法自由访问、修改或分发的机器学习或人工智能模型。闭源模型通常由商业公司或特定机构开发和维护,以保护其知识产权和技术优势,用户需要购买许可或订阅服务才能使用。

12. 开放权重-Open Weight Model

一种介于开源和闭源之间的模型开放策略,这种模式下,模型的源代码、训练数据等没有公开,只是将模型的权重(即训练过程中学到的参数)公开,用户可以查看和修改这些权重,从而对模型进行定制和优化。

13. 私有化部署-Private Deployment

为了更好保存私密数据,避免敏感信息泄露,企业可以将大模型部署在自己本地环境或私有云环境
中,而不是依赖公有云或第三方服务,企业能够根据自身业务需求对大模型进行微调,使其更贴合特定的业务场景,从而完全掌控大模型的使用和运行。

DeepSeek-R1全量版(FP16)各版本本地部署硬件需求:

模型名称 文件大小 显卡配置(最低) 内存配置 GPU显存需求 价格预算
DeepSeek-R1-1.5b 3GB RTX 3050 8GB 8GB ≥4GB 3000 ~ 5000
DeepSeek-R1-7b 5GB RTX 4060 16GB 16-32GB ≥8GB 7000 ~ 10000
DeepSeek-R1-14b 15GB RTX 4070 Ti SUPER 16GB 32GB ≥16GB 1.8万 ~ 2.8万
DeepSeek-R1-32b 30GB GND ≥24GB 6万 ~ 9万
双 RTX 4070 Ti SUPER 16GB
DeepSeek-R1-70b 70GB 4×RTX 5090D 24GB 128GB ≥80GB 25万 ~ 45万
DeepSeek-R1-67lb 200GB+ 8×A100 80GB 512GB+ ≥256GB 120万+

14. PGC-Professionally Generated Content,专业生产内容

由专业的创作者、机构或团队所创作、制作的内容,通常具有较高的质量和可信度,经过精心策划和制作,具有较高的艺术性和商业性。比如:电影、电视剧、新闻报道等专业领域

15. UGC-User GeneratedContent,用户生产内容

由普通用户或群体自发创作、发布的内容,具有较强的个性化和多样性,反映了用户的生活、观点和情感,内容生产速度快、多样性高,互动性强,能够吸引大量用户参与和互动,但质量较差。比如:社交媒体上的帖子、短视频、评论等。

16. AIGC-Artificial Intelligence Generated Content,人工智能生成内容

利用人工智能技术自动生成各种内容,通过深度学习、自然语言处理等技术,使机器能够理解、生成和优化内容。比如,让AI生成营销方案、图片、短视频等

17. AGI-Artificial Generated Intelligence,通用人工智能生成

像人类一样全能的Al,目前不存在。比如:终结者、七弟

训练- Training

训练前AI像刚出生的婴儿啥也不会,模型训练就是让AI从人工智障进化成智能工具的调教过程,利用标注好的训练数据,通过优化算法调整模型参数,使模型能够学习到数据中的特征和规律,从而在新的数据上做出准确的预测或分类的过程。

比如ChatGPT训练:

  • 喂模型数据:吃掉整个互联网文本
  • 学习目标:预测下一个词,如果天空是__,模型能推出是蓝色
  • 最终成果:学会聊天、写代码、编故事等

18. 预训练 - Pretraining

在大规模数据集上预先训练一个模型,使其能够学习到数据中的通用特征和规律,然后将这个预训练好的模型应用到具体的任务上,通过微调(fine-tuning)来适应特定的任务需求。即让Al"先博后
专"的学习策略,相当于给AI装了通用知识库,再根据需要快速点亮技能树。

比如训练AI学医:

  • 预训练(学基础)
    让AI读完整个互联网的医学书、论文、病历,没有具体目标
    AI能学到人体结构、药名、症状描述等通用知识
  • 微调(专精科室)

用具体数据训练AI,比如儿科AI,让AI专注儿童病历;影像科AI,让AI专攻CT片分析

19. 推理-Inference

将训练好的模型应用于实际任务中,对新的、未见过的数据进行预测或决策,就是让训练好的AI实际干活的过程。

训练是AI的学习阶段,不断调整模型参数,让AI能力更强;推理是AI的应用阶段,用学到的知识解决问题。

20. 涌现-Emergence

当模型的规模、复杂度或训练数据量达到一定程度时,模型突然展现出一些新的、超出预期的能力或行为。单个蚂蚁力量小,群蚁涌现出智能。

涌现的三大特点:

  • 不可预测性:开发者无法提前知道会涌现什么能力
  • 非线性跳跃:能力提升曲线突然陡增,瞬间顿悟
  • 跨任务迁移:一项技能的学习以外激活其他技能

21. 模型压缩 - Model Compression

给"AI瘦身减肥”的一些技术。一些资源受限(比如嵌入式设备、移动设备等)的环境中,在不显著降低模型性能的前提下,通过优化模型的结构和参数,减小模型大小和计算复杂度的过程。

比如原模型展100GB内存,只能放服务器,推理速度每次一秒,耗电高,压缩后模型变成2G,能放进手机,推理速度提升到每次0.5秒,且省点。

模型压缩常用技术:参数量化、模型剪枝、模型蒸馏、参数共享、低秩分解。

22. 量化 - Quantization

将模型的权重和激活值从高精度数值表示转换为低精度数值表示的过程。在不显著降低模型性能的前提下,减小模型的存储需求和计算复杂度。比如将32位的浮点数转化为8位的整数。

量化好处

  • 体积暴减,比如10G锐减到2.5G
  • 速度起飞,低精度计算更快
  • 省电降温,小型设备友好,比如智能手表

量化缺陷

  • 精度损失可能会让准确率下降,95%降到90%
  • 硬件限制某些老旧芯片不支持
  • 敏感任务慎用,比如医疗诊断

23. 蒸馏-Distillation

让带AI”教”小AI的”师徒传承”技术。将一个大型复杂模型(教师模型)的知识迁移到一个小型简单模型(学生模型)中,从而使学生模型能够继承教师模型的主要性能,同时保持较小的模型规模和较低的计算复杂度。

比如教学生做题:

步骤 老师(大模型) 学生(小模型)
原始学习 做过100万道题,即海量数据运算 只做1万道题
蒸馏过程 不仅给答案,还教"解题思路" 模仿老师的思考⽅式
结果 准确率99% 准确率90%,但体积可能⼩10倍

GPT-3有1750亿参数,蒸馏后的TinyGPT只有10亿参数,体积大大减小,可以嵌入手机运行。

24. 剪枝 - Pruning

通过移除神经网络中不重要的部分(权重、神经元),减少模型的复杂度和参数数量,在不显著降低模型性能的前提下,使模型更加轻量化和高效。就像给大叔修剪枝叶,保留主干更高效。

比如修剪枝叶:

步骤 果树 AI⼤模型
原始状态 枝繁叶茂,但结果⼦少 参数多,但冗余
剪枝 剪掉弱枝、分叉枝 删除接近零的权重
结果 营养集中,果实更⼤ 模型更⼩,速度更快

25. 提示词 - Prompt

给AI的任务说明书,告诉AI要做什么、怎么做的指令。

【提示词设计三要素】

  • 角色设定Role
"你是一个具有十年以上C++后端开发的架构师,请帮我设计类似微信的聊天软件"
  • 任务描述Task
"用200字总结导致拖延症原因"
  • 格式约束Format
     
"请按要点分条列出,每条不超过15字"

26. 上下文 - Content

AI在对话或任务中临时记住的信息,像人类聊天时不会突然失忆,能联系前后文理解意思。

用户:推荐一部科幻电影
AI:《星际穿越》
用户:为什么推荐这部?
AI(结合上下文):因为它的硬核科学设定和感人父女情..

模型不会记住所有上下文信息,超出部分会被丢弃,就想内存满了自动覆盖。

比如GPT-4最多能记住128ktokenS,大约10万字

27. token

token是模型用来表示自然语言文本的基本单位,可直观理解为“字”或“词”;通常1个中文词
语、1个英文单词、1个数字或1个符号计为1个token。

一般情况下模型中token和字数的换算比例大致如下:

  • 1个英文字符~0.3个token。
  • 1个中文字符~0.6个token。

28. 角色-role

为模型提供当前文本的角色信息,帮助模型更好的理解上下文并生成合适的响应。

在大多数模型中,角色一般有三种:

  • user:表示当前文本是用户输入的内容
{
    "role": "user",
    "content": "你好,我想了解⼀下健康饮⻝的基本原则。"
}
  • assistant:表示当前文本是模型自身输出的内容
{
    "role": "assistant",
    "content": "健康饮⻝的基本原则包括均衡摄⼊各种营养素、控制热量摄⼊、多吃蔬菜⽔果、减少⾼糖⾼盐⾼ 脂肪⻝物等。"
}
  • system:表示当前文本是系统指令或背景信息
{
    "role": "system",
    "content": "你是⼀位专业的营养师,专注于健康饮⻝领域。"
}

29. 温度 - Temperature

调整AI生成内容随机性的参数,温度值越高,AI回答越天马行空;温度越低,回答越保守靠谱。DeepSeek官网建议:

温度 场景
0.0 代码⽣成/数学解题
1.0 数据抽取/分析
1.3 通⽤对话
1.3 翻译
1.5 创作类写作/诗歌创作

30. Top-k

AI生成答案时的候选项筛选器。即控制AI每次只从概率最高的k个候选词中选答案的技术,避免出现一些离谱的词。既不让AI总选最保守的词(无聊),也不让它乱选低概率的词(胡言乱语)。

比如AI在输出:天空是___

候选词 概率
蓝的 60%
晴朗的 20%
⾼的 10%
假的 5%
草莓味 5%

当Top-k为3时,只考虑【蓝的、晴朗的、高的】,输出更合理
当Top-k为10时,候选词可能选中草莓味,输出就比较离谱

注意:

  • Top-k限制候选词范围,决定能选哪些候选词;温度值控制概率分布,决定候选词之间的概率差距
  • 高温度+大K值,模型输出更天马行空;低温度+小K值,模型输出更保守精准

31. 流式结果返回 - Streaming Response

让AI边想边说,逐字逐句输出结果,而不是等全部内容生成完成一次性显示,就像看视频时“边加载边播放”,而不是必须下载完才能看。

⽅式 ⽤⼾体验 技术原理
⾮流式 ⽤⼾盯着光标转圈,突然蹦出全部答案 AI⽣成完整内容后⼀次性返回
流式 ⽂字逐个弹出,像真⼈打字对话 AI每⽣成⼀个词就⽴刻传回

32. RAG - Retrieval-augmented Generation - 检索增强⽣成

为什么会出现RAG?

  • 知识局限性

模型自身的知识完全源于它的训l练数据,而现有的主流大模型(ChatGPT、文心一言、通义千
问··)的训练集基本都是构建于网络公开的数据,对于一些实时性的、非公开的或离线的数据是无
法获取到的,这部分知识也就无从具备。

  • 幻觉问题

所有的AI模型的底层原理都是基于数学概率,其模型输出实质上是一系列数值运算,大模型也不例
外,所以它有时候会一本正经地胡说八道,尤其是在大模型自身不具备某一方面的知识或不擅长的
场景。而这种幻觉问题的区分是比较困难的,因为它要求使用者自身具备相应领域的知识。

  • 数据安全性

对于企业来说,数据安全至关重要,没有企业愿意承担数据泄露的风险,将自身的私域数据上传第
三方平台进行训练。这也导致完全依赖通用大模型自身能力的应用方案不得不在数据安全和效果方
面进行取舍。

RAG是解决上述问题的一套有效方案,RAG=检索技术+LLM提示。

RAG的实现原理

在RAG中,文档索引是整个流程的基础环节之一,将文档(word、execl、PDF、Markdown等)根据一定的规则划分为文本块(textchunk),然后通过Embedding模型将文本转化为向量并存储向量数据库。

RAG步骤:
        a. 向量化问题:将用户问题用相同的Embedding模型转为向量,存入向量数据库,用以检索相关的知识分片
        b. 检索(Retrieval):通过向量数据库一系列高效的数学计算(如余弦相似度、欧氏距离等),检索出予以相似度最高的几个知识分片(Top-k)
        c. 构建Prompt:将Promot+检索结果+用户问题构成完整的Prompt
        d. 生成(Generation):大语言模型再根据这个Prompt生成结果
        e. 返回:大模型将生成的结果返回给用户

33. 词嵌入 - Word Embedding

将文字序列(如词、句子或文档)转化为向量表示(固定维度的向量)的技术,使得具有相似语义的文字序列对应的向量尽可能接近(即相似度高)而语义不同的文字序列对应的向量尽可能远离(即相似度低)。

34. Function Calling

大模型上知天⽂下知地理⽆所不能,但有些事情还真干不了,比如让⼤模型帮你发送⼀封邮件:

在FunctionCalling面世之前,人们可以通过提示词巧妙地"欺骗"Al执行任务,大概思路是:

  • 给模型一个特殊的指令,引导它生成特定格式
  • 用提示词创建模拟工具调用的幻觉
// 你可以发送邮件,当你需要发送邮件时,请返回JSON格式的模拟结果,我会发送后告诉你,你再回复⽤⼾
// 你的回复必须是有效的JSON格式,包含以下字段:
{
    "to" : "friend@example.com", // 朋友的邮箱地址
    "subject" : "hello", // 邮件主题
    "body" : "body of the email" // 邮件正⽂
    "date" : "send email date" // 发送邮件的⽇期
}
  • 模型输出结构化数据(如Json)
{  
    "to": "friend@example.com",
    "subject": "Hello",
    "body": "Hi, how are you?",
    "date" : "2025-08-09"
}
  • 用户根据LLM生成的结构化数据,自己调用外部工具完成任务
url = "https://api.emailservice.com/send";
headers = {"Content-Type": "application/json"};
data = {"to": "friend@example.com","subject": "Hello","body": "Hi, how are
you?", "date" : "2025-08-09"};

response = requests.post(url, json=data,
headers=headers)print(response.json());
  • 最后再告诉大模型处理结果,大模型润色后返回给用户

但提示词并不一定可靠,大模型可能不会按照你的要求生成所需要的JSON数据,或者生成错误的格式

{
    "to": "friend@example.com",
    "subject": "Hello",
    "body": "Hi, how are you?" // 少⼀个分号
    "date" : "2025/08/09" // 格式不对
}

OpenAl也意识到了这个问题,2023年的6月,由OpenAl推出了“FunctionCalling”。Function Calling就是解决此问题的。通过FunctionCalling,大模型能够通过结构化输入连接到外部系统,比如通过API进行交互,从而实现与外部世界的连接。

Function Calling工作流程

  • 用户输入:用户提前定义好接口,在发送请求时会将问题+接口名称+参数+接口描述一起发送给大模型
{
    "name": "getWeather",
    "description": "获取指定城市的天⽓信息",
    "parameters" :{
        "type": "object",
        "member": {
            "location": {
                "type": "string",
                "description": "城市名称,如北京、上海、西安"
            },
            "date": {
                "type": "string""description": "⽇期,⽐如:2025-08-09"
            }
        }
    }
}
  • 模型解析:模型接收到用户输入后,会解析并理解输入内容。模型会根据其训练数据和算法判
    断是否需要调用函数。如果需要函数调用,模型会按照用户要求生成符合格式的JSON参数返回给用户
  • 函数调用:在用户代码中,解析出大模型返回的JSON数据,然后调用第三方api,最后将结果告诉给大模型
  • 处理结果:大模型收到函数调用的结果后,会对用户结果进行总结润色,然后返回给用户

35. MCP - Model Context Protocol - 模型上下⽂协议

除了发送邮件外,用户向大模型发送的提问中还可能需要查询天气、股票交易、查询数据库等,这些都是大模型无法处理的,虽然通过FunctionCalling方式可以解决,但是需要在客户端编写各种工具调用的函数,工具越来越多,不仅代码庞大,维护起来也比较困难;

而且不同LLM平台的FunctionCallingAPI实现差异较大,平台依赖性强,开发者在切换模型时可能需要重写代码,增加适配成本。

2024年11月底,由Anthropic推出的一种开放标准Model Context Protocol,模型上下文协议,简称
MCP,统一了应用程序和不同大模型之间的交互标准,也拓展了更多高级功能,号称AI界的”USB接口"。

MCP在FunctionCall的基础上扩展出三大功能:

  • 工具:让AI能执行具体操作。比如:发送邮件、查询天气、执行命令、调用API|
  • 资源:给AI提供参考信息。比如:文件内容、数据库记录、系统状态等
  • 提示:预设的对话末班。如:快捷命令、标准工作流、指导性提示等

36. LangChain

语言层面解释:Lang是Language的缩写,指大语言模型,比如ChatGPT、DeepSeek等;Chain是链条,即把任务像链条一样串起来。

LangChain是一个用于构建大模型应用程序的开源框架,提供了一套工具和接口,帮助开发者更高效地将大模型集成到实际应用中。

LangChain的核心功能

LangChain功能 描述
Prompts 给模型“出题模板”,⽐如:“请⽤⼩学⽣能听懂的话解释{某个词}”
Chains 让模型“流⽔线作业”,⽐如:先查资料→总结→翻译成英⽂
Agents 给模型“⼯具箱”,让它⾃⼰决定⽤计算器还是⾕歌搜索
Memory 让模型“记住上次聊到哪⼉”,适合多轮对话
Indexes 把公司⽂件“塞进模型脑⼦”,让它能回答内部问题

比如:做一个自动写周报的工具

原始方法:手动复制粘贴本周工作记录,然后丢给大模型,大模型帮你梳理总结后,然后自己改格式

LangChain:

  1. 数据连接:自动从你的工作日志里提取内容
  2. 提示模板:按照固定模板生成周报草稿
  3. 模型集成:调用模型润色文字
  4. 工具扩展:最后邮件发送给老板

全程不需要你动手,将所有的操作和工具链接到一起。

37. AI智能体 - Agent

大模型本身是一个生成模型,它通过学习大量的数据,能够生成自然语言文本、图片、视频等,但不具备真正的决策能力。

普通AI(ChatGPT) AI Agent
只能回答你的问题,不会主动⼲活 能⾃⼰动起来,⽐如订外卖、发邮件
每次对话都是“新开始”,没有记忆 记得之前的事情,能⻓期跟踪任务
只能打字聊天 能调⽤⼯具(⽐如计算器、浏览器、API)
需要你一步步指挥 自己指定计划,分步骤完成任务

让一个系统能够自己感知环境、做出决策、执行任务,甚至还能从经验中学习,就可将其称为智能体。

LangChain功能 描述
感知(Perception) 能听懂你的指令,或从环境获取信息,⽐如:摄像头画⾯,传感器数据
决策(Decision) 分析该做什么。⽐如:⽤⼾要定机票,先查航班,再⽐价格,最后下单
⾏动(Action) 调⽤⼯具完成任务。⽐如:查询天⽓、发送邮件、控制智能家居
学习(Learning) 从错误中改进策略,⽐如发现某⽹站订票更便宜,下次优先选它
Indexes 把公司⽂件“塞进模型脑⼦”,让它能回答内部问题

38. A2A-Agent to Agent

多个智能体之间相互协作、沟通或竞争,共同完成复杂任务。不同Agent具有不同的功能,比如一个负责查数据、一个负责写报告,一个负责审核,各个Agent之间能自动传递信息、请求帮助等。

LangChain工具支持快速搭建A2A系统。

39. 工作流-WorkFlow

通过定义任务的执行顺序、参与者、输入输出以及任务之间的依赖关系,确保任务能够高效、有序地完成。即把一件事情的步骤固定下来,让流程自动化。

比如快递配送:下单--->打包-->发货--->运送--->签收,每个环节都有人(或机器)负责。

40. Manus

Manus由Monica团队开发,定位于全球首个通过AlAgent,简单来说,它不靠"嘴"输出,而是
靠"手"执行任务。

能独立干活:你只需要下指令,比如:整理这堆简历,它能自己拆解任务、调用工具、完成交付,全程不用你盯着

跨领域通吃:从写代码、做PPT到旅游规划、审核合同,甚至帮你设计游戏网页

4.1 Coze

字节跳动推出的一站式AI应用开发平台,旨在降低AI开发门槛,即是没有编程经验的用户,也能快速搭建基于AI模型的各类AI智能体,并部署到社交平台、通讯软件或网站等渠道,也支持通过API与现在系统集成。

Coze上的智能体种类丰富,包括聊天机器人、内容创作、数据分析、文档处理等多种功能。用户可以通过插件和工作流即是实现复杂的业务流程。

特点

  • 无代码开发:通过拖拽操作、模板化配置实现功能设计,无需编程基础。
  • 多模态能力:集成文本、图像、视频、API调用等多模态数据处理,支持复杂场景的智能化需求。
  • 跨平台开发:创建智能体可发布至微信、抖音、废除等社交平台或企业内部。
Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐