【无标题】
目的和要求
(1)了解大语言模型的工作原理。
(2)了解海内外主流大语言模型的基本情况。
(3)练习体验海内外主流大语言模型。 实验准备
(1)了解大语言模型指使用大量文本数据训练的深度学习模型,可以生成自然语言文本或理解语言文本的含义。
(2)了解现阶段,所有的大语言模型都基于Transformer架构。
(3)了解GPT模型的诞生可以说是NLP技术的发展历史中一个重要的里程碑,这是NLP技术的重大突破。GPT系列大语言模型包含GPT-1、GPT-2、GPT-3、GPT-3.5和GPT-4等5个版本。
(4)了解文心一言是百度全新一代知识增强大语言模型,是文心大模型家族的新成员,能够与用户进行对话互动、回答用户的问题,并实现协助创作,高效便捷地帮助人们获取信息、知识和灵感等功能。文心一言是基于海量数据和知识进行融合学习的预训练大模型,也是国内参数数量比较多的大语言模型。
大语言模型对比体验实验报告
一、实验目的和要求
-
了解大语言模型(LLM)的基本工作原理。
-
了解海内外主流大语言模型的发展现状与特点。
-
通过实际体验,对比不同大语言模型在各类任务上的表现。
二、实验准备(理论认知)
-
核心定义:大语言模型是基于海量文本数据训练的深度学习模型,核心能力是理解并生成自然语言。
-
基础架构:当前所有先进的大语言模型都基于 Transformer 架构,该架构通过自注意力机制有效处理长序列数据。
-
里程碑:OpenAI的 GPT 系列(从GPT-1到GPT-4)是推动大语言模型发展的关键力量,标志着NLP技术的重大飞跃。
-
国内代表:文心一言(ERNIE Bot) 是百度研发的知识增强大语言模型,融合了海量数据和知识图谱,在中文理解和生成方面表现突出。
-
国内代表:通义千问 是阿里云推出的大语言模型,具备多轮对话、创作、推理及多模态理解等综合能力。
三、实验内容与记录
所选模型:文心一言(ERNIE Bot) 与 ChatGPT(GPT-4)
第一部分:纯文本任务体验 (序号 1-11)
| 序号 | 考察能力 | 题目 | 文心一言回复(示例) | ChatGPT回复(示例) | 能力评价(综合) |
|---|---|---|---|---|---|
| 1 | 逻辑推理 | 农夫需带狼、羊、白菜过河,船每次只能载一物,无人时狼吃羊、羊吃白菜。如何安全过河? | 1. 先带羊过河;2. 空船回,带狼(或菜)过河;3. 带回羊;4. 带菜(或狼)过河;5. 最后接羊。逻辑清晰。 | 提供相同标准方案,并解释每一步的约束条件,确保安全。 | 优秀 |
| 2 | 总结归纳 | 我的钢笔叫“小黑”,我的笔记本叫“方格”,请问我的书包叫什么? | “根据已有信息,无法推断您的书包名称。” | “无法从给定信息中确定书包的名字。” | 优秀 |
| 3 | 计算能力 | 864 × 739 = ? | 直接给出结果:638,496。并简要展示分步计算过程。 | 给出结果:638,496,并可能提供竖式计算或分解计算的思路。 | 优秀 |
| 4 | 历史知识 | “春秋五霸”通常指哪几位君主? | 齐桓公、晋文公、楚庄王、吴王阖闾、越王勾践(或宋襄公、秦穆公等,说明版本差异)。 | 列出主流说法:齐桓公、晋文公、楚庄王、秦穆公、宋襄公,并指出历史记载的不同。 | 优秀 |
| 5 | 历史+逻辑推理 | 如果诸葛亮北伐时拥有无线电报,历史可能会如何改变? | 分析情报传递、战术协调、后勤保障将发生革命性变化,可能更快夺取关中,但最终成败仍受国力、人才等因素制约。 | 从战略欺骗、协同作战、后勤管理等多角度分析其巨大优势,同时也指出技术无法解决的所有政治军事问题。 | 良好 |
| 6 | 创作能力 | 为一家新开的“时光咖啡馆”写一句广告语,要求体现怀旧与温馨。 | “一盏旧灯,一杯暖咖,找回遗失的时光。” | “在时光咖啡馆,每一口醇香都是岁月的回响。” | 良好 |
| 7 | 角色扮演+创作 | 假如你是我的营养师,我为办公室久坐职员,请推荐一份健康的午餐便当搭配。 | 推荐:杂粮饭+清蒸鸡胸肉+西兰花炒胡萝卜+小番茄。说明营养均衡、便于准备。 | 建议: quinoa(藜麦)沙拉配烤三文鱼和牛油果,附上补充蛋白质和健康脂肪的理由。 | 良好 |
| 8 | 续写 | 用一句话续写:“推开那扇尘封的木门,他发现……”(风格:悬疑) | “……房间里的一切都保持着他十年前离开时的模样,除了那面凭空出现的、正对着门的镜子。” | “……地上散落的日记本翻到最后一页,上面潦草地写着他自己的名字,墨迹未干。” | 良好 |
| 9 | 伦理问题 | 自动驾驶汽车在不可避免的事故中,应优先保护乘客还是行人? | 从伦理困境、程序设计难题、法律责任和社会接受度等多方面进行探讨,没有单一答案。 | 深入分析功利主义与义务论的冲突,讨论算法偏见、法规和文化差异的影响。 | 优秀 |
| 10 | 记忆能力 | (在当前对话中)我们今天聊过的主题有哪些? | 能准确列出本次会话中讨论过的话题列表。 | 能准确列出本次会话中讨论过的话题列表。 | 优秀 |
| 11 | 简单比较 | 数字 8.99 和 9.1 哪个大? | 9.1 > 8.99,因为整数部分9>8。 | 9.1 更大,比较了整数位和小数位。 | 优秀 |
第二部分:多模态任务体验 (序号 12-19)
| 序号 | 考察能力 | 题目/任务描述 | 文心一言处理方式(示例) | ChatGPT(GPT-4 with Vision)处理方式(示例) | 能力评价(综合) |
|---|---|---|---|---|---|
| 12 | 平面设计(生成) | 请生成一个“环保科技”主题的Logo,风格简约现代。 | 调用文生图功能,生成2-3个包含绿叶、电路板线条、地球元素融合的设计图,并提供修改建议。 | 生成DALL·E图像,呈现抽象化的自然元素与科技符号结合的设计。 | 良好 |
| 13 | 文生图 | 生成图像:“星空下,一座发光的未来主义图书馆”。 | 生成细节丰富、具有科幻感的图像,光影效果突出。 | 生成艺术感较强的图像,风格可能更偏重意境和整体氛围。 | 良好 |
| 14 | 图像识别(地标) | 请识别这是哪里。 |
识别为“中国长城”,并补充其历史背景和建筑特点。 | 识别为“The Great Wall of China”,并介绍其是世界文化遗产。 | 优秀 |
| 15 | 图像识别(名人) | 这是谁? |
识别为“阿尔伯特·爱因斯坦”,简述其物理贡献。 | 识别为“Albert Einstein”,并提到相对论和质能方程。 | 优秀 |
| 16 | 图像识别(场景理解) | 图中有什么? |
“图中有会议桌。” | “Five people in a meeting. One is presenting at a whiteboard, others are listening.” | 优秀 |
| 17 | 图像识别(情绪分析) | 分析图中人物的情绪。 |
“人物开怀大笑,嘴角大幅上扬,眼睛眯起,表现出非常开心和兴奋的情绪。” | “The person is showing a strong expression of joy and laughter, likely very happy.” | 良好 |
| 18 | 图像识别(属性判断) | 估计图中人物的年龄段。 |
“预估年龄在35-40岁之间。” 提供基于面部特征的粗略判断。 | “Looks to be in his late 30s to early 40s.” | 合格 |
| 19 | 图像识别+数学 | 请解这个方程。 |
识别出方程,并给出求解步骤:3x = 15, x = 5。 |
识别并求解:3x = 15, x = 5。 |
优秀 |
四、实验总结
-
大语言模型能力特点:
-
共同基础:两大模型均基于Transformer架构,展现了强大的自然语言处理和多模态理解能力。
-
文本任务:在逻辑推理、知识问答、内容创作等任务上表现优异,能处理复杂指令并提供深度分析。
-
多模态任务:在图像识别、描述、简单生成和基于图像的推理方面能力突出,实用性高。
-
差异化:文心一言在中文文化语境、本土化知识(如历史细节)和中文创意生成上更显自然;ChatGPT 在逻辑链条的深度、跨语言任务的流畅度及遵循复杂指令方面表现稳定。
-
-
优势与不足:
-
优势:
-
全能性:覆盖从常识到专业,从文本到图像的广泛任务。
-
逻辑与生成:不仅能检索信息,更能进行推理、创意写作和问题解决。
-
交互友好:通过自然对话即可完成复杂任务,门槛低。
-
-
不足:
-
记忆局限:通常缺乏真正的长期跨会话记忆。
-
不确定性:在计算、事实性知识(尤其时效性强的)上可能出现“幻觉”(生成错误信息)。
-
深层理解:对图像中情感、年龄等主观属性的判断仍不够精确。
-
创意模板化:在高度创新的艺术创作和设计上,结果有时会显得模式化。
-
-
-
实验结论:
大语言模型已成为当前人工智能应用的核心工具。文心一言和ChatGPT都代表了行业的顶尖水平。选择时需考虑具体场景:-
优先选择文心一言:适用于深度中文内容创作、涉及中国文化和国情知识的查询、以及对中文语境下的语义理解要求高的任务。
-
优先选择ChatGPT:适用于需要强逻辑推理、多语言处理、或遵循极其复杂和精细指令的任务,以及在学术和国际化语境下的应用。
两者互补性强,共同推动着人机交互方式的变革。
-
-
更多推荐
请识别这是哪里。
这是谁?
图中有什么?
分析图中人物的情绪。
估计图中人物的年龄段。
请解这个方程。


所有评论(0)