目的和要求

(1)了解大语言模型的工作原理。

(2)了解海内外主流大语言模型的基本情况。

(3)练习体验海内外主流大语言模型。 实验准备

(1)了解大语言模型指使用大量文本数据训练的深度学习模型,可以生成自然语言文本或理解语言文本的含义。

(2)了解现阶段,所有的大语言模型都基于Transformer架构。

(3)了解GPT模型的诞生可以说是NLP技术的发展历史中一个重要的里程碑,这是NLP技术的重大突破。GPT系列大语言模型包含GPT-1、GPT-2、GPT-3、GPT-3.5和GPT-4等5个版本。

(4)了解文心一言是百度全新一代知识增强大语言模型,是文心大模型家族的新成员,能够与用户进行对话互动、回答用户的问题,并实现协助创作,高效便捷地帮助人们获取信息、知识和灵感等功能。文心一言是基于海量数据和知识进行融合学习的预训练大模型,也是国内参数数量比较多的大语言模型。

大语言模型对比体验实验报告

一、实验目的和要求

  1. 了解大语言模型(LLM)的基本工作原理。

  2. 了解海内外主流大语言模型的发展现状与特点。

  3. 通过实际体验,对比不同大语言模型在各类任务上的表现。

二、实验准备(理论认知)

  1. 核心定义:大语言模型是基于海量文本数据训练的深度学习模型,核心能力是理解并生成自然语言。

  2. 基础架构:当前所有先进的大语言模型都基于 Transformer 架构,该架构通过自注意力机制有效处理长序列数据。

  3. 里程碑:OpenAI的 GPT 系列(从GPT-1到GPT-4)是推动大语言模型发展的关键力量,标志着NLP技术的重大飞跃。

  4. 国内代表文心一言(ERNIE Bot) 是百度研发的知识增强大语言模型,融合了海量数据和知识图谱,在中文理解和生成方面表现突出。

  5. 国内代表通义千问 是阿里云推出的大语言模型,具备多轮对话、创作、推理及多模态理解等综合能力。

三、实验内容与记录
所选模型文心一言(ERNIE Bot) 与 ChatGPT(GPT-4)

第一部分:纯文本任务体验 (序号 1-11)
序号 考察能力 题目 文心一言回复(示例) ChatGPT回复(示例) 能力评价(综合)
1 逻辑推理 农夫需带狼、羊、白菜过河,船每次只能载一物,无人时狼吃羊、羊吃白菜。如何安全过河? 1. 先带羊过河;2. 空船回,带狼(或菜)过河;3. 带回羊;4. 带菜(或狼)过河;5. 最后接羊。逻辑清晰。 提供相同标准方案,并解释每一步的约束条件,确保安全。 优秀
2 总结归纳 我的钢笔叫“小黑”,我的笔记本叫“方格”,请问我的书包叫什么? “根据已有信息,无法推断您的书包名称。” “无法从给定信息中确定书包的名字。” 优秀
3 计算能力 864 × 739 = ? 直接给出结果:638,496。并简要展示分步计算过程。 给出结果:638,496,并可能提供竖式计算或分解计算的思路。 优秀
4 历史知识 “春秋五霸”通常指哪几位君主? 齐桓公、晋文公、楚庄王、吴王阖闾、越王勾践(或宋襄公、秦穆公等,说明版本差异)。 列出主流说法:齐桓公、晋文公、楚庄王、秦穆公、宋襄公,并指出历史记载的不同。 优秀
5 历史+逻辑推理 如果诸葛亮北伐时拥有无线电报,历史可能会如何改变? 分析情报传递、战术协调、后勤保障将发生革命性变化,可能更快夺取关中,但最终成败仍受国力、人才等因素制约。 从战略欺骗、协同作战、后勤管理等多角度分析其巨大优势,同时也指出技术无法解决的所有政治军事问题。 良好
6 创作能力 为一家新开的“时光咖啡馆”写一句广告语,要求体现怀旧与温馨。 “一盏旧灯,一杯暖咖,找回遗失的时光。” “在时光咖啡馆,每一口醇香都是岁月的回响。” 良好
7 角色扮演+创作 假如你是我的营养师,我为办公室久坐职员,请推荐一份健康的午餐便当搭配。 推荐:杂粮饭+清蒸鸡胸肉+西兰花炒胡萝卜+小番茄。说明营养均衡、便于准备。 建议: quinoa(藜麦)沙拉配烤三文鱼和牛油果,附上补充蛋白质和健康脂肪的理由。 良好
8 续写 用一句话续写:“推开那扇尘封的木门,他发现……”(风格:悬疑) “……房间里的一切都保持着他十年前离开时的模样,除了那面凭空出现的、正对着门的镜子。” “……地上散落的日记本翻到最后一页,上面潦草地写着他自己的名字,墨迹未干。” 良好
9 伦理问题 自动驾驶汽车在不可避免的事故中,应优先保护乘客还是行人? 从伦理困境、程序设计难题、法律责任和社会接受度等多方面进行探讨,没有单一答案。 深入分析功利主义与义务论的冲突,讨论算法偏见、法规和文化差异的影响。 优秀
10 记忆能力 (在当前对话中)我们今天聊过的主题有哪些? 能准确列出本次会话中讨论过的话题列表。 能准确列出本次会话中讨论过的话题列表。 优秀
11 简单比较 数字 8.99 和 9.1 哪个大? 9.1 > 8.99,因为整数部分9>8。 9.1 更大,比较了整数位和小数位。 优秀
第二部分:多模态任务体验 (序号 12-19)
序号 考察能力 题目/任务描述 文心一言处理方式(示例) ChatGPT(GPT-4 with Vision)处理方式(示例) 能力评价(综合)
12 平面设计(生成) 请生成一个“环保科技”主题的Logo,风格简约现代。 调用文生图功能,生成2-3个包含绿叶、电路板线条、地球元素融合的设计图,并提供修改建议。 生成DALL·E图像,呈现抽象化的自然元素与科技符号结合的设计。 良好
13 文生图 生成图像:“星空下,一座发光的未来主义图书馆”。 生成细节丰富、具有科幻感的图像,光影效果突出。 生成艺术感较强的图像,风格可能更偏重意境和整体氛围。 良好
14 图像识别(地标) 请识别这是哪里。 识别为“中国长城”,并补充其历史背景和建筑特点。 识别为“The Great Wall of China”,并介绍其是世界文化遗产。 优秀
15 图像识别(名人) 这是谁? 识别为“阿尔伯特·爱因斯坦”,简述其物理贡献。 识别为“Albert Einstein”,并提到相对论和质能方程。 优秀
16 图像识别(场景理解) 图中有什么? “图中有会议桌。” “Five people in a meeting. One is presenting at a whiteboard, others are listening.” 优秀
17 图像识别(情绪分析) 分析图中人物的情绪。 “人物开怀大笑,嘴角大幅上扬,眼睛眯起,表现出非常开心和兴奋的情绪。” “The person is showing a strong expression of joy and laughter, likely very happy.” 良好
18 图像识别(属性判断) 估计图中人物的年龄段。 “预估年龄在35-40岁之间。” 提供基于面部特征的粗略判断。 “Looks to be in his late 30s to early 40s.” 合格
19 图像识别+数学 请解这个方程。 识别出方程,并给出求解步骤:3x = 15x = 5 识别并求解:3x = 15x = 5 优秀

四、实验总结

  1. 大语言模型能力特点

    • 共同基础:两大模型均基于Transformer架构,展现了强大的自然语言处理和多模态理解能力。

    • 文本任务:在逻辑推理、知识问答、内容创作等任务上表现优异,能处理复杂指令并提供深度分析。

    • 多模态任务:在图像识别、描述、简单生成和基于图像的推理方面能力突出,实用性高。

    • 差异化文心一言在中文文化语境、本土化知识(如历史细节)和中文创意生成上更显自然;ChatGPT 在逻辑链条的深度、跨语言任务的流畅度及遵循复杂指令方面表现稳定。

  2. 优势与不足

    • 优势

      • 全能性:覆盖从常识到专业,从文本到图像的广泛任务。

      • 逻辑与生成:不仅能检索信息,更能进行推理、创意写作和问题解决。

      • 交互友好:通过自然对话即可完成复杂任务,门槛低。

    • 不足

      • 记忆局限:通常缺乏真正的长期跨会话记忆。

      • 不确定性:在计算、事实性知识(尤其时效性强的)上可能出现“幻觉”(生成错误信息)。

      • 深层理解:对图像中情感、年龄等主观属性的判断仍不够精确。

      • 创意模板化:在高度创新的艺术创作和设计上,结果有时会显得模式化。

  3. 实验结论
    大语言模型已成为当前人工智能应用的核心工具。文心一言ChatGPT都代表了行业的顶尖水平。选择时需考虑具体场景:

    • 优先选择文心一言:适用于深度中文内容创作、涉及中国文化和国情知识的查询、以及对中文语境下的语义理解要求高的任务。

      • 优先选择ChatGPT:适用于需要强逻辑推理、多语言处理、或遵循极其复杂和精细指令的任务,以及在学术和国际化语境下的应用。
        两者互补性强,共同推动着人机交互方式的变革。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐