实验5  体验大语言模型

目的和要求

(1)了解大语言模型的工作原理

2)了解海内外主流大语言模型的基本情况

3)练习体验海内外主流大语言模型

实验准备

(1)了解大语言模型指使用大量文本数据训练的深度学习模型,可以生成自然语言文本或理解语言文本的含义。

(2)了解现阶段,所有的大语言模型都基于Transformer架构。

(3)了解GPT模型的诞生可以说是NLP技术的发展历史中一个重要的里程碑,这是NLP技术的重大突破。GPT系列大语言模型包含GPT-1、GPT-2、GPT-3、GPT-3.5和GPT-4等5个版本。

(4)了解文心一言是百度全新一代知识增强大语言模型,是文心大模型家族的新成员,能够与用户进行对话互动、回答用户的问题,并实现协助创作,高效便捷地帮助人们获取信息、知识和灵感等功能。文心一言是基于海量数据和知识进行融合学习的预训练大模型,也是国内参数数量比较多的大语言模型

(5)了解通义千问是阿里云推出的大语言模型,其功能包括多轮对话、文案创作、逻辑推理、多模态理解、多语言支持。并能够和人类进行多轮的交互,也融入了多模态的知识理解、有文案创作能力、能够续写小说,编写邮件等。

实验内容

推荐的大语言模型有智谱清言、豆包、文心一言、通义千问、chatgpt等。选择2种大语言模型体验纯文本任务和多模态任务两种类型,完成下列表格的填写。

我选择XXX1和XXX2大模型

序号

考察能力

题目

回复

评价

1

逻辑推理

一个人带一只黄狗、一只白兔和一颗白菜过河,河边只有一条小船,此人每次只能带一样东西过河,如果此人不在,黄狗要咬白兔,白兔要啃白菜。请想一想:既不让黄狗咬白兔,又不让白兔啃白菜,该怎么设计过河方案

文心一言:

1. 先带白兔过河,空船返回;

2. 带黄狗过河,带白兔返回;

3. 带白菜过河,空船返回;

4. 带白兔过河,全部安全抵达。

ChatGPT:

步骤如下:

① 人带白兔到对岸,留下白兔,独自划船回来;

② 带黄狗到对岸,留下黄狗,带白兔划船回来;

③ 留下白兔,带白菜到对岸,留下白菜,独自划船回来;

④ 带白兔到对岸,完成过河。

你认为使用的大语言模型的本项能力文心一言:优秀

ChatGPT:优秀

2

总结归纳

我家的猫叫花咪咪,我家的狗叫黄旺旺,请问我家的羊叫什么

文心一言:你只告诉我了猫和狗的名字,没有提供羊的相关信息,所以无法确定你家羊的名字哦。不过从猫和狗的名字风格来看,或许可以叫 “棉羊羊” 这类可爱的名字~

ChatGPT:根据你给出的信息,并没有提到羊的名字,因此无法直接回答。如果按照猫(花咪咪)和狗(黄旺旺)的叠字命名风格,羊的名字可以参考 “白洋洋”“灰羊羊” 之类的名称。

文心一言:优秀

ChatGPT:优秀

3

计算能力

753×951=?

文心一言:753×951 的计算结果是 716103

计算步骤:753×(900+50+1)=753×900 + 753×50 + 753×1=677700+37650+753=716103

ChatGPT:753 × 951 = 716103

验算过程:951×700=665700;951×50=47550;951×3=2853;总和为 665700+47550+2853=716103

文心一言:优秀

ChatGPT:优秀

4

历史知识

“五代十国”包括哪些朝代

文心一言:

五代(中原地区先后更替的五个政权):后梁、后唐、后晋、后汉、后周;

十国(中原周边的割据政权,并非同时存在):前蜀、后蜀、南吴、南唐、吴越、闽国、楚、南汉、南平(荆南)、北汉。

ChatGPT:

五代十国是唐朝灭亡后至北宋建立前的分裂时期,

五代指中原的五个短命王朝:后梁、后唐、后晋、后汉、后周;

十国指南方和北方的十个割据政权,主要有:前蜀、后蜀、吴、南唐、吴越、闽、楚、南汉、南平、北汉。

文心一言:优秀

ChatGPT:优秀

5

历史知识+逻辑推理

刘备怎样才能统一天下

文心一言:刘备若想统一天下,需解决三大核心问题:

1. 战略调整:关羽失荆州后,暂缓伐吴,联吴抗曹为首要,避免两线作战;

2. 内部整合:平衡荆州派、益州派、东州派利益,稳定后方;

3. 人才储备:延长诸葛亮、赵云等核心人物寿命,培养后继人才,弥补后期人才凋零短板。

ChatGPT:刘备统一天下的关键在于修正战略与内政失误:

1. 严守 “联吴抗曹” 底线,阻止关羽贸然北伐,保住荆州这一战略要地;

2. 治理益州时轻徭薄赋,缓和本土士族矛盾,增强国力;

3. 提前布局人才梯队,避免后期 “蜀中无大将” 的困境;

4. 抓住曹魏内部动荡(如司马懿夺权)的时机,协同东吴北伐,双线夹击。

文心一言:良好

ChatGPT:优秀

6

创作能力

我是一个科技公司的老板,请帮我设计一份简短的公司年会发言稿,100字以内

文心一言:

各位同仁,新年好!

过去一年,我们以创新为帆,破浪前行,收获满满。新的一年,愿我们携手并肩,深耕科技,再创辉煌!祝大家新年快乐,万事如意!

(92 字)

ChatGPT:

亲爱的同事们,值此新春,感谢大家一年来的拼搏!我们以技术立身,以创新致远。新岁征程,愿我们同心聚力,勇攀高峰,共筑公司新蓝图!新年快乐!

(95 字)

文心一言:良好

ChatGPT:优秀

7

角色扮演+创作能力

我是一名女学生,身高160cm,体重60kg,平时学习比较紧张,假如你是我的健身教练,请帮忙设计一个每天30min的健身计划

文心一言:

30 分钟学生健身计划

1. 热身(5min):原地踏步 + 关节活动,激活身体;

2. 核心训练(10min):平板支撑(3 组 ×30s)+ 臀桥(3 组 ×15 次);

3. 有氧燃脂(10min):开合跳(1min)+ 高抬腿(1min),循环 5 组;

4. 拉伸(5min):腿部 + 腰背拉伸,缓解久坐疲劳。

ChatGPT:

每日 30 分钟高效健身计划

热身(4min):手腕脚踝环绕 + 猫式伸展,放松肌肉;

有氧训练(12min):跳绳(无绳)8min + 慢跑 4min,提升代谢;

力量训练(8min):深蹲(2 组 ×15 次)+ 靠墙静蹲(2 组 ×40s);

拉伸(6min):胸部拉伸 + 大腿前侧拉伸,预防肌肉僵硬。

文心一言:良好

ChatGPT:优秀

8

续写

如果由你来续写《红楼梦》的后40回,你会如何设计其中的情节?请用100字以内的篇幅概括

文心一言:

贾府败落,黛玉泪尽而逝,宝玉看破红尘。宝钗独守空闺,探春远嫁归来力挽家道,惜春出家。妙玉遭劫后悟道,湘云坎坷后遇良缘。最终宝玉雪中拜别贾政,遁入空门,贾府余脉守得一丝生机。(98 字)

ChatGPT:

黛玉因贾府变故、宝玉被蒙骗娶宝钗,忧思成疾而亡。宝玉得知真相后心灰意冷,贾府被抄后家道中落。宝钗操持家务心力交瘁,宝玉最终看破世事,随一僧一道而去,只留红楼一梦空嗟叹。(96 字)

文心一言:良好

ChatGPT:优秀

9

伦理问题

一列火车正常行驶,前方轨道上有5个小孩在玩耍,而另一条废弃轨道上有一个小孩。如果你是火车司机,突然发现制动失灵,你会变更轨道吗

文心一言:

这是经典的 “电车难题”。从伦理角度,变更轨道意味着主动选择牺牲一人,这违背了 “不伤害无辜者” 的原则;从功利角度,牺牲一人救五人看似划算,但废弃轨道上的孩子无过错,不应为他人的错误买单。因此,不会变更轨道,同时尽力尝试其他应急措施。

ChatGPT:

这个问题没有绝对正确的答案,核心在于伦理立场的差异。若选择功利主义,会变更轨道以牺牲少数拯救多数;但从道义论角度,废弃轨道的孩子没有犯错,主动转向相当于将其卷入灾难,是对个体权利的侵犯。我不会主动变更轨道,而是尝试其他一切可能的应急手段。

文心一言:合格

ChatGPT:合格

10

记忆能力

最近24h内,我提了几个问题?其中有几个关于历史的问题

文心一言:

根据当前对话记录,你在本次实验相关的提问中,暂时没有其他历史类问题的记录哦。

ChatGPT:

在我们当前的对话中,你提出的问题主要围绕本次大语言模型实验,其中明确的历史类问题有 1 个(关于五代十国)。由于没有 24 小时内的完整对话记录,无法统计总提问数。

文心一言:合格

ChatGPT:合格

11

简单比大小

数字9.11和9.9哪个大

文心一言:9.9 > 9.11。比较小数大小,先看整数部分,二者整数部分都是 9;再看十分位,9.9 的十分位是 9,9.11 的十分位是 1,9>1,因此 9.9 更大。

ChatGPT:9.9 比 9.11 大。比较方法:整数部分相同,比较十分位,9.9 的十分位是 9,9.11 的十分位是 1,所以 9.9 > 9.11。

文心一言:合格

ChatGPT:合格

序号1-11是纯文本任务

序号

考察能力

题目

回复

评价

12

平面设计

请设计一个科技公司的Logo,要求扁平化风格,构图简洁明了

文心一言:

Logo 设计方案

1. 主体元素:抽象化的 “芯片 + 无限符号” 组合,芯片代表科技内核,无限符号象征技术无限可能;

2. 色彩搭配:主色为科技蓝,搭配浅灰色,简洁大气;

3. 字体选择:无衬线字体,体现现代感,与图形左右排列,整体对称均衡。

同时生成了对应的文字描述版 Logo 示意图。

ChatGPT:

扁平化科技 Logo 设计

核心图形:一个极简的六边形(代表稳定、科技),内部嵌入一个小圆形(象征核心技术),六边形右侧延伸出一条短横线,寓意连接与创新;

配色:单色设计(深空灰),适配各种场景;

排版:图形在上,公司名称在下,字体选用简洁的无衬线体。

注:可借助设计工具生成可视化图形。

你认为使用的大语言模型的文心一言:合格

ChatGPT:合格

13

文生图

请生成一张名为“花丛中的女孩”的图像:明媚的阳光下,一个身穿白裙子的女孩站在花丛中

文心一言:合格

ChatGPT:合格

14

图像识别

请识别图像中的景点

### 文心一言识别结果:

这张图里的核心建筑是东方明珠广播电视塔,周围还有上海中心大厦等摩天大楼,对应的景点是**中国上海的陆家嘴金融区**,是上海的城市地标区域之一。

### ChatGPT识别结果:

从图中的标志性建筑(东方明珠塔)和周边的高楼建筑群可以判断,这个景点是**中国上海市的陆家嘴区域**,这里是上海的金融中心,也是知名的城市景观地标。

文心一言:合格

ChatGPT:合格

15

图像识别

上传一张迈克尔·乔丹的图像,请大语言模型识别其中是谁

### 文心一言识别结果:

图中人物身穿芝加哥公牛队23号红色球衣,正在进行篮球投篮动作,结合球衣号码与动作特征,可以确定他是**迈克尔·乔丹(Michael Jordan)**,是NBA传奇篮球运动员。

### ChatGPT识别结果:

从图中人物所穿的芝加哥公牛队23号球衣,以及篮球运动员的投篮姿态来看,这个人物是**迈克尔·乔丹(Michael Jordan)**,他是篮球史上极具影响力的传奇球星之一。

文心一言:合格

ChatGPT:合格

16

图像识别

请识别图像中有几个人,他们在干什么

### 文心一言识别结果:

图中可以看到多只手举着酒杯(或饮料杯)碰在一起,桌上摆放着火锅、菜品等餐饮食物,能判断这些人正在**聚餐时举杯碰杯**,属于饭局中的互动环节,氛围看起来比较热闹。

### ChatGPT识别结果:

从画面里的餐桌、火锅、菜品,以及多只举杯相碰的手来看,这些人正处于**聚餐场景中,进行举杯碰杯的互动**,应该是在吃饭时敬酒、庆祝之类的社交行为。

文心一言:合格

ChatGPT:合格

17

图像识别

请识别图像中人物的表情,分析其此刻的心情

 文心一言识别结果:

图中人物穿着西装,眉头紧皱、嘴巴大张嘶吼,同时握紧双拳,肢体和表情都呈现出强烈的情绪张力,能判断他正在**愤怒地发怒、宣泄情绪**,状态比较激动。

### ChatGPT识别结果:

从人物的表情(皱眉、张大嘴吼叫)和肢体动作(紧握拳头)来看,他正处于**愤怒、激动的状态,在大声发怒或宣泄情绪**,整体姿态传递出强烈的情绪波动。

文心一言:合格

ChatGPT:合格

18

图像识别

请识别图像中人物的大概年龄

### 文心一言识别结果:

从人物的面部状态(皮肤状态较年轻、无明显皱纹)、穿着风格(休闲时尚)来看,结合整体气质,判断其大概年龄在 **25-35岁** 之间。

### ChatGPT识别结果:

根据人物的外貌特征(面部神态、皮肤状态)与整体形象,推测其年龄大约处于 **28至38岁** 这个区间,属于青年到中年的过渡阶段。

文心一言:合格

ChatGPT:合格

19

图像识别+数学能力

文心一言:合格

ChatGPT:合格

序号12-19是图像处理任务

四、实验总结

本次实验通过对文心一言(国内主流大模型)和ChatGPT(海外标杆大模型)的体验,对比分析了两款大模型在纯文本任务和图像处理任务中的表现,得出以下结论:

纯文本任务表现:两款模型在逻辑推理、计算能力、历史知识、创作能力等方面均表现出色,其中 ChatGPT 在历史知识融合逻辑推理、角色扮演等任务中回答更具逻辑性和细节;文心一言则更贴合中文语境,在本土化知识问答上更有优势。二者在记忆能力上均受限于对话上下文范围,表现为合格水平。

图像处理任务表现:文心一言具备直接文生图和图像识别的能力,在多模态任务中更具实用性;ChatGPT 本身不支持直接生成图像,但能输出高质量文生图提示词,且图像识别能力稳定,在结合学科知识的图像任务中表现良好。

核心原理验证:两款大模型均基于 Transformer 架构,通过海量数据训练实现语言理解与生成、多模态交互等功能,验证了大语言模型在自然语言处理和多模态任务中的通用性与高效性。

应用展望:大语言模型在日常办公、学习辅助、创意设计等领域具有极高的应用价值,但同时也需关注其在伦理判断、隐私保护等方面的潜在问题,推动技术健康发展。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐