测评

如今,生成式ai大模型已经很常用了,可以说早已飞入寻常百姓家,各大公司纷纷推出自己的大模型,很多都是0门槛且免费的。那么,究竟哪些大模型更实用,又各自在哪些领域具备独特优势呢?

作为生信人,我平时也会频繁用到ai大模型,也对这个感兴趣,想从自身专业视角出发,对这些热门的ai大模型进行简单的测评。

测评方式

我会尽量保证测评的公平,统一执行以下规则:

  • 每个问题会新建对话,只要平台提供就会打开深度思考,而联网模式则是根据问题统一打开。
  • 所有问题提交后都会直接切换网页,后台等结果(按理说应该不会有影响,但实际应用我偶尔感受到后台等结果的不稳定性,我也不知道为什么会这样)。
  • 采用分档排名赋分的形式,对不同问题进行分档排名,即如果几个ai的回答在准确性、合理性上差不多,会赋予同一排名。最后会计算总分以及体现不同方面能力的总分,总分越低排名越高。

热门ai选择

我参考这篇文章,2025年7月AI大模型最新排行榜出炉!谁在领跑?谁被逆袭? - 知乎,对ai大模型进行选择。因为本次测评聚焦于大众常用且免费的,所以最终仅选取了一款国外ai,更多的是国内的常见的,加上我平时常用的,一共有9个平台的ai,列在下面:

  1. ChatGPT (https://chatgpt.com/
  2. DeepSeek - 探索未至之境 (https://chat.deepseek.com/
  3. WPS 灵犀 (https://lingxi.wps.cn/
  4. 通义 - 你的超级个人助理 (https://www.tongyi.com/qianwen
  5. 文心一言 (https://yiyan.baidu.com/X1?utm_source=ai-bot.cn
  6. 豆包 - 字节跳动旗下 AI 智能助手 (https://www.doubao.com/chat/
  7. Kimi - 更强大的 AI 助手 (https://www.kimi.com/
  8. 讯飞星火-懂我的AI助手 (https://xinghuo.xfyun.cn/desk
  9. 腾讯元宝 - 轻松工作 多点生活 (https://yuanbao.tencent.com/chat

测评题目

题型 题目 备注
陷阱题 北京到广州高铁3小时到达,两地距离2121公里,求平均时速 太快了,应该有反常识提示
逻辑题 找出下列数字中特殊的一个: (1)1 (2)2 (3)5 (4)7 (5)11 (6)13 (7)15 没有标准答案,但应该提出2是唯一偶数、15是唯一合数、1是唯一非质非合
阅读微信文章 阅读https://mp.weixin.qq.com/s/3b8IJNXm6WEwLD5ateAfAA,总结其观点
阅读普通链接 阅读 https://blog.csdn.net/m0_61055139/article/details/150448545?spm=1011.2415.3001.5331,总结其观点
阅读开放文献 阅读文献:https://www.science.org/doi/10.1126/science.adu0047,简单总结其研究内容和研究方法
阅读非开放文献 阅读文献:https://www.nature.com/articles/s43017-024-00591-5,列出主要标题,并简单总结其研究内容和研究方法
代码_生信 找napL.fasta这个文件中序列长度最短的序列,用Linux命令或者Linux软件(如seqkit 如果能用seqkit的fx2tab 就比较方便
图片生成 生成图片:关于GTDB各分类等级的分布直方图,用于展示各分类等级的物种数量分布,这样的分布直方图应该长什么样?
图片修改 修改一下图片:天空中加上雷电,并让两人战斗的更激烈
在这里插入图片描述
能否直接修改图片
图片分析 分析下面这张图,总结其主要观点
在这里插入图片描述

结果

在这里插入图片描述

总分: ChatGPT > 豆包 > WPS 灵犀 >(文心 4.5 Turbo = 腾讯 Hunyuan)> 文心 X1.1 > 通义千问 > Kimi >(讯飞星火 = DeepSeek)

除图片的总分: ChatGPT > WPS 灵犀 >(豆包 = 文心 4.5 Turbo = 腾讯 Hunyuan) > 通义千问 > 文心 X1.1 > Kimi > DeepSeek > 讯飞星火

图片分: ChatGPT > 豆包 > 文心 X1.1 >(WPS 灵犀 = 文心 4.5 Turbo = 腾讯 Hunyuan)>(通义千问 = Kimi)> 讯飞星火 > DeepSeek

阅读总分: 豆包 > 腾讯 Hunyuan >(WPS 灵犀 = 文心 4.5 Turbo) >(ChatGPT = 通义千问)> Kimi > 文心 X1.1 >(讯飞星火 = DeepSeek)

结果总结

总体上来说,ChatGPT依旧是老大,不过在中文适应方面,豆包、文心一言、WPS灵犀等做的都很好。

一般我写代码常用WPS灵犀,写文案常用文心一言,图片处理推荐豆包

测评中,腾讯Hunyuan的表现可以说让我眼前一亮,虽然没有解决基本的陷阱题,但是感觉比我几个月前体验它的时候要好很多,期待后面的表现吧。

详细的测评过程我会在后面发出来,可能截图会非常多。感兴趣的可以关注。

最后叠甲:这样的测评肯定不会非常全面,但是是我目前常用的几点,仅供参考。如果你有其他方面的测评问题或者更好的测评建议,敬请留言,谢谢~

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐