从问答、编程到工具调用,AI 助手的能力不断拓展。如何在有限资源下兼顾推理、长文本处理与智能体应用,成为端侧部署的关键问题。

MiniCPM5-2B 提供了一个轻量化选择。作为 OpenBMB 推出的 MiniCPM5 系列第二款模型,它采用标准的 LlamaForCausalLM 架构,面向端侧部署、本地推理和资源受限场景,支持开发者围绕小参数模型构建实用的 AI 应用。

根据官方评测,MiniCPM5-2B 在所列对比范围内取得 53.9 的平均分,达到 2B 级开源模型领先水平,部分指标超过 4B 级模型。其能力覆盖代码推理、数学推理、长上下文理解、工具调用与智能体任务,可用于编程辅助、问题求解和知识问答等场景。针对长文本处理需求,MiniCPM5-2B 原生支持最长 131,072 个 token 的上下文窗口,为输入较长的文档、代码与对话记录提供了空间。

除了文本生成,MiniCPM5-2B 还支持 XML 风格的工具调用,可作为编程智能体、搜索智能体及其他工具调用工作流的模型基础。

目前,HyperAI 教程板块已上线「MiniCPM5-2B:端侧 2B 级 SOTA 大模型推理」实践教程,支持在线体验与一键部署~

在线运行:

https://go.hyper.ai/q0Pc2

更多在线教程:

https://hyper.ai/notebooks

图片

demo 页面

Demo 运行

1.进入 hyper.ai 首页后,选择「教程」页面,或点击「查看更多教程」,选择「MiniCPM5-2B:端侧 2B 级 SOTA 大模型推理」,点击「运行此教程」。

图片

图片

2.页面跳转后,点击右上角「Clone」,将该教程克隆至自己的容器中。

注:页面右上角支持切换语言,目前提供中文及英文两种语言,本教程文章以英文为例进行步骤展示。

图片

3.选择「NVIDIA RTX 5090」以及「vllm」镜像,点击「Continue job execution(继续执行)」。

图片

图片

4.等待分配资源,当状态变为「Running(运行中)」后,点击「Open Workspace」进入 Jupyter Workspace。

图片

效果展示

1.页面跳转后,点击左侧 README 文件,进入后点击上方 Run(运行)。

图片

图片

2.待运行完毕后,请打开新终端,执行以下命令启动 Open WebUI。

图片

3.启动后,点击右侧 API 地址即可在浏览器中访问 Open WebUI 界面,开始与本地模型对话。

图片

图片

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐