告别部署繁琐:LlamaPi 一键搭建本地 Agent 推理底座

一、端侧大模型落地的三道门槛

端侧 AI 与本地 Agent 正在快速落地,各类端侧硬件的 NPU 推理算力也得到大幅提升。但不少开发者在实际落地时依旧要面对重重门槛,整个流程耗时长、上手门槛高,阻碍了端侧大模型与 Agent 项目的快速验证。

常见门槛具体表现LlamaPi 的对应能力
模型获取与转换手动下载权重、反复调试模型转换、转换后精度受损模型库一键下载,按平台提供已适配的模型格式
推理环境搭建手写 NPU 推理代码、依赖冲突、硬件算力无法充分释放单条命令拉起推理服务,运行时自动对接 NPU
长期运行与调度部署不稳定、启停靠手工、重启后需重新加载服务调度 + 持久化部署(开机自动加载)

LlamaPi 的思路是把复杂的部署流程封装简化,为开发者提供一套开箱即用的离线私有 Agent 推理底座。

二、一条命令跑起本地模型

以往端侧部署大模型,需要手动完成模型下载、格式转换、推理环境配置等一连串操作。LlamaPi 把这套流程收敛为单条命令:

# 以 Qwen3.5-4B 为例:自动拉取模型 + 启动本地推理服务
llamapi run qwen3.5-4b

执行命令后,LlamaPi 会自动把模型拉取至本地,并依托端侧 NPU 硬件加速,快速提供高性能的本地大模型推理服务。对于不希望使用命令行的用户,它还配套了桌面客户端应用,提供可视化图形界面,点选操作即可完成模型运行与对话交互,降低上手门槛。

一条命令完成端侧部署 + 桌面客户端对话界面

三、整体架构:三层结构

LlamaPi 整体架构一览

分层组件说明
应用层OpenCode / OpenClaw / Hermes Agent / 其他 OpenAI 兼容应用通过 OpenAI 兼容 API 把推理请求发给 LlamaPi
兼容层LlamaPi 推理服务对内统一完成模型管理与服务调度,对外提供 OpenAI 兼容 API
硬件层RK3588 / RK1828 / RK1820 等NPU 硬件加速,按平台加载对应格式的模型

上层各类第三方应用通过 OpenAI 兼容 API 将推理请求发送给 LlamaPi;LlamaPi 对内统一完成模型管理、服务调度,把推理任务交付给设备的 NPU 完成加速计算,推理结果再原路返回给上层应用。

四、模型库管理:查询 / 下载 / 清理

在端侧开发过程中,往往会同时测试多款不同的大模型。LlamaPi 具备完整的模型管理能力,帮助开发者完成模型的查询、下载与清理,不必手动维护零散的权重文件。

LlamaPi 模型库界面

命令作用
llamapi list列出本地已下载的所有模型
llamapi list --online查看适配当前设备的全部可用模型,包含尚未下载的模型
llamapi pull <model_name>下载指定模型至设备本地
llamapi rm <model_name>从设备上删除指定模型

llamapi list --online 会同时给出模型对应的推理平台与体积,便于评估是否适配当前硬件:

llamapi list --online 实测输出

实测设备上可用的模型清单如下(PLATFORM 列表示该条目对应的推理后端与芯片组合):

MODELPLATFORMSIZELOCAL
bge-m3rknn2/rk35881.1 GBinstalled
gemma4:e4brknn3/rk1828not installed
gemma4:12brknn3/rk1828not installed
qwen3:0.6brkllm/rk3588not installed
qwen3:0.6brknn3/rk1828not installed
qwen3:1.7brkllm/rk3588not installed
qwen3:1.7brknn3/rk1828not installed
qwen3:4brkllm/rk3588not installed
qwen3:4brknn3/rk1828not installed
qwen3:8brknn3/rk1828not installed
qwen3-vl:4brknn3/rk1828not installed
qwen3.5:0.8brkllm/rk35881.5 GBinstalled
qwen3.5:0.8brknn3/rk18281.1 GBinstalled
qwen3.5:2brkllm/rk3588not installed
qwen3.5:2brknn3/rk1828not installed
qwen3.5:4brkllm/rk3588not installed
qwen3.5:4brknn3/rk18283.9 GBinstalled
qwen3.5:9brknn3/rk1828not installed
qwen3.5:27brknn3/rk1828not installed
qwen3.8:27brknn3/rk182816.8 GBinstalled

从清单可以看出两条典型路线:

平台承载硬件覆盖规模适用场景
rkllm/rk3588主控 NPU0.6B ~ 4B轻量对话、低功耗常驻任务
rknn2/rk3588主控 NPU(v2 运行时)向量/嵌入类模型语义检索、知识库 embedding
rknn3/rk1828M.2 NPU 加速卡0.6B ~ 27B大模型对话、多模态、代码 Agent

同一模型往往会在不同平台上分别提供条目,便于按实际硬件选择对应的版本。

五、服务调度:加载 / 卸载 / 开机自启

完成模型下载之后,还需要灵活管控模型的运行状态:包括加载启动、停止释放、查看当前正在运行的模型,或是配置设备开机自动加载模型。在桌面客户端中可以直接对已下载模型执行加载、卸载、设置开机自启,并直观查看当前运行状态。

LlamaPi 部署管理界面

客户端「部署管理」页面中的模型组信息如下(1 个运行中 · 共 4 个模型组):

模型组 IDMODELTYPEPLATFORMSTATUS实例
qwen3.8:27b@rknn3-rk1828qwen3.8:27bchatrknn3/rk1828运行中1
qwen3.5:4b@rknn3-rk1828qwen3.5:4bchatrknn3/rk1828未加载
qwen3.5:0.8b@rkllm-rk3588qwen3.5:0.8bchatrkllm/rk3588未加载
bge-m3@rknn2-rk3588bge-m3embeddingrknn2/rk3588未加载

命令行同样覆盖全部调度能力,适合快速调试与脚本化运维:

命令作用
llamapi ps查看设备上当前已经部署运行的模型状态
llamapi load <model_name>加载并启动本地已下载的指定模型
llamapi unload <model_name>卸载正在运行的模型,释放硬件资源
llamapi enable <model_name>设置模型持久化部署,设备重启后自动加载该模型

llamapi ps / unload / load 实测

llamapi ps 的输出包含模型 ID、MODEL、TYPE、PLATFORM、STATUS 与实例数,另有一列 ENABLE 表示是否已设为开机自启。上述实测中,27B 模型处于 active 状态、1 个实例;unload 后立即释放,随后可用 load 拉起另一个模型。

六、接入第三方应用:OpenAI 兼容 API

当模型在设备内部署完成后,LlamaPi 会自动输出 OpenAI 兼容 API,无需额外开发,就可以将本地端侧推理能力对接各类第三方 AI 应用,快速搭建完整的离线私有 AI 工作流。

配置项填写内容
服务提供方OpenAI 或 OpenAI-compatible
自定义服务地址(Base URL / API Endpoint)http://<设备 IP>:9265/v1
模型 ID通过 llamapi ps 命令或客户端「部署管理」页查看

第三方应用配置流程:

步骤操作
1在第三方应用中选择 OpenAI 或 OpenAI-compatible 服务提供方
2找到自定义服务地址(Base URL / API Endpoint)配置项,填入 http://<设备 IP>:9265/v1
3填写对应的模型 ID,模型 ID 可通过 llamapi ps 命令或在客户端部署管理页面中查看
4保存后即可在应用内调用本地模型,构建离线私有 AI 工作流

七、命令速查表

分类命令说明
快速启动llamapi run <model>拉取模型并直接运行
模型查询llamapi list列出本地已下载的模型
模型查询llamapi list --online查看当前设备全部可用模型
模型管理llamapi pull <model>下载指定模型
模型管理llamapi rm <model>删除指定模型
服务调度llamapi ps查看运行中的模型状态
服务调度llamapi load <model>加载并启动模型
服务调度llamapi unload <model>卸载模型、释放资源
持久化llamapi enable <model>设备重启后自动加载
应用接入OpenAI 兼容 APIhttp://<设备 IP>:9265/v1

八、小结

LlamaPi 把端侧大模型部署中「模型下载 → 格式转换 → NPU 推理 → 服务接口」这几段最耗时的流程做了封装:单条命令即可拉起本地推理服务;模型库与部署管理覆盖查询、下载、清理、加载、卸载与开机自启;对外通过 OpenAI 兼容 API 直接对接 OpenCode、OpenClaw、Hermes Agent 等第三方应用。对于需要离线、私有化、低门槛验证端侧大模型与本地 Agent 的场景,这是一条值得尝试的路径。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐